Voice Clone Studio riunisce tutte le reti neurali vocali più diffuse in un'unica finestra
Se hai mai provato a configurare la sintesi vocale locale o la clonazione vocale, probabilmente ricordi l'inferno delle dipendenze. Un modello richiede PyTorch 2.1 con le vecchie librerie torchaudio, un altro ha bisogno di una build CUDA fresca, e un terzo richiede una versione separata di ONNX Runtime. Il risultato è cinque ambienti virtuali che si accumulano sul disco, ognuno con la propria interfaccia Gradio su una porta casuale.
Lo sviluppatore con il nickname FranckyB ha deciso di porre fine a questo caos e ha rilasciato il progetto Voice Clone Studio. In sostanza, è uno strumento modulare all-in-one che riunisce Qwen3-TTS, Microsoft VibeVoice, Fish Speech, LuxTTS, Resemble AI Chatterbox e il generatore di effetti sonori MMAudio sotto un unico tetto.
Cosa può fare questo strumento
Invece di tenere cinque schede aperte con script diversi, tutto è organizzato in schede con una pipeline dati unificata.
Clonazione vocale ed emozioni
Lo scenario base è semplice: carichi un breve campione audio di 3-10 secondi, inserisci il testo con la trascrizione originale e ottieni il risultato. Ma la cosa interessante è che puoi passare da un motore all'altro al volo usando il menu a tendina:
- Qwen3-TTS nelle varianti 0.6B e 1.7B
- VibeVoice (1.5B, modello completo e quantizzato a 4 bit)
- Fish Speech S2 Pro con 4B parametri
- LuxTTS e Chatterbox
Se selezioni il motore Fish Speech, puoi inserire tag di intonazione direttamente nel testo, come [whisper], [laughing] o [excited]. Il sistema conosce più di 15.000 di questi marcatori. Lo sviluppatore ha anche fatto una cosa carina: se torni a Qwen o VibeVoice, i tag vengono rimossi automaticamente dal testo prima dell'invio al modello, quindi i tuoi script non si rompono.
Scenari di dialogo per podcast
Una delle schede più interessanti è Conversation. È progettata per dialoghi lunghi tra più parlanti.
Lo script è scritto in un formato testo unificato:
[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?
In modalità Qwen ci sono 9 narratori integrati con pause regolabili tra le battute. E se passi alla modalità VibeVoice, ottieni la generazione di tracce continue fino a 90 minuti con quattro parlanti usando i tuoi campioni vocali personali. Il modello posiziona automaticamente gli accenti e a volte aggiunge persino un sottile rumore ambientale della stanza per maggiore realismo.
Progettazione vocale da descrizione testuale
Quando non hai un file audio pronto per la clonazione, torna utile la scheda Voice Design basata su Qwen3-TTS. Descrivi semplicemente il personaggio desiderato a parole: età, genere, tono emotivo, un leggero accento britannico, o un modo di parlare silenzioso e insidioso. La rete neurale genera una voce unica da zero.
Modifica vocale ed effetti sonori
Il modulo Voice Changer funziona con Chatterbox tramite conversione speech-to-speech. Puoi parlare nel microfono, selezionare un timbro target dai campioni salvati e il modello riregistrerà il tuo parlato in una voce diversa preservando le tempistiche e l'intonazione originali.
Per il doppiaggio video, è stato aggiunto al progetto MMAudio. Puoi inserire una descrizione testuale del suono oppure caricare un clip video senza audio. La rete neurale analizza il video e genera effetti sonori sincronizzati a 44.1 kHz.
Preparazione dei dati e fine-tuning
Voice Clone Studio ha uno spazio di lavoro integrato per la preparazione audio (Prep Audio). Puoi caricare un video lungo, estrarre la traccia audio, rimuovere il rumore tramite DeepFilterNet, normalizzare il volume e tagliare automaticamente il file in frasi usando Qwen3-ASR o Whisper.
C'è anche il modulo Train Custom Voices. Se la clonazione base da un breve campione non ti basta, il progetto avvia il fine-tuning LoRA locale per VibeVoice o Qwen. L'interfaccia mostra i grafici di loss e il progresso delle epoche, e i pesi addestrati vengono immediatamente inseriti nella cartella dei preset. Su una GPU con CUDA abilitata, l'addestramento su un dataset piccolo richiede dai 10 ai 30 minuti.
Cosa c'è sotto il cofano
L'architettura del progetto è modulare. Lo script principale voice_clone_studio.py è di sole circa 230 righe e carica dinamicamente le schede dalla directory modules/core_components/tools/. I modelli non necessari o le schede pesanti possono essere disabilitati nelle impostazioni per evitare di ingombrare l'interfaccia e la memoria.
Tra le soluzioni di ingegneria interessanti:
- Supporto per l'accelerazione CUDA Graphs (progetto Faster-Qwen3-TTS), che offre un speedup di inferenza di 5-10x per Qwen.
- Distribuzione dei modelli su GPU diverse. Se hai due GPU nel sistema, puoi mettere la generazione vocale su una scheda e il riconoscimento ASR e il LLM locale sulla seconda.
- Prompt Manager integrato. Si connette a un server locale llama.cpp o Ollama, scarica un modello GGUF e aiuta a generare prompt di dialogo o di sistema direttamente nell'interfaccia.
Avvio e caveat
La soglia minima confortevole è 8 GB di VRAM sulle GPU NVIDIA. Su macOS il progetto funzionerà anche tramite MPS (Apple Silicon), ma la scheda di training verrà automaticamente nascosta poiché il training è focalizzato su CUDA.
Un avvio rapido su Linux è così:
git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh
Per Windows c'è un setup-windows.bat già pronto, oltre a una configurazione Docker Compose se non vuoi installare SOX e FFMPEG direttamente sul sistema.
Alcune sfumature pratiche da tenere a mente:
- Si consiglia Python 3.11. La versione 3.12 potrebbe avere problemi nella compilazione dei wheel per la riduzione del rumore DeepFilterNet.
- Gli utenti Linux e macOS dovrebbero evitare di installare il pacchetto
openai-whisperper conflitti nell'ambiente. VibeVoice ASR e Qwen3 ASR funzionano benissimo come predefiniti. - La prima generazione su qualsiasi campione ha un ritardo mentre i prompt vocali vengono memorizzati nella cache, ma le righe successive vengono assemblate significativamente più velocemente.
A chi tornerà utile questo progetto
Voice Clone Studio risponde a tre esigenze chiare. Prima di tutto, è un eccellente terreno di test per chiunque voglia confrontare la qualità di VibeVoice, Qwen3 e Fish Speech sullo stesso materiale audio senza dover usare le console. In secondo luogo, i creatori di podcast e audiolibri apprezzeranno il modulo Conversation con generazione fino a 90 minuti. In terzo luogo, è una postazione di lavoro pronta all'uso per preparare dataset e addestrare modelli vocali personalizzati senza dover scrivere script di training.
Progetti correlati