>_ DevTrendsfr

Langue

Accueil

Langages

Sections

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarqué Sécurité
Python

Voice Clone Studio rassemble tous les réseaux de neurones vocaux populaires dans une seule fenêtre

Si vous avez déjà essayé de configurer la synthèse vocale locale ou le clonage de voix, vous vous souvenez probablement de l'enfer des dépendances. Un modèle nécessite PyTorch 2.1 avec d'anciennes bibliothèques torchaudio, un autre requiert une version CUDA fraîche, et un troisième a besoin d'une version séparée d'ONNX Runtime. Le résultat : cinq environnements virtuels qui s'accumulent sur le disque, chacun avec sa propre interface Gradio sur un port aléatoire.

Le développeur sous le pseudonyme FranckyB a décidé de mettre fin à ce chaos et a publié le projet Voice Clone Studio. Il s'agit essentiellement d'un outil modulaire tout-en-un qui rassemble Qwen3-TTS, Microsoft VibeVoice, Fish Speech, LuxTTS, Resemble AI Chatterbox et le générateur d'effets MMAudio sous une même interface.

Voice Clone Studio Preview

Ce que cet outil peut faire

Au lieu de garder cinq onglets ouverts avec différents scripts, tout est organisé en onglets avec un pipeline de données unifié.

Clonage vocal et émotions

Le scénario de base est simple : vous téléchargez un échantillon audio court de 3 à 10 secondes, saisissez le texte avec la transcription originale, et vous obtenez le résultat. Mais l'avantage est que vous pouvez basculer entre les moteurs à la volée via un menu déroulant :

  • Qwen3-TTS en variantes 0.6B et 1.7B
  • VibeVoice (1.5B, modèle complet et quantifié 4 bits)
  • Fish Speech S2 Pro avec 4B paramètres
  • LuxTTS et Chatterbox

Si vous sélectionnez le moteur Fish Speech, vous pouvez insérer des balises d'intonation directement dans le texte, comme [whisper], [laughing] ou [excited]. Le système connaît plus de 15 000 de ces marqueurs. Le développeur a également fait un geste élégant : si vous repassez à Qwen ou VibeVoice, les balises sont automatiquement supprimées du texte avant l'envoi au modèle, afin que vos scripts ne soient pas cassés.

Scénarios de dialogues pour les podcasts

L'un des onglets les plus intéressants est Conversation. Il est conçu pour les longs dialogues entre plusieurs locuteurs.

Le script est écrit dans un format texte unifié :

[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?

En mode Qwen, il y a 9 narrateurs intégrés avec des pauses ajustables entre les lignes. Et si vous basculez le mode en VibeVoice, vous obtenez une génération de piste continue jusqu'à 90 minutes avec quatre locuteurs utilisant vos propres échantillons vocaux. Le modèle place automatiquement les accents et ajoute parfois même un léger bruit ambiant de pièce pour plus de réalisme.

Conception vocale à partir d'une description textuelle

Lorsqu'il n'y a pas de fichier audio prêt pour le clonage, l'onglet Voice Design basé sur Qwen3-TTS est utile. Vous décrivez simplement le personnage souhaité en mots : âge, genre, ton émotionnel, un léger accent britannique, ou une manière de parler calme et sinistre. Le réseau de neurones génère une voix unique à partir de zéro.

Modification vocale et effets sonores

Le module Voice Changer fonctionne sur Chatterbox via une conversion parole-à-parole. Vous pouvez parler du texte dans le microphone, sélectionner un timbre cible parmi les échantillons sauvegardés, et le modèle réenregistrera votre discours dans une voix différente tout en préservant les durées et l'intonation originales.

Pour le doublage vidéo, MMAudio a été ajouté au projet. Vous entrez soit une description textuelle du son, soit vous déposez une vidéo prête sans audio. Le réseau de neurones analyse la vidéo et génère des effets sonores synchronisés en qualité 44.1 kHz.

Préparation des données et affinage

Voice Clone Studio dispose d'un espace de travail intégré pour la préparation audio (Prep Audio). Vous pouvez déposer une longue vidéo, extraire la piste audio, supprimer le bruit via DeepFilterNet, normaliser le volume, et automatiquement couper le fichier en phrases en utilisant Qwen3-ASR ou Whisper.

Il y a aussi le module Train Custom Voices ici. Si le clonage de base à partir d'un court échantillon ne vous suffit pas, le projet lance un affinage LoRA local pour VibeVoice ou Qwen. L'interface affiche les graphiques de perte et la progression des époques, et les poids entraînés sont immédiatement déposés dans le dossier des préréglages. Sur un GPU avec CUDA, l'entraînement sur un petit jeu de données prend 10 à 30 minutes.

Ce qui se cache sous le capot

L'architecture du projet est modulaire. Le script principal voice_clone_studio.py ne fait qu'environ 230 lignes et charge dynamiquement les onglets depuis le répertoire modules/core_components/tools/. Les modèles inutilisés ou les onglets lourds peuvent être désactivés dans les paramètres pour éviter d'encombrer l'interface et la mémoire.

Parmi les solutions d'ingénierie intéressantes :

  1. Support de l'accélération par CUDA Graphs (projet Faster-Qwen3-TTS), qui offre une accélération d'inférence de 5 à 10 fois pour Qwen.
  2. Distribution des modèles sur différents GPU. Si vous avez deux GPU dans votre système, vous pouvez mettre la génération de parole sur une carte, et la reconnaissance ASR et le LLM local sur la deuxième.
  3. Prompt Manager intégré. Il se connecte à un serveur llama.cpp ou Ollama local, télécharge un modèle GGUF, et aide à générer des invites de dialogue ou système directement dans l'interface.

Lancement et pièges

Le seuil minimum confortable est de 8 Go de VRAM sur les GPU NVIDIA. Sur macOS, le projet fonctionnera également via MPS (Apple Silicon), mais l'onglet d'entraînement sera automatiquement masqué puisque l'entraînement est axé sur CUDA.

Un lancement rapide sur Linux ressemble à ceci :

git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh

Pour Windows, il y a un setup-windows.bat prêt à l'emploi, ainsi qu'une configuration Docker Compose si vous ne souhaitez pas installer SOX et FFMPEG directement sur le système.

Quelques nuances pratiques à connaître :

  • Python 3.11 est recommandé. La version 3.12 peut avoir des problèmes pour construire les wheels pour la réduction de bruit DeepFilterNet.
  • Les utilisateurs de Linux et macOS doivent éviter d'installer le package openai-whisper en raison des conflits d'environnement. VibeVoice ASR et Qwen3 ASR fonctionnent très bien par défaut à la place.
  • La première génération sur un échantillon a un délai pendant que les invites vocales sont mises en cache, mais les lignes suivantes sont assemblées significativement plus vite.

À qui ce projet sera utile

Voice Clone Studio répond à trois besoins clairs. Premièrement, c'est un excellent terrain de test pour quiconque veut comparer la qualité de VibeVoice, Qwen3 et Fish Speech sur le même matériel audio sans passer par les consoles. Deuxièmement, les créateurs de podcasts et de livres audio apprécieront le module Conversation avec une génération de 90 minutes. Troisièmement, c'est un poste de travail prêt à l'emploi pour préparer des ensembles de données et entraîner des modèles vocaux personnalisés sans écrire de scripts d'entraînement.

Projets similaires