Voice Clone Studio reúne todas las redes neuronales de voz más populares en una sola ventana
Si alguna vez intentaste configurar síntesis de voz local o clonación de voz, probablemente recuerdas el infierno de dependencias. Un modelo necesita PyTorch 2.1 con las antiguas bibliotecas de torchaudio, otro requiere una compilación nueva de CUDA, y un tercero necesita una versión separada de ONNX Runtime. El resultado es cinco entornos virtuales acumulándose en el disco, cada uno con su propia interfaz de Gradio en un puerto aleatorio.
El desarrollador con el apodo FranckyB decidió terminar con este caos y lanzó el proyecto Voice Clone Studio. En esencia, es una herramienta modular todo en uno que reúne Qwen3-TTS, Microsoft VibeVoice, Fish Speech, LuxTTS, Resemble AI Chatterbox y el generador de efectos MMAudio bajo un mismo techo.
Lo que puede hacer esta herramienta
En lugar de mantener cinco pestañas abiertas con diferentes scripts, todo está dividido en pestañas con una tubería de datos unificada.
Clonación de voz y emociones
El escenario básico es directo: subes una muestra de audio corta de 3 a 10 segundos, ingresas el texto con la transcripción original y obtienes el resultado. Pero la ventaja es que puedes cambiar entre motores sobre la marcha usando el menú desplegable:
- Qwen3-TTS en variantes de 0.6B y 1.7B
- VibeVoice (1.5B, modelo completo y cuantizado a 4 bits)
- Fish Speech S2 Pro con 4B parámetros
- LuxTTS y Chatterbox
Si seleccionas el motor Fish Speech, puedes insertar etiquetas de entonación directamente en el texto, como [whisper], [laughing] o [excited]. El sistema reconoce más de 15,000 de estos marcadores. El desarrollador también añadió un buen detalle: si vuelves a cambiar a Qwen o VibeVoice, las etiquetas se eliminan automáticamente del texto antes de enviarlo al modelo, así que tus scripts no se rompen.
Escenarios de diálogo para podcasts
Una de las pestañas más interesantes es Conversation. Está diseñada para diálogos largos entre múltiples hablantes.
El script se escribe en un formato de texto unificado:
[1]: Привет, как продвигается проект?
[2]: Отлично, только что собрал окружение без конфликтов.
[3]: Можно к вам присоединиться?
En modo Qwen, hay 9 narradores integrados con pausas ajustables entre líneas. Y si cambias el modo a VibeVoice, obtienes generación de pista continua hasta 90 minutos con cuatro hablantes usando tus propias muestras de voz. El modelo coloca automáticamente los acentos y a veces incluso añade un sutil ruido ambiental de habitación para mayor realismo.
Diseño de voz a partir de descripción de texto
Cuando no hay un archivo de audio listo para clonar, la pestaña Voice Design basada en Qwen3-TTS es útil. Simplemente describes el personaje deseado con palabras: edad, género, tono emocional, un ligero acento británico o una manera de hablar tranquila e insidiosa. La red neuronal genera una voz única desde cero.
Cambio de voz y efectos de sonido
El módulo Voice Changer funciona con Chatterbox mediante conversión de voz a voz. Puedes hablar texto al micrófono, seleccionar un timbre objetivo de las muestras guardadas y el modelo volverá a grabar tu habla en una voz diferente mientras preserva los tiempos y la entonación originales.
Para doblaje de video, se añadió MMAudio al proyecto. Puedes ingresar una descripción de texto del sonido o soltar un clip de video listo sin audio. La red neuronal analiza el video y genera efectos de sonido sincronizados a calidad de 44.1 kHz.
Preparación de datos y ajuste fino
Voice Clone Studio tiene un espacio de trabajo integrado de preparación de audio (Prep Audio). Puedes soltar un video largo, extraer la pista de audio, eliminar ruido mediante DeepFilterNet, normalizar el volumen y cortar automáticamente el archivo en frases usando Qwen3-ASR o Whisper.
También está el módulo Train Custom Voices aquí. Si la clonación básica desde una muestra corta no es suficiente para ti, el proyecto lanza el ajuste fino de LoRA local para VibeVoice o Qwen. La interfaz muestra gráficos de pérdida y progreso de épocas, y los pesos entrenados se depositan inmediatamente en la carpeta de presets. En una GPU con CUDA habilitado, el entrenamiento en un conjunto de datos pequeño toma de 10 a 30 minutos.
Qué hay bajo el capó
La arquitectura del proyecto es modular. El script principal voice_clone_studio.py tiene solo unas 230 líneas y carga dinámicamente las pestañas desde el directorio modules/core_components/tools/. Los modelos innecesarios o pestañas pesadas se pueden desactivar en la configuración para evitar saturar la interfaz y la memoria.
Entre las soluciones de ingeniería interesantes:
- Soporte de aceleración de CUDA Graphs (proyecto Faster-Qwen3-TTS), que proporciona una aceleración de inferencia de 5 a 10 veces para Qwen.
- Distribución de modelos en diferentes GPUs. Si tienes dos GPUs en tu sistema, puedes poner la generación de voz en una tarjeta y el reconocimiento ASR y el LLM local en la segunda.
- Prompt Manager integrado. Se conecta a un servidor local de llama.cpp u Ollama, descarga un modelo GGUF y ayuda a generar prompts de diálogo o del sistema directamente en la interfaz.
Lanzamiento y consideraciones
El umbral mínimo cómodo es 8 GB de VRAM en GPUs NVIDIA. En macOS, el proyecto también se ejecutará a través de MPS (Apple Silicon), pero la pestaña de entrenamiento se ocultará automáticamente ya que el entrenamiento está enfocado en CUDA.
Un lanzamiento rápido en Linux se ve así:
git clone https://github.com/FranckyB/Voice-Clone-Studio.git
cd Voice-Clone-Studio
chmod +x setup-linux.sh
./setup-linux.sh
./launch.sh
Para Windows, hay un setup-windows.bat listo para usar, así como una configuración de Docker Compose si no quieres instalar SOX y FFMPEG directamente en el sistema.
Algunas sutilezas prácticas a tener en cuenta:
- Se recomienda Python 3.11. La versión 3.12 puede tener problemas al construir wheels para la reducción de ruido de DeepFilterNet.
- Los usuarios de Linux y macOS deben evitar instalar el paquete
openai-whisperdebido a conflictos de entorno. VibeVoice ASR y Qwen3 ASR funcionan muy bien como valores predeterminados. - La primera generación en cualquier muestra tiene un retraso mientras se almacenan en caché los prompts de voz, pero las líneas siguientes se ensamblan significativamente más rápido.
A quién le será útil este proyecto
Voice Clone Studio aborda tres necesidades claras. Primero, es un excelente campo de pruebas para cualquiera que quiera comparar la calidad de VibeVoice, Qwen3 y Fish Speech en el mismo material de audio sin tratar con consolas. Segundo, los creadores de podcasts y audiolibros apreciarán el módulo Conversation con generación de 90 minutos. Tercero, es una estación de trabajo lista para usar para preparar conjuntos de datos y entrenar modelos de voz personalizados sin escribir scripts de entrenamiento.
Proyectos relacionados