>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Python

ElevenLabs local en tu propio hardware con VoiceStudio

Hace poco necesitaba poner voz a un par de docenas de vídeos tutoriales y cortar subtítulos. Mi primera idea fue usar servicios en la nube como ElevenLabs. Pero cuando calculas el coste de la suscripción de equipo y te das cuenta de que el audio de borradores y los materiales confidenciales se enviarán a servidores externos, el entusiasmo se desvanece.

VoiceStudio (antes OmniVoice-Studio) ha ido ganando popularidad en GitHub. Es una aplicación de escritorio para síntesis de voz, clonación de voz, transcripción y doblaje que se ejecuta de forma local.

Logotipo de VoiceStudio

Sin tokens, créditos de generación ni vinculación obligatoria de tarjeta. Descargas la aplicación, esta descarga los pesos del modelo necesarios, y todo el procesamiento se ejecuta en tu GPU o CPU.

Qué puede hacer la aplicación

El repositorio reúne casi todos los desarrollos de audio de código abierto notables de los últimos tiempos. En lugar de preparar una docena de blocs de notas Jupyter separados o lidiar con versiones incompatibles de PyTorch, obtienes una interfaz gráfica lista para usar y un servidor local.

Cambiar motores en VoiceStudio

Estos son los principales escenarios que cubre el programa:

  1. Clonación de voz. Funciona en modo zero-shot: tomas un clip de audio de referencia corto de 5 a 15 segundos sin ruido ni música, introduces el texto y obtienes una pista lista con el mismo timbre.
  2. Diseño de voz. Si no tienes una muestra lista, los parámetros se configuran mediante texto: edad, acento, tono, coloración emocional o particularidades del habla.
  3. Doblaje automático de vídeo. La herramienta puede reconocer el habla en un vídeo, traducirla, separar a los hablantes mediante diarización, superponer la voz sintetizada sobre la pista original e exportar inmediatamente el archivo terminado.
  4. Audiolibros e historias largas. Puedes subir un archivo en formato EPUB o PDF, distribuir líneas entre diferentes narradores virtuales, renderizar capítulos y ensamblar el libro final en formato MP3.
  5. Widget de dictación del sistema. Al pulsar una tecla de acceso rápido global, transcribe la voz del micrófono a texto sobre la marcha, y un modelo de lenguaje local puede limpiar inmediatamente las muletillas y añadir puntuación.

El catálogo de modelos integrado permite cambiar entre 16 motores de síntesis y 11 motores de reconocimiento sobre la marcha con una combinación de teclas.

Catálogo de modelos y galería de voces

Bajo el capó y en el terminal

La arquitectura del proyecto está bien pensada. Los desarrolladores no envolvieron todo en un Electron pesado.

  • Shell de escritorio: Tauri v2 en Rust, que gestiona la bandeja del sistema, las llamadas de teclas de acceso rápido y la gestión de procesos en segundo plano.
  • Interfaz: React con bundler Vite y gestor de estado Zustand.
  • Backend: FastAPI en Python, que se inicia en el puerto 8000. Dentro se ejecutan adaptadores de modelos, colas de tareas y una base de datos SQLite con migraciones mediante Alembic.

Entre los motores de síntesis de voz, se afirma compatibilidad con 646 idiomas mediante k2-fsa/OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, PocketTTS y MOSS-TTS. Para transcripción, están disponibles WhisperX, Faster-Whisper, Parakeet TDT y FunASR. Las pistas de audio se separan con Demucs cuando es necesario, y los hablantes se identifican mediante Pyannote.

Si no necesitas la interfaz y quieres generar audio desde scripts, el backend expone una API compatible con OpenAI. Solo tienes que redirigir la URL base en tu cliente:

base_url="http://localhost:8000/v1"

Además de la API REST estándar, se admiten WebSocket, Server-Sent Events y MCP (Model Context Protocol). Esto significa que la síntesis de voz y el reconocimiento se pueden llamar directamente como herramienta para agentes de IA en Claude Code o Cursor.

Requisitos de hardware e instalación

Para un inicio rápido, los autores prepararon builds listos para usar:

  • macOS: Paquete DMG para Apple Silicon (se admiten backends MPS y MLX). En procesadores Intel antiguos, el backend local no funcionará.
  • Windows: Instalador MSI para sistemas de 64 bits con aceleración CUDA.
  • Linux: Paquete AppImage y contenedores Docker listos con soporte para CUDA y ROCm.

En el primer inicio, el programa configura automáticamente un entorno Python aislado y descarga el modelo base.

El mínimo para un trabajo cómodo es 8 GB de RAM y 4 GB de memoria de vídeo cuando se ejecuta en GPU. Si no hay GPU, los modelos base también funcionan en CPU, pero generar segmentos largos llevará заметно más tiempo. Para modelos pesados como CosyVoice 3, es mejor tener una tarjeta con 8 a 16 GB de VRAM.

Si quieres ejecutar el proyecto desde el código fuente, necesitarás git y Python:

git clone https://github.com/...

Para ejecutar solo la interfaz web en el navegador, usa el comando python -m app.

A quién le será útil

El proyecto claramente atraerá a cualquiera que trabaje regularmente con contenido de audio pero no quiera filtrar datos a nubes externas. Es un gran hallazgo para la localización de podcasts, voiceover automatizado de documentación, poner voz a juegos indie o transcripción rápida local de reuniones sin límites de duración.

El código se distribuye bajo la licencia AGPL-3.0, y los modelos base se distribuyen bajo Apache-2.0. Si has estado buscando un combi de audio independiente para tu escritorio, VoiceStudio definitivamente vale la pena instalar y probar.

Proyectos relacionados