>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
JavaScript

Cómo generar música con voces a partir de texto y referencias en tu GPU

SongGeneration Studio

Los generadores de música en la nube como Suno o Udio producen excelentes resultados, pero requieren una suscripción constante, limitan tus créditos y te atan a servidores externos. Si quieres ejecutar una herramienta similar de forma local, durante mucho tiempo prácticamente no hubo alternativas adecuadas. La mayoría de las redes neuronales de código abierto solo podían generar muestras cortas de fondo sin voces o requerían manipulaciones complejas en la consola.

Recently, developer BazedFrog released the SongGeneration Studio project. This is a convenient web interface for the LeVo model, created by researchers at Tencent AI Lab. The application is packaged for one-click launch via the Pinokio installer, so you can deploy it without deep knowledge of Python and PyTorch.

Qué puede hacer la aplicación

El proyecto está construido sobre un modelo generativo capaz de sintetizar una pista de audio completa a partir de una descripción de texto y letras. La interfaz web de SongGeneration Studio convierte este motor en un mini estudio completamente funcional.

En su interior, hay varias características principales:

  • Constructor de estructura de composición. Las letras de la canción se pueden dividir en bloques lógicos: intro, versos, coro, sección puente y outro final. Esto ayuda a la red neuronal a construir la forma musical correcta.
  • Personalización detallada del estilo. Seleccionas el género (desde pop y hip-hop hasta metal y jazz), el tono emocional, el tempo en BPM, así como el tipo de voz vocal y el conjunto de instrumentos principales.
  • Clonación de estilo a partir de un archivo de audio. Si subes una pista de referencia, el modelo intentará copiar su carácter, ritmo y sonido general al crear una nueva canción.
  • Separación multitrack. La salida te da no solo una pista mezclada sino también stems separados: voces limpias y arreglo instrumental.
  • Gestor de proyectos y exportación. Todas las pistas generadas se guardan en la biblioteca integrada. El resultado final se puede exportar en formato FLAC sin pérdidas o como archivo de video MP4 con portada.

Separar voces e instrumentales aislados facilita la vida de quienes están acostumbrados a refinar material en DAWs como Ableton, FL Studio o Logic. Las muestras se pueden procesar fácilmente con efectos, recortar o superponer sobre tu propia base rítmica.

Requisitos de hardware e instalación

La limitación principal del proyecto está relacionada con los recursos. El modelo LeVo es exigente en memoria de video.

Necesitarás una GPU NVIDIA con al menos 10 GB de VRAM. Sin embargo, para la generación estable de pistas largas en alta calidad, los desarrolladores recomiendan tener 24 GB de memoria de video. Necesitarás aproximadamente 50 GB de espacio libre en tu disco duro, ya que los pesos del modelo por sí solos ocupan unos 15 GB.

Desplegar el sistema es extremadamente sencillo gracias a la plataforma Pinokio:

  1. Inicia Pinokio.
  2. Busca SongGeneration Studio.
  3. Haz clic en el botón de instalar.

El instalador automáticamente instalará la versión requerida de Python, descargará las dependencias y cargará los pesos del modelo. Una vez completado, solo haz clic en Iniciar, y la interfaz se abrirá en tu navegador.

Cómo funciona el proceso de generación

Después de lanzar la interfaz web, crear una canción consta de cuatro pasos:

  1. Entrada de texto y marcado. Pegas las letras y las distribuyes en los bloques de la canción.
  2. Selección de parámetros estilísticos. Se establecen el género, el estado de ánimo, la voz del cantante y los instrumentos.
  3. Añadir una referencia si es necesario. Subir un extracto corto de música ayuda a fijar el diseño de sonido deseado.
  4. Iniciar la generación. Calcular una pista generalmente toma de 3 a 6 minutos.

Desde observaciones personales: la calidad vocal depende directamente de la estructura rítmica del texto. Si introduces texto continuo sin rima y metro claro, la red neuronal comienza a tropezar, estirar vocales o "tragarse" los finales. Si divides el texto en estrofas uniformes de cuatro líneas, el resultado resulta significativamente más limpio.

La función de cola de tareas también funciona de manera interesante. Puedes preparar varias variaciones de texto a la vez y enviarlas para generación en segundo plano, y luego elegir el mejor resultado de la biblioteca.

Limitaciones e impresión general

La herramienta aún no puede reemplazar completamente una grabación de estudio o un arreglista profesional. A veces las voces pueden sonar ligeramente sintéticas, y la generación en tarjetas con 10 GB de VRAM puede alcanzar el límite de memoria con textos demasiado largos. Además, el proyecto aún es joven: el repositorio tiene alrededor de 550 estrellas y unas veinte issues abiertas.

No obstante, SongGeneration Studio se está convirtiendo en una excelente herramienta para experimentos rápidos. Será útil para desarrolladores de juegos indie que crean bandas sonoras, creadores de contenido que obtienen música de fondo sin problemas de derechos de autor, y músicos que generan ideas rápidas de demos.

Proyectos relacionados