>_ DevTrendsfr

Langue

Accueil

Langages

Sections

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarqué Sécurité
JavaScript

Comment générer de la musique avec voix à partir de texte et de références sur votre GPU

SongGeneration Studio

Les générateurs de musique cloud comme Suno ou Udio produisent d'excellents résultats, mais ils nécessitent un abonnement constant, limitent vos crédits et vous attachent à des serveurs externes. Si vous souhaitez exécuter un outil similaire en local, pendant longtemps il n'y avait pratiquement aucune alternative adéquate. La plupart des réseaux neuronaux open source ne pouvaient générer que de courts échantillons d'ambiance sans voix ou nécessitaient des manipulations console complexes.

Récemment, le développeur BazedFrog a publié le projet SongGeneration Studio. Il s'agit d'une interface web pratique pour le modèle LeVo, créé par des chercheurs de Tencent AI Lab. L'application est packagée pour un lancement en un clic via l'installateur Pinokio, vous pouvez donc la déployer sans connaissances approfondies de Python et PyTorch.

Ce que l'application peut faire

Le projet est construit sur un modèle génératif capable de synthétiser une piste audio complète à partir d'une description textuelle et de paroles. L'interface web de SongGeneration Studio transforme ce moteur en un mini studio complet.

À l'intérieur, plusieurs fonctionnalités principales :

  • Constructeur de structure de composition. Les paroles de la chanson peuvent être divisées en blocs logiques : intro, couplets, refrain, pont et outro final. Cela aide le réseau neuronal à construire la forme musicale correcte.
  • Personnalisation détaillée du style. Vous sélectionnez le genre (du pop et hip-hop au metal et jazz), le ton émotionnel, le tempo en BPM, ainsi que le type vocal et l'ensemble d'instruments principaux.
  • Clonage de style à partir d'un fichier audio. Si vous téléchargez une piste de référence, le modèle essaiera de copier son caractère, son rythme et son son global lors de la création d'une nouvelle chanson.
  • Séparation multitrack. La sortie vous donne non seulement une piste mixée mais aussi des stems séparés : voix isolées et arrangement instrumental.
  • Gestionnaire de projet et exportation. Toutes les pistes générées sont sauvegardées dans la bibliothèque intégrée. Le résultat fini peut être exporté au format FLAC sans perte ou en fichier vidéo MP4 avec jaquette.

Séparer les voix isolées et les instrumentaux facilite la vie pour ceux qui ont l'habitude d'affiner le matériel dans des DAW comme Ableton, FL Studio ou Logic. Les échantillons peuvent être facilement traités avec des effets, découpés ou superposés à votre propre beat.

Configuration matérielle requise et installation

La principale limitation du projet est liée aux ressources. Le modèle LeVo est exigeant en mémoire vidéo.

Vous aurez besoin d'un GPU NVIDIA avec au moins 10 Go de VRAM. Cependant, pour une génération stable de pistes longues en haute qualité, les développeurs recommandent d'avoir 24 Go de mémoire vidéo. Vous aurez besoin d'environ 50 Go d'espace libre sur votre disque dur, car les poids du modèle eux-mêmes occupent environ 15 Go.

Déployer le système est extrêmement simple grâce à la plateforme Pinokio :

  1. Lancez Pinokio.
  2. Recherchez SongGeneration Studio.
  3. Cliquez sur le bouton d'installation.

L'installateur installera automatiquement la version requise de Python, téléchargera les dépendances et chargera les poids du modèle. Une fois terminé, cliquez simplement sur Démarrer, et l'interface s'ouvrira dans votre navigateur.

Comment fonctionne le processus de génération

Après avoir lancé l'interface web, créer une chanson se compose de quatre étapes :

  1. Saisie du texte et balisage. Vous collez les paroles et les distribuez dans les blocs de la chanson.
  2. Sélection des paramètres stylistiques. Genre, ambiance, voix du vocalist et instruments sont définis.
  3. Ajout d'une référence si nécessaire. Télécharger un court extrait musical aide à verrouiller le design sonore souhaité.
  4. Démarrage de la génération. Le calcul d'une piste prend généralement 3 à 6 minutes.

D'après mes observations personnelles : la qualité vocale dépend directement de la structure rythmique du texte. Si vous collez du texte continu sans rime et sans mètre clair, le réseau neuronal commence à trébucher, à étirer les voyelles ou à « avaler » les fins. Si vous divisez le texte en quatrains même de quatre lignes, le résultat s'avère significativement plus propre.

La fonction de file d'attente de tâches fonctionne aussi de manière intéressante. Vous pouvez préparer plusieurs variations de texte à la fois et les envoyer pour une génération en arrière-plan, puis choisir le meilleur résultat dans la bibliothèque.

Limitations et impression globale

L'outil ne peut pas encore remplacer pleinement un enregistrement en studio ou un arrangeur professionnel. Parfois, les voix peuvent sonner légèrement synthétiques, et la génération sur des cartes avec 10 Go de VRAM peut atteindre la limite de mémoire avec des textes trop longs. De plus, le projet est encore jeune — le dépôt a environ 550 étoiles et une vingtaine d'issues ouvertes.

Néanmoins, SongGeneration Studio devient un excellent outil pour des expériences rapides. Il sera utile pour les développeurs de jeux indie créant des bandes originales, les créateurs de contenu obtenant de la musique de fond sans problèmes de droits d'auteur, et les musiciens générant rapidement des idées de démos.

Projets similaires