>_ DevTrendsfr

Langue

Accueil

Langages

Sections

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarqué Sécurité
Python

Comment transformer n'importe quel livre en production audio multi-voix avec Alexandria

Une situation familière : vous trouvez un livre ou un fanfic cool que vous voulez « dévorer » en une soirée, mais il n'y a simplement pas le temps de s'asseoir pour lire. Les « lecteurs » classiques avec des voix synthétiques sonnent comme des robots des années quatre-vingt, et les livres audio professionnels coûtent de l'argent ou n'existent tout simplement pas pour les œuvres rares. Récemment, je suis tombé sur le projet Alexandria, qui résout ce problème à un niveau quasi studio.

Alexandria Logo

Ce que c'est

Alexandria n'est pas qu'un simple script de synthèse vocale. C'est un pipeline complet qui prend votre fichier texte et le transforme en script formaté. Le système comprend de lui-même où le narrateur parle et où les personnages interviennent, attribuant à chacun une voix unique. Il fonctionne avec le moteur Qwen3-TTS, qui peut transmettre des émotions, faire des pauses, et même imiter des soupirs ou des rires.

Le point fort principal est que le projet combine les capacités des grands modèles de langage (LLM) pour l'analyse de texte et des réseaux de neurones modernes pour la synthèse vocale. Vous n'obtenez pas un murmure monotone, mais une véritable performance audio.

Comment fonctionne le processus

Le travail avec l'outil est divisé en étapes logiques. J'ai aimé que le développeur ne vous force pas à bidouiller dans la console — il y a une interface web parfaitement utilisable.

Annotation du script via LLM

D'abord, vous donnez le livre au programme. Alexandria se connecte à votre LLM local (via Ollama ou LM Studio) ou à l'API OpenAI. Le réseau de neurones analyse le texte et le convertit en structure JSON. Il extrait les dialogues, identifie le locuteur, et surtout, écrit des instructions vocales. Par exemple : « Marcus dit cela avec une confiance menaçante, d'une voix basse et insidieuse. »

Travail avec les voix

Après l'annotation, vous arrivez dans la section de gestion des voix. Pour chaque personnage trouvé, vous pouvez choisir parmi neuf préréglages ou aller plus loin :

  • Clonage : téléchargez un échantillon audio de 10 secondes, et le personnage parlera avec cette voix.
  • Conception vocale : vous pouvez simplement décrire la voix en texte, par exemple : « Une voix chaleureuse d'une femme âgée avec un léger rauque, » et le réseau de neurones la créera de toutes pièces.
  • Entraînement LoRA : pour ceux qui veulent le résultat parfait, il y a une option pour affiner le modèle sur un ensemble de données spécifique directement dans l'interface.

Éditeur et exportation

Avant l'assemblage final, vous pouvez écouter chaque segment séparément. Si le réseau de neurones a fait une erreur d'intonation quelque part, vous modifiez simplement l'instruction textuelle et régénérez ce passage spécifique. La sortie est soit un seul fichier MP3/M4B avec des chapitres, soit un projet pour Audacity où chaque voix est sur une piste séparée. C'est pratique si vous voulez ajouter de la musique de fond ou des effets manuellement.

L'aspect technique

Le projet est écrit en Python et nécessite un matériel assez puissant si vous voulez générer de l'audio rapidement.

  • Minimum : 8 Go de mémoire vidéo (VRAM). C'est suffisant pour travailler ligne par ligne.
  • Recommandé : 16 Go et plus. Vous pouvez alors activer le traitement par lots, ce qui accélère le processus de 3 à 6 fois.
  • Optimisation : torch.compile est supporté, ce qui donne un gain de vitesse notable sur les cartes NVIDIA et AMD (sur Linux).

Intéressamment, l'auteur a inclus le support Pinokio — c'est un navigateur pour les applications d'IA qui installe automatiquement toutes les dépendances, environnements et bibliothèques. Pour ceux qui ne veulent pas deal avec pip install et les conflits de versions, c'est un vrai sauveur.

Avantages pratiques

Pourquoi un développeur aurait-il besoin de ça ? En dehors de l'évident « créer un livre audio à partir de la documentation, » il y a quelques cas d'usage intéressants :

  1. Prototypage vocal pour les jeux : vous pouvez esquisser rapidement des dialogues et écouter comment ils sonnent interprétés par différents personnages sans engager d'acteurs aux premières étapes.
  2. Création de contenu : si vous gérez un podcast ou une chaîne YouTube, Alexandria vous aidera à créer des segments de qualité avec différentes voix.
  3. Automatisation : le projet a une API REST. Vous pouvez intégrer la génération vocale dans vos pipelines.

Est-ce que ça vaut le coup d'essayer

Si vous avez une carte graphique de niveau RTX 3060 ou supérieur, alors définitivement oui. Alexandria est l'un des outils les plus réfléchis dans sa niche. Il ne se contente pas de « lire le texte » — il essaie de comprendre le contexte et les émotions de l'œuvre.

Du côté des inconvénients : le projet est assez lourd. Lors de la première installation, il téléchargera environ 20 Go de données (bibliothèques + poids du modèle). Gardez aussi à l'esprit qu'un bon LLM est nécessaire pour une annotation de texte de qualité — les petits modèles avec 3 à 7 milliards de paramètres peuvent se mélanger les pinceaux avec les personnages.

Dans l'ensemble, c'est un excellent exemple de la façon dont les réseaux de neurones passent de jouets amusants à des outils véritablement utiles pour les tâches du quotidien. Vous pouvez l'essayer localement ou via Google Colab si vous n'avez pas assez de matériel de votre côté.

Projets similaires