>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Python

Lokale ElevenLabs op Je Eigen Hardware met VoiceStudio

Onlangs moest ik een paar dozijn tutorialvideo's inspreken en ondertitels knippen. Mijn eerste gedachte was om cloudservices zoals ElevenLabs te gebruiken. Maar wanneer je de kosten van een teamabonnement berekent en je beseft dat conceptaudio en vertrouwelijke materialen naar externe servers worden gestuurd, verdwijnt het enthousiasme.

VoiceStudio (voorheen OmniVoice-Studio) wint aan populariteit op GitHub. Het is een desktopapplicatie voor spraaksynthese, stemklonen, transcriptie en nasynchronisatie die lokaal draait.

VoiceStudio logo

Geen tokens, generatiecredits of verplichte creditcardkoppeling. Je downloadt de app, deze haalt de benodigde modelgewichten op, en alle verwerking vindt plaats op je GPU of CPU.

Wat de app kan doen

De repository brengt vrijwel alle opvallende open-source audio-ontwikkelingen van de afgelopen tijd samen. In plaats van een dozijn aparte Jupyter notebooks op te starten of met incompatibele PyTorch-versies te werken, krijg je een kant-en-klare GUI en lokale server.

Engines wisselen in VoiceStudio

Hier zijn de belangrijkste scenario's die het programma dekt:

  1. Stemklonen. Werkt in zero-shot modus: je neemt een kort referentie-audioclip van 5–15 seconden zonder ruis of muziek, voert tekst in, en krijgt een klaar trackje met hetzelfde timbre.
  2. Stemontwerp. Als je geen kant-en-klaar sample hebt, worden parameters ingesteld via tekst: leeftijd, accent, toon, emotionele kleuring of spraakbijzonderheden.
  3. Automatische videonasynchronisatie. Het hulpmiddel kan spraak in video herkennen, vertalen, sprekers scheiden via diarizatie, de gesynthetiseerde stem over het originele track leggen en direct het fertige bestand exporteren.
  4. Audioboeken en lange verhalen. Je kunt een bestand in EPUB- of PDF-formaat uploaden, regels verdelen tussen verschillende virtuele vertellers, hoofdstukken renderen en het fertige boek in MP3-formaat samenstellen.
  5. Systeemdicteerwidget. Door op een globale sneltoets te drukken wordt je stem van de microfoon live getranscribeerd naar tekst, en een lokaal taalmodel kan onmiddellijk vulwoorden verwijderen en interpunctie toevoegen.

De ingebouwde modelcatalogus stelt je in staat om onderweg te schakelen tussen 16 synthese-engines en 11 herkennings-engines met een toetsencombinatie.

Modelcatalogus en stemgalerij

Onder de motorkap en in de terminal

De projectarchitectuur is goed doordacht. De ontwikkelaars hebben niet alles in zware Electron verpakt.

  • Desktop-shell: Tauri v2 in Rust, dat de systeembalk, sneltoetsaanroepen en achtergrondprocesbeheer afhandelt.
  • Interface: React met Vite-bundler en Zustand-state-manager.
  • Backend: FastAPI in Python, draaiend op poort 8000. Daarbinnen draaien modeladapters, taakwachtrijen en een SQLite-database met migraties via Alembic.

Onder de spraaksynthese-engines wordt ondersteuning voor 646 talen geclaimd via k2-fsa/OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, PocketTTS en MOSS-TTS. Voor transcriptie zijn WhisperX, Faster-Whisper, Parakeet TDT en FunASR beschikbaar. Audiotracks worden indien nodig gescheiden met Demucs, en sprekers worden geïdentificeerd via Pyannote.

Als je de interface niet nodig hebt en audio uit scripts wilt genereren, stelt de backend een OpenAI-compatibele API bloot. Stuur gewoon de base-URL om in je client:

base_url="http://localhost:8000/v1"

Naast de standaard REST API worden WebSocket, Server-Sent Events en MCP (Model Context Protocol) ondersteund. Dit betekent dat spraaksynthese en -herkenning direct kunnen worden aangeroepen als een tool voor AI-agents in Claude Code of Cursor.

Hardwarevereisten en installatie

Voor een snelle start hebben de auteurs kant-en-klare builds voorbereid:

  • macOS: DMG-pakket voor Apple Silicon (MPS- en MLX-backends worden ondersteund). Op oude Intel-processors werkt de lokale backend niet.
  • Windows: MSI-installatieprogramma voor 64-bit systemen met CUDA-acceleratie.
  • Linux: AppImage-pakket en kant-en-klare Docker-containers met CUDA- en ROCm-ondersteuning.

Bij de eerste start stelt het programma automatisch een geïsoleerde Python-omgeving in en downloadt het het basismodel.

Het minimum voor comfortabel werken is 8 GB RAM en 4 GB videogeheugen bij draaien op GPU. Als er geen GPU is, werken basismodellen ook op CPU, maar het genereren van lange segmenten kost merkbaar meer tijd. Voor zware modellen zoals CosyVoice 3 is het beter om een kaart met 8–16 GB VRAM te hebben.

Als je het project vanaf de broncode wilt draaien, heb je git en Python nodig:

git clone https://github.com/...

Om alleen de webinterface in de browser te draaien, gebruik je het commando python -m app.

Voor wie is het nuttig

Het project zal duidelijk aanspreken bij iedereen die regelmatig met audio-inhoud werkt maar geen data naar externe clouds wil lekken. Het is een geweldige vondst voor podcastlokalisatie, geautomatiseerde documentatie-voiceover, inspreken van indie-games of snelle lokale vergadetranscriptie zonder tijdslimiet.

De code wordt gedistribueerd onder de AGPL-3.0-licentie en basismodellen worden meegeleverd onder Apache-2.0. Als je op zoek was naar een standalone audio-combinatie voor je desktop, is VoiceStudio zeker de moeite waard om te installeren en uit te proberen.

Gerelateerde projecten