>_ DevTrendsit

Lingua

Home

Linguaggi

Sezioni

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicurezza
Python

ElevenLabs in locale sul tuo hardware con VoiceStudio

Recentemente avevo bisogno di doppiare un paio di dozzine di video tutorial e tagliare i sottotitoli. Il mio primo pensiero è stato usare servizi cloud come ElevenLabs. Ma quando calcoli il costo dell'abbonamento del team e ti rendi conto che l'audio in bozza e i materiali riservati verranno inviati a server esterni, l'entusiasmo svanisce.

VoiceStudio (precedentemente OmniVoice-Studio) sta guadagnando popolarità su GitHub. È un'applicazione desktop per sintesi vocale, cloning vocale, trascrizione e doppiaggio che funziona in locale.

Logo VoiceStudio

Nessun token, crediti di generazione o associazione obbligatoria della carta. Scarichi l'app, scarica i pesi del modello necessari e tutta l'elaborazione viene eseguita sulla tua GPU o CPU.

Cosa può fare l'app

Il repository riunisce quasi tutti i più importanti sviluppi audio open-source degli ultimi tempi. Invece di avviare una dozzina di notebook Jupyter separati o gestire versioni incompatibili di PyTorch, ottieni una GUI pronta all'uso e un server locale.

Cambio motori in VoiceStudio

Ecco i principali scenari coperti dal programma:

  1. Cloning vocale. Funziona in modalità zero-shot: prendi un breve clip audio di riferimento di 5-15 secondi senza rumore o musica, inserisci il testo e ottieni una traccia pronta con lo stesso timbro.
  2. Progettazione vocale. Se non hai un campione pronto, i parametri vengono impostati tramite testo: età, accento, tono, colorazione emotiva o particolarità del parlato.
  3. Doppiaggio video automatico. Lo strumento può riconoscere il parlato nel video, tradurlo, separare i parlanti tramite diarizzazione, sovrapporre la voce sintetizzata alla traccia originale ed esportare immediatamente il file finito.
  4. Audiolibri e storie lunghe. Puoi caricare un file in formato EPUB o PDF, distribuire le battute tra diversi narratori virtuali, eseguire il rendering dei capitoli e assemblare il libro finale in formato MP3.
  5. Widget di dettatura di sistema. Premendo un hotkey globale trascrive la voce dal microfono in testo al volo e un modello linguistico locale può immediatamente pulire le parole di riempimento e aggiungere punteggiatura.

Il catalogo modelli integrato consente di passare tra 16 motori di sintesi e 11 motori di riconoscimento al volo con una combinazione di tasti.

Catalogo modelli e galleria voci

Sotto il cofano e nel terminale

L'architettura del progetto è ben congegnata. Gli sviluppatori non hanno avvolto tutto in un pesante Electron.

  • Shell desktop: Tauri v2 in Rust, che gestisce il vassoio di sistema, le chiamate di hotkey e la gestione dei processi in background.
  • Interfaccia: React con bundler Vite e gestore di stato Zustand.
  • Backend: FastAPI in Python, che si avvia sulla porta 8000. Al suo interno vengono eseguiti adattatori di modelli, code di attività e un database SQLite con migrazioni tramite Alembic.

Tra i motori di sintesi vocale, viene dichiarato il supporto per 646 lingue tramite k2-fsa/OmniVoice, CosyVoice 3, GPT-SoVITS, VoxCPM2, PocketTTS e MOSS-TTS. Per la trascrizione sono disponibili WhisperX, Faster-Whisper, Parakeet TDT e FunASR. Le tracce audio vengono separate con Demucs quando necessario e i parlanti vengono identificati tramite Pyannote.

Se non hai bisogno dell'interfaccia e vuoi generare audio da script, il backend espone un'API compatibile con OpenAI. Basta reindirizzare l'URL base nel tuo client:

base_url="http://localhost:8000/v1"

Oltre all'API REST standard, sono supportati WebSocket, Server-Sent Events e MCP (Model Context Protocol). Questo significa che la sintesi e il riconoscimento vocale possono essere chiamati direttamente come strumento per agenti AI in Claude Code o Cursor.

Requisiti hardware e installazione

Per un avvio rapido, gli autori hanno preparato build pronte all'uso:

  • macOS: pacchetto DMG per Apple Silicon (sono supportati i backend MPS e MLX). Sui vecchi processori Intel, il backend locale non funzionerà.
  • Windows: programma di installazione MSI per sistemi a 64 bit con accelerazione CUDA.
  • Linux: pacchetto AppImage e container Docker pronti all'uso con supporto CUDA e ROCm.

Al primo avvio, il programma configura automaticamente un ambiente Python isolato e scarica il modello base.

Il minimo per un lavoro confortevole è 8 GB di RAM e 4 GB di memoria video quando si esegue su GPU. Se non c'è GPU, i modelli base funzionano anche su CPU, ma generare segmenti lunghi richiederà notevolmente più tempo. Per modelli pesanti come CosyVoice 3, è meglio avere una scheda con 8-16 GB di VRAM.

Se vuoi eseguire il progetto dal codice sorgente, avrai bisogno di git e Python:

git clone https://github.com/...

Per eseguire solo l'interfaccia web nel browser, usa il comando python -m app.

A chi sarà utile

Il progetto piacerà chiaramente a chiunque lavori regolarmente con contenuti audio ma non voglia perdere dati su cloud esterni. È una grande scoperta per la localizzazione di podcast, voiceover automatico di documentazione, doppiaggio di giochi indie o rapida trascrizione di riunioni locali senza limiti di durata.

Il codice è distribuito sotto la licenza AGPL-3.0 e i modelli base sono forniti sotto Apache-2.0. Se stavi cercando un combo audio autonomo per il tuo desktop, VoiceStudio vale sicuramente la pena di installarlo e provarlo.

Progetti correlati