Trascrizione vocale locale direttamente al cursore con Voicetypr
Spesso mi ritrovo a pensare che scrivere prompt lunghi per reti neurali o commenti dettagliati sulle pull request sia semplicemente troppo tedioso. Le dita si stancano, i pensieri si confondono e non ho voglia di rileggere la bozza. L'input vocale sembra risolvere questo problema, ma gli strumenti di sistema standard in macOS e Windows non funzionano poi così bene. Le utility cloud di terze parti come Wispr Flow richiedono un abbonamento e instradano tutta la voce attraverso server esterni, il che è immediatamente da escludere per codice riservato o chat di lavoro.
Recentemente mi sono imbattuto in un progetto interessante chiamato Voicetypr. È un'applicazione desktop open-source con licenza AGPL-3.0 che inserisce il parlato riconosciuto direttamente dove lampeggia il cursore. E lo fa completamente in locale sulla tua macchina.
Cosa può fare l'app
L'idea principale è semplice: premi una scorciatoia globale, detta il testo nel microfono, rilascia il tasto e le frasi finite appaiono immediatamente nel campo di input attivo. Che sia l'editor VS Code, il terminale, un messenger o il browser.
Ecco alcune delle funzionalità che l'autore ha incluso in questa utility:
- Riconoscimento on-device. Su macOS e Windows funziona il modello Whisper, e per i Mac con chip Apple Silicon puoi collegare il modello Parakeet ottimizzato.
- Formattazione tramite LLM. La dettatura grezza è spesso piena di parole di riempimento e strane pause. L'app può passare il testo bozza attraverso OpenAI, Anthropic, Gemini o qualsiasi endpoint locale personalizzato per produrre un paragrafo pulito e modificato in output.
- Trascrizione di file multimediali esistenti. Puoi trascinare un file audio o video e ottenere una trascrizione testuale.
- Cronologia delle registrazioni. Tutte le trascrizioni vengono salvate nell'interfaccia con metadati, così puoi confrontare il testo originale con la versione modificata o riprodurre la registrazione.
- Modalità server sulla rete locale. Se hai una scheda grafica potente su un computer, puoi configurare Voicetypr come server di trascrizione locale e inviare l'audio da un portatile meno potente.
A proposito, se la potenza locale non è sufficiente, puoi passare ai servizi di riconoscimento cloud nelle impostazioni: Groq, Deepgram, OpenAI, Soniox o Cohere. Ma il punto fondamentale di Voicetypr è che per impostazione predefinita il flusso audio non lascia mai il tuo computer.
CLI per automazione e agenti locali
Un dettaglio interessante che gli sviluppatori raramente considerano in utility GUI simili: Voicetypr include un'interfaccia console integrata.
Il comando può essere installato direttamente dalle impostazioni del programma. Questo rende possibile chiamare il motore di riconoscimento da script bash o connettersi ad agenti AI locali:
# Проверить статус приложения
voicetypr status --json
# Посмотреть доступные модели
voicetypr models --json
# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json
# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json
Il flag --json restituisce una risposta strutturata, quindi il risultato è facile da analizzare con jq standard o da passare più avanti nella pipeline.
Come funziona sotto il cofano
Lo stack dell'app è costruito in modo piuttosto pragmatico. L'autore ha scelto Tauri v2 e Rust per il lavoro pesante di sistema, e ha scritto l'interfaccia in React 19, TypeScript, Tailwind CSS e shadcn/ui.
Tutto il lavoro di intercettazione dei tasti di scelta rapida, acquisizione del microfono, ricampionamento dell'audio ed emulazione dell'input nella finestra attiva ricade interamente sul backend Rust. Questo ha garantito una risposta rapida e un consumo di RAM modesto rispetto alle tipiche app Electron.
Su Windows, Whisper locale può usare Vulkan per l'accelerazione GPU. E questo processo è isolato in un sidecar separato. Se qualcosa va storto con il driver video, l'app passa semplicemente in modo silenzioso ai calcoli CPU senza crashare il programma principale.
Come compilare ed eseguire
Se vuoi compilare il progetto dal codice sorgente da solo, avrai bisogno di Node.js con il gestore di pacchetti pnpm, la toolchain Rust e gli strumenti di build di base per il tuo sistema operativo (Xcode CLI su macOS o Visual Studio Build Tools su Windows).
La compilazione viene avviata con comandi standard:
git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev
Nel repository sono disponibili anche test e linter già pronti:
pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate
Per chi non vuole compilare manualmente, pacchetti DMG firmati per macOS e installer per Windows 10/11 sono disponibili nelle release GitHub e sul sito ufficiale.
Perché uno sviluppatore ne ha bisogno
Prima di tutto, Voicetypr tornerà utile per chi scrive molto testo: mantenere documentazione, redigere task nei tracker di issue o comunicare con reti neurali in Cursor e Claude Dev. Dettare un contesto complesso per voce in venti secondi è molto più facile che digitare cinque paragrafi a mano.
Il secondo scenario ovvio è la privacy. Se lavori con NDA o semplicemente non vuoi consegnare registrazioni della tua voce a società di terze parti, la combinazione di Whisper locale e inferenza locale tramite Ollama risolve completamente questo problema.
Il progetto attualmente ha relativamente poche stelle su GitHub, ma il codice sembra pulito e la combo Tauri con Rust funziona velocemente. Vale sicuramente la pena provarlo, soprattutto se stavi cercando un'alternativa gratuita alle app di dettatura proprietarie.
Progetti correlati