Lokale spraak-naar-tekst direct bij de cursor met Voicetypr
Ik betrap mezelf er vaak op dat ik denk dat het typen van lange prompts voor neurale netwerken of gedetailleerde opmerkingen bij pull requests gewoon te vermoeiend is. Mijn vingers worden moe, gedachten raken door elkaar, en ik heb geen zin om de draft opnieuw te lezen. Spraakinvoer lijkt dit probleem op te lossen, maar de standaard systeemtools in macOS en Windows werken niet zo goed. Clouddiensten van derden zoals Wispr Flow vereisen een abonnement en sturen al je stem via externe servers, wat direct afvalt voor vertrouwelijke code of werkgerelateerde chats.
Onlangs stuitte ik op een interessant project genaamd Voicetypr. Het is een open-source desktop-applicatie onder de AGPL-3.0-licentie die herkende spraak direct invoegt waar de cursor knippert. En het doet dit volledig lokaal op je machine.
Wat de app kan doen
Het hoofdidee is simpel: druk op een globale sneltoets, dicteer tekst in de microfoon, laat de toets los, en de voltooide zinnen verschijnen onmiddellijk in het actieve invoerveld. Of het nu VS Code-editor, terminal, messenger of browser is.
Hier zijn een paar dingen die de auteur in dit hulpprogramma heeft gestopt:
- Lokale herkenning op het apparaat. Op macOS en Windows werkt het Whisper-model, en voor Macs met Apple Silicon-chips kun je het geoptimaliseerde Parakeet-model aansluiten.
- Opmaak via LLM. Ruwe dictaten zijn vaak vol met vulwoorden en vreemde pauzes. De app kan draft-tekst doorsturen naar OpenAI, Anthropic, Gemini of elk aangepast lokaal eindpunt om een nette en bewerkte paragraaf als output te produceren.
- Transcriptie van bestaande media-bestanden. Je kunt een audio- of videobestand neerzetten en een teksttranscript krijgen.
- Opnamegeschiedenis. Alle transcripties worden in de interface opgeslagen met metadata, zodat je het oorspronkelijke tekst met de bewerkte versie kunt vergelijken of de opname kunt terugluisteren.
- Servermodus via lokaal netwerk. Als je een krachtige grafische kaart op één computer hebt, kun je Voicetypr instellen als lokale transcriptieserver en audio verzenden vanaf een minder krachtige laptop.
Trouwens, als lokale kracht niet genoeg is, kun je in de instellingen overschakelen naar cloudherkenningsdiensten: Groq, Deepgram, OpenAI, Soniox of Cohere. Maar het hele punt van Voicetypr is dat de audiostroom standaard je computer nooit verlaat.
CLI voor automatisering en lokale agents
Een interessant detail dat ontwikkelaars zelden bedenken in vergelijkbare GUI-hulpprogramma's: Voicetypr wordt geleverd met een ingebouwde console-interface.
De opdracht kan rechtstreeks vanuit de programma-instellingen worden geïnstalleerd. Dit maakt het mogelijk om de herkenningsengine aan te roepen vanuit bash-scripts of verbinding te maken met lokale AI-agents:
# Проверить статус приложения
voicetypr status --json
# Посмотреть доступные модели
voicetypr models --json
# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json
# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json
De --json-vlag retourneert een gestructureerd antwoord, dus het resultaat is gemakkelijk te parseren met standaard jq of verder in de pipeline te voeren.
Hoe het onder de motorkap werkt
De app-stack is vrij pragmatisch opgebouwd. De auteur koos voor Tauri v2 en Rust voor zware systeemwerkzaamheden, en schreef de interface in React 19, TypeScript, Tailwind CSS en shadcn/ui.
Al het werk van het onderscheppen van hotkeys, het vastleggen van de microfoon, het hersamplen van audio en het emuleren van invoer naar het actieve venster ligt volledig op het Rust-backend. Dit gaf snelle respons en bescheiden RAM-verbruik vergeleken met typische Electron-apps.
Op Windows kan lokaal Whisper Vulkan gebruiken voor GPU-versnelling. En dit proces is geïsoleerd in een aparte sidecar. Als er iets misgaat met het videostuurprogramma, schakelt de app gewoon stil over naar CPU-berekeningen zonder het hoofdprogramma te laten crashen.
Hoe te bouwen en uit te voeren
Als je het project zelf vanaf de broncode wilt bouwen, heb je Node.js met de pnpm-pakketbeheerder nodig, de Rust-toolchain en basisbouwtools voor je besturingssysteem (Xcode CLI op macOS of Visual Studio Build Tools op Windows).
Bouwen wordt gestart met standaardopdrachten:
git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev
Er zijn ook kant-en-klare tests en linters in de repository:
pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate
Voor degenen die niet handmatig willen compileren, zijn ondertekende DMG-pakketten voor macOS en installatieprogramma's voor Windows 10/11 beschikbaar in de GitHub-releases en op de officiële website.
Waarom een ontwikkelaar dit nodig heeft
Allereerst zal Voicetypr van pas komen voor degenen die veel tekst schrijven: documentatie onderhouden, taken opstellen in issue trackers, of communiceren met neurale netwerken in Cursor en Claude Dev. Complexe context dicteren met je stem in twintig seconden is veel gemakkelijker dan vijf paragrafen met de hand typen.
Het tweede voor de hand liggende scenario is privacy. Als je met NDA's werkt of gewoon geen opnames van je stem wilt overdragen aan derden, lost de combinatie van lokaal Whisper en lokale inferentie via Ollama dit probleem volledig op.
Het project heeft momenteel relatief weinig sterren op GitHub, maar de codebase ziet er schoon uit en de Tauri met Rust-combinatie werkt snel. Het is zeker de moeite waard om te proberen, vooral als je op zoek bent naar een gratis vervanging voor proprietaire dicteer-apps.
Gerelateerde projecten