Transcrição de voz para texto local bem no cursor com Voicetypr
Frequentemente me pego pensando que digitar longos prompts para redes neurais ou comentários detalhados em pull requests é simplesmente muito tedioso. Meus dedos ficam cansados, os pensamentos se embaralham e não tenho vontade de reler o rascunho. A entrada de voz parece resolver esse problema, mas as ferramentas padrão do sistema em macOS e Windows não funcionam tão bem. Utilitários de nuvem de terceiros como Wispr Flow exigem uma assinatura e roteiam toda a sua voz através de servidores externos, o que é imediatamente descartado para código confidencial ou chats relacionados ao trabalho.
Recentemente encontrei um projeto interessante chamado Voicetypr. É um aplicativo desktop de código aberto sob a licença AGPL-3.0 que insere o discurso reconhecido diretamente onde o cursor está piscando. E faz isso completamente localmente na sua máquina.
O que o aplicativo pode fazer
A ideia principal é simples: pressione um atalho global, dite o texto no microfone, solte a tecla e as frases prontas aparecem imediatamente no campo de entrada ativo. Seja no editor VS Code, terminal, mensageiro ou navegador.
Aqui estão algumas coisas que o autor empacotou neste utilitário:
- Reconhecimento no dispositivo. No macOS e Windows, o modelo Whisper funciona, e para Macs com chips Apple Silicon você pode conectar o modelo Parakeet otimizado.
- Formatação via LLM. A diktação bruta geralmente está cheia de palavras de preenchimento e pausas estranhas. O aplicativo pode passar o texto rascunho pelo OpenAI, Anthropic, Gemini ou qualquer endpoint local personalizado para produzir um parágrafo limpo e editado na saída.
- Transcrição de arquivos de mídia existentes. Você pode soltar um arquivo de áudio ou vídeo e obter uma transcrição de texto.
- Histórico de gravações. Todas as transcrições são salvas na interface com metadados, para que você possa comparar o texto original com a versão editada ou reproduzir a gravação.
- Modo servidor na rede local. Se você tiver uma placa de vídeo potente em um computador, pode configurar o Voicetypr como um servidor de transcrição local e enviar áudio de um laptop menos potente.
A propósito, se a potência local não for suficiente, você pode alternar para serviços de reconhecimento em nuvem nas configurações: Groq, Deepgram, OpenAI, Soniox ou Cohere. Mas todo o sentido do Voicetypr é que, por padrão, o fluxo de áudio nunca sai do seu computador.
CLI para automação e agentes locais
Um detalhe interessante que desenvolvedores raramente pensam em utilitários GUI semelhantes: o Voicetypr vem com uma interface de console integrada.
O comando pode ser instalado diretamente das configurações do programa. Isso torna possível chamar o mecanismo de reconhecimento de scripts bash ou conectar a agentes de IA locais:
# Проверить статус приложения
voicetypr status --json
# Посмотреть доступные модели
voicetypr models --json
# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json
# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json
O flag --json retorna uma resposta estruturada, então o resultado é fácil de analisar com jq padrão ou alimentar mais adiante no pipeline.
Como funciona nos bastidores
A pilha do aplicativo é construída de forma bastante pragmática. O autor escolheu Tauri v2 e Rust para trabalho pesado do sistema e escreveu a interface em React 19, TypeScript, Tailwind CSS e shadcn/ui.
Todo o trabalho de interceptar hotkeys, capturar microfone, reamostrar áudio e emular entrada para a janela ativa fica inteiramente no backend Rust. Isso proporcionou resposta rápida e consumo modesto de RAM em comparação com aplicativos Electron típicos.
No Windows, o Whisper local pode usar Vulkan para aceleração de GPU. E esse processo é isolado em um sidecar separado. Se algo der errado com o driver de vídeo, o aplicativo simplesmente alterna silenciosamente para cálculos na CPU sem travar o programa principal.
Como compilar e executar
Se você quiser compilar o projeto do zero, precisará do Node.js com o gerenciador de pacotes pnpm, o toolchain Rust e ferramentas de compilação básicas para seu sistema operacional (Xcode CLI no macOS ou Visual Studio Build Tools no Windows).
A compilação é iniciada com comandos padrão:
git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev
Também existem testes e linters prontos no repositório:
pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate
Para quem não quer compilar manualmente, pacotes DMG assinados para macOS e instaladores para Windows 10/11 estão disponíveis nos lançamentos do GitHub e no site oficial.
Por que um desenvolvedor precisa disso
Antes de mais nada, o Voicetypr será útil para quem escreve muito texto: manter documentação, rascunhar tarefas em rastreadores de issues ou se comunicar com redes neurais no Cursor e Claude Dev. Ditar contexto complexo por voz em vinte segundos é muito mais fácil do que digitar cinco parágrafos manualmente.
O segundo cenário óbvio é a privacidade. Se você trabalha com NDAs ou simplesmente não quer entregar gravações da sua voz para empresas terceiras, a combinação de Whisper local e inferência local via Ollama resolve completamente esse problema.
O projeto atualmente tem relativamente poucas estrelas no GitHub, mas a base de código parece limpa e a combinação Tauri com Rust funciona rápido. Definitivamente vale a pena experimentar, especialmente se você tem procurado uma替代 gratuita para aplicativos de diktação proprietários.
Projetos relacionados