>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
JavaScript

Como Transformar Voz em Código e Notas Sem Nuvens e Olhos Indiscretos

Imagine: você está em uma ligação, as ideias estão voando rápido, e anotá-las manualmente significa perder o ritmo. Ou outra situação: você precisa rascunhar rapidamente uma documentação, mas seus dedos já estão cansados de digitar. Soa familiar? Geralmente em momentos assim, recorremos a serviços pagos que enviam seus dados de áudio para seus servidores, analisam e possivelmente treinam seus modelos com eles.

Recentemente encontrei o OpenWhispr. É um projeto de código aberto que tenta resolver o problema de ditado e transcrição para usuários comuns. O recurso principal aqui é a privacidade: tudo pode funcionar localmente no seu hardware, seja um MacBook com chip M ou uma máquina Linux com GPU NVIDIA.

OpenWhispr

O que essa ferramenta pode fazer

OpenWhispr não é apenas um wrapper em torno de um modelo de reconhecimento de fala. É uma aplicação desktop completa em Electron que se integra ao seu fluxo de trabalho.

Ditado bem no cursor

O cenário mais simples: você pressiona um atalho de teclado, dita o texto e ele aparece imediatamente na janela ativa. Seja VS Code, Slack ou navegador. Há até um recurso separado para tradução em tempo real — fale em um idioma e o texto em outro é inserido.

Reuniões inteligentes e reconhecimento de locutor

O projeto pode detectar automaticamente chamadas no Zoom, Teams ou FaceTime. Mas o recurso mais interessante aqui é a diarização local. O programa lembra "impressões digitais" de vozes e rotula quem disse o quê, sem enviar a gravação para a nuvem. Se você costuma ouvir novamente gravações de reuniões para lembrar quem prometeu corrigir aquele bug até quarta-feira, isso vai economizar muito tempo.

Agentes de IA ao seu alcance

Dentro existem agentes que você pode controlar com comandos de voz. Você pode conectar pesos pesados como GPT-4 ou Claude via API, ou usar modelos locais através do llama.cpp. Pressione um botão, pergunte "escreva um breve resumo deste texto", e o agente entrega o resultado.

Detalhes técnicos

Os desenvolvedores montaram uma stack bastante sólida. A base é React 19 e Tailwind CSS v4 para a interface, com Electron 41 por baixo.

Para a mágica de voz, eles usam:

  • whisper.cpp para reconhecimento C++ de alto desempenho.
  • NVIDIA Parakeet e sherpa-onnx para quem prefere velocidade de GPU.
  • better-sqlite3 para armazenar notas e transcrições.

Curiosamente, o projeto suporta aceleração Metal no macOS, CUDA na NVIDIA e até Vulkan para GPUs AMD e Intel. Isso significa que a transcrição local não vai demorar uma eternidade.

Como executar

Se você não quer lidar com compilação a partir do código-fonte, eles têm builds prontos para todas as plataformas. Mas somos desenvolvedores aqui, queremos colocar as mãos no código. Para executar a partir do código-fonte, você vai precisar de Node.js 24+.

git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev

A propósito, o projeto tem seu próprio servidor MCP (Model Context Protocol). Isso permite conectar suas notas e transcrições diretamente ao seu assistente de IA favorito como contexto externo.

Para quem isso será útil

Vejo várias categorias de pessoas que vão apreciar o OpenWhispr:

  1. Desenvolvedores que mantêm muitos logs ou notas e querem fazer isso mais rápido.
  2. Líderes de equipe que precisam capturar os resultados de reuniões sem envolver serviços espiões de terceiros.
  3. Paranóicos (no bom sentido) que valorizam soluções auto-hospedadas e privacidade de dados.

O projeto parece bastante ativo: quase 5.000 estrelas no GitHub e commits ativos. Claro, o Electron vai consumir uma boa quantidade de RAM, e modelos locais vão colocar carga na CPU, mas esse é um preço justo por manter suas conversas apenas no seu disco.

Se você tem procurado uma alternativa gratuita e aberta aos serviços de ditado proprietários, o OpenWhispr definitivamente vale a pena passar uma noite testando em condições reais.

Projetos relacionados