Cómo Convertir la Voz en Código y Notas Sin Nubes y Ojos Indiscretos
Imagina: estás en una llamada, las ideas vuelan rápido, y escribirlas manualmente significa perder el ritmo. O otra situación: necesitas redactar documentación rápidamente, pero tus dedos ya están cansados de escribir. ¿Te suena familiar? Por lo general, en momentos como estos recurrimos a servicios de pago que envían tus datos de audio a sus servidores, los analizan y posiblemente entrenan sus modelos con ellos.
Hace poco descubrí OpenWhispr. Es un proyecto de código abierto que intenta resolver el problema del dictado y la transcripción para usuarios normales. La característica principal aquí es la privacidad: todo puede ejecutarse localmente en tu hardware, ya sea un MacBook con chip M o una máquina Linux con GPU NVIDIA.
Qué puede hacer esta herramienta
OpenWhispr no es solo un wrapper alrededor de un modelo de reconocimiento de voz. Es una aplicación de escritorio completa basada en Electron que se integra en tu flujo de trabajo.
Dictado justo en el cursor
El escenario más simple: presionas una tecla de acceso rápido, dictas texto y aparece inmediatamente en la ventana activa. Ya sea VS Code, Slack o un navegador. Incluso hay una función separada para traducción en tiempo real: hablas en un idioma y se inserta el texto en otro.
Reuniones inteligentes y reconocimiento de hablantes
El proyecto puede detectar automáticamente llamadas en Zoom, Teams o FaceTime. Pero lo más interesante aquí es la diarización local. El programa recuerda las "huellas dactilares" de voz y etiqueta quién dijo qué, sin enviar la grabación a la nube. Si frecuentemente vuelves a escuchar grabaciones de reuniones para recordar quién prometió corregir ese error para el miércoles, esto te ahorrará mucho tiempo.
Agentes de IA a tu alcance
Incluye agentes que puedes controlar con comandos de voz. Puedes conectar pesos pesados como GPT-4 o Claude a través de API, o usar modelos locales a través de llama.cpp. Presionas un botón, preguntas "escribe un breve resumen de este texto" y el agente entrega el resultado.
Detalles técnicos
Los desarrolladores han armado un stack bastante sólido. La base es React 19 y Tailwind CSS v4 para la interfaz, con Electron 41 como motor.
Para la magia de voz, utilizan:
- whisper.cpp para reconocimiento de alto rendimiento en C++.
- NVIDIA Parakeet y sherpa-onnx para quienes prefieren velocidad GPU.
- better-sqlite3 para almacenar notas y transcripciones.
Curiosamente, el proyecto soporta aceleración Metal en macOS, CUDA en NVIDIA, e incluso Vulkan para GPUs AMD e Intel. Esto significa que la transcripción local no se arrastrará para siempre.
Cómo ejecutarlo
Si no quieres complicarte compilando desde el código fuente, tienen builds listos para todas las plataformas. Pero somos desarrolladores, queremos poner manos a la obra con el código. Para ejecutar desde el código fuente, necesitarás Node.js 24+.
git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev
Por cierto, el proyecto tiene su propio servidor MCP (Model Context Protocol). Esto te permite conectar tus notas y transcripciones directamente a tu asistente de IA favorito como contexto externo.
A quién le será útil
Veo varias categorías de personas que apreciarán OpenWhispr:
- Desarrolladores que mantienen muchos registros o notas y quieren hacerlo más rápido.
- Líderes de equipo que necesitan capturar los resultados de reuniones sin involucrar servicios de espionaje de terceros.
- Paranoicos (en el buen sentido) que valoran las soluciones autoalojadas y la privacidad de datos.
El proyecto parece muy activo: casi 5,000 estrellas en GitHub y commits constantes. Por supuesto, Electron consumirá bastante RAM, y los modelos locales pondrán carga en la CPU, pero es un precio justo por mantener tus conversaciones solo en tu disco.
Si has estado buscando una alternativa gratuita y de código abierto a los servicios de dictado propietarios, OpenWhispr definitivamente vale la pena pasar una tarde probándolo en condiciones reales.
Proyectos relacionados