>_ DevTrendsfr

Langue

Accueil

Langages

Sections

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarqué Sécurité
Rust

Dictée vocale locale directement au curseur avec Voicetypr

Voicetypr app icon

Je me surprends souvent à penser que taper de longues invites pour les réseaux de neurones ou des commentaires détaillés sur les pull requests est tout simplement trop fastidieux. Mes doigts se fatiguent, les pensées s'emmêlent, et je n'ai pas envie de relire le brouillon. La saisie vocale semble résoudre ce problème, mais les outils système standard de macOS et Windows ne fonctionnent pas très bien. Les utilitaires cloud tiers comme Wispr Flow nécessitent un abonnement et acheminent toute votre voix via des serveurs externes, ce qui est immédiatement exclu pour du code confidentiel ou des discussions professionnelles.

Récemment, je suis tombé sur un projet intéressant appelé Voicetypr. C'est une application de bureau open-source sous licence AGPL-3.0 qui insère la reconnaissance vocale directement là où le curseur clignote. Et elle le fait entièrement en local sur votre machine.

Ce que l'application peut faire

L'idée principale est simple : appuyez sur un raccourci global, dictez dans le microphone, relâchez la touche, et les phrases terminées apparaissent immédiatement dans le champ de saisie actif. Que ce soit l'éditeur VS Code, le terminal, un messager ou le navigateur.

Voici quelques fonctionnalités que l'auteur a intégrées dans cet utilitaire :

  • Reconnaissance sur appareil. Sur macOS et Windows, le modèle Whisper fonctionne, et pour les Macs équipés de puces Apple Silicon, vous pouvez connecter le modèle Parakeet optimisé.
  • Formatage via LLM. La dictée brute est souvent pleine de mots de remplissage et de pauses étranges. L'application peut passer le texte brut par OpenAI, Anthropic, Gemini ou n'importe quel point de terminaison local personnalisé pour produire un paragraphe propre et редактированный en sortie.
  • Transcription de fichiers multimédias existants. Vous pouvez déposer un fichier audio ou vidéo et obtenir une transcription textuelle.
  • Historique des enregistrements. Toutes les transcriptions sont enregistrées dans l'interface avec des métadonnées, vous pouvez donc comparer le texte original avec la version éditée ou rejouer l'enregistrement.
  • Mode serveur sur réseau local. Si vous avez une carte graphique puissante sur un ordinateur, vous pouvez configurer Voicetypr comme serveur de transcription local et envoyer l'audio depuis un ordinateur moins puissant.

Au fait, si la puissance locale ne suffit pas, vous pouvez basculer vers les services de reconnaissance cloud dans les paramètres : Groq, Deepgram, OpenAI, Soniox ou Cohere. Mais le but même de Voicetypr est que par défaut, le flux audio ne quitte jamais votre ordinateur.

CLI pour l'automatisation et les agents locaux

Un détail intéressant que les développeurs réfléchissent rarement dans les utilitaires GUI similaires : Voicetypr est livré avec une interface console intégrée.

La commande peut être installée directement depuis les paramètres du programme. Cela permet d'appeler le moteur de reconnaissance depuis des scripts bash ou de se connecter à des agents IA locaux :

# Проверить статус приложения
voicetypr status --json

# Посмотреть доступные модели
voicetypr models --json

# Расшифровать аудиофайл и получить структурированный JSON
voicetypr transcribe --file note.wav --json

# Записать голос с микрофона до наступления тишины
voicetypr record --until-silence --json

Le flag --json retourne une réponse structurée, le résultat est donc facile à parser avec jq standard ou à transmettre plus loin dans le pipeline.

Comment ça fonctionne en coulisses

La pile technique de l'application est construite de manière assez pragmatique. L'auteur a choisi Tauri v2 et Rust pour le travail système intensif, et a écrit l'interface en React 19, TypeScript, Tailwind CSS et shadcn/ui.

Tout le travail d'interception des raccourcis, de capture du microphone, de rééchantillonnage audio et d'émulation de la saisie dans la fenêtre active repose entièrement sur le backend Rust. Cela a permis d'obtenir une réponse rapide et une consommation de RAM modeste par rapport aux applications Electron typiques.

Sur Windows, Whisper local peut utiliser Vulkan pour l'accélération GPU. Et ce processus est isolé dans un sidecar séparé. Si quelque chose ne va pas avec le pilote vidéo, l'application passe simplement silencieusement aux calculs CPU sans planter le programme principal.

Comment compiler et exécuter

Si vous souhaitez compiler le projet vous-même à partir des sources, vous aurez besoin de Node.js avec le gestionnaire de paquets pnpm, la Rust toolchain et les outils de build de base pour votre système d'exploitation (Xcode CLI sur macOS ou Visual Studio Build Tools sur Windows).

La compilation est lancée avec les commandes standard :

git clone https://github.com/moinulmoin/voicetypr.git
cd voicetypr
pnpm install
pnpm tauri:dev

Il y a aussi des tests et des linters prêts à l'emploi dans le dépôt :

pnpm lint
pnpm test
pnpm test:backend
pnpm quality-gate

Pour ceux qui ne veulent pas compiler manuellement, des paquets DMG signés pour macOS et des installateurs pour Windows 10/11 sont disponibles dans les releases GitHub et sur le site officiel.

Pourquoi un développeur en a besoin

Avant tout, Voicetypr sera utile pour ceux qui écrivent beaucoup de texte : maintenir la documentation, rédiger des tâches dans les issue trackers ou communiquer avec les réseaux de neurones dans Cursor et Claude Dev. Dicter un contexte complexe à la voix en vingt secondes est beaucoup plus facile que de taper cinq paragraphes à la main.

Le deuxième scénario évident est la confidentialité. Si vous travaillez avec des NDA ou si vous ne voulez tout simplement pas confier des enregistrements de votre voix à des entreprises tierces, la combinaison de Whisper local et de l'inférence locale via Ollama résout complètement ce problème.

Le projet a actuellement relativement peu d'étoiles sur GitHub, mais la base de code semble propre et la combinaison Tauri avec Rust fonctionne rapidement. Cela vaut définitivement le coup de l'essayer, surtout si vous cherchez un remplacement gratuit pour les applications de dictée propriétaires.

Projets similaires