将语音转换为代码和笔记——无需云端,隐私无忧
想象一下:你正在通话,灵感飞速涌现,手动记录意味着打断思路。或者另一种情况:你需要快速起草一些文档,但手指已经敲键盘敲累了。是不是很熟悉?通常在这种情况下,我们会转向付费服务,它们会将你的音频数据发送到服务器进行分析,甚至可能用于训练模型。
最近我发现了 OpenWhispr。这是一个开源项目,旨在为普通用户解决语音输入和转录问题。其主要特点是隐私保护:所有功能都可以在你的硬件上本地运行,无论是配备 M 芯片的 MacBook 还是配备 NVIDIA GPU 的 Linux 机器。
这个工具能做什么
OpenWhispr 不仅仅是一个语音识别模型的包装器。它是一个功能完善的 Electron 桌面应用程序,可以集成到你的工作流程中。
光标处直接听写
最简单场景:按下热键,输入文字,它会立即出现在活动窗口中。无论是 VS Code、Slack 还是浏览器。甚至还有一个实时翻译功能——说一种语言,另一种语言的文字就会被插入。
智能会议和说话人识别
该项目可以自动检测 Zoom、Teams 或 FaceTime 中的通话。但最酷的是本地说话人分离。程序会记住声音"指纹"并标记谁说了什么,而无需将录音发送到云端。如果你经常重新听取会议录音来记住谁承诺在周三之前修复那个 bug,这将节省大量时间。
触手可及的 AI 代理
其中包含可以通过语音命令控制的代理。你可以通过 API 连接 GPT-4 或 Claude 这样的重量级模型,或通过 llama.cpp 使用本地模型。按下按钮,问"写一个简短的摘要",代理就会交付结果。
技术内幕
开发者们组合了一个相当扎实的技术栈。界面基于 React 19 和 Tailwind CSS v4,底层使用 Electron 41。
语音处理方面,他们使用:
- whisper.cpp 用于高性能 C++ 识别。
- NVIDIA Parakeet 和 sherpa-onnx,适合喜欢 GPU 速度的用户。
- better-sqlite3 用于存储笔记和转录内容。
有趣的是,该项目支持 macOS 上的 Metal 加速、NVIDIA 上的 CUDA,甚至支持 AMD 和 Intel GPU 的 Vulkan。这意味着本地转录不会没完没了。
如何运行
如果你不想处理从源码构建,他们为所有平台都提供了现成的构建版本。但我们都是开发者,想要亲手接触代码。要从源码运行,你需要 Node.js 24+。
git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev
顺便说一句,该项目有自己的 MCP 服务器(Model Context Protocol)。这让你可以将笔记和转录内容直接连接到你喜欢的 AI 助手中作为外部上下文。
谁会需要这个
我认为有几类人会喜欢 OpenWhispr:
- 需要记录大量日志或笔记并希望更快完成的开发者。
- 需要记录会议结果但不想使用第三方"窃听"服务的团队负责人。
- 重视自托管解决方案和数据隐私的"偏执狂"(褒义)。
这个项目看起来非常有活力:GitHub 上有近 5000 颗星,而且提交活跃。当然,Electron 会占用相当多的内存,本地模型也会给 CPU 带来负载,但这是让你的对话只保存在自己磁盘上的合理代价。
如果你一直在寻找专有语音输入服务的免费开源替代品,OpenWhispr 绝对值得花一个晚上在真实环境中测试。
相关项目