>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
JavaScript

Jak zamienić głos na kod i notatki bez chmur i wścibskich oczu

Wyobraź sobie: jesteś na rozmowie telefonicznej, pomysły lecą szybko, a ręczne ich spisywanie oznacza utratę rytmu. Albo inna sytuacja: musisz szybko napisać dokumentację, ale twoje palce są już zmęczone od pisania. Brzmi znajomo? Zazwyczaj w takich momentach sięgamy po płatne usługi, które wysyłają nasze dane audio na ich serwery, analizują je i prawdopodobnie trenują na nich swoje modele.

Ostatnio natknąłem się na OpenWhispr. To open-source'owy projekt, który próbuje rozwiązać problem dyktowania i transkrypcji dla zwykłych użytkowników. Główną cechą jest tutaj prywatność: wszystko może działać lokalnie na twoim sprzęcie, czy to MacBook z chipem M, czy maszyna z Linuksem i kartą NVIDIA GPU.

OpenWhispr

Co potrafi to narzędzie

OpenWhispr to nie tylko wrapper wokół modelu rozpoznawania mowy. To pełnoprawna aplikacja desktopowa na Electron, która integruje się z twoim workflow.

Dyktowanie bezpośrednio przy kursorem

Najprostszy scenariusz: naciskasz skrót klawiszowy, dyktujesz tekst, a on natychmiast pojawia się w aktywnym oknie. Niezależnie od tego, czy to VS Code, Slack, czy przeglądarka. Jest nawet osobna funkcja do tłumaczenia w locie — mówisz w jednym języku, a tekst w innym jest wstawiany.

Inteligentne spotkania i rozpoznawanie mówców

Projekt może automatycznie wykrywać rozmowy w Zoom, Teams lub FaceTime. Ale najciekawsze jest tutaj lokalne diarowanie. Program zapamiętuje "odciski głosu" i etykietuje, kto co powiedział, bez wysyłania nagrania do chmury. Jeśli często przysłuchujesz się nagraniom ze spotkań, żeby przypomnieć sobie, kto obiecał naprawić tego buga do środy, to zaoszczędzi mnóstwo czasu.

Agenci AI pod ręką

W środku są agenci, którymi możesz sterować za pomocą poleceń głosowych. Możesz podłączyć ciężkie sztuki jak GPT-4 czy Claude przez API, albo użyć lokalnych modeli przez llama.cpp. Nosisz przycisk, pytasz "napisz krótkie podsumowanie tego tekstu", a agent dostarcza wynik.

Wnętrze techniczne

Deweloperzy złożyli całkiem solidny stack. Fundament to React 19 i Tailwind CSS v4 dla interfejsu, z Electron 41 pod maską.

Do magii głosowej używają:

  • whisper.cpp do wysokowydajnego rozpoznawania w C++.
  • NVIDIA Parakeet i sherpa-onnx dla tych, którzy wolą szybkość GPU.
  • better-sqlite3 do przechowywania notatek i transkrypcji.

Ciekawe jest to, że projekt wspiera akcelerację Metal na macOS, CUDA na NVIDIA, a nawet Vulkan dla kart AMD i Intel. To oznacza, że lokalna transkrypcja nie będzie trwała wiecznie.

Jak to uruchomić

Jeśli nie chcesz bawić się w kompilację ze źródeł, mają gotowe buildy na wszystkie platformy. Ale my jesteśmy deweloperami, chcemy sięgnąć do kodu. Żeby uruchomić ze źródeł, potrzebujesz Node.js 24+.

git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev

Przy okazji, projekt ma własny serwer MCP (Model Context Protocol). Pozwala to podłączyć twoje notatki i transkrypcje bezpośrednio do twojego ulubionego asystenta AI jako zewnętrzny kontekst.

Kto to doceni

Widzę kilka kategorii ludzi, którzy docenią OpenWhispr:

  1. Deweloperzy, którzy prowadzą dużo logów czy notatek i chcą robić to szybciej.
  2. Team leadzi, którzy muszą przechwytywać efekty spotkań bez angażowania zewnętrznych szpiegowskich usług.
  3. Paranoidy (w dobrym sensie), którzy cenią rozwiązania self-hosted i prywatność danych.

Projekt wygląda bardzo żywotnie: prawie 5000 gwiazdek na GitHub i aktywne commity. Oczywiście Electron zje sporo RAM-u, a lokalne modele obciążą CPU, ale to uczciwa cena za trzymanie rozmów tylko na twoim dysku.

Jeśli szukałeś darmowej i otwartej alternatywy dla zastrzeżonych usług dyktowania, OpenWhispr zdecydowanie wart jest spędzenia wieczoru na przetestowaniu w realnych warunkach.

Powiązane projekty