Jak nauczyć Claude Code oglądać filmy i rozumieć, co dzieje się na ekranie

Wczoraj próbowałem wyjaśnić Claude Code dokładnie, kiedy utilita zwraca błąd w nagraniu ekranu. Musiałem ręcznie zrobić zrzut ekranu, przyciąć odpowiedni fragment i wrzucić plik do czatu. Gdy jest dużo błędów lub problem pojawia się w dziesiątej minucie nagrania ze spotkania, to ręczne podejście szybko się męczy.
Większość modeli językowych nie może bezpośrednio strumieniować ani odczytywać dużych plików MP4. Reppozytorium claude-video-vision od developera Jordana Vasconcelosa rozwiązuje to elegancko. To jednocześnie wtyczka do Claude Code i serwer MCP, działający jako warstwa percepcji. Konwertuje wideo na zestaw klatek i transkrybowany tekst z timestampami, a następnie przesyła wszystko do sieci neuronowej.
Jak to działa pod maską
Przepływ pracy jest dość prosty. Całą techniczną pracę związaną z cięciem i wyodrębnianiem danych mediów obsługuje serwer MCP Node.js.
Gdy poprosisz Claude o analizę wideo, uruchamiają się dwa równoległe procesy:
- ffmpeg tnie klatki w formacie JPEG, PNG lub WebP i koduje je do base64.
- Backend audio pobiera ścieżkę dźwiękową i konwertuje ją na tekstową transkrypcję z timestampami.
Następnie Claude otrzymuje gotowy zestaw obrazów i tekstu chronologicznego. Ciekawy szczegół: model sam decyduje, jaką częstotliwość klatek i rozdzielczość użyć do cięcia wideo.
Jeśli zapytasz „Co jest napisane na tablicy w 90. sekundzie?
Powiązane projekty