>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
TypeScript

Jak nauczyć Claude Code oglądać filmy i rozumieć, co dzieje się na ekranie

claude-video-vision

Wczoraj próbowałem wyjaśnić Claude Code dokładnie, kiedy utilita zwraca błąd w nagraniu ekranu. Musiałem ręcznie zrobić zrzut ekranu, przyciąć odpowiedni fragment i wrzucić plik do czatu. Gdy jest dużo błędów lub problem pojawia się w dziesiątej minucie nagrania ze spotkania, to ręczne podejście szybko się męczy.

Większość modeli językowych nie może bezpośrednio strumieniować ani odczytywać dużych plików MP4. Reppozytorium claude-video-vision od developera Jordana Vasconcelosa rozwiązuje to elegancko. To jednocześnie wtyczka do Claude Code i serwer MCP, działający jako warstwa percepcji. Konwertuje wideo na zestaw klatek i transkrybowany tekst z timestampami, a następnie przesyła wszystko do sieci neuronowej.

Jak to działa pod maską

Przepływ pracy jest dość prosty. Całą techniczną pracę związaną z cięciem i wyodrębnianiem danych mediów obsługuje serwer MCP Node.js.

Gdy poprosisz Claude o analizę wideo, uruchamiają się dwa równoległe procesy:

  1. ffmpeg tnie klatki w formacie JPEG, PNG lub WebP i koduje je do base64.
  2. Backend audio pobiera ścieżkę dźwiękową i konwertuje ją na tekstową transkrypcję z timestampami.

Następnie Claude otrzymuje gotowy zestaw obrazów i tekstu chronologicznego. Ciekawy szczegół: model sam decyduje, jaką częstotliwość klatek i rozdzielczość użyć do cięcia wideo.

Jeśli zapytasz „Co jest napisane na tablicy w 90. sekundzie?

Powiązane projekty