>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
TypeScript

Hoe je Claude Code leert om video's te bekijken en te begrijpen wat er op het scherm gebeurt

claude-video-vision

Gisteren probeerde ik Claude Code precies uit te leggen wanneer een utility een fout gooit in een schermopname. Ik moest handmatig een screenshot maken, het relevante gebied bijsnijden en het bestand in de chat slepen. Wanneer er veel bugs zijn of het probleem zich voordoet op minuut tien van een vergaderopname, wordt deze handmatige aanpak snel vervelend.

De meeste taalmodellen kunnen geen zware MP4-bestanden direct streamen of lezen. Repository claude-video-vision van ontwikkelaar Jordan Vasconcelos lost dit elegant op. Het is een plugin voor Claude Code en een MCP-server tegelijk, die fungeert als een perceptielaag. Het zet video om in een set frames en getranscribeerde tekst met tijdstemppen, en voert alles vervolgens aan het neurale netwerk.

Hoe het onder de motorkap werkt

De workflow hier is vrij straightforward. Al het technische werk van het slicen en extraheren van media data wordt afgehandeld door de Node.js MCP-server.

Wanneer je Claude vraagt om een video te analyseren, starten twee parallelle processen:

  1. ffmpeg snijdt frames in JPEG, PNG of WebP-formaat en codeert ze naar base64.
  2. Audio backend neemt het geluidsspoor en zet het om naar een teksttranscriptie met tijdstemppen.

Vervolgens ontvangt Claude een kant-en-klare set afbeeldingen en chronologische tekst. Een interessant detail: het model beslist zelf welke frame rate en resolutie het gebruikt voor het slicen van de video.

Als je vraagt "Wat staat er op het bord bij de 90 seconden markering?", zal de plugin niet de hele uur durende video verwerken. Het model zal hoge-resolutie frames met frequente intervallen opvragen specifiek voor het segment van 01:25 tot 01:35. Als je vraagt om een kort overzicht van de hele lezing, zal de plugin de frame rate verlagen en spaarzame previews verzamelen over de gehele duur.

Onder de motorkap: backend-opties

Voor audioverwerking heeft de auteur drie opties gegeven om uit te kiezen:

  • Gemini API. De gratis limiet van 15.000 requests per dag dekt de meeste taken en verwerkt niet alleen spraak maar ook achtergrondgeluiden. Je hebt alleen een API-key nodig.
  • Lokale Whisper. Werkt via whisper.cpp of Python-package openai-whisper. Draait volledig offline en de benodigde modellen downloaden automatisch bij de eerste start.
  • OpenAI API. Maakt gebruik van OpenAI's betaalde Whisper API als je geen lokale processor wilt laden en geen account wilt aanmaken in Google AI Studio.

Het vermelden waard is de YouTube-ondersteuning apart. Als je een videolink doorgeeft, downloadt de plugin deze via yt-dlp. De server probeert eerst handmatige ondertitels op te halen. Als die niet beschikbaar zijn, haalt het YouTube's automatisch gegenereerde captions op. Als ondertitels ontbreken of te gefragmenteerd zijn, schakelt de geselecteerde audio-backend in. Claude ziet de transcriptiebron en begrijpt het nauwkeurigheidsniveau van de tekst.

Setup en eerste commando's

De plugin installeert direct in een Claude Code-sessie. Voer gewoon de commando's sequentieel uit:

/plugin marketplace add https://github.com/jordanrendric/claude-video-vision
/plugin install claude-video-vision

Na de installatie start een interactieve setup-wizard:

/claude-video-vision:setup-video-vision

De wizard controleert op ffmpeg, laat je een audio-backend kiezen en downloadt het Whisper-model als je de offline modus hebt geselecteerd. Configuratie wordt opgeslagen in ~/.claude-video-vision/config.json. Daar kun je de standaard frame-resolutie instellen, afbeeldingsformaat (PNG is bijvoorbeeld handig voor scherpe tekst in screenshots) en het maximale aantal frames per request.

Je kunt met de plugin werken via speciale commando's of in een normale chat-formaat:

/watch-video ~/Downloads/demo.mp4 "какой язык программирования используется в туториале?"
/watch-video https://www.youtube.com/watch?v=... "сделай краткое содержание"

Of typ gewoon in de chat:

Bekijk de eerste seconde van de bug van ~/videos/bug-report.mov en vertel me wat er misging.

Waar dit van pas komt

Het tool dekt verschillende veelvoorkomende ontwikkeltaken:

  1. Bug report-analyse. Een gebruiker of QA-engineer heeft een schermopname gestuurd. In plaats van de video opnieuw te bekijken, kun je het bestand naar Claude droppen en vragen welke fout verscheen in de console bij de derde seconde.
  2. Aantekeningen maken bij talks en tutorials. Je kunt een link naar een uur durende YouTube-presentatie droppen en een gestructureerd overzicht krijgen met tijdstemppen en screenshots van belangrijke dia's.
  3. UI-animatie-review. Wanneer frames in lossless PNG-formaat worden verzonden, kan het model de lay-out en overgangsvloeiendheid in de video evalueren.
  4. Snel zoeken in vergaderopnames. Een uur durende vergaderopname kan snel gefilterd worden op belangrijke onderwerpen zonder tijd te verspillen aan handmatig scrubben.

Is het de moeite waard om te proberen

Het project is nieuw, maar heeft al meer dan duizend sterren op GitHub. De belangrijkste sterke punten zijn doordachte architectuur, slimme afhandeling van het context window via adaptieve fps, en de mogelijkheid om volledig lokaal te werken via whisper.cpp.

Enkele kanttekeningen: het vereist dat ffmpeg is geïnstalleerd, en yt-dlp is nodig voor YouTube-video's. Op macOS installeren alle dependencies via Homebrew in een paar klikken; op andere besturingssystemen moet je ze handmatig installeren.

Als je actief Claude Code gebruikt in de terminal en regelmatig werkt met video-opnames of demo-clips, zal deze plugin je aanzienlijk tijd besparen.

Gerelateerde projecten