So bringen Sie Claude Code bei, Videos zu schauen und zu verstehen, was auf dem Bildschirm passiert

Gestern versuchte ich, Claude Code genau zu erklären, wann ein Utility in einer Bildschirmaufnahme einen Fehler wirft. Ich musste manuell einen Screenshot erstellen, den relevanten Bereich zuschneiden und die Datei in den Chat ziehen. Wenn es viele Bugs gibt oder das Problem bei Minute zehn einer Besprechungsaufnahme auftritt, wird dieser manuelle Ansatz schnell mühsam.
Die meisten Sprachmodelle können keine schweren MP4-Dateien direkt streamen oder lesen. Das Repository claude-video-vision vom Entwickler Jordan Vasconcelos löst das elegant. Es ist ein Plugin für Claude Code und gleichzeitig ein MCP-Server, der als Wahrnehmungsschicht fungiert. Es konvertiert Video in eine Reihe von Frames und transkribierten Text mit Zeitstempeln und übergibt alles an das neuronale Netz.
So funktioniert es unter der Haube
Der Workflow ist hier ziemlich straightforward. Die gesamte technische Arbeit des Aufteilens und Extrahierens von Mediendaten wird vom Node.js MCP-Server erledigt.
Wenn Sie Claude bitten, ein Video zu analysieren, starten zwei parallele Prozesse:
- ffmpeg schneidet Frames im JPEG-, PNG- oder WebP-Format und kodiert sie in base64.
- Audio-Backend nimmt die Tonspur und konvertiert sie in eine Texttranskription mit Zeitstempeln.
Dann erhält Claude einen fertigen Satz Bilder und chronologischen Text. Ein interessantes Detail: Das Modell entscheidet selbst, welche Bildrate und Auflösung für das Schneiden des Videos verwendet werden soll.
Wenn Sie fragen „Was steht auf der Tafel bei der 90-Sekunden-Marke?
Ähnliche Projekte