Comment apprendre à Claude Code à regarder des vidéos et comprendre ce qui se passe à l'écran

Hier, j'essayais d'expliquer à Claude Code exactement quand un utilitaire génère une erreur dans un enregistrement d'écran. J'ai dû prendre manuellement une capture d'écran, recadrer la zone pertinente et déposer le fichier dans le chat. Quand il y a beaucoup de bugs ou que le problème apparaît à la dixième minute d'un enregistrement de réunion, cette approche manuelle devient vite fastidieuse.
La plupart des modèles de langage ne peuvent pas diffuser directement ou lire des fichiers MP4 volumineux. Le dépôt claude-video-vision du développeur Jordan Vasconcelos résout cela élégamment. C'est un plugin pour Claude Code et un serveur MCP en même temps, agissant comme une couche de perception. Il convertit la vidéo en un ensemble d'images et de texte transcrit avec des horodatages, puis envoie tout au réseau neuronal.
Comment ça fonctionne en interne
Le flux de travail ici est assez simple. Tout le travail technique de découpage et d'extraction des données multimédias est géré par le serveur MCP Node.js.
Quand vous demandez à Claude d'analyser une vidéo, deux processus parallèles se lancent :
- ffmpeg découpe les images au format JPEG, PNG ou WebP et les encode en base64.
- Le backend audio extrait la piste sonore et la convertit en transcription textuelle avec horodatages.
Ensuite Claude reçoit un ensemble d'images et de texte chronologique. Un détail intéressant : le modèle décide lui-même du débit d'images et de la résolution à utiliser pour le découpage de la vidéo.
Si vous demandez « Que dit l'écriteau à 1 minute 30 ? », le plugin ne traitera pas toute la vidéo d'une heure. Le modèle demandera des images haute résolution à intervalles fréquents spécifiquement pour le segment de 1:25 à 1:35. Si vous demandez un bref résumé de l'ensemble du cours, le plugin abaissera le débit d'images et collectera des aperçus clairsemés sur toute la durée.
Sous le capot : options du backend
Pour le traitement audio, l'auteur a fourni trois options au choix :
- API Gemini. La limite gratuite de 15 000 requêtes par jour couvre la plupart des tâches et traite non seulement la parole mais aussi les événements sonores en arrière-plan. Vous avez seulement besoin d'une clé API.
- Whisper local. Fonctionne via
whisper.cppou le package Pythonopenai-whisper. Fonctionne entièrement hors ligne, et les modèles requis se téléchargent automatiquement au premier lancement. - API OpenAI. Utilise l'API Whisper payante d'OpenAI si vous ne voulez pas charger un processeur local et configurer un compte dans Google AI Studio.
Il convient de mentionner séparément la prise en charge de YouTube. Si vous passez un lien vidéo, le plugin le télécharge via yt-dlp. Le serveur essaie d'abord de récupérer les sous-titres manuels. S'ils ne sont pas disponibles, il récupère les sous-titres auto-générés de YouTube. Si les sous-titres sont manquants ou trop fragmentés, le backend audio sélectionné prend le relais. Claude voit la source de la transcription et comprend le niveau de précision du texte.
Configuration et premières commandes
Le plugin s'installe directement dans une session Claude Code. Exécutez simplement les commandes séquentiellement :
/plugin marketplace add https://github.com/jordanrendric/claude-video-vision
/plugin install claude-video-vision
Après l'installation, un assistant de configuration interactif se lance :
/claude-video-vision:setup-video-vision
L'assistant vérifie la présence de ffmpeg, vous permet de choisir un backend audio et télécharge le modèle Whisper si vous avez sélectionné le mode hors ligne. La configuration est enregistrée dans ~/.claude-video-vision/config.json. Vous pouvez y définir la résolution d'image par défaut, le format d'image (par exemple, PNG est utile pour du texte net dans les captures d'écran) et le nombre maximum d'images par requête.
Vous pouvez travailler avec le plugin via des commandes spéciales ou dans un format de chat classique :
/watch-video ~/Downloads/demo.mp4 "какой язык программирования используется в туториале?"
/watch-video https://www.youtube.com/watch?v=... "сделай краткое содержание"
Ou tapez simplement dans le chat :
Regarde la première seconde du bug depuis ~/videos/bug-report.mov et dis-moi ce qui s'est mal passé.
Où cela s'avère utile
L'outil couvre plusieurs tâches de développement courantes :
- Analyse de rapports de bugs. Un utilisateur ou un ingénieur QA a envoyé un enregistrement d'écran. Au lieu de revisionner la vidéo, vous pouvez déposer le fichier à Claude et demander quelle erreur est apparue dans la console à la troisième seconde.
- Prendre des notes sur des conférences et tutoriels. Vous pouvez déposer un lien vers une présentation YouTube d'une heure et obtenir un plan structuré avec horodatages et captures des diapositives clés.
- Révision d'animations d'interface utilisateur. Quand les images sont envoyées en format PNG sans perte, le modèle peut évaluer la mise en page et la fluidité des transitions dans la vidéo.
- Recherche rapide dans des enregistrements de réunions. Un enregistrement de réunion d'une heure peut être rapidement filtré par sujets clés sans perdre de temps à faire défiler manuellement.
Cela vaut-il la peine d'essayer
Le projet est récent, mais il compte déjà plus d'un millier d'étoiles sur GitHub. Les principaux points forts sont une architecture bien pensée, une gestion sensée de la fenêtre de contexte via des fps adaptatifs, et la possibilité de fonctionner entièrement localement via whisper.cpp.
Quelques mises en garde : il nécessite l'installation de ffmpeg, et yt-dlp est nécessaire pour les vidéos YouTube. Sur macOS, toutes les dépendances s'installent via Homebrew en quelques clics ; sur les autres systèmes d'exploitation, vous devrez les installer manuellement.
Si vous utilisez activement Claude Code dans le terminal et travaillez régulièrement avec des enregistrements vidéo ou des clips de démonstration, ce plugin vous fera gagner un temps considérable.
Projets similaires