Cómo enseñar a Claude Code a ver vídeos y comprender lo que ocurre en pantalla

Ayer estaba intentando explicarle a Claude Code exactamente cuándo una utilidad lanza un error en una grabación de pantalla. Tuve que hacer manualmente una captura, recortar el área relevante y soltar el archivo en el chat. Cuando hay muchos errores o el problema aparece en el minuto diez de una grabación de reunión, este enfoque manual se vuelve tedioso rápidamente.
La mayoría de los modelos de lenguaje no pueden transmitir o leer directamente archivos MP4 pesados. El repositorio claude-video-vision del desarrollador Jordan Vasconcelos resuelve esto de forma elegante. Es un plugin para Claude Code y un servidor MCP al mismo tiempo, actuando como una capa de percepción. Convierte el vídeo en un conjunto de fotogramas y texto transcrito con marcas de tiempo, y luego alimenta todo a la red neuronal.
Cómo funciona internamente
El flujo de trabajo aquí es bastante directo. Todo el trabajo técnico de cortar y extraer datos multimedia lo maneja el servidor MCP de Node.js.
Cuando le pides a Claude que analice un vídeo, se inician dos procesos en paralelo:
- ffmpeg corta fotogramas en formato JPEG, PNG o WebP y los codifica en base64.
- Backend de audio toma la pista de sonido y la convierte en una transcripción de texto con marcas de tiempo.
Luego Claude recibe un conjunto listo de imágenes y texto cronológico. Un detalle interesante: el modelo decide por sí mismo qué tasa de frames y resolución usar para cortar el vídeo.
Si preguntas "¿Qué está escrito en la pizarra en el segundo 90?", el plugin no procesará todo el vídeo de una hora. El modelo solicitará fotogramas de alta resolución con intervalos frecuentes específicamente para el segmento de 01:25 a 01:35. Si pides un breve resumen de toda la conferencia, el plugin reducirá la tasa de frames y收集ará vistas previas dispersas a lo largo de toda la duración.
Bajo el capó: opciones de backend
Para el procesamiento de audio, el autor proporcionó tres opciones para elegir:
- Gemini API. El límite gratuito de 15.000 solicitudes por día cubre la mayoría de las tareas y procesa no solo el habla sino también eventos de sonido de fondo. Solo necesitas una clave API.
- Whisper local. Funciona a través de
whisper.cppo el paquete de Pythonopenai-whisper. Se ejecuta completamente sin conexión, y los modelos requeridos se descargan automáticamente en el primer lanzamiento. - OpenAI API. Utiliza la API de Whisper de pago de OpenAI si no quieres cargar un procesador local y configurar una cuenta en Google AI Studio.
Vale la pena mencionar el soporte para YouTube por separado. Si pasas un enlace de vídeo, el plugin lo descarga a través de yt-dlp. El servidor primero intenta obtener subtítulos manuales. Si no están disponibles, extrae los subtítulos generados automáticamente de YouTube. Si faltan subtítulos o están demasiado fragmentados, entra en acción el backend de audio seleccionado. Claude ve la fuente de la transcripción y comprende el nivel de precisión del texto.
Configuración y primeros comandos
El plugin se instala directamente en una sesión de Claude Code. Solo ejecuta los comandos secuencialmente:
/plugin marketplace add https://github.com/jordanrendric/claude-video-vision
/plugin install claude-video-vision
Después de la instalación, se inicia un asistente de configuración interactivo:
/claude-video-vision:setup-video-vision
El asistente verifica la presencia de ffmpeg, te permite elegir un backend de audio y descarga el modelo Whisper si seleccionaste el modo sin conexión. La configuración se guarda en ~/.claude-video-vision/config.json. Allí puedes establecer la resolución de frames predeterminada, el formato de imagen (por ejemplo, PNG es útil para texto nítido en capturas de pantalla) y el número máximo de fotogramas por solicitud.
Puedes trabajar con el plugin a través de comandos especiales o en un formato de chat regular:
/watch-video ~/Downloads/demo.mp4 "какой язык программирования используется в туториале?"
/watch-video https://www.youtube.com/watch?v=... "сделай краткое содержание"
O simplemente escribe en el chat:
Mira el primer segundo del error de ~/videos/bug-report.mov y dime qué salió mal.
Dónde resulta útil
La herramienta cubre varias tareas comunes de desarrollo:
- Análisis de reportes de errores. Un usuario o ingeniero de QA envió una grabación de pantalla. En lugar de volver a ver el vídeo, puedes soltar el archivo a Claude y preguntar qué error apareció en la consola en el tercer segundo.
- Tomar notas en charlas y tutoriales. Puedes soltar un enlace a una presentación de YouTube de una hora y obtener un esquema estructurado con marcas de tiempo y capturas de pantalla de las diapositivas clave.
- Revisión de animaciones de UI. Cuando los fotogramas se envían en formato PNG sin pérdida, el modelo puede evaluar el diseño y la fluidez de las transiciones en el vídeo.
- Búsqueda rápida en grabaciones de reuniones. Una grabación de reunión de una hora se puede filtrar rápidamente por temas clave sin perder tiempo en la navegación manual.
¿Vale la pena probarlo?
El proyecto es nuevo, pero ya tiene más de mil estrellas en GitHub. Los puntos fuertes principales son la arquitectura bien pensada, el manejo sensato de la ventana de contexto a través de fps adaptativo y la capacidad de trabajar completamente en local a través de whisper.cpp.
Algunas advertencias: requiere que ffmpeg esté instalado, y se necesita yt-dlp para vídeos de YouTube. En macOS, todas las dependencias se instalan a través de Homebrew en un par de clics; en otros sistemas operativos, tendrás que instalarlas manualmente.
Si usas activamente Claude Code en el terminal y trabajas regularmente con grabaciones de vídeo o clips de demostración, este plugin te ahorrará una cantidad significativa de tiempo.
Proyectos relacionados