Cómo enseñar a los agentes de IA a probar aplicaciones móviles por sí mismos
Historia conocida: le pides a un asistente de IA como Cursor o Claude que escriba una funcionalidad para una aplicación móvil, escupe un montón de código, lo copias, y luego... abres el simulador y haces clic manualmente en cada pantalla para verificar si el diseño se rompió. En ese momento, parece que la automatización se desvió por algún lugar. La IA puede escribir código, pero es "ciega" a la interfaz real fuera del editor de texto.
La gente de Callstack resolvió este problema lanzando agent-device. Es una herramienta CLI que transforma un agente de IA de teórico a practicante. Ahora el agente puede abrir la aplicación en un simulador iOS o emulador Android, ver los elementos de la pantalla y tocar los botones correctos.
¿Por qué molestarse si ya tienes Appium o Maestro?
Podría parecer que ya hay muchas herramientas de automatización móvil. Pero aquí está el truco: Appium y Maestro fueron diseñados para humanos. Un agente de IA no necesita escribir escenarios YAML complejos ni lidiar con selectores en el árbol XML. Necesita una forma rápida, económica y directa de interactuar con el hardware.
agent-device funciona de manera diferente. Captura capturas de pantalla no solo como imágenes, sino como árboles de accesibilidad estructurados. En lugar de alimentar capturas de pantalla pesadas a un modelo multimodal y quemar tokens, el agente obtiene una descripción basada en texto de los elementos con referencias cortas como @e1, @e2. Esto reduce costos y acelera las cosas.

Lo que esta herramienta puede hacer
La herramienta se posiciona como las "manos y ojos" del agente. Estas son las características principales que captaron mi atención:
- Capturas de pantalla inteligentes. El comando
snapshot -idevuelve solo los elementos interactivos. El agente ve una lista:@e1 [button] "Sign In",@e2 [text-field] "Email". Sin adivinar dónde tocar. - Multiplataforma desde el primer momento. El mismo flujo de trabajo funciona para iOS, Android, TV (tvOS y Android TV), e incluso aplicaciones de escritorio en macOS y Linux.
- Recopilación de evidencia. Si algo sale mal, el agente puede iniciar la grabación de video, capturar registros o extraer tráfico de red por sí mismo. Esto es invaluable para depurar errores que solo se reproducen en tiempo de ejecución.
- Integración con React Native. Dado que Callstack está detrás de este proyecto, hay soporte profundo para RN: puedes inspeccionar el árbol de componentes y perfilar los renders.

Cómo se ve en la práctica
Imagina que estás configurando un servidor MCP (Model Context Protocol) para tu agente de IA. Ahora puede ejecutar comandos directamente en la terminal.
Primero, verificamos el entorno:
agent-device doctor
Si todo está bien, el agente puede iniciar la aplicación:
agent-device open "MyApp" --platform ios
Luego echa un vistazo:
agent-device snapshot -i
Una vez que tiene la lista de elementos, simplemente simula las acciones del usuario:
agent-device fill @e3 "[email protected]"
agent-device tap @e2
Eso es todo. Sin esperar la compilación ni cambiar manualmente entre ventanas.
Bajo el capó
La herramienta no intenta reinventar la rueda donde los estándares ya funcionan. Para iOS usa XCTest, para Android es ADB combinado con un helper personalizado de capturas de pantalla. Para la web, Playwright funciona entre bastidores (específicamente la lógica de vercel/agent-browser).
Curiosamente, agent-device puede convertir sus sesiones al formato Maestro. Esto significa que el agente puede redactar una prueba mientras "explora" la aplicación, y luego puedes guardarla como una prueba E2E completa para CI.
Quién debería probar esto
Veo varios escenarios donde esto realmente ahorrará tiempo:
- Desarrolladores de React Native y Expo. Si estás usando Cursor o Windsurf, agrega la documentación de agent-device al contexto. El agente puede verificar sus propios cambios sin interrumpirte.
- Ingenieros de QA. Puedes delegar la escritura de pruebas de humo básicas a la IA. Encontrará los botones por sí mismo y verificará que las transiciones funcionen.
- Equipos que trabajan con plataformas de TV. La automatización de TV siempre es un dolor, y aquí viene incluida.
El proyecto se está desarrollando activamente, y aunque la documentación aún se está completando en algunos lugares, la CLI principal funciona de manera estable. Si crees en el concepto de Agentic Workflows, esta herramienta definitivamente vale la pena dedicarle una noche.
Puedes comenzar con su documentación oficial, que detalla cómo integrar la CLI con agentes de IA populares.
Proyectos relacionados