Comment apprendre aux agents IA à tester des applications mobiles de manière autonome
Histoire familière : vous demandez à un assistant IA comme Cursor ou Claude d'écrire une fonctionnalité pour une application mobile, il crache un tas de code, vous le copiez, et ensuite... vous ouvrez le simulateur et cliquez manuellement sur chaque écran pour vérifier si la mise en page a cassé. À ce moment-là, on a l'impression que l'automatisation a pris un mauvais virage quelque part. L'IA peut écrire du code, mais elle est « aveugle » à l'interface réelle en dehors de l'éditeur de texte.
Les gens de Callstack ont résolu ce problème en publiant agent-device. C'est un outil CLI qui transforme un agent IA de théoricien en praticien. Maintenant, l'agent peut ouvrir l'application sur un simulateur iOS ou un émulateur Android, regarder les éléments de l'écran et appuyer sur les bons boutons.
Pourquoi se compliquer quand on a Appium ou Maestro
On pourrait croire qu'il existe déjà beaucoup d'outils d'automatisation mobile. Mais voici le hic : Appium et Maestro ont été conçus pour les humains. Un agent IA n'a pas besoin d'écrire des scénarios YAML complexes ou de bidouiller des sélecteurs dans l'arbre XML. Il a besoin d'un moyen rapide, économique et direct d'interagir avec le matériel.
agent-device fonctionne différemment. Il capture les captures d'écran non seulement comme des images, mais comme des arbres d'accessibilité structurés. Au lieu de nourrir des captures d'écran lourdes à un modèle multimodal et de brûler des tokens, l'agent obtient une description textuelle des éléments avec de courtes références comme @e1, @e2. Cela réduit les coûts et accélère les choses.

Ce que cet outil peut faire
L'outil se positionne comme les « mains et les yeux » de l'agent. Voici les principales fonctionnalités qui ont retenu mon attention :
- Captures d'écran intelligentes. La commande
snapshot -ine retourne que les éléments interactifs. L'agent voit une liste :@e1 [button] "Sign In",@e2 [text-field] "Email". Plus besoin de deviner où appuyer. - Multiplateforme dès le départ. Le même flux de travail fonctionne pour iOS, Android, TV (tvOS et Android TV), et même les applications de bureau sur macOS et Linux.
- Collecte de preuves. Si quelque chose se passe mal, l'agent peut démarrer un enregistrement vidéo, capturer les logs ou extraire le trafic réseau de lui-même. C'est précieux pour déboguer les bugs qui ne se reproduisent qu'à l'exécution.
- Intégration React Native. Puisque Callstack est derrière ce projet, il y a un support RN profond : vous pouvez inspecter l'arbre des composants et profiler les rendus.

À quoi ça ressemble en pratique
Imaginez que vous configurez un serveur MCP (Model Context Protocol) pour votre agent IA. Maintenant, il peut exécuter des commandes directement dans le terminal.
D'abord, on vérifie l'environnement :
agent-device doctor
Si tout est bon, l'agent peut lancer l'application :
agent-device open "MyApp" --platform ios
Puis il fait le tour du propriétaire :
agent-device snapshot -i
Une fois qu'il a la liste des éléments, il simule simplement les actions utilisateur :
agent-device fill @e3 "[email protected]"
agent-device tap @e2
C'est tout. Pas d'attente de compilation ni de changement manuel de fenêtre.
Sous le capot
L'outil ne réinvente pas la roue là où les standards fonctionnent déjà. Pour iOS, il utilise XCTest, pour Android c'est ADB combiné avec un assistant de capture d'écran personnalisé. Pour le web, Playwright tourne en coulisses (plus précisément la logique de vercel/agent-browser).
Intéressamment, agent-device peut convertir ses sessions au format Maestro. Cela signifie que l'agent peut rédiger un test pendant qu'il « explore » l'application, et vous pouvez ensuite le sauvegarder comme un test E2E complet pour la CI.
Qui devrait essayer ça
Je vois plusieurs scénarios où cela fera vraiment gagner du temps :
- Développeurs React Native et Expo. Si vous utilisez Cursor ou Windsurf, ajoutez la documentation d'agent-device au contexte. L'agent peut vérifier ses propres modifications sans vous interrompre.
- Ingénieurs QA. Vous pouvez déléguer l'écriture de tests smoke de base à l'IA. Elle trouvera les boutons elle-même et vérifiera que les transitions fonctionnent.
- Équipes travaillant avec des plateformes TV. L'automatisation TV est toujours un calvaire, et ici elle est incluse.
Le projet est en développement actif, et bien que la documentation soit encore en cours de rédaction à certains endroits, le CLI principal fonctionne de manière stable. Si vous croyez au concept d'Agentic Workflows, cet outil mérite vraiment qu'on y passe une soirée.
Vous pouvez commencer par leur documentation officielle, qui détaille comment intégrer le CLI avec les agents IA populaires.
Projets similaires