Como Ensinar Agentes de IA a Testar Apps Móveis por Conta Própria
História conhecida: você pede a um assistente de IA como Cursor ou Claude para criar uma funcionalidade para um app móvel, ele gera um monte de código, você copia, e então... você abre o simulador e clica manualmente em cada tela para verificar se o layout quebrou. Nessa hora, parece que a automação deu uma volta errada em algum lugar. A IA consegue escrever código, mas é "cega" para a interface real fora do editor de texto.
A galera da Callstack resolveu esse problema lançando o agent-device. É uma ferramenta CLI que transforma um agente de IA de teórico em prático. Agora o agente consegue abrir o app no simulador iOS ou emulador Android, examinar elementos da tela e tocar nos botões corretos.
Por que se botherar se você já tem Appium ou Maestro
Pode parecer que já existem muitas ferramentas de automação mobile. Mas aí está o problema: Appium e Maestro foram feitos para humanos. Um agente de IA não precisa escrever cenários YAML complexos ou mexer com seletores na árvore XML. Ele precisa de uma forma rápida, barata e direta de interagir com o hardware.
O agent-device funciona de forma diferente. Ele captura screenshots não apenas como imagens, mas como árvores de acessibilidade estruturadas. Em vez de enviar screenshots pesados para um modelo multimodal e queimar tokens, o agente recebe uma descrição baseada em texto dos elementos com referências curtas como @e1, @e2. Isso reduz custos e acelera as coisas.

O que essa ferramenta pode fazer
A ferramenta se posiciona como as "mãos e olhos" do agente. Aqui estão as principais funcionalidades que chamaram minha atenção:
- Screenshots inteligentes. O comando
snapshot -iretorna apenas elementos interativos. O agente vê uma lista:@e1 [button] "Sign In",@e2 [text-field] "Email". Sem adivinhar onde tocar. - Multiplataforma de fábrica. O mesmo fluxo funciona para iOS, Android, TV (tvOS e Android TV), e até apps de desktop em macOS e Linux.
- Coleta de evidências. Se algo der errado, o agente pode iniciar gravação de vídeo, capturar logs ou extrair tráfego de rede por conta própria. Isso é invaluable para debugar bugs que só se reproduzem em runtime.
- Integração com React Native. Como a Callstack está por trás deste projeto, há suporte profundo para RN: você pode inspecionar a árvore de componentes e fazer profile de renders.

Como fica na prática
Imagine que você está configurando um servidor MCP (Model Context Protocol) para seu agente de IA. Agora ele pode executar comandos diretamente no terminal.
Primeiro, verificamos o ambiente:
agent-device doctor
Se tudo estiver certo, o agente pode iniciar o app:
agent-device open "MyApp" --platform ios
Então ele dá uma olhada:
agent-device snapshot -i
Assim que tiver a lista de elementos, ele simplesmente simula ações do usuário:
agent-device fill @e3 "[email protected]"
agent-device tap @e2
É isso. Sem esperar compilação ou trocar de janela manualmente.
Por baixo dos panos
A ferramenta não tenta reinventar a roda onde padrões já funcionam. Para iOS usa XCTest, para Android é ADB combinado com um helper customizado de screenshot. Para web, o Playwright roda por baixo dos panos (especificamente lógica de vercel/agent-browser).
Interessantemente, o agent-device pode converter suas sessões para o formato Maestro. Isso significa que o agente pode rascunhar um teste enquanto "explora" o app, e você pode então salvá-lo como um teste E2E completo para CI.
Quem deveria experimentar isso
Vejo vários cenários onde isso genuinamente vai economizar tempo:
- Desenvolvedores React Native e Expo. Se você está usando Cursor ou Windsurf, adicione a documentação do agent-device ao contexto. O agente pode verificar suas próprias mudanças sem te interromper.
- Engenheiros de QA. Você pode delegar a escrita de smoke tests básicos para a IA. Ele mesmo vai encontrar os botões e verificar se as transições funcionam.
- Times que trabalham com plataformas de TV. Automação de TV é sempre um pé no saco, e aqui vem junto.
O projeto está em desenvolvimento ativo, e embora a documentação ainda esteja sendo preenchida em alguns lugares, a CLI principal funciona de forma estável. Se você acredita no conceito de Agentic Workflows, esta ferramenta definitivamente vale uma noite de experiments.
Você pode começar com a documentação oficial deles, que detalha como integrar a CLI com agentes de IA populares.
Projetos relacionados