>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Python

Como Conectar uma Rede Neural a um Navegador Real com Browser Harness

Todos que tentaram automatizar a web com modelos de linguagem conhecem essa dor. O agente começa alegremente a clicar em botões, mas trava logo no primeiro campo de entrada não padrão ou captcha complicado. Frameworks tradicionais oferecem um conjunto rígido de ferramentas: clicar, digitar, rolar. Se a ação necessária não estiver no código do agente, a tarefa desmorona.

A equipe do browser-use propôs uma abordagem diferente no projeto browser-harness. Em vez de tentar antecipar todos os cenários possíveis de páginas web antecipadamente, eles criaram um wrapper que conecta um LLM ao seu navegador real via Chrome DevTools Protocol (CDP) e dá ao modelo a capacidade de escrever funções ausentes em tempo real.

Qual é a Ideia por Trás do Wrapper Auto-Aprendiz

Um agente de navegador regular funciona isolado. Ele recebe um navegador headless isolado sem sessões salvas, cookies ou autorizações. Como resultado, metade do tempo é gasta tentando fazer login.

Browser Harness conecta diretamente ao seu Chrome em execução via porta de debug. O modelo imediatamente vê abas abertas, seus perfis e ambiente de trabalho.

A parte mais interessante está na mecânica de manipulação de código:

  1. O agente recebe uma tarefa, por exemplo, baixar os últimos vinte vídeos de um perfil de rede social ou preencher um formulário complexo com zona de drop de arquivos.
  2. O modelo verifica o arquivo local agent-workspace/agent_helpers.py. Se não houver uma função adequada para trabalhar com o elemento, o agente escreve um script auxiliar他自己.
  3. O script é executado imediatamente no contexto da página. Se funcionar com sucesso, a função é salva no workspace.
  4. Ao realizar a próxima tarefa semelhante, o agente não reinventa a roda, mas usa o helper escrito anteriormente.

Ao mesmo tempo, o núcleo da biblioteca em si na pasta src/browser_harness/ permanece protegido de alterações. O modelo apenas estende seu próprio workspace local, então o risco de quebrar a lógica central é mínimo.

Download my latest 20 X videos

Como Funciona o Lançamento

O projeto é totalmente integrado com ambientes de desenvolvimento agentic como Claude Code ou Codex. Para começar, basta fornecer ao seu assistente um prompt de instalação pronto:

Install or upgrade browser-harness to the latest stable version with uv using Python 3.12, register the skill from `browser-harness skill`, and connect it to my browser. Ask whether I want local browser recordings enabled; default to no and preserve my existing preference on upgrades. Follow https://github.com/browser-use/browser-harness/blob/main/install.md if setup or connection fails.

Após executar o comando, a aba chrome://inspect/#remote-debugging será aberta. Lá você precisa marcar a caixa de remote debugging para que o agente obtenha acesso ao WebSocket CDP:

Remote debugging setup

Toda a stack é mantida por três arquivos claros:

  • O arquivo de instruções install.md lida com a conexão inicial ao navegador via porta de debug.
  • O arquivo SKILL.md descreve padrões de interação com páginas para o LLM.
  • Módulos no diretório src/browser_harness/ mantêm um socket persistente e passam comandos.

O Que Tem Por Dentro e Quais Tecnologias São Usadas

Por baixo dos panos, o projeto usa Python 3.12 e o gerenciador de pacotes uv. O gerenciamento de sessão usa um WebSocket direto para CDP, sem wrappers pesados como Selenium.

Essa abordagem oferece duas vantagens práticas:

  • Latência mínima ao transmitir eventos de entrada, rolagem e cliques.
  • Acesso completo ao DOM, requisições de rede e armazenamento do navegador sem precisar configurar pontes adicionais.

Se você precisa executar dezenas de tarefas em paralelo, os criadores oferecem a infraestrutura Browser Use Cloud com proxies prontos, proteção contra detectores de bots e resolução de captchas. Mas para execuções locais cotidianas no seu próprio navegador, isso é mais do que suficiente.

Casos de Uso Práticos

Onde essa ferramenta realmente economiza tempo:

  • Coletar dados de dashboards privados onde não há API pública e autenticação de dois fatores está configurada. Você autoriza manualmente uma vez e delega a exportação rotineira de relatórios ao agente.
  • Downloads em massa de arquivos de mídia. O agente abre a página, rola o feed, encontra os seletores necessários do player de vídeo e salva arquivos em uma pasta local.
  • Testar layouts e cenários de usuário. O agente percorre a jornada do usuário, escreve verificações ausentes他自己 e as armazena em helpers.
  • Preencher formulários repetitivos em sistemas CRM corporativos quando você precisa transferir um lote de dados de uma planilha.

Vale a Pena Experimentar

Se você usa ativamente ferramentas CLI agentic como Claude Code e está cansado de copiar manualmente dados de páginas para o terminal, o projeto definitivamente vale a pena experimentar. O conceito onde o agente expande seu próprio toolkit através de helpers persistentes parece muito mais viável do que inflar infinitamente o system prompt.

Das desvantagens, devo notar que o projeto requer atenção cuidadosa à segurança: ao dar a um LLM acesso ao seu navegador principal, você está compartilhando todas as sessões abertas. Então, para experimentos, é mais sábio criar um perfil Chrome separado sem cartões bancários vinculados e serviços críticos. Comece com cenários simples de parsing, observe como o agente gera suas primeiras funções em agent_helpers.py e avalie quão bem esse formato se encaixa no seu stack usual.

Projetos relacionados