A pesquisa em agentes que navegam a web avança em quatro frentes: 1) travessia de grafos (a web como mapa de páginas e links que o agente percorre); 2) percepção multimodal (DOM + captura de tela juntas, a "visão dupla"); 3) memória reflexiva (o agente reconstrói o mapa do site e usa heurísticas de busca: até 50% menos erros no estudo R2D2 de 2025); 4) interfaces web agênticas (AWI): a proposta de padronizar como sites se expõem a agentes, com seis princípios incluindo segurança e intervenção humana. Números de referência: agentes híbridos com API chegam a 38,9% de sucesso contra 14,8% só no navegador (WebArena), e colaboração humano-agente atinge 95% com intervenção em ~15% dos passos.
A web como grafo: o agente com mapa
A formulação clássica trata a web como um grafo dirigido: páginas são nós, links são arestas, e navegar é atravessar o grafo até o nó que satisfaz o objetivo. Os primeiros controladores neurais já usavam atenção sobre a consulta para escolher o próximo link (a linha de pesquisa que vai de 2016 aos dias atuais). A frente recente dá memória ao passeio: o sistema R2D2 (2025) reconstrói um mapa do site conforme navega e usa busca A* com heurísticas de LLM para decidir o caminho, reduzindo erros em até 50% frente a agentes sem mapa. Para o site, a lição é antiga com nome novo: arquitetura de informação clara é o que permite o mapa existir.
Visão dupla: DOM + pixels
Nenhuma representação isolada fecha o problema de percepção: o DOM carrega semântica mas estoura contexto; a captura de tela carrega o visual mas custa caro. A pesquisa convergiu para a fusão multimodal (Kil et al., 2024; Chen et al., 2023): ler o DOM podado com atenção visual sobre a tela, o que os guias populares chamam de visão dupla. É a mesma conclusão prática dos produtos: o guia de como agentes veem seu site cobre o lado do dono do site.
Aprender a navegar: RL e currículos adversariais
A frente de treinamento usa ambientes gerados por adversário: o AEG/PAIRED maximiza o arrependimento do agente para gerar sites de treino cada vez mais difíceis, e os agentes treinados nesse currículo alcançaram mais de 80% de sucesso em preenchimento de formulários e reservas (Gur et al., 2021). Benchmarks padrão (WebArena, MiniWob++, WebLINX para navegação conversacional) medem o progresso, e o Web-Shepherd (2025) trouxe a peça que faltava: um modelo de recompensa de processo que avalia cada etapa da navegação, superando o GPT-4o em mais de 30 pontos na tarefa de julgar trajetórias.
A proposta mais influente da frente (Lù et al., 2025) inverte a pergunta: em vez de ensinar o agente a ler sites feitos para humanos, padronizar como sites se expõem a agentes (Agent-Web-Interface, AWI), com seis princípios: padronização, intervenção humana, segurança, representação ótima, eficiência e facilidade para desenvolvedores. Na prática, é a mesma direção do WebMCP do Chrome e dos dados estruturados: o site declara explicitamente o que pode ser feito. Quem publica semântica e ferramentas claras está, sem saber, construindo a AWI de antes da sigla existir.
Híbrido API + navegador: o resultado que resume tudo
O número mais instrutivo do levantamento vem da comparação de estratégias no WebArena (Song et al., 2024): agentes que alternam entre navegar a interface e chamar APIs documentadas alcançaram 38,9% de sucesso, contra 14,8% dos que só usam o navegador. Tradução: onde existe um caminho estruturado, o agente prefere e performa melhor. A implicação para o negócio é direta: dados estruturados, ferramentas explícitas e APIs abertas (ou WebMCP) valem mais que qualquer ajuste fino de interface. E o modo colaborativo completa o quadro: com intervenção humana em ~15% dos passos, o acerto sobe a 95% (CowPilot, 2025): para jornadas críticas, humano no circuito é desenho, não deficiência.
O que acompanhar nos próximos ciclos
- AWI e WebMCP amadurecendo: a padronização de interfaces agênticas deve seguir o roteiro dos dados estruturados: benefício crescente para quem adota cedo.
- Arquiteturas de duplo processo: decisões rápidas (Sistema 1) para o trivial e planejamento deliberado (Sistema 2) para o difícil, como no CogniWeb: custo de inferência caindo com qualidade mantida.
- Agentes corporificados: a fronteira seguinte orquestra ação física e web na mesma tarefa (a pesquisa de 2025 já demonstra cozinha com busca de receita + manipulação robótica): a jornada omnichannel literal.
- Modelos de recompensa de processo: avaliar cada etapa (não só o fim) vira padrão de qualidade, inclusive para quem opera agentes em produção.
Para o site brasileiro que quer se posicionar agora, a síntese da pesquisa é a mesma dos guias práticos: semântica, estados claros, caminho estruturado e ferramentas declaradas. A base técnica disso é dados estruturados com schema, e a auditoria começa no SEO técnico.