Serviços Blog Cases Glossário Soluções Ferramentas Contato Diagnóstico Grátis

IA & Agentes

A web para agentes de IA: da navegação por tentativa e erro às interfaces agênticas

09/10/2026 7 min de leitura Por Equipe M&C

Visão geral: a pesquisa em navegação de agentes avança em quatro frentes: modelar a web como grafo e atravessá-lo, combinar leitura de DOM com visão (percepção multimodal), dar memória reflexiva ao agente (mapas do site que reduzem erros em até 50%) e propor interfaces web agênticas (AWI) padronizadas, para os sites nascerem prontos para agentes. O resultado prático para quem tem site: a direção do mercado é o site expor sua estrutura de forma explícita para máquinas, e quem preparar a semântica agora surfa a onda em vez de ser atravessado por ela.

Em resumo (para quem tem 1 minuto)

A pesquisa em agentes que navegam a web avança em quatro frentes: 1) travessia de grafos (a web como mapa de páginas e links que o agente percorre); 2) percepção multimodal (DOM + captura de tela juntas, a "visão dupla"); 3) memória reflexiva (o agente reconstrói o mapa do site e usa heurísticas de busca: até 50% menos erros no estudo R2D2 de 2025); 4) interfaces web agênticas (AWI): a proposta de padronizar como sites se expõem a agentes, com seis princípios incluindo segurança e intervenção humana. Números de referência: agentes híbridos com API chegam a 38,9% de sucesso contra 14,8% só no navegador (WebArena), e colaboração humano-agente atinge 95% com intervenção em ~15% dos passos.

A web como grafo: o agente com mapa

A formulação clássica trata a web como um grafo dirigido: páginas são nós, links são arestas, e navegar é atravessar o grafo até o nó que satisfaz o objetivo. Os primeiros controladores neurais já usavam atenção sobre a consulta para escolher o próximo link (a linha de pesquisa que vai de 2016 aos dias atuais). A frente recente dá memória ao passeio: o sistema R2D2 (2025) reconstrói um mapa do site conforme navega e usa busca A* com heurísticas de LLM para decidir o caminho, reduzindo erros em até 50% frente a agentes sem mapa. Para o site, a lição é antiga com nome novo: arquitetura de informação clara é o que permite o mapa existir.

Visão dupla: DOM + pixels

Nenhuma representação isolada fecha o problema de percepção: o DOM carrega semântica mas estoura contexto; a captura de tela carrega o visual mas custa caro. A pesquisa convergiu para a fusão multimodal (Kil et al., 2024; Chen et al., 2023): ler o DOM podado com atenção visual sobre a tela, o que os guias populares chamam de visão dupla. É a mesma conclusão prática dos produtos: o guia de como agentes veem seu site cobre o lado do dono do site.

Aprender a navegar: RL e currículos adversariais

A frente de treinamento usa ambientes gerados por adversário: o AEG/PAIRED maximiza o arrependimento do agente para gerar sites de treino cada vez mais difíceis, e os agentes treinados nesse currículo alcançaram mais de 80% de sucesso em preenchimento de formulários e reservas (Gur et al., 2021). Benchmarks padrão (WebArena, MiniWob++, WebLINX para navegação conversacional) medem o progresso, e o Web-Shepherd (2025) trouxe a peça que faltava: um modelo de recompensa de processo que avalia cada etapa da navegação, superando o GPT-4o em mais de 30 pontos na tarefa de julgar trajetórias.

AWI: construir a web para agentes

A proposta mais influente da frente (Lù et al., 2025) inverte a pergunta: em vez de ensinar o agente a ler sites feitos para humanos, padronizar como sites se expõem a agentes (Agent-Web-Interface, AWI), com seis princípios: padronização, intervenção humana, segurança, representação ótima, eficiência e facilidade para desenvolvedores. Na prática, é a mesma direção do WebMCP do Chrome e dos dados estruturados: o site declara explicitamente o que pode ser feito. Quem publica semântica e ferramentas claras está, sem saber, construindo a AWI de antes da sigla existir.

Híbrido API + navegador: o resultado que resume tudo

O número mais instrutivo do levantamento vem da comparação de estratégias no WebArena (Song et al., 2024): agentes que alternam entre navegar a interface e chamar APIs documentadas alcançaram 38,9% de sucesso, contra 14,8% dos que só usam o navegador. Tradução: onde existe um caminho estruturado, o agente prefere e performa melhor. A implicação para o negócio é direta: dados estruturados, ferramentas explícitas e APIs abertas (ou WebMCP) valem mais que qualquer ajuste fino de interface. E o modo colaborativo completa o quadro: com intervenção humana em ~15% dos passos, o acerto sobe a 95% (CowPilot, 2025): para jornadas críticas, humano no circuito é desenho, não deficiência.

O que acompanhar nos próximos ciclos

  • AWI e WebMCP amadurecendo: a padronização de interfaces agênticas deve seguir o roteiro dos dados estruturados: benefício crescente para quem adota cedo.
  • Arquiteturas de duplo processo: decisões rápidas (Sistema 1) para o trivial e planejamento deliberado (Sistema 2) para o difícil, como no CogniWeb: custo de inferência caindo com qualidade mantida.
  • Agentes corporificados: a fronteira seguinte orquestra ação física e web na mesma tarefa (a pesquisa de 2025 já demonstra cozinha com busca de receita + manipulação robótica): a jornada omnichannel literal.
  • Modelos de recompensa de processo: avaliar cada etapa (não só o fim) vira padrão de qualidade, inclusive para quem opera agentes em produção.

Para o site brasileiro que quer se posicionar agora, a síntese da pesquisa é a mesma dos guias práticos: semântica, estados claros, caminho estruturado e ferramentas declaradas. A base técnica disso é dados estruturados com schema, e a auditoria começa no SEO técnico.

Perguntas frequentes

Dúvidas rápidas

O que são interfaces web agênticas (AWI)?
É a proposta da pesquisa (Lù et al., 2025) de padronizar como sites se expõem a agentes de IA, com seis princípios: padronização, intervenção humana, segurança, representação ótima, eficiência e facilidade para desenvolvedores. Na prática, mesma direção do WebMCP: o site declara explicitamente o que o agente pode fazer.
Como agentes de IA modelam a navegação na web?
Como travessia de grafos: páginas são nós, links são arestas, e o objetivo é alcançar o nó certo. Frentes recentes adicionam memória reflexiva (reconstruir o mapa do site durante a navegação, reduzindo erros em até 50% no estudo R2D2) e percepção multimodal combinando DOM e captura de tela.
Agentes navegam melhor por interface ou por API?
Pela combinação: no WebArena (Song et al., 2024), agentes que alternam entre navegador e APIs documentadas alcançaram 38,9% de sucesso contra 14,8% dos que só navegam. Onde existe caminho estruturado, o agente prefere e performa melhor: daí o valor de dados estruturados e ferramentas explícitas.
O que é memória reflexiva em agentes de navegação?
É a capacidade de reconstruir um mapa do site conforme navega e usá-lo como heurística de busca (como o A* com estimativas de LLM no R2D2, 2025). O agente para de tentar no escuro: cada página visitada melhora o plano das próximas decisões.
Vale a pena preparar o site para agentes agora?
Sim, porque a preparação (semântica, estados claros, dados estruturados, ferramentas declaradas) já serve humanos, buscadores e IAs citadoras, e a direção da pesquisa (AWI, WebMCP) premia quem tiver a estrutura pronta quando os padrões amadurecerem. O custo é de pente-fino, não de reescrita.

Prepare o site para a próxima geração de robôs

A M&C estrutura sites semânticos para humanos, busca e agentes. Veja o audit de SEO técnico.

Continue lendo

Leia também

Fale conosco no WhatsApp