Um agente de IA é um sistema que age no lugar de alguém (o usuário) para alcançar um objetivo: percebe o mundo por "sensores" (o que lê da página), decide a ação (hoje, quase sempre um LLM) e executa por "atuadores" (clique, digitação, navegação). A diferença para a automação tradicional: o agente decide em tempo real, sem passos fixos pré-codificados. Ele opera em um ciclo de perceber → decidir → agir → observar, repetindo até concluir. Para o dono do site, surge um visitante novo: além do humano e do robô de indexação, agora existe o agente tentando completar jornadas (comprar, agendar, comparar) dentro da sua página.
O que é um agente de IA?
A definição clássica da literatura de IA: agente é uma entidade que age em nome de outra, percebendo o ambiente por sensores e agindo sobre ele por atuadores, com um objetivo definido pelo principal. Traduzindo para a web: o usuário diz "compre o voo mais barato para Recife no dia 15", e o agente navega pelo site da companhia, compara, preenche e conclui. A automação tradicional (os scripts com seletores fixos) também executa ações, mas quebra quando o site muda um pixel: ela não decide. O agente decide.
A inteligência vem de três famílias de abordagem, usadas em combinação: busca (modelar o mundo e buscar o caminho até o objetivo), aprendizado por reforço (descobrir a melhor política por tentativa e erro) e redes neurais (generalizar a partir de exemplos). O LLM trouxe a generalização que faltava: um mesmo agente consegue operar em sites que nunca viu, interpretando a página como texto.
Como funciona o ciclo do agente
O ciclo segue de perto os Sete Estágios de Ação de Don Norman, referência clássica de usabilidade: objetivo → intenção → plano → execução → percepção → interpretação → avaliação, repetido até o objetivo ser alcançado. Em cada volta do ciclo, o agente olha o que mudou na página, decide se está no caminho e escolhe a próxima ação. Quando erra, existem dois tipos de erro com nomes próprios: o deslize de execução (clicou no botão errado: recuperável na próxima volta do ciclo) e o erro de plano (escolheu o caminho errado: exige replanejamento). A maioria dos erros é recuperável, e é por isso que agentes funcionam em sites imperfeitos, só que mais devagar.
Uma nuance técnica que explica boa parte das falhas: a navegação web é formalmente um POMDP, um problema de informação parcialmente observável. O agente nunca vê o estado completo do sistema (o que acontece no servidor, o que o JavaScript esconde): ele infere a partir do que a página mostra. Heurística de Nielsen de cá, golfo de percepção de lá: o site que não comunica seu estado deixa humanos e agentes igualmente perdidos.
A arquitetura: LLM + sensores + atuadores
Um agente de navegação web tem três peças. Sensores: a representação da página que o agente consegue ler, geralmente o DOM, a árvore de acessibilidade ou uma captura de tela (o próximo post desta série detalha as três). Atuadores: as ações possíveis (clique, digitação, scroll, seleção), com alvo definido por coordenadas ou seletores. O cérebro: o LLM que lê o snapshot da página, sugere a ação e verifica se o objetivo foi atingido. Entre o cérebro e os atuadores existe ainda o harness: a lógica intermediária que decompõe a tarefa, mantém histórico, trata erros e timeouts e carrega as instruções de sistema. É o harness que transforma uma resposta de LLM em uma sequência confiável de cliques.
Até agora, seu site conversava com dois públicos de máquinas: o crawler que indexa (lê) e o scanner que testa. O agente é o terceiro: ele age. Preenche formulários, compara preços, tenta concluir a compra. Um site legível para humano, semântico e com estados claros serve aos três; um site que esconde a informação atrás de JavaScript pesado ou de divs sem nome atendível trava o agente no meio da jornada. O guia de como agentes de IA veem seu site detalha essa parte técnica.
Para que servem na prática
- Jornadas de consumo: pesquisar, comparar e contratar (voo, hotel, plano) em sites sem API pública: o agente usa a interface que já existe.
- Tarefas repetitivas de trabalho: preencher sistemas internos, extrair dados de portais, conciliar informações entre telas.
- Assistência com supervisão: os agentes mais maduros operam em modo colaborativo: a pessoa acompanha, pausa e corrige (o estudo do CowPilot registrou até 95% de acerto com intervenção humana em cerca de 15% dos passos).
Os limites honestos da tecnologia
A base de pesquisa ainda está em construção: o estudo MAST (2025) documentou taxas de falha de 41% a 86,7% em sete sistemas multiagente, e o Stanford AI Index estima que agentes autônomos falham em cerca de 1 em cada 3 tentativas. Generalizar para sites nunca vistos segue sendo o obstáculo central da área. Para o dono do site, a leitura prática é dupla: agentes vão errar no seu site (e cabe a você facilitar o que estiver ao alcance: semântica, estados, recuperação), e o tráfego que eles representam ainda é minoritário, mas cresce sobre a base que os concorrentes estão preparando agora.