Um agente de deep research pesquisa como um analista júnior: 1) planeja (decompõe a pergunta ampla em sub-perguntas ordenadas), 2) executa (agentes trabalhadores fazem buscas web em várias iterações), 3) replaneja (decide entre novos passos ou resposta final) e 4) sintetiza (produz a resposta com fontes rastreáveis). A arquitetura dominante é plan-and-execute, implementada em grafos de orquestração (LangGraph e equivalentes). As taxas de falha reais: o estudo MAST documentou 41% a 86,7% de falhas em sistemas multiagente, e o Stanford AI Index estima falha autônoma em 1 em 3 tentativas. Para o dono de conteúdo: o deep research lê dezenas de fontes por resposta, e cita as com blocos autocontíveis, dado próprio e fonte nomeada.
O que é deep research?
Deep research é a categoria de agente que executa pesquisa de ponta a ponta: recebe uma pergunta ampla ("qual o melhor CRM para clínica de 3 médicos no Brasil?"), decompõe em sub-perguntas, busca na web iterativamente, cruza fontes e entrega um relatório com citações. A diferença para a busca comum é o número de iterações: uma resposta de busca consome uma consulta; um deep research consome dezenas, em várias rodadas de leitura e refinamento. OpenAI, Google (Deep Research no Gemini) e Perplexity têm produtos nessa categoria, e o padrão técnico é compartilhado.
A arquitetura plan-and-execute
- Planejador (planner): recebe a pergunta e gera passos estruturados e ordenados, cada um verificável. A qualidade do plano é o teto do resultado: plano raso entrega relatório raso.
- Trabalhadores (workers): agentes de execução que fazem as buscas de cada passo e devolvem achados. A prática de engenharia usa modelo forte no planejador e modelos menores nos trabalhadores: o custo de chamadas repetidas exige o equilíbrio.
- Replanejador (replanner): o nó crítico: diante do que os trabalhadores trouxeram, decide entre gerar novos passos (lacuna de informação) ou declarar a resposta pronta. É o replanejamento que separa o deep research da busca encadeada simples.
- Estado compartilhado: os passos concluídos se acumulam em um estado comum, alimentando cada decisão seguinte.
Variação relevante citada na engenharia de 2026: o padrão orquestrador-trabalhadores da Anthropic (um modelo líder decompondo e distribuindo para trabalhadores) registrou ganho de 90,2% sobre o agente único na pesquisa paralela, evidência de que a arquitetura multiagente, quando bem avaliada, supera o agente solitário.
Como avaliar (e por que a maioria não avalia)
O erro clássico: julgar só o relatório final. A prática madura avalia trajetórias: o planejador escolheu as sub-perguntas certas? Os trabalhadores citaram fontes reais ou alucinaram? A síntese aderiu ao que as fontes disseram? Métricas do guia de engenharia: qualidade de seleção de ferramenta, aderência ao contexto e detecção de erro de ferramenta. E os números de referência dão a dimensão do problema: juízes LLM genéricos têm apenas 66% a 68% de concordância com humanos na avaliação, e o estudo MAST documenta falhas de 41% a 86,7% em sete sistemas multiagente. Gartner projeta que mais de 40% dos projetos de IA agêntica serão cancelados até 2027 por custo, valor incerto e risco: a avaliação ausente é a causa raiz mais citada.
O deep research é o fan-out em escala máxima: dezenas de buscas subjacentes por relatório, cada uma uma chance de sua página ser a fonte. O conteúdo que sobrevive à síntese: blocos autocontíveis (a resposta completa em um parágrafo de 80 a 300 palavras), dados próprios que nenhuma outra fonte tem, fonte nomeada com ano em cada número e estrutura de pergunta-resposta. É a mesma receita do formato que as IAs citam, com a régua mais alta: no deep research, a fonte que não sustenta o recorte é descartada em favor da que sustenta.
Os limites honestos
- Falha em cascata: um passo ruim contamina a síntese; sem replanejamento robusto, o relatório final herda o erro do meio da trajetória.
- Confiança sem verificação: o relatório chega com cara de autoridade e citações; conferir as fontes continua sendo trabalho humano, e a síntese pode distorcer o que a fonte diz.
- Custo de iterações: dezenas de chamadas por relatório: sem modelo menor nos trabalhadores, a conta não fecha (o Gartner já projeta cancelamento em massa por custo).
- Recência e Brasil: buscas em português têm menos material de alta qualidade indexado, o que aumenta o valor relativo de quem publica conteúdo técnico sólido no idioma.
A leitura de fundo para o mercado brasileiro: cada relatório de deep research é uma lista de fontes escolhidas. Quem está nelas herda a autoridade da resposta inteira; quem não está, não existe na pesquisa. A preparação é a mesma da citação em IA, começando pela página estruturada em 12 elementos.