Agentes e infraestrutura

Bots de IA: o que cada um faz, quando bloquear e o que você perde

By 11 de setembro de 2026No Comments

A partir do dia 15 de setembro, a decisão de deixar entrar ou barrar deixa de ser omissão e passa a ter um padrão definido por terceiros.

As quatro funções de bot de IA que se confundem

A discussão pública trata bot de IA como categoria única, e o efeito de bloquear cada tipo é completamente distinto. Quatro funções precisam ser separadas antes de qualquer decisão.

FunçãoO que o bot fazO que você perde ao bloquear
TreinamentoColeta conteúdo para treinar modelos. O uso é futuro e difuso.Nada de imediato em tráfego. Perde participação no corpus que forma o conhecimento do modelo.
Busca e indexaçãoMonta o índice que alimenta respostas com citação, no estilo de um buscador.Citação e link em respostas geradas. É a perda mais cara para quem quer visibilidade.
Agente a pedidoBusca a página no momento em que uma pessoa pede algo ao assistente.Acesso do seu próprio público quando ele usa um assistente para chegar até você.
Dupla funçãoUm mesmo user agent alimenta busca tradicional e recursos de IA.Presença na busca tradicional junto com a de IA, porque o bloqueio atinge as duas.

Quem é quem, bot por bot e operador por operador

OperadorUser agentCategoria
OpenAIGPTBotAI Crawler, treinamento
OpenAIOAI-SearchBotAI Search, indexação para citação
OpenAIChatGPT-UserAI Assistant, busca a pedido
AnthropicClaudeBotAI Crawler, treinamento
AnthropicClaude-SearchBotAI Search
AnthropicClaude-UserAI Assistant
PerplexityPerplexityBotAI Search
PerplexityPerplexity-UserAI Assistant
GoogleGooglebotBuscador
GoogleGoogle-CloudVertexBotAI Crawler, a pedido do dono do site
MicrosoftbingbotBuscador
AppleApplebotAI Search
Metameta-externalagentAI Crawler
Metameta-externalfetcherAI Assistant
MetaFacebookBotAI Crawler
ByteDanceBytespiderAI Crawler
Common CrawlCCBotAI Crawler
AmazonAmazonbotAI Crawler
DuckDuckGoDuckAssistBotAI Assistant
MistralMistralAI-UserAI Assistant

A armadilha do crawler multipropósito

O caso do Google, que quase todo mundo erra

Quando bloquear cada tipo de bot, por negócio

Tipo de negócioTreinamentoBusca e agente
Mídia com anúncioBloquear. O conteúdo é o produto e o retorno do treinamento é zero.Permitir busca. Avaliar agente conforme a política de paywall.
E-commercePermitir ou bloquear conforme a política de catálogo.Permitir os dois. Citação em resposta e agente de compra são canal de venda.
SaaS e serviçosBloquear treinamento faz pouca diferença prática.Permitir os dois. A citação é o principal ganho de descoberta.
Consultoria e marca pessoalPermitir. Estar no corpus favorece ser lembrada pelo modelo.Permitir os dois, sem exceção.
Conteúdo pago ou sob assinaturaBloquear.Permitir busca apenas nas páginas abertas, com o restante protegido por autenticação.

O erro de bloqueio que eu mais encontro em auditoria

Não confio em robots.txt com quarenta linhas de exceção. Quem escreve quarenta linhas de pedido educado costuma não ter aberto o log para ver quem entrou ignorando as quarenta.

O bloqueio genérico de tudo que tem nome de IA no robots.txt, escrito em uma tarde, sem separar treinamento de busca. O resultado é uma marca que sai das respostas geradas e continua no corpus dos modelos que ignoram robots.txt, o que junta o pior dos dois cenários.

O segundo erro mais comum é o oposto, e vem de omissão. Deixar tudo aberto sem saber quem entra, e descobrir a resposta apenas quando o custo de banda aparece na fatura.

Content Use Signals no robots.txt

O que fazer antes de 15 de setembro

  • Levantar quais bots acessam o seu site hoje, com registro de acesso ou com o painel de controle de crawlers de IA da sua CDN.
  • Separar a decisão em duas: treinamento é uma escolha de propriedade intelectual, busca e agente são uma escolha de distribuição.
  • Conferir se o seu domínio se enquadra no padrão novo, o que depende de ser domínio novo na Cloudflare e de exibir anúncios.
  • Antes de ligar qualquer bloqueio de treinamento, conferir se ele alcança rastreador de dupla função, e tratar Googlebot, Applebot e Bingbot como caso à parte.
  • Documentar a decisão no robots.txt com comentário datado, para que a próxima pessoa entenda a intenção sem precisar adivinhar.

Referências

Cada fonte foi conferida na data indicada na entrada.

  1. CLOUDFLARE. Your site, your rules: new AI traffic options for all customers. Cloudflare Blog, 1 jul. 2026. Disponível em: https://blog.cloudflare.com/content-independence-day-ai-options/. Acesso em: 11 set. 2026.
  2. CLOUDFLARE. Block AI bots. Cloudflare Docs. Disponível em: https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/. Acesso em: 11 set. 2026.
  3. GOOGLE. Visão geral dos rastreadores e fetchers do Google. Google Search Central. Disponível em: https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers. Acesso em: 09 set. 2026.

Referências

Referências

Cada fonte foi conferida na data de acesso indicada.

  1. Artigo

    Your site, your rules: new AI traffic options for all customers

    Cloudflare Blog · 01/07/2026

  2. Documentação oficial

    Bot reference

    Cloudflare AI Crawl Control docs

  3. Documentação oficial

    List of Google's common crawlers

    Google for Developers

  4. Documentação oficial

    AI features and your website

    Google Search Central