A partir do dia 15 de setembro, a decisão de deixar entrar ou barrar deixa de ser omissão e passa a ter um padrão definido por terceiros.
As quatro funções de bot de IA que se confundem
A discussão pública trata bot de IA como categoria única, e o efeito de bloquear cada tipo é completamente distinto. Quatro funções precisam ser separadas antes de qualquer decisão.
| Função | O que o bot faz | O que você perde ao bloquear |
|---|---|---|
| Treinamento | Coleta conteúdo para treinar modelos. O uso é futuro e difuso. | Nada de imediato em tráfego. Perde participação no corpus que forma o conhecimento do modelo. |
| Busca e indexação | Monta o índice que alimenta respostas com citação, no estilo de um buscador. | Citação e link em respostas geradas. É a perda mais cara para quem quer visibilidade. |
| Agente a pedido | Busca a página no momento em que uma pessoa pede algo ao assistente. | Acesso do seu próprio público quando ele usa um assistente para chegar até você. |
| Dupla função | Um mesmo user agent alimenta busca tradicional e recursos de IA. | Presença na busca tradicional junto com a de IA, porque o bloqueio atinge as duas. |
Quem é quem, bot por bot e operador por operador
| Operador | User agent | Categoria |
|---|---|---|
| OpenAI | GPTBot | AI Crawler, treinamento |
| OpenAI | OAI-SearchBot | AI Search, indexação para citação |
| OpenAI | ChatGPT-User | AI Assistant, busca a pedido |
| Anthropic | ClaudeBot | AI Crawler, treinamento |
| Anthropic | Claude-SearchBot | AI Search |
| Anthropic | Claude-User | AI Assistant |
| Perplexity | PerplexityBot | AI Search |
| Perplexity | Perplexity-User | AI Assistant |
| Googlebot | Buscador | |
| Google-CloudVertexBot | AI Crawler, a pedido do dono do site | |
| Microsoft | bingbot | Buscador |
| Apple | Applebot | AI Search |
| Meta | meta-externalagent | AI Crawler |
| Meta | meta-externalfetcher | AI Assistant |
| Meta | FacebookBot | AI Crawler |
| ByteDance | Bytespider | AI Crawler |
| Common Crawl | CCBot | AI Crawler |
| Amazon | Amazonbot | AI Crawler |
| DuckDuckGo | DuckAssistBot | AI Assistant |
| Mistral | MistralAI-User | AI Assistant |
A armadilha do crawler multipropósito
O caso do Google, que quase todo mundo erra
Quando bloquear cada tipo de bot, por negócio
| Tipo de negócio | Treinamento | Busca e agente |
|---|---|---|
| Mídia com anúncio | Bloquear. O conteúdo é o produto e o retorno do treinamento é zero. | Permitir busca. Avaliar agente conforme a política de paywall. |
| E-commerce | Permitir ou bloquear conforme a política de catálogo. | Permitir os dois. Citação em resposta e agente de compra são canal de venda. |
| SaaS e serviços | Bloquear treinamento faz pouca diferença prática. | Permitir os dois. A citação é o principal ganho de descoberta. |
| Consultoria e marca pessoal | Permitir. Estar no corpus favorece ser lembrada pelo modelo. | Permitir os dois, sem exceção. |
| Conteúdo pago ou sob assinatura | Bloquear. | Permitir busca apenas nas páginas abertas, com o restante protegido por autenticação. |
O erro de bloqueio que eu mais encontro em auditoria
Não confio em robots.txt com quarenta linhas de exceção. Quem escreve quarenta linhas de pedido educado costuma não ter aberto o log para ver quem entrou ignorando as quarenta.
O bloqueio genérico de tudo que tem nome de IA no robots.txt, escrito em uma tarde, sem separar treinamento de busca. O resultado é uma marca que sai das respostas geradas e continua no corpus dos modelos que ignoram robots.txt, o que junta o pior dos dois cenários.
O segundo erro mais comum é o oposto, e vem de omissão. Deixar tudo aberto sem saber quem entra, e descobrir a resposta apenas quando o custo de banda aparece na fatura.
Content Use Signals no robots.txt
O que fazer antes de 15 de setembro
- Levantar quais bots acessam o seu site hoje, com registro de acesso ou com o painel de controle de crawlers de IA da sua CDN.
- Separar a decisão em duas: treinamento é uma escolha de propriedade intelectual, busca e agente são uma escolha de distribuição.
- Conferir se o seu domínio se enquadra no padrão novo, o que depende de ser domínio novo na Cloudflare e de exibir anúncios.
- Antes de ligar qualquer bloqueio de treinamento, conferir se ele alcança rastreador de dupla função, e tratar Googlebot, Applebot e Bingbot como caso à parte.
- Documentar a decisão no robots.txt com comentário datado, para que a próxima pessoa entenda a intenção sem precisar adivinhar.
Referências
Cada fonte foi conferida na data indicada na entrada.
- CLOUDFLARE. Your site, your rules: new AI traffic options for all customers. Cloudflare Blog, 1 jul. 2026. Disponível em: https://blog.cloudflare.com/content-independence-day-ai-options/. Acesso em: 11 set. 2026.
- CLOUDFLARE. Block AI bots. Cloudflare Docs. Disponível em: https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/. Acesso em: 11 set. 2026.
- GOOGLE. Visão geral dos rastreadores e fetchers do Google. Google Search Central. Disponível em: https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers. Acesso em: 09 set. 2026.
Referências
Referências
Cada fonte foi conferida na data de acesso indicada.
-
Artigo
Your site, your rules: new AI traffic options for all customers
Cloudflare Blog · 01/07/2026
-
Documentação oficial
Cloudflare AI Crawl Control docs
-
Documentação oficial
List of Google's common crawlers
Google for Developers
-
Documentação oficial
Google Search Central