# Configurações padrão do rastreador de IA da Cloudflare em 15 de setembro: o que mudou para os agentes e as equipes de dados

Em 15 de setembro de 2026, a Cloudflare alterou o significado do termo “bloqueado” para o tráfego de IA. Novos domínios que geram receita com anúncios passam agora a ter os rastreadores de treinamento de IA desativados e os agentes de IA bloqueados em páginas com anúncios, enquanto a pesquisa permanece aberta. A Cloudflare afirma que mais de 20% da web está protegida por sua rede ([Blog da Cloudflare](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026); portanto, essa configuração padrão funciona de maneira muito semelhante a uma política que abrange um quinto da web. Após duas semanas, eis o que realmente mudou, quem é afetado e o que as equipes que operam agentes de IA ou pipelines de dados devem fazer a respeito.

> **Principais conclusões**
>
> - Desde 15 de setembro de 2026, a Cloudflare classifica o tráfego de IA em três categorias (Pesquisa, Treinamento, Agente), e novos domínios monetizados por anúncios começam com o tráfego de Treinamento de IA desativado e o tráfego de Agente bloqueado em páginas com anúncios ([Blog da Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026).
> - Em junho de 2026, 52% das solicitações de rastreadores observadas pela Cloudflare eram para treinamento de IA, um aumento em relação aos 22% registrados na primavera de 2025 ([Blog da Cloudflare](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026).
> - Se o seu agente busca páginas em nome de um usuário, agora você está no grupo “Agent”. Planeje-se para variações por página, e não para regras por site.

## O que exatamente mudou em 15 de setembro?

Em 15 de setembro de 2026, a Cloudflare alterou a forma como seus controles de bots lidam com o tráfego de IA ([Blog da Cloudflare, “Tenha o melhor dos dois mundos”](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Suas configurações “Bloquear” e “Bloquear em páginas com anúncios” agora também se aplicam a rastreadores de uso misto, os bots que coletam páginas tanto para pesquisa quanto para IA. O botão único “Bloquear bots de IA” está sendo descontinuado, e uma nova configuração, “Proibir treinamento de IA”, permite que um site permaneça nos resultados de pesquisa ao mesmo tempo em que recusa o treinamento. O robots.txt gerenciado passa a se chamar “Sincronização de preferências de bots”. A mudança prática é a divisão. A Cloudflare costumava tratar os “bots de IA” como uma única categoria. Agora, ela classifica o tráfego de IA em três categorias — Pesquisa, Treinamento e Agente — e oferece a cada uma delas seu próprio botão de ativação. Aos novos domínios é oferecida uma de duas predefinições, dependendo se o site gera receita com publicidade:

| Categoria | O que abrange | Novo domínio monetizado por publicidade | Novo domínio sem publicidade |
|--------|----------------|-------------------------|-------------------|
| Pesquisa | Indexação para resultados de pesquisa | Permitido | Permitido |
| Treinamento | Coleta de conteúdo para treinar modelos | Não permitir treinamento de IA | Permitido |
| Agente | Busca de páginas para uma solicitação em tempo real do usuário | Bloqueado em páginas com anúncios | Permitido |

*Predefinições conforme listadas na publicação da Cloudflare de 15 de setembro de 2026, [Tenha o melhor dos dois mundos](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/).*

Portanto, a web não mudou da noite para o dia. As configurações dos clientes existentes são migradas automaticamente, segundo a Cloudflare, e as novas predefinições se aplicam apenas quando um cliente adiciona um novo domínio. O que mudou foi o ponto de partida para todos os novos sites daqui em diante e, em uma rede desse porte, os pontos de partida se acumulam rapidamente.

## Por que a Cloudflare está dividindo os rastreadores em “Pesquisa”, “Treinamento” e “Agente”?

A Cloudflare dividiu seus controles de IA porque o tráfego de treinamento ultrapassou o tráfego de pesquisa. Em junho de 2026, 52% das solicitações de rastreadores observadas pela Cloudflare eram para treinamento de IA, um aumento em relação aos 22% registrados na primavera de 2025, e os rastreadores de uso misto representavam mais de 36% da atividade ([Cloudflare, “Content Independence Day, one year on”](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026). O rastreamento exclusivamente para pesquisa representa agora uma parcela pequena e em declínio. Para o proprietário de um site, isso significa que a maioria dos bots de IA que acessam suas páginas está coletando conteúdo para modelos, em vez de redirecionar leitores por meio de resultados de busca, e um único botão de “bots de IA” não tinha como distinguir entre eles.

Os editores consideram isso uma troca desigual. A TollBit, que auxilia os editores a licenciar conteúdo para empresas de IA, acompanha essa tendência em seu [relatório “State of the Bots”](https://tollbit.com/state-of-the-bots/). A edição do primeiro e segundo trimestres de 2026, abrangendo bots de IA de 40 fornecedores em 3.906 editores, mostrou que a proporção entre coleta de dados e encaminhamento subiu de 150:1 no primeiro trimestre para 227:1 no segundo trimestre (TollBit, 2026, conforme relatado pelo [Digiday](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/) em agosto de 2026). Isso significa centenas de visitas de bots para cada pessoa que clica no link.

Então, por que simplesmente não bloquear tudo? Porque menos de 1% dos sites da Cloudflare bloqueiam bots de busca, de acordo com a mesma publicação de setembro, enquanto 17% ativam algum recurso para bloquear o treinamento ([Blog da Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Os sites querem o tráfego do Google. Eles simplesmente não querem entregar dados de treinamento de graça. A divisão em três categorias permite que eles digam “sim” a um e “não” ao outro.

<!-- [VISÃO EXCLUSIVA] -->
Para quem desenvolve produtos de IA que navegam em nome do usuário, a categoria “Agente” é a que importa. Os rastreadores de treinamento estavam fadados a ficar em segundo plano. Os agentes são mais recentes e agora contam com seu próprio botão de ativação e sua própria configuração padrão, em vez de compartilhar um único botão de “bots de IA” com os rastreadores de treinamento.

## O que é um rastreador de uso misto “responsável”?

A Cloudflare define um rastreador de uso misto responsável como aquele cujo operador oferece aos proprietários de sites uma maneira de recusar o treinamento de IA (por meio do robots.txt ou de um padrão semelhante), controles de recusa para resumos de IA, visibilidade no nível da URL sobre o uso para treinamento e a garantia de que a recusa não prejudicará as classificações de pesquisa ([Blog da Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). A Cloudflare cita o Applebot, o Bingbot e o Googlebot como rastreadores de uso misto responsáveis. A empresa lista a Amazon, a Anthropic, a Meta e a OpenAI como operadores “responsáveis e separados”, pois utilizam rastreadores distintos para pesquisa e para treinamento. Rastreadores de uso misto responsáveis continuam sendo permitidos para pesquisa em sites que selecionarem a opção “Não permitir treinamento de IA”. Todos os demais rastreadores de treinamento são bloqueados nesses sites.

Isso cria um incentivo claro. Se o senhor opera um rastreador, o caminho para continuar sendo bem-vindo é separar suas finalidades ou conceder aos sites controles reais sobre cada uma delas. Um único bot que faz tudo é agora a coisa mais fácil de bloquear.

## O “Pay Per Crawl” passa a ser “Pay Per Use”

No modelo anterior da Cloudflare, o “Pay Per Crawl”, os sites podiam cobrar uma taxa dos rastreadores de IA por cada solicitação de página. Em julho de 2026, a Cloudflare anunciou que pagaria aos editores quando seu conteúdo influenciasse uma resposta de IA, e não apenas quando uma página fosse acessada. As empresas de busca por IA Ceramic.ai e You.com foram citadas como parceiras iniciais ([The Next Web](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers), 2026). Trata-se de uma mudança significativa no que é cobrado. Um rastreamento é uma única solicitação, enquanto um “uso” é o momento em que o conteúdo acaba fazendo parte de uma resposta que alguém lê. Para os editores, isso vincula o pagamento mais estreitamente ao valor. Para as empresas de IA, isso significa que o custo do conteúdo poderia passar a ser calculado com base no uso, em vez de no volume, o que altera a lógica por trás da decisão de se deve ou não buscar uma página.

Abordamos a versão anterior desse modelo e explicamos por que a web aberta começou a se fechar para os bots em [A web que se fecha: bloqueio de rastreadores de IA, pagamento por rastreamento e o que isso significa para os agentes](https://www.joinmassive.com/blog/the-closing-web-ai-crawler-blocking-pay-per-crawl-and-what-it-means-for-agents).

## O que as equipes que operam agentes de IA devem fazer agora?

Comece por aceitar que o acesso agora varia de página para página. Sob a nova configuração pré-definida de monetização por anúncios, um agente pode acessar a página de preços de um site e, em seguida, ser bloqueado no artigo patrocinado por anúncios ao lado dela.

Uma lista de verificação prática:

1. **Saiba em qual categoria você se encontra.** Acessar uma página porque um usuário fez uma pergunta é tráfego de agente. Coletar páginas para ajustar um modelo é treinamento. Identifique-as separadamente em seus próprios registros, pois a web agora as trata de maneira diferente.
2. **Esteja preparado para respostas específicas por página.** “Bloqueio em páginas com anúncios” significa que o mesmo domínio pode responder sim e não. Crie tentativas de repetição e alternativas por URL, não por domínio.
3. **Trate os bloqueios como sinais.** Um bloqueio sob essas configurações pré-definidas é uma preferência declarada pelo editor. Registre-o e contorne-o com uma fonte licenciada ou estruturada, quando houver.
4. **Fique atento ao modelo de pagamento por uso.** Se uma fonte da qual você depende aderir a um programa pago, pagar pode ser mais econômico do que contornar o bloqueio por meio de soluções de engenharia.
5. **Separe suas cargas de trabalho e identifique-as.** Se você gerenciar tanto o tráfego de treinamento quanto o de agentes, mantenha-os em identidades diferentes para que um não bloqueie o outro. A Cloudflare também opera um programa de “agentes assinados”: agentes direcionados por um usuário final podem assinar suas solicitações HTTP com o Web Bot Auth, um padrão criptográfico de assinatura de mensagens, para que a Cloudflare possa verificar quem eles são ([Documentação da Cloudflare, Agentes assinados](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)). Se o senhor opera um agente em qualquer escala, vale a pena ler.

<!-- [VISÃO EXCLUSIVA] -->
Vale a pena destacar uma armadilha. Para pipelines de agentes, as falhas que mais prejudicam geralmente não são bloqueios definitivos, que são fáceis de identificar. As próprias Páginas de Desafio da Cloudflare são o caso mais simples: todas elas contêm um cabeçalho `cf-mitigated: challenge`, e seu tipo de conteúdo é sempre `text/html`, independentemente do recurso solicitado ([Documentação da Cloudflare, Detectar uma resposta de página de desafio](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/)). Verifique se esse cabeçalho está presente antes de analisar qualquer coisa. O caso mais complicado é uma página parcial silenciosa: uma solicitação retorna um status 200, mas o corpo é uma página de preenchimento (um intersticial), um shell de JavaScript ou uma versão simplificada do artigo. Verifique o que foi retornado, não apenas o código de status. Um comprimento mínimo de conteúdo ou uma verificação de um elemento DOM que o(a) senhor(a) espera encontrar na página real detecta a maioria desses casos.

## Como a Massive se adapta aos novos padrões da Cloudflare

O Massive fornece uma rede de acesso a dispositivos e uma pilha de renderização que entrega HTML ou Markdown limpo a partir de páginas públicas, em qualquer um dos mais de 195 países. Os clientes executam suas próprias operações sobre essa base. As preferências de IA dos editores são sinais públicos, e as equipes com as quais trabalhamos as tratam como entradas para suas próprias políticas, não como obstáculos a serem contornados.

O [Web Render API](https://docs.joinmassive.com/web-render/overview) retorna páginas renderizadas como Markdown para pipelines de LLM e permite que os clientes direcionem geograficamente as solicitações por país, região ou cidade. Em proxies residenciais, cada conta também mantém sua própria [lista de bloqueio de domínios](https://docs.joinmassive.com/residential/domain-blocking), de modo que uma equipe pode bloquear solicitações a qualquer site que tenha decidido não acessar. A lista comporta até 1.000 domínios, e uma solicitação para um domínio bloqueado é recusada com um erro 452 (Conteúdo Não Permitido) antes mesmo de chegar ao site. Caso sua pilha de agentes esteja atingindo os novos padrões, consulte [por que os agentes de IA são bloqueados em IPs de data center e como corrigir isso](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it) ou volte ao guia completo sobre [como conceder aos agentes de IA acesso à web em tempo real](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access). Quanto aos aspectos jurídicos dos dados de treinamento, leia [os processos judiciais relacionados a dados de treinamento de IA que toda equipe de dados da web deve conhecer](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers).

## Perguntas frequentes

### A Cloudflare bloqueou todos os rastreadores de IA em 15 de setembro de 2026?

Não. As novas configurações padrão se aplicam a novos domínios que são integrados à Cloudflare, e as configurações existentes foram migradas automaticamente. A pesquisa continua permitida por padrão em todos os lugares. O tráfego de treinamento e de agentes é restrito por padrão apenas em novos domínios monetizados por anúncios, de acordo com a publicação da Cloudflare de 15 de setembro de 2026.

### O Googlebot é bloqueado pelas novas configurações da Cloudflare?

Não em sites que utilizam a opção “Despermitir treinamento de IA”. A Cloudflare classifica o Googlebot, o Bingbot e o Applebot como rastreadores de uso misto responsáveis, que continuam permitidos para pesquisa. No entanto, os sites que optam pela configuração completa de “Bloqueio” agora bloqueiam também os rastreadores de uso misto, o que pode afetar a visibilidade nas buscas.

### Qual é a diferença entre “Pay Per Crawl” e “Pay Per Use”?

O “Pay Per Crawl” cobrava dos rastreadores de IA por solicitação. O “Pay Per Use”, anunciado em julho de 2026, remunera os editores quando seu conteúdo contribui para a formação de uma resposta de IA. A Ceramic.ai e o You.com foram citados como primeiros parceiros, de acordo com a reportagem do The Next Web.

### Qual é a proporção do tráfego de rastreadores destinada ao treinamento de IA atualmente?

Em junho de 2026, a Cloudflare informou que 52% das solicitações de rastreadores em sua rede eram destinadas ao treinamento de IA, um aumento em relação aos 22% registrados na primavera de 2025. Os rastreadores de uso misto representavam mais de 36% da atividade.

## Conclusão

- A Cloudflare agora trata o tráfego de Pesquisa, Treinamento e Agentes como três decisões distintas, cada uma com sua própria configuração e seu próprio padrão para novos domínios.
- Novos domínios monetizados por anúncios começam com o Treinamento desativado e os Agentes bloqueados nas páginas de anúncios.
- O modelo “Pay Per Use” remunera os editores pelas respostas, não pelas consultas.
- Os desenvolvedores de agentes devem planejar o acesso por página, verificar se cada resposta contém o cabeçalho `cf-mitigated: challenge` e registrar cada bloqueio como uma preferência declarada pelo editor.
- Próximo ponto a ser observado: quais empresas de IA aderirão ao Pay Per Use e quantos agentes se registrarão como [agentes cadastrados](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/).

Deseja ver como as consultas renderizadas e direcionadas geograficamente se apresentam na prática? Comece pela [Web Render API visão geral](https://docs.joinmassive.com/web-render/overview).

## Fontes

- Cloudflare, ["Tenha o melhor dos dois mundos: mantenha-se visível nas buscas e, ao mesmo tempo, impeça o treinamento de IA"](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), consultado em 25/09/2026
- Cloudflare, ["Content Independence Day, um ano depois"](https://blog.cloudflare.com/agentic-internet-bot-report/), consultado em 25 de setembro de 2026
- The Next Web, ["Cloudflare estabelece prazo até setembro para rastreadores de IA"](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers), consultado em 25 de setembro de 2026
- Documentação da Cloudflare, [Agentes assinados](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)
- Documentação da Cloudflare, ["Detectar uma resposta da página de desafio"](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/), consultado em 28 de setembro de 2026
- TollBit, [Situação dos bots (1º e 2º trimestres de 2026)](https://tollbit.com/state-of-the-bots/)
- Digiday, ["Editora europeias estão sendo mais afetadas pela extração de dados por bots de IA, aponta relatório"](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/) (Dados do relatório “State of the Bots” da TollBit)
