Não. As novas configurações padrão se aplicam a novos domínios que forem integrados ao Cloudflare, e as configurações existentes são migradas automaticamente. A pesquisa continua permitida por padrão em todos os casos. O tráfego de treinamento e de agentes é restrito por padrão apenas em novos domínios monetizados por anúncios, de acordo com a publicação da Cloudflare de 15 de setembro de 2026.
Configurações padrão do rastreador de IA da Cloudflare de 15 de setembro: o que mudou para os agentes e as equipes de dados
Em 15 de setembro de 2026, a Cloudflare alterou o significado do termo “bloqueado” para o tráfego de IA. Novos domínios que geram receita com anúncios agora têm, inicialmente, os rastreadores de treinamento de IA desativados e os agentes de IA bloqueados em páginas com anúncios, enquanto a Pesquisa permanece aberta. A Cloudflare afirma que mais de 20% da web está protegida por sua rede (Blog da Cloudflare, 2026), de modo que uma configuração padrão neste caso funciona de maneira muito semelhante a uma política que abrange um quinto da web. Após duas semanas, eis o que realmente mudou, quem é afetado e o que as equipes que utilizam agentes de IA ou pipelines de dados devem fazer a respeito.
Principais conclusões
- Desde 15 de setembro de 2026, a Cloudflare classifica o tráfego de IA em três categorias (Pesquisa, Treinamento, Agente), e os novos domínios monetizados por anúncios começam com o tráfego de “Treinamento de IA” desativado e o tráfego de “Agente” bloqueado em páginas com anúncios (Blog da Cloudflare, 2026).
- Em junho de 2026, 52% das solicitações de rastreadores registradas pela Cloudflare referiam-se ao treinamento de IA, um aumento em relação aos 22% registrados na primavera de 2025 (Blog da Cloudflare, 2026).
- Se o seu agente estiver recuperando páginas em nome de um usuário, você está agora no grupo “Agente”. Planeje levando em conta variações por página, e não regras por site.
O que exatamente mudou no dia 15 de setembro?
Em 15 de setembro de 2026, a Cloudflare alterou a forma como seus controles de bots lidam com o tráfego de IA (Blog da Cloudflare, “Tenha o melhor dos dois mundos”, 2026). Suas configurações “Bloquear” e “Bloquear em páginas com anúncios” agora também se aplicam aos rastreadores de uso misto, os bots que coletam páginas tanto para pesquisa quanto para IA. O botão único “Bloquear bots de IA” está sendo descontinuado, e uma nova configuração, “Não permitir treinamento de IA”, permite que um site permaneça nos resultados de pesquisa ao mesmo tempo em que recusa o treinamento. O arquivo robots.txt gerenciado passa a se chamar “Sincronização de preferências de bots”. A mudança prática é a divisão. A Cloudflare costumava tratar os “bots de IA” como uma única categoria. Agora, ela classifica o tráfego de IA em três grupos — Pesquisa, Treinamento e Agente — e atribui a cada um deles seu próprio botão de ativação. Aos novos domínios é oferecida uma das duas predefinições, dependendo se o site gera receita com publicidade:
As predefinições listadas na publicação da Cloudflare de 15 de setembro de 2026, Ter o melhor dos dois mundos.
Portanto, a web não mudou da noite para o dia. As configurações dos clientes existentes são migradas automaticamente, segundo a Cloudflare, e as novas predefinições se aplicam apenas quando um cliente adiciona um novo domínio. O que mudou foi o ponto de partida para todos os novos sites a partir de agora e, em uma rede desse porte, os pontos de partida se acumulam rapidamente.
Por que a Cloudflare está dividindo os rastreadores em “Pesquisa”, “Treinamento” e “Agente”?
A Cloudflare separou seus controles de IA porque o tráfego de treinamento ultrapassou o tráfego de pesquisa. Em junho de 2026, 52% das solicitações de rastreadores observadas pela Cloudflare destinavam-se ao treinamento de IA, um aumento em relação aos 22% registrados na primavera de 2025, e os rastreadores de uso misto representavam mais de 36% da atividade (Cloudflare, “Dia da Independência do Conteúdo: um ano depois”, 2026). O rastreamento exclusivamente para fins de pesquisa representa atualmente uma parcela pequena e cada vez menor. Para o proprietário de um site, isso significa que a maioria dos bots de IA que acessam suas páginas está coletando conteúdo para modelos, em vez de encaminhar leitores por meio dos resultados de pesquisa, e um único botão de “bots de IA” não tinha como distinguir entre eles.
As editoras consideram isso uma relação comercial desigual. A TollBit, que auxilia as editoras a licenciar conteúdo para empresas de IA, acompanha essa situação em seu Relatório “State of the Bots”. A edição do primeiro e segundo trimestres de 2026, que abrange bots de IA de 40 fornecedores em 3.906 editoras, mostrou que a proporção entre conteúdo extraído e conteúdo indicado subiu de 150:1 no primeiro trimestre para 227:1 no segundo trimestre (TollBit, 2026, conforme relatado por Digiday em agosto de 2026). São centenas de acessos de bots para cada pessoa que clica no link.
Então, por que não bloquear simplesmente tudo? Porque menos de 1% dos sites da Cloudflare bloqueiam robôs de busca, de acordo com a mesma publicação de setembro, enquanto 17% ativam algum recurso para impedir o treinamento (Blog da Cloudflare, 2026). Os sites querem tráfego do Google. Só não querem fornecer dados de treinamento de graça. A divisão em três categorias permite que eles aceitem uma coisa e recusem a outra.
Para quem estiver desenvolvendo produtos de IA que navegam em nome do usuário, a categoria “Agente” é a que mais importa. Era inevitável que os rastreadores de treinamento fossem prejudicados. Os agentes são mais recentes e agora contam com seu próprio botão de ativação e sua própria configuração padrão, em vez de compartilharem um único botão de “Bots de IA” com os rastreadores de treinamento.
O que é um “crawler de uso misto responsável”?
A Cloudflare define um rastreador de uso misto responsável como aquele cujo operador oferece aos proprietários de sites uma forma de recusar o treinamento de IA (por meio do arquivo robots.txt ou de um padrão semelhante), controles de recusa para resumos gerados por IA, visibilidade no nível da URL sobre o uso para treinamento e a garantia de que a recusa não prejudicará as classificações nas buscas (Blog da Cloudflare, 2026). A Cloudflare identifica o Applebot, o Bingbot e o Googlebot como rastreadores de uso misto responsáveis. Ela lista a Amazon, a Anthropic, a Meta e a OpenAI como operadoras “responsáveis separadas”, pois utilizam rastreadores distintos para pesquisa e para treinamento. Os rastreadores de uso misto responsáveis continuam sendo permitidos para pesquisa em sites que selecionem a opção “Não permitir treinamento de IA”. Todos os demais rastreadores de treinamento são bloqueados nesses sites.
Isso cria um incentivo claro. Se o senhor opera um rastreador, a maneira de continuar sendo bem-vindo é separar suas finalidades ou conceder aos sites controles reais sobre cada uma delas. Um único bot que faz tudo é, atualmente, a coisa mais fácil de bloquear.
O “Pagamento por rastreamento” passa a ser “Pagamento por uso”
No modelo anterior da Cloudflare, o “Pay Per Crawl”, os sites podiam cobrar uma taxa dos rastreadores de IA por cada solicitação de página. Em julho de 2026, a Cloudflare anunciou que pagaria aos editores quando seu conteúdo fosse utilizado para formar uma resposta de IA, e não apenas quando uma página fosse acessada. As empresas de busca por IA Ceramic.ai e You.com foram apontadas como parceiras iniciais (The Next Web, 2026). Trata-se de uma verdadeira mudança no que é objeto de precificação. Um rastreamento (crawl) é uma única solicitação, enquanto um “uso” é o momento em que o conteúdo aparece em uma resposta que alguém lê. Para os editores, isso vincula o pagamento mais estreitamente ao valor. Para as empresas de IA, isso significa que o custo do conteúdo poderá passar a ser calculado com base no uso, em vez do volume, o que altera a lógica por trás da decisão de se deve ou não buscar uma página.
Abordamos a versão anterior deste modelo e explicamos por que a web aberta começou a se fechar para os bots, em A rede que se fecha: bloqueio de rastreadores de IA, pagamento por rastreamento e o que isso significa para os agentes.
O que as equipes que utilizam agentes de IA devem fazer agora?
Comece por aceitar que o acesso agora varia de página para página. Com a nova configuração padrão de monetização por anúncios, um agente pode acessar a página de preços de um site e, em seguida, ter seu acesso bloqueado no artigo com anúncios que está ao lado.
Uma lista de verificação prática:
- Saiba em qual categoria você se encaixa. A recuperação de uma página porque um usuário fez uma pergunta é considerado tráfego de agente. A coleta de páginas para ajustar um modelo é considerada treinamento. Identifique-os separadamente em seus próprios registros, pois a web agora os trata de maneira diferente.
- Esperem respostas por página. “Bloquear em páginas com anúncios” significa que um mesmo domínio pode responder tanto “sim” quanto “não”. Defina tentativas de repetição e alternativas por URL, e não por domínio.
- Trate os bloqueios como sinais. Um bloqueio decorrente dessas configurações pré-definidas representa a preferência declarada de um editor. Registre-o e contorne-o utilizando uma fonte licenciada ou estruturada, caso exista.
- Fique atento ao sistema de pagamento por uso. Se uma fonte da qual o senhor depende aderir a um programa pago, pagar por ela pode sair mais barato do que tentar contornar a situação.
- Separe suas cargas de trabalho e identifique-as. Caso você execute tanto o tráfego de treinamento quanto o de agentes, mantenha-os em identidades diferentes para que um não bloqueie o outro. A Cloudflare também mantém um programa de “agentes assinados”: os agentes direcionados por um usuário final podem assinar suas solicitações HTTP com o Web Bot Auth, um padrão criptográfico de assinatura de mensagens, para que a Cloudflare possa verificar quem eles são (Documentação da Cloudflare, Agentes assinados). Se o senhor opera um agente em qualquer escala, vale a pena ler.
Vale a pena destacar uma armadilha. No caso dos pipelines de agentes, as falhas que causam mais prejuízo geralmente não são bloqueios definitivos, que são fáceis de identificar. As próprias Páginas de Desafio da Cloudflare são o caso mais simples: cada uma delas contém um cf-mitigated: challenge cabeçalho, e seu tipo de conteúdo é sempre text/html, seja qual for o recurso que o(a) senhor(a) tenha solicitado (Documentação da Cloudflare: Como detectar uma resposta da página de desafio). Verifique se esse cabeçalho está presente antes de analisar qualquer conteúdo. O caso mais complexo é o de uma página parcial “silenciosa”: uma solicitação retorna um código de status 200, mas o corpo é uma página provisória (um intersticial), um shell de JavaScript ou uma versão reduzida do artigo. Verifique o que foi retornado, não apenas o código de status. Um comprimento mínimo de conteúdo ou uma verificação de um elemento DOM que você espera encontrar na página real detecta a maioria desses casos.
Como o Massive se adapta às novas configurações padrão da Cloudflare
Massive oferece uma rede de acesso a dispositivos e uma pilha de renderização que fornece HTML ou Markdown limpo a partir de páginas públicas, em qualquer um dos mais de 195 países. Os clientes administram suas próprias operações com base nisso. As preferências de IA dos editores são sinais públicos, e as equipes com as quais trabalhamos as tratam como inputs para suas próprias políticas, e não como obstáculos a serem contornados.
O Web Render API retorna páginas renderizadas no formato Markdown para pipelines de LLM e permite que os clientes direcionem geograficamente as solicitações por país, região ou cidade. Nos proxies residenciais, cada conta também mantém seu próprio lista de domínios bloqueados, de modo que uma equipe possa bloquear solicitações a qualquer site ao qual tenha decidido não acessar. A lista comporta até 1.000 domínios, e uma solicitação a um domínio bloqueado é recusada com um erro 452 (Conteúdo Não Permitido) antes mesmo de chegar ao site. Caso sua pilha de agentes esteja atingindo os novos padrões, consulte Por que os agentes de IA são bloqueados em endereços IP de data centers e como resolver isso, ou volte ao guia completo em como conceder aos agentes de IA acesso à web em tempo real. Para conhecer os aspectos jurídicos relacionados aos dados de treinamento, leia Os processos judiciais relacionados aos dados de treinamento de IA que toda equipe de dados da web deve conhecer.
Conclusão
- A Cloudflare agora trata o tráfego de Pesquisa, Treinamento e Agente como três decisões distintas, cada uma com seu próprio botão de ativação e sua própria configuração padrão para novos domínios.
- Novos domínios monetizados por anúncios começam com o recurso “Treinamento” desativado e os “Agentes” bloqueados nas páginas de anúncios.
- O modelo “Pay Per Use” remunera os editores pelas respostas, e não pelas consultas.
- Os desenvolvedores de agentes devem planejar o acesso por página e verificar cada resposta quanto ao
cf-mitigated: challengecabeçalho e registrar cada bloco como uma preferência declarada pelo editor. - O que acompanhar a seguir: quais empresas de IA aderirão ao Pay Per Use e quantos agentes se cadastrarão como agentes autorizados.
Gostaria de ver como funcionam, na prática, as consultas renderizadas e direcionadas geograficamente? Comece com o Web Render API visão geral.
Fontes
- Cloudflare, "Consegua o melhor dos dois mundos: mantenha-se visível nos resultados de busca e, ao mesmo tempo, impeça o treinamento de IA", consultado em 25 de setembro de 2026
- Cloudflare, "O Dia da Independência do Conteúdo: um ano depois", consultado em 25 de setembro de 2026
- The Next Web, "A Cloudflare estabelece o prazo de setembro para os rastreadores de IA", consultado em 25 de setembro de 2026
- Documentação da Cloudflare, Agentes contratados
- Documentação da Cloudflare, "Detectar uma resposta da página de desafio", consultado em 28 de setembro de 2026
- TollBit, Situação dos bots (1º e 2º trimestres de 2026)
- Digiday, "Relatório revela que as editoras europeias estão sendo mais fortemente afetadas pela extração de conteúdo por bots de IA" (Dados do relatório “State of the Bots” da TollBit)
Perguntas frequentes
Não em sites que utilizam a opção “Desativar treinamento de IA”. A Cloudflare classifica o Googlebot, o Bingbot e o Applebot como rastreadores de uso misto confiáveis, que continuam sendo permitidos para fins de pesquisa. No entanto, os sites que optam pela configuração “Bloquear” total passam a bloquear também os rastreadores de uso misto, o que pode afetar a visibilidade nas pesquisas.
O modelo “Pay Per Crawl” cobrava dos rastreadores de IA por solicitação. O modelo “Pay Per Use”, anunciado em julho de 2026, remunera os editores quando seu conteúdo contribui para a formulação de uma resposta de IA. A Ceramic.ai e a You.com foram citadas como parceiras iniciais, de acordo com a reportagem do The Next Web.
Em junho de 2026, a Cloudflare informou que 52% das solicitações de rastreadores em sua rede eram destinadas ao treinamento de IA, um aumento em relação aos 22% registrados na primavera de 2025. Os rastreadores de uso misto representaram mais de 36% da atividade.
