# Configuración predeterminada de los rastreadores de IA de Cloudflare a partir del 15 de septiembre: qué ha cambiado para los agentes y los equipos de datos

El 15 de septiembre de 2026, Cloudflare modificó el significado del término «bloqueado» en lo que respecta al tráfico de IA. Los nuevos dominios que obtienen ingresos mediante publicidad comienzan ahora con los rastreadores de entrenamiento de IA desautorizados y los agentes de IA bloqueados en las páginas que contienen anuncios, mientras que la búsqueda permanece habilitada. Cloudflare afirma que más del 20 % de la web se encuentra protegida por su red ([Blog de Cloudflare](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026), por lo que una configuración predeterminada en este caso equivale, en gran medida, a una política que afecta a una quinta parte de la web. Tras dos semanas de aplicación, esto es lo que realmente ha cambiado, a quién afecta y qué deben hacer al respecto los equipos que gestionan agentes de IA o flujos de datos.

> **Puntos clave**
>
> - Desde el 15 de septiembre de 2026, Cloudflare clasifica el tráfico de IA en tres categorías (Búsqueda, Entrenamiento y Agente), y en los nuevos dominios monetizados mediante publicidad, el tráfico de «Entrenamiento de IA» está deshabilitado de forma predeterminada y el tráfico de «Agente» queda bloqueado en las páginas con anuncios ([Blog de Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026).
> - En junio de 2026, el 52 % de las solicitudes de rastreadores registradas por Cloudflare correspondían al entrenamiento de IA, lo que supone un aumento respecto al 22 % registrado en la primavera de 2025 ([Blog de Cloudflare](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026).
> - Si su agente recupera páginas en nombre de un usuario, ahora se encuentra en la categoría «Agente». Planifique teniendo en cuenta las variaciones por página, no las reglas por sitio web.

## ¿Qué cambió exactamente el 15 de septiembre?

El 15 de septiembre de 2026, Cloudflare modificó la forma en que sus controles de bots gestionan el tráfico de IA ([Blog de Cloudflare, «Have it both ways»](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Sus ajustes «Bloquear» y «Bloquear en páginas con anuncios» ahora también se aplican a los rastreadores de uso mixto, es decir, los bots que recopilan páginas tanto para búsquedas como para IA. Se retira el único interruptor «Bloquear bots de IA», y un nuevo ajuste «No permitir el entrenamiento de IA» permite que un sitio web siga apareciendo en los resultados de búsqueda al tiempo que rechaza el entrenamiento. El archivo robots.txt gestionado pasa a denominarse «Sincronización de preferencias de bots». El cambio práctico radica en la división. Anteriormente, Cloudflare trataba a los «bots de IA» como una sola categoría. Ahora clasifica el tráfico de IA en tres grupos —Búsqueda, Entrenamiento y Agente— y asigna a cada uno su propio interruptor. A los nuevos dominios se les ofrece una de dos configuraciones preestablecidas, dependiendo de si el sitio obtiene ingresos por publicidad:

| Categoría | Qué abarca | Nuevo dominio monetizado mediante publicidad | Nuevo dominio sin publicidad |
|--------|----------------|-------------------------|-------------------|
| Búsqueda | Indexación para resultados de búsqueda | Permitido | Permitido |
| Entrenamiento | Recopilación de contenido para entrenar modelos | No permitir el entrenamiento de IA | Permitido |
| Agente | Obtención de páginas para la solicitud en tiempo real de un usuario | Bloqueado en páginas con anuncios | Permitido |

*Configuraciones preestablecidas tal y como figuran en la publicación de Cloudflare del 15 de septiembre de 2026, [Lo mejor de ambos mundos](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/).*

Así pues, la web no ha cambiado de la noche a la mañana. Según Cloudflare, la configuración de los clientes actuales se migra automáticamente, y los nuevos ajustes preestablecidos solo se aplican cuando un cliente incorpora un nuevo dominio. Lo que ha cambiado es el punto de partida para cada nuevo sitio a partir de ahora, y en una red de ese tamaño, los puntos de partida se acumulan rápidamente.

## ¿Por qué divide Cloudflare los rastreadores en «Búsqueda», «Entrenamiento» y «Agente»?

Cloudflare ha dividido sus controles de IA porque el tráfico de entrenamiento ha superado al de búsqueda. En junio de 2026, el 52 % de las solicitudes de rastreadores observadas por Cloudflare correspondían al entrenamiento de IA, frente al 22 % registrado en la primavera de 2025, y los rastreadores de uso mixto representaban más del 36 % de la actividad ([Cloudflare, «Content Independence Day, one year on»](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026). El rastreo dedicado exclusivamente a la búsqueda representa ahora una proporción pequeña y cada vez menor. Para el propietario de un sitio web, esto significa que la mayoría de los bots de IA que acceden a sus páginas están recopilando contenido para modelos, en lugar de redirigir a los lectores a través de los resultados de búsqueda, y un único conmutador de «bots de IA» no permitía distinguirlos.

Los editores consideran que se trata de un intercambio desequilibrado. TollBit, que ayuda a los editores a conceder licencias de contenido a empresas de IA, realiza un seguimiento de esta situación en su [informe «State of the Bots»](https://tollbit.com/state-of-the-bots/). La edición correspondiente al primer y segundo trimestre de 2026, que abarca los bots de IA de 40 proveedores en 3.906 editores, mostró que la proporción entre extracción de datos y visitas de referencia pasó de 150:1 en el primer trimestre a 227:1 en el segundo (TollBit, 2026, según informó [Digiday](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/) en agosto de 2026). Esto supone cientos de visitas de bots por cada persona que hace clic en un enlace.

Entonces, ¿por qué no bloquearlo todo sin más? Porque menos del 1 % de los sitios de Cloudflare bloquean los bots de búsqueda, según la misma publicación de septiembre, mientras que el 17 % activa algún método para bloquear el entrenamiento ([Blog de Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Los sitios web desean recibir tráfico de Google. Simplemente no quieren ceder datos de entrenamiento de forma gratuita. La división en tres categorías les permite decir «sí» a lo uno y «no» a lo otro.

<!-- [PERSPECTIVA ÚNICA] -->
Para cualquiera que desarrolle productos de IA que naveguen en nombre de un usuario, la categoría «Agente» es la que realmente importa. Era inevitable que los rastreadores de entrenamiento se vieran afectados. Los agentes son más recientes y ahora cuentan con su propio interruptor y su propia configuración por defecto, en lugar de compartir un único interruptor de «bots de IA» con los rastreadores de entrenamiento.

## ¿Qué es un rastreador de uso mixto «responsable»?

Cloudflare define un rastreador de uso mixto responsable como aquel cuyo operador ofrece a los propietarios de sitios web la posibilidad de excluirse del entrenamiento de IA (a través de robots.txt o un estándar similar), controles de exclusión para los resúmenes de IA, visibilidad a nivel de URL sobre el uso con fines de entrenamiento y la garantía de que la exclusión voluntaria no perjudicará el posicionamiento en los resultados de búsqueda ([Blog de Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Cloudflare señala a Applebot, Bingbot y Googlebot como rastreadores de uso mixto responsables. Enumera a Amazon, Anthropic, Meta y OpenAI como operadores «responsables con separación», ya que utilizan rastreadores distintos para la búsqueda y para el entrenamiento. Los rastreadores de uso mixto responsables siguen estando permitidos para la búsqueda en los sitios web que elijan «No permitir el entrenamiento de IA». Cualquier otro rastreador de entrenamiento queda bloqueado en dichos sitios web.

Esto establece un incentivo claro. Si gestiona un rastreador, la forma de seguir siendo bienvenido es separar sus fines o proporcionar a los sitios web controles reales sobre cada uno de ellos. Un único bot que lo haga todo es ahora lo más fácil de bloquear.

## El «pago por rastreo» pasa a ser «pago por uso»

Bajo el modelo anterior de Cloudflare, «pago por rastreo», los sitios web podían cobrar a los rastreadores de IA una tarifa por cada solicitud de página. En julio de 2026, Cloudflare anunció que pagaría a los editores cuando su contenido conformara una respuesta de IA, y no solo cuando se recuperara una página. Las empresas de búsqueda basada en IA Ceramic.ai y You.com fueron nombradas como socios iniciales ([The Next Web](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers), 2026). Se trata de un cambio sustancial en lo que se factura. Un rastreo es una solicitud única, mientras que un «uso» es el momento en que el contenido acaba formando parte de una respuesta que alguien lee. Para los editores, esto vincula el pago más estrechamente al valor. Para las empresas de IA, significa que el coste del contenido podría empezar a basarse en el uso en lugar del volumen, lo que cambia el cálculo a la hora de decidir si se debe recuperar una página o no.

Ya tratamos la versión anterior de este modelo, y por qué la web abierta comenzó a cerrarse a los bots, en [La web que se cierra: el bloqueo de rastreadores de IA, el pago por rastreo y lo que significa para los agentes](https://www.joinmassive.com/blog/the-closing-web-ai-crawler-blocking-pay-per-crawl-and-what-it-means-for-agents).

## ¿Qué deben hacer ahora los equipos que gestionan agentes de IA?

Empiecen por aceptar que el acceso varía ahora de una página a otra. Bajo la nueva configuración preestablecida de monetización publicitaria, un agente puede acceder a la página de precios de un sitio web y, a continuación, verse bloqueado al intentar acceder al artículo financiado por publicidad que se encuentra junto a ella.

Una lista de comprobación práctica:

1. **Sepa en qué categoría se encuentra.** Obtener una página porque un usuario ha formulado una pregunta se considera tráfico de agente. Recopilar páginas para ajustar un modelo se considera entrenamiento. Etiquételas por separado en sus propios registros, ya que la web ahora las trata de forma diferente.
2. **Espere respuestas específicas para cada página.** «Bloqueo en páginas con anuncios» significa que un mismo dominio puede dar una respuesta afirmativa y otra negativa. Implemente reintentos y soluciones alternativas por URL, no por dominio.
3. **Trate los bloqueos como señales.** Un bloqueo bajo estos ajustes preestablecidos es la preferencia declarada de un editor. Regístrelo y elúdalo utilizando una fuente con licencia o estructurada, siempre que exista.
4. **Esté atento al modelo de pago por uso.** Si una fuente de la que depende se adhiere a un programa de pago, puede resultar más económico pagar que desarrollar soluciones alternativas.
5. **Separe sus cargas de trabajo e identifíquelas.** Si gestiona tanto tráfico de entrenamiento como de agentes, manténgalos en identidades diferentes para que uno no provoque el bloqueo del otro. Cloudflare también cuenta con un programa de «agentes firmados»: los agentes dirigidos por un usuario final pueden firmar sus solicitudes HTTP con Web Bot Auth, un estándar criptográfico de firma de mensajes, de modo que Cloudflare pueda verificar su identidad ([Documentación de Cloudflare, Agentes firmados](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)). Si gestiona un agente a cualquier escala, merece la pena que lo lea.

<!-- [PERSPECTIVA ÚNICA] -->
Hay una trampa que conviene señalar. En el caso de los flujos de agentes, los fallos que más perjudican no suelen ser los bloqueos definitivos, que son fáciles de detectar. Las propias páginas de desafío de Cloudflare son el caso más sencillo: todas llevan un encabezado `cf-mitigated: challenge` y su tipo de contenido es siempre `text/html`, independientemente del recurso que haya solicitado ([Documentación de Cloudflare, Detectar una respuesta de página de desafío](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/)). Compruebe si existe ese encabezado antes de analizar nada. El caso más complicado es el de una página parcial silenciosa: una solicitud devuelve un estado 200, pero el cuerpo es una página de marcador de posición (un intersticial), un shell de JavaScript o una versión simplificada del artículo. Compruebe qué se ha devuelto, no solo el código de estado. Una longitud mínima de contenido o una comprobación de un elemento DOM que espere encontrar en la página real permite detectar la mayoría de estos casos.

## Cómo se adapta Massive a los nuevos valores predeterminados de Cloudflare

Massive proporciona una red de acceso a dispositivos y una pila de renderizado que ofrece HTML limpio o Markdown a partir de páginas públicas, en cualquiera de los más de 195 países. Los clientes gestionan sus propias operaciones sobre esta base. Las preferencias de IA de los editores son señales públicas, y los equipos con los que trabajamos las tratan como datos de entrada para su propia política, no como obstáculos que hay que eludir.

La función [Web Render API](https://docs.joinmassive.com/web-render/overview) devuelve páginas renderizadas en formato Markdown para los flujos de trabajo de modelos de lenguaje grande (LLM) y permite a los clientes segmentar geográficamente las solicitudes por país, región o ciudad. En el caso de los proxies residenciales, cada cuenta mantiene además su propia [lista de dominios bloqueados](https://docs.joinmassive.com/residential/domain-blocking), de modo que un equipo puede bloquear las solicitudes dirigidas a cualquier sitio al que haya decidido no acceder. La lista admite hasta 1.000 dominios, y una solicitud dirigida a un dominio bloqueado se rechaza con un error 452 (Contenido no permitido) antes incluso de que llegue al sitio web. Si su conjunto de agentes se ve afectado por los nuevos valores predeterminados, consulte [por qué se bloquean los agentes de IA en las IP de los centros de datos y cómo solucionarlo](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it), o vuelva a la guía completa sobre [cómo proporcionar a los agentes de IA acceso en tiempo real a la web](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access). En cuanto a los aspectos legales de los datos de entrenamiento, lea [las demandas judiciales sobre datos de entrenamiento de IA que todo equipo de datos web debería conocer](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers).

## Preguntas frecuentes

### ¿Bloqueó Cloudflare todos los rastreadores de IA el 15 de septiembre de 2026?

No. Los nuevos valores predeterminados se aplican a los nuevos dominios que se incorporan a Cloudflare, y la configuración existente se ha migrado automáticamente. Las búsquedas siguen estando permitidas de forma predeterminada en todas partes. El tráfico de entrenamiento y de agentes está restringido de forma predeterminada únicamente en los nuevos dominios monetizados mediante publicidad, según la publicación de Cloudflare del 15 de septiembre de 2026.

### ¿Queda bloqueado Googlebot con la nueva configuración de Cloudflare?

No en los sitios que utilizan la opción «Disallow AI Training» (Prohibir el entrenamiento de IA). Cloudflare clasifica a Googlebot, Bingbot y Applebot como rastreadores de uso mixto responsables, por lo que siguen estando permitidos para la búsqueda. Sin embargo, los sitios que elijan una configuración de «Bloqueo» total ahora también bloquean a los rastreadores de uso mixto, lo que puede afectar a la visibilidad en los resultados de búsqueda.

### ¿Cuál es la diferencia entre «Pago por rastreo» y «Pago por uso»?

«Pay Per Crawl» cobraba a los rastreadores de IA por solicitud. «Pay Per Use», anunciado en julio de 2026, paga a los editores cuando su contenido da forma a una respuesta de IA. Ceramic.ai y You.com fueron nombrados como socios iniciales, según la información de The Next Web.

### ¿Qué porcentaje del tráfico de rastreadores corresponde actualmente al entrenamiento de IA?

En junio de 2026, Cloudflare informó de que el 52 % de las solicitudes de rastreadores en su red estaban destinadas al entrenamiento de la IA, lo que supone un aumento respecto al 22 % registrado en la primavera de 2025. Los rastreadores de uso mixto representaban más del 36 % de la actividad.

## Conclusión

- Cloudflare trata ahora el tráfico de búsqueda, entrenamiento y agentes como tres decisiones independientes, cada una con su propio conmutador y su propia configuración predeterminada para los nuevos dominios.
- En los nuevos dominios monetizados mediante publicidad, el entrenamiento viene desactivado de forma predeterminada y los agentes bloqueados en las páginas publicitarias.
- El modelo «Pago por uso» remunera a los editores por las respuestas, no por las consultas.
- Los desarrolladores de agentes deben planificar el acceso por página, comprobar que cada respuesta incluya el encabezado `cf-mitigated: challenge` y registrar cada bloqueo como una preferencia expresada por el editor.
- Próximamente: qué empresas de IA se unen a «Pago por uso» y cuántos agentes se registran como [agentes autorizados](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/).

¿Desea ver cómo se ven en la práctica las recuperaciones renderizadas y geolocalizadas? Comience por la [Web Render API descripción general](https://docs.joinmassive.com/web-render/overview).

## Fuentes

- Cloudflare, [«Disfrute de lo mejor de ambos mundos: mantenga su visibilidad en los motores de búsqueda al tiempo que impide el entrenamiento de la IA»](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), consultado el 25 de septiembre de 2026
- Cloudflare, [«Content Independence Day, un año después»](https://blog.cloudflare.com/agentic-internet-bot-report/), consultado el 25 de septiembre de 2026
- The Next Web, [«Cloudflare fija el mes de septiembre como plazo límite para los rastreadores de IA»](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers), consultado el 25 de septiembre de 2026
- Documentación de Cloudflare, [Agentes firmados](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)
- Documentación de Cloudflare, [«Detectar una respuesta de la página de desafío»](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/), consultado el 28 de septiembre de 2026
- TollBit, [Estado de los bots (1.º y 2.º trimestre de 2026)](https://tollbit.com/state-of-the-bots/)
- Digiday, [«Los editores europeos se ven más afectados por el scraping de los bots de IA, según un informe»](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/) (datos de «State of the Bots» de TollBit)
