No. Los nuevos valores predeterminados se aplican a los nuevos dominios que se incorporan a Cloudflare, y la configuración existente se migra automáticamente. Las búsquedas siguen estando permitidas de forma predeterminada en todos los casos. El tráfico de entrenamiento y de agentes está restringido de forma predeterminada únicamente en los nuevos dominios monetizados mediante publicidad, según la publicación de Cloudflare del 15 de septiembre de 2026.
Configuración predeterminada del rastreador de IA de Cloudflare del 15 de septiembre: qué ha cambiado para los agentes y los equipos de datos
El 15 de septiembre de 2026, Cloudflare modificó el significado del término «bloqueado» en lo que respecta al tráfico de IA. Los nuevos dominios que obtienen ingresos por publicidad comienzan ahora con los rastreadores de entrenamiento de IA desautorizados y los agentes de IA bloqueados en las páginas que contienen anuncios, mientras que la búsqueda permanece abierta. Cloudflare afirma que más del 20 % de la web se encuentra protegida por su red (Blog de Cloudflare(2026), por lo que una configuración predeterminada en este caso funciona de manera muy similar a una política que afecta a una quinta parte de la web. Tras dos semanas, esto es lo que ha cambiado realmente, a quiénes afecta y qué deben hacer al respecto los equipos que gestionan agentes de IA o flujos de datos.
Puntos clave
- Desde el 15 de septiembre de 2026, Cloudflare clasifica el tráfico de IA en tres categorías (Búsqueda, Entrenamiento y Agente), y en los nuevos dominios con monetización publicitaria, el tráfico de «Entrenamiento de IA» está desactivado y el tráfico de «Agente» queda bloqueado en las páginas con anuncios (Blog de Cloudflare, 2026).
- En junio de 2026, el 52 % de las solicitudes de rastreadores registradas por Cloudflare estaban destinadas al entrenamiento de IA, lo que supone un aumento con respecto al 22 % registrado en la primavera de 2025 (Blog de Cloudflare, 2026).
- Si su agente recupera páginas en nombre de un usuario, ahora se encuentra en el grupo «Agente». Planifique teniendo en cuenta las variaciones por página, no las reglas por sitio web.
¿Qué cambió exactamente el 15 de septiembre?
El 15 de septiembre de 2026, Cloudflare modificó la forma en que sus controles de bots gestionan el tráfico generado por IA (Blog de Cloudflare, «Disfrute de lo mejor de ambos mundos», 2026). Sus opciones «Bloquear» y «Bloquear en páginas con anuncios» ahora también se aplican a los rastreadores de uso mixto, es decir, los bots que recopilan páginas tanto para la búsqueda como para la IA. Se va a retirar el único interruptor «Bloquear bots de IA», y un nuevo ajuste denominado «No permitir el entrenamiento de IA» permite que un sitio web permanezca en los resultados de búsqueda al tiempo que rechaza el entrenamiento. El archivo robots.txt gestionado pasa a denominarse «Sincronización de preferencias de bots». El cambio práctico radica en la división. Cloudflare solía tratar a los «bots de IA» como una única categoría. Ahora clasifica el tráfico de IA en tres grupos —Búsqueda, Entrenamiento y Agente— y asigna a cada uno su propio interruptor. A los nuevos dominios se les ofrece una de dos configuraciones preestablecidas, dependiendo de si el sitio web obtiene ingresos por publicidad:
Los ajustes predefinidos que figuran en la publicación de Cloudflare del 15 de septiembre de 2026, Tener lo mejor de ambos mundos.
Así pues, la web no ha cambiado de la noche a la mañana. Según Cloudflare, la configuración de los clientes actuales se migra automáticamente, y los nuevos ajustes preestablecidos solo se aplican cuando un cliente incorpora un nuevo dominio. Lo que ha cambiado es el punto de partida de cada nuevo sitio a partir de ahora, y en una red de ese tamaño, los puntos de partida se acumulan rápidamente.
¿Por qué Cloudflare divide los rastreadores en «Búsqueda», «Formación» y «Agente»?
Cloudflare ha dividido sus controles de IA porque el tráfico destinado al entrenamiento ha superado al tráfico de búsqueda. En junio de 2026, el 52 % de las solicitudes de los rastreadores observadas por Cloudflare estaban destinadas al entrenamiento de IA, frente al 22 % registrado en la primavera de 2025, y los rastreadores de uso mixto representaban más del 36 % de la actividad (Cloudflare, «El Día de la Independencia del Contenido, un año después», 2026). El rastreo destinado exclusivamente a la búsqueda representa ahora una proporción reducida y cada vez menor. Para el propietario de un sitio web, esto significa que la mayoría de los bots de IA que acceden a sus páginas recopilan contenido para modelos, en lugar de redirigir a los lectores a través de los resultados de búsqueda, y un simple conmutador de «bots de IA» no permitía distinguir entre unos y otros.
Los editores consideran que se trata de un intercambio desigual. TollBit, que ayuda a los editores a conceder licencias de contenidos a empresas de inteligencia artificial, realiza un seguimiento de esto en su Informe sobre el estado de los bots. La edición correspondiente al primer y segundo trimestre de 2026, que abarca los bots de IA de 40 proveedores en 3.906 editoriales, reveló que la proporción entre contenido extraído y contenido de referencia aumentó de 150:1 en el primer trimestre a 227:1 en el segundo trimestre (TollBit, 2026, según informa Digiday en agosto de 2026). Eso supone cientos de visitas de bots por cada persona que hace clic en el enlace.
Entonces, ¿por qué no bloquearlo todo sin más? Porque, según la misma publicación de septiembre, menos del 1 % de los sitios de Cloudflare bloquean los robots de búsqueda, mientras que el 17 % activa algún método para bloquear el entrenamiento (Blog de Cloudflare, 2026). Los sitios web desean recibir tráfico de Google. Simplemente no quieren ceder datos de entrenamiento de forma gratuita. La división en tres categorías les permite aceptar lo uno y rechazar lo otro.
Para cualquiera que desarrolle productos de IA que naveguen en nombre del usuario, la categoría «Agente» es la que realmente importa. Era inevitable que los rastreadores de entrenamiento se vieran relegados. Los agentes son más recientes y ahora cuentan con su propio interruptor y su propio valor predeterminado, en lugar de compartir un único interruptor de «bots de IA» con los rastreadores de entrenamiento.
¿Qué es un «crawler» de uso mixto «responsable»?
Cloudflare define un rastreador de uso mixto responsable como aquel cuyo operador ofrece a los propietarios de los sitios web la posibilidad de excluirse del entrenamiento de la IA (a través de robots.txt o un estándar similar), controles de exclusión para los resúmenes generados por IA, visibilidad a nivel de URL sobre el uso con fines de entrenamiento y la garantía de que la exclusión no perjudicará el posicionamiento en los resultados de búsqueda (Blog de Cloudflare, 2026). Cloudflare señala a Applebot, Bingbot y Googlebot como rastreadores de uso mixto responsables. Incluye a Amazon, Anthropic, Meta y OpenAI en la lista de operadores «responsables con separación», ya que utilizan rastreadores distintos para la búsqueda y para el entrenamiento. Los rastreadores de uso mixto responsables siguen estando permitidos para la búsqueda en los sitios web que seleccionen la opción «No permitir el entrenamiento de IA». Cualquier otro rastreador de entrenamiento queda bloqueado en dichos sitios web.
Esto supone un claro incentivo. Si gestiona un rastreador, la forma de seguir siendo bienvenido es separar sus fines o proporcionar a los sitios web un control real sobre cada uno de ellos. Un único bot que lo haga todo es, en la actualidad, lo más fácil de bloquear.
El «pago por rastreo» pasa a ser «pago por uso»
En el marco de «Pay Per Crawl», el modelo anterior de Cloudflare, los sitios web podían cobrar a los rastreadores de IA una tarifa por cada solicitud de página. En julio de 2026, Cloudflare anunció que pagaría a los editores cuando su contenido formara parte de una respuesta generada por IA, y no solo cuando se recuperara una página. Las empresas de búsqueda basada en IA Ceramic.ai y You.com fueron nombradas como socios iniciales (The Next Web, 2026). Se trata de un cambio sustancial en lo que se tiene en cuenta a la hora de fijar los precios. Un «rastreo» es una única solicitud, mientras que un «uso» es el momento en el que el contenido acaba formando parte de una respuesta que alguien lee. Para los editores, esto vincula más estrechamente el pago al valor. Para las empresas de IA, significa que el coste del contenido podría empezar a basarse en el uso en lugar del volumen, lo que cambia los cálculos a la hora de decidir si se debe recuperar una página o no.
Ya hemos hablado de la versión anterior de este modelo y de por qué la web abierta comenzó a cerrarse a los bots en La red que se cierra: el bloqueo de los rastreadores de IA, el pago por rastreo y lo que esto supone para los agentes.
¿Qué deberían hacer ahora los equipos que gestionan agentes de IA?
Empiece por aceptar que, en la actualidad, el acceso varía de una página a otra. Con la nueva configuración predeterminada basada en la monetización publicitaria, un agente puede acceder a la página de precios de un sitio web y, a continuación, verse bloqueado al intentar acceder al artículo financiado por publicidad que se encuentra junto a ella.
Una lista de comprobación práctica:
- Sepa en qué categoría se encuentra. La recuperación de una página porque un usuario ha formulado una pregunta se denomina «tráfico de agente». La recopilación de páginas para ajustar un modelo se denomina «entrenamiento». Etiquételas por separado en sus propios registros, ya que la web ahora las trata de forma diferente.
- Se esperan respuestas por página. «Bloquear páginas con anuncios» significa que un mismo dominio puede dar una respuesta afirmativa y otra negativa. Configure los reintentos y las soluciones alternativas por URL, no por dominio.
- Considere los bloqueos como señales. Un bloqueo en el marco de estos ajustes preestablecidos constituye una preferencia expresada por el editor. Regístrelo y elúdalo recurriendo a una fuente autorizada o estructurada, siempre que exista.
- Esté atento al sistema de pago por uso. Si una fuente de la que depende se adhiere a un programa de pago, pagar podría resultar más económico que buscar soluciones alternativas.
- Separe sus cargas de trabajo e identifíquelas. Si gestiona tanto el tráfico de entrenamiento como el de los agentes, utilice identidades diferentes para cada uno, de modo que uno no provoque el bloqueo del otro. Cloudflare también cuenta con un programa de «agentes firmados»: los agentes dirigidos por un usuario final pueden firmar sus solicitudes HTTP con Web Bot Auth, un estándar criptográfico de firma de mensajes, para que Cloudflare pueda verificar su identidad (Documentación de Cloudflare, agentes firmados). Si gestiona una agencia, sea cual sea su tamaño, merece la pena leerlo.
Hay una trampa que merece la pena señalar. En el caso de los flujos de trabajo de los agentes, los fallos que más perjudican no suelen ser los bloqueos definitivos, que son fáciles de detectar. Las propias páginas de desafío de Cloudflare son el ejemplo más sencillo: cada una de ellas incluye un cf-mitigated: challenge encabezado, y su tipo de contenido es siempre text/html, sea cual sea el recurso que haya solicitado (Documentación de Cloudflare: Detectar una respuesta de la página de desafío). Compruebe si existe ese encabezado antes de analizar nada. El caso más complicado es el de una página parcial «silenciosa»: una solicitud devuelve un código de estado 200, pero el cuerpo es una página de marcador de posición (un intersticial), un shell de JavaScript o una versión simplificada del artículo. Compruebe qué se ha devuelto, no solo el código de estado. Una longitud mínima de contenido o una comprobación de la presencia de un elemento DOM que se espera encontrar en la página real permite detectar la mayoría de estos casos.
Cómo se adapta Massive a los nuevos ajustes predeterminados de Cloudflare
Massive ofrece una red de acceso a dispositivos y una pila de renderizado que genera código HTML o Markdown limpio a partir de páginas públicas, en cualquiera de los más de 195 países. Los clientes gestionan sus propias operaciones sobre esta base. Las preferencias de IA de los editores constituyen señales públicas, y los equipos con los que colaboramos las consideran datos de entrada para sus propias políticas, no obstáculos que deban sortearse.
El Web Render API devuelve las páginas generadas en formato Markdown para los flujos de trabajo de modelos de lenguaje grande (LLM) y permite a los clientes segmentar geográficamente las solicitudes por país, región o ciudad. En el caso de los proxies residenciales, cada cuenta también mantiene su propio lista de dominios bloqueados, de modo que un equipo puede bloquear las solicitudes dirigidas a cualquier sitio web al que haya decidido no acceder. La lista admite hasta 1.000 dominios, y una solicitud dirigida a un dominio bloqueado se rechaza con un error 452 (Contenido no permitido) antes incluso de que llegue al sitio web. Si su pila de agentes está alcanzando los nuevos valores predeterminados, consulte Por qué se bloquean los agentes de IA en las direcciones IP de los centros de datos y cómo solucionarlo, o bien vuelva a la guía completa sobre Cómo proporcionar a los agentes de IA acceso en tiempo real a la web. Para conocer los aspectos jurídicos relacionados con los datos de entrenamiento, consulte Los litigios sobre los datos de entrenamiento de la IA que todo equipo de datos web debería conocer.
En resumen
- Cloudflare ahora trata el tráfico de «Búsqueda», «Formación» y «Agente» como tres decisiones independientes, cada una con su propio conmutador y su propia configuración predeterminada para los nuevos dominios.
- Los nuevos dominios monetizados mediante publicidad comienzan con la opción «Formación» desactivada y los «Agentes» bloqueados en las páginas de anuncios.
- El modelo «Pago por uso» remunera a los editores por las respuestas, no por las consultas.
- Los desarrolladores de agentes deben planificar el acceso por página y comprobar en cada respuesta si el
cf-mitigated: challengeencabezado, y registrar cada bloque como la preferencia indicada por el editor. - Próximamente: qué empresas de IA se sumarán a «Pay Per Use» y cuántos agentes se registrarán como agentes autorizados.
¿Desea ver cómo funcionan en la práctica las recuperaciones renderizadas y con geolocalización? Empiece por el Web Render API Resumen.
Fuentes
- Cloudflare, «Consiga lo mejor de ambos mundos: siga siendo visible en los resultados de búsqueda sin permitir el entrenamiento de la IA», consultado el 25 de septiembre de 2026
- Cloudflare, «El Día de la Independencia de los Contenidos, un año después», consultado el 25 de septiembre de 2026
- The Next Web, «Cloudflare fija el mes de septiembre como fecha límite para los rastreadores de IA», consultado el 25 de septiembre de 2026
- Documentación de Cloudflare, Agentes contratados
- Documentación de Cloudflare, «Detectar una respuesta de la página de desafío», consultado el 28 de septiembre de 2026
- TollBit, Situación de los bots (primer y segundo trimestre de 2026)
- Digiday, «Según un informe, los editores europeos se están viendo más afectados por la extracción de contenidos mediante bots de IA» (Datos de «TollBit State of the Bots»)
Preguntas frecuentes
No en los sitios web que utilizan la opción «No permitir el entrenamiento de IA». Cloudflare clasifica a Googlebot, Bingbot y Applebot como rastreadores de uso mixto responsables, a los que se sigue permitiendo el acceso para la búsqueda. Sin embargo, los sitios web que eligen la configuración completa de «Bloquear» ahora también bloquean a los rastreadores de uso mixto, lo que puede afectar a la visibilidad en los resultados de búsqueda.
El modelo «Pay Per Crawl» cobraba a los rastreadores de IA por cada solicitud. El modelo «Pay Per Use», anunciado en julio de 2026, remunera a los editores cuando su contenido forma parte de una respuesta generada por IA. Ceramic.ai y You.com fueron nombrados como socios iniciales, según la información publicada por The Next Web.
En junio de 2026, Cloudflare informó de que el 52 % de las solicitudes de los rastreadores en su red estaban destinadas al entrenamiento de la inteligencia artificial, lo que supone un aumento respecto al 22 % registrado en la primavera de 2025. Los rastreadores de uso mixto representaron más del 36 % de la actividad.
