Sí. El informe «2026 Bad Bot Report» de Imperva reveló que el tráfico automatizado superó el 53 % del tráfico web total en 2025, mientras que el tráfico humano se redujo al 47 %, y describe esta situación como un cambio estructural más que como un repunte temporal.
Situación del sector de los datos en la web: tercer trimestre de 2026
El tráfico automatizado superó al tráfico humano en la web abierta en 2025, y desde entonces no ha dejado de crecer. Los bots representan ahora más del 53 % de todo el tráfico web, mientras que la actividad humana ha descendido al 47 % y sigue disminuyendo (Imperva/Thales, Informe sobre bots maliciosos de 2026). Al mismo tiempo, los editores están creando, por primera vez, una infraestructura real para cobrar por ese tráfico, en lugar de limitarse a intentar bloquearlo. Así se presenta el sector de los datos web de cara al cuarto trimestre de 2026: más grande, más automatizado, más impulsado por la inteligencia artificial y más disputado que hace un año.
Puntos clave
- El tráfico automatizado superó el 53 % del tráfico web total en 2025, y solo los bots maliciosos representaron el 40 %, frente al 37 % del año anterior (Informe sobre bots maliciosos de Imperva/Thales 2026).
- La inteligencia artificial es, en la actualidad, la nueva fuente predominante de demanda de scraping. Los laboratorios de vanguardia ya no revelan la composición de los datos de entrenamiento (Stanford HAI, Informe sobre el Índice de IA de 2026), pero, según las estimaciones del sector, los datos extraídos de la web constituyen la principal fuente de información para la mayoría de los modelos generativos, y los equipos empresariales señalan cada vez con mayor frecuencia que necesitan flujos de trabajo en tiempo real, en lugar de extracciones por lotes, para mantener actualizados los sistemas de IA.
- Los editores están pasando del bloqueo a la facturación. La política predeterminada de Cloudflare, que entrará en vigor el 15 de septiembre de 2026, bloquea los rastreadores de IA de «uso mixto» en las páginas financiadas con publicidad y está transformando su mercado de «pago por rastreo» en un modelo de «pago por uso» que remunera a los editores cuando su contenido aparece realmente en una respuesta generada por IA (Blog de Cloudflare, julio de 2026; TechCrunch, 1 de julio de 2026).
- Los proxies residenciales siguen ganando cuota de mercado a las direcciones IP de centros de datos dentro del propio mercado de los proxies. Las estimaciones de los proveedores sobre la distribución exacta varían considerablemente, pero todas coinciden en la tendencia: los proxies residenciales están ganando terreno porque superan los modernos sistemas antibots con una tasa de éxito mucho mayor.
En 2025, Internet cruzó una línea: ya había más bots que personas
Durante la mayor parte de la historia de Internet, la premisa subyacente en la forma en que se crean, se monetizan y se protegen los sitios web ha sido que el visitante medio es una persona. Esa premisa ya no es válida. El informe «2026 Bad Bot Report» de Imperva reveló que el tráfico automatizado representaba más del 53 % de todo el tráfico web en 2025, frente al 51 % del año anterior, mientras que la actividad humana se redujo al 47 % y sigue disminuyendo (Imperva/Thales, 2026).
De ese porcentaje automatizado, los bots «buenos» (rastreadores de búsqueda, herramientas de supervisión y recopilación legítima de datos) representaban aproximadamente el 13 %. Bots maliciosos, el tráfico automatizado que simula ser un navegador real o que extrae datos sin permiso representó el 40 % del tráfico total, lo que supone un aumento con respecto al 37 % registrado en 2024.
Imperva lo plantea explícitamente como un cambio estructural, no como un repunte a corto plazo vinculado a una campaña de ataques concreta o a un evento viral. Esto es relevante para cualquiera que desarrolle proyectos en la web abierta en 2026. La composición del tráfico que su infraestructura, su estrategia contra los bots y su estrategia de recopilación de datos dan por sentada ya no es la que realmente se está produciendo.
La inteligencia artificial se ha convertido en el principal nuevo motor de la demanda de scraping
El apetito de la IA generativa por los datos de la web es la principal fuerza que está redefiniendo esa composición del tráfico. El Informe sobre el Índice de IA de 2026 de Stanford señala que ya no se divulga la composición de los datos de entrenamiento de varios de los sistemas de vanguardia que más recursos consumen, entre los que se incluyen modelos de OpenAI, Anthropic y Google (Stanford HAI, Informe sobre el Índice de IA de 2026). Esa opacidad es, en sí misma, reveladora. Los laboratorios que antes podían remitirse a un conjunto de datos publicado, ahora se niegan a revelar qué contiene la mezcla.
A falta de esa información, los investigadores del sector han suplido esa carencia con estimaciones. El informe de Actowiz Solutions sobre el sector del web scraping para 2026 sitúa la cifra en aproximadamente el 70 % de los modelos generativos entrenados principalmente con datos extraídos de la web (Actowiz Solutions, Informe sobre el sector del web scraping de 2026). Considere esa cifra concreta como una estimación del proveedor, no como una cifra auditada.
Su orientación sigue coincidiendo con lo que ya observan todos los compradores de infraestructuras de IA. Cada agente de IA adicional, cada sistema RAG y cada proceso de entrenamiento se suman a la misma demanda subyacente: contenido web limpio, actualizado y accesible, con un volumen y una frecuencia de actualización que la recopilación manual periódica no puede satisfacer.
La estimación del tamaño del mercado ofrece una imagen similar, aunque las cifras varían según la empresa de investigación de mercado y la metodología empleada. Varios informes para 2026 sitúan el valor anual del segmento del «web scraping» impulsado por la IA en una cifra que oscila entre los miles de millones bajos y medios de un solo dígito, con un crecimiento de dos dígitos previsto a lo largo de la década. No debe considerarse que ninguna cifra concreta sea definitiva en este contexto. Sin embargo, la tendencia en la que coinciden todas las estimaciones no ofrece lugar a dudas: este segmento está creciendo rápidamente, y la IA es la razón.
Las propias previsiones de Gartner sobre la adopción de esta tecnología por parte de las empresas refuerzan esta misma tendencia desde una perspectiva diferente: se prevé que, para finales de 2026, el 40 % de las aplicaciones empresariales incorporen agentes de IA específicos para determinadas tareas, frente a menos del 5 % en 2025 (Gartner, «Gartner prevé que el 40 % de las aplicaciones empresariales contarán con agentes de IA específicos para cada tarea de aquí a 2026», comunicado de prensa, 26 de agosto de 2025). Cada uno de esos agentes es un nuevo consumidor continuo de datos web en tiempo real, y no una sesión de entrenamiento puntual.
El ecosistema de código abierto es un indicador útil de la rapidez con la que está creciendo esta demanda. Crawl4AI, un rastreador diseñado específicamente para convertir páginas web en formato Markdown compatible con los modelos de lenguaje grande (LLM), ha superado las 83 000 estrellas en GitHub. Esto demuestra que «los datos web limpios para un proceso de IA» se han convertido en una necesidad generalizada entre los desarrolladores, en lugar de ser una necesidad de nicho.
Las editoriales han dejado de limitarse a intentar bloquearlo. Ahora cobran por ello.
La otra noticia destacada del tercer trimestre de 2026: los principales proveedores de infraestructura de la web abierta han dejado de considerar el tráfico de rastreadores de IA como algo puramente hostil. En su lugar, han comenzado a desarrollar la infraestructura necesaria para cobrar por él. El cambio de política de Cloudflare, que entrará en vigor el 15 de septiembre de 2026, establece una nueva configuración por defecto (Blog de Cloudflare, «Su sitio web, sus normas», julio de 2026).
Los rastreadores de IA de «uso mixto» —es decir, los bots que combinan la indexación de búsqueda tradicional con la recopilación de datos para el entrenamiento de la IA o el desarrollo de agentes— quedan bloqueados de forma predeterminada en cualquier página que contenga anuncios. El rastreo de búsqueda puro sigue estando permitido de forma predeterminada. Esta configuración predeterminada se aplica a los nuevos clientes de Cloudflare, a los sitios web recién añadidos a cuentas existentes y a todos los clientes actuales del plan gratuito.
Además de la configuración predeterminada de bloqueo, Cloudflare está transformando su actual modelo de mercado «Pay-Per-Crawl» (pago por rastreo) en lo que denomina «Pay Per Use» (pago por uso). Los editores reciben un pago cuando su contenido aparece realmente en una respuesta generada por IA, y no simplemente cuando un rastreador recoge la página. Ceramic.ai y You.com figuran como socios de lanzamiento de dicho modelo (TechCrunch, 1 de julio de 2026).
Se trata de un mecanismo significativamente diferente del enfoque binario de «bloquear o permitir» que ha definido la política sobre los rastreadores de IA durante los dos últimos años. Esto indica algo más importante: la mayor capa de infraestructura de la web espera ahora que el acceso de la IA sea una relación regulada y monetizada, y no un «todo vale» ni un bloqueo total.
Para cualquiera que esté desarrollando un agente, un proceso RAG o un producto de supervisión basado en IA, esta es la tendencia más importante de cara al cuarto trimestre. Las reglas para acceder a una página están cambiando.
Antes la pregunta era: «¿Podrá mi rastreador superar el control antibots?». Ahora es: «¿Entra mi tráfico en una categoría que el sitio de destino haya aceptado permitir o por la que cobre?». Massive ha estado siguiendo de cerca este cambio; consulte La red que se cierra: el bloqueo de los rastreadores de IA, el pago por rastreo y lo que esto supone para los agentes para obtener un análisis técnico más detallado de los cambios que afectan específicamente a los desarrolladores de agentes.
En el propio mercado de los servidores proxy: el sector residencial sigue ganando cuota en la industria de los datos web
Aunque el tema principal gira en torno a la oposición entre bots y humanos, y entre editores y rastreadores, se está produciendo un segundo cambio, más discreto, en la capa de infraestructura que da servicio a todo este tráfico. Los proxies residenciales y las redes de dispositivos de usuarios reales, como la de Massive, siguen ganando cuota de mercado frente a las direcciones IP de centros de datos dentro del propio mercado de los proxies. Véase Proxies residenciales frente a proxies de centros de datos para agentes de IA para consultar la comparación técnica completa.
Se desconoce con exactitud cuál es la cuota real. Las empresas de investigación de mercado publican cifras globales muy dispares para este segmento, que van desde menos de 150 millones de dólares hasta varios miles de millones, dependiendo del alcance y la metodología. Ninguna de ellas debe interpretarse como una cifra auditada. Según una estimación de un proveedor ampliamente citada, los proxies residenciales representarán aproximadamente el 42 % de los ingresos totales del mercado de proxies en 2026, lo que supone un aumento con respecto al 35 % aproximado de 2023 (recopilación de investigaciones de mercado, 2026). Considere ese porcentaje concreto como orientativo, no como exacto.
Lo que está mejor fundamentado es el mecanismo que subyace a este cambio:
Los sistemas antibots ya no funcionan principalmente mediante la inclusión en listas negras de rangos de direcciones IP conocidos de centros de datos. En su lugar, identifican el comportamiento de las solicitudes, las señales de los dispositivos y los patrones de tráfico que un dispositivo de un usuario real genera de forma natural y que, por lo general, no produce un servidor de un centro de datos.
Es probable que la diferencia de rendimiento que se observa en esa tabla se amplíe, en lugar de reducirse, a medida que se intensifique la carrera armamentística descrita anteriormente. Un mayor número de direcciones IP por sí solo tampoco soluciona el problema; la calidad de los dispositivos es lo que determina si una solicitud llega realmente a su destino.
Qué significa esto para el sector de los datos web de cara al cuarto trimestre de 2026
Hay tres factores que se combinan al mismo tiempo. El tráfico generado por bots constituye ya la mayor parte del tráfico web total. La inteligencia artificial es la fuente de mayor crecimiento en el lado de la demanda de dicho tráfico. Y los principales proveedores de infraestructura están redefiniendo activamente las normas relativas a quién tiene acceso y en qué condiciones.
Cualquier equipo cuyo producto dependa de un acceso fiable a Internet opera en un entorno sustancialmente diferente al de hace tan solo un año. Esto es así independientemente de si el producto es un agente de inteligencia artificial, un flujo de datos, una función de inteligencia competitiva o una herramienta de supervisión de AEO.
Si se analizan por separado, cada una de esas tres fuerzas parece una historia independiente: un informe de seguridad, un anuncio de política y una nota al pie de página de la investigación de mercado. Sin embargo, si se analizan en conjunto, describen un cambio subyacente.
La web abierta ya no es un recurso gratuito que la infraestructura consume discretamente en segundo plano. Se está convirtiendo en un recurso de pago. El precio de acceso consiste en demostrar que su tráfico es legítimo, ya sea ante un sistema antibots o, cada vez más, de acuerdo con las condiciones de facturación de un editor.
Hace dos años, la situación era sencilla: o se le bloqueaba o no. Hoy en día, se trata más bien de tres niveles.
El nivel en el que se clasifica una solicitud depende de factores que controlan en mayor medida los proveedores de infraestructura que los operadores de rastreadores: el origen del dispositivo, la ubicación geográfica y la intención declarada.
El camino más fiable para lograrlo nos lleva una y otra vez a los mismos principios fundamentales: el origen real de los dispositivos frente a las direcciones IP de los centros de datos, y las solicitudes con precisión geográfica. Esto también implica una infraestructura diseñada para adaptarse a los constantes cambios en las políticas de los editores, y no una infraestructura concebida para el mundo más simplista de «bloquear o permitir» de 2024.
Nota sobre las fuentes y la metodología
El presente informe resume los resultados de estudios de terceros sobre el sector, actualizados a septiembre de 2026: Informe sobre el Índice de IA de 2026 del HAI de Stanford, Informe sobre bots maliciosos de 2026 de Imperva/Thales, Anuncio de la política publicado por la propia Cloudflare, La cobertura de TechCrunch sobre ese anuncio, Previsión de Gartner sobre la adopción de agentes de IA empresarial en agosto de 2025, Informe sobre el sector del web scraping de Actowiz Solutions para 2026, así como un estudio agregado de 2026 sobre el volumen de mercado del scraping web basado en la inteligencia artificial y segmentos de proxies residenciales.
En los casos en que las estimaciones del tamaño del mercado variaban de forma significativa entre las distintas empresas de investigación de mercado —en el caso del mercado de proxy, en más de un orden de magnitud—, dicha variación se señala en el texto, en lugar de resumirse en una única cifra fiable. El análisis que relaciona estos datos —el cambio de una red de «bloqueo o permiso» a una de «consumo medido»— es la interpretación que Massive hace de la tendencia, y no una afirmación realizada por ninguna de las fuentes citadas.
Se trata de una síntesis de investigaciones externas, no de un estudio propio de la red Massive. Una próxima entrega de esta serie se basará en los datos propios de Massive sobre el volumen de solicitudes y la tasa de éxito, así como en un informe interno denominado «Signal» que ya figura en la hoja de ruta, y se indicará claramente que se trata de un estudio propio cuando se publique.
Acerca del autor
Ryan Turner se ocupa de la infraestructura de datos web, las redes proxy y el acceso de los agentes de inteligencia artificial para el blog de Massive, donde analiza cómo evolucionan, trimestre a trimestre, los sistemas antibots, las políticas de los editores y la normativa sobre el scraping web. Las preguntas sobre este informe o sobre la red de Massive pueden dirigirse a través de Página «Acerca de» de Massive.
Preguntas frecuentes
No. Se centra específicamente en los rastreadores de «uso mixto», es decir, los bots que combinan la indexación de búsquedas con el entrenamiento de la IA o la recopilación de datos para el desarrollo de agentes, y solo los bloquea de forma predeterminada en las páginas que contienen anuncios. El rastreo puro de búsquedas sigue estando permitido de forma predeterminada, y los propietarios de los sitios web pueden optar por volver a permitir los rastreadores de IA si así lo desean.
Principalmente debido a la tasa de éxito frente a los sistemas modernos de lucha contra los bots: aproximadamente entre el 92 % y el 98 % en el caso de los proxies residenciales, frente a entre el 65 % y el 80 % en el de los proxies de centros de datos, ya que la detección de bots se basa actualmente en el análisis del comportamiento y en la identificación de dispositivos, en lugar de en simples listas negras de direcciones IP. Los porcentajes exactos de cuota de mercado varían según la empresa de investigación de mercado, pero todas las estimaciones publicadas coinciden en la tendencia.
