# Situación del sector de los datos web: tercer trimestre de 2026

El tráfico automatizado superó al tráfico humano en la web abierta en 2025, y desde entonces no ha dejado de crecer. Los bots representan ahora más del 53 % de todo el tráfico web, mientras que la actividad humana ha descendido al 47 % y sigue disminuyendo ([Informe sobre bots maliciosos de Imperva/Thales, 2026](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/)). Al mismo tiempo, los editores están creando, por primera vez, una infraestructura real para cobrar por ese tráfico, en lugar de limitarse a intentar bloquearlo. Este es el estado del sector de los datos web de cara al cuarto trimestre de 2026: más grande, más automatizado, más impulsado por la inteligencia artificial y más disputado que hace un año.

> **Conclusiones clave**
>
> - El tráfico automatizado superó el 53 % del tráfico web total en 2025, y solo los bots maliciosos representaron el 40 %, frente al 37 % del año anterior ([Informe sobre bots maliciosos de Imperva/Thales 2026](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/)).
> - La IA es ahora la nueva fuente dominante de la demanda de scraping. Los laboratorios de vanguardia ya no revelan la composición de los datos de entrenamiento ([Stanford HAI, Informe del Índice de IA de 2026](https://hai.stanford.edu/ai-index/2026-ai-index-report)), pero las estimaciones del sector sitúan los datos web extraídos como la principal fuente de entrada para la mayoría de los modelos generativos, y los equipos empresariales afirman cada vez con mayor frecuencia que necesitan flujos de trabajo en tiempo real, y no extracciones por lotes, para mantener actualizados los sistemas de IA.
> - Los editores están pasando del bloqueo a la facturación. La política predeterminada de Cloudflare, en vigor desde el 15 de septiembre de 2026, bloquea los rastreadores de IA de «uso mixto» en páginas financiadas por publicidad y está transformando su mercado de «pago por rastreo» en un modelo de «pago por uso» que remunera a los editores cuando su contenido aparece realmente en una respuesta de IA ([Blog de Cloudflare, julio de 2026](https://blog.cloudflare.com/content-independence-day-ai-options/); [TechCrunch, 1 de julio de 2026](https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/)).
> - Los proxies residenciales siguen ganando cuota de mercado a las direcciones IP de centros de datos dentro del propio mercado de proxies. Las estimaciones de los proveedores sobre la distribución exacta varían considerablemente, pero todas coinciden en la tendencia: los proxies residenciales están ganando terreno porque superan los modernos sistemas antibots con una tasa mucho mayor.

## La web cruzó una línea en 2025: más bots que humanos

Durante la mayor parte de la historia de Internet, la hipótesis en la que se basaba la forma de crear, monetizar y proteger los sitios web ha sido que el visitante medio es una persona. Esa hipótesis ya no se sostiene. El Informe sobre bots maliciosos de 2026 de Imperva reveló que el tráfico automatizado representaba más del 53 % de todo el tráfico web en 2025, frente al 51 % del año anterior, mientras que la actividad humana se redujo al 47 % y seguía disminuyendo ([Imperva/Thales, 2026](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/)).

De esa proporción automatizada, los bots «buenos» (rastreadores de búsqueda, herramientas de monitorización, recopilación legítima de datos) representaban alrededor del 13 %. Los **bots maliciosos**, es decir, el tráfico automatizado que se hace pasar por un navegador real o extrae datos sin permiso, constituían el 40 % de todo el tráfico, lo que supone un aumento respecto al 37 % registrado en 2024.

Imperva califica esto explícitamente como un cambio estructural, no como un pico a corto plazo vinculado a una campaña de ataque concreta o a un evento viral. Esto es relevante para cualquiera que desarrolle proyectos en la web abierta en 2026. La composición del tráfico que su infraestructura, su estrategia contra los bots y su estrategia de recopilación de datos dan por sentada ya no es la composición del tráfico que realmente se está produciendo.

## La IA se ha convertido en el principal nuevo motor de la demanda de extracción de datos

El apetito de la IA generativa por los datos web es la fuerza más importante que está redefiniendo esa composición del tráfico. El Informe del Índice de IA de 2026 de Stanford señala que ya no se divulga la composición de los datos de entrenamiento de varios de los sistemas de vanguardia que más recursos consumen, incluidos los modelos de OpenAI, Anthropic y Google ([Stanford HAI, Informe del Índice de IA de 2026](https://hai.stanford.edu/ai-index/2026-ai-index-report)). Esa opacidad es, en sí misma, reveladora. Los laboratorios que antes podían remitirse a un conjunto de datos publicado ahora se niegan a revelar qué contiene dicha mezcla.

A falta de esa información, los investigadores del sector han cubierto esa laguna con estimaciones. El informe sobre el sector del web scraping de 2026 de Actowiz Solutions sitúa la cifra en aproximadamente el 70 % de los modelos generativos entrenados principalmente con datos extraídos de la web ([Actowiz Solutions, Informe sobre el sector del web scraping de 2026](https://www.actowizsolutions.com/web-scraping-industry-report-data-first-ai-revolution.php)). Considere esa cifra concreta como una estimación del proveedor, no como una cifra auditada.

Su tendencia sigue coincidiendo con lo que ya observan todos los compradores de infraestructura de IA. Cada agente de IA adicional, cada sistema RAG y cada proceso de entrenamiento se suman a la misma demanda subyacente: contenido web limpio, actualizado y recuperable, con un volumen y una periodicidad que la recopilación manual periódica no puede satisfacer.

El análisis del tamaño del mercado refleja una tendencia similar, aunque las estimaciones varían según la empresa de investigación y la metodología empleada. Varios informes sobre 2026 sitúan el segmento del web scraping impulsado por la IA en una cifra anual de entre unos pocos mil millones y unos diez mil millones, con un crecimiento de dos dígitos previsto a lo largo de la década. No debe considerarse aquí ninguna cifra concreta como definitiva. Sin embargo, la tendencia en la que coinciden todas las estimaciones no ofrece dudas: este segmento está creciendo rápidamente, y la IA es la razón.

La propia previsión de Gartner sobre la adopción empresarial refuerza esta misma tendencia desde un ángulo diferente: se espera que, para finales de 2026, los agentes de IA específicos para tareas concretas estén integrados en el 40 % de las aplicaciones empresariales, frente a menos del 5 % en 2025 ([Gartner, «Gartner prevé que el 40 % de las aplicaciones empresariales contarán con agentes de IA específicos para tareas concretas para 2026», comunicado de prensa, 26 de agosto de 2025](https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025)). Cada uno de esos agentes es un nuevo consumidor continuo de datos web en tiempo real, no un proceso de entrenamiento puntual.

El ecosistema de código abierto es un indicador útil de la rapidez con la que está creciendo esta demanda. [Crawl4AI](https://www.joinmassive.com/blog/crawl4ai-partner-spotlight), un rastreador creado específicamente para convertir páginas web en formato Markdown compatible con los modelos de lenguaje a gran escala (LLM), ha superado las 83 000 estrellas en GitHub. Esto demuestra que «los datos web limpios para un flujo de trabajo de IA» se han convertido en una necesidad generalizada entre los desarrolladores, en lugar de ser una necesidad de nicho.

## Los editores han dejado de limitarse a intentar bloquearlo. Ahora cobran por ello

La otra noticia destacada del tercer trimestre de 2026: los principales proveedores de infraestructura de la web abierta han dejado de considerar el tráfico de los rastreadores de IA como algo puramente hostil. En su lugar, han comenzado a crear la infraestructura necesaria para cobrar por él. El cambio de política de Cloudflare, en vigor desde el 15 de septiembre de 2026, establece una nueva configuración predeterminada ([Blog de Cloudflare, «Su sitio, sus reglas», julio de 2026](https://blog.cloudflare.com/content-independence-day-ai-options/)).

Los rastreadores de IA de «uso mixto» —es decir, los bots que combinan la indexación de búsqueda tradicional con la recopilación de datos para el entrenamiento de la IA o el desarrollo de agentes— quedan bloqueados de forma predeterminada en cualquier página que contenga anuncios. El rastreo de búsqueda puro sigue estando permitido de forma predeterminada. Los nuevos clientes de Cloudflare, los sitios web recién añadidos a cuentas existentes y todos los clientes actuales del plan gratuito se acogen a esta configuración predeterminada.

Además de este bloqueo por defecto, Cloudflare está transformando su actual mercado «Pay-Per-Crawl» (pago por rastreo) en lo que denomina «Pay Per Use» (pago por uso). Los editores reciben un pago cuando su contenido aparece realmente en una respuesta de IA, y no simplemente cuando un rastreador recurre la página. Ceramic.ai y You.com figuran como socios de lanzamiento de dicho modelo ([TechCrunch, 1 de julio de 2026](https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/)).

Se trata de un mecanismo significativamente diferente del binomio «bloquear o permitir» que ha definido los dos últimos años de la política sobre rastreadores de IA. Esto apunta a algo más amplio: la mayor capa de infraestructura de la web espera ahora que el acceso de la IA sea una relación medida y monetizada, y no un «todo vale» ni un bloqueo total.

Para cualquiera que esté desarrollando un agente, un proceso RAG o un producto de monitorización basado en IA, esta es la tendencia más relevante de cara al cuarto trimestre. Las reglas para acceder a una página están cambiando.

Antes la pregunta era: «¿Puede mi rastreador superar el control antibots?». Ahora es: «¿Entra mi tráfico en una categoría que el sitio de destino ha aceptado permitir o por la que cobra?». Massive ha estado siguiendo de cerca este cambio; consulte [«The Closing Web: bloqueo de rastreadores de IA, pago por rastreo y lo que significa para los agentes»](https://www.joinmassive.com/blog/the-closing-web-ai-crawler-blocking-pay-per-crawl-and-what-it-means-for-agents) para obtener un análisis técnico más detallado de los cambios que esto supone específicamente para los desarrolladores de agentes.

## Dentro del propio mercado de los proxies: los residenciales siguen ganando cuota en el sector de los datos web

Si bien la noticia principal gira en torno a los bots frente a los humanos y a los editores frente a los rastreadores, se está produciendo un segundo cambio, más discreto, dentro de la capa de infraestructura que da servicio a todo este tráfico. Los proxies residenciales, redes de dispositivos de usuarios reales como la de Massive, siguen ganando cuota a las direcciones IP de centros de datos dentro del propio mercado de los proxies. Consulte [Proxies residenciales frente a proxies de centros de datos para agentes de IA](https://www.joinmassive.com/blog/residential-vs-datacenter-proxies-for-ai-agents) para ver la comparación técnica completa.

La cuota exacta sigue sin estar realmente clara. Las empresas de investigación de mercado publican cifras generales muy dispares para este segmento, que van desde menos de 150 millones de dólares hasta varios miles de millones, dependiendo del alcance y la metodología. Ninguna de ellas debe interpretarse como una cifra auditada. Una estimación de un proveedor ampliamente citada sitúa a los proxies residenciales en aproximadamente el 42 % de los ingresos totales del mercado de proxies en 2026, frente al 35 % aproximado de 2023 ([agregación de investigaciones de mercado, 2026](https://www.verifiedmarketreports.com/product/residential-proxy-ip-network-market/)). Considere este porcentaje concreto como orientativo, no preciso.

Lo que está mejor fundamentado es el mecanismo que subyace a este cambio:

| Tipo de proxy | Tasa de éxito frente a los sistemas modernos contra bots | Método de detección que elude |
|---|---|---|
| Residencial (dispositivo real) | 92-98 % | Huella de comportamiento y del dispositivo |
| Centro de datos | 65-80 % | Más débil frente a la huella digital, más eficaz únicamente frente a listas de bloqueo de IP sencillas |

Los sistemas antibot ya no funcionan principalmente mediante la inclusión en listas negras de rangos de IP conocidos de centros de datos. En su lugar, identifican el comportamiento de las solicitudes, las señales de los dispositivos y los patrones de tráfico que un dispositivo de consumidor real produce de forma natural y que una máquina de un centro de datos normalmente no produce.

Es probable que la brecha de rendimiento que se observa en esa tabla se amplíe, en lugar de reducirse, a medida que se intensifique la carrera armamentística descrita anteriormente. Un mayor número de direcciones IP por sí solo tampoco soluciona el problema; la calidad del dispositivo es lo que determina si una solicitud llega realmente a su destino.

## Qué significa esto para el sector de los datos web de cara al cuarto trimestre de 2026

Tres factores se están combinando al mismo tiempo. El tráfico de bots constituye ahora la mayor parte de todo el tráfico web. La IA es la fuente de mayor crecimiento en el lado de la demanda de ese tráfico. Y los principales proveedores de infraestructura están redefiniendo activamente las normas sobre quién obtiene acceso y en qué condiciones.

Cualquier equipo cuyo producto dependa de un acceso web fiable está operando en un entorno sustancialmente diferente al de hace tan solo un año. Esto es así independientemente de si el producto es un agente de IA, un canal de datos, una función de inteligencia competitiva o una herramienta de supervisión de AEO.

Leídas por separado, cada una de esas tres fuerzas parece una historia independiente: un informe de seguridad, un anuncio de política, una nota al pie de una investigación de mercado. Leídas en conjunto, describen un cambio subyacente.

La web abierta ya no es un recurso gratuito que la infraestructura consume silenciosamente en segundo plano. Se está convirtiendo en un recurso medido. El precio de acceso consiste en demostrar que su tráfico es legítimo, ya sea ante un sistema antibots o, cada vez más, según las condiciones de facturación de un editor.

Hace dos años, la disyuntiva era sencilla: o se le bloqueaba o no. Hoy en día se acerca más a tres niveles.

| Nivel de acceso | 2024 | 2026 |
|---|---|---|
| Bloqueado directamente | IP de centros de datos, firmas de bots maliciosos conocidas | Lo mismo, más rastreadores de IA de uso mixto en páginas financiadas con publicidad por defecto |
| Permitido, sin precio | La mayor parte del tráfico de rastreadores que supera los controles antibots | Indexación de búsquedas, recopilación de datos sin IA |
| Permitido y facturado | No existía como categoría | Rastreadores de IA bajo el modelo «Pay Per Use» de Cloudflare, que se pagan cuando el contenido aparece en una respuesta |

El nivel en el que se clasifica una solicitud depende de señales que controlan más los proveedores de infraestructura que los operadores de rastreadores: el origen del dispositivo, la ubicación geográfica y la intención declarada.

La vía fiable para ello nos lleva una y otra vez a los mismos principios fundamentales: el origen real del dispositivo frente a las direcciones IP de los centros de datos, y las solicitudes con precisión geográfica. Esto también implica una infraestructura diseñada para adaptarse a los constantes cambios en las políticas de los editores, y no una infraestructura concebida para el mundo más simplista de «bloquear o permitir» de 2024.

## Preguntas frecuentes

### ¿Es el tráfico de bots en la web abierta realmente mayor que el tráfico humano en la actualidad?

Sí. El informe «2026 Bad Bot Report» de Imperva reveló que el tráfico automatizado superó el 53 % de todo el tráfico web en 2025, mientras que el tráfico humano se redujo al 47 %, y describe esto como un cambio estructural más que como un pico temporal.

### ¿La nueva política de Cloudflare bloquea todos los rastreadores de IA?

No. Se centra específicamente en los rastreadores de «uso mixto», es decir, los bots que combinan la indexación de búsquedas con el entrenamiento de IA o la recopilación de datos para el desarrollo de agentes, y solo los bloquea de forma predeterminada en las páginas que contienen anuncios. El rastreo de búsqueda puro sigue estando permitido de forma predeterminada, y los propietarios de los sitios web pueden volver a habilitar los rastreadores de IA si así lo desean.

### ¿Por qué los proxies residenciales están ganando cuota de mercado frente a los proxies de centros de datos?

Principalmente debido a su tasa de éxito frente a los modernos sistemas antibots: aproximadamente entre el 92 % y el 98 % para los proxies residenciales, frente al 65 % y el 80 % de los proxies de centros de datos, ya que la detección antibots actual se basa en el comportamiento y en la huella digital de los dispositivos, en lugar de en simples listas de bloqueo de direcciones IP. Los porcentajes exactos de cuota de mercado varían según la empresa de investigación de mercado, pero todas las estimaciones publicadas coinciden en la tendencia.

## Notas sobre fuentes y metodología

Este informe sintetiza estudios de terceros sobre el sector, actualizados a septiembre de 2026: [Informe del Índice de IA de 2026 de Stanford HAI](https://hai.stanford.edu/ai-index/2026-ai-index-report), [Informe sobre bots maliciosos de 2026 de Imperva/Thales](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/), [el anuncio de política publicado por la propia Cloudflare](https://blog.cloudflare.com/content-independence-day-ai-options/), [la cobertura de TechCrunch sobre dicho anuncio](https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/), [la previsión de Gartner de agosto de 2025 sobre la adopción de agentes de IA en las empresas](https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025), [Informe de Actowiz Solutions sobre el sector del web scraping de 2026](https://www.actowizsolutions.com/web-scraping-industry-report-data-first-ai-revolution.php), y estudios agregados de 2026 sobre el tamaño del mercado en los segmentos del web scraping impulsado por IA y [los proxies residenciales](https://www.verifiedmarketreports.com/product/residential-proxy-ip-network-market/).

En los casos en que las estimaciones del tamaño del mercado variaban significativamente entre las distintas empresas de investigación de mercado —en el caso del mercado de proxies, en más de un orden de magnitud—, dicha variación se señala en el texto en lugar de reducirse a una única cifra fiable. El análisis que relaciona estos datos —el cambio de una web basada en el bloqueo o la autorización a una basada en el consumo medido— es la interpretación que Massive hace de la tendencia, no una afirmación realizada por ninguna de las fuentes citadas.

Se trata de una síntesis de investigaciones externas, no de un estudio propio de la red de Massive. Una próxima entrega de esta serie se basará en los datos propios de Massive sobre el volumen de solicitudes y la tasa de éxito, así como en un informe interno denominado «Signal» que ya figura en la hoja de ruta, y se indicará claramente como estudio propio en el momento de su publicación.

## Acerca del autor

Ryan Turner escribe en el blog de Massive sobre infraestructura de datos web, redes de proxy y acceso mediante agentes de IA, y realiza un seguimiento de cómo evolucionan trimestre a trimestre los sistemas antibots, las políticas de los editores y la normativa sobre el scraping web. Las preguntas sobre este informe o sobre la red de Massive pueden dirigirse a través de [la página «Acerca de» de Massive](https://www.joinmassive.com/about-us).
