Résumé : Visualisation de données de la marque Massive montrant que le trafic généré par les bots dépasse désormais le trafic humain sur une carte du réseau mondial, sur fond sombre avec des barres orange en surbrillance.
Tous les articles

État des lieux du secteur des données Web : 3e trimestre 2026

Ryan Turner
Ryan Turner · Head of Innovation
Ouvrir le markdown

En 2025, le trafic automatisé a dépassé le trafic humain sur le Web ouvert, et cette tendance ne s'est pas inversée depuis. Les robots représentent désormais plus de 53 % de l'ensemble du trafic Web, tandis que l'activité humaine est tombée à 47 % et continue de baisser (Imperva/Thales, Rapport 2026 sur les « bad bots »). Parallèlement, les éditeurs mettent pour la première fois en place une véritable infrastructure leur permettant de monétiser ce trafic, au lieu de se contenter de le bloquer. Tel est l'état du secteur des données Web à l'approche du quatrième trimestre 2026 : plus vaste, plus automatisé, davantage axé sur l'IA et plus disputé qu'il ne l'était il y a un an.

Points clés à retenir
  • Le trafic automatisé représentait 53 % de l'ensemble du trafic Web en 2025, les « mauvais bots » représentant à eux seuls 40 %, contre 37 % l'année précédente (Rapport Imperva/Thales sur les « bad bots » 2026).
  • L'IA est désormais la nouvelle source principale de la demande en matière de scraping. Les laboratoires de pointe ne divulguent plus la composition des données d'apprentissage (Stanford HAI, Rapport 2026 sur l'indice de l'IA), mais selon les estimations du secteur, les données extraites du Web constituent la principale source d'alimentation de la plupart des modèles génératifs, et les équipes d'entreprise indiquent de plus en plus souvent qu'elles ont besoin de pipelines en temps réel, et non d'extractions par lots, pour maintenir à jour leurs systèmes d'IA.
  • Les éditeurs passent du blocage à la facturation. La politique par défaut de Cloudflare, qui entrera en vigueur le 15 septembre 2026, bloque les robots d’indexation IA « à usage mixte » sur les pages financées par la publicité et fait évoluer sa place de marché « Pay-Per-Crawl » vers un modèle « Pay Per Use » qui rémunère les éditeurs lorsque leur contenu apparaît effectivement dans une réponse générée par l’IA (Blog Cloudflare, juillet 2026; TechCrunch, 1er juillet 2026).
  • Sur le marché des proxys lui-même, les proxys résidentiels ne cessent de grignoter des parts de marché aux adresses IP de centres de données. Les estimations des fournisseurs concernant la répartition exacte varient considérablement, mais toutes s'accordent sur la tendance : les proxys résidentiels gagnent du terrain car ils parviennent à contourner les systèmes anti-bots modernes à un taux bien plus élevé.

En 2025, le Web a franchi un cap : il y avait désormais plus de robots que d'humains

Pendant la majeure partie de l'histoire d'Internet, la conception même de la manière dont les sites sont créés, monétisés et protégés reposait sur l'hypothèse que le visiteur type était un être humain. Cette hypothèse n'est plus valable. Le rapport « 2026 Bad Bot Report » d'Imperva a révélé que le trafic automatisé représentait plus de 53 % de l'ensemble du trafic Web en 2025, contre 51 % l'année précédente, tandis que l'activité humaine est tombée à 47 % et continue de baisser (Imperva/Thales, 2026).

Sur cette part automatisée, les « bons » robots (robots d'indexation, outils de surveillance, collecte légitime de données) représentaient environ 13 %. Les mauvais robots, le trafic automatisé qui imite un véritable navigateur ou effectue des extractions de données sans autorisation représentait 40 % du trafic total, contre 37 % en 2024.

Imperva présente clairement ce phénomène comme un changement structurel, et non comme un pic ponctuel lié à une campagne d’attaques ou à un événement viral. Cela revêt une importance particulière pour toute personne développant des applications sur le Web ouvert en 2026. La composition du trafic sur laquelle reposent votre infrastructure, votre stratégie de lutte contre les bots et votre stratégie de collecte de données n’est plus celle que l’on observe réellement.

L'intelligence artificielle est devenue le principal nouveau moteur de la demande en matière de scraping

L'appétit de l'IA générative pour les données du Web est le facteur le plus déterminant dans la transformation de la composition de ce trafic. Le rapport « AI Index Report 2026 » de l’université de Stanford souligne que la composition des données d’entraînement n’est plus divulguée pour plusieurs des systèmes de pointe les plus gourmands en ressources, notamment les modèles d’OpenAI, d’Anthropic et de Google (Stanford HAI, Rapport 2026 sur l'indice de l'IA). Ce manque de transparence est en soi révélateur. Les laboratoires qui pouvaient autrefois se référer à un ensemble de données publié refusent désormais de préciser ce que contient cet ensemble.

En l'absence de ces informations, les chercheurs du secteur ont comblé cette lacune à l'aide d'estimations. Le rapport 2026 d'Actowiz Solutions sur le web scraping estime qu'environ 70 % des modèles génératifs sont entraînés principalement à partir de données web extraites (Actowiz Solutions, Rapport sur le secteur du web scraping 2026). Considérez ce chiffre précis comme une estimation du fournisseur, et non comme un chiffre vérifié.

Cette orientation correspond toujours à ce que constatent déjà tous les acheteurs d’infrastructures d’IA. Chaque agent d’IA supplémentaire, chaque système RAG et chaque pipeline de formation viennent s’ajouter à la même demande sous-jacente : un contenu web propre, à jour et accessible, dont le volume et l’actualité ne peuvent être satisfaits par une collecte manuelle périodique.

L'évaluation de la taille du marché va dans le même sens, bien que les estimations varient selon les cabinets d'études et les méthodologies utilisées. Plusieurs rapports prévisionnels pour 2026 évaluent le segment du web scraping basé sur l'IA à une valeur annuelle comprise entre quelques milliards et une dizaine de milliards, avec une croissance à deux chiffres prévue pour la décennie. Aucun chiffre ne doit être considéré ici comme définitif. Mais la tendance sur laquelle toutes les estimations s’accordent ne fait aucun doute : ce segment connaît une croissance rapide, et l’IA en est la raison.

Les prévisions de Gartner concernant l'adoption de cette technologie par les entreprises confirment cette même tendance sous un angle différent : les agents d'IA dédiés à des tâches spécifiques devraient être intégrés dans 40 % des applications d'entreprise d'ici fin 2026, contre moins de 5 % en 2025 (Gartner, « Gartner prévoit que 40 % des applications d'entreprise intégreront des agents IA dédiés à des tâches spécifiques d'ici 2026 », communiqué de presse, 26 août 2025). Chacun de ces agents constitue un nouveau consommateur permanent de données Web en temps réel, et non un simple cycle d'apprentissage ponctuel.

L'écosystème open source est un indicateur utile de la vitesse à laquelle cette demande augmente. Crawl4AI, un robot d'indexation spécialement conçu pour convertir les pages web en format Markdown compatible avec les modèles de langage de grande envergure (LLM), a dépassé les 83 000 étoiles sur GitHub. Cela démontre que « les données web propres pour un pipeline d'IA » sont désormais un besoin courant chez les développeurs, et non plus un besoin de niche.

Les éditeurs ont cessé de se contenter de tenter de le bloquer. Désormais, ils le facturent.

L'autre événement marquant du troisième trimestre 2026 : les principaux fournisseurs d'infrastructures du Web ouvert ont cessé de considérer le trafic généré par les robots d'indexation basés sur l'IA comme purement nuisible. Ils ont commencé à mettre en place les infrastructures nécessaires pour le facturer. Le changement de politique de Cloudflare, entré en vigueur le 15 septembre 2026, établit un nouveau paramètre par défaut (Blog Cloudflare, « Votre site, vos règles », juillet 2026).

Les robots d'indexation « à double usage », c'est-à-dire les bots qui combinent l'indexation traditionnelle des recherches avec la collecte de données destinées à l'entraînement de l'IA ou au développement d'agents, sont bloqués par défaut sur toute page contenant des publicités. L'indexation purement axée sur la recherche reste autorisée par défaut. Ce paramètre par défaut s'applique aux nouveaux clients de Cloudflare, aux sites récemment ajoutés à des comptes existants et à tous les clients actuels bénéficiant de l'offre gratuite.

Parallèlement à cette option de blocage par défaut, Cloudflare fait évoluer son modèle économique existant « Pay-Per-Crawl » vers ce qu’il appelle le « Pay Per Use ». Les éditeurs sont rémunérés lorsque leur contenu apparaît effectivement dans une réponse générée par l’IA, et non plus simplement lorsqu’un robot d’indexation récupère la page. Ceramic.ai et You.com sont cités comme partenaires de lancement de ce modèle (TechCrunch, 1er juillet 2026).

Il s’agit d’un mécanisme nettement différent du choix binaire « bloquer ou autoriser » qui a caractérisé la politique relative aux robots d’indexation basés sur l’IA au cours des deux dernières années. Cela annonce une évolution plus importante : la plus grande couche d’infrastructure du Web considère désormais que l’accès des IA doit s’inscrire dans le cadre d’une relation mesurée et monétisée, et non plus comme un accès libre à tous ou un blocage total.

Pour tous ceux qui développent un agent, un pipeline RAG ou un produit de surveillance basé sur l'IA, c'est la tendance la plus importante à l'approche du quatrième trimestre. Les règles permettant d'accéder à une page sont en train d'évoluer.

Auparavant, la question était : « Mon robot d’indexation peut-il passer le contrôle anti-bot ? ». Aujourd’hui, c’est : « Mon trafic relève-t-il d’une catégorie que le site de destination a accepté d’autoriser ou de facturer ? ». Massive suit de près cette évolution ; voir Le « Closing Web » : blocage des robots d'indexation basés sur l'IA, paiement à l'indexation, et ce que cela implique pour les agents pour une analyse technique plus approfondie des changements qui concernent spécifiquement les développeurs d'agents.

Au cœur même du marché des proxys : le secteur résidentiel continue de gagner des parts de marché dans le secteur des données Web

Si le sujet principal porte sur l'opposition entre les robots et les humains, d'une part, et entre les éditeurs et les robots d'indexation, d'autre part, une deuxième évolution, plus discrète, se produit au sein de la couche d'infrastructure qui gère l'ensemble de ce trafic. Les proxys résidentiels, ainsi que les réseaux d'appareils d'utilisateurs réels tels que celui de Massive, continuent de grignoter des parts de marché aux adresses IP de centres de données au sein même du marché des proxys. Voir Proxys résidentiels vs proxys de centres de données pour les agents d'IA pour consulter la comparaison technique complète.

La part exacte du marché reste en réalité difficile à déterminer. Les cabinets de recherche de marché publient des chiffres globaux très divergents pour ce segment, allant de moins de 150 millions de dollars à plusieurs milliards de dollars, selon le champ d’application et la méthodologie utilisés. Aucun de ces chiffres ne doit être considéré comme un chiffre certifié. Selon une estimation d'un fournisseur largement citée, les proxys résidentiels représenteraient environ 42 % du chiffre d'affaires total du marché des proxys en 2026, contre environ 35 % en 2023 (synthèse de la recherche de marché, 2026). Considérez ce pourcentage comme indicatif et non comme une valeur exacte.

Ce qui est mieux étayé, c'est le mécanisme à l'origine de ce changement :

Proxy type Pass rate against modern anti-bot systems Detection method it defeats
Residential (real device) 92-98% Behavioral and device fingerprinting
Datacenter 65-80% Weaker against fingerprinting, stronger only against simple IP blocklists

Les systèmes anti-bots ne fonctionnent plus principalement en mettant sur liste noire les plages d'adresses IP connues des centres de données. Ils identifient désormais le comportement des requêtes, les signaux émis par les appareils et les schémas de trafic que produit naturellement un appareil grand public, mais que ne produit généralement pas une machine de centre de données.

L'écart de performances indiqué dans ce tableau risque de se creuser, et non de se réduire, à mesure que la course à l'armement décrite ci-dessus s'intensifie. Un nombre plus élevé d'adresses IP ne suffit pas à lui seul à résoudre ce problème ; c'est la qualité des appareils qui détermine si une requête aboutit réellement.

Ce que cela signifie pour le secteur des données Web à l'approche du quatrième trimestre 2026

Trois facteurs se combinent simultanément. Le trafic généré par les robots représente désormais la majeure partie du trafic Web. L'intelligence artificielle est la source qui connaît la croissance la plus rapide du côté de la demande de ce trafic. Et les plus grands fournisseurs d'infrastructures sont en train de redéfinir activement les règles déterminant qui a accès à ce trafic et à quelles conditions.

Toute équipe dont le produit repose sur un accès Internet fiable évolue aujourd’hui dans un environnement radicalement différent de celui d’il y a encore un an. Cela vaut aussi bien pour un agent d’IA, un pipeline de données, une fonction de veille concurrentielle ou un outil de suivi des AEO.

Prises isolément, ces trois forces semblent constituer autant d'histoires distinctes : un rapport sur la sécurité, l'annonce d'une politique, une note de bas de page issue de la recherche de marché. Considérées dans leur ensemble, elles décrivent une évolution sous-jacente.

Le Web ouvert n'est plus une ressource gratuite que l'infrastructure consomme discrètement en arrière-plan. Il devient une ressource facturée à l'utilisation. Le prix d'accès consiste à prouver que votre trafic est légitime, soit auprès d'un système anti-bot, soit, de plus en plus souvent, conformément aux conditions de facturation d'un éditeur.

Il y a deux ans, le choix était simple : soit on était bloqué, soit on ne l'était pas. Aujourd'hui, on peut plutôt parler de trois niveaux.

Access tier 2024 2026
Blocked outright Datacenter IPs, known bad-bot signatures Same, plus mixed-use AI crawlers on ad-supported pages by default
Allowed, unpriced Most crawler traffic that clears anti-bot checks Search indexing, non-AI data collection
Allowed and billed Did not exist as a category AI crawlers under Cloudflare's Pay Per Use, paid when content surfaces in an answer

Le niveau auquel une requête est classée dépend de critères que les fournisseurs d'infrastructure contrôlent davantage que les opérateurs de robots d'indexation : l'origine de l'appareil, la localisation géographique et l'intention déclarée.

La voie sûre à suivre revient sans cesse aux mêmes principes fondamentaux : l'origine réelle des appareils plutôt que les adresses IP des centres de données, et des requêtes géolocalisées avec précision. Cela implique également une infrastructure conçue pour s'adapter à l'évolution constante des politiques des éditeurs, et non une infrastructure conçue pour le monde simpliste du « bloquer ou autoriser » de 2024.

Note sur les sources et la méthodologie

Le présent rapport synthétise les études sectorielles réalisées par des organismes indépendants, à la date de septembre 2026 : Rapport 2026 sur l'indice de l'IA du HAI de Stanford, Rapport 2026 d'Imperva/Thales sur les « bad bots », Annonce relative à la politique publiée par Cloudflare lui-même, L'article de TechCrunch consacré à cette annonce, Prévisions de Gartner concernant l'adoption des agents d'IA d'entreprise en août 2025, Rapport 2026 d'Actowiz Solutions sur le secteur du web scraping, ainsi qu’une étude de recherche de marché pour 2026 portant sur le web scraping basé sur l’IA et segments de proxys résidentiels.

Lorsque les estimations de la taille du marché présentaient des écarts significatifs entre les cabinets d’études — dans le cas du marché des procurations, ces écarts dépassant même un ordre de grandeur —, cette variance est signalée dans le texte plutôt que d’être résumée en un seul chiffre présenté comme certain. L’analyse reliant ces données, à savoir le passage d’un modèle Internet de type « tout ou rien » à un modèle de tarification au volume, correspond à l’interprétation de Massive quant à cette tendance, et non à une affirmation formulée par l’une des sources citées.

Il s'agit d'une synthèse d'études externes, et non d'une étude réalisée en interne par le réseau Massive. Un prochain volet de cette série s'appuiera sur les données de Massive concernant le volume de demandes et les taux de réussite, ainsi que sur un rapport interne intitulé « Signal » déjà prévu dans notre feuille de route, et sera clairement identifié comme une étude interne lors de sa publication.

À propos de l'auteur

Ryan Turner traite, pour le blog Massive, des infrastructures de données Web, des réseaux de proxys et de l'accès des agents d'intelligence artificielle ; il suit l'évolution, d'un trimestre à l'autre, des systèmes anti-bots, des politiques des éditeurs et de la réglementation relative au web scraping. Vous pouvez adresser vos questions concernant ce rapport ou le réseau de Massive via La page « À propos » de Massive.

Foire aux questions

Le trafic généré par les robots sur le Web ouvert est-il désormais réellement plus important que le trafic humain ?+

Oui. Le rapport « 2026 Bad Bot Report » d'Imperva a révélé qu'en 2025, le trafic automatisé représentait plus de 53 % de l'ensemble du trafic web, tandis que le trafic humain n'atteignait plus que 47 % ; ce rapport qualifie cette évolution de changement structurel plutôt que de pic temporaire.

La nouvelle politique de Cloudflare bloque-t-elle tous les robots d'indexation basés sur l'IA ?+

Non. Cette mesure vise spécifiquement les robots d’indexation « à double usage », c’est-à-dire ceux qui combinent l’indexation de recherche avec l’entraînement de l’IA ou la collecte de données pour le développement d’agents, et ne les bloque par défaut que sur les pages contenant des publicités. L’indexation purement destinée à la recherche reste autorisée par défaut, et les propriétaires de sites peuvent, s’ils le souhaitent, réactiver l’autorisation des robots d’indexation dédiés à l’IA.

Pourquoi les proxys résidentiels gagnent-ils du terrain par rapport aux proxys de centre de données ?+

Principalement en raison de leur taux de réussite face aux systèmes anti-bots modernes : environ 92 à 98 % pour les proxys résidentiels contre 65 à 80 % pour les proxys de centres de données, car la détection anti-bots repose aujourd’hui sur l’analyse comportementale et l’empreinte numérique des appareils plutôt que sur de simples listes noires d’adresses IP. Les pourcentages exacts des parts de marché varient selon les cabinets d'études, mais toutes les estimations publiées s'accordent sur la tendance générale.