Non. Les nouveaux paramètres par défaut s'appliquent aux nouveaux domaines intégrés à Cloudflare, et les paramètres existants sont migrés automatiquement. La recherche reste autorisée par défaut partout. Le trafic lié à l'apprentissage et aux agents n'est restreint par défaut que sur les nouveaux domaines monétisés par la publicité, conformément à l'article publié par Cloudflare le 15 septembre 2026.
Paramètres par défaut du robot d'exploration IA de Cloudflare au 15 septembre : ce qui a changé pour les agents et les équipes chargées des données
Le 15 septembre 2026, Cloudflare a modifié la définition du terme « bloqué » en ce qui concerne le trafic lié à l'IA. Les nouveaux domaines qui génèrent des revenus publicitaires sont désormais soumis aux règles suivantes : les robots d’apprentissage de l’IA sont interdits et les agents IA sont bloqués sur les pages contenant des publicités, tandis que la fonction de recherche reste accessible. Cloudflare indique que plus de 20 % du Web est hébergé sur son réseau (Blog Cloudflare, 2026), de sorte qu’un paramètre par défaut dans ce cas-ci a un impact considérable sur un cinquième du Web. Deux semaines après son entrée en vigueur, voici ce qui a réellement changé, qui est concerné et ce que les équipes utilisant des agents IA ou des pipelines de données devraient faire à ce sujet.
Points clés à retenir
- Depuis le 15 septembre 2026, Cloudflare classe le trafic lié à l'IA en trois catégories (Recherche, Entraînement, Agent), et pour les nouveaux domaines monétisés par la publicité, l'entraînement de l'IA est par défaut désactivé et le trafic « Agent » est bloqué sur les pages contenant des publicités (Blog Cloudflare, 2026).
- En juin 2026, 52 % des requêtes de robots d'indexation enregistrées par Cloudflare concernaient l'entraînement d'IA, contre 22 % au printemps 2025 (Blog Cloudflare, 2026).
- Si votre agent récupère des pages pour le compte d'un utilisateur, vous vous trouvez désormais dans le compartiment « Agent ». Prévoyez des variations par page, et non des règles par site.
Qu'est-ce qui a changé exactement le 15 septembre ?
Le 15 septembre 2026, Cloudflare a modifié la manière dont ses systèmes de contrôle des bots gèrent le trafic généré par l'IA (Blog Cloudflare, « Le meilleur des deux mondes », 2026). Ses paramètres « Bloquer » et « Bloquer sur les pages contenant des publicités » s’appliquent désormais également aux robots d’indexation à double usage, c’est-à-dire aux robots qui collectent des pages à la fois pour la recherche et pour l’IA. Le bouton unique « Bloquer les robots IA » est supprimé, et un nouveau paramètre « Interdire l’entraînement de l’IA » permet à un site de rester dans les résultats de recherche tout en refusant l’entraînement. Le fichier robots.txt géré devient également « Synchronisation des préférences des robots ». Le changement concret réside dans cette scission. Auparavant, Cloudflare traitait les « robots IA » comme une seule catégorie. Désormais, il classe le trafic IA en trois catégories : « Recherche », « Entraînement » et « Agent », et attribue à chacune son propre commutateur. Les nouveaux domaines se voient proposer l’un des deux préréglages suivants, selon que le site tire ou non des revenus publicitaires :
Les préréglages mentionnés dans l'article publié par Cloudflare le 15 septembre 2026, Faire d'une pierre deux coups.
Le Web n'a donc pas basculé du jour au lendemain. Selon Cloudflare, les paramètres des clients existants sont migrés automatiquement, et les nouveaux préréglages ne s'appliquent que lorsqu'un client intègre un nouveau domaine. Ce qui a changé, c'est le point de départ de chaque nouveau site à partir de maintenant, et sur un réseau de cette envergure, ces points de départ s'accumulent rapidement.
Pourquoi Cloudflare distingue-t-il les robots d'indexation en trois catégories : « Search », « Training » et « Agent » ?
Cloudflare a séparé ses contrôles liés à l'IA, car le trafic lié à l'entraînement a dépassé le trafic de recherche. En juin 2026, 52 % des requêtes de robots d'indexation observées par Cloudflare concernaient l'entraînement de l'IA, contre 22 % au printemps 2025, et les robots d'indexation à usage mixte représentaient plus de 36 % de l'activité (Cloudflare, « Content Independence Day : un an après », 2026). L'exploration purement axée sur la recherche ne représente désormais qu'une part modeste et en baisse. Pour un propriétaire de site, cela signifie que la plupart des robots IA qui accèdent à ses pages collectent du contenu destiné à des modèles plutôt que de rediriger des lecteurs via les résultats de recherche, et qu'un simple commutateur « robots IA » ne permettait en aucun cas de les distinguer.
Les éditeurs considèrent qu'il s'agit là d'un échange déséquilibré. TollBit, qui aide les éditeurs à concéder des licences de contenu aux entreprises spécialisées dans l'IA, suit cette évolution dans son Rapport « État des bots ». L'édition du 1er et du 2e trimestre 2026, qui porte sur les bots d'IA de 40 fournisseurs auprès de 3 906 éditeurs, a montré que le rapport « scrape-to-referral » était passé de 150:1 au 1er trimestre à 227:1 au 2e trimestre (TollBit, 2026, selon les informations rapportées par Digiday en août 2026). Cela représente des centaines de visites de robots pour chaque visiteur humain qui clique sur le lien.
Alors pourquoi ne pas tout bloquer, tout simplement ? Parce que, selon ce même article publié en septembre, moins de 1 % des sites utilisant Cloudflare bloquent les robots de recherche, tandis que 17 % activent un moyen de bloquer l'apprentissage (Blog Cloudflare, 2026). Les sites souhaitent bénéficier du trafic provenant de Google. Mais ils ne veulent tout simplement pas fournir gratuitement des données d'entraînement. Cette répartition en trois catégories leur permet d'accepter l'un tout en refusant l'autre.
Pour tous ceux qui développent des produits d'IA effectuant des recherches pour le compte d'un utilisateur, la catégorie « Agent » est celle qui importe. Les robots d'apprentissage allaient inévitablement se retrouver relégués au second plan. Les agents sont plus récents, et ils disposent désormais de leur propre bouton et de leur propre valeur par défaut, au lieu de partager un seul bouton « Bots IA » avec les robots d'apprentissage.
Qu'est-ce qu'un « crawler à usage mixte responsable » ?
Cloudflare définit un robot d'indexation à usage mixte responsable comme un robot dont l'opérateur offre aux propriétaires de sites la possibilité de refuser l'entraînement de l'IA (via le fichier robots.txt ou une norme similaire), des options de désactivation pour les résumés générés par l'IA, une visibilité au niveau des URL sur l'utilisation à des fins d'entraînement, ainsi que la garantie que ce refus n'aura pas d'incidence négative sur le classement dans les résultats de recherche (Blog Cloudflare, 2026). Cloudflare désigne Applebot, Bingbot et Googlebot comme des robots d'indexation à usage mixte responsables. L'entreprise classe Amazon, Anthropic, Meta et OpenAI parmi les opérateurs « responsables séparés », car ils utilisent des robots d'indexation distincts pour la recherche et pour l'entraînement. Les robots d’indexation à usage mixte « responsables » restent autorisés pour la recherche sur les sites qui sélectionnent l’option « Interdire l’apprentissage par l’IA ». Tous les autres robots d’indexation destinés à l’apprentissage sont bloqués sur ces sites.
Cela crée une incitation claire. Si vous exploitez un robot d'indexation, la meilleure façon de rester bien accueilli est de séparer vos objectifs ou de donner aux sites un véritable contrôle sur chacun d'entre eux. Un robot unique qui fait tout est désormais la chose la plus facile à bloquer.
Le modèle « paiement par indexation » devient le modèle « paiement à l'utilisation »
Dans le cadre du modèle « Pay Per Crawl », l'ancien modèle de Cloudflare, les sites pouvaient facturer aux robots d'exploration IA des frais pour chaque requête de page. En juillet 2026, Cloudflare a annoncé qu'il rémunérerait les éditeurs lorsque leur contenu contribuerait à la formulation d'une réponse générée par l'IA, et non plus uniquement lorsqu'une page était consultée. Les entreprises de recherche par IA Ceramic.ai et You.com ont été désignées comme premiers partenaires (The Next Web, 2026). Il s'agit là d'un véritable changement dans ce qui est facturé. Une exploration correspond à une requête unique, tandis qu'une « utilisation » correspond au moment où le contenu apparaît dans une réponse lue par un utilisateur. Pour les éditeurs, cela lie davantage la rémunération à la valeur. Pour les entreprises spécialisées dans l’IA, cela signifie que le coût du contenu pourrait commencer à dépendre de l’utilisation plutôt que du volume, ce qui modifie le calcul permettant de déterminer s’il est opportun de récupérer une page ou non.
Nous avons abordé la version antérieure de ce modèle, ainsi que les raisons pour lesquelles le Web ouvert a commencé à se fermer aux robots, dans Le « Closing Web » : blocage des robots d'indexation basés sur l'IA, paiement à l'indexation et implications pour les agents.
Que doivent faire dès à présent les équipes qui exploitent des agents d'IA ?
Commencez par accepter le fait que l'accès varie désormais d'une page à l'autre. Avec le nouveau paramètre par défaut axé sur la monétisation publicitaire, un agent peut accéder à la page des tarifs d'un site, puis se voir bloquer l'accès à l'article financé par la publicité qui se trouve juste à côté.
Une liste de contrôle pratique :
- Sachez dans quelle catégorie vous vous situez. La récupération d'une page à la suite d'une question posée par un utilisateur relève du trafic « Agent ». La collecte de pages en vue d'affiner un modèle relève de l'« apprentissage ». Veuillez les identifier distinctement dans vos propres journaux, car le Web les traite désormais différemment.
- Attendez-vous à des réponses page par page. « Bloquer les pages contenant des publicités » signifie qu'un même domaine peut donner une réponse positive ou négative. Mettez en place des tentatives de réessai et des solutions de repli par URL, et non par domaine.
- Considérez les blocages comme des signaux. Un blocage lié à ces préréglages correspond à la préférence exprimée par un éditeur. Enregistrez-le et contournez-le en utilisant une source sous licence ou structurée, le cas échéant.
- Surveillez le paiement à l'utilisation. Si une source dont vous dépendez adhère à un programme payant, il peut s'avérer plus économique de payer que de mettre en place une solution technique pour contourner cette situation.
- Séparez vos charges de travail et identifiez-les. Si vous gérez à la fois le trafic d'entraînement et celui des agents, veillez à leur attribuer des identités distinctes afin qu'aucun des deux ne bloque l'autre. Cloudflare propose également un programme d'« agents signés » : les agents pilotés par un utilisateur final peuvent signer leurs requêtes HTTP à l'aide de Web Bot Auth, une norme cryptographique de signature de messages, ce qui permet à Cloudflare de vérifier leur identité (Documentation Cloudflare, Agents signés). Si vous gérez un réseau d'agents, quelle que soit sa taille, cette lecture vous sera utile.
Il convient de signaler un piège en particulier. Dans le cas des pipelines d’agents, les échecs les plus préjudiciables ne sont généralement pas les blocages durs, qui sont faciles à repérer. Les « Challenge Pages » de Cloudflare constituent un exemple simple : chacune d’entre elles comporte un cf-mitigated: challenge en-tête, et son type de contenu est toujours text/html, quelle que soit la ressource que vous ayez demandée (Documentation Cloudflare, Détection d'une réponse de page de vérification). Vérifiez la présence de cet en-tête avant de procéder à toute analyse. Le cas le plus délicat est celui d’une page partielle silencieuse : une requête renvoie un statut 200, mais le corps correspond à une page de remplacement (une page interstitielle), un shell JavaScript ou une version allégée de l’article. Vérifiez le contenu renvoyé, et pas seulement le code d’état. Une longueur minimale de contenu, ou une vérification de la présence d’un élément DOM que vous vous attendez à trouver sur la page réelle, permet de détecter la plupart de ces cas.
Comment Massive s'adapte aux nouveaux paramètres par défaut de Cloudflare
Massive fournit un réseau d'accès aux appareils et une pile de rendu qui génèrent du code HTML ou Markdown propre à partir de pages publiques, dans plus de 195 pays. Les clients gèrent leurs propres opérations par-dessus ce système. Les préférences des éditeurs en matière d'IA constituent des signaux publics, et les équipes avec lesquelles nous travaillons les considèrent comme des éléments d'entrée pour définir leur propre politique, et non comme des obstacles à contourner.
Le Web Render API renvoie les pages générées au format Markdown pour les pipelines LLM et permet aux clients de cibler géographiquement leurs requêtes par pays, région ou ville. Sur les proxys résidentiels, chaque compte dispose également de son propre liste noire de domaines, ce qui permet à une équipe de bloquer les requêtes vers tout site auquel elle a décidé de ne pas accéder. La liste peut contenir jusqu’à 1 000 domaines, et toute requête vers un domaine bloqué est refusée avec une erreur 452 (Contenu interdit) avant même d’atteindre le site. Si votre pile d’agents atteint les nouvelles valeurs par défaut, veuillez consulter Pourquoi les agents IA sont bloqués sur les adresses IP des centres de données et comment y remédier, ou revenir au guide complet sur Comment permettre aux agents IA d'accéder au Web en temps réel. Pour en savoir plus sur les aspects juridiques liés aux données d'entraînement, consultez Les litiges relatifs aux données d'entraînement de l'IA que toute équipe chargée des données Web devrait connaître.
En résumé
- Cloudflare traite désormais le trafic « Search », « Training » et « Agent » comme trois options distinctes, chacune disposant de son propre commutateur et de sa propre valeur par défaut pour les nouveaux domaines.
- Les nouveaux domaines monétisés par la publicité sont initialement configurés avec l'option « Formation » désactivée et les agents bloqués sur les pages publicitaires.
- Avec le modèle « Pay Per Use », les éditeurs sont rémunérés en fonction des réponses fournies, et non du nombre de requêtes.
- Les développeurs d'agents doivent prévoir un accès page par page et vérifier chaque réponse pour s'assurer qu'elle contient le
cf-mitigated: challengeen-tête, et enregistrer chaque bloc en tant que préférence déclarée par l'éditeur. - À suivre : quelles entreprises spécialisées dans l'IA rejoindront Pay Per Use, et combien d'agents s'inscriront en tant que agents agréés.
Vous souhaitez voir à quoi ressemblent concrètement les récupérations de données rendues et géolocalisées ? Commencez par le Web Render API aperçu.
Sources
- Cloudflare, « Le meilleur des deux mondes : rester visible dans les résultats de recherche tout en empêchant l'entraînement de l'IA », consulté le 25 septembre 2026
- Cloudflare, « La Journée de l'indépendance du contenu, un an après », consulté le 25 septembre 2026
- The Next Web, « Cloudflare fixe la date limite de septembre aux robots d'indexation basés sur l'IA », consulté le 25 septembre 2026
- Documentation Cloudflare, Agents sous contrat
- Documentation Cloudflare, « Détecter une réponse à une page de défi », consulté le 28 septembre 2026
- TollBit, État des lieux concernant les bots (1er et 2e trimestres 2026)
- Digiday, « Un rapport révèle que les éditeurs européens sont de plus en plus touchés par le scraping effectué par des bots basés sur l'IA » (Données « State of the Bots » de TollBit)
Foire aux questions
Sauf sur les sites qui utilisent l'option « Disallow AI Training ». Cloudflare considère Googlebot, Bingbot et Applebot comme des robots d'indexation à usage mixte fiables, qui restent autorisés pour la recherche. Les sites qui optent pour un paramètre « Block » complet bloquent désormais également les robots d'indexation à usage mixte, ce qui peut affecter la visibilité dans les résultats de recherche.
Le modèle « Pay Per Crawl » facturait les robots d'indexation IA à chaque requête. Le modèle « Pay Per Use », annoncé en juillet 2026, rémunère les éditeurs lorsque leur contenu alimente une réponse générée par l'IA. Ceramic.ai et You.com ont été cités comme premiers partenaires, selon un article de The Next Web.
En juin 2026, Cloudflare a indiqué que 52 % des requêtes de robots d'exploration sur son réseau concernaient l'entraînement de l'IA, contre 22 % au printemps 2025. Les robots d'exploration à usage mixte représentaient plus de 36 % de l'activité.
