一个实物铁路道岔手柄,置于深色背景上,边缘带有橙色光晕,象征着Cloudflare将AI爬虫流量引导至不同的路径。
所有文章

Cloudflare 9月15日AI爬虫默认设置:对代理和数据团队有何变化

Franklin Uche
Franklin Uche · Community Lead
打开 Markdown

2026年9月15日,Cloudflare调整了AI流量中“被封锁”的定义。 新注册的、通过广告盈利的域名,其AI Training爬虫现被禁止访问,且在带有广告的页面上AI Agents被屏蔽,而搜索功能仍保持开放。Cloudflare表示,超过20%的网站位于其网络之后(Cloudflare 博客(2026年),因此这里的默认设置对五分之一的网络而言,其作用与一项政策大同小异。实施两周以来,以下是实际发生的变化、受影响的对象,以及运行AI代理或数据管道的团队应如何应对。

要点总结
  • 自 2026 年 9 月 15 日起,Cloudflare 将 AI 流量分为三类(搜索、训练、代理),对于通过广告变现的新域名,默认禁止 AI 训练流量,并在含有广告的页面上屏蔽代理流量(Cloudflare 博客(2026年)。
  • 2026年6月,Cloudflare监测到的爬虫请求中,有52%用于AI训练,这一比例较2025年春季的22%有所上升(Cloudflare 博客(2026年)。
  • 如果您的代理程序代表用户抓取页面,那么您现在处于“代理”分类中。请针对每页的差异进行规划,而非制定基于网站的规则。

9月15日到底发生了什么变化?

2026年9月15日,Cloudflare 调整了其机器人控制系统处理人工智能流量的方式(Cloudflare 博客,《两全其美》, 2026)。其“阻止”和“在含广告的页面上阻止”设置现也适用于混合用途爬虫——即同时为搜索和人工智能收集页面的机器人。 原有的“阻止 AI 机器人”单选开关将被淘汰,新的“禁止 AI 训练”设置允许网站在拒绝用于训练的同时仍保留在搜索结果中。托管 robots.txt 功能也更名为“机器人偏好同步”。实际的变化在于分类的细分。 Cloudflare 过去将“AI 机器人”视为一个类别。现在,它将 AI 流量分为“搜索”、“训练”和“代理”三个类别,并为每个类别提供了独立的开关。新域名将根据网站是否通过广告盈利,获得以下两种预设之一:

Bucket What it covers New ad-monetized domain New non-ad domain
Search Indexing for search results Allowed Allowed
Training Collecting content to train models Disallow AI Training Allowed
Agent Fetching pages for a user's live request Blocked on pages with ads Allowed

Cloudflare 在 2026 年 9 月 15 日的帖子中列出的预设,两全其美.

因此,网络并非在一夜之间发生改变。据 Cloudflare 称,现有客户的设置会自动迁移,新的预设仅在客户接入新域名时生效。真正发生变化的是今后每个新网站的起点,而在如此规模的网络中,这些起点的累积速度非常快。

Cloudflare 为何将爬虫分为“搜索”、“训练”和“代理”三类?

Cloudflare 将人工智能控制功能拆分,是因为训练流量已超过搜索流量。截至 2026 年 6 月,Cloudflare 监测到的爬虫请求中,52% 用于人工智能训练,这一比例较 2025 年春季的 22% 有所上升,而混合用途爬虫的活动占比超过 36%(Cloudflare,《“内容独立日”一周年》(2026年)。如今,纯粹的搜索爬取所占比例已很小,且还在不断缩小。对于网站所有者而言,这意味着访问其页面的AI机器人中,大多数是为了收集模型所需的内容,而非将读者引导回搜索结果页面;而仅靠一个“AI机器人”开关,根本无法区分这两类情况。

出版商认为这是一笔不平等的交易。TollBit 是一家帮助出版商向人工智能公司授权内容的机构,它在自己的《机器人现状报告》. 2026年第一季度和第二季度版报告涵盖了来自40家供应商、涉及3,906家出版商的AI机器人,数据显示,从爬取到转介的比例从第一季度的150:1上升至第二季度的227:1 (TollBit,2026年,据Digiday (2026年8月)。这意味着每有一名真实用户点击进入,就会有数百次机器人访问。

那么,为什么不干脆把所有内容都屏蔽掉呢?因为根据同一篇9月份的帖子,只有不到1%的Cloudflare网站会屏蔽搜索机器人,而17%的网站启用了某种屏蔽训练的方式(Cloudflare 博客(2026年)。网站都希望获得谷歌的流量,但它们并不愿意免费提供训练数据。这种“三桶”划分模式让它们既能满足一方的需求,又能拒绝另一方的要求。

对于任何开发代用户浏览的AI产品的人来说,“代理”分类才是关键。训练爬虫的设置空间势必会受到挤压。代理是较新的功能,现在它拥有独立的开关和默认设置,不再需要与训练爬虫共享一个“AI机器人”开关。

什么是“可追责”的混合用途履带式车辆?

Cloudflare 将“负责任的混合用途爬虫”定义为:其运营商向网站所有者提供了一种方式(通过 robots.txt 或类似标准),使其能够选择退出 AI 训练;提供了针对 AI 摘要的选择退出控制功能;在 URL 级别提供训练用途的可见性;并保证选择退出不会影响搜索排名(Cloudflare 博客(2026年)。Cloudflare将Applebot、Bingbot和Googlebot列为“负责任的混合用途爬虫”。它将亚马逊、Anthropic、Meta和OpenAI列为“负责任的分离式”运营商,因为它们为搜索和训练分别运行了不同的爬虫。 对于选择“禁止AI训练”的网站,负责任的混合用途爬虫仍被允许用于搜索。其他所有训练爬虫在这些网站上均会被屏蔽。

这建立了一个明确的激励机制。如果你运行一个爬虫,要保持被欢迎的地位,就必须将不同用途分开,或者让网站能够对每种用途进行实质性的控制。如今,一个包揽所有功能的机器人是最容易被屏蔽的。

“按抓取次数付费”变为“按使用次数付费”

在 Cloudflare 早期的“按爬取次数付费”(Pay Per Crawl)模式下,网站可以针对每次页面请求向 AI 爬虫收取费用。2026 年 7 月,Cloudflare 表示,当发布者的内容被用于生成 AI 答案时,该公司将向其支付报酬,而不仅仅是在页面被抓取时。 人工智能搜索公司 Ceramic.ai 和 You.com 被列为首批合作伙伴(The Next Web(2026年)。这标志着定价对象发生了实质性转变。爬取算作一次请求,而“使用”则是指内容最终出现在用户阅读的答案中的那一刻。 对于内容发布商而言,这使得支付与价值更加紧密地挂钩。对于人工智能公司而言,这意味着内容成本可能开始根据使用情况而非数量来计算,这将改变是否需要抓取该页面的决策逻辑。

我们在……中探讨了该模型的早期版本,以及开放网络为何开始对机器人关闭,“收网”行动:AI爬虫封锁、按爬取次数付费,以及这对代理商意味着什么.

目前,运行人工智能代理的团队应该怎么做?

首先需要接受这样一个事实:现在不同页面的访问情况各不相同。在新的广告变现预设下,代理可能能够访问某个网站的定价页面,但在旁边的广告支持的文章页面上却会被拦截。

一份实用的检查清单:

  1. 弄清楚自己属于哪一类。 因用户提出问题而请求页面属于“代理流量”;为微调模型而抓取页面则属于“训练”。请在您的日志中分别标注这两类流量,因为当前 Web 环境已将它们视为不同类型。
  2. 请按每页为单位作答。 “在含有广告的页面上屏蔽”意味着同一个域名可能既允许也可能不允许。应按 URL 而不是按域名设置重试和备用方案。
  3. 将代码块视为信号。 在这些预设条件下,某条内容的被屏蔽属于发布方的明确偏好。请记录该情况,并在存在许可或规范来源时,改用该来源绕过屏蔽。
  4. 观看“按使用量付费”。 如果一个你依赖的来源加入了付费项目,付费可能比为此另行开发解决方案更划算。
  5. 将工作负载进行分离,并加以标识。 如果您同时运行训练流量和代理流量,请将它们分配到不同的身份下,以免其中一方导致另一方被封锁。Cloudflare 还运行着一个“签名代理”计划:由终端用户控制的代理可以使用 Web Bot Auth(一种加密消息签名标准)对其 HTTP 请求进行签名,以便 Cloudflare 能够验证其身份(Cloudflare 文档,已签名的代理). 无论你的代理业务规模大小,这篇文章都值得一读。

有种陷阱值得特别指出。对于代理管道而言,造成最大影响的故障往往并非那些显而易见的硬阻塞。Cloudflare 自身的“挑战页面”就是个典型的例子:每个页面都包含一个cf-mitigated: challenge 标头,且其内容类型始终为text/html, 无论你请求的是什么资源(Cloudflare 文档:检测挑战页面的响应). 在解析任何内容之前,请先检查该标头。更棘手的情况是“无声的局部页面”:请求返回 200 状态码,但响应正文却是一个占位页面(插页)、一个 JavaScript 壳程序,或是文章的简化版本。 请检查返回的内容,而不仅仅是状态码。通过验证内容长度是否达到最低要求,或者检查真实页面中预期的 DOM 元素是否存在,可以发现其中大部分问题。

Massive 如何适应 Cloudflare 的新默认设置

Massive 提供了一个设备访问网络和渲染堆栈,可在 195 多个国家/地区从公共页面生成纯净的 HTML 或 Markdown 内容。客户可在其基础上开展自己的运营。发布商的 AI 偏好属于公开信号,我们合作的团队将其视为制定自身政策的输入依据,而非需要绕开的障碍。

该Web Render API 将渲染后的页面以 Markdown 格式返回给 LLM 管道,并允许客户按国家、地区或城市对请求进行地理定位。在住宅代理服务中,每个账户还拥有独立的域名黑名单,因此团队可以阻止对任何已被列入禁止访问列表的网站的请求。该列表最多可包含 1,000 个域名,针对被屏蔽域名的请求在尚未到达该网站之前,就会因 452(禁止内容)错误而被拒绝。如果您的代理堆栈触发了新的默认设置,请参阅为什么 AI 代理会被数据中心 IP 地址封锁,以及如何解决这个问题,或者返回关于如何为 AI 代理提供实时网页访问权限. 关于训练数据的法律问题,请参阅每个网络数据团队都应了解的AI训练数据相关诉讼.

归根结底

  • Cloudflare 现将“搜索”、“训练”和“代理”流量视为三项独立的决策,每项决策都有各自的开关,并对新域名设有各自的默认设置。
  • 通过广告变现的新域名在广告页面上初始状态为“禁止训练”且“代理被阻止”。
  • “按使用量付费”模式是根据答案向发布者付费,而非根据查询次数付费。
  • 代理构建器应规划按页面访问,并检查每个响应中的cf-mitigated: challenge 标头,并将每个区块作为发布者声明的偏好进行记录。
  • 接下来值得关注的是:哪些人工智能公司将加入“按使用付费”计划,以及有多少代理商注册为已签约代理.

想看看渲染后的、基于地理位置的请求在实际中是什么样子的吗?不妨从Web Render API 概述.

来源

常见问题解答

Cloudflare 是否在 2026 年 9 月 15 日封锁了所有 AI 爬虫?+

不。新的默认设置适用于新接入 Cloudflare 的域名,现有设置将自动迁移。根据 Cloudflare 于 2026 年 9 月 15 日发布的公告,搜索功能在所有情况下默认均被允许。而训练和代理流量仅在通过广告变现的新域名上默认受到限制。

Googlebot 是否被新的 Cloudflare 设置屏蔽了?+

但不适用于使用“禁止 AI 训练”设置的网站。Cloudflare 将 Googlebot、Bingbot 和 Applebot 归类为可信的混合用途爬虫,这些爬虫仍被允许进行搜索。不过,选择完全“阻止”设置的网站现在也会阻止混合用途爬虫,这可能会影响搜索可见性。

“按抓取次数付费”和“按使用次数付费”有什么区别?+

“按爬取次数付费”(Pay Per Crawl)模式按每次请求向AI爬虫收费。2026年7月公布的“按使用付费”(Pay Per Use)模式则是在发布者的内容被用于生成AI答案时向其支付报酬。据The Next Web的报道,Ceramic.ai和You.com被列为早期合作伙伴。

目前AI训练占爬虫流量的多少?+

截至2026年6月,Cloudflare报告称,其网络上52%的爬虫请求用于AI训练,较2025年春季的22%有所上升。多用途爬虫占总活动量的36%以上。