# Cloudflare 9月15日AI爬虫默认设置：对代理和数据团队有何变化

2026年9月15日，Cloudflare调整了针对AI流量的“阻止”策略。新注册且通过广告盈利的域名，其AI训练爬虫现被默认禁止，而在包含广告的页面上，AI代理将被默认阻止，但搜索功能仍保持开放。 Cloudflare 表示，超过 20% 的网站位于其网络之后（[Cloudflare 博客](https://blog.cloudflare.com/agentic-internet-bot-report/)，2026 年），因此此处的默认设置实际上相当于针对五分之一互联网制定的政策。 政策实施两周后，以下是实际发生的变化、受影响的对象，以及运行 AI 代理或数据管道的团队应采取的应对措施。

> **关键要点**
>
> - 自 2026 年 9 月 15 日起， Cloudflare 将 AI 流量分为三类（搜索、训练、代理），且通过广告变现的新域名默认禁止 AI 训练流量，并在含有广告的页面上屏蔽代理流量（[Cloudflare 博客](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)，2026）。
> - 2026年6月，Cloudflare监测到的爬虫请求中，52%用于AI训练，较2025年春季的22%有所上升（[Cloudflare 博客](https://blog.cloudflare.com/agentic-internet-bot-report/)，2026）。
> - 如果您的代理程序代表用户抓取页面，您现在将被归入“代理”类别。请制定针对单个页面的差异化策略，而非基于整个网站的规则。

## 9月15日究竟发生了什么变化？

2026年9月15日，Cloudflare 调整了其机器人控制机制对 AI 流量的处理方式（[Cloudflare 博客，“两全其美”](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)，2026）。 其“阻止”和“在含广告的页面上阻止”设置现也适用于混合用途爬虫——即同时为搜索和 AI 收集页面的机器人。单一的“阻止 AI 机器人”开关将被淘汰，新的“禁止 AI 训练”设置允许网站在拒绝训练的同时仍保留在搜索结果中。 托管的 robots.txt 文件也更名为“机器人偏好同步”。实际的变化在于分类的细分。Cloudflare 过去将“AI 机器人”视为一个类别。现在，它将 AI 流量分为“搜索”、“训练”和“代理”三个类别，并为每个类别提供了独立的开关。 针对新域名，系统会根据网站是否通过广告盈利，提供两种预设方案之一：

| 分类 | 涵盖范围 | 新的广告盈利域名 | 新的非广告域名 |
|--------|----------------|-------------------------|-------------------|
| 搜索 | 用于搜索结果的索引 | 允许 | 允许 |
| 训练 | 收集内容以训练模型 | 禁止 AI 训练 | 允许 |
| 代理 | 为用户的实时请求抓取页面 | 含广告的页面被阻止 | 允许 |

*预设配置参见 Cloudflare 2026 年 9 月 15 日的博文《两全其美》(https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)。*

因此，网络并非在一夜之间发生巨变。据 Cloudflare 称，现有客户的设置将自动迁移，新预设仅在客户接入新域名时生效。真正发生变化的是今后每个新网站的起始点，而在如此庞大的网络中，这些起始点的累积效应将迅速显现。

## 为什么 Cloudflare 要把爬虫分为“搜索”、“训练”和“代理”三类？

Cloudflare 之所以将 AI 控制功能拆分，是因为训练流量已超过搜索流量。截至 2026 年 6 月，Cloudflare 观察到的爬虫请求中，52% 用于 AI 训练，而 2025 年春季这一比例仅为 22%；混合用途爬虫则占活动总量的 36% 以上（[Cloudflare，《内容独立日，一周年回顾》](https://blog.cloudflare.com/agentic-internet-bot-report/)，2026年)。纯粹的搜索爬取目前仅占很小且不断缩小的份额。 对于网站所有者而言，这意味着访问其页面的绝大多数AI机器人是为了收集模型训练所需的内容，而非将读者引导回搜索结果页面，而仅靠一个“AI机器人”开关根本无法区分这两类情况。

出版商认为这是一种不公平的交易。帮助出版商向人工智能公司授权内容的 TollBit 公司，在其 [《机器人现状报告》](https://tollbit.com/state-of-the-bots/) 中追踪了这一情况。 2026年第一季度和第二季度的报告涵盖了来自3,906家出版商的40家供应商的AI机器人数据，显示“抓取与引流”的比例从第一季度的150:1攀升至第二季度的227:1 （TollBit，2026年，据[Digiday](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/)于2026年8月报道）。这意味着每有一名真实用户点击访问，就有数百个机器人访问。

那么，为什么不干脆把所有流量都屏蔽掉呢？因为根据同一篇9月的博文，不到1%的Cloudflare网站会屏蔽搜索机器人，而17%的网站则启用了某种屏蔽训练数据的方式（[Cloudflare博客](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)，2026年）。 网站希望获得谷歌的流量，但又不愿免费提供训练数据。这种“三桶”划分机制让他们既能接受前者，又能拒绝后者。

<!-- [独特见解] -->
对于任何开发代表用户进行浏览的 AI 产品的人来说，“代理”类别才是关键。训练爬虫势必会受到挤压。代理是较新的概念，现在它们拥有自己的开关和默认设置，而不是与训练爬虫共享一个“AI 机器人”开关。

## 什么是“可追责”的混合用途爬虫？

Cloudflare 将“可追责”的混合用途爬虫定义为：其运营商为网站所有者提供以下功能：通过 robots.txt 或类似标准选择退出 AI 训练；提供 AI 摘要的选择退出控制； URL 级别的训练使用可见性，并保证退出不会影响搜索排名（[Cloudflare 博客](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)，2026）。Cloudflare 将 Applebot、Bingbot 和 Googlebot 列为负责任的混合用途爬虫。 它将亚马逊、Anthropic、Meta 和 OpenAI 列为“负责任的分离式”运营商，因为它们为搜索和训练分别运行独立的爬虫。对于选择“禁止 AI 训练”的网站，负责任的混合用途爬虫仍被允许进行搜索。其他所有训练爬虫在这些网站上都会被屏蔽。

这建立了一个明确的激励机制。如果你运行一个爬虫，要保持被欢迎的地位，就必须将用途分离，或者让网站对每种用途拥有真正的控制权。如今，一个包揽一切的爬虫反而最容易被屏蔽。

## “按爬取次数付费”转变为“按使用次数付费”

在 Cloudflare 早期的“按爬取次数付费”模式下，网站可以针对每次页面请求向 AI 爬虫收取费用。2026 年 7 月，Cloudflare 表示，当网站内容影响 AI 回答时，将向发布者支付费用，而不仅仅是在页面被抓取时。 AI搜索公司Ceramic.ai和You.com被列为早期合作伙伴（[The Next Web](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers)，2026年）。这标志着计费标准的实质性转变。 一次爬取算作单次请求，而“使用”则是指内容最终出现在用户阅读的答案中的那一刻。对内容发布商而言，这使得支付与价值更紧密地挂钩。对人工智能公司而言，这意味着内容成本可能开始根据使用情况而非数据量来计算，从而改变了是否需要抓取页面的决策逻辑。

我们在《封闭的网络：AI爬虫封锁、按爬取付费及其对代理程序的意义》[(https://www.joinmassive.com/blog/the-closing-web-ai-crawler-blocking-pay-per-crawl-and-what-it-means-for-agents)]中曾探讨过该模式的早期版本，以及开放网络为何开始对机器人关闭。

## 运营 AI 代理的团队现在应该怎么做？

首先，要接受访问权限现在因页面而异这一事实。在新的广告变现预设下，一个代理可能能够访问某网站的定价页面，却在旁边的广告支持的文章页面上被拦截。

实用检查清单：

1. **明确自身所属类别。**因用户提问而抓取页面属于“代理”流量；为微调模型而收集页面则属于“训练”流量。请在日志中分别标注这两类流量，因为当前网络对它们的处理方式已有所不同。
2. **做好页面级响应的准备。** “在含广告的页面上被屏蔽”意味着同一域名可能同时出现“允许”和“禁止”的情况。应针对每个 URL 构建重试和备用方案，而非针对整个域名。
3. **将屏蔽视为信号。**在这些预设条件下发生的屏蔽，代表发布商的明确偏好。请记录该情况，并在存在许可或结构化来源时，通过这些来源进行绕行。
4. **关注按使用量付费模式。** 如果您依赖的来源加入了付费计划，付费可能比通过工程手段绕过限制更划算。
5. **分离您的工作负载，并明确标识它们。** 如果您同时运行训练流量和代理流量，请将它们分配到不同的身份标识下，以免其中一方导致另一方被封锁。 Cloudflare 还运行着一个“签名代理”计划：由终端用户控制的代理可以使用 Web Bot Auth（一种加密消息签名标准）对其 HTTP 请求进行签名，以便 Cloudflare 验证其身份（[Cloudflare 文档，签名代理](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)）。 如果您运营任何规模的代理，这篇文档值得一读。

<!-- [独特见解] -->
有种陷阱值得特别指出。对于代理管道而言，造成最大影响的故障往往并非显而易见的硬性阻断。Cloudflare 自身的挑战页面就是最典型的例子： 每个挑战页面都携带一个 `cf-mitigated: challenge` 标头，且其内容类型始终为 `text/html`，无论你请求的是什么资源（[Cloudflare 文档，检测挑战页面响应](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/)）。 在解析任何内容之前，请先检测该标头。更棘手的情况是“无声的页面片段”：请求返回 200 状态码，但响应主体却是一个占位页面（插页）、JavaScript 壳程序，或是文章的阉割版。 请检查返回的内容，而不仅仅是状态码。通过检查内容长度是否达到最低要求，或验证页面中是否包含预期中的 DOM 元素，可以捕获其中大部分情况。

## Massive 如何适应 Cloudflare 的新默认设置

Massive 提供了一套设备访问网络和渲染堆栈，可在 195 多个国家/地区从公共页面交付干净的 HTML 或 Markdown 内容。客户可在其基础上运行自己的业务。发布商的 AI 偏好是公开信号，我们合作的团队将其视为制定自身策略的输入，而非需要绕过的障碍。

[Web Render API](https://docs.joinmassive.com/web-render/overview) 将渲染后的页面以 Markdown 格式返回给 LLM 管道，并允许客户按国家、地区或城市对请求进行地理定位。 在住宅代理方面，每个账户还维护着自己的 [域名黑名单](https://docs.joinmassive.com/residential/domain-blocking)，因此团队可以阻止对任何已决定不访问的网站的请求。 该列表最多可包含 1,000 个域名，对被封锁域名的请求在到达网站之前就会因 452（禁止内容）错误而被拒绝。 如果您的代理堆栈触发了新的默认设置，请参阅[AI 代理为何在数据中心 IP 上被封锁以及如何解决](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it)，或返回完整指南了解[如何为 AI 代理提供实时网络访问](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access)。 关于训练数据的法律问题，请阅读[每个网络数据团队都应了解的 AI 训练数据诉讼](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers)。

## 常见问题

### Cloudflare 是否在 2026 年 9 月 15 日屏蔽了所有 AI 爬虫？

没有。新默认设置仅适用于新接入 Cloudflare 的域名，现有设置已自动迁移。根据 Cloudflare 2026 年 9 月 15 日的公告，搜索流量在所有情况下默认仍被允许。默认情况下，仅对通过广告变现的新域名限制训练流量和代理流量。

### Googlebot 会被新的 Cloudflare 设置拦截吗？

在使用“禁止 AI 训练”设置的网站上不会。Cloudflare 将 Googlebot、Bingbot 和 Applebot 归类为可信的混合用途爬虫，这些爬虫仍被允许进行搜索。 不过，选择完全“阻止”设置的网站现在也会阻止混合用途爬虫，这可能会影响搜索可见性。

### “按爬取次数付费”和“按使用次数付费”有什么区别？

“按爬取计费”模式按每次请求向 AI 爬虫收费；而 2026 年 7 月公布的“按使用计费”模式，则是在发布者的内容被用于生成 AI 答案时向其支付报酬。据 The Next Web 的报道，Ceramic.ai 和 You.com 被列为早期合作伙伴。

### 当前 AI 训练占爬虫流量的比重是多少？

截至 2026 年 6 月，Cloudflare 报告称其网络上 52% 的爬虫请求用于 AI 训练，较 2025 年春季的 22% 有所上升。混合用途爬虫占总流量的 36% 以上。

## 总结

- Cloudflare 现将搜索、训练和代理流量视为三类独立决策，每类均设有独立开关及针对新域名的默认设置。
- 通过广告变现的新域名，初始设置为禁止训练，并在广告页面上屏蔽代理。
- “按使用付费”模式是根据答案而非抓取次数向发布商付费。
- 代理构建者应规划按页面访问的方案，检查每个响应是否包含 `cf-mitigated: challenge` 标头，并将每次阻断记录为发布商声明的偏好。
- 接下来需关注：哪些 AI 公司将加入“按使用量付费”计划，以及有多少代理注册为 [签约代理](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)。

想了解渲染后的、基于地理定位的请求在实际中是什么样子的吗？请从 [Web Render API 概述](https://docs.joinmassive.com/web-render/overview) 开始阅读。

## 来源

- Cloudflare，["两全其美：在搜索中保持可发现性，同时禁止 AI 训练"](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)，检索于 2026-09-25
- Cloudflare，["内容独立日，一周年回顾"](https://blog.cloudflare.com/agentic-internet-bot-report/)，检索于 2026-09-25
- The Next Web，[“Cloudflare 给 AI 爬虫设定了 9 月的最后期限”](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers)，检索于 2026-09-25
- Cloudflare 文档，[已签名代理](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)
- Cloudflare 文档，["检测挑战页面的响应"](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/)，检索于 2026-09-28
- TollBit，[《机器人现状报告（2026年第一季度和第二季度）》](https://tollbit.com/state-of-the-bots/)
- Digiday，[“报告显示：欧洲出版商正遭受AI爬虫更严重的冲击”](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/)（TollBit《机器人现状》数据）
