是的。Imperva的《2026年恶意机器人报告》显示,2025年自动化流量占所有网络流量的53%以上,而人类流量则降至47%,该报告将此描述为一种结构性变化,而非暂时的激增。
2026年第三季度网络数据行业现状
2025年,在开放网络上,自动化流量超过了人类流量,此后便一路领先。如今,机器人流量占所有网络流量的53%以上,而人类活动占比已降至47%,且仍在持续下降(Imperva/Thales,《2026年恶意机器人报告》). 与此同时,内容发布商首次开始构建真正的基础设施,以对这些流量进行收费,而非仅仅试图将其屏蔽。这就是网络数据行业在迈入2026年第四季度时的现状:规模更大、自动化程度更高、更依赖人工智能,且竞争比一年前更加激烈。
要点总结
- 2025年,自动化流量占所有网络流量的53%,其中仅恶意机器人就占40%,较前一年的37%有所上升(Imperva/Thales 2026年恶意机器人报告).
- 人工智能现已成为数据抓取需求的主要新来源。前沿实验室不再披露训练数据的构成(斯坦福大学HAI,2026年人工智能指数报告),但据业界估计,抓取的网络数据是大多数生成式模型的主要输入来源,而且企业团队越来越多地表示,他们需要实时数据管道,而不是批量提取,以确保AI系统保持最新状态。
- 内容发布商正从封锁转向收费。 Cloudflare的默认政策将于2026年9月15日生效,该政策将屏蔽在广告支持页面上运行的“混合用途”AI爬虫,并正在将其“按爬取量付费”的市场模式转型为“按使用量付费”模式——当出版商的内容实际出现在AI答案中时,出版商即可获得报酬(Cloudflare 博客,2026年7月;TechCrunch,2026年7月1日).
- 在代理市场内部,住宅代理正不断蚕食数据中心IP的市场份额。各供应商对具体市场份额比例的估计差异很大,但所有估计都一致认为趋势是:住宅代理正在崛起,因为其通过现代反机器人系统的成功率要高得多。
2025年,互联网越过了某条界限:机器人比人类还多
在互联网发展的大部分时间里,网站建设、盈利和安全防护的背后都隐含着这样一个假设:典型访客是一个人。但这一假设已不再成立。 Imperva的《2026年恶意机器人报告》显示,2025年自动化流量占所有网络流量的53%以上,较前一年的51%有所上升,而人类活动占比已降至47%,且仍在持续下降(Imperva/Thales,2026年).
在该自动化流量中,良性机器人(搜索爬虫、监控工具、合法的数据采集)约占13%。恶意机器人,那些冒充真实浏览器或未经许可进行数据抓取的自动化流量,占总流量的40%,较2024年的37%有所上升。
Imperva明确将此定义为一种结构性转变,而非与某次攻击活动或某起病毒式传播事件相关的短期激增。这对2026年在开放网络上开展建设工作的任何人来说都至关重要。 您的基础设施、反机器人防御措施以及数据收集策略所依据的流量构成,已不再与实际出现的流量构成相符。
人工智能已成为推动数据抓取需求增长的最大新动力
生成式人工智能对网络数据的“胃口”,是重塑这一流量结构的最大推动力。斯坦福大学《2026年人工智能指数报告》指出,对于包括OpenAI、Anthropic和谷歌在内的若干资源消耗最巨大的前沿系统,其训练数据的构成已不再对外披露(斯坦福大学HAI,2026年AI指数报告). 这种不透明性本身就说明了一切。那些曾经可以援引已发布数据集的实验室,如今却拒绝透露其中包含哪些内容。
由于缺乏相关披露,行业研究人员只能通过估算来填补这一空白。Actowiz Solutions发布的2026年网络爬虫行业报告指出,主要基于爬取的网络数据进行训练的生成式模型占比约为70%(Actowiz Solutions,《2026年网络爬虫行业报告》). 请将该具体数字视为供应商的估算值,而非经审计的数字。
其发展方向仍与每位人工智能基础设施采购方当前所见的情况相符。每一个新增的人工智能代理、每一个RAG系统以及每一条训练管道,都在推动同一项基础需求:需要干净、最新且可检索的网络内容,其规模和时效性要求是定期人工采集无法满足的。
市场规模数据也印证了这一趋势,尽管不同研究机构和方法论得出的估计值存在差异。多份关于2026年的报告指出,人工智能驱动的网络爬虫细分市场的年价值在数十亿至数百亿之间,预计本十年内将保持两位数的增长。 这里不应将任何单一数字视为定论。但所有预测都一致认可的发展方向毋庸置疑:该细分市场正在快速增长,而人工智能正是其驱动力。
Gartner自身关于企业采用情况的预测从另一个角度印证了这一趋势:预计到2026年底,40%的企业应用将嵌入专用AI代理,而2025年这一比例还不到5%(Gartner,《Gartner预测:到2026年,40%的企业应用将配备针对特定任务的人工智能代理》,新闻稿,2025年8月26日). 这些代理中的每一个都是实时网络数据的新用户,且持续使用这些数据,而非仅进行一次训练。
开源生态系统是衡量这一需求增长速度的一个有用的指标。Crawl4AI, 这款专门用于将网页转换为适合大型语言模型(LLM)使用的 Markdown 格式的爬虫,在 GitHub 上已获得超过 83,000 个星标。这表明,“为 AI 管道提供干净的网络数据”已不再是小众需求,而是成为了开发者的主流需求。
出版商们不再仅仅试图阻止它了。现在,他们开始为此收费了。
2026年第三季度的另一则标志性事件是:开放网络上最大的基础设施提供商已不再将AI爬虫流量视为纯粹的恶意流量。相反,它们开始构建相关基础设施,以便对这类流量收费。Cloudflare的政策变更将于2026年9月15日生效,该变更设定了新的默认设置(Cloudflare 博客,《您的网站,您的规则》,2026年7月).
“混合用途”AI爬虫——即同时进行传统搜索索引以及用于AI训练或智能代理开发的数据采集的机器人——在任何包含广告的页面上均被默认屏蔽。纯搜索爬取默认仍被允许。Cloudflare的新用户、现有账户中新添加的网站以及所有现有免费套餐用户均采用此默认设置。
除了默认屏蔽功能外,Cloudflare 还正在将其现有的“按抓取付费”(Pay-Per-Crawl)市场转型为所谓的“按使用付费”(Pay Per Use)模式。发布者只有在内容实际出现在 AI 答案中时才能获得报酬,而不仅仅是在爬虫抓取页面时。 Ceramic.ai 和 You.com 被列为该模式的首发合作伙伴(TechCrunch,2026年7月1日).
与过去两年定义人工智能爬虫政策的“阻止或允许”这种二元机制相比,这是一种截然不同的机制。它预示着更深远的趋势:网络上最大的基础设施层现在将人工智能的访问视为一种按量计费、实现商业化的关系,而不是无序的自由访问或完全封锁。
对于任何正在开发智能代理、RAG 管道或 AI 监控产品的人来说,这是进入第四季度后最为重要的趋势。访问网页的规则正在发生变化。
过去的问题是“我的爬虫能否通过反机器人验证”,现在则变成了“我的流量是否属于目标网站已同意允许或收费的类别”。Massive 一直密切关注着这一变化;详见紧缩的网络:AI爬虫封锁、按爬取次数付费,以及这对代理商意味着什么 有关代理构建器具体有哪些变化的更深入的技术分析。
代理市场内部情况:住宅代理在网络数据行业中持续抢占市场份额
虽然表面上看,这场博弈是机器人与人类、内容发布商与爬虫之间的较量,但在支撑所有这些流量的基础设施层内,正悄然发生着另一场转变。在代理市场内部,住宅代理以及像Massive这样的真实用户设备网络,正持续从数据中心IP地址那里抢占市场份额。参见AI 代理所用的住宅代理与数据中心代理的对比 查看完整的技术对比。
这一细分市场的实际份额究竟有多大,目前尚无定论。市场研究公司公布的该细分市场总规模数据差异极大,从不到1.5亿美元到数十亿美元不等,具体取决于调查范围和研究方法。 这些数据均不应被视为经审计的数字。一家广受引用的供应商估计,到2026年,住宅代理服务将占代理市场总收入的约42%,高于2023年的约35%(市场研究汇总,2026年). 将该具体百分比视为一个大致方向,而非精确数值。
更有依据的是这种转变背后的机制:
反机器人系统现在已不再主要通过将已知的数据中心IP地址范围列入黑名单来运作。相反,它们会分析请求行为、设备信号以及流量模式,这些特征通常由真实的终端设备自然产生,而数据中心服务器通常不会产生。
随着上述军备竞赛的加剧,该表格中显示的性能差距很可能进一步拉大,而非缩小。仅靠增加IP数量也无法解决这个问题;设备质量才是决定请求能否真正通过的关键因素。
这对即将进入2026年第四季度的网络数据行业意味着什么
三股力量正在同时交织作用。机器人流量现已成为所有网络流量的主体。在该流量的需求端,人工智能是增长最快的来源。而最大的基础设施提供商正在积极重塑关于谁能获得访问权限以及以何种条件获得的规则。
任何产品的运行都依赖于可靠的网络访问,其所处的环境与一年前相比已大不相同。无论该产品是人工智能代理、数据管道、竞争情报功能,还是AEO监控工具,情况皆是如此。
单独来看,这三股力量似乎各自构成一个独立的故事:一份安全报告、一项政策公告、一条市场研究的脚注。但综合来看,它们共同揭示了一个潜在的变化趋势。
开放网络已不再是基础设施在后台默默消耗的免费资源。它正逐渐变成一种按量计费的资源。要获得访问权限,就必须证明自己的流量是合法的——要么向反机器人系统证明,要么(这种情况越来越普遍)符合发布商的计费条款。
两年前,情况很简单:要么被屏蔽,要么不被屏蔽。如今则更接近三层结构。
请求被归入哪个层级,主要取决于基础设施提供商比爬虫运营商更能控制的信号:设备来源、地理位置以及声明的意图。
实现这一目标的可靠途径始终归结于同一套基本原则:优先采用真实设备来源而非数据中心 IP 地址,并确保请求的地理位置准确性。这也意味着,基础设施必须能够适应发布商政策的不断变化,而非仅针对 2024 年那种简单的“封锁或放行”模式而构建。
资料来源与方法说明
本报告综合了截至2026年9月的第三方行业研究结果:斯坦福大学HAI发布的《2026年人工智能指数报告》,Imperva/Thales《2026年恶意机器人报告》,Cloudflare 自身发布的政策公告,TechCrunch 对该公告的报道,Gartner对2025年8月企业AI代理采用情况的预测,Actowiz Solutions《2026年网络爬虫行业报告》,并汇总了2026年关于人工智能驱动的网络爬虫和住宅代理细分市场.
当不同研究机构对市场规模的估算存在显著差异时——在代理市场案例中,差异甚至超过了一个数量级——文本中会特别标注这种差异,而非将其归纳为一个确信无疑的单一数字。 将这些数据点联系起来的分析——即从“封锁或放行”模式向计量收费模式的转变——是Massive对这一趋势的独立解读,并非引用的任何单一来源所提出的论点。
这是一份对外界研究的综述,并非Massive网络的自有研究。本系列的后续篇章将基于Massive自身的请求量和成功率数据,以及已列入路线图的内部“Signal”报告,并在发布时明确标注为自有研究。
关于作者
瑞安·特纳(Ryan Turner)在Massive博客上负责报道网络数据基础设施、代理网络以及AI代理访问相关话题,追踪反机器人系统、发布商政策以及网络爬虫监管措施的季度变化。有关本报告或Massive网络的疑问,可通过以下方式联系:Massive 的“关于我们”页面.
常见问题解答
不。该措施专门针对“混合用途”爬虫,即同时进行搜索索引、AI训练或智能体开发数据采集的机器人,且默认仅在包含广告的页面上阻止此类爬虫。默认情况下,纯搜索爬取仍被允许,网站所有者若愿意,可选择重新允许AI爬虫访问。
这主要是因为其在应对现代反机器人系统时的成功率:住宅代理的成功率约为92%至98%,而数据中心代理的成功率仅为65%至80%,因为如今的反机器人检测主要依赖行为分析和设备指纹识别,而非简单的IP封禁列表。 具体的市场份额百分比因调研机构而异,但所有已公布的估计数据都指向同一趋势。
