图书馆书架上整齐排列的硬皮法律书籍,被锁着的锻铁门严密封存,象征着人工智能训练数据诉讼案中受限制且需授权的内容。
所有文章

关于AI训练数据的诉讼:这对网络爬虫意味着什么

Ryan Turner
Ryan Turner · Head of Innovation
打开 Markdown

2025年9月,一名联邦法官对一笔15亿美元的和解协议给予了初步批准,这是人工智能史上金额最大的版权赔偿金。 此案的起因是:Anthropic公司利用约50万本盗版书籍对其模型进行了训练(版权联盟,《参与Bartz诉Anthropic和解案》,检索于2026年9月17日)。 仅这一数字就足以引起任何以收集数据为生的人的关注。

在过去的十八个月里,两大洲的法院已开始就人工智能公司和数据抓取工具如何获取训练数据划定明确的界限,而这些界限并不总是与业界此前预期的相符。本文将梳理主要裁决、其具体裁定内容,以及数据团队和数据抓取基础设施提供商应在运营方式上做出哪些调整。 关于相关机制的背景信息,请参阅网页抓取的工作原理.

要点总结
  • Anthropic公司15亿美元的和解协议表明,造成这一法律责任的是盗版行为,而非员工培训(版权联盟,2026年)。
  • Ross Intelligence 未能以“合理使用”为由进行抗辩,因为其人工智能工具与 Westlaw 自身的市场形成了直接竞争;而 Anthropic 和 Meta 则从未面临过这一问题。
  • 仅有14%的顶级域名设置了针对AI机器人的robots.txt信号(Cloudflare Radar,2025年)。
  • 逃避责任会让你被列入黑名单。无需提起诉讼。

法院在人工智能训练数据方面究竟作出了哪些裁决?

法院裁定,获取训练数据的方式可能产生与数据使用方式完全不同的法律责任。 在“巴茨诉Anthropic”案的和解协议中,约50万本盗版书籍的赔偿金额大致为每部作品3,000美元,这一数额直接取决于获取方式,而非这些书籍随后在训练中如何被使用(版权联盟, 《参与“巴茨诉Anthropic”和解案》,检索于2026年9月17日)。

威廉·阿尔苏普法官在“巴茨诉Anthropic案”中的裁决,划出了一条该行业未曾完全预料到的明确界限。 利用Anthropic购买并扫描的书籍进行训练属于合理使用,用他的话说,这具有“惊人的 transformative 性质”(诺顿·罗斯·富布赖特律师事务所,《科技法律内幕》,“Bartz诉Anthropic案:里程碑式简易判决后达成和解”,检索于2026年9月17日)。 而下载盗版副本以建立永久性研究图书馆则属于另一项行为,无论这些数据随后如何使用,均不构成合理使用。

这种区分比和解金额本身更为重要。数据获取与使用如今已成为两个不同的法律问题,一家公司可能在其中一个问题上胜诉,却在另一个问题上惨败。 Anthropic于2025年8月达成了和解协议,阿尔萨普法官于次月给予了初步批准(CNBC,《法官初步批准与作者达成的15亿美元和解协议》,2025年9月25日,检索于2026年9月17日)。

资金雄厚的人工智能实验室,真的比使用相同盗版来源的小型数据抓取工具面临的法律风险更小吗?未必。该和解案表明,一旦获取方式的侵权主张被认定为独立于“合理使用”问题,规模大小并不能使任何人免于此类指控。参见什么算作人工智能训练数据 针对这些裁决所评判的底层机制。

The 2025 Pivot From Litigation to Licensing Horizontal timeline showing four 2025 AI copyright settlement events: Anthropic agrees to a 1.5 billion dollar settlement in Bartz v. Anthropic (August 2025); the court grants preliminary approval (September 2025); Universal Music Group settles with Udio and launches a licensed AI music platform (October 2025); Warner Music Group settles with both Udio and Suno (November 2025). The 2025 Pivot From Litigation to Licensing Major AI copyright settlements, Aug-Nov 2025 $1.5B settlement Bartz v. Anthropic Aug 2025 Court approval Preliminary approval granted Sep 2025 UMG x Udio deal Licensed AI music platform Oct 2025 WMG settles both Udio, then Suno Nov 2025 Source: Copyright Alliance; CNBC; Music Business Worldwide (2025)
2025年,人工智能版权诉讼将转向“和解加授权”模式(来源:版权联盟、CNBC、《全球音乐商业》杂志,2025年)

当Anthropic在“合理使用”案中胜诉时,汤森路透为何能击败罗斯情报公司?

汤森路透胜诉的原因在于,罗斯情报公司利用了未经授权用于训练的许可内容,开发了一款与其直接竞争的产品。 2025年2月,斯特法诺斯·比巴斯法官(特拉华州地方法院)就汤森路透案作出了部分即决判决,这是首家人工智能公司在以训练数据“合理使用”为辩护理由的案件中遭遇即决判决败诉(古德温·普罗克特律师事务所, 《法院驳回人工智能版权案中的合理使用抗辩》,检索于2026年9月17日)。

罗斯利用了Westlaw的判例摘要——即汤森路透耗费数十年时间构建的编辑内容——来训练一款法律研究工具,该工具与Westlaw本身形成了直接竞争。 比巴斯法官认定该行为不具有“转化性”,并对原作的市场造成了商业损害(Jenner & Block,客户通告,检索于2026年9月17日)。

与此形成对比的是“卡德雷诉Meta案”。2025年6月, 文斯·查布里亚法官(加州北区联邦地区法院)就合理使用问题对Meta作出了部分即决判决,尽管部分训练数据源自“影子图书馆”,但原告未能证明Meta的使用行为稀释了其作品的市场(Goodwin Procter,检索于2026年9月17日)。 他特别指出,未来若有原告能证明存在市场稀释,则可能在这些原告败诉的案件中胜诉(版权联盟,《Kadrey诉Meta案判决》,检索于2026年9月17日)。

那么,究竟是什么让“合理使用”的抗辩成立,而另一些却以失败告终呢?事实证明,关键在于市场竞争,而非复制行为本身的运作机制。

综合来看,这些裁决表明,获取方式和竞争性使用构成了两条独立的侵权责任认定路径。Anthropic公司在“获取”(盗版)方面败诉,尽管其在“ transformative use”( transformative use)方面胜诉。Ross公司在“竞争性使用”方面败诉,尽管其内容源自获得许可的来源。仅凭其中任何一个因素都无法保证获得保护。

Case What was trained on How the data was acquired Competes with the source? Fair use outcome
Bartz v. Anthropic Books, purchased and scanned Legally purchased copies (lawful) plus pirated copies from shadow libraries (unlawful) No Training on purchased books: fair use. Downloading pirated copies: not fair use, leading to the $1.5B settlement
Kadrey v. Meta Books, including from shadow libraries Partly pirated Plaintiffs did not prove market harm Fair use on this record; judge left the door open for plaintiffs who can show market dilution
Thomson Reuters v. Ross Intelligence Westlaw headnotes Licensed content, used without authorization for training Yes, a competing legal-research product Not fair use, the first summary judgment loss on AI training
Getty Images v. Stability AI (UK) Licensed stock images Used without a license; training occurred outside the UK Yes, a competing image-licensing business Copyright claim rejected on jurisdictional grounds; trademark infringement found instead

仍在法院审理中的案件

几起规模最大的AI版权案件尚未作出裁决,其结果可能会进一步重塑“合理使用”原则。由《纽约时报》和美国作家协会联合提起的针对OpenAI的诉讼现已合并为“OpenAI版权诉讼案”,由西德尼·斯坦法官审理。 截至2026年9月,该案正处于积极的证据开示阶段,尚未确定庭审日期(《华盛顿邮报》,“司法部敦促法官在《纽约时报》诉讼案中裁定OpenAI和微软胜诉”,2026年9月2日,检索于2026年9月17日)。

2025年4月,斯坦法官基本驳回了OpenAI和微软提出的驳回诉讼动议,允许大部分诉因继续审理,并明确拒绝将AI训练称为“本质上具有 transformative 性”。2025年10月27日的一份裁决书进一步指出: 斯坦法官认为,ChatGPT生成的原告小说情节摘要本身可能构成侵权,这是一种有别于训练问题的“输出”理论(IPWatchdog,《OpenAI就ChatGPT输出引发的多区集体诉讼驳回动议未获支持》, 2025年10月28日,检索于2026年9月17日)。

该案也引起了外界的关注。2026年9月2日,美国司法部提交了一份法律意见书,敦促法院裁定OpenAI和微软胜诉(《华盛顿邮报》,检索于2026年9月17日; Axios,《〈纽约时报〉、OpenAI、微软版权诉讼案》,2026年9月8日,检索于2026年9月17日)。

盖蒂图片社诉Stability AI案的争议焦点在于地域界限。 2025年11月4日,英国高等法院裁定,由于Stability的模型训练在英国境外进行,因此盖蒂的版权主张不成立;但认定存在商标侵权,因为Stable Diffusion早期的生成结果带有盖蒂的水印(Ropes & Gray,检索于2026年9月17日)。 盖蒂在加利福尼亚州北区联邦地区法院重新提起的另一项美国诉讼,于2026年4月就商标权及商标淡化指控成功驳回了驳回起诉动议,审判定于2028年1月至2月进行(CourtListener案卷,检索于2026年9月17日)。

同一理论——即带有品牌水印或可识别衍生内容的人工智能生成内容构成侵权——目前已在英国和美国法院同时得到适用。虽然基于管辖权和 transformative use( transformative use)原则,版权索赔范围正在收窄,但商标和基于生成内容的索赔正在填补这些更狭窄裁决所留下的空白。

这种趋势不仅限于文本领域。2025年6月至9月期间,迪士尼、环球影业和华纳兄弟因图像生成问题起诉了Midjourney,截至2026年年中,这些合并审理的案件仍处于证据开示争议阶段(《Variety》,检索于2026年9月17日; IPWatchdog,《华纳兄弟诉状称Midjourney的版权侵权行为“系统性”且“蓄意”》,检索于2026年9月17日)。 在音乐领域,环球音乐集团于2025年10月与Udio达成和解,在支付赔偿金的同时,就一个新的AI音乐平台达成了许可协议;华纳音乐则于2025年11月分别与Udio和Suno达成和解(《Music Business Worldwide》,检索于2026年9月17日)。 索尼目前仍与这两家平台处于诉讼之中。压力也不仅限于法庭:参见为什么获取网络数据越来越难了 针对同一压力下的基础设施方面。

这些内容是否也适用于公共数据的抓取,而不仅仅是AI训练?

抓取公开可访问的网页本身并不构成联邦犯罪,但这并不意味着它毫无风险。 hiQ Labs诉LinkedIn案在第九巡回上诉法院对此问题作出了裁决:抓取公开网页并不违反《计算机欺诈与滥用法案》(CFAA)中“未经授权”的规定,尽管合同违约、版权侵权和侵占等索赔仍完全成立(White & Case, 《网络抓取、网站条款与《计算机欺诈与滥用法案》》,检索于2026年9月17日)。

该裁决是在最高法院的“范布伦案”判决缩小了《计算机欺诈与滥用法案》(CFAA)适用范围后,经发回重审作出的。 同一诉讼程序还认定,hiQ 仍违反了 LinkedIn 的《服务条款》——这是一项独立的合同索赔,未受《计算机欺诈与滥用法案》裁决的影响(Fenwick & West,《hiQ Labs 再次险胜》,检索于 2026-09-17)。 实际上,真正的风险问题已从“这是否属于黑客行为”转变为“我是否获得了许可或授权”。

如果抓取公开页面不算黑客行为,为什么公司仍会因此被封禁并被起诉?因为《计算机欺诈与滥用法案》(CFAA)的豁免条款从未涵盖合同、版权或侵权索赔,而如今大多数纠纷恰恰集中在这些方面。

2025年8月发生的另一起事件表明,非正式执法行动可以多么迅速。Cloudflare报告称,Perplexity使用未申报的、轮换的用户代理和ASN,继续爬取那些已通过robots.txt文件明确禁止所有爬虫访问的测试域名 (来源:《搜索引擎期刊》,《Cloudflare 将 Perplexity 从已验证机器人名单中移除并阻止其抓取网站》,检索于 2026 年 9 月 17 日)。Cloudflare 撤销了 Perplexity 的“已验证机器人”状态,并在全网范围内封锁了其爬虫,且无需提交任何法庭文件。

Perplexity 公开对 Cloudflare 对事件的描述提出了异议(来源:《搜索引擎杂志》,检索于 2026-09-17)。无论该争议最终如何解决,其中蕴含的教训依然成立:一旦被发现规避已声明的封锁,爬虫对互联网大部分内容的访问权限可能会在一夜之间被终止。 如需更深入地了解法律界限所在,请参阅符合道德规范的网络爬虫实践.

基础设施提供商是如何应对的

基础设施提供商不再等待法院裁决,而是开始自行更改默认设置。自2025年7月1日起,Cloudflare将阻止未经授权的AI爬虫设为每个新域名的默认设置,将此前“主动选择阻止”的模式转变为“默认允许访问”模式(Cloudflare,新闻稿, “Cloudflare 刚刚从根本上改变了 AI 爬虫抓取互联网的方式”,检索于 2026-09-17)。

Cloudflare 配合这一转变推出了“按爬取次数付费”(Pay Per Crawl)机制,该机制允许网站所有者向爬虫收取访问费用。该公司表示,该机制将于 2026 年 9 月 15 日起演变为“按使用次数付费”(Pay Per Use),并默认在广告支持的页面上屏蔽多用途爬虫 (Cloudflare 博客,检索于 2026-09-17)。 在2025年6月19日至26日的流量观察窗口中,Cloudflare Radar发现,Anthropic旗下的Claude每向其爬取的网站发送一次推荐,就会发起约71,000次HTML页面请求(Cloudflare博客/Radar, “Radar 上的 AI 爬取与引荐比例”,检索于 2026-09-17)。

Most Sites Still Have No AI-Bot Signal Set Donut chart showing that of the top 10,000 web domains with a robots.txt file, only 14 percent have any AI-bot-specific directive; 86 percent have no AI-bot signal. Source: Cloudflare Radar, June 2025. Most Sites Still Have No AI-Bot Signal Set Share of top 10,000 domains with an AI-bot robots.txt directive 14% have an AI-bot robots.txt signal 14%: set an AI-bot-specific robots.txt directive 86%: no AI-bot signal set Source: Cloudflare Radar (June 2025)
在前10,000个域名中,仅有14%设置了针对AI机器人的robots.txt指令(来源:Cloudflare Radar,2025年6月)

大多数网站所有者至今仍未设置任何信号。 在同一数据集中,GPTBot是被封锁次数最多的爬虫,在拥有robots.txt文件的3,816个域名中,有312个域名禁止其访问,而明确允许其访问的仅有61个(来源:Cloudflare博客/Radar,检索于2026年9月17日)。

监管机构开始将机器可读信号视为唯一有效的信号。 2025年12月10日,汉堡汉萨高等地区法院在“Kneschke诉LAION案”(OLG Hamburg, 5 U 104/24)中裁定,文本和数据挖掘的“选择退出”条款只有在以机器可读形式存在时才具有法律效力。 Robots.txt、X-Robots-Tag 标头或 TDM 保留协议均符合这一要求。 而深埋在网站自然语言条款中的条款则不被视为有效(诺顿罗氏富布赖特律师事务所,《科技法律内幕》,“可机读的退出机制与人工智能训练:汉堡法院澄清版权例外”,检索于2026年9月17日)。

这一做法与欧盟的《GPAI行为准则》相一致,该准则于2025年7月发布,截至2026年7月已有23家人工智能开发商签署,其中包括OpenAI、谷歌、 Anthropic和微软,这些公司均承诺使用能够识别robots.txt文件的爬虫进行抓取,并遵守机器可读的限制条款。

在这方面,基础设施提供商和监管机构实际上已经领先于法院。 Cloudflare 于 2025 年 7 月调整了其默认爬虫政策,而汉堡法院提出的“机器可读信号”标准出台之时,远早于美国判例法就数据抓取和许可的类似问题作出定论。那些等待诉讼结果出炉后再调整政策的团队可能会发现,默认规则早已悄然改变。

数据抓取工具和数据团队现在应该做什么

那些将数据溯源视为次要考虑的数据团队,最容易面临这些裁决所带来的风险。 仅巴茨案的和解协议,就涉及约50万本盗版书籍,每本盗版作品的赔偿金额约为3,000美元(版权联盟,检索于2026年9月17日),任何法律团队都可以将这一数字乘以自身未经授权的档案数量来估算潜在损失。

1. 端到端追踪数据溯源。 准确掌握每项训练数据或数据集的来源,以及这些数据是获得授权、购买还是通过爬取获取的。Anthropic案表明,监管机构和法院在认定责任时,会将数据获取方式与下游使用区分开来。

2. 尊重机器可读的退订信号。 robots.txt、ai.txt 以及 TDM 预留协议是监管机构目前认可的标准,即使某些司法管辖区尚未强制要求遵守这些标准。

3. 应优先选择获得授权,而非采取与盗版相近的捷径。 购买或获得许可的数据关系在法庭上具有法律效力,而盗版档案则不然,因为Anthropic在购买书籍的合理使用诉讼中胜诉,并不能抵消其在同一训练过程中与这些书籍并列存在的盗版副本所应承担的责任。

4. 避免身份规避策略。 轮换用户代理以规避已声明的封锁,会导致被列入黑名单。无需向法院提交申请。相关背景如下:AI爬取究竟包含哪些内容 这是审核您自身管道的一个有用起点。

来源是构建可辩护的数据获取策略的一部分,而非全部。 Massive 的住宅代理网络运行于 195 多个国家的真实用户设备上,每台设备均通过 Massive SDK 主动加入,可从任何地点的任何公开来源提供纯净的 HTML 或 Markdown 内容。该网络已通过 SOC 2 审计并符合 GDPR 要求,这是构建可辩护数据获取策略的要素之一,但并非法律保护伞,也不能替代法律建议。

结论

今年,关于人工智能训练数据的法律框架分成了两条独立的轨道:如何获取数据以及如何使用数据,而法院现在愿意针对这两方面中的任何一项违规行为分别予以处罚。

  • “获取方式”现已成为一个独立的负债类别,与“合理使用”区分开来。
  • 竞争性使用比盗版更迅速地扳倒“合理使用”抗辩:Ross Intelligence 之所以彻底败诉,正是因为其工具与 Westlaw 直接构成竞争,而 Anthropic 和 Meta 则从未面临过这样的考验。
  • 基础设施的发展速度快于司法系统。Cloudflare 于 2025 年 7 月更改了其爬虫的默认设置;几个月后,欧盟监管机构也采取了相应措施。

预计到2027年,像环球音乐集团(UMG)和华纳音乐(Warner Music)那样的“和解加授权”交易将会越来越多,因为“先起诉再授权”的模式正持续在文字、图像和音乐领域蔓延。关于如何从实际角度确保内容来源具有法律抗辩力,请参阅基于实时网络数据构建数据管道.

来源

  1. 版权联盟,《参与“巴茨诉Anthropic和解案”》,检索于2026年9月17日
  2. CNBC,《法官初步批准与作者达成的15亿美元和解协议》,检索于2026年9月17日
  3. 诺顿罗氏富布赖特律师事务所 / 《Inside Tech Law》,《Bartz 诉 Anthropic 案:在具有里程碑意义的简易判决和集体诉讼认证后达成和解》,检索于 2026-09-17
  4. Goodwin Procter,《法院驳回人工智能版权案中的合理使用抗辩》,检索于2026年9月17日
  5. Jenner & Block 律所关于“汤森路透诉罗斯情报公司案”的客户通告,检索日期:2026年9月17日
  6. 古德温·普罗克特律师事务所,《加利福尼亚州北区法官作出裁决》(Kadrey 诉 Meta 案),检索于 2026-09-17
  7. 版权联盟,《Kadrey诉Meta案判决书》,检索于2026年9月17日
  8. 《华盛顿邮报》,“司法部敦促法官在《纽约时报》诉讼案中裁定OpenAI和微软胜诉”,检索于2026年9月17日
  9. Axios,《《纽约时报》、OpenAI、微软版权诉讼案》,检索于2026年9月17日
  10. IPWatchdog,《OpenAI 未能成功驳回针对 ChatGPT 输出结果的多区集体诉讼》,检索于 2026-09-17
  11. Ropes & Gray,《盖蒂图片社在英国首例……中针对Stability AI的版权侵权诉讼败诉》,检索于2026年9月17日
  12. Cleary Gottlieb,《英国高等法院就“盖蒂图片社诉Stability AI案”作出具有里程碑意义的裁决》,检索于2026年9月17日
  13. CourtListener,盖蒂图片社(美国)公司诉Stability AI有限公司一案的案件卷宗,检索于2026年9月17日
  14. 《Music Business Worldwide》,“环球音乐就Udio诉讼达成和解,并与授权的人工智能音乐平台签署协议”,检索于2026年9月17日
  15. 《好莱坞报道》,“环球音乐集团宣布与Udio达成和解”,检索于2026年9月17日
  16. 《Variety》关于 Midjourney Studios 证据开示纠纷的报道,检索于 2026 年 9 月 17 日
  17. IPWatchdog,《华纳兄弟在诉状中指控Midjourney的版权侵权行为“系统性”且“蓄意”》,检索于2026年9月17日
  18. 怀特·凯斯律师事务所,《网络爬虫、网站条款与《计算机欺诈与滥用法案》(CFAA):hiQ公司获得的初步禁令再次得到维持》,检索于2026年9月17日
  19. Fenwick & West,《hiQ Labs 再次险胜:第九巡回上诉法院重申数据抓取不违反《计算机欺诈与滥用法》》,检索于 2026-09-17
  20. Cloudflare 博客/Radar,《Radar 上的 AI 爬取与引荐比例》,检索于 2026-09-17
  21. Cloudflare,新闻稿,《Cloudflare 刚刚彻底改变了 AI 爬虫抓取互联网的方式》,检索于 2026-09-17
  22. 《搜索引擎杂志》,“Cloudflare 将 Perplexity 从索引中移除并阻止其抓取网站”,检索于 2026-09-17
  23. 诺顿罗氏富布赖特律师事务所,《科技法律内幕》,“可机读的退出选项与人工智能训练:汉堡法院澄清版权例外条款”,检索于2026年9月17日

常见问题解答

抓取公开网站的内容是否违法?+

并非本质上如此。第九巡回上诉法院在“hiQ Labs诉LinkedIn案”中裁定,抓取公开可访问的网页并不违反《计算机欺诈与滥用法》(White & Case,检索于2026年9月17日)。 但违约、版权侵权及动产侵占等索赔仍完全成立,因此数据抓取者即使未违反该项法律,仍可能面临实际法律责任。参见如何为 AI 代理提供实时网页访问权限 关于 robot.txt 和爬虫访问方面的问题。

利用受版权保护的材料训练人工智能模型是否属于合理使用?+

这取决于收购和竞争,而不仅仅是转型。 在Anthropic案中,阿尔苏普法官裁定基于购入书籍进行的训练属于合理使用;而比巴斯法官则裁定Ross Intelligence公司针对竞争产品对Westlaw判例摘要进行的训练不属于合理使用,这是首例此类败诉案例(Goodwin Procter,检索于2026年9月17日)。

Anthropic案与汤森路透案的人工智能版权裁决有何区别?+

Anthropic在“变革性训练”方面胜诉,但在盗版问题上败诉,最终就约50万本盗版图书达成了一项15亿美元的和解协议(版权联盟,检索于2026年9月17日)。 Ross Intelligence 之所以彻底败诉,是因为其利用获得许可的 Westlaw 内容开发了直接竞争的产品,这一结果更多是市场竞争因素所致,而非培训方法本身的问题。

数据团队在收集训练数据时,如何降低法律风险?+

对每条输入数据追踪来源,遵守 robots.txt 和 TDM 预留协议等机器可读的退出信号,并优先使用获得许可或购买的数据,而非采取与盗版相关的捷径。 Cloudflare 发现,截至 2025 年 6 月,仅约 14% 的顶级域名设置了任何针对 AI 机器人的 robots.txt 信号(来源:Cloudflare Radar,检索于 2026-09-17),这意味着默认情况下,大多数风险仍未得到解决。