# 人工智能训练数据诉讼：对网络爬虫意味着什么

2025年9月，一名联邦法官初步批准了一项15亿美元的和解协议，这是人工智能史上金额最大的版权赔偿。其背后的索赔理由如下： Anthropic公司利用约50万本盗版书籍对其模型进行了训练（版权联盟，《参与Bartz诉Anthropic和解案》，检索于2026年9月17日）。仅这一数字就足以引起所有以收集数据为生的人的关注。

在过去的十八个月里，两大洲的法院已开始就人工智能公司和数据抓取者如何获取训练数据划定明确的界限，而这些界限并不总是符合行业此前所预期的。本文将梳理主要裁决内容、其实际裁定结果，以及数据团队和数据抓取基础设施提供商应如何调整其运营方式。 关于技术原理的背景信息，请参阅[网页抓取的工作原理](https://www.joinmassive.com/glossary/what-is-web-scraping)。

> **关键要点**
> - Anthropic公司15亿美元的和解协议表明，造成法律责任的是盗版行为，而非数据训练（版权联盟，2026年）。
> - Ross Intelligence公司未能以“合理使用”为由进行抗辩，因为其AI工具直接与Westlaw自身的市场形成竞争；而Anthropic和Meta则从未面临这一问题。
> - 仅有 14% 的顶级域名设置了针对 AI 机器人的 robots.txt 信号（Cloudflare Radar，2025）。
> - 规避行为会导致被列入黑名单。无需提起诉讼。

## 法院在AI训练数据方面究竟作出了哪些裁决？

法院的裁决表明，训练数据的获取方式可能产生与使用方式完全独立的法律责任。 在“Bartz诉Anthropic”案的和解中，约50万本盗版书籍的赔偿金额按每部作品约3,000美元计算，这一数额直接与获取方式相关，而非这些书籍后来在训练中如何被使用（版权联盟，《参与“Bartz诉 Anthropic和解案”，检索于2026年9月17日）。

![法院图书馆里一排排法律书籍，象征着日益丰富的判例法正在塑造AI训练数据规则。](https://cdn.pixabay.com/photo/2014/03/20/21/53/law-books-291683_1280.jpg)

威廉·阿尔苏普法官在“巴茨诉Anthropic案”中的基础裁决划出了一条行业未曾完全预料到的明确界限。 利用Anthropic购买并扫描的书籍进行训练属于合理使用，用他的话说，这具有“惊人的 transformative 性”（诺顿·罗斯·富布赖特律师事务所，《科技法律内幕》，“Bartz诉Anthropic案：里程碑式的简易判决后达成和解”，检索于2026年9月17日）。 而下载盗版副本以建立永久性研究图书馆则属于另一项行为，无论后续如何使用这些数据，均不构成合理使用。

这一区分比和解金额本身更为重要。 获取与使用现已成为两个不同的法律问题，一家公司可能在其中一方胜诉，却在另一方惨败。Anthropic 于 2025 年 8 月达成了和解协议，阿尔苏普法官于次月给予了初步批准（CNBC，《法官初步批准与作者的 15 亿美元和解协议》， 2025年9月25日，检索于2026年9月17日）。

资金雄厚的人工智能实验室，真的比使用相同盗版数据源的小型数据抓取者面临更小的法律风险吗？未必。该和解协议表明，一旦“获取方式”被确立为独立于“合理使用”问题之外，规模大小并不能使任何人免于面临相关指控。参见[什么算作人工智能训练数据](https://www.joinmassive.com/glossary/what-is-llm-training-data)以了解这些裁决所依据的底层机制。

<!-- 图表 2：和解/许可时间线 -->
<figure data-max-width="640">
  <svg viewBox="0 0 560 380" style="max-width: 100%; height: auto; font-family: 'Outfit', system-ui, sans-serif" role="img" aria-label="2025年AI版权和解时间线：Anthropic于2025年8月在Bartz诉Anthropic案中同意支付15亿美元和解金，并于2025年9月获得法院初步批准， 随后，环球音乐集团于2025年10月与Udio达成许可协议，华纳音乐集团则于2025年11月分别与Udio和Suno达成和解协议。”>
    <title>2025年从诉讼转向许可</title>
    <desc>横向时间轴展示了2025年四起AI版权和解事件：Anthropic在“Bartz诉Anthropic案”中同意达成15亿美元和解（2025年8月）；法院给予初步批准（2025年9月）； 环球音乐集团与Udio达成和解并推出获得授权的AI音乐平台（2025年10月）；华纳音乐集团分别与Udio和Suno达成和解（2025年11月）。</desc>

    <text x="280" y="30" text-anchor="middle" font-size="15" font-weight="800" fill="currentColor">2025年：从诉讼转向许可</text>
    <text x="280" y="50" text-anchor="middle" font-size="10.5" fill="currentColor" opacity="0.55">2025年8月至11月主要AI版权和解案</text>

    <line x1="60" y1="190" x2="500" y2="190" stroke="currentColor" stroke-opacity="0.25" stroke-width="2" />

    <circle cx="100" cy="190" r="8" fill="#d74939" />
    <text x="100" y="150" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">15亿美元和解</text>
    <text x="100" y="165" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Bartz 诉 Anthropic</text>
    <text x="100" y="215" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">2025年8月</text>

    <circle cx="220" cy="190" r="8" fill="#ff8163" />
    <text x="220" y="225" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">法院批准</text>
    <text x="220" y="240" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">已获初步批准</text>
    <text x="220" y="165" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">2025年9月</text>

    <circle cx="340" cy="190" r="8" fill="#d74939" />
    <text x="340" y="150" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">UMG 与 Udio 的合作</text>
    <text x="340" y="165" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">授权的 AI 音乐平台</text>
    <text x="340" y="215" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">2025年10月</text>

 <circle cx="460" cy="190" r="8" fill="#ff8163" />
    <text x="460" y="225" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">WMG 同时解决了这两起诉讼</text>
    <text x="460" y="240" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">先是Udio，随后是Suno</text>
    <text x="460" y="165" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">2025年11月</text>

    <text x="280" y="372" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.35">来源：版权联盟（Copyright Alliance）；CNBC；《全球音乐产业》（Music Business Worldwide）（2025年）</text>
  </svg>
  <figcaption>2025年，AI版权诉讼转向“和解加许可”模式（来源：版权联盟、CNBC、Music Business Worldwide，2025年）</figcaption>
</figure>

## 为何在Anthropic因合理使用胜诉的情况下，汤森路透却击败了Ross Intelligence？

汤森路透之所以胜诉，是因为罗斯智能利用未经授权用于训练的许可内容开发了直接竞争产品。2025年2月，斯特凡诺斯·比巴斯法官（特拉华州地方法院）对汤森路透作出了部分即决判决， 这是人工智能公司首次在以训练数据“合理使用”为辩护理由的案件中遭遇简易判决败诉（古德温·普罗克特律所，《法院驳回人工智能版权案中的合理使用辩护》，检索于2026年9月17日）。

罗斯公司曾利用Westlaw的判例摘要——即汤森路透耗费数十年构建的编辑内容——来训练一款与Westlaw本身直接竞争的法律研究工具。比巴斯法官认定该使用行为不具有 transformative nature，且对原作的市场造成了商业损害 （Jenner & Block，客户通告，检索于2026年9月17日）。

与此形成对比的是Kadrey诉Meta案。2025年6月，文斯·查布里亚法官（加州北区 ）就合理使用问题对Meta作出了部分即决判决，尽管部分训练数据源自影子图书馆，但原告未能证明Meta的行为稀释了其作品的市场价值（Goodwin Procter，检索于2026年9月17日）。他特别指出，未来若有原告能证明存在市场稀释，则可能在这些原告败诉的案件中胜诉（版权联盟，《Kadrey诉Meta案判决》，检索于2026年9月17日）。

那么，成功的“合理使用”抗辩与失败的抗辩究竟有何区别？事实证明，关键在于市场竞争，而非复制行为本身的机制。

<!-- [独到见解] -->
综合来看，这些裁决表明获取方式和竞争性使用构成了两条独立的责任路径。Anthropic公司在获取方式（盗版）方面败诉，尽管其在 transformative use（ transformative use）方面胜诉；Ross公司在竞争性使用方面败诉，尽管其内容源自获得许可的来源。仅凭其中任何一个因素都无法保证获得保护。

<!-- 表 1： 合理使用结果对比（HTML表格 → htmlEmbed）-->
<table>
  <thead>
    <TR>
 <TH>案件</TH>
 <TH>训练数据来源</TH>
 <TH>数据获取方式</TH>
 <TH>是否与来源内容构成竞争？</TH>
 <TH>合理使用裁决结果</TH>
    </TR>
  </THEAD>
  <tbody>
    <tr>
 <td><strong>Bartz 诉 Anthropic 案</strong></td>
 <td>书籍，购买并扫描</td>
 <td>合法购买的副本（合法）加上来自“影子图书馆”的盗版副本（非法）</td>
      <td>否</td>
 <td>基于购买的书籍进行训练：属于合理使用。下载盗版副本：不属于合理使用，导致15亿美元和解</td>
    </tr>
    <tr>
 <td><strong>卡德雷诉Meta案</strong></td>
 <td>书籍，包括来自“影子图书馆”的书籍</td>
 <td>部分为盗版</td>
 <td>原告未证明造成市场损害</td>
      <td>根据本案记录属于合理使用；法官为能证明市场稀释的原告留有余地</td>
    </tr>
    <tr>
 <td><strong>汤森路透诉罗斯情报案</strong></td>
      <td>Westlaw判例摘要</td>
 <td>授权内容，未经授权用于训练</td>
 <td>是的，属于竞争性法律研究产品</td>
 <td>不构成合理使用，这是人工智能训练领域首例 summary judgment 败诉案例</td>
    </tr>
    <tr>
 <td><strong>盖蒂图片社诉Stability AI（英国）案</strong></td>
 <td>已获许可的图库图片</td>
 <td>未经许可使用；训练在英国境外进行</td>
      <td>是的，属于竞争性的图片授权业务</td>
 <td>版权主张因管辖权问题被驳回；但认定存在商标侵权</td>
    </tr>
  </tbody>
</table>

## 仍在法院审理中的案件

几起最具影响力的AI版权案件尚未裁决，其结果可能会进一步重塑“合理使用”原则。 《纽约时报》与作家协会合并提起的针对OpenAI的诉讼现已合并为“OpenAI版权诉讼案”，由西德尼·斯坦法官审理。截至2026年9月，该案正处于积极的证据开示阶段，尚未确定庭审日期（《华盛顿邮报》，“司法部敦促法官在《纽约时报》诉讼中裁定OpenAI和微软胜诉”， 2026年9月2日，检索于2026年9月17日）。

![图书馆内的书架，象征着众多仍在证据开示和上诉阶段的待决AI版权案件。](https://cdn.pixabay.com/photo/2016/01/19/01/42/library-1147815_1280.jpg)

2025年4月，斯坦法官基本驳回了OpenAI和微软提出的驳回诉讼动议，允许大部分诉因继续审理，并明确拒绝将AI训练称为“本质上具有 transformative 性质”。2025年10月27日的一份裁决书进一步指出： 斯坦法官裁定，ChatGPT生成的原告小说情节摘要本身可能构成侵权，这一“输出”理论有别于训练问题（IPWatchdog，《OpenAI就ChatGPT输出引发的多区集体诉讼驳回动议失败，”2025年10月28日，检索于2026年9月17日）。

该案也引起了外界的关注。2026年9月2日，美国司法部提交了一份简报，敦促法院裁定OpenAI和微软胜诉（《华盛顿邮报》，检索于2026年9月17日； Axios，《纽约时报、OpenAI、微软版权诉讼》，2026年9月8日，检索于2026年9月17日）。

盖蒂图片社诉Stability AI案的争议跨越了大洋。 2025年11月4日，英国高等法院裁定盖蒂的版权主张不成立，理由是Stability的训练过程发生在英国境外， 但认定存在商标侵权，因为Stable Diffusion早期的输出结果带有盖蒂的水印（Ropes & Gray，检索于2026年9月17日）。盖蒂在北加利福尼亚州北区法院另行提起的诉讼， ，于2026年4月成功抵御了针对商标及淡化主张的驳回动议，审判定于2028年1月至2月进行（CourtListener案卷，检索于2026年9月17日）。

<!-- [UNIQUE INSIGHT] -->
同一法律理论——即带有品牌水印或可识别衍生内容的人工智能生成内容构成侵权——目前正在英国和美国法院同步适用。虽然基于管辖权和 transformative use 原则，版权主张的范围正在收窄，但商标及生成内容相关索赔正填补这些更狭窄裁决所留下的空白。

这一趋势不仅限于文本领域。2025年6月至9月间，迪士尼、环球影业和华纳兄弟因图像生成问题起诉了Midjourney，截至2026年年中，这些合并审理的案件仍处于证据开示争议阶段 （《Variety》，检索于2026年9月17日；IPWatchdog，《华纳兄弟诉状称Midjourney的版权侵权行为“系统性”且 ‘蓄意’”，检索于2026年9月17日）。在音乐领域，环球音乐集团于2025年10月与Udio达成和解，在赔偿金的基础上还就一个新的AI音乐平台达成了许可协议；华纳音乐则于2025年11月分别与Udio和Suno达成和解（《Music Business Worldwide》， 检索于2026年9月17日）。索尼目前仍与这两家平台处于诉讼之中。压力也不仅限于法庭：参见[为何获取网络数据正变得越来越难](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it)，了解这一压力在基础设施层面的表现。

## 这些情况是否适用于抓取公开数据， 而不仅仅是AI训练？

抓取公开可访问的网页本身并不构成联邦犯罪，但这并不意味着它毫无风险。hiQ Labs诉LinkedIn案在第九巡回上诉法院对此问题作出了裁决：抓取公开网页并不违反《计算机欺诈与滥用法案》（CFAA）中“未经授权” 条款，尽管违约、版权侵权和侵占等索赔仍完全适用（White & Case，《网络爬取、网站条款与《计算机欺诈与滥用法案》》，检索于2026年9月17日）。

该裁决是在最高法院“范布伦案”判决缩小了《计算机欺诈与滥用法案》适用范围后，经发回重审作出的。同一诉讼程序还认定 hiQ 仍违反了 LinkedIn 的《服务条款》，这是一项独立的合同索赔，不受《计算机欺诈与滥用法案》裁决的影响（Fenwick & West， 《hiQ Labs再次险胜》，检索于2026年9月17日）。实际上，真正的风险问题已从“这是否属于黑客行为”转变为“我是否获得许可或许可证”。

如果抓取公开页面不算黑客行为，为什么公司仍会因此被封禁并遭到起诉？因为《计算机欺诈与滥用法案》（CFAA）的豁免条款从未涵盖合同、版权或侵权索赔，而如今大多数纠纷恰恰集中在这几个方面。

2025年8月发生的另一起事件表明，非正式执法行动可以多么迅速。Cloudflare报告称，Perplexity使用未声明的、轮换的用户代理和ASN，持续爬取那些已通过robots.txt明确禁止所有爬虫的测试域名（《搜索引擎期刊》，“Cloudflare将Perplexity移出白名单并全网封禁 Perplexity 爬取网站”，检索于 2026-09-17）。Cloudflare 撤销了 Perplexity 的“已验证机器人”状态，并在全网范围内封锁了其爬虫，且无需向法院提交任何文件。

<div data-block="callout" data-tone="warning">
**身份规避策略本身就存在风险，这与诉讼风险是分开的。** Cloudflare 于 2025 年 8 月针对 Perplexity 的调查结果表明，一旦基础设施提供商检测到用于规避已声明的 robots.txt 封锁的轮换用户代理或 ASN，即可立即将该爬虫从列表中移除并在全网范围内将其列入黑名单， 无需提起诉讼（来源：《搜索引擎期刊》，检索于2026年9月17日）。
</div>

Perplexity公开反驳了Cloudflare对事件的描述（来源：《搜索引擎期刊》，检索于2026年9月17日）。无论该争议如何解决，其中得出的教训依然成立：一旦被发现规避已声明的封锁，爬虫对网络大部分内容的访问权限可能在一夜之间被终止。如需更深入了解法律界限所在，请参阅[合乎道德的网络爬取实践](https://www.joinmassive.com/blog/ethical-web-scraping)。

## 基础设施提供商的应对措施

基础设施提供商不再坐等法院裁决，而是开始自行调整默认设置。自 2025 年 7 月 1 日起，Cloudflare 将“默认阻止未经授权的 AI 爬虫”设为每个新域名的默认设置，将此前“选择加入阻止”的模式转变为“选择退出访问” （Cloudflare，新闻稿，《Cloudflare 刚刚改变了 AI 爬虫抓取互联网的方式》，检索于 2026-09-17）。

Cloudflare 还配合这一转变推出了“按爬取次数付费”（Pay Per Crawl）机制，允许网站所有者向爬虫收取访问费用；该公司表示，该机制将从2026年9月15日起演变为“按使用量付费”（Pay Per Use）， 2026年9月15日起，该机制将演变为“按使用付费”，并默认在广告支持的页面上屏蔽多用途爬虫（Cloudflare 博客，检索于 2026-09-17）。在 2025 年 6 月 19 日至 26 日的流量观察窗口中，Cloudflare Radar 发现 Anthropic 的的Claude每向其爬取的网站发送一次引荐，就会发起约71,000次HTML页面请求（Cloudflare博客/Radar，《Radar上的AI爬取与引荐比率》，检索于2026年9月17日）。

<!-- 图表 3：robots.txt 人工智能机器人采用率差距（环形图） -->
<figure data-max-width="640">
  <svg viewBox="0 0 560 380" style="max-width: 100%; height: auto; font-family: 'Outfit', system-ui, sans-serif" role="img" aria-label="环形图：根据 Cloudflare Radar 2025 年 6 月的数据，在前 10,000 个网站域名中，仅有 14% 设置了针对 AI 机器人的 robots.txt 指令，而 86% 则完全没有 AI 机器人相关信号。">
    <title>大多数网站仍未设置 AI-机器人信号</title>
    <desc>该环形图显示，在拥有robots.txt文件的排名前10,000的网络域名中，仅有14%设置了针对AI机器人的指令；86%则完全没有AI机器人信号。 来源：Cloudflare Radar，2025年6月。</desc>

    <text x="280" y="30" text-anchor="middle" font-size="15" font-weight="800" fill="currentColor">大多数网站仍未设置AI机器人信号</text>
    <text x="280" y="50" text-anchor="middle" font-size="10.5" fill="currentColor" opacity="0.55">前10,000个域名中包含AI机器人robots.txt指令的比例</text>

    <path d="M 280,55 A 100,100 0 0 1 357.1,91.3 L 324.7,118.0 A 58,58 0 0 0 280,97 Z" fill="#d74939" />
    <path d="M 357.1,91.3 A 100,100 0 1 1 280,55 L 280,97 A 58,58 0 1 0 324.7,118.0 Z" fill="#64748b" opacity="0.45" />

 <text x="280" y="150" text-anchor="middle" font-size="34" font-weight="800" fill="#d74939">14%</text>
    <text x="280" y="168" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.65">拥有一个AI机器人</text>
    <text x="280" y="181" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.65">robots.txt 信号</text>

 <rect x="150" y="298" width="14" height="14" fill="#d74939" />
    <text x="172" y="309" font-size="11" fill="currentColor" opacity="0.85">14%：设置针对 AI 机器人的 robots.txt 指令</text>

    <rect x="150" y="322" width="14" height="14" fill="#64748b" opacity="0.45" />
    <text x="172" y="333" font-size="11" fill="currentColor" opacity="0.85">86%：未设置 AI 机器人信号</text>

    <text x="280" y="372" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.35">来源：Cloudflare Radar（2025年6月）</text>
  </svg>
  <figcaption>在前10,000个域名中，仅有14%设置了针对AI机器人的robots.txt指令（来源：Cloudflare Radar，2025年6月）</figcaption>
</figure>

大多数网站所有者至今仍未设置任何信号。在同一数据集中，GPTBot是被封锁次数最多的爬虫，在拥有robots.txt文件的3,816个域名中，有312个域名禁止其访问，而明确允许其访问的仅有61个 （Cloudflare 博客/Radar，检索于 2026-09-17）。

监管机构正开始将机器可读信号视为唯一有效的信号。 2025年12月10日，汉堡汉萨高等地区法院在“Kneschke诉LAION案”（OLG Hamburg, 5 U 104/24）中裁定，仅靠文本和数据挖掘的退出声明，只有在可被机器读取的情况下才具有法律效力。Robots.txt、 X-Robots-Tag标头或TDM保留协议均符合要求。而埋藏在网站自然语言条款中的条款则不被认可（诺顿罗氏富布赖特律师事务所，《科技法内幕》，“机器可读的退出机制与AI训练： 《汉堡法院澄清版权例外》》，检索于2026年9月17日）。

该做法与欧盟的《GPAI行为准则》一致， 该准则于2025年7月发布，截至2026年7月已有23家AI开发商签署，包括OpenAI、谷歌、Anthropic和微软，这些公司均承诺使用支持robots.txt的爬虫进行抓取，并遵守机器可读的保留条款。

<!-- [独到见解] -->
在此问题上，基础设施提供商和监管机构实际上已领先于法院。Cloudflare 于 2025 年 7 月调整了其默认爬虫政策，而汉堡法院提出的“机器可读信号”标准出台时，远早于美国判例法就数据抓取和许可的类似问题作出定论。 那些等待诉讼解决后再调整政策的团队可能会发现，默认设置已在他们不知不觉中发生了变化。

## 数据抓取者和数据团队现在应该怎么做

那些将数据来源视为事后考虑的数据团队，最容易受到这些裁决所带来风险的影响。仅巴茨（Bartz）和解案一项，就涉及约50万本盗版书籍，每本盗版作品的和解成本约为3,000美元（版权联盟，检索于2026年9月17日）， 任何法律团队都可以将这一数字乘以自身未获授权的档案数量来估算损失。

**1. 端到端追踪数据来源。** 准确掌握每条训练数据或数据集输入的来源，以及其是通过许可、购买还是抓取获得的。Anthropic案表明，监管机构和法院在判定责任时，会将获取方式与下游使用区分开来。

**2. 尊重机器可读的退出信号。** robots.txt、ai.txt 以及 TDM 保留协议（TDM Reservation Protocol）是监管机构目前认可的标准，即使某些司法管辖区尚未强制执行相关规定。

**3. 优先选择授权，而非与盗版相近的捷径。** 购买或授权的数据关系在法庭上具有法律效力，而盗版档案则不然——正如Anthropic在购买书籍的合理使用诉讼中胜诉，却无法抵消其在同一训练过程中使用邻近盗版副本所承担的责任。

**4. 避免身份规避策略。** 轮换用户代理以规避已声明的封锁将导致您被列入黑名单。无需任何法庭文件。关于 [AI数据抓取的实际内容](https://www.joinmassive.com/glossary/what-is-ai-scraping)的背景信息，是审核自身数据处理流程的有用起点。

![法官的木槌置于木质表面上，象征着法庭裁决正在塑造数据团队获取和授权训练数据的方式。](https://cdn.pixabay.com/photo/2022/10/05/07/10/gavel-7499921_1280.jpg)

<div data-block="cta" data-text="数据溯源是构建可辩护的数据获取策略的一部分，但并非全部。Massive 的住宅代理网络运行在遍布 195 多个国家的真实用户设备上， 每台设备均通过 Massive SDK 主动加入，可从任何地点的任何公开来源提供纯净的 HTML 或 Markdown 内容。该网络已通过 SOC 2 审计并符合 GDPR 要求，这只是构建可辩护数据获取策略的要素之一，并非法律保护盾，也不能替代法律建议。”></DIV>

### 抓取公开网站是否违法？

本质上并不违法。第九巡回上诉法院在“hiQ Labs 诉 LinkedIn”一案中裁定，抓取公开可访问的网页并不违反《计算机欺诈与滥用法案》（CFAA）（White & Case，检索于 2026-09-17）。但违约、 版权侵权以及侵占动产等索赔仍完全适用，因此爬虫操作者即使未违反该特定法规，仍可能面临实际法律责任。关于 robots.txt 和爬虫访问的相关内容，请参阅[如何为 AI 代理提供实时网络访问权限](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access)。

### 使用受版权保护的材料训练AI模型是否构成合理使用？

这取决于获取方式和竞争关系，而不仅仅是作品的改作。在Anthropic案中，阿尔苏普法官裁定使用购买的书籍进行训练属于合理使用；而在Ross Intelligence案中，比巴斯法官则裁定该公司为开发竞争产品而使用Westlaw判例摘要进行训练不构成合理使用，这是此类案件中的首次败诉 （Goodwin Procter，检索于 2026-09-17）。

### Anthropic 案与汤森路透 AI 版权案的裁决有何区别？

Anthropic公司在基于“ transformative training”的诉讼中胜诉，但在盗版指控中败诉，最终就约50万本盗版书籍达成15亿美元的和解协议（版权联盟，检索于2026年9月17日）。 Ross Intelligence则因使用获得许可的Westlaw内容来开发直接竞争产品而彻底败诉，这一结果更多关乎市场竞争，而非训练方法本身。

### 数据团队在收集训练数据时如何降低法律风险？

追踪每条输入数据的来源，遵守 robots.txt 和 TDM 保留协议等机器可读的退出信号，并优先使用获得许可或购买的数据，而非采取涉及盗版的捷径。Cloudflare 发现，截至 2025 年 6 月， 顶级域名设置了任何针对AI机器人的robots.txt信号（Cloudflare Radar，检索于2026年9月17日），这意味着默认情况下大多数风险暴露问题仍未得到解决。

## 结论

今年，关于 AI 训练数据的法律框架分成了两条独立的轨道：如何获取数据，以及如何使用数据，而法院现在愿意分别对这两方面的任何疏漏进行处罚。

- 获取方式现已成为独立的法律责任轨道，与合理使用区分开来。
- 竞争性使用比盗版更迅速地扼杀“合理使用”抗辩：Ross Intelligence 之所以彻底败诉，正是因为其工具与 Westlaw 直接构成竞争——这是 Anthropic 和 Meta 从未面临过的考验。
- 基础设施的发展速度快于法院。Cloudflare 于 2025 年 7 月更改了其爬虫的默认设置；数月后，欧盟监管机构也随之采取了行动。

预计到2027年，将出现更多类似UMG和华纳音乐的“和解加授权”协议，因为“先起诉后授权”的模式正持续蔓延至文本、图像和音乐领域。关于如何以可辩护的方式获取数据的实践方面，请参阅 [基于实时网络数据构建数据管道](https://www.joinmassive.com/blog/building-a-rag-pipeline-on-live-web-data-without-stale-indexes)。

## 来源

1. [版权联盟（Copyright Alliance），《参与巴茨诉Anthropic和解案》，检索于2026年9月17日](https://copyrightalliance.org/participating-bartz-v-anthropic-settlement/)
2. [CNBC，《法官初步批准与作者达成的15亿美元和解协议》，检索于2026年9月17日](https://www.cnbc.com/2025/09/25/judge-anthropic-case-preliminary-ok-to-1point5b-settlement-with-authors.html)
3. [诺顿罗氏富布赖特律师事务所 / Inside Tech Law，《Bartz诉Anthropic案：在具有里程碑意义的简易判决和集体诉讼认证后达成和解》，检索于2026年9月17日](https://www.insidetechlaw.com/blog/2025/09/bartz-v-anthropic-settlement-reached-after-landmark-summary-judgment-and-class-certification)
4. [古德温·普罗克特律所，“法院驳回人工智能版权案中的合理使用抗辩”，检索于2026年9月17日](https://www.goodwinlaw.com/en/insights/publications/2025/02/alerts-practices-ip-lit-court-rejects-fair-use-defense-in-ai-copyright-case)
5. [詹纳·布洛克律师事务所，关于“汤森路透诉罗斯情报公司”案的客户通告，检索于 2026-09-17](https://www.jenner.com/en/news-insights/client-alerts/court-decides-that-use-of-copyrighted-works-in-ai-training-is-not-fair-use-thomson-reuters-enterprise-centre-gmbh-v-ross-intelligence-inc)
6. [古德温·普罗克特律师事务所，《加利福尼亚州北区法院法官作出裁决》（Kadrey诉Meta案），检索于2026年9月17日](https://www.goodwinlaw.com/en/insights/publications/2025/06/alerts-practices-aiml-northern-district-of-california-judge-rules)
7. [版权联盟，“Kadrey诉Meta案判决”，检索于2026年9月17日](https://copyrightalliance.org/kadrey-v-meta-decision/)
8. [《华盛顿邮报》，“司法部敦促法官在《纽约时报》诉讼案中支持OpenAI和微软”，检索于2026年9月17日](https://www.washingtonpost.com/technology/2026/09/02/doj-urges-judge-rule-openai-microsoft-ny-times-lawsuit/)
9. [Axios，《〈纽约时报〉、OpenAI、微软版权诉讼案》，检索于2026年9月17日](https://www.axios.com/2026/09/08/nyt-openai-microsoft-copyright-lawsuit)
10. [IPWatchdog，《OpenAI 试图驳回针对 ChatGPT 输出内容的多区集体诉讼的动议未果》，检索于 2026-09-17](https://ipwatchdog.com/2025/10/28/openai-loses-bid-dismiss-multi-district-class-action-chatgpt-outputs/)
11. [Ropes & Gray，《盖蒂图片社在英国首例……中针对Stability AI的版权侵权索赔败诉》，检索于2026年9月17日](https://www.ropesgray.com/en/insights/viewpoints/102lvxe/getty-image-loses-copyright-infringement-claim-against-stability-ai-in-uks-first)
12. [Cleary Gottlieb，《英国高等法院就盖蒂图片社诉Stability AI案作出具有里程碑意义的裁决》，检索于2026年9月17日](https://www.clearyiptechinsights.com/2025/11/uk-high-court-issues-landmark-ruling-in-getty-images-v-stability-ai-with-narrow-trademark-infringement-win-for-getty-claim-of-secondary-copyright-infringement-fails/)
13. [CourtListener，《盖蒂图片社（美国）公司诉Stability AI有限公司》案卷，检索于2026年9月17日](https://www.courtlistener.com/docket/71112094/getty-images-us-inc-v-stability-ai-ltd/)
14. [Music Business Worldwide，《环球音乐与Udio达成和解，就授权AI音乐平台签署协议》，检索于2026年9月17日](https://www.musicbusinessworldwide.com/universal-music-settles-udio-lawsuit-strikes-deal-for-licensed-ai-music-platform/)
15. [《好莱坞报道者》，“环球音乐集团宣布与Udio达成和解”，检索于2026年9月17日](https://www.hollywoodreporter.com/music/music-industry-news/universal-music-group-announces-settlement-with-udio-1236414023/)
16. [《综艺》关于Midjourney工作室证据开示纠纷的报道，检索于2026年9月17日](https://variety.com/2026/film/news/midjourney-studios-ai-copyright-discovery-1236800902/)
17. [IPWatchdog，《华纳兄弟诉状指控Midjourney的版权侵权行为“系统性”且“蓄意”》，检索于2026年9月17日](https://ipwatchdog.com/2025/09/08/warner-bros-complaint-alleges-midjourneys-copyright-infringement-systematic-willful/)
18. [怀特·凯斯律师事务所，“网络爬虫、网站条款与《计算机欺诈与滥用法案》（CFAA）： hiQ的初步禁令再次获得维持”，检索于2026年9月17日](https://www.whitecase.com/insight-our-thinking/web-scraping-website-terms-and-cfaa-hiqs-preliminary-injunction-affirmed-again)
19. [Fenwick & West，“hiQ Labs再次险胜： 第九巡回上诉法院重申数据抓取不违反《计算机欺诈与滥用法案》”，检索于2026年9月17日](https://www.fenwick.com/insights/publications/hiq-labs-scrapes-by-again-the-ninth-circuit-reaffirms-that-data-scraping-does-not-violate-the-cfaa-1)
20. [Cloudflare 博客/Radar，"Radar 上的 AI 爬取与引荐比例"，检索于 2026-09-17](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/)
21. [Cloudflare，新闻稿，“Cloudflare 刚刚从根本上改变了 AI 爬虫抓取互联网的方式”，检索于 2026-09-17](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/)
22. [《搜索引擎期刊》，“Cloudflare 将 Perplexity 从网站抓取名单中移除并阻止其抓取”，检索于 2026-09-17](https://www.searchenginejournal.com/cloudflare-delists-and-blocks-perplexity-from-crawling-websites/552899/)
23. [诺顿罗氏富布赖特律师事务所，《Inside Tech Law》，“机器可读的退出机制与人工智能训练：汉堡法院澄清了版权例外条款”，检索于 2026-09-17](https://www.insidetechlaw.com/blog/2025/12/machine-readable-opt-outs-and-ai-training-hamburg-court-clarifies-copyright-exceptions)
