# 破除误区：数据抓取与黑客行为并非一回事

“这基本上就是黑客行为吧？”这是任何从事大规模网页数据抓取的人最常被问到的问题之一。坦率地说，答案是否定的。黑客行为是指侵入未经授权的系统。 而抓取公开网页，则是指读取网站已经向所有浏览器用户展示的内容。在过去的五年里，美国最高法院和第九巡回上诉法院已在实际案件中划清了这一界限。但“不属于黑客行为”并不意味着“没有规则”，这些案例同时也指明了真正的界限所在。

> **关键要点**
>
> - 2021年，美国最高法院将联邦反黑客法（CFAA）解读为一个“门是开着还是关着”的问题： 你是否被允许进入系统的这一部分（[范布伦诉美国案](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf)，2021年）。
> - 2022年，第九巡回上诉法院裁定，向公众开放的网页“未设置任何门槛”，因此浏览这些网页通常不构成“未经授权”的访问（[hiQ诉LinkedIn案](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf)，2022年）。
> - 合同法、虚假账户、版权法和隐私法仍然适用。这些才是网络数据案件胜负的关键所在。

*本文旨在向普通读者解释公开的法院判决。本文不构成法律建议，且各国法律存在差异。*

## 为什么人们认为数据抓取就是黑客行为？

这种混淆主要源于术语。两者都涉及自动化脚本，都以大规模方式进行，且都出现在关于“机器人”的头条新闻中。 1986年通过的《美国计算机欺诈与滥用法案》（CFAA）规定，“未经授权”访问计算机或“超出授权范围”访问计算机均属犯罪。多年来，网站方一直主张违反其服务条款即构成“超出授权范围”的访问。

如果这种解释成立，许多普通行为都将构成联邦犯罪。例如，使用工作电脑查看体育比赛比分；违反网站规定注册第二个账户；向网站明确禁止自动化访问的页面发送自动化请求。多年来，法院对该法规的适用范围一直存在分歧。

因此，这一说法并非毫无根据。它源于一场真实的法律争端，且自2021年以来，该法的适用范围已大幅收窄——尽管部分问题仍悬而未决，且关键的上诉裁决仅对第九巡回上诉法院具有约束力。

## 最高法院在“范布伦案”中作出了什么裁决？

2021年6月，在*范布伦诉美国*一案中， 最高法院以6比3的投票结果裁定，“超出授权访问范围”是指进入计算机系统中你无权访问的部分，而非滥用你原本已被允许查看的信息（[最高法院意见书](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf)，2021年）。 法院将此描述为“门是开着还是关着”的审查。

这种表述方式起到了关键作用。问题不在于“你是否违反了网站制定的规则？”，而在于“这扇门对你是否敞开？”登录页面就是一道门，密码就是一道门。 而任何人都可以在浏览器中加载的页面则不属于“门”。

<!-- [独特见解] -->
请注意这在实践中意味着什么。自*范·布伦*案以来，法院一直将身份验证（即登录或密码）视为“关闭的大门”最明显的例子。 最高法院确实在脚注中留有余地，未明确仅凭合同条款或政策是否足以构成“门”。尽管如此，“在我与这些数据之间是否存在登录门槛？”这个问题，大多数工程团队实际上都能回答，而这一点是大多数服务条款无法做到的。

## hiQ 诉 LinkedIn 案：公开页面不存在“门”

hiQ Labs 收集了 LinkedIn 的公开个人资料以构建劳动力分析模型，LinkedIn 随即发出了停止侵权通知书。在 *Van Buren* 案之后，最高法院将此案发回重审。 2022年4月，第九巡回上诉法院裁定，当一个网站将数据公开时，“该计算机从一开始就未设置任何可升降的门槛” ([第九巡回上诉法院意见书](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf)，2022)。

通俗来说，阅读公开页面——即使使用自动化工具，甚至在被要求停止后仍继续——不太可能构成《计算机欺诈与滥用法案》（CFAA）的违规行为。这是人们通常引用的裁决。

这也是故事通常被截断的地方。

## 为何 hiQ 仍需向 LinkedIn 支付赔偿：合同与行为

因为 hiQ 的败诉并非源于黑客行为，而是源于合同违约和不当行为。2022 年 11 月，地区法院认定 hiQ 违反了 LinkedIn 的《用户协议》，部分原因在于为 hiQ 工作的承包商创建了虚假的 LinkedIn 个人资料。 2022年12月，双方提交了一份拟议的和解判决书，其中包括对hiQ处以50万美元的罚款，并要求其删除所持有的LinkedIn数据（[地区法院案卷](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/)，2022年； [《国家法律评论》](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case)，2022年；[摩根路易斯律师事务所](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators)，2022年)。

这里有一个大多数摘要都忽略的教训。问题在于这些虚假账户，以及hiQ自身曾同意遵守领英《用户协议》这一事实。一旦你拥有了一个账户，就意味着你已接受了相关条款。若以虚假身份创建账户，就相当于用一把自己编造的钥匙穿过了大门。

## 是否登录有区别吗？

有，而且2024年的一起案件对此作了明确说明。2024年1月，在*Meta诉Bright Data*一案中，加利福尼亚州北区法院的爱德华·陈法官裁定Bright Data胜诉。 他认定，Facebook和Instagram的条款并未禁止在未登录状态下收集公开数据（[法院裁决](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf)，2024年；[奎因·伊曼纽尔律师事务所客户通告](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/)，2024年）。

法院认为，已注销登录的访问者并非受这些条款约束的“用户”。法院还驳回了Meta对条款的解释，即该条款永久禁止收集公开数据，即使在账户关闭后也是如此。

将这三起案件并列比较，便会显现出一个简单的模式：

| 情况 | 《计算机欺诈与滥用法案》（CFAA）“黑客攻击”风险 | 合同风险 |
|-----------|--------------------|---------------|
| 浏览公共页面，未登录 | 在 *Van Buren* 和 *hiQ* 案后风险较低 | 更低：一家法院认定 Meta 的条款不涵盖此情形 |
| 浏览通过自身登录访问的页面 | 取决于账户权限设置 | 较高：你已同意相关条款 |
| 使用虚假账户绕过登录 | 较高 | 高，如 hiQ 案所示 |
| 绕过密码或技术障碍 | 高：这相当于翻越封闭的大门 | 高 |

## 那么，获取公开数据的真正规则是什么？

将网络入侵视为“黑客行为”的法律视角大多是错误的。 真正塑造网络数据工作的规则是合同（你是否同意了条款？）、版权（你如何使用内容？）以及欧盟《通用数据保护条例》（GDPR）等隐私法（数据是否能识别个人身份？）。即使访问行为本身并不违法，从公共页面收集个人数据仍可能触发隐私义务。

供团队参考的可行检查清单：

1. **保持未登录状态**，除非你有明确的权利为此目的使用某个账户。
2. **切勿创建虚假账户**来获取数据。这种行为正是 hiQ 败诉的关键原因。
3. **不要绕过技术障碍。** 登录墙或密码就是一道关闭的大门。
4. **核查您正在收集的内容。** 个人数据会带来相应的隐私义务。
5. **核查您对数据的具体用途。** 转载受版权保护的内容与单纯阅读相比，会引发不同的法律问题。
6. **阅读 robots.txt 文件，并保持请求量在合理范围内。** robots.txt 虽非《计算机欺诈与滥用法案》（CFAA）的门槛，但网站所有者会将无视该文件或对网站进行疯狂请求视为恶意行为。请勿损害您正在访问的网站。

<!-- [独特见解] -->
那些能避免麻烦的团队往往会在构建任何东西之前就将规则写下来：他们收集哪些数据、为何收集，以及为了获取数据绝不会做什么。 更优秀团队会更进一步，将这些规则置于脚本无法忽略的位置。例如，位于代理层中的“绝不触碰”列表会直接阻止请求，而不是依赖每位工程师都记住维基页面上的内容。

关于这些问题在 AI 训练争议中的具体表现，请参阅 [每个网络数据团队都应了解的 AI 训练数据诉讼](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers)。关于本系列探讨的另一个误区，请阅读 [为什么 IP 地址越多并不意味着代理网络就越好](https://www.joinmassive.com/blog/myth-more-ips-better-proxy-network)。

## 您使用的网络也是合规的一部分

您访问公共页面的方式也是合规故事的一部分。由被劫持设备构建的住宅网络会带来您未曾造成的问题。 Massive 的网络由真实的消费者设备组成，这些设备的所有者已通过 Massive SDK 主动同意参与，且 Massive 已完成 SOC 2 I 类审计，II 类审计正在进行中，相关信息均列于 [Massive 信任中心](https://trust.joinmassive.com)。 关于向任何供应商提出的问题，请参阅 [SOC 2 与 GDPR：向住宅代理供应商提出哪些问题](https://www.joinmassive.com/blog/proxy-vendor-compliance-soc2-gdpr)。

访问仍存在限制。Massive会在网络层为所有账户屏蔽特定类别的内容，且每个住宅账户最多可向其自身的 [域名屏蔽列表](https://docs.joinmassive.com/residential/domain-blocking) 中添加 1,000 个域名。被屏蔽的请求会返回 `452 Disallowed Content` 状态码，而非成功通过。 关于“主动加入”机制的详细说明，请参阅[Massive 主动加入网络的工作原理](https://www.joinmassive.com/blog/how-massives-opt-in-network-works)。

## 常见问题

根据《计算机欺诈与滥用法案》（CFAA），收集公开可用的网页通常不构成犯罪，至少在第九巡回上诉法院管辖范围内，自 *Van Buren* 案（2021 年）及第九巡回上诉法院 2022 年 *hiQ 诉 LinkedIn* 案的裁决以来便是如此。 但根据您获取数据的方式及对数据的使用目的，合同法、版权法和隐私法仍可能适用。

### “gates-up-or-down”是什么意思？

这是最高法院在 2021 年 *Van Buren* 案中提出的测试标准。 根据《计算机欺诈与滥用法》（CFAA），若您进入系统中对您关闭的部分（例如您无权登录的区域），即构成超出授权范围的访问。而滥用您本已可见的信息则不在此列。

### 如果抓取公开数据不算黑客行为，为什么 hiQ 还是败诉了？

2022年11月，法院裁定hiQ违反了领英（LinkedIn）的《用户协议》，其中包括其承包商创建的虚假个人资料。2022年12月提出的和解判决草案中，hiQ被处以50万美元罚款。此次败诉源于合同违约和不当行为，而非阅读公开页面。

### 《通用数据保护条例》（GDPR）是否适用于公开网络数据？

可能适用。GDPR涵盖所有个人数据，无论其是否公开，且其管辖范围可延伸至监控欧盟境内人员的欧盟以外公司。收集姓名、个人资料或联系方式的团队需要具备合法依据，并制定数据最小化方案。

## 核心要点

- 黑客攻击意味着突破封闭的大门，而抓取公共网页则不属于此类行为。
- *Van Buren*（2021）案确立了“大门测试”标准，第九巡回上诉法院在*hiQ*（2022）案中将其适用于公共网页。
- hiQ案最终仍因虚假账户和合同条款而败诉。
- *Meta诉Bright Data*案（2024）表明，未登录状态下的数据收集与登录状态下的数据使用属于不同范畴。
- 真正的规则在于合同、版权和隐私。请针对这些方面做好规划。

## 来源

- 美国最高法院，[*Van Buren诉美国政府案*，案号 19-783 (2021)](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf)
- 美国第九巡回上诉法院，[*hiQ Labs, Inc. 诉 LinkedIn Corp.*，案号 17-16783（2022年4月18日）](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf)
- 《国家法律评论》，[“hiQ与领英在具有里程碑意义的数据抓取案中达成拟议和解”](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case) (2022)
- 摩根路易斯律师事务所，[“LinkedIn诉hiQ案：具有里程碑意义的数据抓取诉讼提供了指导”](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators) (2022)
- 美国加利福尼亚州北区地方法院，[*hiQ Labs, Inc. 诉 LinkedIn Corp.*, 案号 3:17-cv-03301-EMC，关于双方简易判决动议的裁定（2022年11月4日）](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/)
- 美国加利福尼亚州北区地方法院，[*Meta Platforms, Inc. 诉 Bright Data Ltd.*, 案号 3:23-cv-00077-EMC，准予 Bright Data 关于简易判决动议的裁定（2024年1月23日）](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf)
- 奎因·伊曼纽尔律师事务所，["Meta诉Bright Data案：对网络爬虫行业具有重大意义的裁决"](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/) (2024)
