# Desmistificando: Web scraping e hacking não são a mesma coisa

“Isso não é basicamente hacking?” Essa é uma das perguntas mais comuns que qualquer pessoa que realiza web scraping em grande escala recebe. A resposta sincera é não. Hacking significa invadir um sistema ao qual você não tem permissão para acessar. Recolher uma página da web pública significa ler algo que o site já exibe para qualquer pessoa com um navegador. Nos últimos cinco anos, a Suprema Corte dos EUA e o Nono Circuito traçaram essa linha em casos reais. Mas “não ser hacking” não significa “ausência de regras”, e os mesmos casos mostram onde estão os limites reais.

> **Pontos-chave**
>
> - Em 2021, a Suprema Corte dos EUA interpretou a lei federal contra a pirataria informática (a CFAA) como uma questão do tipo “portão aberto ou fechado”: você tem permissão para acessar esta parte do sistema ou não ([Van Buren v. United States](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf), 2021).
> - Em 2022, o Nono Circuito decidiu que páginas abertas ao público “não ergueram portões”, portanto, acessá-las provavelmente não constitui acesso “sem autorização” ([hiQ v. LinkedIn](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf), 2022).
> - Contratos, contas falsas, direitos autorais e legislação de privacidade continuam a ser aplicáveis. É nessas áreas que os processos envolvendo dados da web são, de fato, ganhos ou perdidos.

*Esta publicação explica decisões judiciais públicas para um público geral. Não se trata de aconselhamento jurídico, e a legislação varia de acordo com o país.*

## Por que as pessoas acham que o scraping é hacking?

A confusão se deve principalmente ao vocabulário. Ambos envolvem scripts automatizados, ambos ocorrem em grande escala e ambos aparecem em manchetes sobre “bots”. A Lei de Fraude e Abuso Informático dos EUA (CFAA), aprovada em 1986, tornou crime acessar um computador “sem autorização” ou “exceder o acesso autorizado”. Durante anos, os sites argumentaram que violar seus termos de serviço equivalia a exceder o acesso autorizado.

Se essa interpretação tivesse prevalecido, muitos comportamentos comuns seriam considerados crimes federais. Usar um computador do trabalho para verificar resultados esportivos. Criar uma segunda conta contrariando as regras de um site. Enviar uma solicitação automatizada a uma página que o site determinou que não deveria ser automatizada. Os tribunais permaneceram divididos por anos quanto ao alcance da lei.

Portanto, o mito não é absurdo. Ele surgiu de uma disputa jurídica real, que se tornou bem mais restrita desde 2021, embora algumas questões ainda estejam em aberto e a decisão-chave do recurso vincule apenas a Nona Circunscrição.

## O que a Suprema Corte decidiu no caso Van Buren?

Em junho de 2021, no caso *Van Buren v. Estados Unidos*, a Suprema Corte decidiu, por 6 votos a 3, que “exceder o acesso autorizado” abrange o acesso a partes de um sistema de computador que estão fora do seu alcance, e não o uso indevido de informações que você já tinha permissão para visualizar ([Parecer da Suprema Corte](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf), 2021). A Corte descreveu isso como uma análise do tipo “portão aberto ou fechado”.

A formulação da questão já resolve grande parte do problema. A pergunta não é “o senhor infringiu uma regra estabelecida pelo site?”. É “o portão estava aberto para o senhor?”. Uma página de login é um portão. Uma senha é um portão. Uma página que qualquer pessoa pode carregar em um navegador não o é.

<!-- [VISÃO EXCLUSIVA] -->
Observe o que isso significa na prática. Desde o caso *Van Buren*, os tribunais têm tratado a autenticação — seja um login ou uma senha — como o exemplo mais claro de um portão fechado. A Suprema Corte deixou em aberto, em uma nota de rodapé, se os termos contratuais ou as políticas, por si sós, podem fechar um portão. Ainda assim, “existe um login entre mim e esses dados?” é uma pergunta que a maioria das equipes de engenharia consegue realmente responder, o que é mais do que se pode dizer da maioria dos termos de serviço.

## hiQ v. LinkedIn: páginas públicas não possuem portão

A hiQ Labs coletou perfis públicos do LinkedIn para elaborar análises da força de trabalho, e o LinkedIn enviou uma carta de cessação e desistência. Após o caso *Van Buren*, a Suprema Corte remeteu o caso de volta à instância inferior. Em abril de 2022, o Nono Circuito decidiu que, quando um site disponibiliza dados publicamente, “esse computador não ergueu nenhuma barreira para levantar ou abaixar, para começar” ([parecer do Nono Circuito](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf), 2022).

Em termos simples, acessar páginas públicas, mesmo com ferramentas automatizadas e mesmo após ter sido solicitado a interromper a atividade, provavelmente não constituía uma violação da CFAA. É essa decisão que as pessoas costumam citar.

É também nesse ponto que a história geralmente é interrompida.

## Por que a hiQ ainda pagou ao LinkedIn: contrato e conduta

Porque a hiQ não perdeu por causa da invasão. Perdeu por causa do contrato e da conduta. Em novembro de 2022, o tribunal distrital concluiu que a hiQ havia violado o Acordo de Usuário do LinkedIn, em parte porque prestadores de serviços que trabalhavam para a hiQ criaram perfis falsos no LinkedIn. Em dezembro de 2022, as partes apresentaram uma proposta de sentença de consentimento que incluía uma condenação de US$ 500.000 contra a hiQ e exigia que ela apagasse os dados do LinkedIn que mantinha ([autos do tribunal distrital](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/), 2022; [National Law Review](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case), 2022; [Morgan Lewis](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators), 2022).

Eis a lição que a maioria dos resumos deixa de lado. As contas falsas e o fato de a própria hiQ ter concordado com o Termo de Uso do LinkedIn eram o problema. Ao criar uma conta, o usuário aceita os termos. Criar uma conta com identidade falsa é como atravessar um portão com uma chave que você mesmo inventou.

## É relevante se você está conectado ou não?

Sim, e um caso de 2024 deixou isso bem claro. Em janeiro de 2024, no caso *Meta v. Bright Data*, o juiz Edward Chen, do Distrito Norte da Califórnia, concedeu julgamento sumário à Bright Data. Ele concluiu que os termos do Facebook e do Instagram não proíbem a coleta de dados públicos quando o usuário está desconectado ([decisão judicial](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf), 2024; [alerta ao cliente da Quinn Emanuel](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/), 2024).

O tribunal argumentou que um visitante que não está conectado não atua como um “usuário” vinculado a esses termos. Também rejeitou a interpretação da Meta de que seus termos proíbem a coleta de dados públicos para sempre, mesmo após o encerramento de uma conta.

Ao comparar os três casos, surge um padrão simples:

| Situação | Risco de “hacking” nos termos da CFAA | Risco contratual |
|-----------|--------------------|---------------|
| Acessar páginas públicas, sem estar conectado | Baixo após *Van Buren* e *hiQ* | Menor: um tribunal considerou que os termos da Meta não abrangiam essa situação |
| Acessar páginas por meio de seu próprio login | Depende do que sua conta permite | Mais alto: o senhor concordou com os termos |
| Uso de contas falsas para acessar áreas restritas | Mais elevado | Elevado, conforme constatado no caso hiQ |
| Contornar uma senha ou barreira técnica | Elevado: trata-se de um portão fechado | Elevado |

## Então, quais são as regras reais para a obtenção de dados públicos?

A legislação sobre hacking, em grande parte, não é a perspectiva correta. As regras que realmente moldam o trabalho com dados da web são os contratos (o senhor concordou com os termos?), os direitos autorais (o que o senhor está fazendo com o conteúdo?) e as leis de privacidade, como o GDPR da UE (os dados identificam pessoas?). A coleta de dados pessoais de uma página pública ainda pode acionar obrigações de privacidade, mesmo quando nada no acesso foi ilegal.

Uma lista de verificação prática para equipes:

1. **Mantenha-se desconectado**, a menos que tenha o direito claro de usar uma conta para esse fim.
2. **Nunca crie contas falsas** para obter dados. Essa conduta foi fundamental para a derrota da hiQ.
3. **Não contorne barreiras técnicas.** Uma página de login ou senha é um portão fechado.
4. **Verifique o que você está coletando.** Dados pessoais acarretam obrigações de privacidade.
5. **Verifique o que você está fazendo com eles.** Republicar conteúdo protegido por direitos autorais levanta questões distintas daquelas relacionadas à simples leitura.
6. **Leia o arquivo robots.txt e mantenha o volume de solicitações dentro de limites razoáveis.** O robots.txt não é uma barreira da CFAA, mas os proprietários de sites consideram ignorá-lo ou sobrecarregar um site como um sinal de má-fé. Não prejudique o site que você está acessando.

<!-- [VISÃO EXCLUSIVA] -->
As equipes que evitam problemas tendem a definir suas regras por escrito antes de desenvolver qualquer coisa: quais dados coletam, por quê e o que nunca farão para obtê-los. As melhores vão um passo além e colocam essas regras onde um script não possa ignorá-las. Uma lista de “proibições” que fica na camada de proxy, por exemplo, bloqueia uma solicitação imediatamente, em vez de depender de que todos os engenheiros se lembrem de uma página wiki.

Para saber como essas questões se manifestam especificamente em disputas sobre treinamento de IA, consulte [os processos judiciais sobre dados de treinamento de IA que toda equipe de dados da web deve conhecer](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers). Para conhecer outro mito abordado nesta série, leia [por que mais IPs não resultam em uma rede de proxy melhor](https://www.joinmassive.com/blog/myth-more-ips-better-proxy-network).

## A rede que o senhor utiliza também faz parte da conformidade

A forma como o senhor acessa páginas públicas também faz parte de sua história de conformidade. Uma rede residencial construída a partir de dispositivos sequestrados acrescenta um problema que o senhor não criou. A rede da Massive é composta por dispositivos reais de consumidores cujos proprietários optaram por participar por meio do SDK da Massive, e a Massive concluiu uma auditoria SOC 2 Tipo I, com a Tipo 2 em andamento, ambas listadas no [Massive Trust Center](https://trust.joinmassive.com). Para saber quais perguntas fazer a qualquer fornecedor, consulte [SOC 2 e GDPR: o que perguntar a um fornecedor de proxy residencial](https://www.joinmassive.com/blog/proxy-vendor-compliance-soc2-gdpr).

O acesso ainda apresenta limites. A Massive bloqueia certas categorias de conteúdo na camada de rede para todas as contas, e cada conta residencial pode adicionar até 1.000 domínios à sua própria [lista de bloqueio de domínios](https://docs.joinmassive.com/residential/domain-blocking). Uma solicitação bloqueada retorna como `452 Disallowed Content` em vez de ser processada. Os detalhes sobre como funciona o opt-in estão em [como funciona a rede opt-in da Massive](https://www.joinmassive.com/blog/how-massives-opt-in-network-works).

## Perguntas frequentes

### O web scraping é ilegal nos EUA?

A coleta de páginas disponíveis publicamente geralmente não constitui crime nos termos da CFAA, pelo menos no Nono Circuito, após o caso *Van Buren* (2021) e a decisão do Nono Circuito de 2022 no caso *hiQ v. LinkedIn*. As leis de contratos, direitos autorais e privacidade ainda podem ser aplicáveis, dependendo de como o senhor acessa os dados e do que faz com eles.

### O que significa “gates-up-or-down”?

Trata-se do critério estabelecido pela Suprema Corte em 2021 no caso *Van Buren*. O senhor excede o acesso autorizado nos termos da CFAA ao entrar em partes de um sistema que lhe estão vedadas, como áreas protegidas por um login ao qual o senhor não tem direito. O uso indevido de informações que o senhor já pudesse visualizar não é considerado violação.

### Por que a hiQ perdeu se a coleta de dados públicos não é hacking?

Em novembro de 2022, um tribunal considerou que a hiQ violou o Acordo de Usuário do LinkedIn, inclusive por meio de perfis falsos criados por seus prestadores de serviços. A proposta de sentença de consentimento de dezembro de 2022 previa uma multa de US$ 500.000 contra a hiQ. A derrota decorreu de questões contratuais e de conduta, e não da consulta de páginas públicas.

### O GDPR se aplica a dados públicos na web?

Pode se aplicar. O GDPR abrange dados pessoais, sejam eles públicos ou não, e pode se estender a empresas fora da UE que monitoram pessoas na UE. Equipes que coletam nomes, perfis ou detalhes de contato precisam de uma base legal e de um plano para a minimização de dados.

## Conclusão

- Hackear significa ultrapassar um portão fechado. Extrair dados de uma página pública não.
- O caso *Van Buren* (2021) estabeleceu o “teste do portão”, e a Nona Circunscrição Judicial aplicou-o a páginas públicas no caso *hiQ* (2022).
- A *hiQ* ainda assim perdeu, devido a contas falsas e aos termos contratuais.
- *Meta v. Bright Data* (2024) demonstrou que a coleta de dados quando o usuário está desconectado se situa em um contexto diferente do uso quando o usuário está conectado.
- As regras reais são o contrato, os direitos autorais e a privacidade. Planeje-se de acordo com elas.

## Fontes

- Suprema Corte dos Estados Unidos, [*Van Buren v. Estados Unidos*, n.º 19-783 (2021)](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf)
- Tribunal de Apelações dos Estados Unidos para o Nono Circuito, [*hiQ Labs, Inc. v. LinkedIn Corp.*, n.º 17-16783 (18 de abril de 2022)](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf)
- National Law Review, ["hiQ e LinkedIn chegam a um acordo proposto em caso histórico de extração de dados"](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case) (2022)
- Morgan Lewis, ["LinkedIn v. hiQ: Ação judicial histórica sobre extração de dados oferece orientação"](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators) (2022)
- Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia, [*hiQ Labs, Inc. v. LinkedIn Corp.*, n.º 3:17-cv-03301-EMC, decisão sobre as moções recíprocas de julgamento sumário (4 de novembro de 2022)](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/)
- Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia, [*Meta Platforms, Inc. contra Bright Data Ltd.*, n.º 3:23-cv-00077-EMC, decisão que defere a moção da Bright Data para julgamento sumário (23 de janeiro de 2024)](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf)
- Quinn Emanuel, ["Meta contra Bright Data: decisão significativa para o setor de web scraping"](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/) (2024)
