A coleta de páginas disponíveis ao público geralmente não constitui crime nos termos da CFAA, pelo menos no Nono Circuito, após Van Buren (2021) e a decisão do Nono Circuito de 2022 hiQ contra LinkedIn decisão. A legislação contratual, de direitos autorais e de privacidade ainda pode ser aplicável, dependendo de como você acessa os dados e do que faz com eles.
Desmistificando: “Scraping” e “hacking” não são a mesma coisa
“Isso não é basicamente hacking?” Essa é uma das perguntas mais comuns que qualquer pessoa que faça web scraping em grande escala recebe. A resposta sincera é não. Hacking significa invadir um sistema ao qual você não tem permissão para acessar. Recuperar uma página da web pública significa ler algo que o site já exibe para qualquer pessoa que utilize um navegador. Nos últimos cinco anos, a Suprema Corte dos EUA e o Nono Circuito traçaram essa linha em casos reais. Mas “não ser hacking” não significa “ausência de regras”, e os mesmos casos mostram onde se situam os limites reais.
Principais conclusões
- Em 2021, a Suprema Corte dos EUA interpretou a lei federal contra a invasão de sistemas (a CFAA) como uma questão do tipo “portão aberto ou fechado”: o senhor tem permissão para acessar esta parte do sistema ou não (Van Buren contra os Estados Unidos, 2021).
- Em 2022, o Nono Circuito decidiu que as páginas abertas ao público “não impõem restrições”, de modo que a leitura dessas páginas provavelmente não constitui acesso “sem autorização” (hiQ contra LinkedIn, 2022).
- Os contratos, as contas falsas, os direitos autorais e a legislação sobre privacidade continuam em vigor. É nessas áreas que os processos relacionados a dados da web são, de fato, ganhos ou perdidos.
Esta publicação explica decisões judiciais públicas para o público em geral. Não se trata de aconselhamento jurídico, e a legislação varia de acordo com o país.
Por que as pessoas acham que o scraping é hacking?
A confusão se deve principalmente ao vocabulário. Ambos envolvem scripts automatizados, ambos ocorrem em grande escala e ambos aparecem em manchetes sobre “bots”. A Lei dos Estados Unidos sobre Fraude e Abuso Informático (CFAA), aprovada em 1986, tipificou como crime o acesso a um computador “sem autorização” ou a “ultrapassar o acesso autorizado”. Durante anos, os sites argumentaram que a violação de seus termos de serviço constituía uma ultrapassagem do acesso autorizado.
Se essa interpretação tivesse prevalecido, muitos comportamentos comuns seriam considerados crimes federais. Usar um computador do trabalho para verificar resultados esportivos. Criar uma segunda conta, contrariando as regras de um site. Enviar uma solicitação automatizada a uma página para a qual o site determinou que não se deveria utilizar automação. Durante anos, os tribunais permaneceram divididos quanto ao alcance da lei.
Portanto, o mito não é tão absurdo assim. Ele teve origem em uma disputa jurídica real, que se reduziu bastante desde 2021, embora algumas questões ainda estejam em aberto e a decisão do recurso principal tenha validade apenas para a Nona Circunscrição.
O que a Suprema Corte decidiu no caso Van Buren?
Em junho de 2021, em Van Buren contra os Estados Unidos, a Suprema Corte decidiu, por 6 votos a 3, que a expressão “acesso não autorizado” abrange o acesso a partes de um sistema de computador às quais o usuário não tem permissão para acessar, e não o uso indevido de informações que já lhe estavam permitidas (Parecer da Suprema Corte, 2021). O Tribunal descreveu isso como uma análise do tipo “portões abertos ou fechados”.
O contexto é que faz a maior parte do trabalho. A questão não é “o senhor infringiu alguma regra estabelecida pelo site?”. É “o portão estava aberto para o senhor?”. Uma página de login é um portão. Uma senha é um portão. Uma página que qualquer pessoa pode carregar em um navegador não é.
Observe o que isso significa na prática. Uma vez que Van Buren, os tribunais têm tratado a autenticação — seja um login ou uma senha — como o exemplo mais claro de um “portão fechado”. A Suprema Corte deixou em aberto, em uma nota de rodapé, se os termos contratuais ou as políticas, por si só, podem fechar tal portão. Ainda assim, “existe um login entre mim e esses dados?” é uma pergunta que a maioria das equipes de engenharia consegue realmente responder, o que é mais do que se pode dizer da maioria dos termos de serviço.
hiQ x LinkedIn: as páginas públicas não têm restrição de acesso
A hiQ Labs coletou perfis públicos do LinkedIn para elaborar análises sobre a força de trabalho, e o LinkedIn enviou uma carta de notificação de cessação e desistência. Após Van Buren, a Suprema Corte remeteu o caso de volta à instância inferior. Em abril de 2022, o Nono Circuito decidiu que, quando um site disponibiliza dados ao público, “esse computador não ergueu, para começar, nenhuma barreira para levantar ou abaixar” (Decisão do Nono Circuito, 2022).
Em termos simples, a leitura de páginas públicas, mesmo com o uso de ferramentas automatizadas e mesmo após ter sido solicitado que se parasse, provavelmente não constituiria uma violação da CFAA. É essa decisão que as pessoas costumam citar.
É também nesse ponto que a história geralmente é interrompida.
Por que a hiQ continuou a pagar ao LinkedIn: contrato e conduta
Porque a hiQ não perdeu por causa de um ataque cibernético. Perdeu por questões contratuais e de conduta. Em novembro de 2022, o tribunal distrital concluiu que a hiQ havia violado o Acordo de Usuário do LinkedIn, em parte porque prestadores de serviços que trabalhavam para a hiQ criaram perfis falsos no LinkedIn. Em dezembro de 2022, as partes apresentaram uma proposta de sentença de consentimento que incluía uma indenização de US$ 500.000 contra a hiQ e exigia que ela excluisse os dados do LinkedIn que mantinha (pauta do tribunal distrital, 2022; Revista Nacional de Direito, 2022; Morgan Lewis, 2022).
Eis a lição que a maioria dos resumos deixa passar. As contas falsas e o fato de que a própria hiQ havia concordado com o Termo de Uso do LinkedIn eram o problema. Ao criar uma conta, o usuário aceita os termos. Criar uma conta com identidade falsa é como atravessar um portão com uma chave que você mesmo inventou.
É importante se o senhor está conectado?
Sim, e um caso de 2024 deixou isso bem claro. Em janeiro de 2024, em Meta contra Bright Data, o juiz Edward Chen, do Distrito Norte da Califórnia, concedeu uma sentença sumária à Bright Data. Ele concluiu que os termos de uso do Facebook e do Instagram não proíbem a coleta de dados públicos quando o usuário está desconectado (decisão judicial, 2024; Alerta aos clientes da Quinn Emanuel, 2024).
O tribunal argumentou que um visitante que não está conectado não está agindo como um “usuário” sujeito a esses termos. Além disso, rejeitou a interpretação da Meta de que seus termos proíbem a coleta de dados públicos para sempre, mesmo após o encerramento de uma conta.
Ao colocar os três casos lado a lado, surge um padrão simples:
Então, quais são as regras reais para a obtenção de dados públicos?
Encarar a questão do hacking sob a ótica da lei é, em grande parte, uma abordagem equivocada. As regras que realmente moldam o tratamento dos dados na web são os contratos (o senhor concordou com os termos?), os direitos autorais (o que o senhor está fazendo com o conteúdo?) e as leis de privacidade, como o GDPR da UE (os dados identificam pessoas?). A coleta de dados pessoais de uma página pública ainda pode acionar obrigações de privacidade, mesmo quando nada relacionado ao acesso foi ilegal.
Uma lista de verificação prática para equipes:
- Permanecer sem fazer login a menos que o senhor tenha o direito expresso de utilizar uma conta para esse fim.
- Nunca crie contas falsas para acessar os dados. Essa conduta foi determinante para o prejuízo sofrido pela hiQ.
- Não contorne as barreiras técnicas. Uma barreira de login ou senha é um portão fechado.
- Verifique o que o(a) senhor(a) está colecionando. Os dados pessoais acarretam obrigações em matéria de privacidade.
- Verifique o que o senhor está fazendo com isso. A republicação de conteúdo protegido por direitos autorais levanta questões diferentes daquelas relacionadas à sua leitura.
- Leia o arquivo robots.txt e mantenha o volume de solicitações dentro de limites razoáveis. O arquivo robots.txt não constitui uma barreira nos termos da CFAA, mas os proprietários de sites consideram que ignorá-lo ou sobrecarregar um site é um sinal de má-fé. Não prejudique o site que o senhor está lendo.
As equipes que evitam problemas costumam definir suas regras por escrito antes de desenvolver qualquer coisa: quais dados coletam, por quê e o que nunca farão para obtê-los. As melhores vão um passo além e colocam essas regras em um local onde um script não possa ignorá-las. Uma lista de “proibições” que fica na camada de proxy, por exemplo, bloqueia uma solicitação imediatamente, em vez de depender de que todos os engenheiros se lembrem de uma página da wiki.
Para saber como essas questões se aplicam especificamente a disputas relacionadas ao treinamento de IA, consulte Os processos judiciais relacionados aos dados de treinamento de IA que toda equipe de dados da web deveria conhecer. Para conhecer outro mito abordado nesta série, leia por que um número maior de endereços IP não resulta em uma rede de proxy melhor.
A rede que o senhor utiliza também faz parte da conformidade
A forma como o senhor acessa páginas públicas também faz parte de sua história de conformidade. Uma rede residencial construída a partir de dispositivos sequestrados acrescenta um problema que o senhor não criou. A rede da Massive é composta por dispositivos reais de consumidores cujos proprietários optaram por participar por meio do SDK da Massive, e a Massive concluiu uma auditoria SOC 2 Tipo I, estando a auditoria Tipo 2 em andamento; ambas estão listadas no Centro de Confiança Massive. Para saber quais perguntas fazer a qualquer fornecedor, consulte SOC 2 e GDPR: o que perguntar a um fornecedor de proxies residenciais.
O Access ainda apresenta limitações. O Massive bloqueia determinadas categorias de conteúdo na camada de rede para todas as contas, e cada conta Residencial pode adicionar até 1.000 domínios à sua própria lista de domínios bloqueados. Uma solicitação bloqueada é devolvida como 452 Disallowed Content em vez de passar por isso. Os detalhes sobre como funciona a adesão voluntária estão em Como funciona a rede de opt-in da Massive.
Conclusão
- Hackear significa passar por um portão fechado. Extrair dados de uma página pública não significa isso.
- Van Buren (2021) estabeleceu o teste de “gates”, e o Nono Circuito o aplicou a páginas públicas em hiQ (2022).
- A hiQ ainda saiu perdendo, devido a contas falsas e aos termos do contrato.
- Meta contra Bright Data (2024) demonstrou que o acesso ao acervo por usuários não conectados ocorre em um local diferente daquele em que ocorre o uso por usuários conectados.
- As regras de fato são os contratos, os direitos autorais e a privacidade. Planejem-se para lidar com elas.
Fontes
- Suprema Corte dos Estados Unidos, Van Buren contra os Estados Unidos, n.º 19-783 (2021)
- Tribunal de Apelações dos Estados Unidos para o Nono Circuito, hiQ Labs, Inc. contra LinkedIn Corp., n.º 17-16783 (18 de abril de 2022)
- Revista Nacional de Direito, "hiQ e LinkedIn chegam a um acordo proposto em caso histórico de extração de dados" (2022)
- Morgan Lewis, "LinkedIn x hiQ: processo histórico sobre extração de dados oferece orientações" (2022)
- Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia, hiQ Labs, Inc. contra LinkedIn Corp., Processo nº 3:17-cv-03301-EMC, decisão sobre as requisições recíprocas de julgamento sumário (4 de novembro de 2022)
- Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia, Meta Platforms, Inc. contra Bright Data Ltd., Processo nº 3:23-cv-00077-EMC, decisão que defere o pedido de julgamento sumário da Bright Data (23 de janeiro de 2024)
- Quinn Emanuel, "Meta contra Bright Data: decisão significativa para o setor de web scraping" (2024)
Perguntas frequentes
Este é o desafio de 2021 para a Suprema Corte, proveniente de Van Buren. Você excede o acesso autorizado nos termos da CFAA ao acessar partes de um sistema às quais não tem acesso, como áreas restritas que exigem um login para o qual você não tem permissão. O uso indevido de informações que você já pudesse visualizar não se enquadra nessa definição.
Em novembro de 2022, um tribunal determinou que a hiQ violou o Acordo de Usuário do LinkedIn, inclusive por meio de perfis falsos criados por seus prestadores de serviços. A proposta de sentença de consentimento de dezembro de 2022 previa uma indenização de US$ 500.000 contra a hiQ. O prejuízo decorreu do contrato e da conduta da empresa, e não da leitura de páginas públicas.
Sim, é possível. O GDPR abrange dados pessoais, sejam eles públicos ou não, e pode se aplicar a empresas fora da UE que monitoram pessoas na UE. Equipes que coletam nomes, perfis ou dados de contato precisam de uma base legal e de um plano para a minimização de dados.
