# Desmontando mitos: el scraping y el hacking no son lo mismo

«¿No es eso, básicamente, hacking?» Es una de las preguntas más habituales que se le plantean a cualquiera que realice scraping web a gran escala. La respuesta sincera es no. El hacking consiste en acceder a un sistema al que no se tiene permiso de acceso. Recuperar una página web pública significa leer algo que el sitio ya muestra a cualquier persona que disponga de un navegador. En los últimos cinco años, el Tribunal Supremo de los Estados Unidos y el Noveno Circuito han establecido esa distinción en casos reales. Sin embargo, que «no sea piratería informática» no significa que «no haya normas», y esos mismos casos muestran dónde se sitúan los límites reales.

> **Puntos clave**
>
> - En 2021, el Tribunal Supremo de los Estados Unidos interpretó la ley federal contra el hacking (la CFAA) como una cuestión de «puertas abiertas o cerradas»: ¿se le permite el acceso a esta parte del sistema o no? ([Van Buren contra Estados Unidos](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf), 2021).
> - En 2022, el Noveno Circuito sostuvo que las páginas abiertas al público «no han erigido barreras», por lo que consultarlas probablemente no constituya un acceso «sin autorización» ([hiQ contra LinkedIn](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf), 2022).
> - Los contratos, las cuentas falsas, los derechos de autor y la legislación sobre privacidad siguen siendo de aplicación. Es en estos ámbitos donde realmente se ganan o se pierden los casos relacionados con los datos web.

*Esta publicación explica sentencias judiciales públicas para un público general. No constituye asesoramiento jurídico, y la legislación varía según el país.*

## ¿Por qué se considera que el «scraping» es piratería informática?

La confusión se debe principalmente a la terminología. Ambos implican scripts automatizados, ambos se producen a gran escala y ambos aparecen en titulares sobre «bots». La Ley de Fraude y Abuso Informático de EE. UU. (CFAA), aprobada en 1986, tipificó como delito el acceso a un ordenador «sin autorización» o «exceder el acceso autorizado». Durante años, los sitios web argumentaron que incumplir sus condiciones de servicio equivalía a exceder el acceso autorizado.

Si esa interpretación se hubiera mantenido, muchos comportamientos cotidianos constituirían un delito federal. Utilizar un ordenador del trabajo para consultar resultados deportivos. Crear una segunda cuenta infringiendo las normas de un sitio web. Enviar una solicitud automatizada a una página en la que el sitio web indicaba que no se debía automatizar. Durante años, los tribunales estuvieron divididos sobre el alcance de la ley.

Por lo tanto, el mito no es descabellado. Tiene su origen en una disputa jurídica real, que se ha reducido considerablemente desde 2021, aunque algunas cuestiones siguen sin resolverse y la sentencia clave del recurso de apelación solo es vinculante para el Noveno Circuito.

## ¿Qué decidió el Tribunal Supremo en el caso Van Buren?

En junio de 2021, en el caso *Van Buren contra Estados Unidos*, el Tribunal Supremo dictaminó por 6 votos contra 3 que la expresión «acceso no autorizado» abarca el acceso a partes de un sistema informático a las que no se tiene acceso, y no el uso indebido de información a la que ya se tenía acceso ([Dictamen del Tribunal Supremo](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf), 2021). El Tribunal describió esto como una investigación de «puertas abiertas o cerradas».

El enfoque es lo que marca la diferencia. La pregunta no es «¿infringió usted una norma establecida por el sitio?», sino «¿estaba la puerta abierta para usted?». Una pantalla de inicio de sesión es una puerta. Una contraseña es una puerta. Una página que cualquiera puede cargar en un navegador no lo es.

<!-- [PERSPECTIVA ÚNICA] -->
Fíjese en lo que esto significa en la práctica. Desde el caso *Van Buren*, los tribunales han considerado la autenticación —un inicio de sesión o una contraseña— como el ejemplo más claro de una puerta cerrada. El Tribunal Supremo dejó abierta, en una nota al pie, la cuestión de si los términos contractuales o las políticas por sí solos pueden cerrar una. Aun así, «¿existe un inicio de sesión entre usted y estos datos?» es una pregunta que la mayoría de los equipos de ingeniería pueden responder realmente, lo cual es más de lo que se puede decir de la mayoría de los términos de servicio.

## hiQ contra LinkedIn: las páginas públicas carecen de «puerta»

hiQ Labs recopiló perfiles públicos de LinkedIn para elaborar análisis sobre la población activa, y LinkedIn envió una carta de cese y desistimiento. Tras el caso *Van Buren*, el Tribunal Supremo devolvió el asunto a la instancia inferior. En abril de 2022, el Noveno Circuito sostuvo que, cuando un sitio pone datos a disposición del público, «ese ordenador no ha erigido, en primer lugar, ninguna barrera que se pueda levantar o bajar» ([Dictamen del Noveno Circuito](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf), 2022).

En términos sencillos, consultar páginas públicas, incluso con herramientas automatizadas e incluso tras haber recibido la orden de cesar, no constituía probablemente una infracción de la CFAA. Es la sentencia que se suele citar.

También es aquí donde la historia suele quedarse a medias.

## Por qué hiQ tuvo que pagar a LinkedIn: el contrato y la conducta

Porque hiQ no perdió por piratería informática. Perdió por cuestiones relacionadas con el contrato y la conducta. En noviembre de 2022, el tribunal de distrito determinó que hiQ había incumplido el Acuerdo de usuario de LinkedIn, en parte porque los contratistas que trabajaban para hiQ crearon perfiles falsos en LinkedIn. En diciembre de 2022, las partes presentaron una propuesta de sentencia de conformidad que incluía una condena de 500 000 dólares contra hiQ y le obligaba a eliminar los datos de LinkedIn que tenía en su poder ([expediente del tribunal de distrito](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/), 2022; [National Law Review](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case), 2022; [Morgan Lewis](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators), 2022).

He aquí la lección que la mayoría de los resúmenes pasan por alto. El problema radicaba en las cuentas falsas y en el hecho de que la propia hiQ hubiera aceptado el Acuerdo de usuario de LinkedIn. En cuanto se dispone de una cuenta, se han aceptado las condiciones. Crear una con una identidad falsa equivale a atravesar una puerta con una llave que uno mismo se ha inventado.

## ¿Importa si se ha iniciado sesión?

Sí, y un caso de 2024 lo dejó claro. En enero de 2024, en el caso *Meta contra Bright Data*, el juez Edward Chen, del Distrito Norte de California, dictó sentencia sumaria a favor de Bright Data. Consideró que las condiciones de Facebook e Instagram no prohibían la recopilación de datos públicos mientras no se estuviera conectado ([resolución judicial](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf), 2024; [alerta a clientes de Quinn Emanuel](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/), 2024).

El tribunal razonó que un visitante que ha cerrado sesión no actúa como un «usuario» sujeto a dichos términos. Asimismo, rechazó la interpretación de Meta de que sus términos prohibían la recopilación de datos públicos de forma indefinida, incluso después de que se hubiera cerrado una cuenta.

Si se comparan los tres casos, se aprecia un patrón claro:

| Situación | Riesgo de «piratería informática» según la CFAA | Riesgo contractual |
|-----------|--------------------|---------------|
| Lectura de páginas públicas sin haber iniciado sesión | Bajo tras *Van Buren* y *hiQ* | Menor: un tribunal consideró que las condiciones de Meta no lo cubrían |
| Lectura de páginas tras haber iniciado sesión con su propia cuenta | Depende de lo que permita su cuenta | Mayor: usted aceptó las condiciones |
| Uso de cuentas falsas para acceder a contenidos protegidos | Mayor | Alto, tal y como se constató en el caso *hiQ* |
| Eludir una contraseña o una barrera técnica | Alto: se trata de una puerta cerrada | Alto |

## Entonces, ¿cuáles son las normas reales para la obtención de datos públicos?

La legislación sobre piratería informática suele ser un enfoque erróneo. Las normas que realmente rigen el trabajo con datos web son los contratos (¿ha aceptado los términos?), los derechos de autor (¿qué está haciendo con el contenido?) y la legislación sobre privacidad, como el RGPD de la UE (¿los datos identifican a personas?). La recopilación de datos personales de una página pública puede seguir dando lugar a obligaciones en materia de privacidad, incluso cuando el acceso no haya sido ilegal en modo alguno.

Una lista de comprobación práctica para los equipos:

1. **Manténgase desconectado** a menos que tenga un derecho claro a utilizar una cuenta para este fin.
2. **Nunca cree cuentas falsas** para acceder a los datos. Esa conducta fue fundamental en la derrota de hiQ.
3. **No eluda las barreras técnicas.** Una pantalla de inicio de sesión o una contraseña son una puerta cerrada.
4. **Compruebe qué datos está recopilando.** Los datos personales conllevan obligaciones en materia de privacidad.
5. **Compruebe qué está haciendo con ellos.** La republicación de contenido protegido por derechos de autor plantea cuestiones distintas a las que plantea su mera lectura.
6. **Lea el archivo robots.txt y mantenga un volumen de solicitudes razonable.** El archivo robots.txt no es una barrera de la CFAA, pero los propietarios de los sitios web consideran que ignorarlo o saturar un sitio con solicitudes es una señal de mala fe. No degrade el sitio que está consultando.

<!-- [PERSPECTIVA ÚNICA] -->
Los equipos que evitan problemas suelen establecer sus normas por escrito antes de desarrollar nada: qué datos recopilan, por qué y qué es lo que nunca harán para obtenerlos. Los mejores van un paso más allá y colocan esas reglas donde un script no pueda ignorarlas. Una lista de «prohibidos» ubicada en la capa de proxy, por ejemplo, detiene una solicitud de raíz, en lugar de depender de que cada ingeniero recuerde una página wiki.

Para saber cómo se plantean estas cuestiones específicamente en las disputas sobre el entrenamiento de la IA, consulte [los litigios sobre datos de entrenamiento de IA que todo equipo de datos web debería conocer](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers). Para conocer otro mito que se ha abordado en esta serie, lea [por qué un mayor número de direcciones IP no garantiza una mejor red de proxy](https://www.joinmassive.com/blog/myth-more-ips-better-proxy-network).

## La red que utiliza también forma parte del cumplimiento normativo

La forma en que accede a las páginas públicas también forma parte de su historial de cumplimiento normativo. Una red residencial construida a partir de dispositivos secuestrados añade un problema que usted no ha creado. La red de Massive está compuesta por dispositivos reales de consumidores cuyos propietarios han dado su consentimiento a través del SDK de Massive, y Massive ha superado una auditoría SOC 2 de Tipo I, estando en curso la de Tipo II; ambas figuran en el [Centro de Confianza de Massive](https://trust.joinmassive.com). Para conocer las preguntas que debe plantear a cualquier proveedor, consulte [SOC 2 y el RGPD: qué preguntar a un proveedor de proxies residenciales](https://www.joinmassive.com/blog/proxy-vendor-compliance-soc2-gdpr).

El acceso sigue teniendo limitaciones. Massive bloquea determinadas categorías de contenido en la capa de red para todas las cuentas, y cada cuenta residencial puede añadir hasta 1.000 dominios a su propia [lista de dominios bloqueados](https://docs.joinmassive.com/residential/domain-blocking). Una solicitud bloqueada devuelve el código `452 Disallowed Content` en lugar de procesarse. Los detalles sobre el funcionamiento del sistema de participación voluntaria se encuentran en [cómo funciona la red de participación voluntaria de Massive](https://www.joinmassive.com/blog/how-massives-opt-in-network-works).

## Preguntas frecuentes

La recopilación de páginas de acceso público no suele constituir un delito en virtud de la CFAA, al menos en el Noveno Circuito, tras el caso *Van Buren* (2021) y la sentencia del Noveno Circuito de 2022 en el caso *hiQ contra LinkedIn*. No obstante, la legislación en materia de contratos, derechos de autor y privacidad puede seguir siendo aplicable en función de cómo acceda a los datos y del uso que haga de ellos.

### ¿Qué significa «gates-up-or-down»?

Se trata del criterio establecido por el Tribunal Supremo en 2021 en el caso *Van Buren*. Se excede el acceso autorizado en virtud de la CFAA al entrar en partes de un sistema a las que no tiene acceso, como áreas protegidas por un inicio de sesión al que no tiene derecho. El uso indebido de información a la que ya tenía acceso no cuenta.

### ¿Por qué perdió hiQ si la extracción de datos públicos no constituye piratería informática?

En noviembre de 2022, un tribunal determinó que hiQ había incumplido el Acuerdo de usuario de LinkedIn, entre otras cosas, mediante perfiles falsos creados por sus contratistas. La propuesta de sentencia de conformidad de diciembre de 2022 incluía una multa de 500 000 dólares contra hiQ. La derrota se debió al incumplimiento del contrato y a la conducta, no a la consulta de páginas públicas.

### ¿Se aplica el RGPD a los datos públicos de la web?

Puede aplicarse. El RGPD ampara los datos personales, sean públicos o no, y puede afectar a empresas fuera de la UE que realicen un seguimiento de personas en la UE. Los equipos que recopilen nombres, perfiles o datos de contacto necesitan una base legal y un plan de minimización de datos.

## Conclusión

- El «hacking» implica traspasar una barrera cerrada. El «scraping» de una página pública no lo hace.
- El caso *Van Buren* (2021) estableció el «criterio de las barreras», y el Noveno Circuito lo aplicó a las páginas públicas en el caso *hiQ* (2022).
- *hiQ* perdió el caso, debido a las cuentas falsas y a las condiciones contractuales.
- *Meta contra Bright Data* (2024) demostró que la recopilación de datos sin haber iniciado sesión se sitúa en un plano distinto al uso tras haber iniciado sesión.
- Las normas reales son el contrato, los derechos de autor y la privacidad. Prepárese para ellas.

## Fuentes

- Tribunal Supremo de los Estados Unidos, [*Van Buren contra Estados Unidos*, n.º 19-783 (2021)](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf)
- Tribunal de Apelación de los Estados Unidos para el Noveno Circuito, [*hiQ Labs, Inc. contra LinkedIn Corp.*, n.º 17-16783 (18 de abril de 2022)](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf)
- National Law Review, [«hiQ y LinkedIn alcanzan un acuerdo propuesto en un caso histórico sobre la extracción de datos»](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case) (2022)
- Morgan Lewis, [«LinkedIn contra hiQ: una demanda histórica sobre la extracción de datos ofrece orientación»](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators) (2022)
- Tribunal de Distrito de los Estados Unidos para el Distrito Norte de California, [*hiQ Labs, Inc. contra LinkedIn Corp.*, n.º 3:17-cv-03301-EMC, auto sobre las mociones cruzadas de sentencia sumaria (4 de noviembre de 2022)](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/)
- Tribunal de Distrito de los Estados Unidos para el Distrito Norte de California, [*Meta Platforms, Inc. contra Bright Data Ltd.*, n.º 3:23-cv-00077-EMC, auto por el que se estima la solicitud de sentencia sumaria presentada por Bright Data (23 de enero de 2024)](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf)
- Quinn Emanuel, [«Meta contra Bright Data: una decisión significativa para el sector del web scraping»](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/) (2024)
