Una verja de jardín de hierro forjado abierta junto a una puerta de caja fuerte de acero cerrada con llave sobre un fondo oscuro, con una iluminación naranja en los bordes, lo que contrasta el acceso público con los sistemas cerrados con llave.
Todas las entradas

Desmontando mitos: el «scraping» y el «hacking» no son lo mismo

Franklin Uche
Franklin Uche · Community Lead
Abrir markdown

«¿No es eso, en esencia, piratería informática?» Es una de las preguntas más habituales que se le plantean a cualquiera que realice web scraping a gran escala. La respuesta sincera es no. La piratería informática consiste en acceder a un sistema al que no se tiene permiso para acceder. Recuperar una página web pública significa leer algo que el sitio ya muestra a cualquier persona que disponga de un navegador. En los últimos cinco años, el Tribunal Supremo de los Estados Unidos y el Noveno Circuito han establecido esa distinción en casos reales. Sin embargo, que «no sea piratería informática» no significa que «no haya normas», y esos mismos casos muestran dónde se sitúan los límites reales.

Puntos clave
  • En 2021, el Tribunal Supremo de los Estados Unidos interpretó la ley federal contra la piratería informática (la CFAA) como una cuestión de «acceso permitido o denegado»: ¿se le permite acceder a esta parte del sistema o no? (Van Buren contra los Estados Unidos, 2021).
  • En 2022, el Noveno Circuito dictaminó que las páginas de acceso público «no han establecido ninguna barrera de acceso», por lo que su lectura probablemente no constituya un acceso «sin autorización» (hiQ contra LinkedIn, 2022).
  • Los contratos, las cuentas falsas, los derechos de autor y la legislación sobre privacidad siguen siendo de aplicación. Es en esos ámbitos donde realmente se ganan o se pierden los casos relacionados con los datos web.

En esta entrada se explican las sentencias judiciales públicas dirigidas a un público general. No constituye asesoramiento jurídico, y la legislación varía según el país.

¿Por qué la gente piensa que el «scraping» es piratería informática?

La confusión radica principalmente en el vocabulario. Ambos implican scripts automatizados, ambos se producen a gran escala y ambos aparecen en titulares sobre «bots». La Ley de Fraude y Abuso Informático de EE. UU. (CFAA), aprobada en 1986, tipificó como delito el acceso a un ordenador «sin autorización» o «exceder el acceso autorizado». Durante años, los sitios web sostuvieron que incumplir sus condiciones de servicio se consideraba un exceso del acceso autorizado.

Si esa interpretación se hubiera mantenido, muchas conductas cotidianas constituirían un delito federal. Utilizar un ordenador del trabajo para consultar resultados deportivos. Crear una segunda cuenta incumpliendo las normas de un sitio web. Enviar una solicitud automatizada a una página en la que el sitio web indicaba que no se debía utilizar la automatización. Durante años, los tribunales se mostraron divididos sobre el alcance de la ley.

Así pues, el mito no es descabellado. Tiene su origen en un litigio real, que se ha reducido considerablemente desde 2021, aunque aún quedan algunas cuestiones pendientes y la sentencia clave en apelación solo es vinculante para el Noveno Circuito.

¿Qué resolvió el Tribunal Supremo en el caso Van Buren?

En junio de 2021, en Van Buren contra los Estados Unidos, el Tribunal Supremo dictaminó, por 6 votos contra 3, que la expresión «acceso no autorizado» se refiere al hecho de acceder a partes de un sistema informático a las que no se tiene acceso, y no al uso indebido de información a la que ya se tenía acceso (Sentencia del Tribunal Supremo, 2021). El Tribunal describió esto como un análisis de «si las puertas están abiertas o cerradas».

El contexto es lo que marca la diferencia. La pregunta no es «¿ha infringido alguna norma establecida por el sitio web?», sino «¿tenía usted acceso a dicha página?». Una página de inicio de sesión es una barrera. Una contraseña es una barrera. Una página que cualquiera puede cargar en un navegador no lo es.

Fíjese en lo que esto significa en la práctica. Dado que Van Buren, los tribunales han considerado que la autenticación —ya sea un nombre de usuario o una contraseña— constituye el ejemplo más claro de una «puerta cerrada». El Tribunal Supremo dejó sin resolver, en una nota al pie, si las condiciones contractuales o las políticas por sí solas pueden cerrarla. Aun así, «¿existe un nombre de usuario entre usted y estos datos?» es una pregunta que la mayoría de los equipos de ingeniería pueden responder, lo cual es más de lo que se puede decir de la mayoría de las condiciones de uso.

hiQ contra LinkedIn: las páginas públicas no tienen restricción de acceso

hiQ Labs recopiló perfiles públicos de LinkedIn para elaborar análisis sobre la plantilla, y LinkedIn le envió una carta de cese y desistimiento. Tras Van Buren, el Tribunal Supremo devolvió el caso a la instancia inferior. En abril de 2022, el Noveno Circuito sostuvo que, cuando un sitio web pone datos a disposición del público, «ese ordenador no ha levantado ni bajado ninguna barrera en primer lugar» (Sentencia del Noveno Circuito, 2022).

En términos sencillos, leer páginas públicas, incluso con herramientas automatizadas e incluso tras haber recibido la orden de dejar de hacerlo, difícilmente constituiría una infracción de la CFAA. Es la sentencia que se suele citar.

Además, suele ser ahí donde la historia se trunca.

Por qué hiQ siguió pagando a LinkedIn: el contrato y la conducta

Porque hiQ no perdió por un ataque informático. Perdió por incumplimiento contractual y conducta indebida. En noviembre de 2022, el tribunal de distrito determinó que hiQ había incumplido el Acuerdo de usuario de LinkedIn, en parte porque los contratistas que trabajaban para hiQ crearon perfiles falsos en LinkedIn. En diciembre de 2022, las partes presentaron una propuesta de sentencia de conformidad que incluía una condena de 500 000 dólares contra hiQ y le obligaba a eliminar los datos de LinkedIn que tenía en su poder (expediente del tribunal de distrito, 2022; Revista Nacional de Derecho, 2022; Morgan Lewis, 2022).

Esta es la lección que la mayoría de los resúmenes pasan por alto. El problema radicaba en las cuentas falsas y en el hecho de que la propia hiQ había aceptado las Condiciones de uso de LinkedIn. En cuanto se crea una cuenta, se aceptan las condiciones. Si se crea una con una identidad falsa, es como si se hubiera atravesado una puerta con una llave inventada.

¿Importa si ha iniciado sesión?

Sí, y un caso de 2024 lo dejó claro. En enero de 2024, en Meta contra Bright Data, el juez Edward Chen, del Distrito Norte de California, dictó sentencia sumaria a favor de Bright Data. Consideró que las condiciones de uso de Facebook e Instagram no prohibían la recopilación de datos públicos mientras se estuviera desconectado (resolución judicial, 2024; Aviso a los clientes de Quinn Emanuel, 2024).

El tribunal argumentó que un visitante que no ha iniciado sesión no actúa como un «usuario» sujeto a dichas condiciones. Asimismo, rechazó la interpretación de Meta según la cual sus condiciones prohibían la recopilación de datos públicos de forma indefinida, incluso después de que se hubiera cerrado una cuenta.

Si se comparan los tres casos uno al lado del otro, se aprecia un patrón sencillo:

Situation CFAA "hacking" risk Contract risk
Reading public pages, logged out Low after Van Buren and hiQ Lower: one court held Meta's terms didn't cover it
Reading pages behind your own login Depends on what your account allows Higher: you agreed to the terms
Using fake accounts to get behind a login Higher High, as hiQ found
Getting around a password or technical barrier High: that's a closed gate High

Entonces, ¿cuáles son las normas reales para obtener datos públicos?

Enfocar la cuestión del «hacking» desde el punto de vista jurídico suele ser un error. Las normas que realmente regulan el tratamiento de los datos en la web son los contratos (¿ha aceptado usted los términos?), los derechos de autor (¿qué está haciendo con el contenido?) y la legislación en materia de privacidad, como el RGPD de la UE (¿permiten los datos identificar a personas?). La recopilación de datos personales de una página pública puede dar lugar a obligaciones en materia de privacidad, incluso cuando el acceso no haya sido ilegal en modo alguno.

Una lista de comprobación práctica para los equipos:

  1. Mantener la sesión cerrada a menos que tenga un derecho claro a utilizar una cuenta con este fin.
  2. Nunca cree cuentas falsas para acceder a los datos. Esa conducta fue determinante en las pérdidas sufridas por hiQ.
  3. No eluda las barreras técnicas. Una pantalla de inicio de sesión o una contraseña es una puerta cerrada.
  4. Compruebe lo que está coleccionando. Los datos personales conllevan obligaciones en materia de privacidad.
  5. Compruebe cómo lo está utilizando. La republicación de contenidos protegidos por derechos de autor plantea cuestiones distintas a las que plantea su lectura.
  6. Lea el archivo robots.txt y mantenga un volumen de solicitudes razonable. El archivo robots.txt no constituye un obstáculo en virtud de la CFAA, pero los propietarios de los sitios web consideran que ignorarlo o saturar un sitio web es una señal de mala fe. No degrade el sitio web que está leyendo.

Los equipos que evitan meterse en problemas suelen plasmar por escrito sus normas antes de desarrollar nada: qué datos recopilan, por qué y qué es lo que nunca harán para obtenerlos. Los mejores van un paso más allá y colocan esas normas en un lugar donde un script no pueda ignorarlas. Una lista de «prohibiciones» ubicada en la capa de proxy, por ejemplo, detiene una solicitud de raíz, en lugar de depender de que cada ingeniero recuerde una página wiki.

Para conocer cómo se plantean estas cuestiones, concretamente en los litigios relacionados con el entrenamiento de la IA, véase Los litigios relacionados con los datos de entrenamiento de la IA que todo equipo de datos web debería conocer. Para conocer otro mito que se ha abordado en esta serie, lea ¿Por qué un mayor número de direcciones IP no garantiza una mejor red de proxy?.

La red que utiliza también forma parte del cumplimiento normativo

La forma en que accede a las páginas públicas también forma parte de su historial de cumplimiento normativo. Una red residencial creada a partir de dispositivos secuestrados supone un problema que usted no ha generado. La red de Massive está compuesta por dispositivos reales de consumidores cuyos propietarios han dado su consentimiento a través del SDK de Massive, y Massive ha superado una auditoría SOC 2 de Tipo I, estando en curso la de Tipo II; ambas figuran en el Centro de confianza a gran escala. Para conocer las preguntas que debe plantear a cualquier proveedor, consulte SOC 2 y el RGPD: qué preguntar a un proveedor de proxies residenciales.

El acceso sigue teniendo limitaciones. Massive bloquea determinadas categorías de contenido en la capa de red para todas las cuentas, y cada cuenta residencial puede añadir hasta 1.000 dominios a su propia lista de dominios bloqueados. Una solicitud bloqueada se devuelve como 452 Disallowed Content en lugar de pasar por ello. Los detalles sobre el funcionamiento del sistema de suscripción voluntaria se encuentran en Cómo funciona la red de suscripción voluntaria de Massive.

En resumen

  • El «hacking» consiste en sortear una puerta cerrada. Extraer datos de una página pública no lo es.
  • Van Buren (2021) estableció el criterio de «gates», y el Noveno Circuito lo aplicó a las páginas públicas en hiQ (2022).
  • hiQ sigue perdiendo terreno, debido a las cuentas falsas y a las condiciones contractuales.
  • Meta contra Bright Data (2024) puso de manifiesto que el acceso sin iniciar sesión se produce en un lugar distinto al del uso con sesión iniciada.
  • Las normas que realmente importan son las relativas a los contratos, los derechos de autor y la privacidad. Téngalas en cuenta.

Fuentes

Preguntas frecuentes

¿Es ilegal el web scraping en EE. UU.?+

Recopilar páginas de acceso público no suele constituir un delito en virtud de la CFAA, al menos en el Noveno Circuito, tras Van Buren (2021) y la sentencia del Noveno Circuito de 2022 hiQ contra LinkedIn sentencia. La legislación en materia de contratos, derechos de autor y protección de datos puede seguir siendo de aplicación, dependiendo de cómo acceda a los datos y del uso que haga de ellos.

¿Qué significa «gates-up-or-down»?+

Es la prueba de 2021 del Tribunal Supremo de Van Buren. Se considera que se excede el acceso autorizado en virtud de la CFAA al acceder a partes de un sistema a las que no tiene acceso, como las áreas que se encuentran tras un inicio de sesión para el que no tiene autorización. El uso indebido de información a la que ya tenía acceso no se considera una infracción.

¿Por qué perdió hiQ si la extracción de datos públicos no es piratería informática?+

En noviembre de 2022, un tribunal dictaminó que hiQ había incumplido el Acuerdo de usuario de LinkedIn, entre otras cosas, mediante perfiles falsos creados por sus contratistas. La propuesta de sentencia de conformidad de diciembre de 2022 incluía una indemnización de 500 000 dólares a cargo de hiQ. La indemnización se derivaba del incumplimiento del contrato y de la conducta de la empresa, y no de la consulta de páginas públicas.

¿Se aplica el RGPD a los datos públicos disponibles en Internet?+

Sí, es posible. El RGPD se aplica a los datos personales, sean o no públicos, y puede afectar a empresas situadas fuera de la UE que realicen un seguimiento de personas en la UE. Los equipos que recopilen nombres, perfiles o datos de contacto deben contar con una base jurídica y un plan de minimización de datos.