Un portail de jardin en fer forgé ouvert, à côté d'une porte de chambre forte en acier verrouillée, sur un fond sombre avec un éclairage périphérique orange, mettant en contraste l'accès public et les systèmes verrouillés.
Tous les articles

Démystification : le « scraping » et le « hacking » ne sont pas la même chose

Franklin Uche
Franklin Uche · Community Lead
Ouvrir le markdown

« N'est-ce pas, au fond, du piratage ? » C'est l'une des questions les plus courantes que l'on pose à toute personne pratiquant le web scraping à grande échelle. La réponse honnête est non. Le piratage consiste à s'introduire dans un système auquel on n'a pas accès. Récupérer une page web publique revient à lire des informations que le site affiche déjà à toute personne disposant d’un navigateur. Au cours des cinq dernières années, la Cour suprême des États-Unis et la Cour d’appel du neuvième circuit ont établi cette distinction dans des affaires concrètes. Mais « ne pas pirater » ne signifie pas « aucune règle », et ces mêmes affaires montrent où se situent les véritables limites.

Points clés à retenir
  • En 2021, la Cour suprême des États-Unis a interprété la loi fédérale contre le piratage informatique (la CFAA) comme une question de « accès autorisé ou non » : avez-vous le droit d'accéder à cette partie du système ou non (Van Buren c. États-Unis, 2021).
  • En 2022, la Cour d'appel du neuvième circuit a estimé que les pages accessibles au public n'avaient « érigé aucune barrière » ; par conséquent, leur consultation ne constitue probablement pas un accès « non autorisé » (hiQ c. LinkedIn, 2022).
  • Les contrats, les faux comptes, le droit d'auteur et la législation sur la vie privée restent applicables. C'est sur ces points que se jouent réellement les affaires liées aux données du Web.

Cet article explique les décisions judiciaires rendues publiques à l'intention d'un large public. Il ne s'agit pas d'un avis juridique, et la législation varie d'un pays à l'autre.

Pourquoi les gens pensent-ils que le « scraping » relève du piratage informatique ?

La confusion porte principalement sur le vocabulaire. Ces deux phénomènes impliquent des scripts automatisés, se produisent à grande échelle et font l’objet de titres évoquant les « bots ». La loi américaine sur la fraude et les abus informatiques (Computer Fraud and Abuse Act, CFAA), adoptée en 1986, a érigé en infraction pénale le fait d’accéder à un ordinateur « sans autorisation » ou de « dépasser les limites de l’accès autorisé ». Pendant des années, les sites ont fait valoir que le non-respect de leurs conditions d’utilisation constituait un dépassement des limites de l’accès autorisé.

Si cette interprétation avait été retenue, de nombreux comportements courants auraient constitué un délit fédéral. Utiliser un ordinateur professionnel pour consulter les résultats sportifs. Créer un deuxième compte en violation des règles d’un site. Envoyer une requête automatisée à une page pour laquelle le site interdisait toute automatisation. Pendant des années, les tribunaux ont été divisés quant à la portée exacte de cette loi.

Ce mythe n'est donc pas si farfelu. Il trouve son origine dans un véritable litige juridique, dont la portée s'est considérablement réduite depuis 2021, même si certaines questions restent en suspens et que la décision clé rendue en appel ne s'applique qu'à la 9e circonscription judiciaire.

Quelle a été la décision de la Cour suprême dans l'affaire Van Buren ?

En juin 2021, à Van Buren c. États-Unis, la Cour de cassation a statué, par 6 voix contre 3, que la notion d’« accès non autorisé » couvre le fait d’accéder à des parties d’un système informatique auxquelles vous n’avez pas accès, et non l’utilisation abusive d’informations que vous étiez déjà autorisé à consulter (Arrêt de la Cour de cassation, 2021). La Cour a qualifié cette analyse d’« examen portant sur l’ouverture ou la fermeture des barrières ».

C'est le contexte qui fait l'essentiel du travail. La question n'est pas « avez-vous enfreint une règle établie par le site ? », mais « la porte vous était-elle ouverte ? ». Une page de connexion est une porte. Un mot de passe est une porte. Une page que n'importe qui peut charger dans un navigateur n'en est pas une.

Voyez ce que cela signifie concrètement. Étant donné que Van Buren, les tribunaux ont considéré l’authentification, qu’il s’agisse d’un identifiant ou d’un mot de passe, comme l’exemple le plus évident d’une « porte fermée ». La Cour de cassation a toutefois laissé ouverte, dans une note de bas de page, la question de savoir si les clauses contractuelles ou les conditions générales pouvaient à elles seules constituer une telle « porte fermée ». Néanmoins, « y a-t-il un identifiant entre moi et ces données ? » est une question à laquelle la plupart des équipes d’ingénieurs peuvent effectivement répondre, ce qui est plus que ce que l’on peut dire de la plupart des conditions générales d’utilisation.

hiQ c. LinkedIn : les pages publiques ne sont pas soumises à des restrictions d'accès

hiQ Labs a collecté des profils LinkedIn publics afin de réaliser des analyses sur la main-d'œuvre, et LinkedIn lui a adressé une mise en demeure. Après Van Buren, la Cour suprême a renvoyé l'affaire devant la juridiction inférieure. En avril 2022, la Cour d'appel du neuvième circuit a estimé que lorsqu'un site met des données à la disposition du public, « cet ordinateur n'a, dès le départ, érigé aucune barrière à lever ou à abaisser » (Arrêt de la Cour d'appel du neuvième circuit, 2022).

En termes simples, la consultation de pages publiques, même à l’aide d’outils automatisés et même après avoir reçu l’ordre de cesser, ne constituait probablement pas une violation de la CFAA. C’est la décision que l’on cite généralement.

C'est également là que l'histoire s'arrête généralement.

Pourquoi hiQ a continué à payer LinkedIn : contrat et conduite

En effet, hiQ n’a pas été condamnée pour piratage informatique, mais pour manquement à ses obligations contractuelles et pour faute professionnelle. En novembre 2022, le tribunal de grande instance a estimé que hiQ avait enfreint les conditions d’utilisation de LinkedIn, notamment parce que des prestataires travaillant pour hiQ avaient créé de faux profils LinkedIn. En décembre 2022, les parties ont déposé un projet de jugement d'accord à l'amiable prévoyant une condamnation de 500 000 dollars à l'encontre de hiQ et lui imposant de supprimer les données LinkedIn en sa possession (registre des affaires du tribunal de district, 2022 ; Revue nationale du droit, 2022 ; Morgan Lewis, 2022).

Voici la leçon que la plupart des résumés omettent de mentionner. Le problème résidait dans les faux comptes et dans le fait que hiQ avait elle-même accepté les conditions d'utilisation de LinkedIn. Dès lors que vous possédez un compte, vous en avez accepté les conditions. En créer un sous une fausse identité revient à franchir une porte avec une clé que vous avez inventée de toutes pièces.

Est-ce que le fait que vous soyez connecté ou non a de l'importance ?

Oui, et une affaire de 2024 l'a clairement démontré. En janvier 2024, dans Meta c. Bright Data, le juge Edward Chen, du district nord de Californie, a rendu un jugement sommaire en faveur de Bright Data. Il a estimé que les conditions d'utilisation de Facebook et d'Instagram n'interdisaient pas la collecte de données publiques lorsque l'utilisateur n'était pas connecté (décision de justice, 2024 ; Alerte client de Quinn Emanuel, 2024).

Le tribunal a estimé qu'un visiteur n'ayant pas ouvert de session n'agissait pas en tant qu'« utilisateur » lié par ces conditions générales. Il a également rejeté l'interprétation de Meta selon laquelle ses conditions générales interdisaient définitivement la collecte de données publiques, même après la fermeture d'un compte.

Si l'on compare ces trois cas côte à côte, une tendance claire se dégage :

Situation CFAA "hacking" risk Contract risk
Reading public pages, logged out Low after Van Buren and hiQ Lower: one court held Meta's terms didn't cover it
Reading pages behind your own login Depends on what your account allows Higher: you agreed to the terms
Using fake accounts to get behind a login Higher High, as hiQ found
Getting around a password or technical barrier High: that's a closed gate High

Quelles sont donc les véritables règles à respecter pour extraire des données publiques ?

Aborder la question sous l’angle du piratage informatique n’est généralement pas la bonne approche. Les règles qui régissent réellement l’exploitation des données sur le Web sont les contrats (avez-vous accepté les conditions générales ?), le droit d’auteur (que faites-vous de ce contenu ?) et la législation sur la protection de la vie privée, comme le RGPD de l’UE (ces données permettent-elles d’identifier des personnes ?). La collecte de données à caractère personnel à partir d’une page publique peut tout de même entraîner des obligations en matière de protection de la vie privée, même si cet accès n’avait rien d’illégal.

Une liste de contrôle pratique pour les équipes :

  1. Rester déconnecté à moins que vous ne disposiez d'un droit explicite d'utiliser un compte à cette fin.
  2. Ne créez jamais de faux comptes pour accéder aux données. Ce comportement a joué un rôle déterminant dans la perte subie par hiQ.
  3. Ne contournez pas les obstacles techniques. Une page de connexion ou un mot de passe, c'est comme une porte fermée.
  4. Vérifiez ce que vous collectionnez. Les données à caractère personnel s'accompagnent d'obligations en matière de protection de la vie privée.
  5. Vérifiez ce que vous en faites. La republication de contenus protégés par le droit d'auteur soulève des questions différentes de celles liées à leur lecture.
  6. Veuillez respecter le fichier robots.txt et limiter le volume de requêtes à un niveau raisonnable. Le fichier robots.txt ne constitue pas un obstacle au sens de la CFAA, mais les propriétaires de sites considèrent le fait de l'ignorer ou de surcharger un site comme un signe de mauvaise foi. Ne dégradez pas le site que vous consultez.

Les équipes qui évitent les problèmes ont tendance à consigner leurs règles par écrit avant même de commencer à développer quoi que ce soit : quelles données elles collectent, pourquoi, et ce qu’elles ne feront jamais pour les obtenir. Les meilleures vont encore plus loin et placent ces règles à un endroit où un script ne peut pas les ignorer. Une liste « à ne jamais modifier » hébergée dans la couche proxy, par exemple, bloque purement et simplement une requête, au lieu de compter sur le fait que chaque ingénieur se souvienne d’une page wiki.

Pour savoir comment ces questions se posent plus précisément dans le cadre des litiges relatifs à la formation en IA, voir Les litiges relatifs aux données d'entraînement de l'IA que toute équipe chargée des données Web devrait connaître. Pour découvrir un autre mythe abordé dans cette série, lisez Pourquoi un plus grand nombre d'adresses IP ne garantit pas un meilleur réseau de proxy.

Le réseau que vous utilisez fait également partie de la conformité

La manière dont vous accédez aux pages publiques fait également partie de votre démarche de conformité. Un réseau résidentiel constitué d’appareils piratés ajoute un problème dont vous n’êtes pas à l’origine. Le réseau de Massive est composé d’appareils grand public authentiques dont les propriétaires ont donné leur accord via le SDK Massive, et Massive a passé avec succès un audit SOC 2 de type I, l’audit de type II étant en cours ; ces deux audits sont répertoriés sur le Centre de confiance Massive. Pour connaître les questions à poser à tout fournisseur, consultez SOC 2 et RGPD : les questions à poser à un fournisseur de proxys résidentiels.

L'accès reste soumis à certaines restrictions. Massive bloque certaines catégories de contenu au niveau de la couche réseau pour tous les comptes, et chaque compte résidentiel peut ajouter jusqu'à 1 000 domaines à sa propre liste. liste noire de domaines. Une requête bloquée est renvoyée sous la forme suivante : 452 Disallowed Content plutôt que de passer par là. Vous trouverez les détails concernant le fonctionnement de l'« opt-in » dans Comment fonctionne le réseau « opt-in » de Massive ?.

En résumé

  • Le piratage consiste à franchir une barrière fermée. Le scraping d'une page publique n'en fait pas partie.
  • Van Buren (2021) a établi le « critère des portes », et la Cour d'appel du neuvième circuit l'a appliqué aux pages publiques dans hiQ (2022).
  • hiQ a encore perdu, à cause de faux comptes et des clauses contractuelles.
  • Meta c. Bright Data (2024) a montré que l'accès aux collections par les utilisateurs non connectés se fait à un endroit différent de celui utilisé par les utilisateurs connectés.
  • Les véritables règles sont celles relatives aux contrats, au droit d'auteur et à la vie privée. Prévoyez-les.

Sources

Foire aux questions

Le « web scraping » est-il illégal aux États-Unis ?+

La collecte de pages accessibles au public ne constitue généralement pas un délit au regard de la CFAA, du moins dans le neuvième circuit, après Van Buren (2021) et l'arrêt rendu en 2022 par la Cour d'appel du neuvième circuit hiQ c. LinkedIn décision. Le droit des contrats, le droit d'auteur et le droit à la vie privée peuvent tout de même s'appliquer selon la manière dont vous accédez aux données et l'usage que vous en faites.

Que signifie « gates-up-or-down » ?+

C'est l'affaire de 2021 devant la Cour de cassation, issue de Van Buren. Vous outrepassez les droits d’accès autorisés en vertu de la CFAA lorsque vous accédez à des parties d’un système qui vous sont interdites, comme les zones accessibles uniquement après une connexion à laquelle vous n’avez pas droit. L’utilisation abusive d’informations auxquelles vous aviez déjà accès n’est pas prise en compte.

Pourquoi hiQ a-t-il perdu si l'extraction de données publiques ne constitue pas un acte de piratage ?+

En novembre 2022, un tribunal a estimé que hiQ avait enfreint les conditions d'utilisation de LinkedIn, notamment par le biais de faux profils créés par ses sous-traitants. Le projet de jugement d'accord à l'amiable de décembre 2022 prévoyait une amende de 500 000 dollars à l'encontre de hiQ. Ce préjudice résultait de la violation du contrat et d'un comportement fautif, et non de la consultation de pages publiques.

Le RGPD s'applique-t-il aux données publiques disponibles sur Internet ?+

C'est possible. Le RGPD s'applique aux données à caractère personnel, qu'elles soient publiques ou non, et peut s'étendre aux entreprises situées en dehors de l'UE qui surveillent des personnes au sein de l'UE. Les équipes qui collectent des noms, des profils ou des coordonnées doivent disposer d'une base légale et d'un plan de minimisation des données.