# Démystifier les idées reçues : le scraping et le piratage ne sont pas la même chose

« N’est-ce pas, au fond, du piratage ? » C’est l’une des questions les plus courantes que l’on pose à toute personne pratiquant le scraping à grande échelle. La réponse honnête est non. Le piratage consiste à s’introduire dans un système auquel on n’a pas accès. Extraire une page web publique revient à lire des informations que le site met déjà à la disposition de toute personne disposant d’un navigateur. Au cours des cinq dernières années, la Cour suprême des États-Unis et la Cour d’appel du neuvième circuit ont établi cette distinction dans des affaires concrètes. Mais « ne pas pirater » ne signifie pas « ne pas respecter de règles », et ces mêmes affaires montrent où se situent les véritables limites.

> **Points clés à retenir**
>
> - En 2021, la Cour suprême des États-Unis a interprété la loi fédérale anti-piratage (la CFAA) comme une question de « porte ouverte ou fermée » : avez-vous le droit d’accéder à cette partie du système ou non ([Van Buren c. États-Unis](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf), 2021) ?
> - En 2022, la Cour d’appel du neuvième circuit a estimé que les pages accessibles au public n’avaient « érigé aucune barrière » ; leur consultation ne constitue donc probablement pas un accès « sans autorisation » ([hiQ c. LinkedIn](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf), 2022).
> - Les contrats, les faux comptes, le droit d’auteur et la législation sur la vie privée restent applicables. C’est sur ces points que se jouent réellement les affaires relatives aux données du Web.

*Cet article explique des décisions judiciaires publiques à l’intention d’un large public. Il ne s’agit pas d’un avis juridique, et la législation varie d’un pays à l’autre.*

## Pourquoi les gens pensent-ils que le « scraping » est du piratage informatique ?

La confusion tient principalement au vocabulaire. Les deux pratiques impliquent des scripts automatisés, se déroulent à grande échelle et font l’objet de gros titres évoquant des « bots ». La loi américaine sur la fraude et les abus informatiques (Computer Fraud and Abuse Act, CFAA), adoptée en 1986, a érigé en infraction le fait d’accéder à un ordinateur « sans autorisation » ou de « dépasser les limites de l’accès autorisé ». Pendant des années, les sites ont fait valoir que le non-respect de leurs conditions d’utilisation constituait un dépassement des limites de l’accès autorisé.

Si cette interprétation avait prévalu, de nombreux comportements courants auraient constitué un délit fédéral. Utiliser un ordinateur professionnel pour consulter les résultats sportifs. Créer un deuxième compte en violation des règles d’un site. Envoyer une requête automatisée à une page pour laquelle le site interdisait l’automatisation. Pendant des années, les tribunaux ont été divisés quant à la portée exacte de cette loi.

Ce mythe n’est donc pas totalement infondé. Il trouve son origine dans un véritable conflit juridique, dont la portée s’est considérablement réduite depuis 2021, même si certaines questions restent en suspens et que l’arrêt clé rendu en appel ne lie que la Cour d’appel du neuvième circuit.

## Quelle a été la décision de la Cour suprême dans l’affaire Van Buren ?

En juin 2021, dans l’affaire *Van Buren c. États-Unis*, la Cour suprême a statué, par 6 voix contre 3, que l’expression « excès d’accès autorisé » couvre l’accès à des parties d’un système informatique qui vous sont interdites, et non l’utilisation abusive d’informations que vous étiez déjà autorisé à consulter ([avis de la Cour suprême](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf), 2021). La Cour a décrit cela comme une analyse de type « porte ouverte ou fermée ».

C’est la formulation même de la question qui fait l’essentiel du travail. La question n’est pas « avez-vous enfreint une règle établie par le site ? », mais « la porte vous était-elle ouverte ? ». Une page de connexion est une porte. Un mot de passe est une porte. Une page que n’importe qui peut charger dans un navigateur n’en est pas une.

<!-- [POINT DE VUE UNIQUE] -->
Remarquez ce que cela signifie concrètement. Depuis l’affaire *Van Buren*, les tribunaux ont considéré l’authentification, qu’il s’agisse d’une connexion ou d’un mot de passe, comme l’exemple le plus évident d’une barrière fermée. La Cour suprême a toutefois laissé ouverte, dans une note de bas de page, la question de savoir si les clauses contractuelles ou les politiques à elles seules peuvent en fermer une. Néanmoins, « y a-t-il une connexion entre vous et ces données ? » est une question à laquelle la plupart des équipes d’ingénieurs peuvent réellement répondre, ce qui est plus que l’on ne peut en dire de la plupart des conditions d’utilisation.

## hiQ c. LinkedIn : les pages publiques ne comportent pas de barrière

hiQ Labs a collecté des profils LinkedIn publics afin d’élaborer des analyses sur la main-d’œuvre, et LinkedIn lui a adressé une lettre de mise en demeure. Après l’affaire *Van Buren*, la Cour suprême a renvoyé l’affaire devant la juridiction inférieure. En avril 2022, la Cour d’appel du neuvième circuit a estimé que lorsqu’un site rend des données accessibles au public, « cet ordinateur n’a, a priori, érigé aucune barrière à lever ou à abaisser » ([avis de la Cour d’appel du neuvième circuit](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf), 2022).

En termes simples, la consultation de pages publiques, même à l’aide d’outils automatisés et même après avoir reçu l’ordre de cesser, n’était guère susceptible de constituer une violation de la CFAA. C’est la décision que l’on cite généralement.

C’est également là que l’histoire s’arrête généralement.

## Pourquoi hiQ a tout de même dû payer LinkedIn : contrat et comportement

Car hiQ n’a pas été condamnée pour piratage. Elle l’a été pour violation de contrat et pour son comportement. En novembre 2022, le tribunal de district a conclu que hiQ avait enfreint les Conditions d’utilisation de LinkedIn, en partie parce que des sous-traitants travaillant pour hiQ avaient créé de faux profils LinkedIn. En décembre 2022, les parties ont déposé une proposition de jugement d’accord amiable prévoyant une condamnation de 500 000 dollars à l’encontre de hiQ et lui imposant de supprimer les données LinkedIn en sa possession ([registre du tribunal de district](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/), 2022 ; [National Law Review](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case), 2022 ; [Morgan Lewis](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators), 2022).

Voici la leçon que la plupart des résumés omettent de mentionner. Le problème résidait dans les faux comptes et dans le fait que hiQ avait elle-même accepté les conditions d’utilisation de LinkedIn. Dès lors que vous possédez un compte, vous avez accepté ces conditions. En créer un sous une fausse identité revient à franchir une porte avec une clé que vous avez inventée.

## Le fait d’être connecté a-t-il de l’importance ?

Oui, et une affaire de 2024 l’a clairement démontré. En janvier 2024, dans l’affaire *Meta c. Bright Data*, le juge Edward Chen, du district nord de Californie, a rendu un jugement sommaire en faveur de Bright Data. Il a estimé que les conditions d’utilisation de Facebook et d’Instagram n’interdisaient pas la collecte de données publiques lorsque l’utilisateur n’était pas connecté ([ordonnance du tribunal](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf), 2024 ; [alerte client de Quinn Emanuel](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/), 2024).

Le tribunal a estimé qu’un visiteur déconnecté n’agit pas en tant qu’« utilisateur » lié par ces conditions. Il a également rejeté l’interprétation de Meta selon laquelle ses conditions interdisaient définitivement la collecte de données publiques, même après la fermeture d’un compte.

Si l’on compare ces trois affaires, une tendance claire se dégage :

| Situation | Risque de « piratage » au sens de la CFAA | Risque contractuel |
|-----------|--------------------|---------------|
| Consultation de pages publiques, hors connexion | Faible après *Van Buren* et *hiQ* | Moins élevé : un tribunal a estimé que les conditions de Meta ne s’appliquaient pas à ce cas |
| Consultation de pages après connexion à votre propre compte | Dépend des autorisations de votre compte | Plus élevé : vous avez accepté les conditions |
| Utilisation de faux comptes pour accéder à des pages protégées par un identifiant | Plus élevé | Élevé, comme l’a constaté hiQ |
| Contournement d’un mot de passe ou d’une barrière technique | Élevé : il s’agit d’une porte fermée | Élevé |

## Quelles sont donc les véritables règles applicables à l’extraction de données publiques ?

La législation sur le piratage informatique n’est généralement pas le bon prisme d’analyse. Les règles qui régissent réellement l’exploitation des données sur le Web sont les contrats (avez-vous accepté les conditions d’utilisation ?), le droit d’auteur (que faites-vous du contenu ?) et la législation sur la protection de la vie privée, comme le RGPD de l’UE (les données permettent-elles d’identifier des personnes ?). La collecte de données à caractère personnel à partir d’une page publique peut tout de même entraîner des obligations en matière de protection de la vie privée, même si l’accès n’avait rien d’illégal.

Une liste de contrôle pratique pour les équipes :

1. **Restez déconnecté**, sauf si vous disposez d’un droit clair d’utiliser un compte à cette fin.
2. **Ne créez jamais de faux comptes** pour accéder aux données. Ce comportement a joué un rôle central dans la défaite de hiQ.
3. **Ne contournez pas les barrières techniques.** Une page de connexion ou un mot de passe constituent une barrière.
4. **Vérifiez ce que vous collectez.** Les données à caractère personnel entraînent des obligations en matière de protection de la vie privée.
5. **Vérifiez ce que vous en faites.** La republication de contenu protégé par le droit d’auteur soulève des questions distinctes de sa simple lecture.
6. **Lisez le fichier robots.txt et maintenez un volume de requêtes raisonnable.** Le fichier robots.txt n’est pas un obstacle au sens de la CFAA, mais les propriétaires de sites considèrent le fait de l’ignorer ou de surcharger un site comme un signe de mauvaise foi. Ne dégradez pas le site que vous consultez.

<!-- [POINT DE VUE UNIQUE] -->
Les équipes qui évitent les ennuis ont tendance à consigner leurs règles par écrit avant de développer quoi que ce soit : quelles données elles collectent, pourquoi, et ce qu’elles ne feront jamais pour les obtenir. Les meilleures vont encore plus loin et placent ces règles à un endroit où un script ne peut pas les ignorer. Une liste « à ne jamais toucher » hébergée dans la couche proxy, par exemple, bloque purement et simplement une requête, au lieu de compter sur le fait que chaque ingénieur se souvienne d’une page wiki.

Pour savoir comment ces questions se posent concrètement dans le cadre des litiges liés à l’entraînement des IA, consultez [les procès relatifs aux données d’entraînement des IA que toute équipe chargée des données Web devrait connaître](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers). Pour découvrir un autre mythe abordé dans cette série, lisez [pourquoi un plus grand nombre d’adresses IP ne garantit pas un meilleur réseau proxy](https://www.joinmassive.com/blog/myth-more-ips-better-proxy-network).

## Le réseau que vous utilisez fait également partie de la conformité

La manière dont vous accédez aux pages publiques fait également partie de votre démarche de conformité. Un réseau résidentiel constitué d’appareils détournés ajoute un problème dont vous n’êtes pas à l’origine. Le réseau de Massive est constitué de véritables appareils grand public dont les propriétaires ont donné leur accord via le SDK Massive, et Massive a passé avec succès un audit SOC 2 de type I, le type II étant en cours ; ces deux certifications sont répertoriées sur le [Centre de confiance Massive](https://trust.joinmassive.com). Pour connaître les questions à poser à tout fournisseur, consultez [SOC 2 et RGPD : les questions à poser à un fournisseur de proxys résidentiels](https://www.joinmassive.com/blog/proxy-vendor-compliance-soc2-gdpr).

L'accès reste soumis à certaines restrictions. Massive bloque certaines catégories de contenu au niveau de la couche réseau pour tous les comptes, et chaque compte résidentiel peut ajouter jusqu’à 1 000 domaines à sa propre [liste noire de domaines](https://docs.joinmassive.com/residential/domain-blocking). Une requête bloquée renvoie le code `452 Disallowed Content` au lieu d’aboutir. Les détails du fonctionnement de l’opt-in se trouvent dans [le fonctionnement du réseau opt-in de Massive](https://www.joinmassive.com/blog/how-massives-opt-in-network-works).

## Foire aux questions

### Le web scraping est-il illégal aux États-Unis ?

La collecte de pages accessibles au public ne constitue généralement pas un délit au regard de la CFAA, du moins dans le neuvième circuit, à la suite de l’affaire *Van Buren* (2021) et de l’arrêt rendu en 2022 par le neuvième circuit dans l’affaire *hiQ c. LinkedIn*. Le droit des contrats, le droit d’auteur et le droit à la vie privée peuvent toutefois s’appliquer en fonction de la manière dont vous accédez aux données et de l’usage que vous en faites.

### Que signifie l’expression « gates-up-or-down » ?

Il s’agit du critère établi par la Cour suprême en 2021 dans l’affaire *Van Buren*. Vous outrepassez les limites de l’accès autorisé au titre de la CFAA en pénétrant dans des parties d’un système qui vous sont interdites, comme les zones accessibles uniquement après une connexion à laquelle vous n’avez pas droit. L’utilisation abusive d’informations auxquelles vous aviez déjà accès n’est pas prise en compte.

### Pourquoi hiQ a-t-il perdu si l’extraction de données publiques ne constitue pas un piratage ?

En novembre 2022, un tribunal a estimé que hiQ avait enfreint les conditions d’utilisation de LinkedIn, notamment par le biais de faux profils créés par ses sous-traitants. Le projet de jugement d’accord à l’amiable de décembre 2022 prévoyait une amende de 500 000 dollars à l’encontre de hiQ. Cette condamnation découlait de la violation du contrat et d’un comportement répréhensible, et non de la consultation de pages publiques.

### Le RGPD s’applique-t-il aux données publiques sur Internet ?

C’est possible. Le RGPD couvre les données à caractère personnel, qu’elles soient publiques ou non, et peut s’appliquer aux entreprises situées en dehors de l’UE qui surveillent des personnes au sein de l’UE. Les équipes qui collectent des noms, des profils ou des coordonnées doivent disposer d’une base légale et d’un plan de minimisation des données.

## Conclusion

- Le piratage consiste à franchir une barrière fermée. Le scraping d’une page publique n’en relève pas.
- L’affaire *Van Buren* (2021) a établi le « test des barrières », et la Cour d’appel du neuvième circuit l’a appliqué aux pages publiques dans l’affaire *hiQ* (2022).
- hiQ a tout de même perdu, en raison de faux comptes et des clauses contractuelles.
- L’affaire *Meta c. Bright Data* (2024) a montré que la collecte de données lorsque l’utilisateur est déconnecté relève d’un cadre différent de l’utilisation lorsqu’il est connecté.
- Les véritables règles sont celles du droit des contrats, du droit d'auteur et de la protection de la vie privée. Prévoyez-les.

## Sources

- Cour suprême des États-Unis, [*Van Buren c. États-Unis*, n° 19-783 (2021)](https://www.supremecourt.gov/opinions/20pdf/19-783_k53l.pdf)
- Cour d’appel des États-Unis pour le neuvième circuit, [*hiQ Labs, Inc. c. LinkedIn Corp.*, n° 17-16783 (18 avril 2022)](https://cdn.ca9.uscourts.gov/datastore/opinions/2022/04/18/17-16783.pdf)
- National Law Review, [« hiQ et LinkedIn parviennent à un accord de règlement dans une affaire historique de scraping »](https://natlawreview.com/article/hiq-and-linkedin-reach-proposed-settlement-landmark-scraping-case) (2022)
- Morgan Lewis, [« LinkedIn c. hiQ : un procès historique sur le scraping de données apporte des éclaircissements »](https://www.morganlewis.com/blogs/sourcingatmorganlewis/2022/12/linkedin-v-hiq-landmark-data-scraping-suit-provides-guidance-to-data-scrapers-and-web-operators) (2022)
- Tribunal fédéral de première instance du district nord de Californie, [*hiQ Labs, Inc. c. LinkedIn Corp.*, n° 3:17-cv-03301-EMC, ordonnance relative aux requêtes réciproques en jugement sommaire (4 novembre 2022)](https://www.courtlistener.com/docket/6071320/hiq-labs-inc-v-linkedin-corporation/)
- Tribunal fédéral de première instance du district nord de Californie, [*Meta Platforms, Inc. c. Bright Data Ltd.*, n° 3:23-cv-00077-EMC, ordonnance faisant droit à la requête en jugement sommaire de Bright Data (23 janvier 2024)](https://www.courthousenews.com/wp-content/uploads/2024/01/meta-platforms-v-bright-data-ruling-motion-for-summary-judgment.pdf)
- Quinn Emanuel, [« Meta c. Bright Data : une décision importante pour le secteur du web scraping »](https://www.quinnemanuel.com/the-firm/news-events/client-alert-meta-v-bright-data-significant-decision-for-web-scraping-industry/) (2024)
