# Судебные иски, связанные с обучающими данными для ИИ: что это означает для веб-скреперов

В сентябре 2025 года федеральный судья вынес решение о предварительном одобрении урегулирования на сумму 1,5 миллиарда долларов, что стало крупнейшей выплатой по авторскому праву в истории развития искусственного интеллекта. Основанием для иска послужило следующее: Компания Anthropic обучала свои модели на основе примерно 500 000 пиратских книг (Copyright Alliance, «Участие в урегулировании по делу Bartz v. Anthropic», просмотр 17.09.2026). Уже одна только эта цифра должна привлечь внимание любого, кто зарабатывает на жизнь сбором данных.

За последние восемнадцать месяцев суды на двух континентах начали устанавливать четкие рамки в отношении того, как компании, занимающиеся ИИ, и поставщики инструментов для сбора данных могут получать обучающие данные, и эти рамки не всегда соответствуют тому, что предполагала отрасль. В данной статье рассматриваются основные судебные решения, их фактическое содержание, а также то, что команды по работе с данными и поставщики инфраструктуры для сбора данных должны изменить в своей деятельности. Для ознакомления с механизмами см. [как работает веб-скрейпинг](https://www.joinmassive.com/glossary/what-is-web-scraping).

> **Ключевые выводы**
> - Урегулирование спора с компанией Anthropic на сумму 1,5 млрд долларов показывает, что причиной ответственности стало пиратство, а не обучение (Copyright Alliance, 2026).
> - Компания Ross Intelligence не смогла воспользоваться защитой на основании «добросовестного использования», поскольку её инструмент ИИ напрямую конкурировал с собственным рынком Westlaw; компаниям Anthropic и Meta никогда не приходилось отвечать на этот вопрос.
> - Лишь 14 % ведущих доменов установили сигнал robots.txt для ИИ-ботов (Cloudflare Radar, 2025).
> - Уклонение от ответственности приводит к включению в черный список. Судебный иск при этом не требуется.

## Какие решения на самом деле выносят суды в отношении обучающих данных для ИИ?

Суды постановляют, что способ получения обучающих данных может повлечь за собой юридическую ответственность, совершенно не связанную с тем, как эти данные впоследствии используются. Урегулирование по делу «Бартц против Anthropic» составило примерно 3 000 долларов за каждое произведение из примерно 500 000 пиратских книг; эта цифра напрямую связана со способом приобретения, а не с тем, как книги впоследствии использовались при обучении (Copyright Alliance, «Участие в урегулировании по делу „Бартц против Anthropic», прочитано 17.09.2026).

![Ряды юридических книг на полках библиотеки здания суда, символизирующие растущий массив судебной практики, определяющей правила в отношении обучающих данных для ИИ.](https://cdn.pixabay.com/photo/2014/03/20/21/53/law-books-291683_1280.jpg)

Основополагающее решение судьи Уильяма Алсупа по делу «Бартц против Anthropic» провело чёткую грань, которой отрасль не ожидала в полной мере. Обучение на основе книг, приобретённых и отсканированных компанией Anthropic, было признано добросовестным использованием, «впечатляющим образом преобразующим», по его словам (Norton Rose Fulbright, Inside Tech Law, «Дело Бартц против Anthropic: достигнуто урегулирование после знакового решения по суммарному производству», прочитано 17 сентября 2026 г.). Загрузка пиратских копий с целью создания постоянной научной библиотеки представляла собой отдельное деяние и не являлась добросовестным использованием, независимо от того, как данные использовались впоследствии.

Это разграничение имеет большее значение, чем сама сумма урегулирования. Приобретение и использование теперь представляют собой два разных правовых вопроса, и компания может выиграть в одном, но при этом потерпеть серьезное поражение в другом. Компания Anthropic заключила соглашение об урегулировании в августе 2025 года, а судья Алсуп дал предварительное одобрение в следующем месяце (CNBC, «Судья дал предварительное одобрение урегулированию на сумму 1,5 млрд долларов с авторами», 25 сентября 2025 г., прочитано 17 сентября 2026 г.).

Действительно ли хорошо финансируемая лаборатория ИИ подвергается меньшему юридическому риску, чем небольшой сайт-скрейпер, использующий тот же пиратский источник? Не обязательно. Данное урегулирование показывает, что масштаб деятельности не защищает никого от исков, касающихся метода сбора данных, как только этот вопрос будет признан независимым от вопроса о добросовестном использовании. См. [что считается обучающими данными для ИИ](https://www.joinmassive.com/glossary/what-is-llm-training-data), чтобы ознакомиться с механизмами, лежащими в основе данных судебных решений.

<!-- ДИАГРАММА 2: Хронология урегулирования/лицензирования -->
<figure data-max-width="640">
  <svg viewBox="0 0 560 380" style="max-width: 100%; height: auto; font-family: 'Outfit', system-ui, sans-serif" role="img" aria-label="Хронология урегулирований споров об авторских правах в сфере ИИ в 2025 году: в августе 2025 года компания Anthropic согласилась на урегулирование на сумму 1,5 млрд долларов по делу «Бартц против Anthropic», которое получило предварительное одобрение суда в сентябре 2025 года, за которым последуют заключение лицензионного соглашения между Universal Music Group и Udio в октябре 2025 года, а также заключение соглашений между Warner Music Group и компаниями Udio и Suno в ноябре 2025 года.»>
    <title>Переход от судебных разбирательств к лицензированию в 2025 году</title>
    <desc>Горизонтальная временная шкала, отражающая четыре события 2025 года, связанные с урегулированием споров об авторских правах в сфере ИИ: компания Anthropic соглашается на урегулирование на сумму 1,5 млрд долларов по делу «Бартц против Anthropic» (август 2025 года); суд выносит предварительное одобрение (сентябрь 2025 года); Universal Music Group достигает урегулирования с Udio и запускает лицензионную музыкальную платформу на базе ИИ (октябрь 2025 года); Warner Music Group достигает урегулирования как с Udio, так и с Suno (ноябрь 2025 года).</desc>

    <text x="280" y="30" text-anchor="middle" font-size="15" font-weight="800" fill="currentColor">Переход от судебных разбирательств к лицензированию в 2025 году</text>
    <text x="280" y="50" text-anchor="middle" font-size="10.5" fill="currentColor" opacity="0.55">Крупные соглашения по авторскому праву в сфере ИИ, август–ноябрь 2025 г.</text>

    <line x1="60" y1="190" x2="500" y2="190" stroke="currentColor" stroke-opacity="0.25" stroke-width="2" />

    <circle cx="100" cy="190" r="8" fill="#d74939" />
    <text x="100" y="150" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">Урегулирование на сумму 1,5 млрд долларов</text>
    <text x="100" y="165" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Дело Бартц против Anthropic</text>
    <text x="100" y="215" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">август 2025 года</text>

    <circle cx="220" cy="190" r="8" fill="#ff8163" />
    <text x="220" y="225" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">Одобрение суда</text>
    <text x="220" y="240" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Предоставлено предварительное одобрение</text>
    <text x="220" y="165" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">сентябрь 2025 года</text>

    <circle cx="340" cy="190" r="8" fill="#d74939" />
    <text x="340" y="150" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">Сделка между UMG и Udio</text>
    <text x="340" y="165" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Лицензионная музыкальная платформа на базе ИИ</text>
    <text x="340" y="215" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">Октябрь 2025 г.</text>

 <circle cx="460" cy="190" r="8" fill="#ff8163" />
    <text x="460" y="225" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">WMG урегулировала оба спора</text>
    <text x="460" y="240" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Udio, а затем Suno</text>
    <text x="460" y="165" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">ноябрь 2025 года</text>

    <text x="280" y="372" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.35">Источник: Copyright Alliance; CNBC; Music Business Worldwide (2025)</text>
  </svg>
  <figcaption>Переход в 2025 году от судебных разбирательств по вопросам авторского права в сфере ИИ к схеме «урегулирование плюс лицензирование» (Источник: Copyright Alliance, CNBC, Music Business Worldwide, 2025)</figcaption>
</figure>

## Почему Thomson Reuters одержала победу над Ross Intelligence, если Anthropic выиграла дело о добросовестном использовании?

Компания Thomson Reuters одержала победу, поскольку Ross Intelligence создала продукт, непосредственно конкурирующий с продуктом Thomson Reuters, на основе лицензионного контента, который она не имела права использовать для обучения. В феврале 2025 года судья Стефанос Бибас (окружной суд штата Делавэр) вынес частичное суммарное решение в пользу Thomson Reuters, что стало первым случаем проигрыша компании, занимающейся искусственным интеллектом, в деле о справедливом использовании данных для обучения (Goodwin Procter, «Суд отклонил аргумент о справедливом использовании в деле об авторском праве в сфере ИИ», прочитано 17.09.2026).

Компания Ross использовала аннотации Westlaw — редакционный контент, который Thomson Reuters создавала на протяжении десятилетий, — для обучения инструмента юридического поиска, который напрямую конкурировал с самим Westlaw. Судья Бибас счёл такое использование нетрансформативным и наносящим коммерческий ущерб рынку оригинального произведения (Jenner & Block, уведомление для клиентов, прочитано 17.09.2026).

Сравните это с делом «Кадрей против Meta». В июне 2025 года судья Винс Чхабрия (Северный округ Калифорния) вынес в пользу Meta частичное суммарное решение по вопросу добросовестного использования, несмотря на то что некоторые учебные материалы были получены из «теневых» библиотек, поскольку истцы не смогли доказать, что использование со стороны Meta привело к размыванию рынка их произведений (Goodwin Procter, просмотрено 17.09.2026). Он осторожно отметил, что будущий истец, способный доказать размывание рынка, может выиграть дело там, где эти истцы потерпели неудачу (Copyright Alliance, «Решение по делу „Kadrey v. Meta“», просмотрено 17 сентября 2026 г.).

Так что же на самом деле отличает успешную защиту на основании добросовестного использования от неудачной? Оказывается, это рыночная конкуренция, а не механизм самого копирования.

<!-- [УНИКАЛЬНЫЙ ВЗГЛЯД] -->
В совокупности эти судебные решения указывают на то, что способ получения материала и конкурентное использование выступают в качестве двух независимых критериев ответственности. Компания Anthropic проиграла по вопросу получения материала (пиратство), несмотря на победу в части трансформативного использования. Росс проиграл по вопросу конкурентного использования, несмотря на то что опирался на контент из лицензионного источника. Ни один из этих факторов сам по себе не гарантирует защиты.

<!-- ТАБЛИЦА 1: Сравнение результатов по «добросовестному использованию» (таблица HTML -> htmlEmbed) -->
<table>
  <thead>
    <TR>
 <TH>Дело</TH>
 <TH>На чём осуществлялось обучение</TH>
 <TH>Как были получены данные</TH>
 <TH>Конкурирует ли с исходным источником?</TH>
 <TH>Результат по вопросу добросовестного использования</TH>
    </TR>
  </THEAD>
  <tbody>
    <tr>
 <td><strong>Дело «Бартц против Anthropic»</strong></td>
 <td>Книги, приобретённые и отсканированные</td>
 <td>Законно приобретённые экземпляры (законно) плюс пиратские копии из «теневых библиотек» (незаконно)</td>
      <td>Нет</td>
 <td>Обучение на основе приобретённых книг: добросовестное использование. Загрузка пиратских копий: не является добросовестным использованием, что привело к урегулированию на сумму 1,5 млрд долларов</td>
    </tr>
    <tr>
 <td><strong>Дело «Кадрей против Meta»</strong></td>
 <td>Книги, в том числе из «теневых библиотек»</td>
 <td>Частично пиратские</td>
 <td>Истцы не доказали нанесения ущерба рынку</td>
      <td>В данном деле признано добросовестное использование; судья оставил возможность для истцов, способных доказать размывание рынка</td>
    </tr>
    <tr>
 <td><strong>Дело «Thomson Reuters против Ross Intelligence»</strong></td>
      <td>Аннотации Westlaw</td>
 <td>Лицензионный контент, использованный без разрешения для обучения</td>
 <td>Да, конкурирующий продукт для юридических исследований</td>
 <td>Не является добросовестным использованием; первое проигрышное решение в порядке упрощённого судебного разбирательства по делу об обучении ИИ</td>
    </tr>
    <tr>
 <td><strong>Getty Images против Stability AI (Великобритания)</strong></td>
 <td>Лицензионные стоковые изображения</td>
 <td>Использованы без лицензии; обучение проводилось за пределами Великобритании</td>
      <td>Да, конкурирующий бизнес по лицензированию изображений</td>
 <td>Иск об авторском праве отклонен по юрисдикционным основаниям; вместо этого установлено нарушение прав на товарный знак</td>
    </tr>
  </tbody>
</table>

## Дела, которые все еще находятся на рассмотрении в суде

Несколько крупнейших дел об авторских правах в сфере ИИ по-прежнему находятся на рассмотрении, и их исход может ещё больше изменить доктрину добросовестного использования. Объединенные иски «Нью-Йорк Таймс» и Гильдии авторов против OpenAI в настоящее время рассматриваются в рамках дела «In re OpenAI Copyright Litigation» под председательством судьи Сидни Стейна. По состоянию на сентябрь 2026 года в рамках данного дела активно проводится досудебное расследование, дата судебного разбирательства не назначена (Washington Post, «Министерство юстиции призывает судью вынести решение в пользу OpenAI и Microsoft в иске «Нью-Йорк Таймс», 2 сентября 2026 г., прочитано 17 сентября 2026 г.).

![Книжные полки в библиотеке, символизирующие многочисленные все ещё не завершённые судебные дела об авторском праве в сфере ИИ, проходящие этапы сбора доказательств и апелляционного рассмотрения.](https://cdn.pixabay.com/photo/2016/01/19/01/42/library-1147815_1280.jpg)

В апреле 2025 года судья Стейн в основном отклонил ходатайство OpenAI и Microsoft об отклонении иска, позволив рассмотрение большинства исковых требований и прямо отказавшись называть обучение ИИ «по своей сути преобразующим». Постановление от 27 октября 2025 года пошло ещё дальше: Судья Стейн постановил, что сгенерированные ChatGPT краткие изложения сюжетов романов истцов сами по себе могут представлять собой нарушение авторских прав — это теория «результатов», отличная от вопроса об обучении (IPWatchdog, «OpenAI проиграла ходатайство об отклонении межокружного коллективного иска в связи с результатами ChatGPT»,», 28 октября 2025 г., прочитано 17 сентября 2026 г.).

Это дело привлекло внимание и за пределами суда. 2 сентября 2026 года Министерство юстиции подало судебное заключение, в котором призвало суд вынести решение в пользу OpenAI и Microsoft (Washington Post, прочитано 17 сентября 2026 г.; Axios, «Судебный процесс по делу о нарушении авторских прав между NYT, OpenAI и Microsoft», 8 сентября 2026 г., прочитано 17 сентября 2026 г.).

Дело «Getty Images против Stability AI» разделило стороны океаном. 4 ноября 2025 года Высокий суд Великобритании постановил, что иск Getty об авторских правах не может быть удовлетворен, поскольку обучение модели Stability происходило за пределами Великобритании, однако установил факт нарушения прав на товарный знак, поскольку ранние результаты работы Stable Diffusion содержали водяной знак Getty (Ropes & Gray, прочитано 17 сентября 2026 г.). Отдельное дело Getty в США, повторно поданное в окружной суд Северного округа Калифорнии, в апреле 2026 года устояло перед ходатайством об отклонении иска по претензиям о нарушении прав на товарный знак и размывании знака, а судебное разбирательство назначено на январь–февраль 2028 года (реестр CourtListener, по состоянию на 17.09.2026).

<!-- [УНИКАЛЬНЫЙ АНАЛИЗ] -->
Та же теория, согласно которой результаты работы ИИ, содержащие водяной знак бренда или узнаваемый производный контент, равносильны нарушению, в настоящее время рассматривается одновременно в судах Великобритании и США. Иски об авторских правах сужаются по юрисдикционным соображениям и в связи с преобразующим использованием, однако иски, основанные на товарных знаках и результатахзаполняют пробел, оставленный этими более узкими судебными решениями.

Эта тенденция выходит за рамки текста. В период с июня по сентябрь 2025 года компании Disney, Universal и Warner Bros. подали иски против Midjourney в связи с генерацией изображений, и по состоянию на середину 2026 года в этих объединенных делах продолжается спор по вопросам сбора доказательств (Variety, просмотр 17.09.2026; IPWatchdog, «В иске Warner Bros. утверждается, что нарушение авторских прав со стороны Midjourney носит „систематический“ и «умышленным»», прочитано 17.09.2026). В музыкальной отрасли компания Universal Music Group достигла урегулирования с Udio в октябре 2025 года, соединив выплату компенсации с соглашением о лицензировании для новой музыкальной платформы на базе ИИ, а Warner Music достигла урегулирования как с Udio, так и с Suno в ноябре 2025 года (Music Business Worldwide, просмотрено 17.09.2026). Компания Sony по-прежнему ведёт судебные разбирательства с обеими платформами. Давление не ограничивается лишь залами судебных заседаний: см. [почему доступ к веб-данным становится всё более затруднительным](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it), чтобы ознакомиться с инфраструктурной стороной этой же проблемы.

## Применимо ли всё это к сбору общедоступных данных, а не только к обучению ИИ?

Сбор данных с общедоступных веб-страниц сам по себе не является федеральным преступлением, но это не означает, что он не сопряжён с рисками. Дело «hiQ Labs против LinkedIn» разрешило этот вопрос в Девятом окружном апелляционном суде: сбор данных с общедоступных страниц не нарушает положение Закона о компьютерных мошенничествах и злоупотреблениях (CFAA) о «несанкционированном доступе» , хотя иски о нарушении договора, авторских прав и неправомерном вторжении по-прежнему вполне возможны (White & Case, «Сбор данных из Интернета, условия использования веб-сайтов и CFAA», прочитано 17.09.2026).

Данное постановление было вынесено в рамках повторного рассмотрения дела после того, как решение Верховного суда по делу «Ван Бюрен» сузило сферу применения CFAA. В ходе того же разбирательства также было установлено, что компания hiQ по-прежнему нарушала Условия предоставления услуг LinkedIn, что представляет собой отдельное исковое требование по договору, на которое не повлияло решение по делу CFAA (Fenwick & West, «hiQ Labs вновь уходит от ответственности», прочитано 17 сентября 2026 г.). На практике вопрос о реальном риске сместился с «является ли это взломом» на «имел ли я разрешение или лицензию».

Если скрапинг общедоступных страниц не является взломом, почему компании по-прежнему блокируются и подвергаются судебным искам по этому поводу? Потому что иммунитет, предоставляемый CFAA, никогда не распространялся на иски, связанные с нарушением договорных обязательств, авторских прав или права собственности, и именно в этой сфере в настоящее время возникает большинство споров.

Отдельный инцидент, произошедший в августе 2025 года, продемонстрировал, насколько быстро могут действовать неформальные меры правоприменения. Компания Cloudflare сообщила, что Perplexity использовала незадекларированные, сменяющиеся пользовательские агенты и ASN для продолжения сканирования тестовых доменов, на которых все сканеры были явно запрещены через файл robots.txt (Search Engine Journal, «Cloudflare исключила из списка и заблокировала Perplexity от сканирования веб-сайтов», прочитано 17.09.2026). Cloudflare лишила Perplexity статуса «проверенного бота» и заблокировала её сканер по всей сети, при этом обращение в суд не потребовалось.

<div data-block="callout" data-tone="warning">
**Тактики маскировки идентичности сопряжены со своими рисками, не связанными с судебными разбирательствами.** Выводы Cloudflare по Perplexity, сделанные в августе 2025 года, показывают, что поставщики инфраструктуры могут исключить из списка и занести в чёрный список бота в масштабах всей сети в тот же момент, когда обнаруживают смену пользовательских агентов или ASN, используемых для обхода объявленного блокирования в файле robots.txt, без необходимости подачи иска (Search Engine Journal, прочитано 17.09.2026).
</div>

Компания Perplexity публично оспорила интерпретацию событий со стороны Cloudflare (Search Engine Journal, прочитано 17.09.2026). Независимо от того, как разрешится этот спор, урок остаётся неизменным: если вас поймают на обходе объявленного блокирования, доступ вашего робота-паука к значительной части Интернета может быть прекращён в одночасье. Чтобы подробнее ознакомиться с правовыми рамками, см. [этичные практики веб-скрейпинга](https://www.joinmassive.com/blog/ethical-web-scraping).

## Как реагируют поставщики инфраструктуры

Поставщики инфраструктуры перестали ждать решений судов и начали самостоятельно изменять настройки по умолчанию. С 1 июля 2025 года компания Cloudflare сделала блокировку неавторизованных ИИ-краулеров настройкой по умолчанию для каждого нового домена, заменив прежнюю модель «блокировка по согласию» на модель «доступ по отказу» (Cloudflare, пресс-релиз «Cloudflare кардинально изменила подход к сбору данных в Интернете с помощью ИИ-краулеров», прочитано 17 сентября 2026 г.).

Cloudflare сопроводила это изменение введением механизма «Pay Per Crawl» («Оплата за сканирование»), позволяющего владельцам сайтов взимать плату с сканеров за доступ; по заявлению компании, с 15 сентября 2026 года, при этом по умолчанию будут блокироваться сканеры смешанного назначения на страницах, поддерживаемых рекламой (блог Cloudflare, прочитано 17.09.2026). В период с 19 по 26 июня 2025 года система Cloudflare Radar выявила, что сканер компании AnthropicClaude отправлял примерно 71 000 запросов на HTML-страницы на каждый один реферал, который он возвращал на сканируемые сайты (блог Cloudflare/Radar, «Соотношение сканирования и рефералов ИИ в Radar», прочитано 17.09.2026 г.).

<!-- ДИАГРАММА 3: разрыв во внедрении ИИ-ботов в файлах robots.txt (кольцевая диаграмма) -->
<figure data-max-width="640">
  <svg viewBox="0 0 560 380" style="max-width: 100%; height: auto; font-family: 'Outfit', system-ui, sans-serif" role="img" aria-label="Диаграмма в виде кольца: согласно данным Cloudflare Radar за июнь 2025 года, лишь 14 процентов из 10 000 ведущих веб-доменов установили какие-либо директивы в файле robots.txt, специально предназначенные для ИИ-ботов, в то время как 86 процентов не имеют никаких сигналов для ИИ-ботов.">
    <title>На большинстве сайтов по-прежнему отсутствует набор сигналов для ИИ-ботов</title>
    <desc>Диаграмма «кольцо», демонстрирующая, что из 10 000 ведущих веб-доменов, имеющих файл robots.txt, лишь 14 процентов содержат какие-либо директивы, специально предназначенные для ИИ-ботов; 86 процентов не имеют сигналов для ИИ-ботов. Источник: Cloudflare Radar, июнь 2025 года.</desc>

    <text x="280" y="30" text-anchor="middle" font-size="15" font-weight="800" fill="currentColor">На большинстве сайтов по-прежнему отсутствует настройка сигналов для ИИ-ботов</text>
    <text x="280" y="50" text-anchor="middle" font-size="10.5" fill="currentColor" opacity="0.55">Доля 10 000 ведущих доменов, в файлах robots.txt которых присутствует директива для ИИ-ботов</text>

    <path d="M 280,55 A 100,100 0 0 1 357.1,91,3 L 324,7,118,0 A 58,58 0 0 0 280,97 Z" fill="#d74939" />
    <path d="M 357,1,91.3 A 100,100 0 1 1 280,55 L 280,97 A 58,58 0 1 0 324,7,118,0 Z" fill="#64748b" opacity="0.45" />

 <text x="280" y="150" text-anchor="middle" font-size="34" font-weight="800" fill="#d74939">14%</text>
    <text x="280" y="168" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.65">имеют ИИ-бота</text>
    <text x="280" y="181" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.65">сигнал в файле robots.txt</text>

 <rect x="150" y="298" width="14" height="14" fill="#d74939" />
    <text x="172" y="309" font-size="11" fill="currentColor" opacity="0.85">14 %: установите директиву robots.txt, предназначенную специально для ИИ-бота</text>

    <rect x="150" y="322" width="14" height="14" fill="#64748b" opacity="0.45" />
    <text x="172" y="333" font-size="11" fill="currentColor" opacity="0.85">86 %: сигнал для ИИ-ботов не установлен</text>

    <text x="280" y="372" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.35">Источник: Cloudflare Radar (июнь 2025 г.)</text>
  </svg>
  <figcaption>Лишь 14 % из 10 000 ведущих доменов установили директиву robots.txt, специально предназначенную для ИИ-ботов (Источник: Cloudflare Radar, июнь 2025 г.)</figcaption>
</figure>

Большинство владельцев сайтов до сих пор не задали никаких сигналов. GPTBot стал самым заблокированным сканером в том же наборе данных: его доступ был запрещён 312 из 3 816 доменов, имеющих файл robots.txt, в то время как явно разрешили его доступ лишь 61 домен (Блог Cloudflare/Radar, по состоянию на 17.09.2026).

Регулирующие органы начинают рассматривать машиночитаемые сигналы как единственные, имеющие значение. 10 декабря 2025 года Ганзейский высший региональный суд Гамбурга вынес решение по делу «Кнешке против LAION» (OLG Hamburg, 5 U 104/24), согласно которому отказ от текстового иотказ от добычи данных являются юридически действительными только в том случае, если они доступны для машинного считывания. В число таких средств входят файл robots.txt, заголовок X-Robots-Tag или протокол TDM Reservation Protocol — все они принимаются во внимание. Положение, скрытое в условиях использования веб-сайта, изложенных на естественном языке, не принимается (Norton Rose Fulbright, Inside Tech Law, «Машинно-читаемые отказы и обучение ИИ: Гамбургский суд разъясняет исключения из авторского права», прочитано 17.09.2026).

Данный подход соответствует Кодексу практики GPAI ЕС, опубликованного в июле 2025 года и подписанного к июлю 2026 года 23 разработчиками ИИ, включая OpenAI, Google, Anthropic и Microsoft, которые все обязались осуществлять сканирование с помощью ботов, поддерживающих файл robots.txt, и соблюдать машиночитаемые ограничения.

<!-- [УНИКАЛЬНЫЙ АНАЛИЗ] -->
Поставщики инфраструктуры и регулирующие органы в данном вопросе фактически опережают суды. Компания Cloudflare изменила свою политику сканирования по умолчанию в июле 2025 года, а стандарт Гамбургского суда в отношении машиночитаемых сигналов был введён задолго до того, как судебная практика США урегулировала аналогичные вопросы, касающиеся сбора данных и лицензирования. Команды, ожидающие разрешения судебных споров перед корректировкой политики, могут обнаружить, что стандартные настройки уже изменились без их ведома.

## Что следует сделать сейчас скрейперам и командам по работе с данными

Команды по работе с данными, которые относятся к вопросу происхождения данных как к второстепенному, подвергаются наибольшему риску, связанному с этими судебными решениями. Одно только урегулирование по делу Бартца обошлось примерно в 3 000 долларов за каждое пиратское произведение из числа около 500 000 книг (Copyright Alliance, по состоянию на 17.09.2026), и любая юридическая команда может умножить эту цифру на размер своего собственного нелицензионного архива.

**1. Отслеживайте происхождение данных на всех этапах.** Точно знайте, откуда поступил каждый входной материал для обучения или сбора данных, а также было ли он лицензирован, приобретён или получен с помощью скрейпинга. Дело «Anthropic» показывает, что регулирующие органы и суды будут отделять способ получения данных от последующего использования при определении ответственности.

**2. Уважайте машиночитаемые сигналы отказа от участия.** Файлы robots.txt, ai.txt и протокол TDM Reservation Protocol являются стандартами, которые в настоящее время признают регулирующие органы, даже в тех юрисдикциях, где этот вопрос ещё не стал обязательным.

**3. Отдавайте предпочтение лицензированию, а не «обходным путям», граничащим с пиратством.** Отношения, основанные на приобретенных или лицензированных данных, выдерживают проверку в суде, в отличие от пиратских архивов, поскольку победа компании Anthropic по делу о добросовестном использовании в отношении приобретённых книг никоим образом не сняла с неё ответственности за пиратские копии, которые находились рядом с ними в том же цикле обучения.

**4. Избегайте тактик уклонения от идентификации.** Смена пользовательских агентов с целью обойти объявленную блокировку приведёт к тому, что вас внесут в чёрный список. Для этого не требуется подавать заявление в суд. Обзор того, [том, что на самом деле входит в скрапинг данных с помощью ИИ](https://www.joinmassive.com/glossary/what-is-ai-scraping), станет полезной отправной точкой для аудита вашего собственного рабочего процесса.

![Судейский молоток, лежащий на деревянной поверхности, символизирующий судебные решения, которые в настоящее время определяют, как команды по работе с данными получают и лицензируют обучающие данные.](https://cdn.pixabay.com/photo/2022/10/05/07/10/gavel-7499921_1280.jpg)

<div data-block="cta" data-text="Происхождение данных — это лишь один из элементов обоснованной стратегии сбора данных, а не вся картина. Сеть прокси-серверов Massive для частного использования работает на реальных пользовательских устройствах в более чем 195 странах, каждое из которых подключено через SDK Massive и предоставляет чистый HTML-код или формат Markdown из любого общедоступного источника в любой точке мира. Система прошла аудит SOC 2 и соответствует требованиям GDPR, что является одним из элементов обоснованной стратегии, но не юридическим щитом и не заменой юридической консультации."></DIV>

### Является ли незаконным скрапинг общедоступных веб-сайтов?

Само по себе — нет. Апелляционный суд девятого округа в деле «hiQ Labs против LinkedIn» постановил, что скрапинг общедоступных страниц не нарушает Закон о компьютерном мошенничестве и злоупотреблении (CFAA) (White & Case, по состоянию на 17.09.2026). Однако иски о нарушении договора, нарушение авторских прав и незаконное посягательство на имущество по-прежнему остаются в силе, поэтому пользователь, занимающийся скрапингом, может понести реальную ответственность, даже не нарушив данный закон. См. [инструкцию по предоставлению ИИ-агентам доступа к веб-ресурсам в режиме реального времени](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access) для ознакомления с аспектами, касающимися файла robots.txt и доступа сканеров.

### Является ли обучение модели ИИ на материалах, защищенных авторским правом, добросовестным использованием?

Это зависит от способа приобретения и конкуренции, а не только от преобразования. В деле Anthropic судья Алсуп постановил, что обучение на приобретенных книгах является добросовестным использованием, в то время как судья Бибас постановил, что обучение компании Ross Intelligence на аннотациях Westlaw для создания конкурирующего продукта таковым не является — это первый подобный проигрыш (Goodwin Procter, по состоянию на 17.09.2026 г.).

### В чём заключается различие между судебными решениями по делам Anthropic и Thomson Reuters, касающимися авторского права в сфере ИИ?

Компания Anthropic выиграла дело в части трансформационного обучения, но проиграла в части пиратства, что привело к урегулированию спора на сумму 1,5 миллиарда долларов в связи с примерно 500 000 пиратских книг (Copyright Alliance, по состоянию на 17.09.2026). Компания Ross Intelligence потерпела полное поражение, поскольку использовала лицензионный контент Westlaw для создания продукта, непосредственно конкурирующего с ним; данный исход связан скорее с рыночной конкуренцией, чем с самим методом обучения.

### Как команды, занимающиеся обработкой данных, могут снизить юридические риски при сборе обучающих данных?

Отслеживайте происхождение каждого входного сигнала, соблюдайте машиночитаемые сигналы отказа, такие как robots.txt и TDM Reservation Protocol, и отдавайте предпочтение лицензионным или приобретенным данным, а не «упрощениям», связанным с пиратством. Компания Cloudflare обнаружила, что лишь около 14 % из ведущих доменов установили какой-либо сигнал robots.txt для ИИ-ботов по состоянию на июнь 2025 года (Cloudflare Radar, данные от 17.09.2026), в результате чего большая часть уязвимостей по умолчанию осталась без внимания.

## Заключение

В этом году правовая ситуация в отношении данных для обучения ИИ разделилась на два отдельных направления: способы получения данных и способы их использования, и суды теперь готовы налагать санкции за нарушения в любой из этих областей независимо друг от друга.

- Способ получения данных теперь представляет собой отдельное основание для ответственности, не связанное с доктриной добросовестного использования.
- Конкурентное использование лишает защиты на основании добросовестного использования быстрее, чем пиратство: компания Ross Intelligence потерпела полное поражение, поскольку её инструмент напрямую конкурировал с Westlaw — испытание, с которым Anthropic и Meta никогда не сталкивались.
- Инфраструктура развивается быстрее, чем судебная система. В июле 2025 года Cloudflare изменила настройки своего веб-краулера по умолчанию; регуляторы ЕС последовали этому примеру несколькими месяцами позже.

Ожидайте появления большего числа соглашений, сочетающих урегулирование спора и лицензирование, подобных сделкам с UMG и Warner Music, вплоть до 2027 года, поскольку модель «сначала подать иск, затем заключить лицензионное соглашение» продолжает распространяться на тексты, изображения и музыку. Что касается практических аспектов обоснованного сбора данных, см. [создание конвейера данных на основе актуальных веб-данных](https://www.joinmassive.com/blog/building-a-rag-pipeline-on-live-web-data-without-stale-indexes).

## Источники

1. [Copyright Alliance, «Участие в урегулировании по делу Bartz против Anthropic», прочитано 17 сентября 2026 г.](https://copyrightalliance.org/participating-bartz-v-anthropic-settlement/)
2. [CNBC, «Судья дал предварительное согласие на урегулирование с авторами на сумму 1,5 млрд долларов», прочитано 17 сентября 2026 г.](https://www.cnbc.com/2025/09/25/judge-anthropic-case-preliminary-ok-to-1point5b-settlement-with-authors.html)
3. [Norton Rose Fulbright / Inside Tech Law, «Дело Бартц против Anthropic: достигнуто урегулирование после знакового решения по упрощённой процедуре и сертификации группового иска», прочитано 17 сентября 2026 г.](https://www.insidetechlaw.com/blog/2025/09/bartz-v-anthropic-settlement-reached-after-landmark-summary-judgment-and-class-certification)
4. [Goodwin Procter, «Суд отклонил аргумент о добросовестном использовании в деле об авторских правах на ИИ», прочитано 17.09.2026](https://www.goodwinlaw.com/en/insights/publications/2025/02/alerts-practices-ip-lit-court-rejects-fair-use-defense-in-ai-copyright-case)
5. [Jenner & Block, информационное сообщение для клиентов по делу «Thomson Reuters против Ross Intelligence», прочитано 17 сентября 2026 г.](https://www.jenner.com/en/news-insights/client-alerts/court-decides-that-use-of-copyrighted-works-in-ai-training-is-not-fair-use-thomson-reuters-enterprise-centre-gmbh-v-ross-intelligence-inc)
6. [Goodwin Procter, «Решение судьи Северного округа Калифорнии» (Kadrey против Meta), прочитано 17 сентября 2026 г.](https://www.goodwinlaw.com/en/insights/publications/2025/06/alerts-practices-aiml-northern-district-of-california-judge-rules)
7. [Copyright Alliance, «Решение по делу „Kadrey против Meta“», прочитано 17 сентября 2026 г.](https://copyrightalliance.org/kadrey-v-meta-decision/)
8. [Washington Post, «Министерство юстиции призывает судью вынести решение в пользу OpenAI и Microsoft в иске против New York Times», прочитано 17 сентября 2026 г.](https://www.washingtonpost.com/technology/2026/09/02/doj-urges-judge-rule-openai-microsoft-ny-times-lawsuit/)
9. [Axios, «Судебный иск о нарушении авторских прав между NYT, OpenAI и Microsoft», прочитано 17 сентября 2026 г.](https://www.axios.com/2026/09/08/nyt-openai-microsoft-copyright-lawsuit)
10. [IPWatchdog, «OpenAI не удалось добиться отклонения многоокружного коллективного иска в связи с результатами работы ChatGPT», прочитано 17 сентября 2026 г.](https://ipwatchdog.com/2025/10/28/openai-loses-bid-dismiss-multi-district-class-action-chatgpt-outputs/)
11. [Ropes & Gray, «Getty Images проиграла иск о нарушении авторских прав против Stability AI в первом в Великобритании...», прочитано 17 сентября 2026 г.](https://www.ropesgray.com/en/insights/viewpoints/102lvxe/getty-image-loses-copyright-infringement-claim-against-stability-ai-in-uks-first)
12. [Cleary Gottlieb, «Высший суд Великобритании вынес знаковое решение по делу Getty Images против Stability AI», прочитано 17.09.2026](https://www.clearyiptechinsights.com/2025/11/uk-high-court-issues-landmark-ruling-in-getty-images-v-stability-ai-with-narrow-trademark-infringement-win-for-getty-claim-of-secondary-copyright-infringement-fails/)
13. [CourtListener, материалы дела «Getty Images (US) Inc. против Stability AI Ltd.», прочитано 17 сентября 2026 г.](https://www.courtlistener.com/docket/71112094/getty-images-us-inc-v-stability-ai-ltd/)
14. [Music Business Worldwide, «Universal Music урегулировала судебный спор с Udio и заключила соглашение о лицензировании музыкальной платформы на базе искусственного интеллекта», прочитано 17 сентября 2026 г.](https://www.musicbusinessworldwide.com/universal-music-settles-udio-lawsuit-strikes-deal-for-licensed-ai-music-platform/)
15. [Hollywood Reporter, «Universal Music Group объявляет о заключении мирового соглашения с Udio», просмотрено 17 сентября 2026 г.](https://www.hollywoodreporter.com/music/music-industry-news/universal-music-group-announces-settlement-with-udio-1236414023/)
16. [Variety, о споре по поводу раскрытия доказательств в деле Midjourney Studios, просмотрено 17 сентября 2026 г.](https://variety.com/2026/film/news/midjourney-studios-ai-copyright-discovery-1236800902/)
17. [IPWatchdog, «В иске Warner Bros. утверждается, что нарушение авторских прав со стороны Midjourney носит „систематический“ и „умышленный“ характер», прочитано 17 сентября 2026 г.](https://ipwatchdog.com/2025/09/08/warner-bros-complaint-alleges-midjourneys-copyright-infringement-systematic-willful/)
18. [White & Case, «Веб-скрейпинг, условия использования веб-сайтов и Закон о компьютерном мошенничестве и злоупотреблении (CFAA): предварительный судебный запрет в отношении hiQ вновь подтвержден», прочитано 17 сентября 2026 г.](https://www.whitecase.com/insight-our-thinking/web-scraping-website-terms-and-cfaa-hiqs-preliminary-injunction-affirmed-again)
19. [Fenwick & West, «hiQ Labs вновь избежала судебного преследования: Девятый окружной апелляционный суд вновь подтвердил, что скрапинг данных не нарушает CFAA», прочитано 17 сентября 2026 г.](https://www.fenwick.com/insights/publications/hiq-labs-scrapes-by-again-the-ninth-circuit-reaffirms-that-data-scraping-does-not-violate-the-cfaa-1)
20. [Блог Cloudflare/Radar, «Соотношение сканирования и переходов с помощью ИИ в Radar», прочитано 17 сентября 2026 г.](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/)
21. [Cloudflare, пресс-релиз, «Cloudflare только что изменила подход к сбору данных в Интернете с помощью ИИ-сканеров в целом», прочитано 17 сентября 2026 г.](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/)
22. [Search Engine Journal, «Cloudflare исключила Perplexity из списка и заблокировала ей доступ к сканированию веб-сайтов», прочитано 17 сентября 2026 г.](https://www.searchenginejournal.com/cloudflare-delists-and-blocks-perplexity-from-crawling-websites/552899/)
23. [Norton Rose Fulbright, Inside Tech Law, «Машинно-читаемые отказы от участия и обучение ИИ: суд Гамбурга разъясняет исключения из авторского права», прочитано 17 сентября 2026 г.](https://www.insidetechlaw.com/blog/2025/12/machine-readable-opt-outs-and-ai-training-hamburg-court-clarifies-copyright-exceptions)
