Не по сути. Девятый окружной апелляционный суд в деле «hiQ Labs против LinkedIn» постановил, что скрапинг общедоступных страниц не нарушает Закон о компьютерных мошенничестве и злоупотреблениях (CFAA) (White & Case, просмотрено 17 сентября 2026 г.). Однако иски о нарушении договора, нарушении авторских прав и незаконном завладении движимым имуществом по-прежнему остаются в силе, поэтому лицо, занимающееся скрапингом, по-прежнему может понести реальную ответственность, даже не нарушив данный закон. См. Как предоставить ИИ-агентам доступ к веб-ресурсам в режиме реального времени что касается файла robots.txt и доступа поисковых роботов.
Судебные иски, связанные с данными для обучения ИИ: что это означает для разработчиков программ для сбора данных из Интернета
В сентябре 2025 года федеральный судья дал предварительное одобрение урегулированию на сумму 1,5 миллиарда долларов, что стало крупнейшей выплатой по делу об авторских правах в истории искусственного интеллекта. Основанием для иска послужило то, что компания Anthropic обучала свои модели на основе примерно 500 000 пиратских книг (Copyright Alliance, «Участие в урегулировании по делу Бартц против Anthropic», просмотр 17.09.2026). Уже одна только эта цифра должна привлечь внимание любого, кто зарабатывает на жизнь сбором данных.
За последние восемнадцать месяцев суды на двух континентах начали устанавливать четкие рамки в отношении того, как компании, занимающиеся искусственным интеллектом, и поставщики услуг по сбору данных могут получать обучающие данные, и эти рамки не всегда совпадают с тем, что предполагала отрасль. В данной статье рассматриваются основные судебные решения, их фактическое содержание, а также то, что необходимо изменить в своей деятельности командам по работе с данными и поставщикам инфраструктуры для сбора данных. Для ознакомления с техническими аспектами см. Как работает веб-парсинг.
Основные выводы
- Урегулирование спора с компанией Anthropic на сумму 1,5 млрд долларов свидетельствует о том, что причиной возникновения обязательств стало пиратство, а не обучение (Copyright Alliance, 2026).
- Компания Ross Intelligence не смогла воспользоваться аргументом о «добросовестном использовании», поскольку её инструмент на базе искусственного интеллекта напрямую конкурировал с рынком, на котором работает Westlaw; компаниям Anthropic и Meta этот вопрос не приходилось решать.
- Лишь 14 % ведущих доменов установили сигнал robots.txt для ИИ-ботов (Cloudflare Radar, 2025 г.).
- Уклонение от уплаты приведёт к внесению вас в чёрный список. Судебный иск для этого не потребуется.
Какие решения на самом деле принимают суды в отношении данных для обучения ИИ?
Суды признают, что способ получения обучающих данных может повлечь за собой юридическую ответственность, совершенно не связанную с тем, как эти данные впоследствии используются. В рамках урегулирования дела «Бартц против Anthropic» сумма компенсации составила примерно 3 000 долларов за каждое произведение из примерно 500 000 пиратских книг; эта цифра напрямую связана со способом их получения, а не с тем, как эти книги впоследствии использовались в процессе обучения (Copyright Alliance, «Участие в урегулировании дела «Бартц против Anthropic», по состоянию на 17.09.2026 г.).
В своём основном решении по делу «Бартц против Anthropic» судья Уильям Олсуп провёл чёткую границу, которой представители отрасли не ожидали в полной мере. Использование книг, приобретённых и отсканированных компанией Anthropic, для обучения было признано добросовестным использованием, «впечатляющим образом преобразующим», по его словам (Norton Rose Fulbright, Inside Tech Law, «Дело Бартц против Anthropic: достигнуто урегулирование после знакового решения по делу в порядке упрощённого судопроизводства», прочитан 17 сентября 2026 г.). Загрузка пиратских копий с целью создания постоянной научной библиотеки представляла собой отдельное действие и не являлась добросовестным использованием, независимо от того, как эти данные использовались впоследствии.
Это различие имеет большее значение, чем сама сумма урегулирования. Приобретение и использование в настоящее время представляют собой два разных правовых вопроса, и компания может добиться успеха в одном из них, но при этом понести серьёзное поражение в другом. Компания Anthropic достигла соглашения об урегулировании в августе 2025 года, и в следующем месяце судья Алсуп дал предварительное одобрение (CNBC, «Судья дал предварительное одобрение урегулированию на сумму 1,5 млрд долларов с авторами», 25 сентября 2025 года, просмотрено 17 сентября 2026 года).
Действительно ли хорошо финансируемая лаборатория по искусственному интеллекту подвергается меньшему правовому риску, чем небольшой сайт-скрейпер, использующий тот же пиратский источник? Не обязательно. Данное урегулирование показывает, что масштаб деятельности не защищает никого от исков, связанных с методом получения информации, если этот вопрос уже рассмотрен отдельно от вопроса о добросовестном использовании. См. что считается обучающими данными для ИИ в отношении механизмов, лежащих в основе дел, по которым выносятся эти решения.
Почему компания Thomson Reuters одержала победу над Ross Intelligence, если в деле о «добросовестном использовании» выиграла компания Anthropic?
Компания Thomson Reuters выиграла дело, поскольку Ross Intelligence создала продукт, непосредственно конкурирующий с её продукцией, на основе лицензионного контента, который не был разрешен к использованию в целях обучения. В феврале 2025 года судья Стефанос Бибас (окружной суд штата Делавэр) вынес частичное суммарное решение в пользу Thomson Reuters; это стало первым случаем, когда компания, занимающаяся искусственным интеллектом, проиграла дело на основании аргумента о добросовестном использовании обучающих данных (Goodwin Procter, «Суд отклонил аргумент о добросовестном использовании в деле об авторских правах в сфере ИИ», просмотр 17.09.2026).
Росс использовал аннотации Westlaw — редакционный контент, над созданием которого компания Thomson Reuters работала десятилетиями, — для обучения инструмента юридического поиска, который напрямую конкурировал с самим Westlaw. Судья Бибас счёл такое использование нетрансформативным и наносящим коммерческий ущерб рынку оригинального произведения (Jenner & Block, информационное сообщение для клиентов, прочитано 17 сентября 2026 г.).
Сравните это с делом «Кадрей против Meta». В июне 2025 года судья Винс Чабрия (Северный округ Калифорнии) вынес частичное суммарное решение в пользу Meta по вопросу добросовестного использования, несмотря на то что некоторые учебные книги были взяты из «теневых библиотек», поскольку истцы не смогли доказать, что использование со стороны Meta привело к размыванию рынка их произведений (Goodwin Procter, просмотрено 17.09.2026). Он осторожно отметил, что будущий истец, который сможет доказать размывание рынка, может выиграть дело там, где эти истцы потерпели неудачу (Copyright Alliance, «Решение по делу „Kadrey v. Meta“», прочитано 17.09.2026).
Итак, что же на самом деле отличает успешную защиту на основании «добросовестного использования» от неудачной? Оказывается, это рыночная конкуренция, а не механизм самого копирования.
В совокупности эти судебные решения указывают на то, что метод приобретения и функция конкурентного использования представляют собой два независимых критерия ответственности. Компания Anthropic проиграла дело в части приобретения (пиратства), несмотря на то, что выиграла в части преобразующего использования. Компания Ross проиграла дело в части конкурентного использования, несмотря на то, что использовала контент из лицензионного источника. Ни один из этих факторов сам по себе не гарантирует защиты.
Дела, которые по-прежнему находятся на рассмотрении в суде
Ряд крупнейших судебных дел, связанных с авторским правом в сфере искусственного интеллекта, по-прежнему остаются нерешенными, и их исход может еще больше изменить доктрину добросовестного использования. Объединенные иски «Нью-Йорк Таймс» и Гильдии авторов против OpenAI в настоящее время рассматриваются в рамках дела «In re OpenAI Copyright Litigation» под председательством судьи Сидни Стейна. По состоянию на сентябрь 2026 года в рамках данного дела активно проводится сбор доказательств, при этом дата судебного разбирательства пока не назначена (Washington Post, «Министерство юстиции США призывает судью вынести решение в пользу OpenAI и Microsoft в иске, поданном NY Times», 2 сентября 2026 г., прочитано 17 сентября 2026 г.).
В апреле 2025 года судья Стейн в основном отклонил ходатайство OpenAI и Microsoft об отклонении иска, разрешив рассмотрение большинства исковых требований и прямо отказавшись признать обучение ИИ «по своей сути преобразующим». В постановлении от 27 октября 2025 года он пошёл ещё дальше: Судья Стейн постановил, что сгенерированные ChatGPT краткие изложения сюжетов романов истцов сами по себе могут представлять собой нарушение авторских прав — это теория «результатов», отличная от вопроса об обучении (IPWatchdog, «OpenAI проиграла ходатайство об отклонении многоокружного группового иска в связи с результатами работы ChatGPT», 28 октября 2025 г., прочитано 17 сентября 2026 г.).
Это дело привлекло внимание и за пределами страны. 2 сентября 2026 года Министерство юстиции подало судебное заключение, в котором призвало суд вынести решение в пользу OpenAI и Microsoft («Washington Post», прочитано 17 сентября 2026 г.; Axios, «Судебный иск о нарушении авторских прав: NYT, OpenAI, Microsoft», 8 сентября 2026 г., прочитано 17 сентября 2026 г.).
Дело «Getty Images против Stability AI» разделилось по линии океана. 4 ноября 2025 года Высокий суд Великобритании постановил, что иск Getty об авторских правах не был удовлетворен, поскольку обучение модели Stability AI проходило за пределами Великобритании, однако признал факт нарушения прав на товарный знак, поскольку ранние результаты работы Stable Diffusion содержали водяной знак Getty (Ropes & Gray, по состоянию на 17.09.2026). Отдельное дело компании Getty в США, повторно поданное в окружной суд Северного округа Калифорнии, в апреле 2026 года выдержало ходатайство об отклонении исков о нарушении прав на товарный знак и размывании знака; судебное разбирательство назначено на январь–февраль 2028 года (реестр CourtListener, по состоянию на 17 сентября 2026 года).
Та же теория, согласно которой результаты работы ИИ, содержащие водяной знак бренда или узнаваемый производный контент, представляют собой нарушение прав, в настоящее время рассматривается одновременно в судах Великобритании и США. Иски об авторских правах становятся все более узконаправленными на основании юрисдикционных соображений и принципа трансформативного использования, однако иски, связанные с товарными знаками и результатами деятельности ИИ, заполняют пробел, образовавшийся в результате этих более узконаправленных решений.
Эта тенденция выходит за рамки текста. В период с июня по сентябрь 2025 года компании Disney, Universal и Warner Bros. подали иски против Midjourney в связи с генерацией изображений, и по состоянию на середину 2026 года в рамках объединенных дел продолжается спор о процедуре раскрытия доказательств (Variety, просмотрено 17.09.2026; IPWatchdog, «В иске Warner Bros. утверждается, что нарушение авторских прав со стороны Midjourney носит „систематический“ и „умышленный“ характер», прочитано 17 сентября 2026 г.). В музыкальной отрасли компания Universal Music Group достигла урегулирования с Udio в октябре 2025 года, соединив выплату компенсации с заключением лицензионного соглашения в отношении новой музыкальной платформы на базе искусственного интеллекта, а Warner Music урегулировала споры как с Udio, так и с Suno в ноябре 2025 года (Music Business Worldwide, прочитано 17.09.2026). Компания Sony по-прежнему ведёт судебные разбирательства с обеими платформами. Давление не ограничивается лишь судебными залами: см. почему доступ к веб-данным становится всё сложнее в отношении инфраструктурной составляющей той же проблемы.
Применимо ли что-либо из вышесказанного к сбору открытых данных, а не только к обучению ИИ?
Сбор данных с общедоступных веб-страниц сам по себе не является федеральным преступлением, однако это не означает, что он не сопряжён с рисками. Дело «hiQ Labs против LinkedIn» разрешило этот вопрос в Девятом окружном апелляционном суде: скрапинг общедоступных страниц не нарушает положение Закона о компьютерном мошенничестве и злоупотреблении (CFAA) о «несанкционированном доступе», хотя иски о нарушении договорных обязательств, авторских прав и неправомерном проникновении по-прежнему остаются в силе (White & Case, «Сбор данных из Интернета, условия использования веб-сайтов и Закон о компьютерном мошенничестве и злоупотреблении (CFAA)», просмотр 17.09.2026).
Данное постановление было вынесено в рамках повторного рассмотрения дела после того, как решение Верховного суда по делу «Ван Бюрен» сузило сферу применения Закона о компьютерном мошенничестве и злоупотреблении (CFAA). В ходе того же судебного разбирательства было также установлено, что компания hiQ по-прежнему нарушала Условия предоставления услуг LinkedIn — это отдельное договорное требование, на которое не повлияло решение по делу CFAA (Fenwick & West, «hiQ Labs Scrapes By Again», прочитано 17 сентября 2026 г.). На практике вопрос о реальном риске сместился с «является ли это взломом» на «имел ли я разрешение или лицензию».
Если сбор данных с общедоступных страниц не является хакерством, почему компании по-прежнему подвергаются блокировке и судебным искам по этому поводу? Потому что иммунитет, предусмотренный Законом о компьютерном мошенничестве и злоупотреблении (CFAA), никогда не распространялся на иски, связанные с нарушением договорных обязательств, авторских прав или незаконного проникновения, и именно в этой сфере в настоящее время возникает большинство споров.
Отдельный инцидент, произошедший в августе 2025 года, продемонстрировал, насколько быстро могут действовать неформальные меры реагирования. Компания Cloudflare сообщила, что Perplexity использовала незадекларированные, сменяющиеся пользовательские агенты и номера автономных систем (ASN) для продолжения сканирования тестовых доменов, на которых через файл robots.txt было явно запрещено использование любых сканеров (Search Engine Journal, «Cloudflare исключила Perplexity из списка и заблокировала сканирование веб-сайтов», прочитано 17 сентября 2026 г.). Компания Cloudflare лишила Perplexity статуса «проверенного бота» и заблокировала её сканер по всей сети без подачи судебного иска.
Компания Perplexity публично оспорила интерпретацию событий со стороны Cloudflare (Search Engine Journal, прочитано 17 сентября 2026 г.). Независимо от того, как разрешится этот спор, урок остаётся прежним: если вас поймают на обходе объявленного блокирования, доступ вашего сканера к значительной части Интернета может быть прекращён в одночасье. Для более подробного изучения правовых границ см. этичные методы веб-парсинга.
Как реагируют поставщики инфраструктуры
Поставщики инфраструктурных услуг перестали ждать решений судов и начали самостоятельно изменять настройки по умолчанию. С 1 июля 2025 года компания Cloudflare установила блокировку несанкционированных ИИ-краулеров в качестве настройки по умолчанию для каждого нового домена, заменив прежнюю модель «блокировка по согласию» на модель «доступ по отказу» (Cloudflare, пресс-релиз, «Cloudflare кардинально изменила подход к сбору данных в Интернете с помощью ИИ-краулеров», прочитано 17 сентября 2026 г.).
Cloudflare сопроводила это изменение введением механизма «Pay Per Crawl» (оплата за сканирование), позволяющего владельцам сайтов взимать плату с сканеров за доступ; по заявлению компании, с 15 сентября 2026 года этот механизм будет преобразован в систему «Pay Per Use» (оплата за использование), которая по умолчанию будет блокировать сканеры смешанного назначения на страницах, содержащих рекламу (Блог Cloudflare, просмотрено 17 сентября 2026 г.). В период с 19 по 26 июня 2025 года система Cloudflare Radar зафиксировала, что система Claude компании Anthropic совершала примерно 71 000 запросов на HTML-страницы на каждый переход, который она направляла обратно на сканируемые сайты (Блог Cloudflare/Radar, «Соотношение сканирования и переходов ИИ в Radar», просмотрено 17 сентября 2026 г.).
Большинство владельцев сайтов до сих пор не установили никаких ограничений. GPTBot стал самым заблокированным роботом-пауком в том же наборе данных: его доступ был запрещён 312 из 3 816 доменов, имеющих файл robots.txt, в то время как явно разрешили его доступ лишь 61 домен (блог Cloudflare/Radar, данные на 17 сентября 2026 г.).
Регулирующие органы начинают рассматривать машиночитаемые сигналы как единственные, имеющие значение. 10 декабря 2025 года Ганзейский высший региональный суд Гамбурга в деле «Кнешке против LAION» (OLG Hamburg, 5 U 104/24) постановил, что отказ от участия в процедуре извлечения текста и данных имеет юридическую силу только в том случае, если он представлен в машиночитаемом формате. К таким формам относятся файл robots.txt, заголовок X-Robots-Tag или протокол TDM Reservation Protocol. Однако положение, скрытое в условиях использования веб-сайта, изложенных на естественном языке, не считается таковым (Norton Rose Fulbright, Inside Tech Law, «Машинно-читаемые отказы от участия и обучение ИИ: суд Гамбурга разъясняет исключения из авторского права», прочитано 17 сентября 2026 г.).
Данный подход соответствует Кодексу практики ЕС в области общего искусственного интеллекта (GPAI), опубликованному в июле 2025 года и подписанному к июлю 2026 года 23 разработчиками ИИ, включая OpenAI, Google, Anthropic и Microsoft, — все они взяли на себя обязательство осуществлять сканирование с помощью ботов, поддерживающих файл robots.txt, и соблюдать машиночитаемые ограничения.
В данном вопросе поставщики инфраструктуры и регулирующие органы фактически опережают суды. В июле 2025 года компания Cloudflare изменила свою политику в отношении роботов-сканеров по умолчанию, а стандарт «машиночитаемого сигнала», установленный судом Гамбурга, появился задолго до того, как судебная практика США урегулировала аналогичные вопросы, касающиеся сбора данных и лицензирования. Команды, ожидающие разрешения судебных споров перед корректировкой своей политики, могут обнаружить, что стандартные настройки уже изменились без их ведома.
Что следует сделать сейчас специалистам по сбору данных и командам, занимающимся обработкой данных
Команды по работе с данными, которые относятся к вопросу прослеживаемости как к второстепенному, подвергаются наибольшему риску, связанному с этими судебными решениями. Одно только урегулирование по делу Бартца обошлось примерно в 3 000 долларов за каждое пиратское произведение из числа около 500 000 книг (Copyright Alliance, по состоянию на 17.09.2026 г.) — эту цифру любая юридическая команда может умножить на количество нелицензионных материалов в своём собственном архиве.
1. Осуществлять сквозное отслеживание происхождения данных. Точно знайте, откуда поступил каждый входной материал для обучения или сбора данных, а также был ли он получен по лицензии, приобретен или извлечен из открытых источников. Дело компании Anthropic демонстрирует, что при определении ответственности регулирующие органы и суды будут отделять способ получения данных от их последующего использования.
2. Учитывайте машиночитаемые сигналы об отказе. Файлы robots.txt, ai.txt и протокол резервирования TDM являются стандартами, которые в настоящее время признают регулирующие органы, даже в тех юрисдикциях, где данный вопрос пока не стал обязательным.
3. Отдавайте предпочтение лицензированию, а не обходным путям, связанным с пиратством. Права на приобретенные или лицензированные наборы данных имеют юридическую силу в суде, в отличие от пиратских архивов, поскольку победа компании Anthropic в деле о «добросовестном использовании» в отношении приобретенных книг никоим образом не снизила её ответственности за пиратские копии, которые находились рядом с ними в рамках того же самого учебного цикла.
4. Избегайте тактик уклонения от раскрытия личности. Смена пользовательских агентов с целью обойти объявленную блокировку приводит к внесению в черный список. Судебное разбирательство при этом не требуется. Подробнее о в чем на самом деле заключается скрапинг с использованием ИИ является полезной отправной точкой для проведения аудита вашего собственного конвейера.
Провенанс является одним из элементов обоснованной стратегии обеспечения достоверности источников данных, но не отражает всю картину в целом. Сеть прокси-серверов Massive для домашнего использования работает на реальных пользовательских устройствах в более чем 195 странах; каждое устройство подключается через SDK Massive и предоставляет чистый HTML-код или формат Markdown из любого общедоступного источника в любом месте. Сеть прошла аудит SOC 2 и соответствует требованиям GDPR; это один из элементов обоснованной стратегии защиты данных, но не юридический щит и не замена юридической консультации.
Заключение
В этом году правовая ситуация в отношении данных для обучения ИИ разделилась на два отдельных направления: способы сбора данных и способы их использования, и суды теперь готовы налагать санкции за нарушения в любой из этих областей независимо друг от друга.
- Метод приобретения теперь представляет собой отдельный учетный счет обязательств, не связанный со справедливой стоимостью.
- Использование в конкурентных целях лишает возможности защищаться на основании «добросовестного использования» гораздо быстрее, чем пиратство: компания Ross Intelligence потерпела полное поражение, поскольку её инструмент напрямую конкурировал с Westlaw — это испытание, с которым компаниям Anthropic и Meta никогда не приходилось сталкиваться.
- Развитие инфраструктуры опережает работу судебных органов. В июле 2025 года компания Cloudflare изменила настройки своего сканера по умолчанию; регуляторы ЕС последовали этому примеру несколькими месяцами позже.
Ожидается, что до 2027 года будет заключаться всё больше сделок, сочетающих урегулирование споров и предоставление лицензий, подобных сделкам UMG и Warner Music, поскольку модель «сначала подать иск, а затем предоставить лицензию» продолжает распространяться на тексты, изображения и музыку. Что касается практических аспектов обеспечения обоснованности источников, см. создание конвейера обработки данных на основе оперативных веб-данных.
Источники
- Copyright Alliance, «Участие в деле «Бартц против Anthropic Settlement»», прочитано 17 сентября 2026 г.
- CNBC, «Судья дал предварительное согласие на урегулирование спора с авторами на сумму 1,5 млрд долларов», прочитано 17 сентября 2026 г.
- Norton Rose Fulbright / Inside Tech Law, «Дело Бартц против Anthropic: достигнуто урегулирование после вынесения знакового решения в порядке упрощённого производства и признания иска коллективным», прочитано 17 сентября 2026 г.
- Goodwin Procter, «Суд отклонил аргумент о добросовестном использовании в деле об авторских правах, связанном с ИИ», прочитано 17 сентября 2026 г.
- Jenner & Block, информационное сообщение для клиентов по делу «Thomson Reuters против Ross Intelligence», прочитано 17 сентября 2026 г.
- Goodwin Procter, «Решение судьи Северного округа Калифорнии» (дело «Kadrey против Meta»), просмотрено 17 сентября 2026 г.
- Copyright Alliance, «Решение по делу „Kadrey против Meta“», просмотрено 17 сентября 2026 г.
- «Washington Post», «Министерство юстиции призывает судью вынести решение в пользу OpenAI и Microsoft в иске против New York Times», прочитано 17 сентября 2026 г.
- Axios, «Судебный иск о нарушении авторских прав: NYT, OpenAI, Microsoft», прочитано 17 сентября 2026 г.
- IPWatchdog, «OpenAI не удалось добиться отклонения многоокружного коллективного иска в связи с результатами работы ChatGPT», прочитано 17 сентября 2026 г.
- Ropes & Gray, «Getty Images проиграла иск о нарушении авторских прав против Stability AI в первом в Великобритании...», прочитано 17 сентября 2026 г.
- Cleary Gottlieb, «Высокий суд Великобритании вынес знаковое решение по делу Getty Images против Stability AI», просмотрено 17 сентября 2026 г.
- CourtListener, список дел по делу «Getty Images (US) Inc. против Stability AI Ltd.», просмотрено 17 сентября 2026 г.
- Music Business Worldwide, «Universal Music урегулировала судебный спор с Udio и заключила соглашение о лицензировании платформы для музыки, созданной с помощью ИИ», прочитано 17 сентября 2026 г.
- Hollywood Reporter, «Universal Music Group объявляет о достижении соглашения с Udio», прочитано 17 сентября 2026 г.
- Издание «Variety» о споре вокруг компании Midjourney Studios, прочитано 17 сентября 2026 г.
- IPWatchdog, «В иске компании Warner Bros. утверждается, что нарушение авторских прав со стороны Midjourney носит „систематический“ и „умышленный“ характер», прочитано 17 сентября 2026 г.
- White & Case, «Веб-скрейпинг, условия использования веб-сайтов и Закон о компьютерном мошенничестве и злоупотреблении (CFAA): предварительный судебный запрет в отношении компании hiQ вновь подтвержден», прочитано 17 сентября 2026 г.
- Fenwick & West, «hiQ Labs вновь избежала наказания: Апелляционный суд девятого округа вновь подтвердил, что сбор данных не нарушает Закон о компьютерном мошенничестве и злоупотреблении (CFAA)», прочитано 17 сентября 2026 г.
- Блог Cloudflare/Radar, «Соотношение сканирования и переходов в Radar на основе искусственного интеллекта», прочитано 17 сентября 2026 г.
- Cloudflare, пресс-релиз «Cloudflare кардинально изменила подход к сбору данных в Интернете с помощью ИИ-краулеров», прочитано 17 сентября 2026 г.
- Search Engine Journal, «Cloudflare исключает Perplexity из списка и блокирует его доступ к сканированию веб-сайтов», прочитано 17 сентября 2026 г.
- Norton Rose Fulbright, Inside Tech Law, «Машинно-читаемые механизмы отказа и обучение ИИ: суд Гамбурга разъяснил исключения из авторского права», прочитано 17 сентября 2026 г.
Часто задаваемые вопросы
Это зависит от приобретения и конкуренции, а не только от трансформации. В деле Anthropic судья Алсуп постановил, что обучение с использованием приобретенных книг является добросовестным использованием, в то время как судья Бибас постановил, что обучение компании Ross Intelligence с использованием аннотаций Westlaw для создания конкурирующего продукта таковым не является; это стало первым подобным проигрышем (Goodwin Procter, просмотр 17.09.2026).
Компания Anthropic одержала победу в вопросе трансформационного обучения, но потерпела поражение в вопросе пиратства, что привело к заключению соглашения о выплате 1,5 миллиарда долларов в связи с примерно 500 000 пиратских книг (Copyright Alliance, по состоянию на 17.09.2026). Компания Ross Intelligence потерпела полное поражение, поскольку использовала лицензионный контент Westlaw для создания продукта, непосредственно конкурирующего с ним; этот исход был обусловлен рыночной конкуренцией, а не самим методом обучения.
Отслеживайте происхождение каждого входного данного, соблюдайте машиночитаемые сигналы отказа, такие как robots.txt и протокол TDM Reservation Protocol, и отдавайте предпочтение лицензионным или приобретенным данным, а не упрощениям, связанным с пиратством. По данным Cloudflare, по состоянию на июнь 2025 года лишь около 14 % ведущих доменов установили какой-либо сигнал robots.txt для ИИ-ботов (Cloudflare Radar, данные на 17 сентября 2026 года), в результате чего большая часть уязвимостей по умолчанию остаётся неустраненной.
