# Настройки по умолчанию для ИИ-краулеров Cloudflare от 15 сентября: что изменилось для агентов и команд по работе с данными

15 сентября 2026 года компания Cloudflare изменила значение термина «заблокировано» в отношении трафика искусственного интеллекта. Для новых доменов, получающих доход от рекламы, теперь по умолчанию запрещен доступ для сканеров AI Training, а на страницах с рекламой блокируются агенты AI, при этом доступ к поиску остается открытым. По данным Cloudflare, более 20 % веб-ресурсов находятся за пределами его сети ([Блог Cloudflare](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026 г.), поэтому установленные здесь настройки по умолчанию фактически действуют как политика для одной пятой части Интернета. Спустя две недели мы расскажем, что именно изменилось, кого это затрагивает и что следует предпринять командам, использующим ИИ-агенты или конвейеры данных.

> **Основные выводы**
>
> - С 15 сентября 2026 года Cloudflare классифицирует трафик ИИ по трём категориям («Поиск», «Обучение», «Агент»), а для новых доменов, монетизируемых за счёт рекламы, по умолчанию запрещён трафик категории «Обучение ИИ», а трафик категории «Агент» блокируется на страницах с рекламой ([Блог Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026).
> - В июне 2026 года 52 % запросов сканеров, зарегистрированных Cloudflare, были связаны с обучением ИИ, что представляет собой рост по сравнению с 22 % весной 2025 года ([Блог Cloudflare](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026).
> - Если ваш агент загружает страницы от имени пользователя, вы теперь попадаете в категорию «Агент». Планируйте с учётом различий на уровне отдельных страниц, а не правил на уровне сайта.

## Что именно изменилось 15 сентября?

15 сентября 2026 года Cloudflare изменила подход к управлению трафиком ИИ со стороны своих средств контроля ботов ([Блог Cloudflare, «Have it both ways»](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Настройки «Блокировать» и «Блокировать на страницах с рекламой» теперь также применяются к краулерам смешанного назначения — ботам, которые собирают страницы как для поиска, так и для ИИ. Единый переключатель «Блокировать ИИ-ботов» выводится из использования, а новая настройка «Запретить обучение ИИ» позволяет сайту оставаться в результатах поиска, одновременно отказывая в доступе для обучения. Функция «Управляемый файл robots.txt» также преобразуется в «Синхронизацию настроек для ботов». Практическое изменение заключается в разделении. Ранее Cloudflare рассматривала «ботов ИИ» как единую категорию. Теперь трафик ИИ разбивается на три категории: «Поиск», «Обучение» и «Агент», и для каждой из них предусмотрен отдельный переключатель. Новым доменам предлагается один из двух наборов настроек в зависимости от того, получает ли сайт доход от рекламы:

| Категория | Что она охватывает | Новый домен с монетизацией за счёт рекламы | Новый домен без рекламы |
|--------|----------------|-------------------------|-------------------|
| Поиск | Индексирование для результатов поиска | Разрешено | Разрешено |
| Обучение | Сбор контента для обучения моделей | Запретить обучение ИИ | Разрешено |
| Агент | Загрузка страниц по актуальному запросу пользователя | Заблокировано на страницах с рекламой | Разрешено |

*Предустановки приведены в публикации Cloudflare от 15 сентября 2026 года «[Have it both ways](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/)».*

Таким образом, изменения в сети произошли не в одночасье. По словам Cloudflare, настройки существующих клиентов переносятся автоматически, а новые предустановки применяются только при подключении клиентом нового домена. Изменилась исходная точка для каждого нового сайта с этого момента, а в сети такого масштаба количество таких точек быстро растёт.

## Почему Cloudflare разделяет сканеры на «Поиск», «Обучение» и «Агент»?

Cloudflare разделила свои механизмы управления ИИ, поскольку трафик обучения превзошёл поисковый трафик. По состоянию на июнь 2026 года 52 % запросов сканеров, зафиксированных Cloudflare, были связаны с обучением ИИ — по сравнению с 22 % весной 2025 года, а сканеры смешанного назначения составляли более 36 % активности ([Cloudflare, «Content Independence Day, one year on»](https://blog.cloudflare.com/agentic-internet-bot-report/), 2026 г.). Доля сканирования, предназначенного исключительно для поиска, в настоящее время незначительна и продолжает сокращаться. Для владельца сайта это означает, что большинство ИИ-ботов, посещающих его страницы, собирают контент для моделей, а не направляют читателей обратно через результаты поиска, и один-единственный переключатель «ИИ-боты» не позволял различить эти случаи.

Издатели считают это несбалансированной сделкой. Компания TollBit, которая помогает издателям предоставлять лицензии на контент компаниям, занимающимся искусственным интеллектом, отслеживает эту ситуацию в своём [отчёте «State of the Bots»](https://tollbit.com/state-of-the-bots/). В выпуске за 1-й и 2-й кварталы 2026 года, охватывающем ИИ-ботов от 40 поставщиков на 3 906 издательствах, было показано, что соотношение «скрейпинг к рефералам» выросло со 150:1 в 1-м квартале до 227:1 во 2-м квартале (TollBit, 2026 г., как сообщил [Digiday](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/) в августе 2026 года). Это сотни посещений ботами на каждого человека, который переходит по ссылке.

Так почему бы просто не заблокировать всё? Потому что, согласно той же сентябрьской публикации, менее 1 % сайтов Cloudflare блокируют поисковые боты, в то время как 17 % используют какие-либо средства для блокировки данных для обучения ([Блог Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Сайты заинтересованы в трафике от Google. Просто они не хотят бесплатно предоставлять данные для обучения. Разделение на три категории позволяет им соглашаться на одно и отказываться от другого.

<!-- [УНИКАЛЬНЫЙ ВЗГЛЯД] -->
Для всех, кто разрабатывает продукты искусственного интеллекта, осуществляющие просмотр веб-страниц от имени пользователя, важна именно категория «Агент». Очевидно, что краулеры для обучения окажутся в затруднительном положении. Агенты — это более новое явление, и теперь у них есть собственный переключатель и собственное значение по умолчанию, вместо того чтобы делить один переключатель «ИИ-боты» с краулерами для обучения.

## Что такое «подконтрольный» краулер смешанного назначения?

Cloudflare определяет подконтрольный краулер смешанного назначения как краулер, оператор которого предоставляет владельцам сайтов возможность отказаться от обучения ИИ (через файл robots.txt или аналогичный стандарт), средства управления отказом от ИИ-резюме, прозрачность использования для обучения на уровне URL, а также гарантию того, что отказ не повлияет на позиции в поисковой выдаче ([Блог Cloudflare](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), 2026). Cloudflare называет Applebot, Bingbot и Googlebot «ответственными краулерами смешанного назначения». Компания относит Amazon, Anthropic, Meta и OpenAI к категории «ответственных операторов с разделенными функциями», поскольку они используют отдельные краулеры для поиска и для обучения. Ответственные краулеры смешанного назначения по-прежнему допускаются для поиска на сайтах, выбравших опцию «Запретить обучение ИИ». Все остальные краулеры, предназначенные для обучения, блокируются на таких сайтах.

Это создаёт чёткий стимул. Если вы используете сканер, единственный способ остаться желанным гостем — разделить свои цели или предоставить сайтам реальный контроль над каждой из них. Единый бот, выполняющий все задачи, теперь становится самым простым объектом для блокировки.

## Модель «Оплата за сканирование» сменяется моделью «Оплата за использование»

В рамках прежней модели Cloudflare — «Оплата за сканирование» — сайты могли взимать с ИИ-сканеров плату за каждый запрос на страницу. В июле 2026 года Cloudflare заявила, что будет выплачивать вознаграждение издателям не только при загрузке страницы, но и в тех случаях, когда их контент формирует ответ ИИ. В качестве первых партнёров были названы компании, занимающиеся поиском на основе ИИ: Ceramic.ai и You.com ([The Next Web](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers), 2026). Это представляет собой реальный сдвиг в том, что именно становится предметом ценообразования. Сканирование представляет собой отдельный запрос, тогда как «использование» — это момент, когда контент попадает в ответ, который кто-то читает. Для издателей это более тесно увязывает оплату с реальной ценностью. Для компаний, занимающихся ИИ, это означает, что стоимость контента может начать зависеть от использования, а не от объёма, что изменяет расчёты относительно целесообразности загрузки страницы вообще.

Мы уже рассматривали более раннюю версию этой модели, а также причины, по которым открытый Интернет начал закрываться для ботов, в статье [«Закрывающийся Интернет: блокировка ИИ-краулеров, оплата за сканирование и что это означает для агентов»](https://www.joinmassive.com/blog/the-closing-web-ai-crawler-blocking-pay-per-crawl-and-what-it-means-for-agents).

## Что следует делать командам, запускающим ИИ-агентов?

Начните с того, что примите тот факт: доступ теперь варьируется от страницы к странице. В рамках новой модели монетизации за счёт рекламы агент может получить доступ к странице с ценами на сайте, а затем быть заблокирован при попытке просмотра расположенной рядом статьи, содержащей рекламу.

Практический контрольный список:

1. **Определите, к какой категории вы относитесь.** Загрузка страницы по запросу пользователя относится к трафику агента. Сбор страниц для тонкой настройки модели относится к обучению. Маркируйте их отдельно в своих журналах, поскольку в Интернете к ним теперь применяются разные правила.
2. **Будьте готовы к разным ответам для разных страниц.** «Блокировка на страницах с рекламой» означает, что один и тот же домен может давать как положительный, так и отрицательный ответ. Разрабатывайте механизмы повторных попыток и альтернативных решений для каждого URL-адреса, а не для всего домена.
3. **Рассматривайте блокировки как сигналы.** Блокировка в рамках этих настроек отражает заявленное предпочтение издателя. Регистрируйте её в журнале и обходите с помощью лицензионного или структурированного источника, если таковой имеется.
4. **Следите за программами с оплатой за использование.** Если источник, от которого вы зависите, присоединяется к платной программе, оплата может оказаться дешевле, чем разработка обходных решений.
5. **Разделяйте рабочие нагрузки и идентифицируйте их.** Если вы обрабатываете как обучающий трафик, так и трафик агентов, размещайте их под разными идентификаторами, чтобы один не привёл к блокировке другого. Cloudflare также реализует программу «подписанных агентов»: агенты, управляемые конечным пользователем, могут подписывать свои HTTP-запросы с помощью Web Bot Auth — криптографического стандарта подписи сообщений, — чтобы Cloudflare могла подтвердить их подлинность ([Документация Cloudflare, Подписанные агенты](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)). Если вы используете агенты в любом масштабе, вам стоит ознакомиться с этой информацией.

<!-- [УНИКАЛЬНЫЙ АНАЛИЗ] -->
Стоит обратить внимание на одну ловушку. В случае конвейеров агентов наиболее серьезные сбои чаще всего связаны не с жесткими блокировками, которые легко заметить. Страницы проверки (Challenge Pages) самой Cloudflare представляют собой простой случай: каждая из них содержит заголовок `cf-mitigated: challenge`, а тип её содержимого всегда равен `text/html`, независимо от того, какой ресурс вы запросили ([Документация Cloudflare, Обнаружение ответа страницы проверки](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/)). Проверьте наличие этого заголовка, прежде чем приступать к разбору данных. Более сложным случаем является «бесшумная» частичная страница: запрос возвращает статус 200, но тело запроса представляет собой страницу-заполнитель (интерстициал), оболочку JavaScript или урезанную версию статьи. Проверяйте, что именно было возвращено, а не только код статуса. Наличие минимальной длины содержимого или проверка наличия элемента DOM, который должен присутствовать на реальной странице, позволяют выявить большинство таких случаев.

## Как Massive соответствует новым настройкам по умолчанию Cloudflare

Massive предоставляет сеть доступа к устройствам и стек рендеринга, который доставляет чистый HTML или Markdown с общедоступных страниц в любой из более чем 195 стран. Клиенты осуществляют свои собственные операции на этой основе. Настройки ИИ издателей являются открытыми сигналами, и команды, с которыми мы сотрудничаем, рассматривают их как исходные данные для формирования собственной политики, а не как препятствия, которые необходимо обходить.

Функция [Web Render API](https://docs.joinmassive.com/web-render/overview) возвращает отрендеренные страницы в формате Markdown для конвейеров LLM и позволяет клиентам осуществлять геотаргетирование запросов по стране, региону или городу. Что касается прокси-серверов для частного использования, каждая учетная запись также ведёт собственный [список заблокированных доменов](https://docs.joinmassive.com/residential/domain-blocking), благодаря чему команда может блокировать запросы к любому сайту, доступ к которому она решила запретить. Список вмещает до 1 000 доменов, и запрос на заблокированный домен отклоняется с ошибкой 452 (Disallowed Content) ещё до того, как он достигнет сайта. Если ваш набор агентов сталкивается с новыми настройками по умолчанию, ознакомьтесь со статьёй [«Почему ИИ-агенты блокируются на IP-адресах центров обработки данных и как это исправить»](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it) или вернитесь к полному руководству по [«Как предоставить ИИ-агентам доступ к веб-ресурсам в режиме реального времени»](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access). Что касается правовых аспектов данных для обучения, ознакомьтесь с [судебными разбирательствами по поводу данных для обучения ИИ, о которых должна знать каждая команда, работающая с веб-данными](https://www.joinmassive.com/blog/ai-training-data-lawsuits-web-scrapers).

## Часто задаваемые вопросы

### Заблокировала ли Cloudflare все ИИ-краулеры 15 сентября 2026 года?

Нет. Новые настройки по умолчанию применяются к новым доменам, подключаемым к Cloudflare, а существующие настройки были перенесены автоматически. Поисковый трафик по умолчанию разрешён повсеместно. Трафик, связанный с обучением и агентами, по умолчанию ограничивается только на новых доменах, монетизируемых за счёт рекламы, согласно сообщению Cloudflare от 15 сентября 2026 года.

### Блокируется ли Googlebot новыми настройками Cloudflare?

Нет — на сайтах, где используется настройка «Запретить обучение ИИ». Cloudflare классифицирует Googlebot, Bingbot и Applebot как ответственные сканеры смешанного назначения, которые по-прежнему допускаются для поиска. Однако сайты, выбравшие полную настройку «Block», теперь блокируют и краулеры смешанного назначения, что может повлиять на видимость в поисковой выдаче.

### В чём разница между моделями «Pay Per Crawl» и «Pay Per Use»?

В рамках модели «Pay Per Crawl» с ИИ-сканеров взималась плата за каждый запрос. Модель «Pay Per Use», объявленная в июле 2026 года, предусматривает выплату вознаграждения издателям, когда их контент лежит в основе ответа ИИ. Согласно материалам The Next Web, в число первых партнёров вошли Ceramic.ai и You.com.

### Какую долю трафика сканеров в настоящее время составляет обучение ИИ?

По данным Cloudflare на июнь 2026 года, 52 % запросов сканеров в её сети были связаны с обучением ИИ, что представляет собой рост по сравнению с 22 % весной 2025 года. На долю сканеров смешанного назначения приходилось более 36 % всей активности.

## Итог

- В настоящее время Cloudflare рассматривает трафик поисковых систем, обучения и агентов как три отдельных параметра, каждый из которых имеет собственный переключатель и собственное значение по умолчанию для новых доменов.
- Для новых доменов, монетизируемых за счёт рекламы, по умолчанию запрещён трафик обучения, а агенты блокируются на рекламных страницах.
- Модель «Pay Per Use» (оплата по факту использования) предусматривает выплату издателям вознаграждения за ответы, а не за запросы.
- Разработчикам агентов следует планировать доступ на уровне отдельных страниц, проверять каждый ответ на наличие заголовка `cf-mitigated: challenge` и регистрировать каждый случай блокировки как заявленное предпочтение издателя.
- Что стоит отслеживать дальше: какие компании, занимающиеся искусственным интеллектом, присоединятся к модели «Pay Per Use» и сколько агентов зарегистрируются в качестве [подписанных агентов](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/).

Хотите увидеть, как на практике выглядят рендерированные запросы с геотаргетированием? Начните с [Web Render API обзора](https://docs.joinmassive.com/web-render/overview).

## Источники

- Cloudflare, [«Получите и то, и другое: оставайтесь заметными в поиске, запрещая при этом обучение ИИ»](https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/), прочитано 25.09.2026
- Cloudflare, [«Content Independence Day: год спустя»](https://blog.cloudflare.com/agentic-internet-bot-report/), прочитано 25.09.2026
- The Next Web, [«Cloudflare устанавливает крайний срок для ИИ-сканеров — сентябрь»](https://thenextweb.com/news/cloudflare-block-ai-crawlers-pay-publishers), прочитано 25 сентября 2026 г.
- Документация Cloudflare, [Подписанные агенты](https://developers.cloudflare.com/bots/concepts/bot/signed-agents/)
- Документация Cloudflare, [«Обнаружение ответа страницы с проверкой»](https://developers.cloudflare.com/cloudflare-challenges/challenge-types/challenge-pages/detect-response/), прочитано 28 сентября 2026 г.
- TollBit, [«Состояние ботов (1-й и 2-й кварталы 2026 г.)»](https://tollbit.com/state-of-the-bots/)
- Digiday, [«Согласно отчёту, европейские издатели в большей степени страдают от сбора данных ботами с искусственным интеллектом»](https://digiday.com/media/european-publishers-are-getting-hit-harder-by-ai-bot-scraping-report-finds/) (данные TollBit «Состояние ботов»)
