Аннотация: Визуализация данных под брендом «Massive», демонстрирующая, как трафик ботов превосходит трафик пользователей на карте глобальной сети; тёмный фон с оранжевыми акцентными полосами.
Все публикации

Состояние отрасли веб-данных: 3-й квартал 2026 года

Ryan Turner
Ryan Turner · Head of Innovation
Открыть markdown

В 2025 году объем автоматизированного трафика превысил объем трафика, генерируемого людьми, в открытом Интернете, и с тех пор эта тенденция только усиливается. В настоящее время на долю ботов приходится более 53 % всего веб-трафика, в то время как доля активности людей сократилась до 47 % и продолжает снижаться (Imperva/Thales, Отчет о вредоносных ботах за 2026 год). В то же время издатели впервые создают реальную инфраструктуру для взимания платы за этот трафик, а не просто пытаются его блокировать. Таково состояние индустрии веб-данных в преддверии 4-го квартала 2026 года: она стала масштабнее, более автоматизированной, в большей степени опирающейся на искусственный интеллект и более конкурентной, чем год назад.

Основные выводы
  • В 2025 году доля автоматизированного трафика превысила 53 % от общего объема веб-трафика, причем только на долю вредоносных ботов пришлось 40 %, что выше показателя предыдущего года (37 %) (Отчет Imperva/Thales о вредоносных ботах за 2026 год).
  • В настоящее время искусственный интеллект является основным новым источником спроса на скрапинг. Передовые исследовательские лаборатории больше не раскрывают состав обучающих данных (Стэнфордский институт HAI, отчет «Индекс ИИ» за 2026 год), однако, по оценкам отраслевых экспертов, данные, извлеченные из Интернета, являются основным исходным материалом для большинства генеративных моделей, а специалисты предприятий всё чаще отмечают, что для поддержания актуальности систем искусственного интеллекта им требуются конвейеры обработки данных в режиме реального времени, а не пакетная обработка данных.
  • Издатели переходят от блокировки к введению платы за доступ. Политика Cloudflare, вступающая в силу 15 сентября 2026 года, предусматривает блокировку «универсальных» ИИ-сканеров на страницах, финансируемых за счёт рекламы, а также преобразование платформы Pay-Per-Crawl в модель «Pay Per Use», в рамках которой издатели получают вознаграждение, когда их контент фактически появляется в ответе ИИ (Блог Cloudflare, июль 2026 года; TechCrunch, 1 июля 2026 года).
  • На рынке прокси-серверов прокси-адреса из жилых сетей продолжают отвоевывать долю у IP-адресов из дата-центров. Оценки поставщиков относительно точного соотношения значительно различаются, однако все они сходятся в одном: доля прокси-адресов из жилых сетей растёт, поскольку они гораздо чаще проходят проверку современных систем защиты от ботов.

В 2025 году Интернет переступил черту: ботов стало больше, чем людей

На протяжении большей части истории Интернета в основе подходов к созданию, монетизации и защите веб-сайтов лежало предположение о том, что типичный посетитель — это человек. Это предположение больше не соответствует действительности. Согласно отчёту Imperva «Bad Bot Report 2026», в 2025 году доля автоматизированного трафика составила более 53 % от всего веб-трафика, увеличившись по сравнению с 51 % годом ранее, в то время как доля трафика, генерируемого людьми, сократилась до 47 % и продолжает снижаться (Imperva/Thales, 2026 год).

Из этой доли автоматизированного трафика на долю «полезных» ботов (поисковые роботы, инструменты мониторинга, легитимный сбор данных) приходилось около 13 %. Вредные боты, автоматизированный трафик, имитирующий работу реального браузера или осуществляющий скрапинг без разрешения, составил 40 % всего трафика, что превышает показатель 2024 года (37 %).

Компания Imperva явно определяет это как структурный сдвиг, а не как краткосрочный всплеск, связанный с одной атакующей кампанией или одним широко освещаемым событием. Это имеет значение для всех, кто занимается разработкой в открытом Интернете в 2026 году. Состав трафика, на котором основаны ваша инфраструктура, ваша система защиты от ботов и ваша стратегия сбора данных, больше не соответствует тому составу трафика, который наблюдается в реальности.

Искусственный интеллект стал главным новым фактором, стимулирующим спрос на скрапинг

Потребность генеративного ИИ в веб-данных является главным фактором, определяющим изменение структуры этого трафика. В отчете Стэнфордского университета «AI Index Report 2026» отмечается, что состав обучающих данных больше не раскрывается для ряда наиболее ресурсоемких передовых систем, включая модели компаний OpenAI, Anthropic и Google (Стэнфордский институт HAI, отчет «Индекс ИИ» за 2026 год). Эта непрозрачность сама по себе красноречива. Лаборатории, которые раньше могли сослаться на опубликованный набор данных, теперь отказываются раскрывать состав смеси.

В отсутствие таких данных отраслевые исследователи восполнили этот пробел с помощью оценок. Согласно отчету компании Actowiz Solutions о состоянии отрасли веб-скрейпинга за 2026 год, примерно 70 % генеративных моделей обучаются преимущественно на данных, полученных путем веб-скрейпинга (Actowiz Solutions, Отчет об отрасли веб-парсинга за 2026 год). Рассматривайте эту конкретную цифру как предварительную оценку поставщика, а не как проверенный показатель.

Это направление по-прежнему соответствует тому, с чем уже сталкивается каждый покупатель инфраструктуры искусственного интеллекта. Каждый дополнительный агент ИИ, каждая система RAG и каждый конвейер обучения способствуют росту одного и того же базового спроса: на чистый, актуальный и доступный для поиска веб-контент, объем и свежесть которого невозможно обеспечить с помощью периодического ручного сбора данных.

Оценки объёма рынка свидетельствуют о том же, хотя данные варьируются в зависимости от исследовательской компании и используемой методологии. Согласно нескольким отчётам за 2026 год, годовой объём сегмента веб-парсинга на базе ИИ оценивается в диапазоне от низких до средних однозначных миллиардов, при этом на всё десятилетие прогнозируется двузначный рост. Ни одну из цифр не следует рассматривать в данном контексте как окончательную. Однако направление, в котором сходятся все оценки, не вызывает сомнений: этот сегмент быстро растёт, и причиной этого является искусственный интеллект.

Собственный прогноз компании Gartner относительно внедрения ИИ в корпоративном секторе подтверждает эту же тенденцию с другой точки зрения: ожидается, что к концу 2026 года ИИ-агенты, предназначенные для выполнения конкретных задач, будут интегрированы в 40 % корпоративных приложений, тогда как в 2025 году этот показатель составлял менее 5 % (Gartner, «Gartner прогнозирует, что к 2026 году 40 % корпоративных приложений будут оснащены специализированными ИИ-агентами», пресс-релиз, 26 августа 2025 г.). Каждый из этих агентов представляет собой новый, постоянно действующий потребитель оперативных веб-данных, а не разовый цикл обучения.

Экосистема открытого исходного кода служит полезным индикатором темпов роста данного спроса. Crawl4AI, веб-краулер, специально разработанный для преобразования веб-страниц в формат Markdown, совместимый с большими языковыми моделями (LLM), набрал более 83 000 звездочек на GitHub. Это свидетельствует о том, что «чистые веб-данные для конвейера искусственного интеллекта» стали одной из основных потребностей разработчиков, а не лишь нишевой задачей.

Издатели перестали просто пытаться это блокировать. Теперь они взимают за это плату

Еще одно знаковое событие третьего квартала 2026 года: крупнейшие поставщики инфраструктуры в открытом Интернете перестали рассматривать трафик ИИ-краулеров исключительно как вредоносный. Вместо этого они приступили к созданию механизмов, позволяющих взимать плату за такой трафик. Изменение политики Cloudflare, вступающее в силу 15 сентября 2026 года, устанавливает новый параметр по умолчанию (Блог Cloudflare, «Ваш сайт — ваши правила», июль 2026 года).

«Многофункциональные» ИИ-сканеры — боты, сочетающие традиционную индексацию поисковых результатов со сбором данных для обучения ИИ или разработки агентов, — по умолчанию блокируются на любой странице, содержащей рекламу. Чистое сканирование с целью поиска по-прежнему разрешено по умолчанию. Данная настройка по умолчанию применяется ко всем новым клиентам Cloudflare, к недавно добавленным сайтам в существующих учетных записях, а также ко всем существующим пользователям бесплатного тарифного плана.

Наряду с функцией блокировки по умолчанию компания Cloudflare развивает свою существующую платформу Pay-Per-Crawl, преобразуя её в модель, которую она называет «Pay Per Use». Издатели получают вознаграждение не просто за то, что сканер загружает страницу, а именно тогда, когда их контент действительно отображается в ответе, сгенерированном искусственным интеллектом. В качестве партнёров по запуску этой модели названы Ceramic.ai и You.com (TechCrunch, 1 июля 2026 года).

Этот механизм существенно отличается от бинарного подхода «заблокировать или разрешить», который определял политику в отношении ИИ-краулеров на протяжении последних двух лет. Он свидетельствует о более значимом сдвиге: крупнейший инфраструктурный уровень в сети теперь предполагает, что доступ ИИ будет представлять собой регулируемые и монетизируемые отношения, а не беспрепятственный доступ для всех или полный запрет.

Для всех, кто занимается разработкой агента, конвейера RAG или продукта для мониторинга ИИ, именно эта тенденция будет иметь наибольшее значение в преддверии IV квартала. Правила, определяющие, как пользователь попадает на страницу, меняются.

Раньше вопрос звучал так: «Сможет ли мой робот пройти проверку на ботов?». Теперь же он звучит так: «Относится ли мой трафик к той категории, которую целевой сайт согласился разрешить или за которую он взимает плату?». Компания Massive внимательно отслеживает эту тенденцию; см. «Замыкающаяся сеть»: блокировка ИИ-краулеров, оплата за сканирование и что это означает для агентов для более подробного технического разбора того, что именно изменится для разработчиков агентов.

Внутри самого рынка прокси-серверов: сегмент частных пользователей продолжает завоевывать долю в отрасли веб-данных

Хотя в центре внимания находятся противостояние ботов и людей, а также издателей и поисковых роботов, на инфраструктурном уровне, обслуживающем весь этот трафик, происходит второе, менее заметное изменение. Прокси-серверы из частных сетей, а также сети устройств реальных пользователей, такие как сеть компании Massive, продолжают отвоевывать долю рынка у IP-адресов центров обработки данных на самом рынке прокси-серверов. См. Прокси-серверы для частных пользователей и прокси-серверы для центров обработки данных при использовании ИИ-агентов для ознакомления с полным техническим сравнением.

Точный объем этого сегмента рынка остаётся неопределённым. Компании, занимающиеся исследованием рынка, публикуют крайне разнящиеся общие показатели по данному сегменту — от менее чем 150 миллионов долларов до нескольких миллиардов долларов в зависимости от объёма исследования и методологии. Ни одну из этих цифр не следует рассматривать как аудированные данные. Согласно одной широко цитируемой оценке поставщика, доля резидентных прокси-серверов в общей выручке рынка прокси-серверов в 2026 году составит примерно 42 %, по сравнению с примерно 35 % в 2023 году (обзор результатов исследований рынка, 2026 год). Рассматривайте указанную долю как ориентировочную, а не точную.

Более подробно рассмотрен механизм, лежащий в основе этого сдвига:

Proxy type Pass rate against modern anti-bot systems Detection method it defeats
Residential (real device) 92-98% Behavioral and device fingerprinting
Datacenter 65-80% Weaker against fingerprinting, stronger only against simple IP blocklists

Системы защиты от ботов больше не используют в качестве основного метода добавление известных диапазонов IP-адресов центров обработки данных в чёрный список. Вместо этого они анализируют характер запросов, сигналы устройств и особенности трафика, которые естественным образом генерирует реальное потребительское устройство, а компьютер в центре обработки данных, как правило, — нет.

По мере обострения описанной выше «гонки вооружений» разрыв в производительности, указанный в этой таблице, скорее всего, будет увеличиваться, а не сокращаться. Даже увеличение количества IP-адресов само по себе не решит эту проблему; именно качество устройств определяет, будет ли запрос действительно пропущен.

Что это означает для отрасли веб-данных в преддверии IV квартала 2026 года

Одновременно действуют три фактора. Трафик ботов в настоящее время составляет большую часть всего веб-трафика. Искусственный интеллект является самым быстрорастущим источником спроса на этот трафик. А крупнейшие поставщики инфраструктуры активно пересматривают правила, определяющие, кому и на каких условиях предоставляется доступ.

Любая команда, продукт которой зависит от надежного доступа к Интернету, работает в условиях, существенно отличающихся от тех, что были даже год назад. Это верно независимо от того, является ли продукт ИИ-агентом, конвейером данных, средством анализа конкурентной среды или инструментом мониторинга AEO.

Если рассматривать каждую из этих трёх тенденций в отдельности, то каждая из них представляет собой отдельную историю: отчёт по вопросам безопасности, заявление о политике, сноска в результатах исследования рынка. Однако в совокупности они свидетельствуют об одном фундаментальном сдвиге.

Открытый Интернет больше не является бесплатным ресурсом, который инфраструктура незаметно потребляет в фоновом режиме. Он постепенно превращается в платный ресурс. Условием доступа является подтверждение легитимности вашего трафика — либо перед системой защиты от ботов, либо, что становится всё более распространённым, в соответствии с условиями биллинга издателя.

Два года назад ситуация была однозначной: вас либо заблокировали, либо нет. Сегодня она ближе к трёхуровневой системе.

Access tier 2024 2026
Blocked outright Datacenter IPs, known bad-bot signatures Same, plus mixed-use AI crawlers on ad-supported pages by default
Allowed, unpriced Most crawler traffic that clears anti-bot checks Search indexing, non-AI data collection
Allowed and billed Did not exist as a category AI crawlers under Cloudflare's Pay Per Use, paid when content surfaces in an answer

То, в какой уровень попадает запрос, зависит от факторов, которые в большей степени контролируют поставщики инфраструктуры, чем операторы сканеров: источник устройства, географическое положение и заявленное намерение.

Надежный путь к решению этой задачи неизменно сводится к одним и тем же основополагающим принципам: определение реального местоположения устройства вместо IP-адресов центров обработки данных и географически точные запросы. Это также означает, что инфраструктура должна быть построена таким образом, чтобы адаптироваться к постоянным изменениям политики издателей, а не ориентироваться на более упрощённую модель «блокировать или разрешать», характерную для 2024 года.

Примечание об источниках и методологии

В настоящем отчете обобщены данные независимых отраслевых исследований по состоянию на сентябрь 2026 года: Отчет «Индекс искусственного интеллекта» на 2026 год, подготовленный Исследовательским центром по искусственному интеллекту Стэнфордского университета (HAI), Отчет Imperva/Thales «Bad Bot Report» за 2026 год, Официальное заявление компании Cloudflare о своей политике, Репортаж TechCrunch об этом объявлении, Прогноз компании Gartner относительно внедрения корпоративных ИИ-агентов на август 2025 года, Отчет компании «Actowiz Solutions» об отрасли веб-парсинга за 2026 год, а также обобщенные данные исследования рынка за 2026 год, посвященного веб-парсингу на основе искусственного интеллекта и сегменты прокси-серверов для домашнего использования.

В тех случаях, когда оценки объёма рынка существенно различались между исследовательскими компаниями — в случае рынка прокси-серверов разница превышала один порядок величины — эти расхождения отмечаются в тексте, а не сводятся к единому достоверному показателю. Анализ, связывающий эти данные — переход от модели «блокировать или разрешать» к модели с тарификацией по объему трафика — представляет собой собственное толкование этой тенденции компанией Massive, а не утверждение, сделанное каким-либо одним из цитируемых источников.

Данный материал представляет собой обобщение результатов внешних исследований, а не собственное исследование сети Massive. В одной из будущих статей этой серии будут использованы собственные данные Massive об объеме запросов и коэффициенте успешности, а также внутренний отчет «Signal», который уже включен в план работ; при публикации данная статья будет четко обозначена как собственное исследование.

Об авторе

Райан Тернер освещает в блоге Massive темы, связанные с инфраструктурой веб-данных, прокси-сетями и доступом ИИ-агентов, отслеживая, как из квартала в квартал меняются системы защиты от ботов, политика издателей и нормативные требования в отношении веб-парсинга. Вопросы по данному отчёту или сети Massive можно направлять через Страница «О компании» Massive.

Часто задаваемые вопросы

Действительно ли в настоящее время объем трафика, генерируемого ботами, в открытом Интернете превышает объем трафика, генерируемого пользователями?+

Да. В отчете Imperva «Bad Bot Report 2026» отмечается, что в 2025 году доля автоматизированного трафика превысила 53 % от общего объема веб-трафика, в то время как доля трафика, генерируемого людьми, сократилась до 47 %; в отчете это явление характеризуется как структурное изменение, а не как временный всплеск.

Блокирует ли новая политика Cloudflare все ИИ-краулеры?+

Нет. Данная функция специально нацелена на «многофункциональные» сканеры — ботов, сочетающих индексирование поисковых результатов со сбором данных для обучения искусственного интеллекта или разработки агентов, — и по умолчанию блокирует их только на страницах, содержащих рекламу. Чистое сканирование с целью поиска по-прежнему разрешено по умолчанию, и владельцы сайтов могут по собственному усмотрению вновь разрешить работу сканеров искусственного интеллекта.

Почему доля прокси-серверов, расположенных в жилых домах, растёт за счёт прокси-серверов, размещённых в центрах обработки данных?+

В первую очередь это обусловлено эффективностью обхода современных антибот-систем: примерно 92–98 % для прокси-серверов, расположенных в жилых домах, по сравнению с 65–80 % для прокси-серверов, расположенных в дата-центрах, поскольку в настоящее время обнаружение ботов основано на анализе поведения и идентификации устройств, а не на простом блокировании IP-адресов. Точные процентные показатели доли рынка варьируются в зависимости от исследовательской компании, однако все опубликованные оценки сходятся в общем тренде.