Sim. O Relatório sobre Bots Maliciosos de 2026 da Imperva constatou que o tráfego automatizado ultrapassou 53% de todo o tráfego da web em 2025, com o tráfego humano caindo para 47%, e descreve isso como uma mudança estrutural, e não como um pico temporário.
Situação do setor de dados da Web: 3º trimestre de 2026
O tráfego automatizado ultrapassou o tráfego humano na web aberta em 2025 e, desde então, não parou mais. Os bots representam agora mais de 53% de todo o tráfego da web, enquanto a atividade humana caiu para 47% e continua diminuindo (Imperva/Thales, Relatório sobre bots maliciosos de 2026). Ao mesmo tempo, os editores estão, pela primeira vez, criando uma infraestrutura de fato para cobrar por esse tráfego, em vez de simplesmente tentar bloqueá-lo. Esse é o panorama do setor de dados da web à medida que nos aproximamos do 4º trimestre de 2026: maior, mais automatizado, mais orientado por IA e mais disputado do que era há um ano.
Principais conclusões
- O tráfego automatizado representou 53% de todo o tráfego da web em 2025, sendo que somente os bots maliciosos representaram 40%, um aumento em relação aos 37% do ano anterior (Relatório Imperva/Thales sobre Bots Maliciosos de 2026).
- Atualmente, a IA é a nova fonte dominante de demanda por scraping. Os laboratórios de ponta não divulgam mais a composição dos dados de treinamento (Stanford HAI, Relatório do Índice de IA de 2026), mas estimativas do setor apontam que os dados extraídos da web constituem a principal fonte de entrada para a maioria dos modelos generativos, e as equipes empresariais afirmam, cada vez mais, que precisam de fluxos de trabalho em tempo real, e não de extrações em lote, para manter os sistemas de IA atualizados.
- Os editores estão passando do bloqueio para a cobrança. A política padrão da Cloudflare, em vigor a partir de 15 de setembro de 2026, bloqueia rastreadores de IA de “uso misto” em páginas sustentadas por anúncios e está transformando seu mercado de “pagamento por rastreamento” em um modelo de “pagamento por uso”, no qual os editores são remunerados quando seu conteúdo realmente aparece em uma resposta de IA (Blog da Cloudflare, julho de 2026; TechCrunch, 1º de julho de 2026).
- Os proxies residenciais continuam conquistando participação de mercado às custas dos IPs de data centers no próprio mercado de proxies. As estimativas dos fornecedores quanto à divisão exata variam amplamente, mas todas concordam quanto à tendência: os proxies residenciais estão ganhando terreno porque conseguem contornar os modernos sistemas anti-bot com uma taxa de sucesso muito maior.
A internet ultrapassou um limite em 2025: há mais bots do que humanos
Durante a maior parte da história da internet, a suposição subjacente à forma como os sites são criados, monetizados e protegidos tem sido a de que o visitante típico é uma pessoa. Essa suposição não se sustenta mais. O Relatório sobre Bots Maliciosos de 2026 da Imperva constatou que o tráfego automatizado representou mais de 53% de todo o tráfego da web em 2025, um aumento em relação aos 51% do ano anterior, enquanto a atividade humana caiu para 47% e continua em queda (Imperva/Thales, 2026).
Dessa parcela automatizada, os bots benéficos (rastreadores de busca, ferramentas de monitoramento, coleta legítima de dados) representaram cerca de 13%. Bots maliciosos, o tráfego automatizado que simula um navegador real ou realiza scraping sem permissão representou 40% de todo o tráfego, um aumento em relação aos 37% registrados em 2024.
A Imperva define isso explicitamente como uma mudança estrutural, e não como um pico de curto prazo vinculado a uma única campanha de ataques ou a um único evento viral. Isso é relevante para qualquer pessoa que esteja desenvolvendo na web aberta em 2026. A composição de tráfego que sua infraestrutura, sua estratégia de combate a bots e sua estratégia de coleta de dados pressupõem não é mais a composição de tráfego que está realmente ocorrendo.
A IA tornou-se o maior novo impulsionador da demanda por scraping
A demanda da IA generativa por dados da web é a maior força isolada que está remodelando essa composição do tráfego. O Relatório do Índice de IA de 2026 da Universidade de Stanford observa que a composição dos dados de treinamento não é mais divulgada para vários dos sistemas de ponta que exigem mais recursos, incluindo modelos da OpenAI, da Anthropic e do Google (Stanford HAI, Relatório do Índice de IA de 2026). Essa opacidade, por si só, já é reveladora. Laboratórios que antes podiam indicar um conjunto de dados publicado agora se recusam a revelar o que está incluído na análise.
Na ausência dessa divulgação, pesquisadores do setor preencheram essa lacuna com estimativas. O relatório da Actowiz Solutions sobre o setor de web scraping para 2026 estima que cerca de 70% dos modelos generativos sejam treinados principalmente com dados da web extraídos (Actowiz Solutions, Relatório do Setor de Web Scraping de 2026). Considere esse número específico como uma estimativa do fornecedor, e não como um valor auditado.
Essa tendência continua a corresponder ao que todos os compradores de infraestrutura de IA já estão observando. Cada agente de IA adicional, cada sistema RAG e cada fluxo de treinamento contribuem para a mesma demanda subjacente: conteúdo da web limpo, atualizado e recuperável, com um volume e um nível de atualidade que a coleta manual periódica não consegue satisfazer.
A avaliação do tamanho do mercado aponta para um quadro semelhante, embora as estimativas variem de acordo com a empresa de pesquisa de mercado e a metodologia utilizada. Vários relatórios para 2026 estimam que o segmento de web scraping impulsionado por IA atinja um valor anual na faixa de bilhões de um dígito (baixo a médio), com projeção de crescimento de dois dígitos ao longo da década. Nenhum número isolado deve ser considerado definitivo neste contexto. No entanto, a tendência em que todas as estimativas concordam não está em dúvida: esse segmento está crescendo rapidamente, e a IA é a razão para isso.
A própria previsão da Gartner sobre a adoção corporativa reforça essa mesma tendência sob um ângulo diferente: espera-se que agentes de IA específicos para tarefas sejam incorporados a 40% dos aplicativos corporativos até o final de 2026, um aumento em relação aos menos de 5% registrados em 2025 (Gartner, “Gartner prevê que 40% dos aplicativos corporativos contarão com agentes de IA para tarefas específicas até 2026”, comunicado à imprensa, 26 de agosto de 2025). Cada um desses agentes é um novo consumidor contínuo de dados da web em tempo real, e não uma execução única de treinamento.
O ecossistema de código aberto é um indicador útil da velocidade com que essa demanda está crescendo. Crawl4AI, um rastreador desenvolvido especificamente para converter páginas da web em Markdown compatível com LLM, ultrapassou 83.000 estrelas no GitHub. Isso comprova que “dados limpos da web para um pipeline de IA” se tornou uma necessidade generalizada entre os desenvolvedores, em vez de uma necessidade de nicho.
As editoras deixaram de tentar apenas bloqueá-lo. Agora, estão cobrando por isso
A outra notícia marcante do terceiro trimestre de 2026: os maiores provedores de infraestrutura da web aberta deixaram de tratar o tráfego de rastreadores de IA como puramente adversário. Em vez disso, começaram a criar a estrutura necessária para cobrar por ele. A mudança na política da Cloudflare, em vigor a partir de 15 de setembro de 2026, estabelece uma nova configuração padrão (Blog da Cloudflare, “Seu site, suas regras”, julho de 2026).
Os rastreadores de IA de “uso misto” — bots que combinam a indexação tradicional de pesquisa com a coleta de dados para treinamento de IA ou desenvolvimento de agentes — são bloqueados por padrão em qualquer página que exiba anúncios. O rastreamento voltado exclusivamente para pesquisa continua permitido por padrão. Novos clientes da Cloudflare, sites recém-adicionados a contas existentes e todos os clientes do plano gratuito já existentes passam a ter essa configuração padrão.
Além da configuração padrão de bloqueio, a Cloudflare está transformando seu mercado “Pay-Per-Crawl” existente no que chama de “Pay Per Use”. Os editores recebem pagamento quando seu conteúdo realmente aparece em uma resposta de IA, e não simplesmente quando um rastreador acessa a página. A Ceramic.ai e a You.com foram apontadas como as parceiras de lançamento desse modelo (TechCrunch, 1º de julho de 2026).
Trata-se de um mecanismo significativamente diferente da abordagem binária de “bloquear ou permitir” que definiu os últimos dois anos da política relativa aos rastreadores de IA. Isso sinaliza algo mais amplo: a maior camada de infraestrutura da web agora espera que o acesso da IA seja uma relação medida e monetizada, e não uma situação de acesso irrestrito nem um bloqueio total.
Para quem estiver desenvolvendo um agente, um pipeline RAG ou um produto de monitoramento de IA, essa é a tendência mais importante para o quarto trimestre. As regras para acessar uma página estão mudando.
Antes, a questão era: “meu rastreador consegue passar pela verificação anti-bot?”. Agora, é: “meu tráfego se enquadra em uma categoria que o site de destino concordou em permitir ou pela qual cobra?”. A Massive vem acompanhando de perto essa mudança; veja A rede que se fecha: bloqueio de rastreadores de IA, pagamento por rastreamento e o que isso significa para os agentes para uma análise técnica mais aprofundada sobre o que muda especificamente para os desenvolvedores de agentes.
No próprio mercado de proxies: o setor residencial continua ganhando participação no setor de dados da web
Embora o tema principal seja bots versus humanos e editores versus rastreadores, há uma segunda mudança, mais discreta, ocorrendo na camada de infraestrutura que atende a todo esse tráfego. Proxies residenciais e redes de dispositivos de usuários reais, como a da Massive, continuam a conquistar participação de mercado às custas dos IPs de data centers no próprio mercado de proxies. Veja Proxies residenciais versus proxies de data center para agentes de IA para consultar a comparação técnica completa.
Ainda não se sabe exatamente qual é a participação de mercado real. Empresas de pesquisa de mercado divulgam números gerais muito divergentes para esse segmento, que variam de menos de US$ 150 milhões a vários bilhões de dólares, dependendo do escopo e da metodologia. Nenhum desses números deve ser interpretado como um valor auditado. Uma estimativa de um fornecedor amplamente citada aponta que os proxies residenciais representarão cerca de 42% da receita total do mercado de proxies em 2026, um aumento em relação aos cerca de 35% registrados em 2023 (agregação de pesquisas de mercado, 2026). Considere essa porcentagem específica como orientativa, e não como exata.
O que está mais bem fundamentado é o mecanismo por trás dessa mudança:
Os sistemas antibot já não funcionam principalmente por meio da inclusão em listas negras de intervalos de IP conhecidos de centros de dados. Em vez disso, eles identificam o comportamento das solicitações, os sinais dos dispositivos e os padrões de tráfego que um dispositivo de consumidor real produz naturalmente e que uma máquina de centro de dados normalmente não produz.
É provável que a diferença de desempenho apresentada nessa tabela aumente, e não diminua, à medida que a corrida armamentista descrita acima se intensifica. Um número maior de IPs, por si só, também não resolve o problema; a qualidade do dispositivo é o que determina se uma solicitação será efetivamente processada.
O que isso significa para o setor de dados da web à medida que nos aproximamos do 4º trimestre de 2026
Três fatores estão se combinando simultaneamente. O tráfego de bots representa agora a maior parte de todo o tráfego da web. A IA é a fonte que mais cresce no lado da demanda desse tráfego. E os maiores provedores de infraestrutura estão redefinindo ativamente as regras sobre quem tem acesso e em que condições.
Qualquer equipe cujo produto dependa de um acesso confiável à internet está operando em um ambiente substancialmente diferente do que era há apenas um ano. Isso vale independentemente de o produto ser um agente de IA, um pipeline de dados, uma função de inteligência competitiva ou uma ferramenta de monitoramento de AEO.
Quando analisadas isoladamente, cada uma dessas três forças parece constituir uma história à parte: um relatório de segurança, um anúncio de política e uma nota de rodapé de pesquisa de mercado. Quando consideradas em conjunto, elas descrevem uma mudança subjacente.
A web aberta não é mais um recurso gratuito que a infraestrutura consome discretamente em segundo plano. Ela está se tornando um recurso cobrado. O preço de acesso consiste em comprovar que seu tráfego é legítimo, seja para um sistema antibots ou, cada vez mais, de acordo com os termos de cobrança de um editor.
Há dois anos, a situação era simples: ou se era bloqueado ou não. Hoje, ela se aproxima mais de três níveis.
O nível em que uma solicitação é classificada depende de sinais que estão sob o controle dos provedores de infraestrutura, mais do que dos operadores de rastreadores: origem do dispositivo, localização geográfica e intenção declarada.
O caminho confiável a ser seguido sempre retorna aos mesmos princípios fundamentais: a origem real do dispositivo em vez de endereços IP de data centers e solicitações com precisão geográfica. Isso também significa uma infraestrutura projetada para se adaptar à medida que as políticas dos editores vão mudando, e não uma infraestrutura criada para o mundo mais simples de “bloquear ou permitir” de 2024.
Nota sobre fontes e metodologia
Este relatório sintetiza pesquisas setoriais realizadas por terceiros, com dados atualizados até setembro de 2026: Relatório do Índice de IA de 2026 do HAI de Stanford, Relatório sobre bots maliciosos de 2026 da Imperva/Thales, Anúncio da política publicada pela própria Cloudflare, A reportagem do TechCrunch sobre esse anúncio, Previsão da Gartner para agosto de 2025 sobre a adoção de agentes de IA corporativos, Relatório da Actowiz Solutions sobre o setor de web scraping em 2026, e uma pesquisa de mercado agregada de 2026 sobre o tamanho do mercado de web scraping impulsionado por IA e segmentos de proxies residenciais.
Nos casos em que as estimativas do tamanho do mercado variaram significativamente entre as empresas de pesquisa de mercado — no caso do mercado de proxies, em mais de uma ordem de magnitude —, essa variação é destacada no texto, em vez de ser sintetizada em um único número considerado confiável. A análise que relaciona esses dados — a transição de uma internet do tipo “bloquear ou permitir” para uma com tarifação por tráfego — é a interpretação da Massive sobre esse padrão, e não uma afirmação feita por qualquer fonte citada isoladamente.
Trata-se de uma síntese de pesquisas externas, e não de um estudo próprio da rede Massive. Uma próxima edição desta série se baseará nos dados da própria Massive sobre volume de solicitações e taxa de sucesso, bem como em um relatório interno chamado “Signal” que já está previsto no plano de trabalho, e será claramente identificada como um estudo próprio quando for publicada.
Sobre o autor
Ryan Turner aborda temas como infraestrutura de dados da web, redes de proxy e acesso por meio de agentes de IA no blog da Massive, acompanhando como os sistemas antibots, as políticas dos editores e a regulamentação sobre web scraping evoluem a cada trimestre. Dúvidas sobre este relatório ou sobre a rede da Massive podem ser encaminhadas por meio de Página “Sobre a Massive”.
Perguntas frequentes
Não. Ele visa especificamente os rastreadores de “uso misto” — bots que combinam a indexação de busca com o treinamento de IA ou a coleta de dados para o desenvolvimento de agentes — e os bloqueia por padrão apenas em páginas que exibem anúncios. O rastreamento exclusivamente para busca continua permitido por padrão, e os proprietários de sites podem optar por permitir novamente os rastreadores de IA, se assim o desejarem.
Principalmente devido à taxa de sucesso contra os modernos sistemas anti-bot: aproximadamente 92% a 98% para proxies residenciais, contra 65% a 80% para proxies de data center, uma vez que a detecção anti-bot atualmente se baseia na análise comportamental e na identificação de dispositivos, em vez do simples bloqueio de endereços IP. As porcentagens exatas de participação de mercado variam de acordo com a empresa de pesquisa de mercado, mas todas as estimativas publicadas concordam quanto à tendência.
