Bots de IA Já Não Se Contentam Em Raspar Sites

No momento, você está visualizando Bots de IA Já Não Se Contentam Em Raspar Sites

O tráfego automatizado malicioso na internet está crescendo mais de nove vezes mais rápido que o tráfego humano. E, o que é mais preocupante, os bots de inteligência artificial estão indo além da simples coleta de conteúdo: passaram a acessar páginas de login e outras áreas sensíveis dos sites.

Os dados vêm do relatório State of Bot & Agent Security, edição 2026, divulgado em 22 de setembro pela DataDome, empresa especializada em gestão de confiança de bots e agentes. O estudo analisou mais de um trilhão de requisições em mais de 75 mil sites de clientes, somados a testes em mais de 20 mil sites populares. O resultado: o tráfego de bots maliciosos cresceu 124% entre julho de 2025 e junho de 2026, enquanto o tráfego humano avançou apenas 13,2%.

Se você administra um site, uma loja virtual ou qualquer serviço com área de clientes, vale entender o que mudou — porque a velha pergunta “isso é humano ou robô?” deixou de ser suficiente.

Organização de TI

A automação está indo mais fundo, não só ficando maior

O ponto central do relatório não é o volume, e sim o destino desse tráfego. Como resume Jérôme Segura, vice-presidente de pesquisa de ameaças da DataDome, o tráfego automatizado deixou de ser apenas um problema de volume na borda da internet. Ele está crescendo rápido e indo mais fundo: para dentro dos fluxos de login, conta e transação, que ficam no centro da jornada do cliente.

Os números dão a dimensão dessa mudança. No primeiro semestre de 2026, agentes de IA geraram 605,6 milhões de requisições a páginas de login, formulários, carrinhos de compra, fluxos de pagamento e criação de contas. As páginas de login sozinhas responderam por 51,7% desse volume — contra 23% um ano antes.

A curva mensal é ainda mais reveladora. O tráfego de bots de IA para páginas de login saltou de 11,9 milhões de requisições em janeiro para 99,7 milhões em junho.

Vale notar, para manter a proporção, que 97,9% das requisições de bots de IA ainda vão para páginas iniciais e conteúdo geral. Os tais 2,1% restantes são exatamente onde a mudança está acontecendo — e onde mora o risco.

Raspagem de dados: o vetor que mais cresce

A coleta automatizada de conteúdo, conhecida como scraping, continua sendo o maior e mais acelerado vetor de ataque. Ela responde por 70,9% de todo o tráfego de bots maliciosos e cresceu 185,2% no período analisado.

Segura aponta vários fatores por trás desse avanço. As ferramentas de raspagem se multiplicaram conforme cresceu a demanda por dados da web usados em treinamento de modelos de IA, respostas de agentes e outros serviços. Ao mesmo tempo, frameworks anti-impressão digital, navegadores automatizados e plataformas de “bot como serviço” a baixo custo tornaram a evasão sofisticada muito mais acessível — e a própria IA deixou essas ferramentas mais rápidas e baratas de construir.

Jacob Krell, diretor sênior de soluções seguras de IA e cibersegurança na Suzu Labs, traduz o fenômeno de forma bem concreta. Esse salto de 185% representa agentes buscando respostas em páginas que foram construídas para pessoas. Busca com IA, ferramentas de pesquisa, inteligência competitiva e raspadores antigos geram fluxos contínuos de requisições. Uma única pergunta humana pode se transformar em consultas a várias páginas ou sites. É demanda em escala de máquina sobre uma infraestrutura dimensionada para gente — com mais espaço para roubo de conteúdo, raspagem de preços e coleta não autorizada de dados.

Ensar Seker, diretor de segurança da informação da SOCRadar, reforça que a raspagem já não se resume a copiar conteúdo público. Sistemas automatizados conseguem coletar dados de produtos, preços, propriedade intelectual, pesquisa proprietária e outras informações comercialmente valiosas em escala enorme. Segundo ele, a IA aumentou o valor econômico dos grandes conjuntos de dados, porque as informações passaram a servir para treinamento de modelos, sistemas de recuperação e inteligência competitiva.

O prejuízo é real: a raspagem agressiva eleva custos de infraestrutura, distorce as métricas de análise de audiência e pode minar o valor comercial dos dados e do conteúdo que a empresa produz.

Quem está por trás desse tráfego

O relatório também mapeou a origem. A DataDome registrou 52,7 bilhões de requisições de agentes e rastreadores de IA em sua base, com bots ligados à Meta respondendo por 46,3% do total identificado e bots ligados à OpenAI por 34,6%. O tráfego de IA como um todo cresceu 82,3% no período.

E não é só a raspagem que preocupa. O scalping — uso de bots para comprar estoques limitados e revendê-los — disparou 290,7%, com o volume diário mediano quase quadruplicando. A criação de contas falsas subiu 34,5%. Já o credential stuffing, teste automatizado de senhas vazadas, ficou estável na comparação anual, mas com quedas e retomadas bruscas ao longo do período.

De bots roteirizados a automação adaptativa

Krell aponta o uso de navegadores agênticos como outro impulsionador desse volume. Os modelos já conseguiam planejar uma sequência de ações; o que mudou foi que modelos de visão e ferramentas de controle de navegador tornaram prático executar esse plano em um site comum. Um agente consegue ler a página renderizada, localizar controles, preencher formulários e percorrer um fluxo inteiro em escala de máquina.

Seker acrescenta que a IA generativa derrubou drasticamente a barreira técnica para construir e modificar automações, enquanto navegadores sem interface gráfica, redes de proxy residencial e tecnologias antidetecção deixaram os bots muito melhores em imitar usuários legítimos. Com isso, os atacantes automatizam reconhecimento, raspagem, teste de credenciais e abuso transacional em uma escala que antes exigiria muito mais infraestrutura e conhecimento.

A conclusão dele resume bem a virada: estamos saindo de bots roteirizados e relativamente previsíveis rumo a uma automação adaptativa, capaz de navegar por sites, tomar decisões e mudar de comportamento conforme o que encontra pela frente.

Por que mexer no login muda tudo

Para Seker, o aumento das requisições de bots de IA a páginas de autenticação é um dos achados mais significativos do relatório. A lógica é direta: rastrear uma página inicial é essencialmente uma atividade de acesso a informação, enquanto interagir com páginas de autenticação indica que a automação está avançando para dentro das aplicações, na direção de identidades, contas e transações.

Isso cria uma fronteira de segurança bem mais sensível. As mesmas tecnologias que permitem a um agente legítimo acessar uma conta em nome do usuário podem ser abusadas para credential stuffing, sequestro de contas, abuso de sessão ou fraude automatizada. Por isso, as equipes de segurança já não podem se limitar a perguntar se o tráfego é humano ou automatizado — precisam determinar quem ou o que opera aquele agente, se ele está autorizado e o que está tentando realizar.

Aviv Nahum, cofundador e CEO da Above Security, recomenda que times de TI tratem os agentes de IA como identidades de primeira classe e como uma nova categoria de pessoas internas. Saber quais agentes estão implantados, o que fazem, quem os gerencia e a quais sistemas e credenciais têm acesso é essencial para identificar riscos ligados a esses “insiders sintéticos”. Só assim é possível avaliar a atividade agêntica e distinguir um comportamento que faz sentido de um sinal de alerta.

A maioria dos sites está completamente desprotegida

Aqui está o dado mais desconfortável de todo o relatório, e que o cenário anterior torna ainda mais grave. Em um teste feito em junho com 21.491 sites populares, 65% deles se mostraram completamente desprotegidos contra bots.

Ou seja, a maior parte da web não tem sequer a primeira camada de defesa contra um problema que cresce a três dígitos ao ano.

Como distinguir um agente legítimo de um bot abusivo

Segura recomenda que as organizações parem de perguntar se o visitante é bot ou humano e passem a perguntar o que ele está tentando fazer e se aquilo serve ao negócio.

O problema é que a identidade, sozinha, não responde a isso. Segundo a DataDome, a falsificação de identidade de agentes de IA cresceu 45% entre fevereiro e julho de 2026, e um estudo separado da empresa apontou que 80% dos agentes de IA não se identificam corretamente. A resposta prática, na visão dele, é combinar identidade verificada de agente com sinais de comportamento — embora o equilíbrio certo dependa de cada negócio.

Há um esforço técnico em andamento justamente para resolver essa parte. No IETF, o órgão que define os padrões da internet, tramita a proposta conhecida como Web Bot Auth, que busca criar um mecanismo de autenticação criptográfica para clientes automatizados. A ideia é permitir que um agente prove quem é, de modo que o site possa decidir conscientemente o que liberar para cada tipo de automação, em vez de bloquear tudo ou confiar em cabeçalhos que qualquer um pode forjar. Enquanto esses padrões amadurecem, a análise comportamental continua sendo o principal recurso disponível.

Nem todo mundo, aliás, enxerga o tráfego automatizado apenas como ameaça. Algumas publicações começaram a experimentar caminhos alternativos: a revista Time, por exemplo, passou a vender anúncios em páginas em formato markdown criadas especificamente para rastreadores de IA, tratando parte desse tráfego como audiência em potencial, e não só como problema.

O argumento da biometria (e uma ressalva)

Kevin Alan Tussy, CEO da FaceTec, defende que a IA agêntica representa um desafio crescente para os métodos convencionais de autenticação. O raciocínio dele é que agentes já conseguem possuir e usar praticamente qualquer fator moderno de autenticação — senhas, passkeys e códigos temporários por e-mail ou SMS. A única coisa que um agente não consegue possuir, argumenta, é um rosto humano vivo.

Ele considera que defesas no estilo teste de Turing são um beco sem saída, já que bots podem observar um humano resolver um captcha, algo que leva de 15 a 30 segundos, e aprender a replicar esse comportamento perfeitamente. O que não se ensina a um bot, na visão dele, é apresentar um rosto real diante de uma câmera e completar um desafio de detecção de vivacidade em 3D.

Vale um adendo editorial aqui: a FaceTec vende exatamente esse tipo de tecnologia, assim como várias outras fontes citadas neste texto comercializam soluções na área. Isso não invalida os argumentos, que são tecnicamente consistentes, mas convém lê-los com essa informação em mente. Biometria facial também traz suas próprias questões, sobretudo de privacidade e de tratamento de dados sensíveis.

O que isso significa para empresas brasileiras

Para quem opera no Brasil, alguns pontos merecem atenção especial.

O comércio eletrônico local é um alvo natural de raspagem de preços e de scalping, sobretudo em lançamentos e datas promocionais. Já os fluxos de login e criação de conta concentram o risco de fraude e de acesso indevido a dados pessoais — área em que a LGPD exige que a empresa demonstre as medidas de segurança adotadas e comunique incidentes relevantes à ANPD e aos titulares.

Do ponto de vista prático, três medidas costumam ter o melhor retorno inicial. A primeira é descobrir se o seu site está entre os 65% desprotegidos, o que já se percebe observando picos anômalos de tráfego, custos de infraestrutura inexplicados e distorções nas métricas de audiência. A segunda é reforçar especificamente os fluxos sensíveis, com autenticação resistente a phishing e limitação de tentativas nas páginas de login e cadastro. A terceira é passar a registrar e revisar o comportamento automatizado, em vez de tratar todo bot como igual.

O fim da pergunta binária

No fim das contas, a grande mudança que esse relatório documenta é conceitual. A defesa contra automação foi construída em torno de uma escolha binária: bloquear ou permitir, robô ou pessoa. Só que agentes de IA legítimos, agindo a pedido de clientes reais, se parecem muito com bots maliciosos testando senhas roubadas.

Como resume Segura, as organizações estão sendo chamadas a tomar decisões mais matizadas com defesas ainda construídas em torno de escolhas binárias. Conseguir distinguir um assistente de IA legítimo de um bot testando credenciais será decisivo para proteger clientes sem bloquear atividade benéfica.

É um problema novo, e a resposta ainda está sendo escrita — nos padrões técnicos, nas ferramentas de defesa e nas decisões de negócio de cada empresa sobre que tipo de automação quer receber.

Claude

Deixe um comentário