Mineradores de dados de IA são encontrados causando lentidão massiva na Internet

A plataforma de hospedagem Git de código aberto SourceHut disse que seus serviços foram prejudicados por rastreadores da web executados por empresas de inteligência artificial. Reclamações semelhantes vêm cada vez mais de proprietários de outros recursos.

Fonte da imagem: Kai Wenzel/unsplash.com

Para limitar o tráfego de bots de IA, a SourceHut teve que implantar o Nepenthes, uma defesa contra rastreadores da web desonestos que coletam dados para treinar modelos de IA. A administração da plataforma bloqueou unilateralmente todos os intervalos de endereços de vários provedores de nuvem, incluindo Google Cloud e Microsoft Azure, devido ao volume excessivo de tráfego de bots implantados em suas redes. Proprietários de serviços genuínos nessas infraestruturas foram orientados a entrar em contato com a administração da SourceHut individualmente para adicioná-los às exceções. Em 2022, a SourceHut também sofreu com solicitações excessivas de recursos do serviço Go Module Mirror do Google.

Em 2023, a OpenAI prometeu que seus bots seguiriam as diretrizes dos arquivos robots.txt, que especificam as regras para processamento de dados de sites por rastreadores da web. Outros desenvolvedores de IA assumiram compromissos semelhantes, mas reclamações de abuso continuam chegando. No verão passado, o site iFixit, em particular, foi invadido pelo bot Anthropic Claudebot. Em dezembro, o host Vercel relatou uma presença significativa de rastreadores de IA em sua infraestrutura: o OpenAI GPTbot enviou 569 milhões de solicitações para sua rede, enquanto o Anthropic Claude enviou 370 milhões. Juntos, eles foram responsáveis ​​por cerca de 20% das 4,5 bilhões de solicitações que o Googlebot usa para indexar recursos no Google.

Fonte da imagem: Kai Wenzel/unsplash.com

Ao mesmo tempo, o desenvolvedor da rede social distribuída Diaspora, Dennis Schubert, reclamou que, nos últimos 60 dias, os bots de IA foram responsáveis ​​por 70% do tráfego para seu servidor. A postagem se tornou viral e a atividade do rastreador de IA caiu drasticamente; No entanto, hooligans online lançaram uma invasão massiva de solicitações de clientes com o valor da string do agente do usuário correspondente ao OpenAI GPTbot. Mas o verdadeiro bot de IA da OpenAI envia solicitações da infraestrutura do Microsoft Azure e, no caso do servidor Diaspora, elas vieram de endereços da AWS e até mesmo de ISPs americanos.

Às vezes a situação é complicada pelo fato de que alguns bots têm múltiplas finalidades. Assim, o bot Meta✴ AI e o AppleBot coletam dados exclusivamente para treinamento de IA, enquanto o GoogleBot atende tanto à IA quanto à indexação de pesquisa. Para evitar confusão, o Google adicionou um valor Google-Extended separado para ferramentas de treinamento de IA em 2023.

avalanche

Postagens recentes

Reencarnação dos lendários smartwatches Pebble anunciada — Core 2 Duo e Core Time 2 serão lançados este ano

O criador do lendário smartwatch Pebble, Eric Migicovsky, mostrou o que ele trará de volta…

7 horas atrás

Amostras do lado mais distante da lua confirmam que ela já foi um oceano sólido de magma

No verão de 2024, a missão chinesa Chang'e-6 retornou amostras do lado oculto da Lua…

7 horas atrás

Análise da MSI MEG Z890 Ace: uma placa-mãe de ponta com quase nenhum detalhe

Na linha de placas-mãe MSI, os produtos mais sofisticados pertencem à série MEG - MSI…

8 horas atrás

Críticos dão veredito sobre Assassin’s Creed Shadows – Primeira olhada no lançamento mais importante da Ubisoft nos últimos anos

Fonte da imagem: Ubisoft Os críticos ficaram satisfeitos com o mundo colorido do Japão feudal,…

9 horas atrás

Fotônica Integrada e Armazenamento Líquido Líquido: NVIDIA Anuncia Switches 800G Spectrum-X e Quantum-X

A corrida para se tornar uma potência em IA está mudando a face dos data…

9 horas atrás