Mineradores de dados de IA são encontrados causando lentidão massiva na Internet

A plataforma de hospedagem Git de código aberto SourceHut disse que seus serviços foram prejudicados por rastreadores da web executados por empresas de inteligência artificial. Reclamações semelhantes vêm cada vez mais de proprietários de outros recursos.

Fonte da imagem: Kai Wenzel/unsplash.com

Para limitar o tráfego de bots de IA, a SourceHut teve que implantar o Nepenthes, uma defesa contra rastreadores da web desonestos que coletam dados para treinar modelos de IA. A administração da plataforma bloqueou unilateralmente todos os intervalos de endereços de vários provedores de nuvem, incluindo Google Cloud e Microsoft Azure, devido ao volume excessivo de tráfego de bots implantados em suas redes. Proprietários de serviços genuínos nessas infraestruturas foram orientados a entrar em contato com a administração da SourceHut individualmente para adicioná-los às exceções. Em 2022, a SourceHut também sofreu com solicitações excessivas de recursos do serviço Go Module Mirror do Google.

Em 2023, a OpenAI prometeu que seus bots seguiriam as diretrizes dos arquivos robots.txt, que especificam as regras para processamento de dados de sites por rastreadores da web. Outros desenvolvedores de IA assumiram compromissos semelhantes, mas reclamações de abuso continuam chegando. No verão passado, o site iFixit, em particular, foi invadido pelo bot Anthropic Claudebot. Em dezembro, o host Vercel relatou uma presença significativa de rastreadores de IA em sua infraestrutura: o OpenAI GPTbot enviou 569 milhões de solicitações para sua rede, enquanto o Anthropic Claude enviou 370 milhões. Juntos, eles foram responsáveis ​​por cerca de 20% das 4,5 bilhões de solicitações que o Googlebot usa para indexar recursos no Google.

Fonte da imagem: Kai Wenzel/unsplash.com

Ao mesmo tempo, o desenvolvedor da rede social distribuída Diaspora, Dennis Schubert, reclamou que, nos últimos 60 dias, os bots de IA foram responsáveis ​​por 70% do tráfego para seu servidor. A postagem se tornou viral e a atividade do rastreador de IA caiu drasticamente; No entanto, hooligans online lançaram uma invasão massiva de solicitações de clientes com o valor da string do agente do usuário correspondente ao OpenAI GPTbot. Mas o verdadeiro bot de IA da OpenAI envia solicitações da infraestrutura do Microsoft Azure e, no caso do servidor Diaspora, elas vieram de endereços da AWS e até mesmo de ISPs americanos.

Às vezes a situação é complicada pelo fato de que alguns bots têm múltiplas finalidades. Assim, o bot Meta✴ AI e o AppleBot coletam dados exclusivamente para treinamento de IA, enquanto o GoogleBot atende tanto à IA quanto à indexação de pesquisa. Para evitar confusão, o Google adicionou um valor Google-Extended separado para ferramentas de treinamento de IA em 2023.

avalanche

Postagens recentes

A Intel apresentou um protótipo de um enorme chip de IA com quatro unidades lógicas e 12 módulos HBM4.

A Intel Foundry divulgou um relatório técnico detalhando as soluções avançadas de design e implementação…

7 horas atrás

A Samsung, a SK Hynix e a Micron estão reavaliando todos os pedidos de memória para evitar compras em grande quantidade.

Segundo o Nikkei Asia, três grandes fabricantes de chips de memória — Micron, SK Hynix…

7 horas atrás

O console portátil MSI Claw A8 com Ryzen Z2 Extreme chegou aos EUA e à Europa, com preço de US$ 1.149 para a versão com 24 GB de RAM.

O MSI Claw A8 é o primeiro console portátil da empresa baseado na plataforma AMD.…

10 horas atrás

A SK Hynix supera a Samsung em lucro anual pela primeira vez em meio ao boom da IA.

Historicamente, a Samsung Electronics tem sido consistentemente a maior fornecedora mundial de componentes semicondutores em…

11 horas atrás

Intel e AMD, preparem-se: a Nvidia confirmou o desenvolvimento do processador N1 para PCs em colaboração com a MediaTek.

Jensen Huang confirmou publicamente a colaboração da Nvidia com a MediaTek no desenvolvimento dos processadores…

21 horas atrás