Mineradores de dados de IA são encontrados causando lentidão massiva na Internet

A plataforma de hospedagem Git de código aberto SourceHut disse que seus serviços foram prejudicados por rastreadores da web executados por empresas de inteligência artificial. Reclamações semelhantes vêm cada vez mais de proprietários de outros recursos.

Fonte da imagem: Kai Wenzel/unsplash.com

Para limitar o tráfego de bots de IA, a SourceHut teve que implantar o Nepenthes, uma defesa contra rastreadores da web desonestos que coletam dados para treinar modelos de IA. A administração da plataforma bloqueou unilateralmente todos os intervalos de endereços de vários provedores de nuvem, incluindo Google Cloud e Microsoft Azure, devido ao volume excessivo de tráfego de bots implantados em suas redes. Proprietários de serviços genuínos nessas infraestruturas foram orientados a entrar em contato com a administração da SourceHut individualmente para adicioná-los às exceções. Em 2022, a SourceHut também sofreu com solicitações excessivas de recursos do serviço Go Module Mirror do Google.

Em 2023, a OpenAI prometeu que seus bots seguiriam as diretrizes dos arquivos robots.txt, que especificam as regras para processamento de dados de sites por rastreadores da web. Outros desenvolvedores de IA assumiram compromissos semelhantes, mas reclamações de abuso continuam chegando. No verão passado, o site iFixit, em particular, foi invadido pelo bot Anthropic Claudebot. Em dezembro, o host Vercel relatou uma presença significativa de rastreadores de IA em sua infraestrutura: o OpenAI GPTbot enviou 569 milhões de solicitações para sua rede, enquanto o Anthropic Claude enviou 370 milhões. Juntos, eles foram responsáveis ​​por cerca de 20% das 4,5 bilhões de solicitações que o Googlebot usa para indexar recursos no Google.

Fonte da imagem: Kai Wenzel/unsplash.com

Ao mesmo tempo, o desenvolvedor da rede social distribuída Diaspora, Dennis Schubert, reclamou que, nos últimos 60 dias, os bots de IA foram responsáveis ​​por 70% do tráfego para seu servidor. A postagem se tornou viral e a atividade do rastreador de IA caiu drasticamente; No entanto, hooligans online lançaram uma invasão massiva de solicitações de clientes com o valor da string do agente do usuário correspondente ao OpenAI GPTbot. Mas o verdadeiro bot de IA da OpenAI envia solicitações da infraestrutura do Microsoft Azure e, no caso do servidor Diaspora, elas vieram de endereços da AWS e até mesmo de ISPs americanos.

Às vezes a situação é complicada pelo fato de que alguns bots têm múltiplas finalidades. Assim, o bot Meta✴ AI e o AppleBot coletam dados exclusivamente para treinamento de IA, enquanto o GoogleBot atende tanto à IA quanto à indexação de pesquisa. Para evitar confusão, o Google adicionou um valor Google-Extended separado para ferramentas de treinamento de IA em 2023.

avalanche

Postagens recentes

Foremay revela SSD espacial resistente à radiação da série InterStellar

A Foremay anunciou sua família de SSDs InterStellar, projetada para uso em satélites comerciais e…

45 minutos atrás

Jackpot: A segunda temporada de Fallout se tornou um dos maiores sucessos da Amazon.

O Hollywood Reporter, citando a Amazon MGM Studios, compartilhou informações sobre o sucesso da segunda…

1 hora atrás

A Samsung pretende dominar a tecnologia de processo de 1 nanômetro e introduzir folhas em formato de garfo em transistores até 2030.

A escassez de capacidade da TSMC está abrindo novas oportunidades para a rival Samsung Electronics…

1 hora atrás

A Microsoft forçou IAs a testarem umas às outras em pesquisa do Copilot.

A Microsoft introduziu a capacidade de usar vários modelos de IA em um único fluxo…

1 hora atrás

A Meta começou a testar uma assinatura do Instagram Plus com Stories expandidos e mais recursos.

A Meta começou a testar uma assinatura paga para recursos adicionais do Instagram em alguns…

2 horas atrás

CEO da Naughty Dog dá aos fãs novas esperanças para The Last of Us Part III

O presidente e diretor criativo da Naughty Dog, Neil Druckmann, usou as redes sociais para…

2 horas atrás