A plataforma de hospedagem Git de código aberto SourceHut disse que seus serviços foram prejudicados por rastreadores da web executados por empresas de inteligência artificial. Reclamações semelhantes vêm cada vez mais de proprietários de outros recursos.
Fonte da imagem: Kai Wenzel/unsplash.com
Para limitar o tráfego de bots de IA, a SourceHut teve que implantar o Nepenthes, uma defesa contra rastreadores da web desonestos que coletam dados para treinar modelos de IA. A administração da plataforma bloqueou unilateralmente todos os intervalos de endereços de vários provedores de nuvem, incluindo Google Cloud e Microsoft Azure, devido ao volume excessivo de tráfego de bots implantados em suas redes. Proprietários de serviços genuínos nessas infraestruturas foram orientados a entrar em contato com a administração da SourceHut individualmente para adicioná-los às exceções. Em 2022, a SourceHut também sofreu com solicitações excessivas de recursos do serviço Go Module Mirror do Google.
Em 2023, a OpenAI prometeu que seus bots seguiriam as diretrizes dos arquivos robots.txt, que especificam as regras para processamento de dados de sites por rastreadores da web. Outros desenvolvedores de IA assumiram compromissos semelhantes, mas reclamações de abuso continuam chegando. No verão passado, o site iFixit, em particular, foi invadido pelo bot Anthropic Claudebot. Em dezembro, o host Vercel relatou uma presença significativa de rastreadores de IA em sua infraestrutura: o OpenAI GPTbot enviou 569 milhões de solicitações para sua rede, enquanto o Anthropic Claude enviou 370 milhões. Juntos, eles foram responsáveis por cerca de 20% das 4,5 bilhões de solicitações que o Googlebot usa para indexar recursos no Google.
Fonte da imagem: Kai Wenzel/unsplash.com
Ao mesmo tempo, o desenvolvedor da rede social distribuída Diaspora, Dennis Schubert, reclamou que, nos últimos 60 dias, os bots de IA foram responsáveis por 70% do tráfego para seu servidor. A postagem se tornou viral e a atividade do rastreador de IA caiu drasticamente; No entanto, hooligans online lançaram uma invasão massiva de solicitações de clientes com o valor da string do agente do usuário correspondente ao OpenAI GPTbot. Mas o verdadeiro bot de IA da OpenAI envia solicitações da infraestrutura do Microsoft Azure e, no caso do servidor Diaspora, elas vieram de endereços da AWS e até mesmo de ISPs americanos.
Às vezes a situação é complicada pelo fato de que alguns bots têm múltiplas finalidades. Assim, o bot Meta✴ AI e o AppleBot coletam dados exclusivamente para treinamento de IA, enquanto o GoogleBot atende tanto à IA quanto à indexação de pesquisa. Para evitar confusão, o Google adicionou um valor Google-Extended separado para ferramentas de treinamento de IA em 2023.
A Nvidia é corretamente considerada uma das principais beneficiárias do boom da inteligência artificial. No…
O criador do lendário smartwatch Pebble, Eric Migicovsky, mostrou o que ele trará de volta…
No verão de 2024, a missão chinesa Chang'e-6 retornou amostras do lado oculto da Lua…
Na linha de placas-mãe MSI, os produtos mais sofisticados pertencem à série MEG - MSI…
Fonte da imagem: Ubisoft Os críticos ficaram satisfeitos com o mundo colorido do Japão feudal,…
A corrida para se tornar uma potência em IA está mudando a face dos data…