A marionete de políticas, uma técnica universal para compor consultas a modelos generativos de inteligência artificial, pode atuar como um meio de hackear os maiores e mais populares sistemas, dizem especialistas da HiddenLayer, uma empresa especializada em questões de segurança de IA.

Fonte da imagem: hiddenlayer.com

O esquema de ataque Policy Puppetry envolve formular solicitações à IA de tal forma que grandes modelos de linguagem as percebam como políticas comportamentais – as instruções subjacentes são redefinidas e as defesas param de funcionar. Os modelos de IA generativa são treinados para rejeitar solicitações do usuário se as respostas a elas puderem levar a resultados perigosos: ameaças químicas, biológicas, radiológicas ou nucleares, violência ou automutilação pelo usuário.

O método de aprendizado por reforço usado para ajustar os modelos os impede de elogiar ou inferir tal material sob quaisquer circunstâncias, mesmo que um usuário mal-intencionado sugira cenários hipotéticos ou fictícios, diz HiddenLayer. Mas a empresa desenvolveu um método de ataque Policy Puppetry que permite que você ignore essas defesas criando uma solicitação que se parece com um dos vários tipos de arquivos de política: XML, INI ou JSON. Como resultado, um invasor hipotético pode facilmente ignorar as configurações do sistema do modelo e quaisquer medidas de segurança implantadas durante a fase de treinamento.

Os autores do projeto testaram o ataque Policy Puppetry nos modelos de IA mais populares da Anthropic, DeepSeek, Google, Meta✴, Microsoft, Mistral, OpenAI e Alibaba. Ele se mostrou eficaz contra todos eles, embora em alguns casos tenham sido necessários pequenos ajustes. Se houver uma maneira universal de contornar as proteções dos modelos de IA, estes últimos não serão capazes de se controlar para emitir materiais inapropriados e exigirão medidas de segurança adicionais, dizem os especialistas.

avalanche

Postagens recentes

Um modder aprimorou os gráficos de Dark Souls 2 com traçado de raios — uma nova versão beta do DS2LightingEngine já está disponível.

O ambicioso mod gráfico DS2LightingEngine para o RPG de ação hardcore Dark Souls 2 da…

31 minutos atrás

O Google Fotos agora oferece novas ferramentas de retoque de fotos com um clique.

O Google adicionou ferramentas de retoque ao aplicativo Google Fotos para melhorias rápidas em retratos.…

31 minutos atrás

O Google está preparando um concorrente para o Whoop: o rastreador de atividades físicas Fitbit Air, sem tela, será mais barato.

Segundo informações, o Google planeja lançar um rastreador de atividades físicas sem tela chamado Fitbit…

31 minutos atrás

A Era Cook em Números: O que a Apple Conquistou nos Últimos 15 Anos

No início de setembro, o segundo CEO com mais tempo de serviço na Apple, depois…

31 minutos atrás

O preço do console portátil Legion Go S da Lenovo quase dobrou, vítima da escassez de memória.

Com um pouco de pesquisa, ainda é possível encontrar os consoles portáteis Asus Xbox Ally…

31 minutos atrás

Tim Cook publicou uma carta de despedida por ocasião de sua saída do cargo de CEO da Apple.

Antes de deixar o cargo de CEO da Apple, Tim Cook escreveu uma carta aberta…

2 horas atrás