A marionete de políticas, uma técnica universal para compor consultas a modelos generativos de inteligência artificial, pode atuar como um meio de hackear os maiores e mais populares sistemas, dizem especialistas da HiddenLayer, uma empresa especializada em questões de segurança de IA.

Fonte da imagem: hiddenlayer.com

O esquema de ataque Policy Puppetry envolve formular solicitações à IA de tal forma que grandes modelos de linguagem as percebam como políticas comportamentais – as instruções subjacentes são redefinidas e as defesas param de funcionar. Os modelos de IA generativa são treinados para rejeitar solicitações do usuário se as respostas a elas puderem levar a resultados perigosos: ameaças químicas, biológicas, radiológicas ou nucleares, violência ou automutilação pelo usuário.

O método de aprendizado por reforço usado para ajustar os modelos os impede de elogiar ou inferir tal material sob quaisquer circunstâncias, mesmo que um usuário mal-intencionado sugira cenários hipotéticos ou fictícios, diz HiddenLayer. Mas a empresa desenvolveu um método de ataque Policy Puppetry que permite que você ignore essas defesas criando uma solicitação que se parece com um dos vários tipos de arquivos de política: XML, INI ou JSON. Como resultado, um invasor hipotético pode facilmente ignorar as configurações do sistema do modelo e quaisquer medidas de segurança implantadas durante a fase de treinamento.

Os autores do projeto testaram o ataque Policy Puppetry nos modelos de IA mais populares da Anthropic, DeepSeek, Google, Meta✴, Microsoft, Mistral, OpenAI e Alibaba. Ele se mostrou eficaz contra todos eles, embora em alguns casos tenham sido necessários pequenos ajustes. Se houver uma maneira universal de contornar as proteções dos modelos de IA, estes últimos não serão capazes de se controlar para emitir materiais inapropriados e exigirão medidas de segurança adicionais, dizem os especialistas.

avalanche

Postagens recentes

A Apple se recusou a implementar Claude na Siri devido à insaciabilidade da Anthropic.

A Apple abandonou o modelo de IA Claude da Anthropic para aprimorar a Siri e,…

5 horas atrás

Escape from Mars: O primeiro trailer do jogo de tiro de ficção científica Cor3, dos criadores de Escape from Tarkov, foi lançado.

Conforme previsto pela contagem regressiva no site de divulgação, o dia 1º de fevereiro marcou…

7 horas atrás

A Intel apresentou um protótipo de um enorme chip de IA com quatro unidades lógicas e 12 módulos HBM4.

A Intel Foundry divulgou um relatório técnico detalhando as soluções avançadas de design e implementação…

12 horas atrás

A Samsung, a SK Hynix e a Micron estão reavaliando todos os pedidos de memória para evitar compras em grande quantidade.

Segundo o Nikkei Asia, três grandes fabricantes de chips de memória — Micron, SK Hynix…

12 horas atrás

O console portátil MSI Claw A8 com Ryzen Z2 Extreme chegou aos EUA e à Europa, com preço de US$ 1.149 para a versão com 24 GB de RAM.

O MSI Claw A8 é o primeiro console portátil da empresa baseado na plataforma AMD.…

15 horas atrás

A SK Hynix supera a Samsung em lucro anual pela primeira vez em meio ao boom da IA.

Historicamente, a Samsung Electronics tem sido consistentemente a maior fornecedora mundial de componentes semicondutores em…

17 horas atrás