Uma equipe internacional de cientistas descobriu que todos os modelos de inteligência artificial de código aberto existentes podem ser sequestrados e levados a responder a consultas maliciosas, mesmo que seus desenvolvedores tenham implementado mecanismos de proteção.

Fonte da imagem: Steve A Johnson / unsplash.com

Pesquisadores identificaram nove maneiras principais de desativar mecanismos de defesa em modelos abertos:

Fonte da imagem: Numan Ali / unsplash.com

Vinte e um modelos de IA, com tamanhos variando de 0,6 bilhão a 8 bilhões de parâmetros, foram usados ​​nos testes, incluindo os das famílias Meta✴Llama, Alibaba Qwen3 e Mistral-7B. Todos eles se mostraram vulneráveis ​​a pelo menos alguns desses métodos. O enfraquecimento ou a desativação dos mecanismos de defesa também impactam a qualidade das respostas dos modelos, mas a queda na qualidade do raciocínio ao longo de 40 tentativas não ultrapassou a meta de 10% estabelecida pelos cientistas. Para o modelo Llama-3-8B-Instruct, a taxa de resposta adversária antes do re-treinamento foi de 0,08 e, após o re-treinamento, atingiu 0,88; para o Qwen3-8B, essas taxas foram de 0,05 e 0,85, respectivamente. Resultados semelhantes também foram observados em modelos maiores, com 32 bilhões e 70 bilhões de parâmetros.

Governos ao redor do mundo estão utilizando cada vez mais modelos de IA em diversos setores, incluindo saúde, educação, prevenção de fraudes e serviços públicos. Tais estudos, enfatizam os pesquisadores, mostram que os modelos de IA devem passar por testes rigorosos antes da implementação. Modelos fechados também são vulneráveis ​​a esses incidentes — eles podem ser manipulados por meio de APIs e requisições. Métodos confiáveis ​​para tornar essas defesas robustas ainda não existem.

By admin

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *