A Anthropic apresentou o Claude Fable 5.1 e o Claude Mythos 5.1, novas versões de seus principais modelos de IA focados em programação, processamento de grandes volumes de dados e execução de tarefas longas e complexas. Segundo a desenvolvedora, os novos modelos superam significativamente seus antecessores em diversos testes, e suas capacidades já permitem o uso de IA em certas áreas da pesquisa científica.

Fonte da imagem: Anthropic

Fable 5.1 e Mythos 5.1 são o mesmo modelo, mas diferem no nível dos mecanismos de segurança. O Fable 5.1 está disponível para todos os usuários, enquanto o Mythos 5.1 é distribuído por meio de um programa de acesso confiável para profissionais de cibersegurança e ciências da vida.

A Anthropic cita diversos exemplos em que o Fable 5.1 se mostrou significativamente melhor que seu antecessor. Assim, no teste Terminal-Bench 4.0, o novo Fable 5.1 obteve 55,8%, em comparação com 42% para o Fable 5 e 52,3% para o Opus 5. No GDPval-AA v2, que avalia tarefas profissionais, o novo modelo alcançou 1853 pontos, contra 1723 para o Fable 5 e 1824 para o Opus 5. No OSWorld 2.0, a pontuação foi de 77,9% no modo parcial e 41,7% no modo estrito — em comparação com 72,9% e 36,1%, respectivamente, para seu antecessor.

A Anthropic observa que os testes foram conduzidos com mecanismos de proteção ativados, o que, em alguns casos, interferiu na execução das tarefas, podendo levar a resultados inferiores.

A Anthropic enfatizou particularmente as capacidades científicas dos novos modelos. Em um dos experimentos de Claude, o Mythos 5.1 utilizou ferramentas especializadas para criar novas proteínas — moléculas que poderiam ser usadas, por exemplo, no desenvolvimento de medicamentos. As variantes resultantes foram então testadas em laboratórios de duas organizações independentes.

De acordo com a Anthropic, para três dos 12 alvos estudados, as proteínas criadas pelo Mythos 5.1 se ligaram às moléculas desejadas com uma eficiência aproximadamente dez vezes maior do que os melhores projetos submetidos às competições da Adaptyv Bio. No geral, quase metade das variantes criadas pelo Mythos 5.1 eram funcionais.Em comparação, com os métodos modernos de projeto computacional de proteínas, geralmente apenas 10 a 15% das proteínas desenvolvidas são bem-sucedidas.opções.

Outro experimento foi relacionado à ciência planetária. O Fable 5.1 também criou um novo mapa de elevação de aproximadamente um terço da superfície de Vênus, baseado em imagens de radar obtidas pela sonda Magellan da NASA há mais de 30 anos. A resolução do mapa foi aumentada de 10-20 km para 2-3 km, e a precisão da elevação aumentou para 25%. A empresa planeja publicar o mapa sob uma licença Creative Commons antes das próximas missões VERITAS da NASA e EnVision da ESA.

Além disso, o Mythos 5.1 demonstrou sua capacidade de otimizar cálculos em bioinformática. O modelo escreveu seus próprios kernels de GPU e implementou o cache de resultados intermediários, permitindo que sete modelos de código aberto para trabalhar com proteínas e genomas fossem executados até 2,5 vezes mais rápido, mantendo resultados idênticos. De acordo com a Anthropic, isso pode reduzir os custos de GPU em 30-60% em estudos genômicos de grande escala.

Ao mesmo tempo, a Anthropic reduziu o custo de utilização do Fable 5.1. O custo de leitura de dados em cache foi reduzido em 75%, para US$ 0,25 por milhão de tokens. Os demais custos permanecem inalterados: US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Como resultado, o custo típico de utilização do Fable 5.1, segundo a empresa, foi reduzido em aproximadamente 25% em comparação com o Fable 5, e para tarefas complexas e altamente dependentes de agentes, a economia pode chegar a 45%.

Ao mesmo tempo, a Anthropic aprimorou seus mecanismos de segurança: o número de falsos positivos em cibersegurança foi reduzido em aproximadamente 60%, e os modelos do Fable 5.1 agora são capazes de detectar vulnerabilidades de software. No entanto, a criação de exploits e diversas outras tarefas potencialmente perigosas permanecem restritas.Para questões biológicas e médicas, os mecanismos de defesa também se tornaram menos sensíveis:A Anthropic relata uma redução de 85% no número de respostas a perguntas inócuas sobre biologia básica e medicina, em comparação com as configurações iniciais do Fable 5.

O Claude Fable 5.1 já está disponível nas principais plataformas, incluindo Amazon Web Services, Google Cloud e Microsoft Azure, e os desenvolvedores podem usar o modelo por meio de uma API.

O Claude Mythos 5.1, por sua vez, está disponível atualmente apenas para profissionais e organizações verificadas. No lançamento, o Mythos 5.1 está disponível apenas para determinadas organizações nos Estados Unidos. No entanto, a empresa está colaborando com o governo americano para expandir o programa para outros parceiros nacionais e internacionais.

By admin

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *