Fonte da imagem: Scale.com
O benchmark, criado por especialistas de todo o mundo, contém perguntas e tarefas extremamente complexas sobre conhecimento e raciocínio – mesmo algumas pessoas não conseguem entender perguntas individuais, sem mencionar a resposta para elas. Logo após sua saída, a lista de líderes no exame foi liderada pelo modelo de raciocínio da AI Deepseek R1, que deu 9,4 % das respostas corretas. Os modelos OpenAI O3-Mini com resultado de 10,5 % e O3-Mini-High podem ultrapassá-lo, o que marcou 13 %-o último é realmente mais poderoso, mas também funciona mais lentamente. Mas o resultado foi demonstrado pela pesquisa do Openai Deep, mais impressionante-marcou 26,6 %, conduzindo assim os anteriores menos de 10 dias.
Imperfeito, mas bem-sucedido — assim podemos descrever o voo inaugural do sistema de foguete Starship…
A Anthropic publicou o primeiro relatório sobre seu projeto de cibersegurança, o Projeto Glasswing, lançado…
O presidente dos EUA, Donald Trump, é um investidor experiente. Nos últimos meses, suas declarações…
Uma grave vulnerabilidade foi descoberta no sistema operacional Linux, permitindo que qualquer usuário obtenha acesso…
A versão beta mais recente do WhatsApp para iPhone menciona uma interface de lista de…
A primeira taikonauta de Hong Kong, uma ex-policial com doutorado em informática forense, será a…