Fonte da imagem: Scale.com
O benchmark, criado por especialistas de todo o mundo, contém perguntas e tarefas extremamente complexas sobre conhecimento e raciocínio – mesmo algumas pessoas não conseguem entender perguntas individuais, sem mencionar a resposta para elas. Logo após sua saída, a lista de líderes no exame foi liderada pelo modelo de raciocínio da AI Deepseek R1, que deu 9,4 % das respostas corretas. Os modelos OpenAI O3-Mini com resultado de 10,5 % e O3-Mini-High podem ultrapassá-lo, o que marcou 13 %-o último é realmente mais poderoso, mas também funciona mais lentamente. Mas o resultado foi demonstrado pela pesquisa do Openai Deep, mais impressionante-marcou 26,6 %, conduzindo assim os anteriores menos de 10 dias.
Astrônomos relataram a descoberta de uma radiogaláxia incomum, RAD-BAARG, ao redor da qual se formou…
A Ayaneo lançou o Pocket Micro 2, seu segundo console Android em miniatura e formato…
Uma nova versão do computador de placa única Raspberry Pi 4 Modelo B já está…
A Comissão Europeia anunciou que chegou a uma conclusão preliminar para incluir os principais serviços…
A escassez de chips de memória e os preços exorbitantes estão inspirando entusiastas a grandes…
A Google Play Store provavelmente tem aplicativos para todos os gostos e necessidades, mas a…