O modelo o3 da OpenAI derrotou o modelo Grok 4 da xAI por 4 a 0 na final do torneio de xadrez Kaggle AI Exhibition, segundo o The Independent. Outros modelos de IA competindo incluíram Anthropic, DeepSeek, Google e Moonshot AI. O confronto final assumiu um significado especial devido à relação extremamente tensa entre os cofundadores da OpenAI, Sam Altman, e Elon Musk, que tentou adquirir a empresa após deixar a OpenAI.

Fonte da imagem: Steve Johnson/Unsplash

Na rodada final do torneio, o o3 demonstrou um jogo impecável, vencendo todas as quatro partidas contra o Grok 4. Ambos os sistemas avançaram para a rodada final após derrotar seus concorrentes nas rodadas anteriores. Em resposta à derrota do Grok 4 no xadrez, Musk afirmou que a jogabilidade do modelo era um “efeito adicional” e não uma prioridade em seu desenvolvimento.

A capacidade dos computadores de derrotar os melhores enxadristas do mundo é conhecida desde 1997, quando o supercomputador Deep Blue, da IBM, derrotou Garry Kasparov. Posteriormente, o Google DeepMind criou um modelo de IA capaz de aprender a jogar xadrez e Go por conta própria. Mas o novo torneio foi a primeira grande competição a testar modelos de grandes linguagens (LLMs) como o ChatGPT.

O CEO e cofundador da Take Take Take, Mats André Kristiansen, observou que, embora a partida de Kasparov contra o Deep Blue tenha sido um grande evento na década de 1990, o principal valor do torneio atual está em explorar como os modelos modernos de IA raciocinam e tomam decisões.

Curiosamente, em julho, o atual campeão mundial de xadrez, Magnus Carlsen, derrotou o ChatGPT em uma partida online sem perder uma única peça. Comentando sobre a final entre Grok e o3, Carlsen estimou o rating de Grok em cerca de 800, e o de o3 em 1200. Para efeito de comparação, seu próprio rating máximo é 2882. Em resposta a uma pergunta do usuário X, o próprio Grok estimou seu nível entre 1600 e 1800.

admin

Postagens recentes

A Tesla está fazendo um recall de milhares de veículos elétricos Model Y devido a uma possível falta de um adesivo.

A Administração Nacional de Segurança Rodoviária (NHTSA) anunciou o recall de 14.575 veículos elétricos Tesla…

2 horas atrás

“Deixem-no terminar o trabalho dele”: Anthropic pediu aos desenvolvedores que não interferissem no trabalho de Claude, que estava escrevendo e revisando o código.

A Anthropic realizou uma conferência de dois dias para desenvolvedores, chamada Code with Claude, em…

3 horas atrás

O Google nomeia os melhores modelos de IA para desenvolvimento de aplicativos Android – Gemini perde para GPT.

O Google atualizou mais uma vez seu ranking Android Bench, que reúne os melhores modelos…

3 horas atrás

A Realme apresentou o smartwatch Watch S5 com tela AMOLED de 1,43 polegadas e bateria com duração de até 20 dias, por US$ 80.

Coincidindo com o lançamento do smartphone Realme 16T, a empresa apresentou o novo smartwatch Realme…

3 horas atrás

A Sparkle lançou a Arc Pro B50 Blower, uma placa gráfica fina com sistema de resfriamento por turbina, ideal para estações de trabalho.

A Sparkle lançou a placa gráfica profissional Intel Arc Pro B50 16GB Blower (SBP50W-16G). A…

3 horas atrás