Estudo da Microsoft mostra que a IA é ‘mais ou menos’ na correção de bugs em códigos de software

Um novo estudo da Microsoft Research descobriu que, embora a IA esteja ajudando os desenvolvedores a escrever código, mesmo os melhores modelos da OpenAI (o1) e da Anthropic (Claude 3.7 Sonnet) só conseguem corrigir erros metade das vezes. O teste foi realizado com base no melhor benchmark SWE-bench, que mede a capacidade dos sistemas de IA de criar código de programa.

Fonte da imagem: gerada por IA

Durante o experimento, os agentes de IA tentaram resolver 300 problemas para eliminar erros no código. O líder foi o modelo Claude 3.7 Sonnet, que completou a tarefa com uma taxa de sucesso de 48,4%, o segundo lugar foi para o OpenAI o1 (30,2%) e o terceiro para o o3-mini (22,1%). Entretanto, como você pode ver, mesmo esses números estão longe do nível que se esperaria de programadores humanos experientes. Como explica o TechCrunch, o principal problema é que a inteligência artificial ainda tem uma compreensão deficiente de como usar as ferramentas disponíveis e interpretar erros.

Segundo os autores do estudo, o principal obstáculo continua sendo a falta de dados para modelos de treinamento. “Acreditamos firmemente que o treinamento ou a reciclagem podem torná-los melhores depuradores interativos”, escrevem eles. “No entanto, isso requer dados especializados, por exemplo, uma cadeia de registros de todos os processos de interação entre pessoas e depuradores de IA.”

Atualmente, esses dados são insuficientes, o que limita as capacidades dos modelos. Por exemplo, a popular ferramenta Devin da startup Cognition Labs só conseguiu lidar com três dos 20 testes de codificação por esse motivo. E embora a IA esteja sendo muito usada por empresas como o Google, o CEO Sundar Pichai diz que um quarto do código criado usando inteligência artificial pode, na verdade, introduzir bugs.

Líderes de tecnologia estão céticos quanto à automação completa da profissão de programação. Bill Gates está confiante de que a programação como profissão certamente não desaparecerá. O CEO da Replit, Amjad Masad, o CEO da Okta, Todd McKinnon, e o CEO da IBM, Arvind Krishna, compartilham opiniões semelhantes.

Apesar dos desafios óbvios, o interesse em ferramentas de desenvolvimento de IA continua crescendo. Os investidores veem potencial para ganhos de eficiência, mas os principais desenvolvedores acreditam que é muito cedo para confiar completamente na IA.

avalanche

Postagens recentes

Calendário de Lançamentos – 1 a 7 de setembro: Hollow Knight: Silksong, Cronos: The New Dawn e Metal Eden

Análise do modo ranqueado de Warface: fácil de pegar o jeito, difícil de largar

20 minutos atrás

CD Projekt Red intriga fãs de Cyberpunk 2077 com teaser misterioso do presidente dos EUA

Embora o suporte de conteúdo para o RPG de ação cyberpunk em primeira pessoa Cyberpunk…

39 minutos atrás

A seleção de horas e minutos do despertador do iPhone não é um ciclo, mas uma longa lista com um final inesperado

Parece difícil imaginar algo mais elementar do ponto de vista do usuário do que escolher…

49 minutos atrás

Google Chrome Mobile recebe nova interface de usuário Material 3 Expressive

O Google anunciou sua nova linguagem de design, Material 3 Expressive, em maio deste ano.…

57 minutos atrás

O pico online de Hollow Knight atinge 71 mil jogadores simultâneos no Steam conforme Silksong se aproxima

Lançado em 2017, Metroidvania Hollow Knight, do estúdio australiano Team Cherry, continua quebrando recordes de…

2 horas atrás