A Microsoft lançou uma prévia pública de dois novos modelos de inteligência artificial de seu próprio projeto. MAI-Image-2.5-Pro ​​​​é o principal gerador de imagens da linha de produtos da empresa; MAI-Voice-2-Flash foi projetado para reconhecimento de fala em cargas de trabalho empresariais de alto volume.\n\n

\n\nFonte da imagem: microsoft.ai\n\nA gigante do software citou os dados de desempenho de ambos os modelos como seu argumento mais forte de que pode usar seus próprios produtos sem depender dos designs da OpenAI. Agora, os modelos de IA da Microsoft estão sendo executados em um grande número de produtos da empresa: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot e Azure – não são mais projetos de pesquisa, mas infraestrutura funcional que atende milhões de clientes. “Cada uma dessas melhorias é um passo em direção ao mesmo objetivo: produtos Microsoft rodando em modelos Microsoft”, enfatizou a empresa.\n\nNa curva qualidade-velocidade-custo, os dois novos modelos ocupam posições opostas, e isso é intencional. MAI-Image-2.5-Pro ​​​​é um desenvolvimento premium: gera imagens de alta qualidade, fornece edição detalhada e renderização de texto precisa. Quando acessado por meio da API, trabalhar com o modelo custará US$ 5 por 1 milhão de tokens de texto como entrada, US$ 8 por 1 milhão de tokens de imagem como entrada e US$ 106 por milhão de tokens de imagem como saída. O MAI-Image-2.5 básico ficou recentemente em segundo lugar no ranking de modelos de edição de imagens na plataforma Arena.\n\n

\n\nMAI-Voice-2-Flash tem exatamente o posicionamento oposto. Funciona duas vezes mais rápido que o MAI-Voice-2-Flash básico e custa 32% menos – US$ 15 por 1 milhão de caracteres. O modelo foi projetado para o mercado de voz de alto desempenho: call centers, agentes de voz e aplicações de processamento de fala em tempo real, onde a baixa latência é importante. Um estúdio criativo que busca o máximo de precisão tem necessidades muito diferentes de uma equipe de atendimento ao cliente que atende milhões de chamadas por dia.\n\nA Microsoft também falou sobre o progresso na implementação de seus próprios modelos. O serviço Bing Image Creator foi totalmente transferido para MAI-Image-2.5; no PowerPoint, esse modelo ajudou a reduzir os custos de recursos de GPU em 84% em comparação ao OpenAI GPT-Image-2; ajudou a otimizar o processamento de tarefas no armazenamento em nuvem OneDrive. O novo MAI-Voice-2-Flash foi implantado na plataforma Dynamics 365 Contact Center, reduzindo os custos de recursos de GPU em até 89%; também foi integrado ao serviço Azure Voice Live para desenvolvedores. O serviço Microsoft Dragon Copilot, que é usado por 170.000 instituições médicas e que processou 28 milhões de solicitações de pacientes no primeiro trimestre, foi transferido para o modelo MAI-Transcribe-1.5 com suporte para 58 idiomas.\n\nO modelo leve MAI-Code-1-Flash para escrever código começou a funcionar na plataforma GitHub Copilot em junho – em comparação com OpenAI GPT-5.4 Mini e Anthropic Claude Haiku 4.5 que ele fornece Adoção de código 10% maior com consumo médio de token 10% menor. Os usuários têm 6% mais probabilidade de escolhê-lo novamente do que o GPT-5.4 Mini e 11% mais probabilidade de escolhê-lo novamente do que o Claude Haiku 4.5. A Microsoft também a treinou para trabalhar em Excel, e na maioria das tarefas mais comuns ela começou a realizar no nível GPT-5.6, embora seja bastantepequeno para rodar em aceleradores Nvidia H100 e até mesmo A100 desatualizados.\n

By admin

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *