A Meta✴ apresentou o primeiro modelo de IA projetado para processamento de áudio em tempo real. O Muse Voice Transcribe transcreve a fala de mais de 20 pessoas e lida com vários idiomas simultaneamente.

Fonte da imagem: Kate Bezzubets / unsplash.com

No vídeo de demonstração, o modelo não só suporta o reconhecimento de fala para múltiplos falantes e processa vários idiomas, como também consegue decifrar frases quando uma pessoa alterna entre idiomas no meio da frase. “O modelo decide quando ouvir”, disse o CEO Mark Zuckerberg. “Ele espera um pouco mais por palavras complexas e responde mais rapidamente às simples, usando latência adaptativa para prever cada token e melhorar a precisão. Ele também funciona bem com áudio de baixa qualidade do mundo real — treinado em 70 idiomas (25 dos quais foram testados no lançamento), lida com transições de idioma no meio da frase e com sessões de uma hora com mais de 20 falantes.”

Na semana passada, o Google apresentou o Gemini 3.5 Transcribe, um modelo com capacidades semelhantes, que será integrado ao Android e ao Chrome. A Meta✴ ainda não anunciou planos para integrar seu desenvolvimento aos seus próprios serviços principais. O Muse Voice Transcribe está disponível no aplicativo Meta✴AI para macOS da Apple. Os desenvolvedores podem acessar o conteúdo por meio das plataformas Muse Code e Meta✴Model API por US$ 3 a cada 1.000 minutos de áudio.

By admin

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *