Meta ensinou o modelo SeamlessM4T AI a traduzir texto e fala de forma mais rápida e natural

Meta✴ atualizou seu modelo SeamlessM4T AI projetado para tradução de fala e texto. Agora a plataforma suporta traduções em quase 100 idiomas, incluindo russo, em formato de texto e 36 em idioma falado. Com a nova arquitetura de solução, a gigante tecnológica pretende tornar a tradução mais natural e expressiva, o que promete ser um avanço na comunicação humana e na produção de conteúdos.

Fonte da imagem: Meta✴

Meta✴ construiu SeamlessM4T em cima de sua arquitetura de modelo rica em recursos UnitY baseada em PyTorch, que executa várias traduções modais, bem como reconhecimento automático de fala. Ele usa o sistema BERT 2.0 para codificação de áudio, dividindo os dados de entrada em tokens de componentes para análise e um vocoder de unidade HiFi-GAN para gerar respostas de voz.

O primeiro dos dois novos recursos do SeamlessM4T é chamado SeamlessExpression. Como o nome sugere, transfere as entonações emocionais da voz para o discurso traduzido. O sistema leva em consideração componentes como o tom da fala, seu volume, coloração emocional (excitação, tristeza ou sussurro), velocidade da fala e pausas. Tudo isso torna as traduções menos mecânicas e mais vivas. Os idiomas suportados são inglês, espanhol, alemão, francês, italiano e chinês.

O segundo recurso, SeamlessStreaming, começa a traduzir a fala enquanto o locutor ainda está falando, permitindo que outros ouvintes ouçam a tradução mais rapidamente. O atraso é de pouco menos de dois segundos. Segundo Meta✴, a principal dificuldade aqui foi a diferença na estrutura das frases nos diferentes idiomas, por isso foi desenvolvido um algoritmo especial que analisa fragmentos de áudio incompletos e decide se há contexto suficiente para começar a gerar uma tradução ou se vale a pena ouvir para o orador.

Como a maioria dos esforços anteriores de tradução automática do Meta✴, seja Llama 2, Massively Multilingual Speech (MMS), Universal Speech Translator (UST) ou o ambicioso projeto No Language Left Behind (NLLB), o SeamlessM4T é de código aberto no GitHub. “Acreditamos que o SeamlessM4T é um avanço importante na busca da comunidade de IA para criar sistemas universais e ricos em recursos”, escreveu a equipe de pesquisa.

O desenvolvimento de tecnologias de IA pela Meta✴ para tradução de vários idiomas abre novas perspectivas no campo da comunicação interlinguística. Estas inovações têm o potencial de superar significativamente as soluções existentes, como as ferramentas de tradução desenvolvidas pela Google e pela Samsung. Ainda não há informações exatas sobre quando o Meta✴ apresentará esses recursos, mas seu potencial uso, por exemplo nos óculos inteligentes Meta✴, promete torná-los indispensáveis ​​​​no dia a dia e no âmbito profissional.

avalanche

Postagens recentes

O primeiro relógio de pulso movido a energia solar do mundo completa 50 anos.

A Citizen comemorou o 50º aniversário do seu primeiro relógio de pulso analógico movido a…

4 horas atrás

A NASA indignou empresas privadas ao abandonar estações orbitais comerciais – bilhões em investimentos estão em risco.

No evento do programa Ignition da NASA, em 24 de março, a agência propôs abandonar…

6 horas atrás

O Apple Mac OS X celebrou seu aniversário de 25 anos.

Esta semana, o Mac OS X da Apple celebrou seu aniversário de 25 anos —…

6 horas atrás

O Apple Mac OS X celebrou seu aniversário de 25 anos.

Esta semana, o Mac OS X da Apple celebrou seu aniversário de 25 anos —…

6 horas atrás

A AMD comemorou o 10º aniversário da plataforma AM4 e prometeu dar continuidade à tradição na AM5.

A AMD considera o suporte a longo prazo para sockets como um compromisso com os…

9 horas atrás