Meta ensinou o modelo SeamlessM4T AI a traduzir texto e fala de forma mais rápida e natural

Meta✴ atualizou seu modelo SeamlessM4T AI projetado para tradução de fala e texto. Agora a plataforma suporta traduções em quase 100 idiomas, incluindo russo, em formato de texto e 36 em idioma falado. Com a nova arquitetura de solução, a gigante tecnológica pretende tornar a tradução mais natural e expressiva, o que promete ser um avanço na comunicação humana e na produção de conteúdos.

Fonte da imagem: Meta✴

Meta✴ construiu SeamlessM4T em cima de sua arquitetura de modelo rica em recursos UnitY baseada em PyTorch, que executa várias traduções modais, bem como reconhecimento automático de fala. Ele usa o sistema BERT 2.0 para codificação de áudio, dividindo os dados de entrada em tokens de componentes para análise e um vocoder de unidade HiFi-GAN para gerar respostas de voz.

O primeiro dos dois novos recursos do SeamlessM4T é chamado SeamlessExpression. Como o nome sugere, transfere as entonações emocionais da voz para o discurso traduzido. O sistema leva em consideração componentes como o tom da fala, seu volume, coloração emocional (excitação, tristeza ou sussurro), velocidade da fala e pausas. Tudo isso torna as traduções menos mecânicas e mais vivas. Os idiomas suportados são inglês, espanhol, alemão, francês, italiano e chinês.

O segundo recurso, SeamlessStreaming, começa a traduzir a fala enquanto o locutor ainda está falando, permitindo que outros ouvintes ouçam a tradução mais rapidamente. O atraso é de pouco menos de dois segundos. Segundo Meta✴, a principal dificuldade aqui foi a diferença na estrutura das frases nos diferentes idiomas, por isso foi desenvolvido um algoritmo especial que analisa fragmentos de áudio incompletos e decide se há contexto suficiente para começar a gerar uma tradução ou se vale a pena ouvir para o orador.

Como a maioria dos esforços anteriores de tradução automática do Meta✴, seja Llama 2, Massively Multilingual Speech (MMS), Universal Speech Translator (UST) ou o ambicioso projeto No Language Left Behind (NLLB), o SeamlessM4T é de código aberto no GitHub. “Acreditamos que o SeamlessM4T é um avanço importante na busca da comunidade de IA para criar sistemas universais e ricos em recursos”, escreveu a equipe de pesquisa.

O desenvolvimento de tecnologias de IA pela Meta✴ para tradução de vários idiomas abre novas perspectivas no campo da comunicação interlinguística. Estas inovações têm o potencial de superar significativamente as soluções existentes, como as ferramentas de tradução desenvolvidas pela Google e pela Samsung. Ainda não há informações exatas sobre quando o Meta✴ apresentará esses recursos, mas seu potencial uso, por exemplo nos óculos inteligentes Meta✴, promete torná-los indispensáveis ​​​​no dia a dia e no âmbito profissional.

avalanche

Postagens recentes

O filme The Legend of Zelda será lançado antes do previsto – a estreia foi adiada novamente.

Shigeru Miyamoto, cocriador da série de jogos de ação e aventura The Legend of Zelda,…

25 minutos atrás

O maior drone solar do mundo realizou um voo recorde e desapareceu no oceano.

O voo recorde de longa duração do singular avião não tripulado Skydweller, que durou do…

2 horas atrás

A Nvidia está a caminho de atingir uma capitalização de mercado de 6 trilhões de dólares, com suas ações subindo 20% em uma semana.

As ações da Nvidia subiram na quinta-feira, ampliando os ganhos de 20% acumulados nos últimos…

2 horas atrás

A Microsoft está preparando um controle Xbox compacto para jogos na nuvem.

Fontes internas relatam que a Microsoft está desenvolvendo um novo controle compacto para Xbox voltado…

2 horas atrás

A Razer apresenta o notebook gamer Blade 18 com desempenho de desktop.

A Razer anunciou hoje seu laptop mais poderoso de todos os tempos, o Blade 18.…

3 horas atrás

A Microsoft é suspeita de sufocar a concorrência por meio do Word, Teams e Copilot.

A Autoridade de Concorrência e Mercados do Reino Unido (CMA) iniciou uma grande investigação antitruste…

3 horas atrás