Categorias: Inteligência Artificial, Aprendizado de Máquina, Redes NeuraisMercado de tecnologia e TI. notícia

ChatGPT aprendeu a entender comandos de voz e trabalhar com imagens

OpenAI expandiu as opções de interação com ChatGPT. A nova versão do chatbot agora aceita não apenas texto, mas também imagens e comandos de voz como prompts. Para usuários comerciais, novos recursos estarão disponíveis nas próximas duas semanas, mas outros terão que esperar um pouco.

Fonte da imagem: The Verge

As conversas de voz com ChatGPT são um tanto semelhantes às conversas com qualquer assistente de voz, mas a OpenAI afirma que a qualidade das respostas é significativamente maior devido à tecnologia subjacente aprimorada. O usuário pressiona um botão e faz uma pergunta, o ChatGPT converte em texto e a alimenta em um modelo de linguagem maior, recebe a resposta, converte de volta em fala e fala a resposta em voz alta.

Os novos recursos do ChatGPT contam com o modelo maior de linguagem Whisper, que faz grande parte do trabalho de conversão de fala em texto e vice-versa. De acordo com a OpenAI, o novo modelo pode gerar “uma voz humana a partir de um texto e uma amostra de fala com alguns segundos de duração”. Existem atualmente cinco opções de voz ChatGPT disponíveis, mas a OpenAI vê muito mais potencial neste modelo.

A capacidade de criar uma voz sintetizada de qualquer pessoa com base em apenas alguns segundos de sua fala oferece um amplo campo de atividade para os cibercriminosos, admite a OpenAI no anúncio de novos recursos: “São novos riscos, como a capacidade dos invasores de personificar figuras públicas ou cometer fraude.” Segundo a empresa, o modelo não está disponível para uso generalizado por este motivo: a OpenAI planeja limitar o modelo a casos de uso específicos e acordos de parceria.

Já para fazer uma solicitação no ChatGPT por meio de uma imagem, basta o usuário tirar uma foto ou desenhar um item de seu interesse e enviar para o bot. Durante a comunicação, você pode usar instruções de texto ou voz para esclarecer sua solicitação ou limitar a área de pesquisa.

Obviamente, usar imagens como dicas do chatbot também tem seus problemas potenciais. Trata-se principalmente de uma consulta sobre a identidade de uma pessoa em uma foto, embora a OpenAI afirme que limitou a “capacidade do ChatGPT de analisar e fazer declarações diretas sobre as pessoas” por razões de precisão e privacidade.

Quase um ano após o lançamento inicial do ChatGPT, a OpenAI continua a ultrapassar os limites da aplicação e da utilização do seu chatbot, tentando evitar os problemas e deficiências a ele associados. Em particular, a empresa limita deliberadamente as capacidades dos seus novos modelos de IA. Mas esta abordagem não funcionará para sempre. À medida que mais pessoas usam o controle de voz e a pesquisa de imagens, e o ChatGPT se torna um assistente virtual multimodal e útil, manter a IA alinhada se tornará cada vez mais difícil.

avalanche

Próximo O Spotify dublará podcasts em línguas estrangeiras nas vozes dos próprios autores usando IA »

Anterior « As autoridades chinesas alocarão outros US$ 13,7 bilhões para o desenvolvimento da indústria de semicondutores

Deixar comentário

Publicado por

avalanche

3 anos atrás

Postagens recentes

Eletrônica vestível

Filmado em Hollywood? Por que Stanley Kubrick não conseguiu simular fisicamente o Moonwalk / Offsyanka

⇡#Parte 1. Elegância cinematográfica versus monstruosidade biomecânica Qualquer pessoa que estude imagens das missões lunares…

2 horas atrás

Eletrônica vestível

Um vazamento mostra os óculos Samsung Galaxy de todos os ângulos.

A Samsung deverá apresentar seus primeiros óculos inteligentes antes do final deste ano. Embora a…

3 horas atrás

Sistemas operacionais

A Microsoft estava desenvolvendo um sistema operacional de IA distinto do Windows, com profunda integração do Copilot e de agentes.

De acordo com o Windows Central, a Microsoft explorou a possibilidade de criar um sistema…

5 horas atrás

Carros, motos, veículos

O novo crossover R2 dá novo fôlego à Rivian: vendas superam expectativas, previsão revisada para cima.

A Rivian Automotive Inc. elevou sua previsão de vendas de veículos elétricos para este ano.…

5 horas atrás

Monitores, projetores, sintonizadores de TV, televisões

A Philips anunciou os monitores gamer Evnia M4 de 27 polegadas com três modos de operação: 1440p a 275Hz, 1080p a 360Hz e 720p a 540Hz.

A Philips anunciou dois monitores da sua série gamer Evnia M4: o 27M4N3500PT e o…

6 horas atrás

Jogos

A Epic Games Store está oferecendo gratuitamente o clássico jogo “I Have No Mouth, and I Must Scream”, sobre os últimos humanos na Terra sendo torturados por um supercomputador enlouquecido.

Conforme prometido, no dia 2 de julho, a Epic Games Store lançou uma promoção com…

8 horas atrás