OpenAI expandiu as opções de interação com ChatGPT. A nova versão do chatbot agora aceita não apenas texto, mas também imagens e comandos de voz como prompts. Para usuários comerciais, novos recursos estarão disponíveis nas próximas duas semanas, mas outros terão que esperar um pouco.

Fonte da imagem: The Verge

As conversas de voz com ChatGPT são um tanto semelhantes às conversas com qualquer assistente de voz, mas a OpenAI afirma que a qualidade das respostas é significativamente maior devido à tecnologia subjacente aprimorada. O usuário pressiona um botão e faz uma pergunta, o ChatGPT converte em texto e a alimenta em um modelo de linguagem maior, recebe a resposta, converte de volta em fala e fala a resposta em voz alta.

Os novos recursos do ChatGPT contam com o modelo maior de linguagem Whisper, que faz grande parte do trabalho de conversão de fala em texto e vice-versa. De acordo com a OpenAI, o novo modelo pode gerar “uma voz humana a partir de um texto e uma amostra de fala com alguns segundos de duração”. Existem atualmente cinco opções de voz ChatGPT disponíveis, mas a OpenAI vê muito mais potencial neste modelo.

A capacidade de criar uma voz sintetizada de qualquer pessoa com base em apenas alguns segundos de sua fala oferece um amplo campo de atividade para os cibercriminosos, admite a OpenAI no anúncio de novos recursos: “São novos riscos, como a capacidade dos invasores de personificar figuras públicas ou cometer fraude.” Segundo a empresa, o modelo não está disponível para uso generalizado por este motivo: a OpenAI planeja limitar o modelo a casos de uso específicos e acordos de parceria.

Já para fazer uma solicitação no ChatGPT por meio de uma imagem, basta o usuário tirar uma foto ou desenhar um item de seu interesse e enviar para o bot. Durante a comunicação, você pode usar instruções de texto ou voz para esclarecer sua solicitação ou limitar a área de pesquisa.

Obviamente, usar imagens como dicas do chatbot também tem seus problemas potenciais. Trata-se principalmente de uma consulta sobre a identidade de uma pessoa em uma foto, embora a OpenAI afirme que limitou a “capacidade do ChatGPT de analisar e fazer declarações diretas sobre as pessoas” por razões de precisão e privacidade.

Quase um ano após o lançamento inicial do ChatGPT, a OpenAI continua a ultrapassar os limites da aplicação e da utilização do seu chatbot, tentando evitar os problemas e deficiências a ele associados. Em particular, a empresa limita deliberadamente as capacidades dos seus novos modelos de IA. Mas esta abordagem não funcionará para sempre. À medida que mais pessoas usam o controle de voz e a pesquisa de imagens, e o ChatGPT se torna um assistente virtual multimodal e útil, manter a IA alinhada se tornará cada vez mais difícil.

avalanche

Postagens recentes

A Apple desenvolveu uma IA que considera várias opções de resposta em paralelo e produz a melhor delas.

Pesquisadores da Apple, em conjunto com cientistas da Universidade da Califórnia, em San Diego, desenvolveram…

35 minutos atrás

A Microsoft aumentou sua receita e lucro, mas as despesas também aumentaram – a IA “devorará” US$ 190 bilhões em um ano.

A Microsoft divulgou seus resultados financeiros do último trimestre: os principais indicadores da empresa mostraram…

35 minutos atrás

A computação em nuvem impulsiona os lucros da Alphabet — os investimentos em IA aumentam para US$ 190 bilhões e mais estão por vir.

A Alphabet Holdings divulgou seus resultados financeiros do último trimestre, segundo os quais o rápido…

35 minutos atrás

CEO da Qualcomm: Mercado de smartphones atingirá o ponto mais baixo neste trimestre, mas depois retomará o crescimento.

O segmento de smartphones deverá ser duramente atingido pelo aumento dos preços da memória e…

46 minutos atrás

“2026 começou muito bem”: YouTube registra crescimento em visualizações, inscrições e receita publicitária.

O tempo de visualização no YouTube, a maior plataforma de vídeos online, continua a crescer…

1 hora atrás