OpenAI dos EUA lança modelo de voz full-duplex GPT-Live

2026-07-09 08:46
Favoritos

De acordo com pt.wedoany.com-A empresa de inteligência artificial dos EUA, OpenAI, lançou um novo modelo de voz, o GPT-Live, projetado para impulsionar interações de voz humano-computador mais naturais. Baseado em uma arquitetura full-duplex, o modelo pode ouvir continuamente e responder em tempo real, não dependendo mais completamente do modo de turno tradicional dos assistentes de voz, onde "o usuário termina uma frase e o sistema começa a responder".

O GPT-Live será lançado em duas versões: GPT-Live-1 e GPT-Live-1 mini. O GPT-Live-1 se tornará o modelo de voz padrão do ChatGPT Voice para usuários dos planos Go, Plus e Pro, enquanto o GPT-Live-1 mini será o modelo de voz padrão para usuários do plano Free. A OpenAI afirma que o GPT-Live está sendo implementado gradualmente para usuários do ChatGPT em todo o mundo, abrangendo iOS, Android e ChatGPT.com.

O full-duplex é o núcleo desta mudança de modelo. A interação de voz tradicional geralmente precisa esperar que o usuário faça uma pausa ou termine de falar para decidir se deve responder, o que pode facilmente levar a problemas como interrupções, falhas na escuta, atrasos ou experiências de interrupção não naturais. O GPT-Live pode monitorar continuamente a entrada de voz durante a conversa, ao mesmo tempo que determina se o usuário está fazendo uma pausa, complementando, corrigindo-se ou esperando que o modelo responda imediatamente. O modelo pode lidar com pausas, interrupções, mudanças na velocidade da fala e transições no ritmo da conversa, tornando a interação de voz mais próxima da comunicação em tempo real entre pessoas.

O GPT-Live é voltado para cenários de agentes de voz em tempo real. O modelo precisa realizar simultaneamente compreensão de voz, rastreamento de contexto, geração de respostas e controle de saída de voz, além de decidir quando continuar ouvindo, quando intervir com uma resposta e quando esperar que o usuário complemente. Em comparação com o processo de simplesmente converter voz em texto e depois gerar uma resposta, o modelo de voz full-duplex integra ouvir, pensar e falar em um único sistema de interação contínua, exigindo maior controle de latência, detecção de atividade de voz, manutenção de contexto e julgamento de turnos de conversa.

A OpenAI também publicou o cartão do sistema GPT-Live, explicando que o GPT-Live-1 e o GPT-Live-1 mini pertencem a uma nova geração de modelos de voz, com o objetivo de tornar as conversas de IA mais naturais e inteligentes. O cartão do sistema menciona que a capacidade full-duplex permite que o modelo ouça e responda continuamente, em vez de esperar o término de um turno de fala explícito para agir.

Em termos de formato de produto, o GPT-Live entra primeiro no ChatGPT Voice. Os usuários podem conversar com o ChatGPT por voz em dispositivos móveis ou na web, e o modelo responderá em tempo real com base no conteúdo da entrada de voz e no contexto da conversa. Para aplicações como assistentes de voz, robôs de atendimento ao cliente, tutores educacionais, auxiliares de reunião, interação veicular e aplicativos de companhia em tempo real, os principais indicadores desse tipo de modelo se concentrarão em latência de resposta, tratamento de interrupções, reconhecimento de pausas naturais, diálogo contínuo de múltiplos turnos e estabilidade da saída de voz.

Em relação à API, a OpenAI já abriu o registro de notificação da API GPT-Live-1, permitindo que desenvolvedores solicitem notificações de disponibilidade futura. Posteriormente, se o GPT-Live entrar na API, empresas e desenvolvedores poderão integrar a capacidade de voz full-duplex em produtos como atendimento ao cliente por voz, hardware inteligente, tradução em tempo real, colaboração remota e agentes de voz industriais.

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com