A nova geração de voz da OpenAI substitui o Voz Avançada por uma arquitetura full-duplex: o modelo processa entrada e saída de áudio continuamente, decide em milissegundos se fala, escuta, pausa ou interrompe — e delega raciocínio pesado para um modelo de backend. Estreou no ChatGPT em 8 de julho de 2026 e chegou à API em 10 de setembro de 2026 por US$ 0,05/minuto.
O GPT-Live é apresentado pela OpenAI como “uma nova geração de modelos de voz que faz conversar com IA parecer muito mais uma conversa real”. São duas mudanças estruturais: interação contínua e delegação.
Em vez de trocar mensagens em turnos, o modelo processa continuamente a entrada enquanto gera a saída. Ele faz decisões de interação muitas vezes por segundo: falar, continuar ouvindo, pausar, interromper ou chamar uma ferramenta.
Na prática: ele solta “mhmm” e “entendi” enquanto você fala, aguenta pausas para pensar sem atropelar, ignora melhor ruído de fundo e ainda faz tradução ao vivo.
Quando a pergunta exige busca, raciocínio ou tarefas mais agênticas, o GPT-Live delega para outro modelo e continua conversando até o resultado voltar. No lançamento do ChatGPT usava o GPT-5.5; na API já é pareado com modelos da geração GPT-6 (ex.: Astra para casos complexos, Luna para alto volume).
Isso desacopla a camada de voz do motor de inteligência: dá para trocar de modelo de backend sem refazer o produto de voz.
Três modelos em fila (transcrição, texto, fala). Informação se perde entre as etapas, a resposta é lenta e engessada. Foi o ChatGPT Modo Voz original.
Áudio processado e gerado num único modelo, mas ainda esperando o turno acabar. Baseado em silêncio, então pausa ou ruído viravam interrupção em hora errada.
Full-duplex com backchannels, timing próprio e delegação para backend. A conversa continua fluindo enquanto o trabalho profundo acontece em segundo plano.
Do anúncio no ChatGPT ao modelo pago por minuto na API, em pouco mais de dois meses.
A documentação oficial separa o problema em duas partes. O GPT-Live cuida da conversa; o backend cuida do trabalho delegado. Você escolhe o backend de forma independente do modelo de voz.
Os números oficiais comparam com o GPT-Realtime-2.1, o modelo anterior da API. Em testes com pessoa humana, GPT-Live-1 e mini foram preferidos em relação à Voz Avançada em conversas de 5 a 10 minutos (preferência geral, troca de turno, interrupções, fluxo e naturalidade).
Ganho substancial sobre a Voz Avançada em raciocínio científico nível especialista (bio, química, física).
Forte avanço em busca agêntica na web — achar informação difícil com a conversa em andamento.
Atendimento de telecom com múltiplos turnos, incluindo pausas, hesitações e autocorreções na fala.
O GPT-Live-1 é cobrado por tempo de sessão, não por token de áudio: US$ 0,05 por minuto, faturado por segundo e sem arredondar para o minuto seguinte. O uso do modelo de backend e das ferramentas é cobrado à parte, na tabela normal.
Camada de voz (front-end). Backend e ferramentas fora desse valor. Sessão medida por segundo.
v1/live/sessionsEndpoint principal do modelo na API, ao lado dos endpoints clássicos de audio/realtime.
gpt-live-1Use o identificador direto nas requisições. Knowledge cutoff em 31 de julho de 2025.
| Tier | Sessões concorrentes |
|---|---|
| Free | Não suportado |
| Tier 1 | 25 |
| Tier 2 | 50 |
| Tier 3 | 200 |
| Tier 4 | 300 |
| Tier 5 | 500 |
// trecho do post de lançamento: o app passa contexto para o Codex // e devolve a resposta para o GPT-Live-1 como comentário na sessão import { Codex } from "@openai/codex-sdk"; const thread = new Codex().startThread({ workingDirectory: "./repo", sandboxMode: "read-only", approvalPolicy: "never", }); async function answer(live, delegationId, context) { const { finalResponse } = await thread.run( `Answer the latest question using this repo. Reply in two short spoken sentences.\n${context}` ); live.send({ type: "session.commentary.append", delegation_id: delegationId, content: finalResponse, }); }
Setup completo: chave no servidor, sessão criada no backend, WebRTC no browser
Espere session.started antes de falar
Feche a sessão para coletar uso final e liberar a conexão
A OpenAI posiciona telefonia e atendimento como os primeiros casos fortes: reservas, pedidos, suporte e coaching. Os depoimentos no lançamento vêm de quem já trocou arquitetura de voz pelo modelo.
“Comparado ao nosso build em cascata, o GPT-Live-1 simplificou o código em 80% e removeu 23 mil linhas. Isso permitiu conversas de paciente naturais em tempo real e liberou o time para melhorar a experiência.”
“O GPT-Live-1 melhorou troca de turno e precisão sobre a arquitetura de voz tradicional. Nas chamadas de reservas e pedidos, vemos ganhos relevantes na taxa de atendimento — e quem liga fala frases mais completas.”
Oferece agentes de voz corporativos que respondem, resolvem, usam sistemas da empresa, executam ações aprovadas e escalam para humanos quando necessário — usando o GPT-Live como camada de voz.
O system card é de 8 de julho de 2026 e cobre GPT-Live-1 e GPT-Live-1 mini, inclusive no cenário de delegação.
Áudio compatível gerado pelo GPT-Live sai com marca-d’água SynthID. A verificação está disponível na ferramenta pública e via API para fluxos próprios.
Entradas e saídas são checadas conforme a conversa corre. Quando detecta risco, o sistema pode redirecionar a resposta, tocar aviso falado, oferecer recursos de apoio em texto ou encerrar a conversa em casos mais graves.
Testes internos e externos em vários idiomas cobriram voz infantil, impersonação, identificação de locutor, automutilação, dependência emocional, golpes e perturbações de áudio.
O Safety Advisory Group avaliou que nem GPT-Live-1 nem o mini, operando sem delegação, atingem risco Alto nas categorias monitoradas (bio/químico, autoaperfeiçoamento de IA, cibersegurança). Com delegação, valem as salvaguardas do modelo que faz o trabalho.
O modelo é feito para conversar, não para imitar vozes: no ChatGPT usa um conjunto predefinido de vozes com proteção contra imitar pessoa real. Para adolescentes há comportamentos treinados por idade e controles parentais sobre o uso do Modo Voz.
O que a própria OpenAI deixa explícito e o que precisa entrar no planejamento.
O ganho real não é “falar melhor”: é poder colocar a inteligência no backend e tratar a voz como uma camada substituível. Arquitetura em cascata pode perder bastante código nessa troca.
É o cenário mais maduro: SIP, ASR nativo, leitura de alfanuméricos e biasing de palavras, com handling de interrupção que era o ponto fraco dos sistemas por turno.
Português não aparece entre os idiomas destacados nos materiais. Antes de prometer fluência nativa, vale testar sotaque, gírias e nomes próprios em sessão real pagando por minuto.
Material oficial da OpenAI primeiro; mídia e análises de terceiros para números de contexto.