OpenAI · Modelo de voz full-duplex

GPT‑Live‑1
ouvir e falar ao mesmo tempo

A nova geração de voz da OpenAI substitui o Voz Avançada por uma arquitetura full-duplex: o modelo processa entrada e saída de áudio continuamente, decide em milissegundos se fala, escuta, pausa ou interrompe — e delega raciocínio pesado para um modelo de backend. Estreou no ChatGPT em 8 de julho de 2026 e chegou à API em 10 de setembro de 2026 por US$ 0,05/minuto.

Variantes: GPT-Live-1 (pago) · GPT-Live-1 mini (Free) API: gpt-live-1 · v1/live/sessions Knowledge cutoff: 31/07/2025 Preço: US$ 0,05/min (por segundo)

1. Visão geral

O GPT-Live é apresentado pela OpenAI como “uma nova geração de modelos de voz que faz conversar com IA parecer muito mais uma conversa real”. São duas mudanças estruturais: interação contínua e delegação.

Interação contínua

Full-duplex

Em vez de trocar mensagens em turnos, o modelo processa continuamente a entrada enquanto gera a saída. Ele faz decisões de interação muitas vezes por segundo: falar, continuar ouvindo, pausar, interromper ou chamar uma ferramenta.

Na prática: ele solta “mhmm” e “entendi” enquanto você fala, aguenta pausas para pensar sem atropelar, ignora melhor ruído de fundo e ainda faz tradução ao vivo.

Delegação

Voz separada do raciocínio

Quando a pergunta exige busca, raciocínio ou tarefas mais agênticas, o GPT-Live delega para outro modelo e continua conversando até o resultado voltar. No lançamento do ChatGPT usava o GPT-5.5; na API já é pareado com modelos da geração GPT-6 (ex.: Astra para casos complexos, Luna para alto volume).

Isso desacopla a camada de voz do motor de inteligência: dá para trocar de modelo de backend sem refazer o produto de voz.

Por que isso importa: as três gerações de voz

1ª · Cascata

STT → LLM → TTS

Três modelos em fila (transcrição, texto, fala). Informação se perde entre as etapas, a resposta é lenta e engessada. Foi o ChatGPT Modo Voz original.

2ª · Por turnos

Voz Avançada (AVM)

Áudio processado e gerado num único modelo, mas ainda esperando o turno acabar. Baseado em silêncio, então pausa ou ruído viravam interrupção em hora errada.

3ª · Contínua

GPT-Live

Full-duplex com backchannels, timing próprio e delegação para backend. A conversa continua fluindo enquanto o trabalho profundo acontece em segundo plano.

2. Linha do tempo

Do anúncio no ChatGPT ao modelo pago por minuto na API, em pouco mais de dois meses.

8 jul 2026ChatGPT
Apresentação do GPT-Live GPT-Live-1 e GPT-Live-1 mini viram o modelo padrão do Modo Voz (pago e Free, respectivamente), em iOS, Android e web. GPT-5.5 como backend no lançamento; nove vozes do ChatGPT remasterizadas; respostas visuais (clima, ações, esportes). Mais de 150 milhões de pessoas usam voz/ditado por semana. Sem vídeo nem compartilhamento de tela na estreia.
31 jul 2026Segurança
Marca-d’água SynthID Áudio compatível gerado pelo GPT-Live (ChatGPT Voice e API) passa a carregar watermark SynthID. A ferramenta pública de verificação detecta sinais de procedência da OpenAI, e a verificação também ganha acesso via API.
4 ago 2026System card
Correção de avaliações de segurança OpenAI identificou um descasamento de configuração nos testes (backend diferente do release final), re-rodou tudo e publicou apêndice com valores originais e corrigidos. Conclusões gerais inalteradas; houve regressões pequenas de “illicit behavior”, “sexual content” e “gore”, nenhuma abaixo do padrão de lançamento.
10 set 2026API
GPT-Live-1 na API a US$ 0,05 por minuto Modelo full-duplex liberado para desenvolvedores, com delegação para modelo de backend (Responses ou cliente), suporte a telefonia, novas vozes, controle de tom/ritmo/estilo por prompt e gerenciamento silencioso de contexto.

3. Arquitetura: dois papéis, uma conversa

A documentação oficial separa o problema em duas partes. O GPT-Live cuida da conversa; o backend cuida do trabalho delegado. Você escolhe o backend de forma independente do modelo de voz.

Modos de delegação

Responses ou cliente

  • Responses delegation: a OpenAI roda o modelo de backend e faz o transporte de contexto e resultados; sua aplicação ainda executa as próprias ferramentas.
  • Client delegation: você conecta qualquer modelo, harness de agente ou serviço próprio e controla contexto, execução e retorno.
  • O modo é escolhido na criação da sessão — para trocar, abre-se uma nova sessão.
Como conectar

WebRTC, WebSocket, SIP e sideband

  • WebRTC: navegador — áudio em media tracks e eventos JSON num data channel. A chave de API fica no servidor.
  • WebSockets: integrações server-side, áudio e controle na mesma conexão.
  • Telefonia/SIP: chamadas de telefone (reservas, suporte).
  • Sideband: WebSocket extra para monitorar ou controlar a sessão pelo backend, sem tirar o áudio do caminho principal.
  • Parceiros: LiveKit, Twilio, Telnyx e Daily/Pipecat.

Recursos nativos do modelo

Transcrições ASR nativas Texto da resposta em paralelo Detecção de turno opcional Function calling Keyword biasing Boa leitura de alfanuméricos (pedidos, placas, códigos) Retenção de contexto em sessões longas 12 vozes, com expansão em andamento Vozes customizadas sob aprovação (via sales)

4. Benchmarks

Os números oficiais comparam com o GPT-Realtime-2.1, o modelo anterior da API. Em testes com pessoa humana, GPT-Live-1 e mini foram preferidos em relação à Voz Avançada em conversas de 5 a 10 minutos (preferência geral, troca de turno, interrupções, fluxo e naturalidade).

+30 p.p.
Full Duplex Bench vs GPT-Realtime-2.1 — com ganhos grandes em latência de troca de turno e comportamento interativo
83,6%
Pass@1 no Tau3 (GPT-Live-1 + Astra em esforço médio), contra 45,7% do GPT-Realtime-2.1 — 1º lugar no ranking de inteligência de voice agents
−80%
Interrupções em avaliação inicial da Speak: mais tempo para o aluno pensar antes da resposta do tutor
#1
Tau3 em tarefas end-to-end de atendimento (aéreo, varejo, telecom) e bom desempenho em suporte bancário

Outras avaliações citadas

GPQA

Ganho substancial sobre a Voz Avançada em raciocínio científico nível especialista (bio, química, física).

BrowseComp

Forte avanço em busca agêntica na web — achar informação difícil com a conversa em andamento.

τ³-Voice Telecom

Atendimento de telecom com múltiplos turnos, incluindo pausas, hesitações e autocorreções na fala.

5. API e preço

O GPT-Live-1 é cobrado por tempo de sessão, não por token de áudio: US$ 0,05 por minuto, faturado por segundo e sem arredondar para o minuto seguinte. O uso do modelo de backend e das ferramentas é cobrado à parte, na tabela normal.

Preço

US$ 0,05 / minuto

Camada de voz (front-end). Backend e ferramentas fora desse valor. Sessão medida por segundo.

Endpoint

v1/live/sessions

Endpoint principal do modelo na API, ao lado dos endpoints clássicos de audio/realtime.

Snapshot

gpt-live-1

Use o identificador direto nas requisições. Knowledge cutoff em 31 de julho de 2025.

Modalidades e features

Entrada / saída

  • Áudio: entrada e saída ✔
  • Texto: entrada e saída ✔
  • Imagem: não suportado (o antecessor aceitava — regressão de escopo)
  • Vídeo: não suportado

Capacidades

  • Streaming: suportado
  • Function calling: suportado
  • Structured outputs: não
  • Fine-tuning: não
  • Predicted outputs: não

Limites de sessões simultâneas

TierSessões concorrentes
FreeNão suportado
Tier 125
Tier 250
Tier 3200
Tier 4300
Tier 5500

Delegando para um agente (exemplo oficial com Codex)

// trecho do post de lançamento: o app passa contexto para o Codex
// e devolve a resposta para o GPT-Live-1 como comentário na sessão
import { Codex } from "@openai/codex-sdk";

const thread = new Codex().startThread({
  workingDirectory: "./repo",
  sandboxMode: "read-only",
  approvalPolicy: "never",
});

async function answer(live, delegationId, context) {
  const { finalResponse } = await thread.run(
    `Answer the latest question using this repo.
Reply in two short spoken sentences.\n${context}`
  );

  live.send({
    type: "session.commentary.append",
    delegation_id: delegationId,
    content: finalResponse,
  });
}

Setup completo: chave no servidor, sessão criada no backend, WebRTC no browser Espere session.started antes de falar Feche a sessão para coletar uso final e liberar a conexão

6. Casos de uso e clientes citados

A OpenAI posiciona telefonia e atendimento como os primeiros casos fortes: reservas, pedidos, suporte e coaching. Os depoimentos no lançamento vêm de quem já trocou arquitetura de voz pelo modelo.

“Comparado ao nosso build em cascata, o GPT-Live-1 simplificou o código em 80% e removeu 23 mil linhas. Isso permitiu conversas de paciente naturais em tempo real e liberou o time para melhorar a experiência.”
Tony Stoyanov · Co-fundador e CTO · Harrison.ai
“O GPT-Live-1 melhorou troca de turno e precisão sobre a arquitetura de voz tradicional. Nas chamadas de reservas e pedidos, vemos ganhos relevantes na taxa de atendimento — e quem liga fala frases mais completas.”
Alex Levy · CTO · Yelp (Yelp Host e Hatch)
Quem aparece no material
  • Yelp: reservas e pedidos por telefone.
  • Speak: tutor de idiomas com menos interrupções e mais tempo de pensar.
  • Fin: suporte ao cliente em escala.
  • Cognition: agentes de engenharia com camada de voz.
  • Harrison.ai: conversas clínicas em tempo real.
Produto em cima do modelo

OpenAI Presence

Oferece agentes de voz corporativos que respondem, resolvem, usam sistemas da empresa, executam ações aprovadas e escalam para humanos quando necessário — usando o GPT-Live como camada de voz.

7. Segurança

O system card é de 8 de julho de 2026 e cobre GPT-Live-1 e GPT-Live-1 mini, inclusive no cenário de delegação.

Procedência

SynthID

Áudio compatível gerado pelo GPT-Live sai com marca-d’água SynthID. A verificação está disponível na ferramenta pública e via API para fluxos próprios.

Proteções em tempo real

Steering durante a fala

Entradas e saídas são checadas conforme a conversa corre. Quando detecta risco, o sistema pode redirecionar a resposta, tocar aviso falado, oferecer recursos de apoio em texto ou encerrar a conversa em casos mais graves.

Red teaming

Riscos exclusivos de voz

Testes internos e externos em vários idiomas cobriram voz infantil, impersonação, identificação de locutor, automutilação, dependência emocional, golpes e perturbações de áudio.

Preparedness Framework

O Safety Advisory Group avaliou que nem GPT-Live-1 nem o mini, operando sem delegação, atingem risco Alto nas categorias monitoradas (bio/químico, autoaperfeiçoamento de IA, cibersegurança). Com delegação, valem as salvaguardas do modelo que faz o trabalho.

Sem clonagem de voz no ChatGPT

O modelo é feito para conversar, não para imitar vozes: no ChatGPT usa um conjunto predefinido de vozes com proteção contra imitar pessoa real. Para adolescentes há comportamentos treinados por idade e controles parentais sobre o uso do Modo Voz.

8. Limitações e pontos de atenção

O que a própria OpenAI deixa explícito e o que precisa entrar no planejamento.

Cuidado
  • Sem imagem e sem vídeo: o modelo não aceita imagem na API (o antecessor aceitava) e o Modo Voz estreou sem vídeo ou compartilhamento de tela.
  • Idiomas: otimizado para os idiomas mais populares do ChatGPT; em alguns pode haver sotaque não nativo ou lacunas de fluência.
  • Vozes customizadas: exigem elegibilidade e processo de solicitação; vozes novas e mais idiomas chegam ao longo dos meses.
  • Structured outputs e fine-tuning: fora do escopo — a estruturação fica no backend.
Operação
  • Custo muda de natureza: você paga por tempo de conversa, então sessões longas e silêncio custam — e o backend soma por cima.
  • Duas partes para versionar: voz e backend evoluem separados; o modo de delegação é fixado na criação da sessão.
  • Migração: quem já usa Realtime API precisa rever prompts, manejo de turno e ferramentas no caminho de migração.
  • Fallback: o ChatGPT mantém Modo Voz padrão e Voz Avançada acessíveis para recursos ainda não cobertos (vídeo, tela).

9. Leitura rápida

Se você constrói produto de voz

O ganho real não é “falar melhor”: é poder colocar a inteligência no backend e tratar a voz como uma camada substituível. Arquitetura em cascata pode perder bastante código nessa troca.

Se o caso é telefonia

É o cenário mais maduro: SIP, ASR nativo, leitura de alfanuméricos e biasing de palavras, com handling de interrupção que era o ponto fraco dos sistemas por turno.

Se o público é brasileiro

Português não aparece entre os idiomas destacados nos materiais. Antes de prometer fluência nativa, vale testar sotaque, gírias e nomes próprios em sessão real pagando por minuto.

Números para guardar

US$ 0,05/min
camada de voz, por segundo
+30 p.p.
Full Duplex Bench vs GPT-Realtime-2.1
500
sessões simultâneas no Tier 5
150 M
pessoas por semana usando voz/ditado no ChatGPT

Fontes

Material oficial da OpenAI primeiro; mídia e análises de terceiros para números de contexto.

Oficiais

Mídia e análises de terceiros