
GPT-Live-1 chega à API com voz full-duplex
A OpenAI lançou o GPT-Live-1 na API para desenvolvedores criarem agentes de voz que escutam e respondem ao mesmo tempo. Segundo o anúncio divulgado em 10 de setembro de 2026, o modelo de voz full-duplex custa US$ 0,05 por minuto e foi desenhado para conversas naturais, com tratamento de interrupções, silêncio, ruído de fundo e detecção de turno.
A proposta é substituir parte da arquitetura tradicional de reconhecimento de fala, raciocínio e síntese de voz por uma experiência mais contínua em aplicativos, centrais de atendimento e telefonia.
Tabela de conteúdos
Em resumo
O GPT-Live-1 processa áudio de entrada e saída em conjunto. Assim, o agente pode reconhecer uma fala interrompida, reagir com breves confirmações e manter o diálogo enquanto modelos e ferramentas executam tarefas mais complexas.
Como o GPT-Live-1 muda os agentes de voz
Em sistemas em cascata, a voz do usuário costuma passar por reconhecimento de fala, seguir para um modelo de raciocínio e, só então, chegar à síntese de voz. Cada handoff pode acrescentar latência e perder elementos importantes do ritmo da conversa. No GPT-Live-1, ouvir e falar ocorrem de forma simultânea, característica conhecida como full-duplex.
Na prática, a OpenAI afirma que o modelo entende quando deve aguardar, confirmar que está ouvindo ou ceder a vez ao interlocutor. Isso é relevante para agentes de voz em situações menos roteirizadas, como suporte ao cliente, marcação de reservas, atualização de pedidos e conversas em que a pessoa pensa antes de responder. O GPT-Live-1 também pode trabalhar sobre um backend escolhido pelo desenvolvedor, incluindo GPT-6 Astra, Codex ou outras ferramentas da própria aplicação.
O preço informado cobre a camada de voz: modelo de raciocínio, ferramentas e infraestrutura do agente são cobrados separadamente.
Recursos anunciados para a OpenAI API
- Processamento de áudio bidirecional full-duplex.
- Tratamento de interrupções e confirmações naturais.
- Doze vozes com sotaques, dialetos e idiomas.
- Transcrição ASR, texto de resposta e viés de palavras-chave.
- Reconhecimento alfanumérico e detecção nativa de turno.
- Controles de tom, ritmo e estilo via system prompt.
A empresa diz que essas opções permitem separar a camada conversacional da lógica do negócio. Uma organização pode usar o GPT-Live-1 para a fala, conectar seu CRM, definir regras de aprovação e encaminhar casos sensíveis a uma pessoa. Há ainda suporte voltado à telefonia. Vozes personalizadas, porém, dependem de contato com a área comercial, de acordo com o material de lançamento.
Testes, clientes e limites dos números
Os resultados divulgados devem ser lidos como dados fornecidos pela OpenAI e por usuários iniciais, não como auditorias independentes. A Speak relatou quase 80% menos interrupções em comparação com sistemas anteriores baseados em turnos, um dado especialmente relevante para estudantes que precisam de mais tempo para formular respostas. A OpenAI também informou ganho de 30 pontos percentuais sobre o GPT-Realtime-2.1 no Full Duplex Bench.
“GPT-Live-1 leva as conversas naturais e full-duplex do ChatGPT para a API, com mais controle sobre como agentes de voz falam e agem.”
No benchmark Tau3, a companhia afirma que o modelo ficou em primeiro lugar quando combinado ao GPT-6 Astra em esforço médio de raciocínio. Entre os primeiros nomes citados estão Yelp Host, Speak, Fin, da Intercom, e Devin, da Cognition. Um cliente teria reduzido em 80% o código de voz de uma solução em cascata e eliminado 23 mil linhas usadas em conversas clínicas em tempo real. Os resultados podem variar conforme idioma, ruído, integração de ferramentas e desenho do fluxo.
| Aspecto | GPT-Live-1 | Arquitetura em cascata |
|---|---|---|
| Fluxo de áudio | Escuta e fala simultâneas | Etapas sequenciais |
| Interrupções | Tratamento nativo | Depende da orquestração |
| Custo de voz | US$ 0,05 por minuto | Varia por componente |
O que empresas devem avaliar antes da adoção
O lançamento não elimina a necessidade de projetar um agente com segurança. Empresas devem testar precisão da transcrição, reconhecimento de códigos e números, privacidade de gravações, consentimento do cliente, planos de contingência e escalonamento humano. Também é necessário somar o preço do GPT-Live-1 aos custos do modelo de raciocínio, da telefonia, das integrações e do monitoramento.
Para tarefas de alto impacto, como saúde e finanças, a automação deve operar com limites claros e ações aprovadas. A OpenAI cita o Presence como caminho para fluxos em tempo real que usam sistemas corporativos, executam operações permitidas e transferem a conversa a equipes humanas. O ponto central é que uma fala mais fluida não substitui governança, testes de qualidade e revisão de riscos.
O que é o GPT-Live-1 da OpenAI?
É um modelo de voz full-duplex para a API. Ele escuta e responde simultaneamente, buscando reduzir pausas e interrupções em agentes de voz. A lógica de raciocínio pode ser conectada separadamente.
Quanto custa usar o GPT-Live-1?
O preço anunciado é de US$ 0,05 por minuto de áudio. Esse valor não inclui o modelo de raciocínio, ferramentas, telefonia ou a infraestrutura usada pelo agente.
Qual é a diferença para um sistema de voz em cascata?
O sistema em cascata separa ASR, raciocínio e síntese de voz. O GPT-Live-1 processa a conversa de modo bidirecional, preservando melhor o timing e a troca de turnos.
O GPT-Live-1 serve para atendimento ao cliente?
Sim. A OpenAI aponta usos em telefonia, reservas, pedidos e suporte. A adoção responsável exige integração segura, regras de ação e escalonamento para atendentes humanos.
Considerações finais
O GPT-Live-1 posiciona a OpenAI API como uma camada de voz mais natural para agentes conversacionais. A combinação de full-duplex, detecção de turno, controle por prompt e integração com modelos de raciocínio pode simplificar projetos antes dependentes de várias peças. Para avaliar o ganho real, porém, empresas precisarão comparar latência, qualidade, custo total e segurança em seus próprios cenários. Fonte primária: anúncio da OpenAI;
