NoticiasInteligência ArtificialTecnologia

GPT-Live-1 chega à API com voz full-duplex

A OpenAI lançou o GPT-Live-1 na API para desenvolvedores criarem agentes de voz que escutam e respondem ao mesmo tempo. Segundo o anúncio divulgado em 10 de setembro de 2026, o modelo de voz full-duplex custa US$ 0,05 por minuto e foi desenhado para conversas naturais, com tratamento de interrupções, silêncio, ruído de fundo e detecção de turno.

A proposta é substituir parte da arquitetura tradicional de reconhecimento de fala, raciocínio e síntese de voz por uma experiência mais contínua em aplicativos, centrais de atendimento e telefonia.

Em resumo

O GPT-Live-1 processa áudio de entrada e saída em conjunto. Assim, o agente pode reconhecer uma fala interrompida, reagir com breves confirmações e manter o diálogo enquanto modelos e ferramentas executam tarefas mais complexas.

PUBLICIDADE

Como o GPT-Live-1 muda os agentes de voz

Em sistemas em cascata, a voz do usuário costuma passar por reconhecimento de fala, seguir para um modelo de raciocínio e, só então, chegar à síntese de voz. Cada handoff pode acrescentar latência e perder elementos importantes do ritmo da conversa. No GPT-Live-1, ouvir e falar ocorrem de forma simultânea, característica conhecida como full-duplex.

Na prática, a OpenAI afirma que o modelo entende quando deve aguardar, confirmar que está ouvindo ou ceder a vez ao interlocutor. Isso é relevante para agentes de voz em situações menos roteirizadas, como suporte ao cliente, marcação de reservas, atualização de pedidos e conversas em que a pessoa pensa antes de responder. O GPT-Live-1 também pode trabalhar sobre um backend escolhido pelo desenvolvedor, incluindo GPT-6 Astra, Codex ou outras ferramentas da própria aplicação.

O preço informado cobre a camada de voz: modelo de raciocínio, ferramentas e infraestrutura do agente são cobrados separadamente.

Recursos anunciados para a OpenAI API

  • Processamento de áudio bidirecional full-duplex.
  • Tratamento de interrupções e confirmações naturais.
  • Doze vozes com sotaques, dialetos e idiomas.
  • Transcrição ASR, texto de resposta e viés de palavras-chave.
  • Reconhecimento alfanumérico e detecção nativa de turno.
  • Controles de tom, ritmo e estilo via system prompt.

A empresa diz que essas opções permitem separar a camada conversacional da lógica do negócio. Uma organização pode usar o GPT-Live-1 para a fala, conectar seu CRM, definir regras de aprovação e encaminhar casos sensíveis a uma pessoa. Há ainda suporte voltado à telefonia. Vozes personalizadas, porém, dependem de contato com a área comercial, de acordo com o material de lançamento.

Testes, clientes e limites dos números

Os resultados divulgados devem ser lidos como dados fornecidos pela OpenAI e por usuários iniciais, não como auditorias independentes. A Speak relatou quase 80% menos interrupções em comparação com sistemas anteriores baseados em turnos, um dado especialmente relevante para estudantes que precisam de mais tempo para formular respostas. A OpenAI também informou ganho de 30 pontos percentuais sobre o GPT-Realtime-2.1 no Full Duplex Bench.

“GPT-Live-1 leva as conversas naturais e full-duplex do ChatGPT para a API, com mais controle sobre como agentes de voz falam e agem.”

No benchmark Tau3, a companhia afirma que o modelo ficou em primeiro lugar quando combinado ao GPT-6 Astra em esforço médio de raciocínio. Entre os primeiros nomes citados estão Yelp Host, Speak, Fin, da Intercom, e Devin, da Cognition. Um cliente teria reduzido em 80% o código de voz de uma solução em cascata e eliminado 23 mil linhas usadas em conversas clínicas em tempo real. Os resultados podem variar conforme idioma, ruído, integração de ferramentas e desenho do fluxo.

AspectoGPT-Live-1Arquitetura em cascata
Fluxo de áudioEscuta e fala simultâneasEtapas sequenciais
InterrupçõesTratamento nativoDepende da orquestração
Custo de vozUS$ 0,05 por minutoVaria por componente

O que empresas devem avaliar antes da adoção

O lançamento não elimina a necessidade de projetar um agente com segurança. Empresas devem testar precisão da transcrição, reconhecimento de códigos e números, privacidade de gravações, consentimento do cliente, planos de contingência e escalonamento humano. Também é necessário somar o preço do GPT-Live-1 aos custos do modelo de raciocínio, da telefonia, das integrações e do monitoramento.

Para tarefas de alto impacto, como saúde e finanças, a automação deve operar com limites claros e ações aprovadas. A OpenAI cita o Presence como caminho para fluxos em tempo real que usam sistemas corporativos, executam operações permitidas e transferem a conversa a equipes humanas. O ponto central é que uma fala mais fluida não substitui governança, testes de qualidade e revisão de riscos.

  1. O que é o GPT-Live-1 da OpenAI?

    É um modelo de voz full-duplex para a API. Ele escuta e responde simultaneamente, buscando reduzir pausas e interrupções em agentes de voz. A lógica de raciocínio pode ser conectada separadamente.

  2. Quanto custa usar o GPT-Live-1?

    O preço anunciado é de US$ 0,05 por minuto de áudio. Esse valor não inclui o modelo de raciocínio, ferramentas, telefonia ou a infraestrutura usada pelo agente.

  3. Qual é a diferença para um sistema de voz em cascata?

    O sistema em cascata separa ASR, raciocínio e síntese de voz. O GPT-Live-1 processa a conversa de modo bidirecional, preservando melhor o timing e a troca de turnos.

  4. O GPT-Live-1 serve para atendimento ao cliente?

    Sim. A OpenAI aponta usos em telefonia, reservas, pedidos e suporte. A adoção responsável exige integração segura, regras de ação e escalonamento para atendentes humanos.

Considerações finais

O GPT-Live-1 posiciona a OpenAI API como uma camada de voz mais natural para agentes conversacionais. A combinação de full-duplex, detecção de turno, controle por prompt e integração com modelos de raciocínio pode simplificar projetos antes dependentes de várias peças. Para avaliar o ganho real, porém, empresas precisarão comparar latência, qualidade, custo total e segurança em seus próprios cenários. Fonte primária: anúncio da OpenAI;

PUBLICIDADE

Diogo Fernando

Apaixonado por tecnologia e cultura pop, programo para resolver problemas e transformar vidas. Empreendedor e geek, busco novas ideias e desafios. Acredito na tecnologia como superpoder do século XXI.