- Ferramentas de IA
- Inteligência artificial
GPT Live 1 API está aqui: preço, recursos e como funciona
GPT Live 1 traz conversas de voz full-duplex para o OpenAI API. Saiba como funciona, o que inclui US$ 0,05 por minuto e como ele se compara ao GPT-Realtime-2.1.

OpenAI trouxe conversação full-duplex no estilo ChatGPT para desenvolvedores. A mudança importante não é apenas uma nova voz – é uma nova divisão de trabalho entre a conversa e o trabalho que está por trás dela.
Os assistentes de voz melhoraram rapidamente, mas muitos ainda revelam suas máquinas. Eles esperam ansiosamente durante uma pausa, continuam falando depois que você interrompe ou ficam quietos enquanto uma ferramenta procura um pedido. OpenAI Lançamento GPT-Live 1 API é uma tentativa de tornar essa maquinaria menos visível.
Lançado em 10 de setembro de 2026, o GPT-Live 1 pode ouvir e falar ao mesmo tempo. Ele controla o ritmo da conversa em si, enquanto um modelo ou agente de back-end separado pode raciocinar, pesquisar, chamar ferramentas aprovadas e retornar um resultado. Essa arquitetura é a ideia central a ser entendida antes de comparar preços ou benchmarks.
Este guia cobre o que é GPT Live 1, o que é US$ 0,05 por minuto o preço inclui, como funciona a delegação e como ela difere da GPT-Realtime-2.1 e pipelines de fala tradicionais. Usamos “GPT Live 1” onde as pessoas provavelmente o pesquisarão; OpenAI estiliza o nome do produto GPT-Live 1, e o ID exato do modelo API é gpt-live-1.
Resposta rápida – verificada em 11 de setembro de 2026
GPT-Live 1 está disponível no OpenAI API agora. Os custos do front-end de voz full-duplex US$ 0,05 por minuto de sessão, cobrado por segundo. O uso do modelo de back-end, ferramentas, telefonia e infraestrutura de aplicativos são custos separados. Ele suporta entrada/saída de texto e áudio, streaming e uso de ferramenta delegada; imagem e vídeo não são suportados pelo frontend Live.
| Fato GPT Live 1 | Detalhe confirmado |
|---|---|
| Data de lançamento | 10 de setembro de 2026 |
| ID do modelo API | gpt-live-1 |
| Preço | US$ 0,05 por minuto de sessão de voz, cobrado por segundo |
| Custos extras | Modelo de back-end, ferramentas, telefonia, armazenamento e infraestrutura de aplicativos |
| Entradas → saídas | Texto e áudio → texto e áudio |
| Conexões | WebRTC, WebSockets, controle de servidor de banda lateral e caminhos de telefonia/SIP |
| Corte de conhecimento | 31 de julho de 2025 |
| Camada API gratuita | Não compatível |
O que é GPT Live 1?
GPT-Live 1 é um modelo de voz em tempo real desenvolvido para gerenciar a camada conversacional de um aplicativo. Ele recebe um fluxo de áudio contínuo, produz fala e raciocina ao mesmo tempo sobre o áudio de entrada e saída. Em linguagem simples, ele não precisa parar de ouvir simplesmente porque começou a falar.
Isso torna o modelo adequado para as partes complicadas do discurso real: reconhecimentos “mm-hm”, hesitações, risos, conversas de fundo, correções no meio de uma frase e interrupções que mudam o que o falante realmente deseja.
O GPT-Live 1 não se destina a transportar todos os fluxos de trabalho de negócios difíceis dentro do modelo de voz. Para um raciocínio mais aprofundado e uso da ferramenta, ele delega para um backend selecionado pelo desenvolvedor. OpenAI dá exemplos como o uso de um modelo menor como o Luna para agendamento de alto volume ou atualizações de pedidos e um modelo como o Astra para problemas complexos de clientes. Com a delegação de cliente, o back-end não precisa ser um modelo OpenAI.
Para obter os fatos exatos sobre API, links de acesso atuais e fontes de provedores, consulte o novo Página do modelo GPT-Live 1 na biblioteca de modelos do Cody.
Por que a voz full-duplex parece diferente
A maioria das pessoas não fala em blocos alternados. Paramos para pensar sem abrir mão da palavra. Dizemos “certo” enquanto outra pessoa está falando para mostrar que estamos seguindo. Iniciamos uma correção antes que a outra pessoa termine. Um sistema baseado em turnos precisa adivinhar se cada silêncio ou som significa “responda agora”, “continue ouvindo” ou “pare de falar”.
Duplex completo significa que o sistema pode ouvir enquanto fala. Isso não garante uma conversa natural por si só, mas dá ao modelo o contexto acústico necessário para reagir à sobreposição conforme ela acontece. Um breve reconhecimento pode ser tratado de forma diferente de uma interrupção genuína. Uma pausa pensativa pode permanecer uma pausa em vez de se tornar um convite para o assistente intervir.
É também por isso que um simples número de “tempo para o primeiro áudio” não pode descrever toda a experiência. Um agente de voz pode começar a falar rapidamente e ainda assim se sentir rude se interromper um usuário que está pensando. Ele pode ter boa qualidade de fala e ainda parecer lento se ficar silencioso sempre que uma ferramenta de back-end for executada. O tempo, a recuperação, o comportamento do ruído de fundo e a conclusão da tarefa são importantes.
Como funciona a delegação GPT Live 1
A delegação separa o front-end de voz do agente de back-end. GPT-Live 1 pode manter a conversa em andamento – reconhecendo a solicitação ou solicitando um acompanhamento útil – enquanto um trabalho mais profundo é executado em outro lugar. OpenAI documenta duas maneiras de conectar esse trabalho.
Delegação de respostas
Com Delegação de respostas, GPT-Live 1 prepara a solicitação de back-end, envia o contexto de conversa relevante para o modelo de respostas OpenAI escolhido para a sessão e traz o resultado de volta para a conversa falada. É o caminho mais gerenciado e o lugar mais fácil para começar quando um modelo de Respostas e suas ferramentas suportadas se adequam ao trabalho.
A escolha do backend é independente do modelo de voz. Uma equipe pode encaminhar o trabalho rotineiro para um modelo mais rápido ou menos dispendioso e reservar raciocínios mais pesados para casos que o justifiquem. Isso também significa que a qualidade e o custo total de um agente GPT-Live 1 dependem parcialmente da configuração de back-end – não apenas do front-end de voz.
Delegação de cliente
Com delegação de clientes, o aplicativo recebe um evento de delegação, monta a transcrição e o contexto de negócios apropriados, chama qualquer modelo, agente, serviço ou fluxo de trabalho personalizado e, em seguida, decide qual resultado enviar de volta. Esta rota adiciona trabalho de engenharia, mas oferece muito mais controle.
A delegação do cliente é mais adequada quando os resultados devem ser validados ou editados antes de serem falados, vários back-ends precisam de roteamento personalizado, sistemas privados devem permanecer dentro de um equipamento de agente existente ou uma equipe precisa de seus próprios orçamentos, pontos de verificação e lógica de fallback.
Em ambos os modos, o aplicativo — e não o GPT-Live 1 — permanece responsável pelas permissões, confirmações, registros comerciais e estado durável da tarefa. A delegação é um mecanismo de comunicação, não um sistema de autorização.
Recursos GPT Live 1 que importam
- Ouvir e falar simultaneamente: o modelo raciocina sobre o áudio de entrada e saída juntos, em vez de tratar cada um como um turno isolado.
- Tratamento de interrupções naturais: ele pode responder de maneira diferente a um backchannel, a uma correção ou a uma tentativa genuína de tomar a palavra.
- Raciocínio e ferramentas delegados: um trabalho mais profundo pode ser executado por meio de um modelo de Respostas selecionado ou de um back-end operado por aplicativo.
- Comportamento de voz solicitado: os desenvolvedores podem moldar o tom, o ritmo, o estilo, os backchannels, o comportamento de interrupção e quando o modelo deve delegar.
- Transcrições nativas: As transcrições ASR e o texto da resposta estão disponíveis junto com o fluxo de áudio.
- Suporte alfanumérico e de palavras-chave: OpenAI destaca um manuseio mais forte de nomes, códigos e outras strings exatas, além de polarização de palavras-chave.
- Tratamento de silêncio e ruído de fundo: o modelo foi projetado para evitar tratar cada som ou pausa como um comando para responder.
- Confiabilidade de sessão longa: OpenAI afirma que melhorou a retenção de contexto e a qualidade da conversa em interações mais longas.
- Conexões de navegador, servidor e telefone: os caminhos documentados incluem WebRTC, WebSockets, controle de banda lateral e telefonia/SIP.
A página do modelo também lista streaming e chamadas de função como suportadas. Saídas estruturadas, ajuste fino e saídas previstas não são suportadas para GPT-Live 1.
Preços GPT Live 1
A taxa de manchete é simples: US$ 0,05 por minuto para a sessão de voz front-end. OpenAI fatura por segundo, portanto, uma sessão de 61 segundos não é arredondada para dois minutos completos.
Quanto custa uma sessão de voz
| Uso de voz | Custo de front-end GPT-Live 1 |
|---|---|
| 10 minutos | $0.50 |
| 30 minutos | $1.50 |
| 100 horas (6.000 minutos) | $300 |
| 1.000 horas (60.000 minutos) | $3,000 |
Esses exemplos são simples multiplicação de preços de tabela. Eles são úteis para estimar a camada de conversação, mas são não o custo total de operação de um agente de voz.
Os custos não incluídos em US$ 0,05 por minuto
- O modelo de back-end que executa o raciocínio ou gera resultados delegados.
- Ferramentas pagas, como pesquisa na web ou outros serviços de provedores.
- Taxas de operadora de telefonia, número de telefone, SIP ou plataforma de parceiro.
- Seus servidores, armazenamento, monitoramento, observabilidade e infraestrutura de áudio.
- Escalonamento humano, revisão de qualidade e operações de suporte.
Uma previsão realista é, portanto: minutos de sessão de voz + uso de back-end + ferramentas + telefone/transporte + custos de aplicativos. Capture essas peças separadamente durante um piloto. O custo por tarefa concluída costuma ser mais útil do que o custo por minuto porque uma chamada mais natural pode ser resolvida mais rapidamente ou pode encorajar uma conversa mais longa.
A página do modelo OpenAI mede os limites de taxa em sessões simultâneas. Atualmente, lista 25 sessões para o Nível 1, 50 para o Nível 2, 200 para o Nível 3, 300 para o Nível 4 e 500 para o Nível 5. As equipes de produção devem confirmar os limites atuais e solicitar capacidade antes de um grande lançamento.
GPT Live 1 vs GPT-Realtime-2.1
Ambos são modelos de voz OpenAI, mas resolvem a arquitetura de maneira diferente. GPT-Realtime-2.1 é um modelo de raciocínio de fala para fala que pode receber contexto de texto, imagem e áudio e chamar funções dentro de uma sessão em tempo real. GPT-Live 1 é um front-end de conversação full-duplex dedicado que delega raciocínios e ações mais profundos a um back-end separado.
| Pergunta | GPT-Live 1 | GPT-Realtime-2.1 |
|---|---|---|
| Projeto central | Front-end de voz full-duplex mais back-end delegado | Modelo de fala para fala em tempo real com raciocínio e chamada de função na sessão |
| Faturamento publicado | US$ 0,05 por minuto de sessão, mais uso de back-end | Baseado em token: as taxas de áudio, texto e imagem variam de acordo com a classe de entrada/saída |
| Comportamento de voz | Projetado para ouvir e falar simultaneamente | Diálogo em tempo real com detecção de curva e tratamento de interrupções |
| Entrada de front-end | Texto e áudio | Texto, imagem e áudio |
| Flexibilidade de back-end | Modelo de respostas ou qualquer modelo, agente ou serviço operado pelo cliente | Um modelo em tempo real configurado e suas ferramentas disponíveis |
| Melhor motivo para testar | Sobreposição mais natural e roteamento de back-end independente | Uma sessão multimodal unificada em tempo real com uso baseado em token |
As linhas de preços não podem ser convertidas num veredicto universal justo de “modelo mais barato”. GPT-Live 1 cobra pelo tempo decorrido da sessão e adiciona uma fatura de back-end. GPT-Realtime-2.1 cobra tokens em diversas classes de mídia. Silêncio, proporção de fala, duração da resposta, uso de imagem, ferramentas, cache e escolha de back-end, todos alteram o resultado.
Use a biblioteca de modelos do Cody para inspecionar a corrente Comparação GPT-Live 1 vs GPT-Realtime-2.1 ou compare GPT-Live 1 com os outros modelos do categoria de voz e tempo real.
GPT Live 1 versus um pipeline STT-LLM-TTS tradicional
Um agente de voz tradicional geralmente conecta três sistemas: fala para texto, um modelo de linguagem e texto para fala. Essa modularidade é valiosa. As equipes podem escolher o melhor modelo de transcrição para um idioma, validar uma resposta de texto completa antes do início da fala e substituir um componente sem substituir tudo.
A compensação é a orquestração. Cada transferência cria outra fila, outra conversão de formato e outro local onde o tempo ou o contexto podem ser perdidos. A aplicação deve decidir quando uma expressão termina, o que fazer se o chamador interromper a fala sintetizada e como a transcrição deve mudar após uma autocorreção.
O GPT-Live 1 reúne os estágios de audição e fala em uma camada de voz contínua, preservando um back-end separado para um trabalho mais profundo. Isso pode simplificar a troca de turnos e reduzir a sensação de “walkie-talkie”, mas não elimina a necessidade de uma camada de aplicação. O aplicativo ainda precisa gerenciar ações, privacidade, recuperação de falhas, telefonia e a fonte da verdade para a tarefa.
Escolha com base no requisito mais difícil. Se a validação completa pré-discurso e o controle em nível de componente forem obrigatórios, um pipeline em cascata poderá permanecer atraente. Se o fluxo da conversa, a sobreposição e o envolvimento contínuo enquanto uma tarefa é executada são fundamentais, GPT-Live 1 é uma arquitetura atraente para testar.
O que os benchmarks do OpenAI fazem e não provam
OpenAI relata que GPT-Live 1 melhorou seu resultado Full Duplex Bench em 30 pontos percentuais acima de GPT-Realtime-2.1, com ganhos em latência de troca de turnos e comportamento interativo. Emparelhado com GPT-6 Astra com esforço de raciocínio médio, OpenAI também relata um resultado Tau3 número um para tarefas de agente de voz ponta a ponta.
Numa avaliação inicial de clientes, a empresa de aprendizagem de línguas Speak relatou quase 80% menos interrupções durante as pausas para reflexão dos alunos do que os seus sistemas anteriores baseados em turnos. OpenAI também publicou contas de clientes favoráveis do Yelp, Fin, Cognition e outros.
Esses resultados são sinais úteis, mas permanecem avaliações publicadas pelo fornecedor e relatórios de clientes. O resultado Astra mede um sistema combinado, não apenas GPT-Live 1. Nenhum dos números garante desempenho em sua operadora de telefonia, sotaques, ruído, latência de ferramenta, prompt ou fluxo de trabalho comercial. Não os reproduzimos como benchmark Cody.
Uma avaliação sólida deve pontuar pelo menos: tarefas concluídas, interrupções inadequadas, recuperação após correções, tempo de final de turno, precisão da ferramenta, percentis de latência, qualidade do escalonamento, custo por tarefa concluída e preferência humana em chamadas de representantes.
Vozes GPT Live 1 e suporte a idiomas
O lançamento do OpenAI lista doze vozes: Quartzo, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta e Cinder. A empresa afirma que a seleção expande a cobertura entre sotaques, dialetos e idiomas e planeja adicionar mais ao longo do tempo.
OpenAI não publica uma lista exata de idiomas na página do modelo GPT-Live 1. A “disponibilidade mais ampla de idiomas” não deve, portanto, ser interpretada como uma garantia para cada localidade, sotaque ou padrão de troca de código. Teste alto-falantes reais, condições de fundo, nomes, endereços, frases de confirmação e os idiomas que seu produto promete oferecer suporte.
O acesso de voz personalizado não é um padrão de autoatendimento. OpenAI orienta as organizações interessadas a entrar em contato com o departamento de vendas para saber a elegibilidade e o processo de solicitação.
Como conectar GPT Live 1
OpenAI documenta vários padrões de conexão. O caminho certo depende de onde o áudio se origina e de qual sistema precisa de controle da sessão.
WebRTC para aplicativos de voz do navegador
WebRTC é o ponto de partida recomendado para aplicativos de voz baseados em navegador. As trilhas de mídia transportam o áudio do microfone e do alto-falante, enquanto um canal de dados transporta os eventos da sessão. Um servidor confiável deve criar a sessão e manter a chave OpenAI API fora do navegador.
WebSockets para áudio do lado do servidor
WebSockets se adaptam a integrações do lado do servidor onde o aplicativo possui o fluxo de áudio. O soquete principal transporta eventos de áudio e controle. Se o navegador possuir a conexão WebRTC, mas o servidor ainda precisar de transcrições, monitoramento ou instruções corretivas, uma banda lateral WebSocket poderá anexar controles do servidor sem afastar o áudio de WebRTC.
Telefonia e SIP para agentes telefônicos
OpenAI documenta caminhos de integração de telefonia e SIP e fornece orientação de parceiros para sistemas como LiveKit, Twilio, Telnyx, Daily e Pipecat. As taxas da operadora e dos parceiros permanecem separadas da cobrança da sessão GPT-Live 1.
Um plano de configuração prático do GPT Live 1
- Escolha uma chamada restrita. Comece com um fluxo de trabalho limitado, como verificar um pedido, qualificar um lead ou encontrar um compromisso, e não um agente multifuncional.
- Escolha a conexão. Use WebRTC para um protótipo de navegador, WebSockets quando um servidor possui o áudio ou uma rota de telefonia documentada para chamadas telefônicas.
- Mantenha o prompt ao vivo curto. Coloque tom, ritmo, estilo de interrupção, backchannels e política de delegação no prompt de voz. Mantenha fluxos de trabalho de negócios detalhados e regras de ferramentas no back-end.
- Selecione delegação. Comece com a delegação de respostas para um back-end OpenAI gerenciado. Use a delegação de cliente quando precisar de contexto personalizado, validação, roteamento ou um serviço não OpenAI.
- Aplique regras de ação no código. Verifique identidade, autorização, confirmações, orçamentos e alterações de estado permitidas antes da execução de uma ferramenta.
- Preservar transcrições e estado da tarefa. Deltas de transcrição podem estar incompletos ou errados. Armazene histórico suficiente para entender “sim”, “sexta-feira” e correções que se referem a detalhes anteriores.
- Teste áudio bagunçado. Inclua pensadores lentos, interrupções, conversas paralelas, ruído, ortografia, números de contas, silêncio, desconexões e encaminhamento para um humano.
- Meça o sistema completo. Acompanhe a qualidade da conversa e o sucesso das tarefas de back-end, além de todos os custos que estão fora da taxa de minutos de voz.
Migrando do tempo real ou de uma pilha de voz em cascata
A migração não é simplesmente alterar o ID do modelo. A mudança mais importante é dividir responsabilidades intencionalmente.
- Mova o estilo conversacional para o prompt ao vivo. Defina como a voz deve falar, esperar, reconhecer, interromper e delegar.
- Mantenha fluxos de trabalho detalhados no back-end. Regras de negócios, esquemas de ferramentas, validação, permissões e saídas longas pertencem ao agente que faz o trabalho.
- Adapte-se a eventos de áudio contínuos. GPT-Live 1 transmite áudio continuamente e possui diferentes eventos de sessão do Realtime API; não assuma o mesmo fluxo manual de confirmação e acionamento.
- Traduza chamadas de função em delegação. O front-end Live pede ajuda ao back-end, em vez de emitir argumentos comuns de ferramentas estruturadas da mesma forma que um agente de texto ou em tempo real.
- Mantenha as salvaguardas existentes. Retenha monitoramento, bloqueios de ação, confirmações, registros de auditoria, cancelamento e escalonamento. Adapte-os para um modelo que possa continuar falando enquanto as verificações são executadas.
Execute a arquitetura antiga e a nova nos mesmos cenários registrados onde a política permitir. Compare os resultados da chamada completa, não uma demonstração refinada. Nosso separado guia para latência do agente de voz explica por que transporte, transcrição, raciocínio, ferramentas e reprodução devem ser medidos juntos.
Advertências de produção que vale a pena entender
Seu aplicativo ainda possui as decisões arriscadas
GPT-Live 1 pode fazer uma conversa parecer confiante; que não prove que uma ação externa foi autorizada ou concluída. Verifique as permissões e as confirmações necessárias antes de alterar um compromisso, cobrar um cartão, expor um registro de conta ou anunciar sucesso. Persista o estado da tarefa da fonte da verdade fora da sessão de voz.
Uma interrupção não é um cancelamento
Se um chamador disser “Na verdade, sexta-feira” enquanto uma pesquisa de quinta-feira estiver em execução, interromper a fala não cancelará essa pesquisa. O aplicativo deve revisar a tarefa ativa, invalidar confirmações desatualizadas, cancelar o trabalho sempre que possível e evitar que um resultado de quinta-feira seja considerado atual.
A fala contínua muda o design do guarda-corpo
Um agente de texto pode terminar e validar uma resposta inteira antes de mostrá-la. GPT-Live 1 pode falar enquanto o trabalho de back-end ou as verificações de política continuam. Reter o resultado de uma ferramenta não garante que o frontend de voz permaneça silencioso. Monitore transcrições e ações, bloqueie ferramentas inseguras no código do aplicativo e controle a reprodução onde a aprovação pré-discurso for necessária.
Algumas decisões ainda precisam do áudio original
Um backend delegado não recebe automaticamente a forma de onda bruta. Se um fluxo de trabalho depender de evidências acústicas (um bipe do correio de voz, cadência do alto-falante, uma segunda pessoa entrando ou outro sinal que não seja de texto), encaminhe o áudio original para um detector ou revisor apropriado. Não presuma que uma transcrição contém todos os sinais que o frontend ouviu.
Quem deve testar o GPT Live 1?
GPT-Live 1 é mais interessante para produtos onde o tempo de conversação faz parte do trabalho: suporte ao cliente, agendamento de compromissos, reservas em restaurantes, aulas de idiomas, qualificação de vendas, acessibilidade, trabalho com viva-voz e interfaces de voz colaborativas.
É menos obviamente necessário para narração unidirecional, transcrição de arquivo, conversão simples de texto em fala ou fluxos de trabalho que devem validar cada frase completa antes que qualquer áudio possa ser reproduzido. Serviços de fala especializados ou uma pilha em cascata podem oferecer um controle mais direto para esses casos.
A decisão prática não é “GPT-Live 1 é o melhor modelo de voz?” É: A conversação full-duplex mais um back-end escolhido separadamente melhoram o sucesso da tarefa o suficiente para justificar a arquitetura e o custo total? Um piloto representativo pode responder a isso; um título de referência não pode.
Perguntas frequentes
O que é GPT Live 1?
GPT-Live 1 é o modelo de voz full-duplex do OpenAI para conversas em tempo real. Ele ouve e fala ao mesmo tempo e, em seguida, delega o raciocínio mais profundo e o trabalho com ferramentas a um agente de back-end separado.
Quanto custa GPT Live 1?
A sessão de voz front-end custa US$ 0,05 por minuto e é cobrada por segundo. O uso do modelo de back-end, ferramentas, telefonia, armazenamento e infraestrutura de aplicativos têm um custo extra.
O GPT Live 1 está disponível agora?
Sim. OpenAI lançou GPT-Live 1 no API em 10 de setembro de 2026. Seu ID exato do modelo API é gpt-live-1. A página do modelo OpenAI diz que o nível API gratuito não é compatível.
O que é IA de voz full-duplex?
Full duplex significa que o sistema de voz pode ouvir enquanto fala. Isso torna a sobreposição de discursos, reconhecimentos, interrupções e pausas naturais mais fáceis de lidar do que uma troca rígida de um orador por vez.
Qual é a diferença entre GPT Live 1 e GPT-Realtime-2.1?
GPT-Live 1 é um front-end de voz full-duplex com cobrança por minuto que delega um trabalho mais profundo a um modelo de back-end. GPT-Realtime-2.1 é um modelo de fala para fala com cobrança de token que lida com áudio, raciocínio e chamadas de função em sua sessão em tempo real.
O GPT Live 1 pode chamar ferramentas?
Sim, através de delegação. A delegação de respostas usa um modelo de respostas OpenAI selecionado. A delegação de cliente permite que o aplicativo chame outro modelo, agente, serviço ou fluxo de trabalho personalizado e decida qual resultado verificado retornará.
A interrupção do GPT Live 1 cancela uma tarefa de back-end?
Não. Interromper a fala não cancela automaticamente o trabalho de back-end. O aplicativo deve decidir se deseja cancelar, revisar ou descartar um resultado desatualizado.
GPT Live 1 oferece suporte a WebRTC, WebSockets e chamadas telefônicas?
Sim. OpenAI documenta WebRTC para aplicativos de voz do navegador, WebSockets para áudio do lado do servidor, controles de servidor de banda lateral e caminhos de integração de telefonia ou SIP.
Quais vozes estão disponíveis para GPT Live 1?
O lançamento do OpenAI lista Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta e Cinder. O acesso de voz personalizado requer um processo de elegibilidade e vendas.
Fontes e metodologia
Este artigo foi verificado em relação ao material OpenAI original em 11 de setembro de 2026. Os resultados de referência e do cliente são rotulados como relatados por OpenAI em vez de apresentados como medições Cody independentes.
- OpenAI: anúncio de lançamento de GPT-Live 1 API
- OpenAI: página do modelo GPT-Live 1, preço, recursos e limites de taxa
- OpenAI: primeiros passos com GPT-Live
- OpenAI: guia de solicitação GPT-Live
- OpenAI: delegação e ferramentas GPT-Live
- OpenAI: orientação de migração para GPT-Live
- OpenAI: preços API
O resultado final
GPT-Live 1 é mais do que uma nova voz sintética. Muda a forma de um agente de voz: um modelo full-duplex gerencia o ritmo humano da conversa, enquanto um back-end escolhido separadamente cuida do trabalho mais pesado.
O preço de US$ 0,05 por minuto torna o front-end fácil de estimar, mas o back-end, as ferramentas, a rede telefônica e o aplicativo ainda determinam a conta total e grande parte da qualidade da tarefa. A próxima etapa mais útil é um piloto restrito com interrupções, correções, ruídos e permissões realistas - não uma demonstração com script limpo.
Explorar o Guia do modelo GPT-Live 1, compare-o diretamente com GPT-Realtime-2.1ou navegue na íntegra diretório de modelo de IA de voz.


