• herramientas de inteligencia artificial
  • Inteligencia artificial

GPT Live 1 API está aquí: precios, características y cómo funciona

GPT Live 1 trae conversaciones de voz full-duplex al OpenAI API. Descubra cómo funciona, qué incluye $0,05 por minuto y cómo se compara con GPT-Realtime-2.1.

Por Om Kamathtiempo de lectura: 20 minutos
Dos personas manteniendo una conversación de voz simultánea a través de GPT Live 1 mientras una herramienta de backend funciona en segundo plano.

OpenAI ha traído la conversación full-duplex estilo ChatGPT a los desarrolladores. El cambio importante no es sólo una nueva voz: es una nueva división del trabajo entre la conversación y el trabajo que se realiza detrás de ella.

Los asistentes de voz han mejorado rápidamente, pero muchos todavía revelan su maquinaria. Esperan con demasiada impaciencia durante una pausa, siguen hablando después de que usted interrumpe o se quedan en silencio mientras una herramienta busca una orden. OpenAI Lanzamiento de GPT-Live 1 API es un intento de hacer que esa maquinaria sea menos visible.

Lanzado el 10 de septiembre de 2026, GPT-Live 1 puede escuchar y hablar al mismo tiempo. Maneja el ritmo de la conversación en sí, mientras que un modelo o agente de backend independiente puede razonar, buscar, llamar a herramientas aprobadas y devolver un resultado. Esa arquitectura es la idea central a comprender antes de comparar precios o puntos de referencia.

Esta guía cubre qué es GPT Live 1, cuáles son $0.05 por minuto el precio incluye, cómo funciona la delegación y en qué se diferencia de GPT-Realtime-2.1 y canales de voz tradicionales. Usamos “GPT Live 1” donde es probable que la gente lo busque; OpenAI diseña el nombre del producto GPT-Live 1, y el ID exacto del modelo API es gpt-live-1.

Respuesta rápida: consultado el 11 de septiembre de 2026

GPT-Live 1 ya está disponible en OpenAI API. Los costos de la interfaz de voz full-duplex $0.05 por minuto de sesión, facturado por segundo. El uso del modelo backend, las herramientas, la telefonía y la infraestructura de su aplicación son costos separados. Admite entrada/salida de texto y audio, transmisión y uso de herramientas delegadas; Las imágenes y los vídeos no son compatibles con la interfaz Live.

GPT Live 1 hechoDetalle confirmado
fecha de lanzamiento10 de septiembre de 2026
ID del modelo APIgpt-live-1
Precio$0.05 por minuto de sesión de voz, facturado por segundo
Cargos extraModelo backend, herramientas, telefonía, almacenamiento e infraestructura de aplicaciones.
Entradas → salidasTexto y audio → texto y audio
ConexionesWebRTC, WebSockets, control de servidor de banda lateral y rutas de telefonía/SIP
límite de conocimiento31 de julio de 2025
Nivel API gratuitoNo compatible

¿Qué es GPT Live 1?

GPT-Live 1 es un modelo de voz en tiempo real creado para gestionar la capa conversacional de una aplicación. Recibe un flujo de audio continuo, produce voz y razona el audio entrante y saliente juntos. En términos sencillos, no tiene por qué dejar de escuchar simplemente porque ha empezado a hablar.

Eso hace que el modelo sea muy adecuado para las partes confusas del discurso real: reconocimientos tipo “mm-hm”, vacilaciones, risas, conversaciones de fondo, correcciones a mitad de una oración e interrupciones que cambian lo que el hablante realmente quiere.

GPT-Live 1 no está diseñado para llevar todos los flujos de trabajo comerciales difíciles dentro del modelo de voz. Para un razonamiento más profundo y un uso de herramientas, delega a un backend seleccionado por el desarrollador. OpenAI ofrece ejemplos como el uso de un modelo más pequeño como Luna para programación de gran volumen o actualizaciones de pedidos y un modelo como Astra para problemas complejos de los clientes. Con la delegación del cliente, no es necesario que el backend sea un modelo OpenAI.

Para conocer los datos exactos de API, los enlaces de acceso actuales y las fuentes de proveedores, consulte el nuevo Página del modelo GPT-Live 1 en la biblioteca de modelos de Cody.

Por qué la voz full-duplex se siente diferente

La mayoría de la gente no habla en bloques ordenados y alternos. Nos detenemos a pensar sin ceder la palabra. Decimos "bien" mientras alguien más habla para demostrar que lo estamos siguiendo. Comenzamos una corrección antes de que la otra persona termine. Un sistema por turnos tiene que adivinar si cada silencio o sonido significa "responder ahora", "seguir escuchando" o "dejar de hablar".

Dúplex completo significa que el sistema puede escuchar mientras habla. Eso por sí solo no garantiza una conversación natural, pero le da al modelo el contexto acústico necesario para reaccionar ante la superposición a medida que ocurre. Un breve reconocimiento puede tratarse de manera diferente a una interrupción genuina. Una pausa reflexiva puede seguir siendo una pausa en lugar de convertirse en una invitación para que el asistente intervenga.

Esta es también la razón por la que un simple número de “tiempo hasta el primer audio” no puede describir toda la experiencia. Un agente de voz puede empezar a hablar rápidamente y aun así sentirse grosero si interrumpe a un usuario que está pensando. Puede tener buena calidad de voz y aun así sentirse lento si se vuelve silencioso cada vez que se ejecuta una herramienta de backend. El tiempo de giro, la recuperación, el comportamiento del ruido de fondo y la finalización de la tarea son todos juntos.

Diagrama que muestra a una persona que llama en audio bidireccional continuo con GPT Live 1, que delega un trabajo más profundo a un modelo de backend y sistemas comerciales aprobados.
GPT-Live 1 gestiona la conversación en vivo mientras un backend elegido maneja un razonamiento más profundo y las acciones aprobadas. Su aplicación todavía posee permisos y estado de tarea.

Cómo funciona la delegación GPT Live 1

La delegación separa la interfaz de voz del agente de backend. GPT-Live 1 puede mantener la conversación en movimiento (reconociendo la solicitud o solicitando un seguimiento útil) mientras se realiza un trabajo más profundo en otra parte. OpenAI documenta dos formas de conectar ese trabajo.

Delegación de respuestas

con Delegación de respuestas, GPT-Live 1 prepara la solicitud de backend, envía el contexto de conversación relevante al modelo de respuestas OpenAI elegido para la sesión y devuelve el resultado a la conversación hablada. Es la ruta más administrada y el lugar más fácil para comenzar cuando un modelo de Responses y sus herramientas compatibles se adaptan al trabajo.

La elección del backend es independiente del modelo de voz. Un equipo puede encaminar el trabajo rutinario a un modelo más rápido o menos costoso y reservar razonamientos más sólidos para los casos que lo justifiquen. Esto también significa que la calidad y el costo total de un agente GPT-Live 1 dependen en parte de la configuración del backend, no solo del frontend de voz.

Delegación de clientes

con delegación de clientes, la aplicación recibe un evento de delegación, reúne la transcripción y el contexto empresarial adecuados, llama a cualquier modelo, agente, servicio o flujo de trabajo personalizado y luego decide qué resultado devolver. Esta ruta añade trabajo de ingeniería pero proporciona mucho más control.

La delegación de clientes es la mejor opción cuando los resultados deben validarse o redactarse antes de expresarse, varios backends necesitan enrutamiento personalizado, los sistemas privados deben permanecer dentro de un arnés de agente existente o un equipo necesita sus propios presupuestos, puntos de control y lógica alternativa.

En ambos modos, la aplicación (no GPT-Live 1) sigue siendo responsable de los permisos, las confirmaciones, los registros comerciales y el estado duradero de las tareas. La delegación es un mecanismo de comunicación, no un sistema de autorización.

GPT Live 1 características que importan

  • Escuchar y hablar simultáneamente: el modelo analiza el audio entrante y saliente juntos en lugar de tratar cada uno como un giro aislado.
  • Manejo de interrupciones naturales: puede responder de manera diferente a un canal secundario, una corrección o un intento genuino de tomar la palabra.
  • Razonamiento y herramientas delegados: Se puede realizar un trabajo más profundo a través de un modelo de Respuestas seleccionado o un backend operado por una aplicación.
  • Comportamiento de voz solicitado: los desarrolladores pueden dar forma al tono, el ritmo, el estilo, los canales secundarios, el comportamiento de interrupción y cuándo debe delegar el modelo.
  • Transcripciones nativas: Las transcripciones ASR y el texto de respuesta están disponibles junto con la transmisión de audio.
  • Soporte alfanumérico y de palabras clave: OpenAI destaca un manejo más sólido de nombres, códigos y otras cadenas exactas, además de la parcialidad de palabras clave.
  • Manejo del silencio y el ruido de fondo: el modelo está diseñado para evitar tratar cada sonido o pausa como una orden para responder.
  • Fiabilidad de larga duración: OpenAI dice que mejoró la retención del contexto y la calidad de la conversación en interacciones más largas.
  • Conexiones de navegador, servidor y teléfono: las rutas documentadas incluyen WebRTC, WebSockets, control de banda lateral y telefonía/SIP.

La página del modelo también enumera la transmisión y las llamadas a funciones como compatibles. Las salidas estructuradas, el ajuste fino y las salidas previstas no son compatibles con GPT-Live 1.

Precios de GPT Live 1

La tasa principal es simple: $0.05 por minuto para la sesión de voz frontal. OpenAI se factura por segundo, por lo que una sesión de 61 segundos no se redondea a dos minutos completos.

Lo que cuesta una sesión de voz

Uso de vozGPT-Live 1 costo de interfaz
10 minutos$0.50
30 minutos$1.50
100 horas (6.000 minutos)$300
1.000 horas (60.000 minutos)$3,000

Estos ejemplos son una simple multiplicación de precios de lista. Son útiles para estimar la capa de conversación, pero son no es el costo total de operar un agente de voz.

Los costos no incluidos en $0.05 por minuto

  • El modelo de backend que realiza razonamientos o genera resultados delegados.
  • Herramientas pagas como búsqueda web u otros servicios de proveedores.
  • Cargos de operador de telefonía, número de teléfono, SIP o plataforma asociada.
  • Sus servidores, almacenamiento, monitoreo, observabilidad e infraestructura de audio.
  • Escalamiento humano, revisión de calidad y operaciones de soporte.

Por tanto, una previsión realista es: minutos de sesión de voz + uso de backend + herramientas + teléfono/transporte + costos de aplicaciones. Captura esas piezas por separado durante un piloto. El costo por tarea completada suele ser más útil que el costo por minuto porque una llamada más natural puede resolverse más rápido o puede fomentar una conversación más larga.

La página del modelo OpenAI mide los límites de velocidad en sesiones simultáneas. Actualmente enumera 25 sesiones para el Nivel 1, 50 para el Nivel 2, 200 para el Nivel 3, 300 para el Nivel 4 y 500 para el Nivel 5. Los equipos de producción deben confirmar los límites actuales y solicitar capacidad antes de un lanzamiento importante.

GPT Live 1 y GPT-Realtime-2.1

Ambos son modelos de voz OpenAI, pero resuelven la arquitectura de forma diferente. GPT-Realtime-2.1 es un modelo de razonamiento de voz a voz que puede recibir contexto de texto, imagen y audio y llamar a funciones dentro de una sesión en tiempo real. GPT-Live 1 es una interfaz de conversación full-duplex dedicada que delega razonamientos y acciones más profundos a un backend independiente.

PreguntaGPT-Live 1GPT-Realtime-2.1
Diseño centralFrontend de voz full-duplex más backend delegadoModelo de voz a voz en tiempo real con razonamiento y llamada de funciones en la sesión.
Facturación publicada$0.05 por minuto de sesión, más uso de backendBasado en tokens: las tarifas de audio, texto e imágenes varían según la clase de entrada/salida
Comportamiento de la vozDiseñado para escuchar y hablar simultáneamenteDiálogo en tiempo real con detección de giros y manejo de interrupciones.
Entrada frontalTexto y audioTexto, imagen y audio.
Flexibilidad de backendModelo de respuestas o cualquier modelo, agente o servicio operado por el cliente.Un modelo configurado en tiempo real y sus herramientas disponibles.
La mejor razón para probarSuperposición más natural y enrutamiento backend independienteUna sesión multimodal unificada en tiempo real con uso basado en tokens

Las disputas sobre los precios no pueden convertirse en un veredicto justo y universal sobre el “modelo más barato”. GPT-Live 1 cobra por el tiempo de sesión transcurrido y agrega una factura de backend. GPT-Realtime-2.1 carga tokens en varias clases de medios. El silencio, la proporción de habla, la duración de la respuesta, el uso de imágenes, las herramientas, el almacenamiento en caché y la elección del backend cambian el resultado.

Utilice la biblioteca de modelos de Cody para inspeccionar el actual Comparación de GPT-Live 1 y GPT-Realtime-2.1 o comparar GPT-Live 1 con los otros modelos en el categoría de voz y tiempo real.

GPT Live 1 frente a una tubería STT-LLM-TTS tradicional

Un agente de voz tradicional suele conectar tres sistemas: voz a texto, un modelo de lenguaje y texto a voz. Esa modularidad es valiosa. Los equipos pueden elegir el mejor modelo de transcripción para un idioma, validar una respuesta de texto completa antes de que comience el discurso y reemplazar un componente sin reemplazar todo.

La compensación es la orquestación. Cada traspaso crea otra cola, otra conversión de formato y otro lugar donde se puede perder el tiempo o el contexto. La aplicación debe decidir cuándo termina una expresión, qué hacer si la persona que llama interrumpe el discurso sintetizado y cómo debe cambiar la transcripción después de una autocorrección.

GPT-Live 1 colapsa las etapas de escucha y conversación en una capa de voz continua y al mismo tiempo conserva un backend separado para un trabajo más profundo. Esto puede simplificar los turnos y reducir la sensación de “walkie-talkie”, pero no elimina la necesidad de una capa de aplicación. La aplicación aún tiene que gestionar las acciones, la privacidad, la recuperación ante fallos, la telefonía y la fuente de verdad para la tarea.

Elija según el requisito más difícil. Si son obligatorios una validación completa previa al discurso y un control a nivel de componentes, un canal en cascada puede seguir siendo atractivo. Si la conversación fluye, se superpone y continúa interactuando mientras se ejecuta una tarea es fundamental, GPT-Live 1 es una arquitectura convincente para probar.

Lo que prueban y no prueban los puntos de referencia de OpenAI

OpenAI informa que GPT-Live 1 mejoró su resultado Full Duplex Bench en 30 puntos porcentuales sobre GPT-Realtime-2.1, con mejoras en la latencia de turnos y el comportamiento interactivo. Junto con GPT-6 Astra con un esfuerzo de razonamiento medio, OpenAI también informa un resultado Tau3 número uno para tareas de agente de voz de un extremo a otro.

En una evaluación inicial de un cliente, la empresa de aprendizaje de idiomas Speak informó casi un 80 % menos de interrupciones durante las pausas de pensamiento del alumno que sus sistemas anteriores por turnos. OpenAI también publicó cuentas de clientes favorables de Yelp, Fin, Cognition y otros.

Esos resultados son señales útiles, pero siguen siendo evaluaciones publicadas por el proveedor e informes de clientes. El resultado Astra mide un sistema combinado, no GPT-Live 1 solo. Ninguno de los números garantiza el rendimiento de su operador telefónico, acentos, ruido, latencia de herramientas, avisos o flujo de trabajo comercial. No los hemos reproducido como punto de referencia Cody.

Una evaluación sólida debe obtener al menos: tareas completadas, interrupciones inapropiadas, recuperación después de las correcciones, sincronización de fin de turno, precisión de la herramienta, percentiles de latencia, calidad de escalamiento, costo por tarea completada y preferencia humana en las llamadas de los representantes.

GPT Live 1 soporte de voces e idiomas

El lanzamiento de OpenAI enumera doce voces: Cuarzo, Ondulación, Víspera, Sauce, Piedra, Brillo, Meridiano, Bossa, Tempo, Baliza, Delta y Ceniza. La compañía dice que la selección amplía la cobertura a través de acentos, dialectos e idiomas y planea agregar más con el tiempo.

OpenAI no publica una lista de idiomas exacta en la página del modelo GPT-Live 1. Por lo tanto, la “disponibilidad más amplia del idioma” no debe interpretarse como una garantía para cada idioma, acento o patrón de cambio de código. Pruebe hablantes reales, condiciones de fondo, nombres, direcciones, frases de confirmación y los idiomas que su producto promete admitir.

El acceso de voz personalizado no es un valor predeterminado de autoservicio. OpenAI indica a las organizaciones interesadas que se comuniquen con ventas para conocer la elegibilidad y el proceso de solicitud.

Cómo conectar GPT Live 1

OpenAI documenta varios patrones de conexión. El correcto depende de dónde se origina el audio y qué sistema necesita controlar la sesión.

WebRTC para aplicaciones de voz del navegador

WebRTC es el punto de partida recomendado para aplicaciones de voz basadas en navegador. Las pistas multimedia transportan el audio del micrófono y del altavoz, mientras que un canal de datos transporta los eventos de la sesión. Un servidor confiable debe crear la sesión y mantener la clave OpenAI API fuera del navegador.

WebSockets para audio del lado del servidor

WebSockets se adaptan a integraciones del lado del servidor donde la aplicación posee la transmisión de audio. La toma principal transporta eventos de audio y control. Si el navegador posee la conexión WebRTC pero el servidor aún necesita transcripciones, monitoreo o instrucciones correctivas, una banda lateral WebSocket puede conectar controles del servidor sin alejar el audio de WebRTC.

Telefonía y SIP para agentes telefónicos

OpenAI documenta las rutas de integración de telefonía y SIP y proporciona orientación a los socios para sistemas como LiveKit, Twilio, Telnyx, Daily y Pipecat. Las tarifas de los operadores y socios permanecen separadas del cargo de sesión GPT-Live 1.

Un práctico plan de instalación del GPT Live 1

  1. Elija una llamada limitada. Comience con un flujo de trabajo limitado, como verificar un pedido, calificar un cliente potencial o encontrar una cita, no con un agente para todo propósito.
  2. Elige la conexión. Utilice WebRTC para un prototipo de navegador, WebSockets cuando un servidor posee el audio o una ruta telefónica documentada para llamadas telefónicas.
  3. Mantenga breve el mensaje en vivo. Introduzca el tono, el ritmo, el estilo de interrupción, los canales secundarios y la política de delegación en el mensaje de voz. Mantenga flujos de trabajo empresariales detallados y reglas de herramientas en el backend.
  4. Seleccione delegación. Comience con la delegación de respuestas para un backend OpenAI administrado. Utilice la delegación de clientes cuando necesite contexto personalizado, validación, enrutamiento o un servicio que no sea OpenAI.
  5. Haga cumplir las reglas de acción en el código. Verifique la identidad, la autorización, las confirmaciones, los presupuestos y los cambios de estado permitidos antes de ejecutar una herramienta.
  6. Preservar las transcripciones y el estado de la tarea. Los deltas de transcripción pueden estar incompletos o ser incorrectos. Almacene suficiente historial para comprender "sí", "en lugar de viernes" y correcciones que se refieran a detalles anteriores.
  7. Pruebe el audio desordenado. Incluya pensadores lentos, interrupciones, conversaciones secundarias, ruido, ortografía, números de cuentas, silencio, desconexiones y derivación a un ser humano.
  8. Mida el sistema completo. Realice un seguimiento de la calidad de la conversación y del éxito de las tareas de backend, además de todos los costos que quedan fuera de la tarifa de minutos de voz.

Migrar desde Realtime o una pila de voz en cascada

La migración no es simplemente cambiar la identificación del modelo. El cambio más importante es dividir las responsabilidades intencionalmente.

  • Mueva el estilo conversacional al mensaje en vivo. Defina cómo la voz debe hablar, esperar, reconocer, interrumpir y delegar.
  • Mantenga flujos de trabajo detallados en el backend. Las reglas comerciales, los esquemas de herramientas, la validación, los permisos y los resultados largos pertenecen al agente que realiza el trabajo.
  • Adáptese a eventos de audio continuos. GPT-Live 1 transmite audio continuamente y tiene diferentes eventos de sesión que Realtime API; no asuma el mismo flujo de confirmación y activación manual.
  • Traducir llamadas a funciones en delegación. El frontend en vivo solicita ayuda al backend en lugar de emitir argumentos de herramienta estructurados ordinarios de la misma manera que un agente de texto o en tiempo real.
  • Mantener las salvaguardas existentes. Conservar monitoreo, bloques de acción, confirmaciones, registros de auditoría, cancelación y escalamiento. Adáptelos para un modelo que pueda seguir hablando mientras se realizan las comprobaciones.

Ejecute la arquitectura antigua y nueva en los mismos escenarios registrados cuando la política lo permita. Compare los resultados de una llamada completa, no una demostración pulida. nuestro separado guía para la latencia del agente de voz explica por qué el transporte, la transcripción, el razonamiento, las herramientas y la reproducción deben medirse juntos.

Advertencias de producción que vale la pena entender

Su aplicación aún posee las decisiones arriesgadas

GPT-Live 1 puede hacer que una conversación suene segura; que no prueba que se autorizó o completó una acción externa. Verifique los permisos y las confirmaciones requeridas antes de cambiar una cita, cargar una tarjeta, exponer un registro de cuenta o anunciar el éxito. Conserve el estado de la tarea de fuente de verdad fuera de la sesión de voz.

Una interrupción no es una cancelación.

Si una persona que llama dice "En realidad, viernes" mientras se ejecuta una búsqueda del jueves, interrumpir el discurso no cancela esa búsqueda. La aplicación debe revisar la tarea activa, invalidar las confirmaciones obsoletas, cancelar el trabajo cuando sea posible y evitar que un resultado del jueves pasado se considere actual.

El habla continua cambia el diseño de la barandilla

Un agente de texto puede finalizar y validar una respuesta completa antes de mostrarla. GPT-Live 1 puede hablar mientras continúa el trabajo de backend o las comprobaciones de políticas. Retener el resultado de una herramienta no garantiza que la interfaz de voz permanezca en silencio. Supervise tanto las transcripciones como las acciones, bloquee herramientas inseguras en el código de la aplicación y controle la reproducción cuando se requiera aprobación previa al discurso.

Algunas decisiones aún necesitan el audio original.

Un backend delegado no recibe automáticamente la forma de onda sin formato. Si un flujo de trabajo depende de evidencia acústica (un pitido de correo de voz, cadencia del hablante, una segunda persona uniéndose u otra señal que no sea de texto), enrute el audio original a un detector o revisor adecuado. No asuma que una transcripción contiene todas las señales que escuchó la interfaz.

¿Quién debería probar GPT Live 1?

GPT-Live 1 es más interesante para productos en los que la sincronización de la conversación es parte del trabajo: atención al cliente, programación de citas, reservas en restaurantes, tutorías de idiomas, calificación de ventas, accesibilidad, trabajo con manos libres e interfaces de voz colaborativas.

Es menos necesario para la narración unidireccional, la transcripción de archivos, la conversión simple de texto a voz o los flujos de trabajo que deben validar cada oración completa antes de que se pueda reproducir cualquier audio. Los servicios de voz especializados o una pila en cascada pueden ofrecer un control más directo para esos casos.

La decisión práctica no es "¿Es GPT-Live 1 el mejor modelo de voz?" Es: ¿La conversación full-duplex más un backend elegido por separado mejora el éxito de la tarea lo suficiente como para justificar la arquitectura y el costo total? Un piloto representativo puede responder eso; un titular de referencia no puede.

Preguntas frecuentes

¿Qué es GPT Live 1?

GPT-Live 1 es el modelo de voz full-duplex de OpenAI para conversaciones en tiempo real. Escucha y habla al mismo tiempo, luego delega el razonamiento más profundo y el trabajo de herramientas a un agente backend independiente.

¿Cuánto cuesta GPT Live 1?

La sesión de voz frontal cuesta $0,05 por minuto y se factura por segundo. El uso del modelo backend, las herramientas, la telefonía, el almacenamiento y la infraestructura de aplicaciones tienen un costo adicional.

¿GPT Live 1 está disponible ahora?

Sí. OpenAI lanzó GPT-Live 1 en API el 10 de septiembre de 2026. Su ID exacta del modelo API es gpt-live-1. La página del modelo OpenAI dice que el nivel gratuito API no es compatible.

¿Qué es la IA de voz full-duplex?

Full dúplex significa que el sistema de voz puede escuchar mientras habla. Eso hace que la superposición de discursos, reconocimientos, interrupciones y pausas naturales sea más fácil de manejar que un intercambio rígido de un orador a la vez.

¿Cuál es la diferencia entre GPT Live 1 y GPT-Realtime-2.1?

GPT-Live 1 es una interfaz de voz full-duplex de facturación por minutos que delega un trabajo más profundo a un modelo de backend. GPT-Realtime-2.1 es un modelo de voz a voz con facturación de token que maneja audio, razonamiento y llamadas de funciones dentro de su sesión en tiempo real.

¿Puede GPT Live 1 llamar a herramientas?

Sí, mediante delegación. La delegación de respuestas utiliza un modelo de respuestas OpenAI seleccionado. La delegación del cliente permite que la aplicación llame a otro modelo, agente, servicio o flujo de trabajo personalizado y decida qué resultado verificado regresa.

¿Interrumpir GPT Live 1 cancela una tarea de backend?

No. Interrumpir la conversación no cancela automáticamente el trabajo de backend. La aplicación debe decidir si cancela, revisa o descarta un resultado obsoleto.

¿GPT Live 1 admite WebRTC, WebSockets y llamadas telefónicas?

Sí. OpenAI documenta WebRTC para aplicaciones de voz de navegador, WebSockets para audio del lado del servidor, controles de servidor de banda lateral y rutas de integración de telefonía o SIP.

¿Qué voces están disponibles para GPT Live 1?

El lanzamiento de OpenAI incluye Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta y Cinder. El acceso de voz personalizado requiere un proceso de elegibilidad y ventas.

Fuentes y metodología

Este artículo se comparó con material OpenAI propio el 11 de septiembre de 2026. Los resultados de referencia y de clientes se etiquetan como informados por OpenAI en lugar de presentarse como mediciones independientes de Cody.

El resultado final

GPT-Live 1 es más que una nueva voz sintética. Cambia la forma de un agente de voz: un modelo full-duplex gestiona el ritmo humano de la conversación, mientras que un backend elegido por separado se encarga del trabajo más duro.

El precio de 0,05 dólares por minuto hace que el frontend sea fácil de estimar, pero el backend, las herramientas, la red telefónica y la aplicación aún determinan la factura total y gran parte de la calidad de la tarea. El siguiente paso más útil es un piloto limitado con interrupciones, correcciones, ruido y permisos realistas, no una demostración con guión limpio.

Explora el Guía del modelo GPT-Live 1, compararlo directamente con GPT-Realtime-2.1, o navegar por el completo directorio de modelos de voz AI.

Tu primer asistente está a minutos de distancia.

Ponga a trabajar sus conocimientos empresariales.

Comience con una cuenta Cody gratuita. Agregue su contenido, cree un asistente y comparta la primera respuesta útil hoy.