- KI-Tools
- Künstliche Intelligenz
GPT Live 1 API ist da: Preise, Funktionen und Funktionsweise
GPT Live 1 ermöglicht Vollduplex-Sprachgespräche mit dem OpenAI API. Erfahren Sie, wie es funktioniert, was 0,05 $ pro Minute beinhaltet und wie es im Vergleich zu GPT-Realtime-2.1 abschneidet.

OpenAI bietet Entwicklern eine Vollduplex-Konversation im ChatGPT-Stil. Die wichtige Veränderung ist nicht nur eine neue Stimme – sie ist eine neue Arbeitsteilung zwischen dem Gespräch und der Arbeit dahinter.
Sprachassistenten haben sich schnell verbessert, dennoch offenbaren viele immer noch ihre Funktionsweise. Sie warten während einer Pause zu eifrig, reden weiter, nachdem Sie unterbrochen wurden, oder schweigen, während ein Tool nach einer Bestellung sucht. OpenAI’s GPT-Live 1 API Start ist ein Versuch, diese Maschinerie weniger sichtbar zu machen.
GPT-Live 1 wurde am 10. September 2026 veröffentlicht und kann gleichzeitig zuhören und sprechen. Es verwaltet den Rhythmus des Gesprächs selbst, während ein separates Backend-Modell oder ein separater Agent argumentieren, suchen, genehmigte Tools aufrufen und ein Ergebnis zurückgeben kann. Diese Architektur ist der zentrale Gedanke, den es zu verstehen gilt, bevor man Preise oder Benchmarks vergleicht.
In diesem Handbuch erfahren Sie, was GPT Live 1 ist und was es ist 0,05 $ pro Minute Der Preis beinhaltet, wie die Delegation funktioniert und wie sie sich unterscheidet GPT-Realtime-2.1 und traditionelle Sprachpipelines. Wir verwenden „GPT Live 1“ dort, wo wahrscheinlich danach gesucht wird. OpenAI formatiert den Produktnamen GPT-Live 1und die genaue Modell-ID API lautet gpt-live-1.
Schnelle Antwort – überprüft am 11. September 2026
GPT-Live 1 ist jetzt in der Version OpenAI API verfügbar. Das Vollduplex-Sprach-Frontend kostet 0,05 $ pro Sitzungsminute, pro Sekunde abgerechnet. Die Nutzung des Backend-Modells, Tools, Telefonie und Ihre Anwendungsinfrastruktur sind separate Kosten. Es unterstützt die Eingabe/Ausgabe von Text und Audio, Streaming und die delegierte Tool-Nutzung. Bild und Video werden vom Live-Frontend nicht unterstützt.
| GPT Live 1 Tatsache | Bestätigtes Detail |
|---|---|
| Erscheinungsdatum | 10. September 2026 |
| API Modell-ID | gpt-live-1 |
| Preis | 0,05 $ pro Sprachsitzungsminute, Abrechnung pro Sekunde |
| Zusätzliche Gebühren | Backend-Modell, Tools, Telefonie, Speicher und Anwendungsinfrastruktur |
| Eingänge → Ausgänge | Text und Audio → Text und Audio |
| Verbindungen | WebRTC, WebSockets, Sideband-Serversteuerung und Telefonie-/SIP-Pfade |
| Wissensabbruch | 31. Juli 2025 |
| Kostenlose API-Stufe | Nicht unterstützt |
Was ist GPT Live 1?
GPT-Live 1 ist ein Echtzeit-Sprachmodell, das zur Verwaltung der Konversationsschicht einer Anwendung entwickelt wurde. Es empfängt einen kontinuierlichen Audiostream, erzeugt Sprache und Argumente über ein- und ausgehende Audiodaten zusammen. Im Klartext bedeutet es nicht, dass es aufhören muss zuzuhören, nur weil es angefangen hat zu sprechen.
Dadurch eignet sich das Modell gut für die chaotischen Teile echter Sprache: „mm-hm“-Bestätigungen, Zögern, Lachen, Hintergrundgespräche, Korrekturen in der Mitte eines Satzes und Unterbrechungen, die das ändern, was der Sprecher eigentlich will.
GPT-Live 1 ist nicht dazu gedacht, alle schwierigen Geschäftsabläufe innerhalb des Sprachmodells zu übertragen. Für tiefergehende Überlegungen und Werkzeugnutzung wird es an ein vom Entwickler ausgewähltes Backend delegiert. OpenAI gibt Beispiele wie die Verwendung eines kleineren Modells wie Luna für die Planung großer Mengen oder Auftragsaktualisierungen und ein Modell wie Astra für komplexe Kundenprobleme. Bei der Client-Delegierung muss das Backend überhaupt kein OpenAI-Modell sein.
Die genauen API-Fakten, aktuellen Zugangslinks und Anbieterquellen finden Sie im neuen GPT-Live 1-Modellseite in der Modellbibliothek von Cody.
Warum sich Vollduplex-Sprache anders anfühlt
Die meisten Menschen sprechen nicht in sauberen Wechselblöcken. Wir halten inne, um nachzudenken, ohne das Wort aufzugeben. Wir sagen „richtig“, während jemand anderes spricht, um zu zeigen, dass wir folgen. Wir beginnen mit einer Korrektur, bevor die andere Person fertig ist. Ein rundenbasiertes System muss erraten, ob jede Stille oder jeder Ton „jetzt antworten“, „weiter zuhören“ oder „aufhören zu sprechen“ bedeutet.
Vollduplex bedeutet, dass das System zuhören kann, während es spricht. Das allein garantiert noch keine natürliche Konversation, aber es gibt dem Modell den akustischen Kontext, den es braucht, um auf auftretende Überschneidungen zu reagieren. Eine kurze Bestätigung kann anders behandelt werden als eine echte Unterbrechung. Eine nachdenkliche Pause kann eine Pause bleiben, anstatt zu einer Aufforderung an den Assistenten zu werden, einzugreifen.
Dies ist auch der Grund, warum eine einfache Zahl „Zeit bis zum ersten Audio“ nicht das gesamte Erlebnis beschreiben kann. Ein Sprachagent kann schnell anfangen zu sprechen und sich trotzdem unhöflich fühlen, wenn er einen Benutzer beim Nachdenken unterbricht. Es kann eine gute Sprachqualität haben und sich trotzdem langsam anfühlen, wenn es jedes Mal still wird, wenn ein Backend-Tool ausgeführt wird. Turn-Timing, Erholung, Hintergrundgeräuschverhalten und Aufgabenerledigung sind alle zusammen von Bedeutung.
So funktioniert die GPT Live 1-Delegierung
Durch die Delegation wird das Sprach-Frontend vom Backend-Agenten getrennt. GPT-Live 1 kann das Gespräch am Laufen halten – indem es die Anfrage bestätigt oder um eine nützliche Nachbereitung bittet –, während an anderer Stelle tiefergehende Arbeit geleistet wird. OpenAI dokumentiert zwei Möglichkeiten, diese Arbeit zu verbinden.
Antwortdelegation
Mit Antwortdelegation, GPT-Live 1 bereitet die Backend-Anfrage vor, sendet relevanten Konversationskontext an das für die Sitzung ausgewählte OpenAI-Antwortmodell und bringt das Ergebnis zurück in die gesprochene Konversation. Dies ist der verwaltetere Weg und der einfachere Ausgangspunkt, wenn ein Responses-Modell und die unterstützten Tools zur Aufgabe passen.
Die Backend-Auswahl ist unabhängig vom Sprachmodell. Ein Team kann Routinearbeiten auf ein schnelleres oder kostengünstigeres Modell umleiten und sich eine ausführlichere Begründung für Fälle vorbehalten, die dies rechtfertigen. Dies bedeutet auch, dass die Qualität und die Gesamtkosten eines GPT-Live 1-Agenten teilweise von der Backend-Konfiguration abhängen – und nicht nur vom Sprach-Frontend.
Kundendelegation
Mit Kundendelegation, empfängt die Anwendung ein Delegationsereignis, stellt das entsprechende Transkript und den Geschäftskontext zusammen, ruft ein beliebiges Modell, einen Agenten, einen Dienst oder einen benutzerdefinierten Workflow auf und entscheidet dann, welches Ergebnis zurückgesendet werden soll. Diese Route erfordert mehr Ingenieursarbeit, bietet aber viel mehr Kontrolle.
Die Client-Delegation eignet sich besser, wenn Ergebnisse vor der Veröffentlichung validiert oder redigiert werden müssen, mehrere Backends benutzerdefiniertes Routing benötigen, private Systeme innerhalb eines vorhandenen Agentensystems bleiben müssen oder ein Team eigene Budgets, Prüfpunkte und Fallback-Logik benötigt.
In beiden Modi bleibt die Anwendung – nicht GPT-Live 1 – für Berechtigungen, Bestätigungen, Geschäftsunterlagen und den dauerhaften Aufgabenstatus verantwortlich. Delegation ist ein Kommunikationsmechanismus, kein Autorisierungssystem.
GPT Live 1-Funktionen, die wichtig sind
- Gleichzeitiges Zuhören und Sprechen: Das Modell geht davon aus, dass eingehende und ausgehende Audiosignale zusammen gesendet werden, anstatt sie jeweils als isolierte Runde zu behandeln.
- Natürliche Unterbrechungsbehandlung: Es kann unterschiedlich auf einen Rückkanal, eine Korrektur oder einen echten Versuch, das Wort zu ergreifen, reagieren.
- Delegierte Argumentation und Tools: Tiefergehende Arbeiten können über ein ausgewähltes Responses-Modell oder ein anwendungsgesteuertes Backend ausgeführt werden.
- Angeleitetes Sprachverhalten: Entwickler können Ton, Tempo, Stil, Rückkanäle, Unterbrechungsverhalten und den Zeitpunkt der Delegierung durch das Modell festlegen.
- Native Transkripte: ASR-Transkripte und Antworttexte sind neben dem Audiostream verfügbar.
- Alphanumerische und Schlüsselwortunterstützung: OpenAI hebt eine stärkere Handhabung von Namen, Codes und anderen genauen Zeichenfolgen sowie die Ausrichtung auf Schlüsselwörter hervor.
- Umgang mit Stille und Hintergrundgeräuschen: Das Modell ist so konzipiert, dass es nicht jeden Ton oder jede Pause als Befehl zum Reagieren behandelt.
- Zuverlässigkeit über lange Sitzungen: OpenAI gibt an, dass es die Kontexterhaltung und Gesprächsqualität bei längeren Interaktionen verbessert hat.
- Browser-, Server- und Telefonverbindungen: Zu den dokumentierten Pfaden gehören WebRTC, WebSockets, Seitenbandsteuerung und Telefonie/SIP.
Auf der Modellseite werden auch Streaming und Funktionsaufrufe als unterstützt aufgeführt. Strukturierte Ausgaben, Feinabstimmung und vorhergesagte Ausgaben werden für GPT-Live 1 nicht unterstützt.
GPT Live 1-Preise
Die Schlagzeilenrate ist einfach: 0,05 $ pro Minute für die Front-End-Sprachsitzung. OpenAI rechnet sekundenweise ab, sodass eine 61-Sekunden-Sitzung nicht auf zwei volle Minuten aufgerundet wird.
Was eine Sprachsitzung kostet
| Sprachnutzung | GPT-Live 1 Frontend-Kosten |
|---|---|
| 10 Minuten | $0.50 |
| 30 Minuten | $1.50 |
| 100 Stunden (6.000 Minuten) | $300 |
| 1.000 Stunden (60.000 Minuten) | $3,000 |
Bei diesen Beispielen handelt es sich um einfache Listenpreismultiplikationen. Sie sind nützlich, um die Konversationsschicht abzuschätzen, aber sie sind es nicht die Gesamtkosten für den Betrieb eines Sprachagenten.
Die Kosten sind in 0,05 $ pro Minute nicht enthalten
- Das Backend-Modell, das Überlegungen durchführt oder delegierte Ergebnisse generiert.
- Kostenpflichtige Tools wie Websuche oder andere Anbieterdienste.
- Gebühren für Telefonanbieter, Telefonnummer, SIP oder Partnerplattform.
- Ihre Server-, Speicher-, Überwachungs-, Observability- und Audio-Infrastruktur.
- Menschliche Eskalation, Qualitätsprüfung und Supporteinsätze.
Eine realistische Prognose lautet daher: Sprachsitzungsminuten + Backend-Nutzung + Tools + Telefon/Transport + Anwendungskosten. Erfassen Sie diese Teile während eines Pilotprojekts separat. Die Kosten pro erledigter Aufgabe sind häufig sinnvoller als die Kosten pro Minute, da ein natürlicherer Anruf möglicherweise schneller gelöst wird – oder zu einem längeren Gespräch anregt.
Die Modellseite von OpenAI misst Ratenlimits in gleichzeitigen Sitzungen. Derzeit werden 25 Sitzungen für Tier 1, 50 für Tier 2, 200 für Tier 3, 300 für Tier 4 und 500 für Tier 5 aufgeführt. Produktionsteams sollten vor einem großen Start die aktuellen Grenzwerte bestätigen und Kapazität anfordern.
GPT Live 1 vs. GPT-Realtime-2.1
Beide sind OpenAI-Sprachmodelle, lösen die Architektur jedoch unterschiedlich. GPT-Realtime-2.1 ist ein Speech-to-Speech-Argumentationsmodell, das Text-, Bild- und Audiokontext empfangen und Funktionen innerhalb einer Echtzeitsitzung aufrufen kann. GPT-Live 1 ist ein dediziertes Vollduplex-Konversations-Frontend, das tiefergehende Überlegungen und Aktionen an ein separates Backend delegiert.
| Frage | GPT-Live 1 | GPT-Realtime-2.1 |
|---|---|---|
| Kerndesign | Vollduplex-Sprach-Frontend plus delegiertes Backend | Echtzeit-Speech-to-Speech-Modell mit Argumentation und Funktionsaufruf in der Sitzung |
| Veröffentlichte Abrechnung | 0,05 $ pro Sitzungsminute, zuzüglich Backend-Nutzung | Tokenbasiert: Audio-, Text- und Bildraten variieren je nach Eingabe-/Ausgabeklasse |
| Stimmverhalten | Konzipiert für gleichzeitiges Zuhören und Sprechen | Echtzeitdialog mit Abbiegeerkennung und Unterbrechungsbehandlung |
| Frontend-Eingabe | Text und Audio | Text, Bild und Audio |
| Backend-Flexibilität | Antwortmodell oder ein beliebiges vom Kunden betriebenes Modell, Agent oder Dienst | Ein konfiguriertes Echtzeitmodell und die verfügbaren Tools |
| Bester Grund zum Testen | Natürlichere Überlappung und unabhängiges Backend-Routing | Eine einheitliche multimodale Echtzeitsitzung mit tokenbasierter Nutzung |
Die Preisstreitigkeiten können nicht in ein faires, universelles „billigeres Modell“-Urteil umgewandelt werden. GPT-Live 1 berechnet die verstrichene Sitzungszeit und fügt eine Backend-Rechnung hinzu. GPT-Realtime-2.1 berechnet Token über mehrere Medienklassen hinweg. Stille, Sprechverhältnis, Antwortlänge, Bildverwendung, Tools, Caching und Backend-Auswahl verändern das Ergebnis.
Verwenden Sie die Modellbibliothek von Cody, um den Strom zu überprüfen Vergleich zwischen GPT-Live 1 und GPT-Realtime-2.1 oder vergleichen Sie GPT-Live 1 mit den anderen Modellen in der Sprache und Echtzeit-Kategorie.
GPT Live 1 im Vergleich zu einer herkömmlichen STT-LLM-TTS-Pipeline
Ein herkömmlicher Sprachagent verbindet normalerweise drei Systeme: Speech-to-Text, ein Sprachmodell und Text-to-Speech. Diese Modularität ist wertvoll. Teams können das beste Transkriptionsmodell für eine Sprache auswählen, eine vollständige Textantwort vor Beginn der Rede validieren und eine Komponente ersetzen, ohne alles ersetzen zu müssen.
Der Kompromiss ist Orchestrierung. Bei jeder Übergabe entsteht eine weitere Warteschlange, eine weitere Formatkonvertierung und ein weiterer Ort, an dem Timing oder Kontext verloren gehen können. Die Anwendung muss entscheiden, wann eine Äußerung endet, was zu tun ist, wenn der Anrufer die synthetisierte Sprache unterbricht, und wie sich das Transkript nach einer Selbstkorrektur ändern soll.
GPT-Live 1 fasst die Hör- und Sprechphasen in einer kontinuierlichen Sprachebene zusammen und behält gleichzeitig ein separates Backend für tiefergehende Arbeiten bei. Das kann das Abwechseln vereinfachen und das „Walkie-Talkie“-Gefühl verringern, macht aber eine Anwendungsschicht nicht überflüssig. Die App muss weiterhin Aktionen, Datenschutz, Fehlerbehebung, Telefonie und die Quelle der Wahrheit für die Aufgabe verwalten.
Wählen Sie basierend auf der schwierigsten Anforderung. Wenn eine vollständige Validierung vor der Rede und eine Kontrolle auf Komponentenebene obligatorisch sind, kann eine kaskadierte Pipeline attraktiv bleiben. Wenn Gesprächsfluss, Überschneidungen und die kontinuierliche Interaktion während der Ausführung einer Aufgabe im Mittelpunkt stehen, ist GPT-Live 1 eine überzeugende Architektur zum Testen.
Was die Benchmarks von OpenAI beweisen und was nicht
OpenAI meldet, dass GPT-Live 1 sein Full Duplex Bench-Ergebnis um verbessert hat 30 Prozentpunkte gegenüber GPT-Realtime-2.1, mit Zuwächsen bei der Turn-Taking-Latenz und beim interaktiven Verhalten. In Kombination mit GPT-6 Astra bei mittlerem Argumentationsaufwand meldet OpenAI auch ein Tau3-Ergebnis Nummer eins für End-to-End-Sprachagentenaufgaben.
In einer ersten Kundenbewertung berichtete das Sprachlernunternehmen Speak von fast 80 % weniger Unterbrechungen während Denkpausen der Lernenden als seine früheren rundenbasierten Systeme. OpenAI hat auch günstige Kundenkonten von Yelp, Fin, Cognition und anderen veröffentlicht.
Diese Ergebnisse sind nützliche Signale, aber sie bleiben bestehen Vom Anbieter veröffentlichte Auswertungen und Kundenberichte. Das Ergebnis Astra misst ein kombiniertes System, nicht GPT-Live 1 allein. Keine der Zahlen garantiert die Leistung Ihres Mobilfunkanbieters, Akzente, Lärm, Werkzeuglatenz, Eingabeaufforderung oder Geschäftsablauf. Wir haben sie nicht als Cody-Benchmark reproduziert.
Eine aussagekräftige Bewertung sollte mindestens folgende Punkte erzielen: abgeschlossene Aufgaben, unangemessene Unterbrechungen, Erholung nach Korrekturen, Timing am Ende der Runde, Werkzeuggenauigkeit, Latenzperzentile, Eskalationsqualität, Kosten pro abgeschlossene Aufgabe und menschliche Präferenz bei repräsentativen Anrufen.
GPT Live 1 Stimmen- und Sprachunterstützung
Die Markteinführung von OpenAI listet zwölf Stimmen auf: Quarz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta und Cinder. Das Unternehmen gibt an, dass die Auswahl die Abdeckung von Akzenten, Dialekten und Sprachen erweitert und plant, im Laufe der Zeit weitere hinzuzufügen.
OpenAI veröffentlicht keine genaue Sprachliste auf der GPT-Live 1-Modellseite. „Breitere Sprachverfügbarkeit“ sollte daher nicht als Garantie für jedes Gebietsschema, jeden Akzent oder jedes Codewechselmuster verstanden werden. Testen Sie echte Sprecher, Hintergrundbedingungen, Namen, Adressen, Bestätigungssätze und die Sprachen, die Ihr Produkt unterstützen soll.
Der benutzerdefinierte Sprachzugriff ist keine Selbstbedienungs-Standardeinstellung. OpenAI weist interessierte Organisationen an, sich bezüglich der Berechtigung und des Anfrageprozesses an den Vertrieb zu wenden.
So verbinden Sie GPT Live 1
OpenAI dokumentiert mehrere Verbindungsmuster. Welche die richtige ist, hängt davon ab, woher das Audio kommt und welches System die Kontrolle über die Sitzung benötigt.
WebRTC für Browser-Sprach-Apps
WebRTC ist der empfohlene Ausgangspunkt für browserbasierte Sprachanwendungen. Medienspuren übertragen das Mikrofon- und Lautsprecheraudio, während ein Datenkanal Sitzungsereignisse überträgt. Ein vertrauenswürdiger Server sollte die Sitzung erstellen und den Schlüssel OpenAI API aus dem Browser fernhalten.
WebSockets für serverseitiges Audio
WebSockets eignen sich für serverseitige Integrationen, bei denen die Anwendung Eigentümer des Audiostreams ist. Der Hauptanschluss überträgt Audio- und Steuerereignisse. Wenn der Browser über die WebRTC-Verbindung verfügt, der Server jedoch weiterhin Transkripte, Überwachung oder Korrekturanweisungen benötigt, kann ein Sideband-WebSocket Serversteuerungen anbinden, ohne Audio von WebRTC wegzubewegen.
Telefonie und SIP für Telefonagenten
OpenAI dokumentiert Telefonie- und SIP-Integrationspfade und bietet Partneranleitungen für Systeme wie LiveKit, Twilio, Telnyx, Daily und Pipecat. Die Gebühren für Mobilfunkanbieter und Partner bleiben von der Sitzungsgebühr GPT-Live 1 getrennt.
Ein praktischer GPT Live 1-Einrichtungsplan
- Wählen Sie einen schmalen Anruf. Beginnen Sie mit einem begrenzten Arbeitsablauf, z. B. der Prüfung einer Bestellung, der Qualifizierung eines Leads oder der Suche nach einem Termin – und nicht mit einem Allzweck-Agenten.
- Wählen Sie die Verbindung. Verwenden Sie WebRTC für einen Browser-Prototyp, WebSockets, wenn ein Server das Audio besitzt, oder eine dokumentierte Telefonroute für Telefonanrufe.
- Halten Sie die Live-Eingabeaufforderung kurz. Geben Sie Ton, Tempo, Unterbrechungsstil, Rückkanäle und Delegationsrichtlinien in die Sprachansage ein. Behalten Sie detaillierte Geschäftsabläufe und Toolregeln im Backend bei.
- Delegation auswählen. Beginnen Sie mit der Antwortdelegierung für ein verwaltetes OpenAI-Backend. Verwenden Sie die Clientdelegierung, wenn Sie benutzerdefinierten Kontext, Validierung, Routing oder einen Nicht-OpenAI-Dienst benötigen.
- Erzwingen Sie Aktionsregeln im Code. Überprüfen Sie Identität, Autorisierung, Bestätigungen, Budgets und zulässige Statusänderungen, bevor ein Tool ausgeführt wird.
- Behalten Sie Transkripte und Aufgabenstatus bei. Transkriptdeltas können unvollständig oder falsch sein. Speichern Sie genügend Verlauf, um „Ja“, „Stattdessen Freitag“ und Korrekturen, die sich auf frühere Details beziehen, zu verstehen.
- Testen Sie unordentliches Audio. Berücksichtigen Sie langsame Denker, Unterbrechungen, Nebengespräche, Lärm, Rechtschreibung, Kontonummern, Stille, Unterbrechungen und die Eskalation gegenüber einem Menschen.
- Messen Sie das komplette System. Verfolgen Sie sowohl die Gesprächsqualität als auch den Erfolg der Backend-Aufgaben sowie alle Kosten, die außerhalb des Sprachminutentarifs liegen.
Migration von Echtzeit oder einem kaskadierten Sprachstapel
Bei der Migration wird nicht einfach nur die Modell-ID geändert. Die wichtigste Änderung besteht in der bewussten Aufteilung der Verantwortlichkeiten.
- Verschieben Sie den Konversationsstil in die Live-Eingabeaufforderung. Definieren Sie, wie die Stimme sprechen, warten, bestätigen, unterbrechen und delegieren soll.
- Behalten Sie detaillierte Arbeitsabläufe im Backend bei. Geschäftsregeln, Toolschemata, Validierung, Berechtigungen und lange Ausgaben gehören zum Agenten, der die Arbeit erledigt.
- Passen Sie sich an kontinuierliche Audioereignisse an. GPT-Live 1 streamt kontinuierlich Audio und verfügt über andere Sitzungsereignisse als Echtzeit-API; Gehen Sie nicht von demselben manuellen Commit- und Trigger-Ablauf aus.
- Übersetzen Sie Funktionsaufrufe in Delegation. Das Live-Frontend bittet ein Backend um Hilfe, anstatt wie ein Text- oder Echtzeitagent gewöhnliche strukturierte Toolargumente auszugeben.
- Bestehende Schutzmaßnahmen beibehalten. Behalten Sie Überwachung, Aktionsblöcke, Bestätigungen, Prüfaufzeichnungen, Stornierung und Eskalation bei. Passen Sie sie an ein Modell an, das während der Ausführung von Prüfungen weiterhin sprechen kann.
Führen Sie die alte und die neue Architektur in denselben aufgezeichneten Szenarien aus, sofern die Richtlinien dies zulassen. Vergleichen Sie die Ergebnisse eines vollständigen Anrufs, keine ausgefeilte Demo. Unsere separate Leitfaden zur Latenz von Sprachagenten erklärt, warum Transport, Transkription, Argumentation, Werkzeuge und Wiedergabe gemeinsam gemessen werden müssen.
Es lohnt sich, Produktionsvorbehalte zu verstehen
Die riskanten Entscheidungen liegen weiterhin in Ihrer Bewerbung
GPT-Live 1 kann dafür sorgen, dass ein Gespräch souverän klingt; Dies beweist nicht, dass eine externe Maßnahme genehmigt oder abgeschlossen wurde. Überprüfen Sie Berechtigungen und erforderliche Bestätigungen, bevor Sie einen Termin ändern, eine Karte belasten, einen Kontodatensatz offenlegen oder einen Erfolg verkünden. Behalten Sie den Status der Source-of-Truth-Aufgabe außerhalb der Sprachsitzung bei.
Eine Unterbrechung ist keine Stornierung
Wenn ein Anrufer „Eigentlich lieber Freitag“ sagt, während eine Suche am Donnerstag läuft, wird die Suche durch eine Unterbrechung der Rede nicht abgebrochen. Der Antrag muss die aktive Aufgabe überarbeiten, veraltete Bestätigungen ungültig machen, Arbeiten nach Möglichkeit abbrechen und verhindern, dass ein Ergebnis vom späten Donnerstag als aktuell gilt.
Kontinuierliches Sprechen verändert das Design der Leitplanke
Ein Textagent kann eine gesamte Antwort fertigstellen und validieren, bevor er sie anzeigt. GPT-Live 1 spricht möglicherweise, während Backend-Arbeiten oder Richtlinienprüfungen fortgesetzt werden. Das Zurückhalten eines Tool-Ergebnisses garantiert nicht, dass das Sprach-Frontend stumm bleibt. Überwachen Sie sowohl Transkripte als auch Aktionen, blockieren Sie unsichere Tools im Anwendungscode und steuern Sie die Wiedergabe dort, wo vor der Rede eine Genehmigung erforderlich ist.
Für einige Entscheidungen ist immer noch das Originalaudio erforderlich
Ein delegiertes Backend empfängt die Rohwellenform nicht automatisch. Wenn ein Arbeitsablauf von akustischen Beweisen abhängt – einem Voicemail-Piepton, dem Rhythmus des Sprechers, dem Zutritt einer zweiten Person oder einem anderen Nicht-Text-Signal –, leiten Sie das Originalaudio an einen geeigneten Detektor oder Prüfer weiter. Gehen Sie nicht davon aus, dass ein Transkript jedes Signal enthält, das das Frontend gehört hat.
Wer sollte GPT Live 1 testen?
GPT-Live 1 ist am interessantesten für Produkte, bei denen Gesprächs-Timing Teil der Arbeit ist: Kundenbetreuung, Terminplanung, Restaurantreservierungen, Sprachunterricht, Vertriebsqualifikation, Barrierefreiheit, freihändiges Arbeiten und kollaborative Sprachschnittstellen.
Für einseitige Erzählung, Dateitranskription, einfache Text-to-Speech-Umwandlung oder Arbeitsabläufe, bei denen jeder vollständige Satz überprüft werden muss, bevor Audio abgespielt werden kann, ist dies weniger offensichtlich erforderlich. Spezielle Sprachdienste oder ein kaskadierter Stapel können in diesen Fällen eine direktere Kontrolle bieten.
Die praktische Entscheidung lautet nicht: „Ist GPT-Live 1 das beste Sprachmodell?“ Es ist: Verbessert Vollduplex-Konversation plus ein separat ausgewähltes Backend den Aufgabenerfolg ausreichend, um die Architektur und die Gesamtkosten zu rechtfertigen? Ein repräsentativer Pilot kann das beantworten; Eine Benchmark-Überschrift kann das nicht.
Häufig gestellte Fragen
Was ist GPT Live 1?
GPT-Live 1 ist das Vollduplex-Sprachmodell von OpenAI für Gespräche in Echtzeit. Es hört zu und spricht gleichzeitig und delegiert dann tiefergehende Überlegungen und Tool-Arbeit an einen separaten Backend-Agenten.
Wie viel kostet GPT Live 1?
Die Front-End-Sprachsitzung kostet 0,05 $ pro Minute und wird pro Sekunde abgerechnet. Für die Nutzung des Backend-Modells, Tools, Telefonie, Speicher und Anwendungsinfrastruktur fallen zusätzliche Kosten an.
Ist GPT Live 1 jetzt verfügbar?
Ja. OpenAI veröffentlichte GPT-Live 1 im API am 10. September 2026. Die genaue API-Modell-ID lautet gpt-live-1. Auf der Modellseite von OpenAI heißt es, dass die kostenlose Stufe API nicht unterstützt wird.
Was ist Vollduplex-Sprach-KI?
Vollduplex bedeutet, dass das Sprachsystem beim Sprechen zuhören kann. Dadurch sind sich überschneidende Reden, Danksagungen, Unterbrechungen und natürliche Pausen einfacher zu handhaben als ein starrer Austausch zwischen jeweils einem Sprecher.
Was ist der Unterschied zwischen GPT Live 1 und GPT-Realtime-2.1?
GPT-Live 1 ist ein Vollduplex-Sprach-Frontend mit Minutenabrechnung, das tiefergehende Arbeiten an ein Backend-Modell delegiert. GPT-Realtime-2.1 ist ein Speech-to-Speech-Modell mit Token-Abrechnung, das Audio, Argumentation und Funktionsaufrufe innerhalb seiner Echtzeitsitzung verarbeitet.
Kann GPT Live 1 Tools aufrufen?
Ja, durch Delegation. Die Antwortdelegierung verwendet ein ausgewähltes OpenAI-Antwortmodell. Durch die Client-Delegierung kann die Anwendung ein anderes Modell, einen anderen Agenten, einen anderen Dienst oder einen benutzerdefinierten Workflow aufrufen und entscheiden, welches überprüfte Ergebnis zurückgegeben wird.
Wird durch die Unterbrechung von GPT Live 1 eine Backend-Aufgabe abgebrochen?
Nein. Eine Sprachunterbrechung führt nicht automatisch zum Abbruch der Backend-Arbeit. Der Antrag muss entscheiden, ob ein veraltetes Ergebnis annulliert, überarbeitet oder verworfen werden soll.
Unterstützt GPT Live 1 WebRTC, WebSockets und Telefonanrufe?
Ja. OpenAI dokumentiert WebRTC für Browser-Sprachanwendungen, WebSockets für serverseitiges Audio, Sideband-Serversteuerungen und Telefonie- oder SIP-Integrationspfade.
Welche Stimmen sind für GPT Live 1 verfügbar?
Die Startliste von OpenAI listet Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta und Cinder auf. Für den benutzerdefinierten Sprachzugriff ist ein Berechtigungs- und Verkaufsprozess erforderlich.
Quellen und Methodik
Dieser Artikel wurde am 11. September 2026 mit OpenAI-Material von Erstanbietern überprüft. Benchmark- und Kundenergebnisse werden als OpenAI-gemeldet gekennzeichnet und nicht als unabhängige Cody-Messungen dargestellt.
- OpenAI: GPT-Live 1 API Startankündigung
- OpenAI: GPT-Live 1-Modellseite, Preis, Funktionen und Tarifbeschränkungen
- OpenAI: Erste Schritte mit GPT-Live
- OpenAI: Anleitung zur GPT-Live-Eingabeaufforderung
- OpenAI: GPT-Live-Delegierung und Tools
- OpenAI: Migrationsanleitung für GPT-Live
- OpenAI: API Preise
Das Endergebnis
GPT-Live 1 ist mehr als eine neue synthetische Stimme. Es verändert die Form eines Sprachagenten: Ein Vollduplex-Modell verwaltet den menschlichen Rhythmus der Konversation, während ein separat ausgewähltes Backend die schwierigere Arbeit übernimmt.
Der Preis von 0,05 US-Dollar pro Minute macht das Frontend leicht abzuschätzen, aber das Backend, die Tools, das Telefonnetz und die Anwendung bestimmen immer noch die Gesamtrechnung und einen Großteil der Aufgabenqualität. Der nützlichste nächste Schritt ist ein enger Pilot mit realistischen Unterbrechungen, Korrekturen, Lärm und Berechtigungen – keine saubere Skript-Demo.
Entdecken Sie die GPT-Live 1-Modellführer, vergleichen Sie es direkt mit GPT-Realtime-2.1, oder stöbern Sie im Volltext Verzeichnis der Sprach-KI-Modelle.


