Alle Modelle
Inworld AI

Inworld Realtime TTS-2

Das neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen.

Übersicht in einfacher englischer Sprache

Was Inworld Realtime TTS-2 eigentlich ist

Inworld Realtime TTS-2 wandelt Text in gestreamte Sprache um und verwendet dabei frühere Audiodrehungen, um die Wiedergabe eines Charakters konsistent zu halten. Entwickler können die gewünschte Stimmung oder Übermittlung in natürlicher Sprache beschreiben, die Sprache wechseln und das Klonen von Stimmen verwenden, sofern ihre Rechte und Kontoeinstellungen dies zulassen.

Die Preise basieren auf Zeichen und nicht auf Audio-Tokens, was die Schätzung von Skripten erleichtert. Inworld meldet eine durchschnittliche Zeit bis zum ersten Ton von weniger als 200 ms, aber die Netzwerkentfernung, die Anwendungsarbeit und das Upstream-Sprachmodell wirken sich immer noch auf die vollständige Antwortzeit aus.

Gute Passform für

  • Echtzeit-Begleiter und Support-Stimmen
  • Mehrsprachige Erlebnisse mit einer einheitlichen Stimme
  • Kreative Sprachregie und autorisiertes Klonen

Kategorievergleich

Die Fakten, die für die stimme-Modelle wichtig sind

Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.

Preisbasis
25 $ / 1 Mio. Zeichen auf Anfrage; MengenrabatteToken-, zeichen- oder minutenbasierter Preis für die aufgeführte Zugangsroute.
Interaktionsmodus
Steuerbares Echtzeit-TTS mit vorherigem AudiokontextSpeech-to-Speech-, Audio-to-Audio- oder gestreamtes Text-to-Speech-Verhalten.
Veröffentlichte Latenz
Unter 200 ms mittlerer TTFAVom Anbieter veröffentlichte Messung mit den angegebenen Ausschlüssen; kein Cody-Test.
Sprachen
100+ mit Umschalten während der ÄußerungVom Anbieter dokumentierte Sprachabdeckung oder ein eindeutiger unveröffentlichter Marker.
Werkzeuge und Steuerung
Stimmführung, Design, Klonen, NonverbalNative Funktionsaufruf-, Argumentations- oder Sprachsteuerungsfunktionen.
Kontext oder Eingabelimit
Nicht veröffentlichtDokumentiertes Token oder Zeichenlimit, wo es sinnvoll ist.

API- und Provider-Zugriff

Wo bekomme ich Inworld Realtime TTS-2?

Verfügbarkeit

Regionen und Zugriffsphase

Allgemein verfügbar über die REST-TTS-API von Inworld und die OpenAI-kompatible Echtzeit-API.

Die Abdeckung der Standardregion ist auf der Modellseite nicht aufgeführt; Unternehmenspläne bieten Optionen für die Datenspeicherung in der EU und Indien an.

Überprüfen Sie die Live-Verfügbarkeit

Daten und Schulung

Die Route ist wichtig.

Inworld bewirbt Zero Data Retention als Unternehmens-Add-on, auf der aktuell veröffentlichten ZDR-Supportseite werden jedoch nur TTS-1.5 Mini und Max genannt. Bestätigen Sie die TTS-2-Abdeckung direkt, bevor Sie regulierte oder vertrauliche Texte senden.

Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.

Lesen Sie die Richtlinien des Anbieters

Häufig gestellte Fragen

Inworld Realtime TTS-2 FAQ

Was ist Inworld Realtime TTS-2?

Das neueste ausdrucksstarke Echtzeit-Text-to-Speech-Modell von Inworld, das darauf ausgelegt ist, sich die gesprochene Sprache zu merken und in mehr als 100 Sprachen zu sprechen. Inworld Realtime TTS-2 wandelt Text in gestreamte Sprache um und verwendet dabei frühere Audiodrehungen, um die Wiedergabe eines Charakters konsistent zu halten. Entwickler können die gewünschte Stimmung oder Übermittlung in natürlicher Sprache beschreiben, die Sprache wechseln und das Klonen von Stimmen verwenden, sofern ihre Rechte und Kontoeinstellungen dies zulassen.

Wann wurde Inworld Realtime TTS-2 veröffentlicht?

Inworld Realtime TTS-2 wurde gemäß den zitierten Anbietermaterialien auf 31. August 2026 veröffentlicht.

Wo kann ich auf Inworld Realtime TTS-2 zugreifen?

Allgemein verfügbar über die REST-TTS-API von Inworld und die OpenAI-kompatible Echtzeit-API. Die in diesem Handbuch aufgeführten Zugriffsrouten sind Inworld AI.

Wie viel kostet Inworld Realtime TTS-2?

25 $ / 1 Mio. Zeichen auf Anfrage. Die veröffentlichten Abonnementpreise sinken auf 20 $, 17,50 $, 15 $ und 12,50 $ pro Million Zeichen je Stufe, wobei die Preise für Unternehmen bereits bei 5 $ liegen.

Wo ist Inworld Realtime TTS-2 erhältlich?

Allgemein verfügbar über die REST-TTS-API von Inworld und die OpenAI-kompatible Echtzeit-API. Die Abdeckung der Standardregion ist auf der Modellseite nicht aufgeführt; Unternehmenspläne bieten Optionen für die Datenspeicherung in der EU und Indien an.

Werden meine Inworld Realtime TTS-2-API-Daten für das Training verwendet?

Inworld bewirbt Zero Data Retention als Unternehmens-Add-on, auf der aktuell veröffentlichten ZDR-Supportseite werden jedoch nur TTS-1.5 Mini und Max genannt. Bestätigen Sie die TTS-2-Abdeckung direkt, bevor Sie regulierte oder vertrauliche Texte senden. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.

Verwandte Vergleiche

Direktvergleiche

  1. Inworld Realtime TTS-2 vs Gemini 3.8 Flash TTS

    Googles Sprachgenerierungsmodell für ausdrucksstarke Erzählungen, Charakterstimmen und Dialoge in 130 Sprachen.

    Vollständigen Vergleich öffnen
  2. Inworld Realtime TTS-2 vs Gemini 3.8 Flash-Lite TTS

    Googles günstigeres Sprachgenerierungsmodell für Vorlesefunktionen und große Audiomengen in 101 Sprachen.

    Vollständigen Vergleich öffnen
  3. Inworld Realtime TTS-2 vs GPT-Live 1

    Das Vollduplex-Sprach-Frontend von OpenAI für natürliche Konversation, das tiefergehende Überlegungen und Aktionen an einen separaten Backend-Agenten delegiert.

    Vollständigen Vergleich öffnen
  4. Inworld Realtime TTS-2 vs Gemini 3.8 Live

    Googles Echtzeit-Sprachmodell für flüssige Gespräche mit Audio, Text und visuellem Kontext.

    Vollständigen Vergleich öffnen
  5. Inworld Realtime TTS-2 vs Gemini 3.8 Live Extended Thinking

    Ein separates Gemini-Sprachmodell, das komplexe Anfragen im Hintergrund bearbeitet und das Gespräch dabei fortsetzt.

    Vollständigen Vergleich öffnen
  6. Inworld Realtime TTS-2 vs GPT-Realtime-2.1

    Das Echtzeit-Speech-to-Speech-Argumentationsmodell von OpenAI für Tool-verwendende Sprachagenten, die auch Text- und Bildkontext benötigen.

    Vollständigen Vergleich öffnen
  7. Inworld Realtime TTS-2 vs Gemini 3.1 Flash Live Preview

    Das Vorschau-Audio-zu-Audio-Modell von Google für Dialoge mit geringer Latenz mit multimodalem Bewusstsein, Denken, Sucherdung und Funktionsaufruf.

    Vollständigen Vergleich öffnen
  8. Inworld Realtime TTS-2 vs Eleven v3 Conversational

    ElevenLabs‘ ausdrucksstarkes Echtzeit-Text-to-Speech-Modell für natürliche Dialoge, emotionale Übermittlung, Audio-Tags und mehr als 70 Sprachen.

    Vollständigen Vergleich öffnen
  9. Inworld Realtime TTS-2 vs Grok Voice Think Fast 2.0

    Das aktuelle Echtzeit-Speech-to-Speech-Modell von SpaceXAI für Sub-Sekunden-Konversationsagenten mit Tool-Zugriff.

    Vollständigen Vergleich öffnen