Wszystkie modele
Inworld AI

Inworld Realtime TTS-2

Najnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach.

Przegląd w prostym języku angielskim

Czym właściwie jest Inworld Realtime TTS-2

Inworld Realtime TTS-2 zamienia tekst na mowę przesyłaną strumieniowo, korzystając z wcześniejszych zwrotów audio, aby zachować spójność odtwarzania postaci. Programiści mogą opisać pożądany nastrój lub prezentację w języku naturalnym, zmieniać języki i korzystać z klonowania głosu, jeśli pozwalają na to ich uprawnienia i konfiguracja konta.

Ceny opierają się na postaciach, a nie na tokenach dźwiękowych, co ułatwia oszacowanie skryptów. Inworld podaje, że średni czas do pierwszego dźwięku wynosi mniej niż 200 ms, ale odległość od sieci, praca aplikacji i model języka nadrzędnego nadal wpływają na całkowity czas odpowiedzi.

Dobre dopasowanie do

  • Towarzysze w czasie rzeczywistym i głosy wsparcia
  • Wielojęzyczne doświadczenia z jednym spójnym głosem
  • Kreatywne kierowanie głosem i autoryzowane klonowanie

Porównanie kategorii

Fakty, które mają znaczenie w przypadku modeli głos

Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.

Podstawa ceny
25 USD / 1 milion znaków na żądanie; rabaty ilościoweCena oparta na tokenach, znakach lub minutach dla podanej trasy dostępu.
Tryb interakcji
Sterowany TTS w czasie rzeczywistym z wcześniejszym kontekstem audioZachowanie polegające na zamianie mowy na mowę, audio na dźwięk lub strumieniowej zamianie tekstu na mowę.
Opublikowane opóźnienie
Mediana TTFA poniżej 200 msPomiar opublikowany przez dostawcę z podanymi wyłączeniami; nie jest to test Cody.
Języki
100+ z przełączaniem w połowie wypowiedziZakres języka udokumentowany przez dostawcę lub wyraźny, niepublikowany znacznik.
Narzędzia i kontrola
Kierunek głosu, projektowanie, klonowanie, komunikaty niewerbalneNatywne wywoływanie funkcji, wnioskowanie lub funkcje kontroli mowy.
Kontekst lub limit wejściowy
NieopublikowaneUdokumentowany limit tokenów lub znaków, jeśli ma to znaczenie.

Dostęp do API i dostawcy

Gdzie zdobyć Inworld Realtime TTS-2

Dostępność

Regiony i etap dostępu

Ogólnie dostępne za pośrednictwem interfejsu API REST TTS firmy Inworld i interfejsu API czasu rzeczywistego zgodnego z OpenAI.

Standardowy zasięg regionu nie jest wymieniony na stronie modelu; plany korporacyjne reklamują opcje przechowywania danych w UE i Indiach.

Sprawdź dostępność na żywo

Dane i szkolenia

Trasa ma znaczenie.

Inworld reklamuje dodatek dla przedsiębiorstw o zerowej retencji danych, ale obecnie opublikowana strona pomocy ZDR zawiera nazwy tylko TTS-1.5 Mini i Max. Potwierdź zasięg TTS-2 bezpośrednio przed wysłaniem tekstu objętego przepisami lub poufnego.

Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.

Przeczytaj politykę dostawcy

Często zadawane pytania

Często zadawane pytania dotyczące Inworld Realtime TTS-2

Co to jest Inworld Realtime TTS-2?

Najnowszy, ekspresyjny model syntezy mowy firmy Inworld w czasie rzeczywistym, zaprojektowany z myślą o zapamiętywaniu przebiegu konwersacji i mówieniu w ponad 100 językach. Inworld Realtime TTS-2 zamienia tekst na mowę przesyłaną strumieniowo, korzystając z wcześniejszych zwrotów audio, aby zachować spójność odtwarzania postaci. Programiści mogą opisać pożądany nastrój lub prezentację w języku naturalnym, zmieniać języki i korzystać z klonowania głosu, jeśli pozwalają na to ich uprawnienia i konfiguracja konta.

Kiedy wypuszczono Inworld Realtime TTS-2?

Według materiałów cytowanego dostawcy Inworld Realtime TTS-2 został wydany na 31 sierpnia 2026.

Gdzie mogę uzyskać dostęp do Inworld Realtime TTS-2?

Ogólnie dostępne za pośrednictwem interfejsu API REST TTS firmy Inworld i interfejsu API czasu rzeczywistego zgodnego z OpenAI. Drogi dostępu wymienione w tym przewodniku to Inworld AI.

Ile kosztuje Inworld Realtime TTS-2?

25 USD / 1 milion znaków na żądanie. Opublikowane stawki subskrypcji spadają do 20 USD, 17,50 USD, 15 USD i 12,50 USD za milion znaków według poziomu, a ceny dla przedsiębiorstw reklamowane są już od 5 USD.

Gdzie jest dostępny Inworld Realtime TTS-2?

Ogólnie dostępne za pośrednictwem interfejsu API REST TTS firmy Inworld i interfejsu API czasu rzeczywistego zgodnego z OpenAI. Standardowy zasięg regionu nie jest wymieniony na stronie modelu; plany korporacyjne reklamują opcje przechowywania danych w UE i Indiach.

Czy moje dane API Inworld Realtime TTS-2 są wykorzystywane do szkolenia?

Inworld reklamuje dodatek dla przedsiębiorstw o zerowej retencji danych, ale obecnie opublikowana strona pomocy ZDR zawiera nazwy tylko TTS-1.5 Mini i Max. Potwierdź zasięg TTS-2 bezpośrednio przed wysłaniem tekstu objętego przepisami lub poufnego. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.

Powiązane porównania

Porównania bezpośrednie

  1. Inworld Realtime TTS-2 vs Gemini 3.8 Flash TTS

    Model generowania mowy Google do ekspresyjnej narracji, głosów postaci i dialogów w 130 językach.

    Otwórz pełne porównanie
  2. Inworld Realtime TTS-2 vs Gemini 3.8 Flash-Lite TTS

    Tańszy model generowania mowy Google do odczytywania tekstu i masowej produkcji audio w 101 językach.

    Otwórz pełne porównanie
  3. Inworld Realtime TTS-2 vs GPT-Live 1

    Pełnodupleksowy interfejs głosowy OpenAI zapewniający naturalną konwersację, który przekazuje głębsze rozumowanie i działania oddzielnemu agentowi zaplecza.

    Otwórz pełne porównanie
  4. Inworld Realtime TTS-2 vs Gemini 3.8 Live

    Model głosowy Google do płynnych rozmów w czasie rzeczywistym z dźwiękiem, tekstem i kontekstem wizualnym.

    Otwórz pełne porównanie
  5. Inworld Realtime TTS-2 vs Gemini 3.8 Live Extended Thinking

    Osobny model głosowy Gemini, który przetwarza złożone prośby w tle, podtrzymując rozmowę.

    Otwórz pełne porównanie
  6. Inworld Realtime TTS-2 vs GPT-Realtime-2.1

    Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.

    Otwórz pełne porównanie
  7. Inworld Realtime TTS-2 vs Gemini 3.1 Flash Live Preview

    Model Google typu audio-to-audio umożliwiający dialog o niskim opóźnieniu ze świadomością multimodalną, myśleniem, uziemieniem wyszukiwania i wywoływaniem funkcji.

    Otwórz pełne porównanie
  8. Inworld Realtime TTS-2 vs Eleven v3 Conversational

    Ekspresyjny model syntezy mowy ElevenLabs w czasie rzeczywistym zapewniający naturalny dialog, dostarczanie emocji, znaczniki audio i ponad 70 języków.

    Otwórz pełne porównanie
  9. Inworld Realtime TTS-2 vs Grok Voice Think Fast 2.0

    Obecny model zamiany mowy na mowę SpaceXAI w czasie rzeczywistym dla agentów konwersacyjnych w czasie krótszym niż sekunda z dostępem do narzędzi.

    Otwórz pełne porównanie