Wszystkie modele
OpenAI

GPT-Realtime-2.1

Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu.

Przegląd w prostym języku angielskim

Czym właściwie jest GPT-Realtime-2.1

GPT-Realtime-2.1 jest przeznaczony do rozmów na żywo, podczas których model musi słuchać, mówić, postępować zgodnie z instrukcjami i wywoływać narzędzia w jednej sesji w czasie rzeczywistym. OpenAI wyróżnia się ulepszoną obsługą zakłóceń, ciszy, szumów i obsługi alfanumerycznej w porównaniu z poprzednią wersją.

Opłaty za dźwięk, tekst i obrazy są rozliczane w różnych klasach tokenów. Realistyczny budżet wymaga zatem wykorzystania wykorzystania pełnych rozmów, a nie prostej konwersji z samych minut audio.

Dobre dopasowanie do

  • Agenci głosowi klientów lub pracowników korzystający z narzędzi
  • Multimodalni asystenci w czasie rzeczywistym
  • Stosy agentów natywnych OpenAI

Porównanie kategorii

Fakty, które mają znaczenie w przypadku modeli głos

Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.

Podstawa ceny
Audio 32 $ wejścia · 64 $ wyjścia / 1 milion tokenówCena oparta na tokenach, znakach lub minutach dla podanej trasy dostępu.
Tryb interakcji
Zamiana mowy na mowę w kontekście tekstu/obrazuZachowanie polegające na zamianie mowy na mowę, audio na dźwięk lub strumieniowej zamianie tekstu na mowę.
Opublikowane opóźnienie
NieopublikowanePomiar opublikowany przez dostawcę z podanymi wyłączeniami; nie jest to test Cody.
Języki
Wielojęzyczny; dokładna lista nie została tutaj opublikowanaZakres języka udokumentowany przez dostawcę lub wyraźny, niepublikowany znacznik.
Narzędzia i kontrola
Wywoływanie funkcji i konfigurowalne rozumowanieNatywne wywoływanie funkcji, wnioskowanie lub funkcje kontroli mowy.
Kontekst lub limit wejściowy
Wejście 128 tys. · Maks. moc wyjściowa 32 tysUdokumentowany limit tokenów lub znaków, jeśli ma to znaczenie.

Dostęp do API i dostawcy

Gdzie zdobyć GPT-Realtime-2.1

Dostępność

Regiony i etap dostępu

Dostępne za pośrednictwem interfejsu API czasu rzeczywistego OpenAI w obsługiwanych krajach i terytoriach.

Bezpośredni dostęp następuje po liście obsługiwanych krajów OpenAI.

Sprawdź dostępność na żywo

Dane i szkolenia

Trasa ma znaczenie.

OpenAI mówi, że zawartość interfejsu API nie jest domyślnie używana do szkolenia. Domyślne dzienniki monitorowania nadużyć mogą być przechowywane do 30 dni, a kwalifikujące się organizacje mają dostęp do dodatkowych kontroli.

Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.

Przeczytaj politykę dostawcy

Często zadawane pytania

Często zadawane pytania dotyczące GPT-Realtime-2.1

Co to jest GPT-Realtime-2.1?

Model wnioskowania mowy na mowę OpenAI w czasie rzeczywistym dla agentów głosowych korzystających z narzędzi, którzy również potrzebują kontekstu tekstowego i obrazu. GPT-Realtime-2.1 jest przeznaczony do rozmów na żywo, podczas których model musi słuchać, mówić, postępować zgodnie z instrukcjami i wywoływać narzędzia w jednej sesji w czasie rzeczywistym. OpenAI wyróżnia się ulepszoną obsługą zakłóceń, ciszy, szumów i obsługi alfanumerycznej w porównaniu z poprzednią wersją.

Kiedy wypuszczono GPT-Realtime-2.1?

Dostawca nie publikuje jasnej daty wydania GPT-Realtime-2.1 w materiale źródłowym recenzowanym przez Cody.

Gdzie mogę uzyskać dostęp do GPT-Realtime-2.1?

Dostępne za pośrednictwem interfejsu API czasu rzeczywistego OpenAI w obsługiwanych krajach i terytoriach. Drogi dostępu wymienione w tym przewodniku to OpenAI.

Ile kosztuje GPT-Realtime-2.1?

Wejście audio za 32 USD · Wyjście audio za 64 USD / 1 milion tokenów. Tekst to 4 USD na wejściu i 24 USD na milion tokenów; wkład obrazu wynosi 5 USD za milion tokenów. Szybkość wprowadzania danych w pamięci podręcznej jest różna.

Gdzie jest dostępny GPT-Realtime-2.1?

Dostępne za pośrednictwem interfejsu API czasu rzeczywistego OpenAI w obsługiwanych krajach i terytoriach. Bezpośredni dostęp następuje po liście obsługiwanych krajów OpenAI.

Czy moje dane API GPT-Realtime-2.1 są wykorzystywane do szkolenia?

OpenAI mówi, że zawartość interfejsu API nie jest domyślnie używana do szkolenia. Domyślne dzienniki monitorowania nadużyć mogą być przechowywane do 30 dni, a kwalifikujące się organizacje mają dostęp do dodatkowych kontroli. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.