Wszystkie artykuły
Sztuczna inteligencja w czasie rzeczywistym

Porównanie agentów połączeń telefonicznych AI: opóźnienia, wykrywanie skrętu i przerwy

Dlaczego każdy opublikowany test porównawczy nie jest zgodny z tym, ile naprawdę kosztuje wykrywanie skrętów i jak samemu to zmierzyć Oto dwa fakty na temat agentów telefonicznych AI w 2026 r., oba dobrze udokumentowane, prawdziwe i najwyraźniej niezgodne. Fakt pierwszy: Vapi celuje w p50 poniżej… Czytaj więcej »

Przez Om KamathCzas czytania: 15 minuty
Dwie fale dźwiękowe skierowane ku sobie w ciemnym polu ze świecącą, zmieniającą się szczeliną pomiędzy nimi

Dlaczego każdy opublikowany test porównawczy nie zgadza się z tym, ile naprawdę kosztuje wykrywanie skrętów i jak to zmierzyć samodzielnie

Oto dwa fakty na temat agentów telefonicznych AI w 2026 r., oba dobrze udokumentowane, prawdziwe i najwyraźniej niezgodne.

Fakt pierwszy: Vapi ma na celu p50 poniżej 500 ms. Retell publikuje około 600 ms. Strona główna Bland podaje 400 ms. Wewnętrzne testy Twilio ConversationRelay zgłaszają medianę 491 ms.

Fakt drugi: niezależny test porównawczy, w ramach którego łączyno te platformy za pośrednictwem rzeczywistych linii telefonicznych i mierzono na podstawie nagranego dźwięku, wykazał, że mediany wynoszą od 1296 ms do 1740 ms — czyli każda platforma jest od dwóch do czterech razy wolniejsza niż jej własne opublikowane wartości.

Nikt nie kłamie. Mierzą różne rzeczy, w różnych transportach, przy różnych założeniach dotyczących tego, gdzie zaczyna się zegar. Dopóki nie zrozumiesz dokładnie, co opisuje każda liczba, nie możesz użyć żadnego z nich do wybrania platformy.

W tym artykule poważnie potraktowano problem pomiaru, zestawiono opublikowane testy porównawcze wraz z dołączoną do nich metodologią, wyjaśniono, dlaczego wykrywanie skrętów – a nie model językowy – jest obecnie zmienną dominującą, a kończy się protokołem tworzenia liczb, któremu można naprawdę zaufać.

Gdzie płynie czas

Włącz głos w rozmowie telefonicznej, to bieg sztafetowy na pięciu nogach, w którym pałeczka zostaje upuszczona pomiędzy każdą parę biegaczy.

Abstrakcyjny, skumulowany pasek osi czasu przedstawiający pięć segmentów o nierównym opóźnieniu przekraczających linię progową

Zwrot głosu to sztafeta na pięciu etapach. Jeden z nich jest zawsze znacznie szerszy od pozostałych. Obraz wygenerowany za pomocą obrazu GPT 2.

Scena Wspólnie zlokalizowany stos Typowy zszyty stos
Sieć / SIP 45 ms 150 ms
Zamiana mowy na tekst 100 ms 225 ms
Wnioskowanie LLM 225 ms 650 ms
Zamiana tekstu na mowę 80 ms 185 ms
Razem 450 ms 1210 ms

Dwie obserwacje. LLM dominuje w obu kolumnach — dlatego przekierowanie zwykłej konwersacji do małego, szybkiego modelu i eskalacja tylko wtedy, gdy naprawdę potrzebne jest rozumowanie, jest zmianą o największej dźwigni dostępną dla większości zespołów. A przerwa między kolumnami wynosząca 760 ms nie wpływa na jakość modelu. Chodzi o położenie geograficzne, liczbę przeskoków i liczbę sieci różnych dostawców, przez które przechodzi dźwięk.

W tabeli pominięto etap, który zwykle kosztuje najwięcej: podjęcie decyzji, że rozmówca skończył mówić. Dzieje się tak przed uruchomieniem przekaźnika, a źle skonfigurowany próg punktu końcowego może spowodować większe opóźnienie niż cały potok poniżej.

Benchmarki wraz z dołączoną metodologią

Cztery niezależne badania opublikowały dane liczbowe dla tych platform w 2026 r. Nie zgadzają się z nimi, czasami całkowicie odwracając rankingi. Oto oni z metodologią, która je wyprodukowała, ponieważ jest to metodologia jest wynik.

Badanie 1: Prawdziwe rozmowy telefoniczne mierzone na podstawie nagranego dźwięku

Najbardziej przejrzysty metodologicznie publiczny test porównawczy nawiązał połączenie z agentem każdej platformy podczas prawdziwej rozmowy telefonicznej za pomocą robota wywołującego czytającego ustalony scenariusz, zarejestrował obie strony połączenia na jednym zegarze i zlokalizował granice mowy w nagraniu za pomocą Silero VAD z udoskonaleniem energetycznym. Nie użyto żadnych znaczników czasu zgłoszonych przez platformę. 2078 użytecznych zakrętów na pięciu platformach; punkt końcowy standaryzowany na 0,1 s, jeśli jest konfigurowalny. Metryką jest czas do pierwszego bajtu audio.

Platforma p50 s. 95 Stosunek ogona Użyteczne zakręty
Telnyx 1296 ms 1856 ms 1.43× 419/432
ElevenLabs 1424 ms 1768 ms 1.24× 429/432
Bland AI 1520 ms 2248 ms 1.48× 429/432
Vapi 1558 ms 2008 ms 1.29× 382/432
Retell AI 1740 ms 2259 ms 1.30× 419/430

Zwróć uwagę na ostatnią kolumnę. Vapi odrzucił 50 zwojów — ponad dziesięć procent — w porównaniu do kilku w przypadku pozostałych. Platforma, która czasami w ogóle nie wykonuje użytecznego skrętu, mówi ci coś, czego nie wychwytuje żaden percentyl opóźnienia.

Badanie 2: Połączenia produkcyjne, komunikacja głosowa

W badaniu przeprowadzonym w marcu 2026 r. przeprowadzono 500 rozmów produkcyjnych na każdą platformę, mierząc wymianę głosu na głos.

Platforma Mediana s. 95
Retell 680 ms 920 ms
Vapi 720 ms 1050 ms
Bland 850 ms 1180 ms

Retell kończy jako ostatni w Badaniu 1 i jako pierwszy w Badaniu 2. Ta sama platforma, ten sam rok, odwrotne wnioski. To jest najważniejsza rzecz w tym artykule: przy obecnym stanie techniki metoda pomiaru przesuwa wynik w większym stopniu niż platforma.

Badanie 3: Naprawiono stos stron trzecich

Inne podejście — utrzymaj modele na stałym poziomie (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) i zmierz pełny obrót, izolując warstwę orkiestracji:

Platforma Pełny obrót, p50
ElevenLabs 1,73 s
Retell 1,96 s
Vapi 2,34 s

Każda liczba tutaj znacznie przewyższa tę, którą reklamuje jakikolwiek dostawca, ponieważ pełny obrót na stałym stosie innej firmy obejmuje części wykluczone przez dostawców, gdy podają własną zoptymalizowaną ścieżkę.

Badanie 4: Sama noga nośna

Wreszcie, test przeprowadzony w czerwcu 2026 r., obejmujący 120 połączeń wychodzących na operatora, izolował czas podróży w obie strony na odcinku telefonicznym:

Przewoźnik p50 RTT p95 RTT
Telnyx 71 ms 118 ms
Twilio 89 ms 161 ms
Vonage 94 ms 152 ms

Przydatny kontekst: przewoźnik wnosi wkład poniżej 100 ms. Jeśli Twój agent czuje się powolny, przyczyną prawie nigdy nie jest sieć telefoniczna.

Cztery różne przyrządy pomiarowe obejmujące różne rozpiętości tego samego świecącego paska

Jeden obiekt, cztery instrumenty, cztery odczyty. Każda wartość opóźnienia podana w tym artykule jest dokładna; po prostu nie mierzą tej samej rozpiętości. Obraz wygenerowany za pomocą obrazu GPT 2.

Jak czytać wszystkie cztery razem

Typ numeru Co zawiera Co kryje Zaufaj temu
Roszczenie dostawcy p50 Zoptymalizowana ścieżka, często WebSocket, a nie telefonia Oczekiwanie na punkt końcowy, noga przewoźnika, ogon Surowa jakość architektury
Opóźnienie komponentu (np. 75 ms TTS) Czas syntezy jednego modelu Wszystko inne Wybór tego komponentu
Nagrany dźwięk TTFAB Wszystko, co słyszy rozmówca Nic — ale obejmuje koszty nagrywania Ranking prawdziwego doświadczenia
Pełny obrót ze stałym stosem Napowietrzna orkiestracja, izolowana Dostrojone modele każdej platformy Porównanie warstw orkiestracji
Przewoźnik RTT Tylko transport telefoniczny Agent całkowicie Wybór przewoźnika

Oraz progi, które mają znaczenie percepcyjne: przełączanie konwersacji między ludźmi trwa około 200 ms; po upływie około 800 ms osoba dzwoniąca rejestruje opóźnienie; po około 1500 ms odczytuje się, że jest uszkodzony. Należy zauważyć, że większość wartości p95 w Badaniu 1 znajduje się po złej stronie drugiego progu. Mediana określa, jak wygląda Twoje demo. P95 jest tym, co czują Twoi rozmówcy.

Wykrywanie skrętu to prawdziwy wyróżnik

Każda platforma powyżej może wywoływać modele klasy GPT i przesyłać strumieniowo głosy klasy ElevenLabs. To są towary. Tym, co odróżnia czynnik naturalny od wyczerpującego, jest część decydująca kiedy mówići w tym właśnie tkwią obecnie prawdziwe różnice inżynieryjne.

Podatek końcowy

Naiwne podejście czeka na ciszę. Ustaw próg na 800 ms, a do każdej odpowiedzi przed rozpoczęciem przetwarzania dodasz prawie pełną sekundę. Ponad dziesięciominutowe połączenie, które jest prawdziwym martwym powietrzem, opłacane wartością konfiguracyjną. Obniż próg, a agent zacznie przerywać każdemu, kto zatrzyma się, aby pomyśleć – czyli wszystkim w połowie numeru konta.

Stos, który to naprawia

Wykrywanie skrętu to najmniej efektowna i najważniejsza część agenta głosowego. Własny opis semantycznego modelu końca wypowiedzi LiveKit jest najjaśniejszym krótkim wyjaśnieniem, dlaczego limit czasu ciszy nie jest wystarczający.
Warstwa Co to robi Reprezentatywne wdrożenia
VAD Klasyfikuje każdą ramkę audio jako mowę lub nie Silero VAD — niemal uniwersalna wartość domyślna
Punkt końcowy Obserwuje strumień transkrypcji pod kątem sygnałów zakończenia Konfiguracja punktu końcowego dostawcy STT
Semantyczne wykrywanie skrętu Przewiduje, że zakończenie straci znaczenie, może zatwierdzić przed ciszą Detektor skrętu LiveKit (Dostrajanie Qwen2.5-0.5B, wnioskowanie o procesorze, 14 języków); Pipecat Inteligentny zwrot
Rozmowy STT Rozpoznawanie i odgrywanie ról w jednym modelu Deepgram Flux; Tavus Sparrow-1

Flux Deepgram, ogólnie dostępny w formie wielojęzycznej od 29 kwietnia 2026 r. w dziesięciu językach z przełączaniem języka w trakcie rozmowy, raportuje medianę wykrycia końca tury przy 260 ms przy p95 po 1,5 s, udostępnia konfigurowalny eot_threshold aby zamienić opóźnienie na dokładność i raportuje opóźnienie reakcji środka tnącego na poziomie 200–600 ms w porównaniu z konwencjonalnym STT-plus-VAD. Tavus zgłasza swój model przepływu Sparrow-1 przy średnim opóźnieniu przewidywania minimalnego wynoszącym 55 ms.

Mówiąc konkretnie: przejście z limitu czasu ciszy wynoszącego 800 ms na semantyczny detektor skrętu może zaoszczędzić więcej opóźnień niż jakakolwiek inna optymalizacja na tej stronie razem wzięta. Jeśli robisz zakupy z opóźnieniem, zapytaj, jakiego wykrywania skrętów używa platforma i czy możesz to zmienić – ta odpowiedź pozwala przewidzieć Twoje wrażenia lepiej niż jakikolwiek opublikowany p50.

Obsługa przerwań: polityka, a nie przełącznik

Wtrącenie jest zwykle eksponowane jako jedna wartość logiczna. To niewłaściwa postać problemu i jest to najczęstszy powód, dla którego agent, który osiąga dobre wyniki w zakresie opóźnień, nadal czuje się niewłaściwie, rozmawiając z nim.

Powodem jest to, że dźwięk rozmówcy przychodzącego nie jest jedną rzeczą. Przydatna taksonomia dzieli to na sześć sposobów, z których każdy wymaga innego zachowania:

Klasa wejściowa Przykład Prawidłowe zachowanie Sygnał awarii
Prawdziwa korekta „Nie, piątek” Zatrzymaj się, zaakceptuj zwrot, zachowaj kontekst zadania Rozmówca powtarza tę samą poprawkę
Kanał tylny „tak”, „mm-hm” Mów dalej; nie traktuj jako zamiaru Agent anuluje swoją odpowiedź i resetuje się
Hałas w tle Klawiatura, ruch, drugi głos Kontynuuj; zarejestruj fałszywe przerwanie Odtwarzanie zatrzymuje się bez transkrypcji rozmówcy
DTMF Osoba dzwoniąca naciska 2 podczas przeglądania menu Trasuj cyfrowo, a nie transkrypcyjnie Cyfra ignorowana lub traktowana jako mowa
Długa pauza elementu Wstrzymaj w połowie numeru konta Czekać; nie reaguj wcześniej Agent przerywa, zanim jednostka zakończy swoją wypowiedź
Eskalacja „Chcę kogoś” Zatrzymaj się i natychmiast przenieś Agent się kłóci

Porażką, która najszybciej zabija zaufanie, jest fałszywy przystanek: rozmówca mówi „OK”, gdy agent jest w połowie zdania, agent zatrzymuje się, a następnie traktuje „OK” jako nowe pytanie. W przypadku jednego połączenia jest to usterka. W przypadku tysięcy połączeń jest to wymierny spadek współczynnika realizacji i nie jest widoczny w żadnym wskaźniku opóźnienia.

Właściwa struktura to polityka dotycząca typu wiadomości. Pozdrowienia z możliwością przerwania po okresie karencji; menu akceptujące DTMF i mowę; podmiot przechwytujący pacjenta; ujawnienia prawne, dotyczące zgód i płatności nieprzerywalny; możliwość natychmiastowego anulowania wypełniaczy oczekujących na narzędzie; zamiar przeniesienia ludzi jest zawsze honorowany.

I oprzyrząduj to. Cztery zdarzenia, które warto rejestrować w każdej turze, to kandydat na przerwanie, decyzja i wersja polityki, która je spowodowała, pozycja przywracania i potwierdzone fałszywe alarmy. Śledź współczynnik fałszywych i nieodebranych przerwań jako osobne pulpity nawigacyjne — poruszają się w przeciwnych kierunkach, a ich uśrednianie ukrywa oba. Dostępny jest otwarty pakiet scenariuszy do testowania wtrącenia GitHub który działa na Vapi, Retell, Bland, Pipecat i LiveKit na własnym serwerze.

Platformy

Vapi

Vapi to najbardziej elastyczna warstwa orkiestracji: przynieś własne STT, LLM, TTS i telefonię, zamień dowolne z nich i dostrój potok. Wyceniony na około 0,05 USD/min za orkiestrację, przy czym każdy podstawowy dostawca jest rozliczany osobno. Niezależne testy wykazały, że dostrojony stos wynosi medianę 500–700 ms, a domyślny potok jest znacznie wolniejszy. Wybierz tę opcję, jeśli chcesz kontrolować każdy komponent i jesteś przygotowany na samodzielne dostrajanie; elastyczność jest realna, podobnie jak obciążenie konfiguracyjne.

Retell AI

Retell to zarządzany stos z naciskiem na przepływy ustrukturyzowanego dialogu i zgodność z przepisami przedsiębiorstwa. Około 0,055 USD/min za infrastrukturę głosową, płatność zgodnie z rzeczywistym użyciem od około 0,07 USD/min. W jednym badaniu zgłoszono około 600 ms po wyjęciu z pudełka, a w innym ostatnie miejsce – patrz sekcja powyżej. Wybierz tę opcję, jeśli potrzebujesz obsługiwanego zarządzanego potoku z silną kontrolą przepływu, a nie zestawu komponentów.

Bland AI

Bland korzysta z pakietowych cen — zamiana mowy na tekst, LLM, zamiana tekstu na mowę i telefonia w ramach jednej stawki 0,09–0,14 USD/min — i jest stworzona specjalnie z myślą o dużych ruchach wychodzących. Mierzony około 700–900 ms, w zależności od złożoności ścieżki. Pakiet jest naprawdę łatwiejszy do rozważenia z komercyjnego punktu widzenia; kompromisem jest mniejsza kontrola nad każdą warstwą.

ElevenLabs Agents

Zbudowany na bazie najlepiej ocenianej syntezy głosu w tej kategorii, której model Flash syntezuje w około 75 ms. Agenci wystawiają rachunki od około 0,08 USD/min w przypadku rocznych planów biznesowych i około 0,10 USD/min w przypadku wersji Creator i Pro, z tokenami LLM przekazywanymi osobno i pakietami minut na każdym poziomie. SIP trunkingowy łączy istniejącą telefonię — Twilio, Telnyx, samoobsługową centralę PBX — z uwierzytelnianiem szyfrowanym lub ACL oraz narzędziem do przesyłania na numer obsługującym style konferencyjne, ślepe i SIP REFER. Warto zauważyć, że uzyskał on najwęższy współczynnik końcowy w teście porównawczym nagranego dźwięku, który ma większe znaczenie niż dobra mediana.

Telnyx

Cechą wyróżniającą jest integracja pionowa: Telnyx jest właścicielem sieci nośnej, przez którą przesyłany jest dźwięk, a budżet na architekturę wynoszący 450 ms pochodzi z kolokacji stosu, a nie z szybszych modeli. Odnotowała najniższą medianę w badaniu dotyczącym nagrań audio i najniższy współczynnik RTT nośnej w badaniu dotyczącym transportu. Wybierz tę opcję, gdy kwestia telefonii jest sprawą najwyższej klasy.

OpenAI Realtime

Nie platforma, ale model i coraz częściej rzecz, na której budowane są platformy. The API czasu rzeczywistego obsługuje trzy transporty — WebRTC dla przeglądarek, WebSocket dla serwerów i SIP do kierowania prawdziwej rozmowy telefonicznej bezpośrednio do sesji. Jest to natywna zamiana mowy na mowę: wejście audio, wyjście audio, brak wąskiego gardła w tekście pośrednim i prozodia zachowana przez całą turę. Ceny opierają się na tokenach, a nie na minutę, co zapewnia szeroki efektywny zakres w zależności od tego, jak zdyscyplinowany jesteś w kontekście i buforowaniu. Wybierz tę opcję, jeśli chcesz mieć najniższe osiągalne opóźnienie skrętu i możesz zbudować otaczającą orkiestrację; unikaj tego, gdy musisz rejestrować, kontrolować lub ograniczać rozumowanie pośrednie, ponieważ nie ma żadnego tekstu do sprawdzenia.

Synthflow, Twilio ConversationRelay i reszta

Synthflow kosztuje około 0,09 USD/min za silnik głosowy z kreatorem bez kodu, skierowanym raczej do operatorów niż inżynierów. Twilio ConversationRelay dołącza agenta AI do istniejącej infrastruktury telefonicznej Twilio, z wewnętrznie raportowanymi czasami 491 ms p50 i 713 ms p95 — atrakcyjne, jeśli Twoja infrastruktura połączeń już tam istnieje.

Zbuduj to sam: agenci Pipecat i LiveKit

Obydwa są oprogramowaniem typu open source i oba są naprawdę opłacalne w produkcji.

Pipecat, zapoczątkowane przez Daily, modeluje agenta głosowego jako potok procesorów, przez który przepływa dźwięk i tekst, z bardzo dużą biblioteką wtyczek i niemal codziennym rozwojem. Pipecat Cloud osiągnął ogólną dostępność w 2026 r. po wersji beta z udziałem ponad tysiąca zespołów, więc zarządzana ścieżka istnieje, jeśli chcesz.

Agenci LiveKit jest zbudowany na serwerze multimediów WebRTC firmy LiveKit, a jego cechą wyróżniającą jest model pomieszczenia: agent dołącza jako uczestnik wraz z użytkownikami, co sprawia, że ​​scenariusze z wieloma uczestnikami są natywne, a nie przykręcane. Jeden z zespołów publicznie zgłosił przebudowę agenta telefonicznego z Pipecat na agenty LiveKit, gdy klient skalował się z 20 do 400 jednoczesnych połączeń.

Własny hosting może wynieść znacznie poniżej 0,05 USD/min przy wolumenie. Handlujesz opłatami za platformę za infrastrukturę, pracę na wezwanie i dostrajanie opóźnień – co jest dobrą transakcją na dużą skalę i złą, zanim znajdziesz produkt pasujący do rynku.

Ile to właściwie kosztuje

Najczęstszym błędem budżetowania w tej kategorii jest porównanie stawki obejmującej tylko platformę ze stawką pakietową.

Platforma Kurs główny Co to obejmuje Realistyczne all-in
Vapi 0,05 USD/min Tylko orkiestracja ~ 0,25–0,33 USD/min po dodaniu STT, LLM, TTS i telefonii
Retell 0,055 USD/min Infrastruktura głosowa Od ~0,07 USD/min, płatność zgodnie z rzeczywistym użyciem
Bland 0,09–0,14 USD/min Wszystko w pakiecie Mniej więcej stawka podstawowa
Synthflow 0,09 USD/min Silnik głosowy Plus LLM i telefonia
ElevenLabs Agents 0,08–0,10 USD/min Platforma + głos Plus tokeny LLM przeszły
OpenAI Realtime Oparty na tokenach Tylko model Bardzo zmienna; Dominuje buforowanie i dyscyplina kontekstowa
Własny hosting (Pipecat / LiveKit) Infrastruktura Nic w pakiecie Może spaść poniżej 0,05 USD/min przy objętości plus czas inżynierii

Komponentowe punkty odniesienia do tworzenia własnych szacunków: telefonia około 0,014 USD/min, strumieniowe przesyłanie mowy na tekst około 0,008 USD/min, premium TTS około 0,05 USD/min i mały szybki LLM około 0,01 USD/min. Na całym rynku stawki za pełne obciążenie w 2026 r. będą się wahać w przybliżeniu sześciokrotnym zakresie, od około 0,05 USD/min w najbardziej agresywnych planach samoobsługowych do około 0,31 USD/min w warstwach premium dla przedsiębiorstw.

Jedna uwaga strukturalna: buforowanie podpowiedzi nie jest błędem zaokrąglania w agencie głosowym. Podpowiedź systemowa — osobowość, poręcze, reguły biznesowe, wiedza — jest identyczna przy każdym połączeniu. Dane wejściowe buforowane w modelach czasu rzeczywistego są wyceniane jako niewielki ułamek standardowych danych wejściowych. Włączenie buforowania często zmienia koszt modelu o rząd wielkości i jest to pierwsza rzecz, którą należy sprawdzić, zanim ktokolwiek zaproponuje przejście na gorszy model w celu zaoszczędzenia pieniędzy.

Zgodność nie jest tutaj opcjonalna

Agenci telefoniczni niosą ze sobą ryzyko regulacyjne, którego nie mają agenci przeglądarkowi.

W Stanach Zjednoczonych FCC Orzeczenie deklaratywne z lutego 2024 r potwierdziło, że głosy generowane przez sztuczną inteligencję są „sztucznym lub nagranym głosem” w ramach TCPA. Wiąże się to z wymogami dotyczącymi zgody na połączenia z liniami bezprzewodowymi i stacjonarnymi, obowiązkami dotyczącymi identyfikacji i ujawniania informacji oraz możliwością rezygnacji – z ustawowymi odszkodowaniami od 500 dolarów za naruszenie do 1500 dolarów w przypadku umyślnych naruszeń. Oczekuje się, że dalsze ustalanie przepisów FCC dotyczących zaproszeń generowanych przez sztuczną inteligencję zakończy się pod koniec 2026 r. lub na początku 2027 r., a powszechnie oczekiwanym rezultatem jest wyraźny wymóg identyfikacji sztucznej inteligencji na początku zaproszenia oraz język zgody, w którym konkretnie wymieniona jest sztuczna inteligencja.

W UE art. 50 ustawy o sztucznej inteligencji obowiązuje od 2 sierpnia 2026 r. i wymaga, aby ludzie byli informowani o interakcji z sztuczną inteligencją. Na szczeblu stanowym w USA ustawa Colorado AI Act wchodzi w życie w 2026 r. i może klasyfikować większość tej kategorii jako stwarzającą wysokie ryzyko.

Praktyczne podejście jest proste i nic Cię nie kosztuje: ujawnij to na początku, zachowaj zapis zgody, natychmiast honoruj ​​rezygnację i zapewnij zawsze możliwość przeniesienia danych przez człowieka. Każdy z nich jest tańszy w budowie teraz niż w modernizacji.

Dokonaj porównania samodzielnie

Biorąc pod uwagę, że dwa wiarygodne badania odwróciły te same rankingi, jedyne liczby, na podstawie których powinieneś działać, to twoje własne. Ten protokół zajmuje jeden dzień.

  1. Zbuduj stały skrypt. Dwadzieścia do trzydziestu tur obejmujących rzeczywisty przypadek użycia, w tym co najmniej jeden długi numer, jedna korekta i jedna prośba o człowieka.
  2. Nagraj obie nogi na jednym zegarze. Nie używaj czasów zgłaszanych przez platformę; wykluczają części ścieżki, którą doświadcza rozmówca. Uchwyć rzeczywisty dźwięk połączenia.
  3. Zmierz czas do pierwszego bajtu audio od końca mowy rozmówcy, używając VAD na nagraniu, a nie na strumieniu zdarzeń dowolnego dostawcy.
  4. Standaryzuj punkty końcowe na każdej testowanej platformie lub testujesz konfigurację, a nie architekturę.
  5. Zgłosić oddzielnie p50 i p95, plus stosunek ogona i liczba tur, które musiałeś odrzucić. Platforma, która czasami nic nie produkuje, jest gorsza niż platforma, która jest równomiernie nieco wolniejsza.
  6. Uruchom sześć klas przerywania z powyższej tabeli jako oddzielne przypadki testowe i niezależnie oceniaj fałszywe przystanki i pominięte przystanki.
  7. Testuj pod obciążeniem. Każda platforma wygląda dobrze podczas jednego połączenia. Współbieżność ma miejsce, gdy mediany ulegają degradacji, a ogony eksplodują.
  8. Sprawdź na złym połączeniu i z telefonu komórkowego w jadącym samochodzie, a nie z biurka po światłowodzie.

Konkluzja

Platformy w tej kategorii są bliżej siebie, niż sugeruje ich marketing, a różnica między dowolnymi dwoma z nich jest mniejsza niż różnica między dobrze i źle dostrojonym wdrożeniem któregokolwiek z nich.

Trzy rzeczy są ważniejsze od wybranego dostawcy. Wykrywanie skrętu, ponieważ jest to największy możliwy do odzyskania fragment opóźnienia i różnica między agentem, który wydaje się obecny, a agentem, który czuje się jak drzewo telefoniczne. Polityka przerywania, bo od niej zależy, czy dzwoniący zaufa danej rzeczy już po pierwszym nieporozumieniu. I opóźnienie końcowe, ponieważ p95 jest tym, czego faktycznie doświadczają Twoi klienci i mniej więcej w tym miejscu się rozłączają.

Każdy sprzedawca pokaże Ci medianę. Zapytaj o p95, zapytaj, jak został zmierzony, a następnie sam go zmierz.

Twój pierwszy asystent jest w zasięgu kilku minut

Wykorzystaj swoją wiedzę biznesową w praktyce.

Zacznij od darmowego konta Cody. Dodaj swoją treść, zbuduj asystenta i udostępnij pierwszą przydatną odpowiedź już dziś.