모든 기사
실시간 AI

AI 전화 통화 에이전트 비교: 지연 시간, 회전 감지 및 중단

게시된 모든 벤치마크가 일치하지 않는 이유, 회전 감지에 실제로 비용이 발생하는 부분 및 이를 직접 측정하는 방법 다음은 2026년 AI 전화 에이전트에 대한 두 가지 사실입니다. 두 가지 모두 잘 알려진 사실이고 둘 다 사실이며 분명히 호환되지 않습니다. 사실 1: Vapi는 p50 이하를 목표로 합니다... 더 읽기 »

작성자: Om Kamath독서시간: 12
어두운 필드에서 서로 마주보는 두 개의 오디오 파형 사이에 빛나는 회전 간격이 있습니다.

게시된 모든 벤치마크가 일치하지 않는 이유, 회전 감지에 실제로 비용이 드는 부분, 직접 측정하는 방법

다음은 2026년 AI 전화 에이전트에 관한 두 가지 사실입니다. 둘 다 출처가 확실하고 사실이며 분명히 호환되지 않습니다.

사실 1: Vapi는 500ms 미만의 p50을 목표로 합니다. Retell는 대략 600ms를 게시합니다. Bland 홈페이지에는 400ms라고 나와 있습니다. Twilio의 내부 ConversationRelay 테스트에서는 중앙값 491ms를 보고했습니다.

사실 2: 실제 전화선을 통해 이러한 플랫폼에 전화를 걸고 녹음된 오디오에서 측정한 독립적인 벤치마크에서는 중앙값이 1,296ms에서 1,740ms 사이인 것으로 나타났습니다. 모든 단일 플랫폼은 자체 게시된 수치보다 2~4배 느립니다.

아무도 거짓말을 하지 않습니다. 그들은 시계가 시작되는 위치에 대해 서로 다른 가정을 가지고 다양한 전송을 통해 다양한 것을 측정하고 있습니다. 그리고 각 숫자가 무엇을 설명하는지 정확히 이해하기 전까지는 이를 사용하여 플랫폼을 선택할 수 없습니다.

이 기사는 측정 문제를 심각하게 다루고, 게시된 벤치마크를 방법론과 함께 나란히 놓고, 언어 모델이 아닌 회전 감지가 이제 주요 변수인 이유를 설명하고, 실제로 신뢰할 수 있는 숫자를 생성하기 위한 프로토콜로 끝납니다.

시간이 가는 곳

전화 통화 중 음성 켜기는 5개의 다리로 하는 릴레이 경주이며, 배턴은 모든 주자들 쌍 사이에 떨어집니다.

임계값 선을 넘는 5개의 서로 다른 지연 시간 세그먼트를 보여주는 추상 누적 타임라인 막대

보이스 턴은 5개 다리로 릴레이 경주를 하는 것입니다. 그 중 하나는 항상 다른 것보다 훨씬 넓습니다. GPT 이미지 2로 생성된 이미지.

무대 함께 배치된 스택 일반적인 스티치 스택
네트워크/SIP 45ms 150ms
음성-텍스트 100ms 225ms
LLM 추론 225ms 650ms
텍스트 음성 변환 80ms 185ms
합계 450ms 1,210ms

두 가지 관찰. LLM은 두 열을 모두 지배합니다. 따라서 일반적인 대화를 소규모 빠른 모델로 라우팅하고 추론이 실제로 필요한 경우에만 에스컬레이션하는 것이 대부분의 팀에서 사용할 수 있는 가장 영향력 있는 변화입니다. 그리고 열 사이의 760ms 간격은 모델 품질의 차이가 아닙니다. 이는 지역, 홉 수, 오디오가 통과하는 개별 공급업체의 네트워크 수입니다.

이 표에서 제외되는 것은 일반적으로 비용이 가장 많이 드는 단계입니다. 발신자가 통화를 마쳤다고 판단하는 단계입니다. 이는 릴레이가 시작되기 전에 발생하며 잘못 구성된 엔드포인트 임계값은 그 아래의 전체 파이프라인보다 더 많은 지연을 추가할 수 있습니다.

방법론이 첨부된 벤치마크

4개의 독립적인 연구에서는 2026년에 이러한 플랫폼에 대한 수치를 발표했습니다. 그들은 동의하지 않으며 때로는 순위를 완전히 뒤집기도 합니다. 여기에 그것들을 생산한 방법론이 있습니다. 이다 결과.

연구 1: 녹음된 오디오를 통해 측정된 실제 전화 통화

방법론적으로 가장 투명한 공개 벤치마크는 고정된 스크립트를 읽는 발신 로봇을 사용하여 실제 전화 통화를 통해 각 플랫폼의 에이전트에게 전화를 걸고, 단일 시계에 통화의 양쪽을 녹음하고, 에너지 개선이 적용된 Silero VAD를 사용하여 녹음에서 음성 경계를 찾았습니다. 플랫폼에서 보고된 타임스탬프가 사용되지 않았습니다. 5개 플랫폼에 걸쳐 2,078개의 사용 가능한 회전; 구성 가능한 경우 엔드포인트는 0.1초로 표준화됩니다. 측정항목은 첫 번째 오디오 바이트까지의 시간입니다.

플랫폼 p50 p95 꼬리 비율 사용 가능한 턴
Telnyx 1,296ms 1,856ms 1.43× 419/432
ElevenLabs 1,424ms 1,768ms 1.24× 429/432
Bland AI 1,520ms 2,248ms 1.48× 429/432
Vapi 1,558ms 2,008ms 1.29× 382/432
Retell AI 1,740ms 2,259ms 1.30× 419/430

마지막 열을 참고하세요. Vapi는 다른 턴에 비해 50턴(10% 이상)을 버렸습니다. 때때로 사용 가능한 회전을 전혀 생성하지 못하는 플랫폼은 지연 시간 백분위수가 캡처하지 못하는 것을 알려주는 것입니다.

연구 2: 생산 통화, 음성 대 음성

2026년 3월 연구에서는 플랫폼당 500건의 프로덕션 호출을 실행하여 음성 대 음성을 측정했습니다.

플랫폼 중앙값 p95
Retell 680ms 920ms
Vapi 720ms 1,050ms
Bland 850ms 1,180ms

Retell는 연구 1에서 꼴찌, 연구 2에서 1위를 차지했습니다. 같은 플랫폼, 같은 해, 반대 결론. 이것이 이 기사에서 가장 중요한 것입니다. 현재 기술 수준에서는 측정 방법이 플랫폼보다 결과를 더 많이 움직입니다.

연구 3: 타사 스택 수정

다른 접근 방식 - 모델(GPT-4.1, Deepgram Nova-3, ElevenLabs Flash)을 일정하게 유지하고 전체 회전을 측정하여 오케스트레이션 레이어를 분리합니다.

플랫폼 완전 회전, p50
ElevenLabs 1.73초
Retell 1.96초
Vapi 2.34초

여기에 있는 모든 숫자는 공급업체가 광고하는 것보다 훨씬 높습니다. 고정된 타사 스택을 완전히 전환하면 공급업체가 자체 최적화 경로를 인용할 때 제외하는 부품이 포함되기 때문입니다.

연구 4: 캐리어 다리만 사용

마지막으로, 통신업체당 120개의 아웃바운드 통화를 대상으로 한 2026년 6월 테스트에서는 전화 통신 구간의 왕복 시간을 격리했습니다.

캐리어 p50 RTT p95 RTT
Telnyx 71ms 118ms
Twilio 89ms 161ms
Vonage 94ms 152ms

유용한 컨텍스트: 이동통신사는 100ms 미만으로 기여합니다. 상담원이 느리다고 느낀다면 전화 네트워크가 원인이 아닐 가능성이 높습니다.

동일한 빛나는 막대의 서로 다른 범위를 브라케팅하는 4개의 서로 다른 측정 장비

하나의 물체, 네 개의 장비, 네 개의 판독값. 이 문서의 모든 대기 시간 수치는 정확합니다. 그들은 단순히 동일한 범위를 측정하지 않습니다. GPT 이미지 2로 생성된 이미지.

네 가지를 모두 함께 읽는 방법

숫자 유형 포함 내용 그것이 숨기는 것 그것을 믿으세요
공급업체 p50 소유권 주장 최적화된 경로, 종종 전화 통신이 아닌 WebSocket 엔드포인트 대기, 캐리어 레그, 테일 대략적인 아키텍처 품질
구성요소 지연 시간(예: 75ms TTS) 한 모델의 합성 시간 그 밖의 모든 것 해당 구성요소 선택
녹음된 오디오 TTFAB 발신자가 듣는 모든 것 없음 - 녹화 오버헤드가 포함됨 실제 경험 순위
고정 스택 완전 회전 오케스트레이션 오버헤드, 격리됨 각 플랫폼별로 튜닝된 모델 오케스트레이션 레이어 비교
캐리어 RTT 전화 통신 전용 에이전트가 전적으로 통신사 선택

그리고 지각적으로 중요한 임계값은 다음과 같습니다. 인간의 대화 핸드오프는 200ms에 가깝습니다. 대략 800ms가 지나면 발신자가 지연을 등록합니다. 대략 1,500ms가 지나면 깨진 것으로 읽힙니다. 연구 1의 대부분의 p95 수치는 두 번째 임계값의 잘못된 쪽에 있습니다. 중앙값은 데모의 느낌입니다. p95는 발신자가 느끼는 것과 같습니다.

회전 감지가 진정한 차별화 요소입니다

위의 모든 플랫폼은 GPT급 모델을 호출하고 ElevenLabs급 음성을 스트리밍할 수 있습니다. 그것들은 상품입니다. 자연적인 작용제와 지치는 작용제를 구분하는 것은 결정하는 부분입니다. 언제 말할 것인가, 이것이 바로 진정한 엔지니어링 차이가 존재하는 곳입니다.

종점세

순진한 접근 방식은 침묵을 기다립니다. 임계값을 800ms로 설정하면 처리가 시작되기 전에 모든 응답에 거의 1초가 추가됩니다. 10분이 넘는 통화는 구성 값으로 지불되는 정말 무감각한 통화입니다. 임계값을 낮추면 에이전트는 생각하기 위해 잠시 멈추는 모든 사람, 즉 계좌 번호 중간에 있는 모든 사람을 방해하기 시작합니다.

이를 해결하는 스택

회전 감지는 음성 에이전트에서 가장 매력이 덜하고 가장 중요한 부분입니다. LiveKit의 의미론적 발화 종료 모델에 대한 자체 연습은 침묵 시간 제한이 충분하지 않은 이유에 대한 가장 명확하고 간단한 설명입니다.
레이어 기능 대표적인 구현
VAD 각 오디오 프레임을 음성으로 분류합니다. Silero VAD — 거의 보편적인 기본값
엔드포인트 완료 신호에 대한 기록 스트림을 감시합니다. STT 공급자 엔드포인트 구성
의미론적 회전 감지 의미로부터 차례 완료를 예측하고, 침묵하기 전에 커밋할 수 있습니다. LiveKit 회전 감지기 (Qwen2.5-0.5B 미세 조정, CPU 추론, 14개 언어) Pipecat 스마트 턴
대화형 STT 하나의 모델에서 인식 및 차례 수행 Deepgram Flux; Tavus Sparrow-1

Deepgram의 Flux는 2026년 4월 29일부터 대화 중 언어 전환 기능을 통해 10개 언어에 걸쳐 다국어 형식으로 일반적으로 제공되며, 중간 회전 종료 감지 시간은 260ms, p95는 1.5초로 보고하고 구성 가능한 eot_threshold 정확성과 지연 시간을 교환하고 기존 STT-plus-VAD에 비해 에이전트 응답 지연 시간을 200~600ms 단축한다고 보고합니다. Tavus는 Sparrow-1 흐름 모델을 중앙값 바닥 예측 대기 시간 55ms로 보고합니다.

구체적으로 말하면, 800ms 무음 시간 초과에서 의미론적 회전 감지기로 전환하면 이 페이지의 다른 모든 최적화를 합친 것보다 더 많은 대기 시간을 절약할 수 있습니다. 지연 시간에 맞춰 쇼핑하는 경우 플랫폼이 사용하는 회전 감지와 이를 변경할 수 있는지 물어보세요. 그 대답은 게시된 어떤 p50보다 경험을 더 잘 예측합니다.

중단 처리: 토글이 아닌 정책

Barge-in은 일반적으로 하나의 부울로 노출됩니다. 이는 문제의 잘못된 형태이며, 대기 시간에서 좋은 점수를 받은 상담원이 여전히 대화하기에 잘못되었다고 느끼는 가장 일반적인 이유입니다.

그 이유는 수신 발신자 오디오가 한 가지가 아니기 때문입니다. 유용한 분류법은 이를 6가지 방식으로 나누며 각각 다른 동작을 요구합니다.

입력 클래스 올바른 행동 실패 신호
진정한 교정 "아니요, 금요일" 중지하고, 차례를 수락하고, 작업 컨텍스트를 유지하세요. 발신자가 동일한 수정을 반복함
백채널 "그래", "으흠" 계속 말하세요. 의도로 취급하지 않음 상담원이 답변을 취소하고 재설정합니다.
배경 소음 키보드, 트래픽, 두 번째 음성 계속하세요. 잘못된 방해를 기록하다 발신자 기록 없이 재생이 중지됩니다.
DTMF 발신자가 메뉴 중에 2번을 누름 성적표가 아닌 숫자로 전달 숫자가 무시되거나 음성으로 처리됨
긴 항목 일시중지 중간 계좌번호 일시중지 기다리다; 일찍 대답하지 마세요 엔터티가 완료되기 전에 에이전트가 중단됩니다.
에스컬레이션 "나는 사람을 원한다" 즉시 중지하고 환승 상담원이 주장함

신뢰를 가장 빨리 파괴하는 실패는 잘못된 중지입니다. 에이전트가 문장 중간에 있는 동안 호출자가 "알겠습니다"라고 말하고 에이전트는 중지한 다음 "알았어"를 새로운 질문으로 처리합니다. 한 번의 통화에서는 결함이 있습니다. 수천 건의 호출에 걸쳐 완료율이 측정 가능한 수준으로 감소하며 대기 시간 측정항목에는 표시되지 않습니다.

올바른 구조는 메시지 유형별 정책입니다. 유예 기간 후에는 인사말을 중단할 수 있습니다. DTMF 및 음성을 허용하는 메뉴; 개체 포획 환자; 법률, 동의 및 지불 공개 중단할 수 없는; 도구 대기 필러는 즉시 취소 가능합니다. 인간 이동 의도는 항상 존중됩니다.

그리고 그것을 도구화하세요. 매 턴마다 기록할 가치가 있는 4가지 이벤트는 중단 후보, 이를 생성한 결정 및 정책 버전, 복구 위치, 확인된 오탐입니다. 잘못된 중단 비율과 중단 누락 비율을 별도의 대시보드로 추적합니다. 서로 반대 방향으로 이동하고 평균을 계산하면 두 가지가 모두 숨겨집니다. 바지인 테스트를 위한 공개 시나리오 팩이 있습니다. GitHub 이는 Vapi, Retell, Bland, Pipecat 및 자체 호스팅 LiveKit에서 작동합니다.

플랫폼

Vapi

Vapi 가장 유연한 오케스트레이션 레이어입니다. 자신만의 STT, LLM, TTS 및 전화 통신을 가져와서 교환하고 파이프라인을 조정하세요. 오케스트레이션의 경우 분당 약 0.05달러로 가격이 책정되며 모든 기본 제공업체에 대해 별도로 요금이 청구됩니다. 독립적인 테스트를 통해 조정된 스택은 중앙값 500~700ms로 설정되고 기본 파이프라인은 의미 있게 느려집니다. 모든 구성 요소를 제어하고 튜닝을 소유할 준비가 된 경우 이 제품을 선택하십시오. 유연성은 현실적이며 구성 부담도 마찬가지입니다.

Retell AI

Retell 구조화된 대화 흐름과 기업 규정 준수에 중점을 둔 관리형 스택입니다. 음성 인프라의 경우 분당 약 $0.055이며 종량제 요금은 분당 약 $0.07입니다. 한 연구에서는 기본적으로 약 600ms가 보고되었고 다른 연구에서는 마지막 위치로 보고되었습니다. 위 섹션을 참조하세요. 구성 요소 키트가 아닌 강력한 흐름 제어 기능을 갖춘 지원되는 관리형 파이프라인을 원할 때 선택하세요.

Bland AI

Bland 음성-문자 변환, LLM, 문자-음성 변환 및 전화 기능을 분당 0.09~0.14달러의 요금으로 묶음 가격으로 제공하며 대용량 아웃바운드를 위해 특별히 제작되었습니다. 경로 복잡성에 따라 약 700~900ms로 측정됩니다. 번들은 상업적으로 추론하기가 정말 더 간단합니다. 단점은 각 레이어에 대한 통제력이 떨어진다는 것입니다.

ElevenLabs Agents

해당 카테고리에서 가장 호평받는 음성 합성 기능을 기반으로 구축되었으며, Flash 모델의 합성 속도는 약 75ms입니다. 에이전트는 연간 비즈니스 플랜의 경우 약 $0.08/분, Creator 및 Pro의 경우 약 $0.10/분의 비용을 청구합니다. LLM 토큰은 별도로 전달되고 각 계층에 번들로 제공되는 시간 허용량을 사용합니다. SIP 트렁킹 기존 전화 통신(Twilio, Telnyx, 자체 호스팅 PBX)을 다이제스트 또는 ACL 인증과 회의, 블라인드 및 SIP REFER 스타일을 지원하는 번호로 전송 도구와 연결합니다. 특히, 녹음된 오디오 벤치마크에서 가장 엄격한 꼬리 비율을 기록했는데, 이는 좋은 중앙값보다 더 중요합니다.

Telnyx

구별되는 속성은 수직적 통합입니다. Telnyx 오디오가 이동하는 캐리어 네트워크를 소유하고 있으며 450ms의 아키텍처 예산은 더 빠른 모델이 아닌 스택을 같은 위치에 배치하는 데서 비롯됩니다. 녹음된 오디오 연구에서 가장 낮은 중앙값을 기록했고 전송 연구에서 가장 낮은 반송파 RTT를 기록했습니다. 전화 연결이 가장 중요한 문제인 경우 선택하세요.

OpenAI Realtime

플랫폼이 아니라 모델이며 플랫폼이 구축되는 기반이 점점 더 커지고 있습니다. 는 실시간 API 브라우저용 WebRTC, 서버용 WebSocket, 실제 전화 통화를 세션으로 직접 라우팅하는 SIP 등 세 가지 전송을 지원합니다. 이는 기본 음성 대 음성입니다. 오디오 입력, 오디오 출력, 중간 텍스트 병목 현상이 없고 전체 차례에 걸쳐 보존되는 운율입니다. 가격은 분당이 아닌 토큰 기반으로 책정되며, 이는 컨텍스트 및 캐싱을 얼마나 잘 관리하는지에 따라 광범위한 유효 범위를 생성합니다. 달성 가능한 가장 낮은 회전 대기 시간을 원하고 주변 오케스트레이션을 구축할 수 있는 경우 이를 선택하십시오. 검사할 텍스트가 없기 때문에 중간 추론을 기록, 감사 또는 제한해야 하는 경우에는 이를 피하세요.

Synthflow, Twilio ConversationRelay 및 나머지

Synthflow 엔지니어가 아닌 운영자를 대상으로 하는 코드 없는 빌더를 갖춘 음성 엔진의 경우 분당 $0.09 정도입니다. Twilio의 ConversationRelay 내부적으로 보고된 491ms p50 및 713ms p95로 Twilio의 기존 전화 통신 환경에 AI 에이전트를 연결합니다. 통화 인프라가 이미 그곳에 있는 경우 매력적입니다.

직접 구축: Pipecat 및 LiveKit 에이전트

둘 다 오픈 소스이며 둘 다 실제로 생산 가능합니다.

PipecatDaily에서 시작된 는 매우 큰 플러그인 라이브러리와 거의 매일 개발되는 오디오 및 텍스트 흐름을 통과하는 프로세서 파이프라인으로 음성 에이전트를 모델링합니다. Pipecat Cloud는 천 개 이상의 팀이 베타 버전을 선보인 후 2026년에 일반 가용성에 도달했으므로 원하는 경우 관리형 경로가 존재합니다.

LiveKit 에이전트 LiveKit의 WebRTC 미디어 서버를 기반으로 구축되었으며, 그 특징은 룸 모델입니다. 즉, 에이전트가 사용자와 함께 참가자로 참여하여 다중 참가자 시나리오를 추가하지 않고 기본으로 만듭니다. 한 팀은 클라이언트가 동시 통화를 20개에서 400개로 확장했을 때 Pipecat에서 LiveKit 에이전트로 전화 에이전트를 재구축했다고 공개적으로 보고했습니다.

자체 호스팅 중 하나를 사용하면 볼륨당 $0.05/min 미만이 될 수 있습니다. 인프라, 대기 시간 조정 작업에 대한 플랫폼 수수료를 거래하고 있습니다. 이는 규모 면에서 좋은 거래이고 제품 시장 적합성을 찾기 전에는 나쁜 거래입니다.

실제 비용

이 범주에서 가장 일반적인 예산 책정 오류는 플랫폼 전용 요금과 번들 요금을 비교하는 것입니다.

플랫폼 헤드라인 요율 다루는 내용 현실적인 올인
Vapi $0.05/분 오케스트레이션만 STT, LLM, TTS 및 전화 통신이 추가되면 ~$0.25–0.33/분
Retell $0.055/분 음성 인프라 ~$0.07/분부터 종량제
Bland $0.09~0.14/분 모든 것이 번들로 제공됨 대략적인 헤드라인 비율
Synthflow $0.09/분 음성 엔진 플러스 LLM 및 전화 통신
ElevenLabs Agents $0.08~0.10/분 플랫폼 + 음성 또한 LLM 토큰이 통과되었습니다.
OpenAI Realtime 토큰 기반 모델만 매우 가변적입니다. 캐싱과 컨텍스트 규율이 지배적입니다.
자체 호스팅(Pipecat / LiveKit) 인프라 번들로 제공되는 항목 없음 볼륨 및 엔지니어링 시간을 분당 $0.05 미만으로 줄일 수 있습니다.

자신만의 추정치를 구축하기 위한 구성 요소 참조 포인트: 전화 통신은 약 $0.014/분, 음성-텍스트 스트리밍은 약 $0.008/분, 프리미엄 TTS는 약 $0.05/분, 작고 빠른 LLM은 약 $0.01/분입니다. 시장 전반에 걸쳐 2026년 완전 로드 요금은 가장 공격적인 셀프 서비스 요금제의 분당 약 $0.05부터 프리미엄 엔터프라이즈 계층의 분당 약 $0.31까지 대략 6배 범위에 이릅니다.

한 가지 구조적 참고 사항: 프롬프트 캐싱은 음성 에이전트의 반올림 오류가 아닙니다. 페르소나, 가드레일, 비즈니스 규칙, 지식 등 시스템 프롬프트는 모든 통화에서 동일합니다. 실시간 모델의 캐시된 입력 가격은 표준 입력의 작은 부분으로 책정됩니다. 캐싱을 자주 켜면 모델 비용이 엄청나게 변경되며, 누군가가 비용을 절약하기 위해 더 나쁜 모델로 다운그레이드를 제안하기 전에 가장 먼저 확인해야 할 사항입니다.

여기서 규정 준수는 선택 사항이 아닙니다.

전화 에이전트는 브라우저 에이전트가 아닌 규제 노출을 수행합니다.

미국에서는 FCC의 2024년 2월 선언적 판결 AI 생성 음성이 TCPA에서 "인공 또는 사전 녹음된 음성"임을 확인했습니다. 여기에는 무선 및 주거용 회선 통화, 식별 및 공개 의무, 거부 처리에 대한 동의 요구 사항이 포함되며, 법정 손해 배상금은 위반당 500달러에서 고의적 위반의 경우 1,500달러로 증가합니다. AI 생성 통화에 대한 추가 FCC 규칙 제정은 2026년 말 또는 2027년 초에 마무리될 것으로 예상되며, 널리 예상되는 결과는 통화 시작 시 명시적인 AI 식별 요구 사항과 AI를 구체적으로 명명하는 동의 언어입니다.

EU에서는 AI법 50조가 2026년 8월 2일부터 적용되어 사람들에게 AI와 상호 작용하고 있음을 알릴 것을 요구합니다. 미국의 주 차원에서 콜로라도 AI법은 2026년에 발효되며 이 범주의 대부분을 고위험으로 분류할 수 있습니다.

실제 자세는 간단하며 비용이 전혀 들지 않습니다. 시작 줄에 공개하고, 동의 기록을 유지하고, 거부를 즉시 존중하고, 항상 인적 전달이 가능하도록 하십시오. 이들 모두는 개조하는 것보다 지금 구축하는 것이 더 저렴합니다.

직접 벤치마킹하세요

신뢰할 수 있는 두 연구에서 동일한 순위가 역전된 경우, 조치를 취해야 할 유일한 수치는 본인의 수치입니다. 이 프로토콜은 하루가 걸립니다.

  1. 고정된 스크립트를 빌드합니다. 최소 하나의 긴 숫자, 하나의 수정 및 사람에 대한 하나의 요청을 포함하여 실제 사용 사례를 다루는 20~30개의 턴입니다.
  2. 하나의 시계에 두 다리를 모두 기록합니다. 플랫폼에서 보고된 타이밍을 사용하지 마세요. 발신자가 경험하는 경로의 일부를 제외합니다. 실제 통화 오디오를 캡처합니다.
  3. 첫 번째 오디오 바이트까지의 시간 측정 발신자 음성이 끝날 때부터 벤더의 이벤트 스트림 대신 녹음에 VAD를 사용합니다.
  4. 엔드포인트 표준화 테스트하는 모든 플랫폼에서 또는 아키텍처가 아닌 구성을 벤치마킹하고 있습니다.
  5. p50과 p95를 별도로 보고하고, 게다가 꼬리 비율과 버려야 하는 턴 수도 더해집니다. 때때로 아무것도 생산하지 않는 플랫폼은 일정하게 약간 느린 플랫폼보다 더 나쁩니다.
  6. 6가지 중단 클래스 실행 위의 표에서 별도의 테스트 사례로 분리하고, 잘못된 정지점과 누락된 정지점을 독립적으로 점수를 매깁니다.
  7. 부하가 걸린 상태에서 테스트합니다. 단일 호출에서는 모든 플랫폼이 좋아 보입니다. 동시성은 중앙값이 저하되고 꼬리가 폭발하는 곳입니다.
  8. 잘못된 연결 테스트 그리고 광섬유가 있는 책상이 아닌 움직이는 차에 있는 모바일 핸드셋을 통해서도 가능합니다.

결론

이 범주의 플랫폼은 마케팅에서 제시하는 것보다 서로 더 가깝고, 둘 사이의 격차는 잘 조정된 배포와 잘못 조정된 배포 간의 격차보다 작습니다.

선택한 공급업체보다 세 가지가 더 중요합니다. 회전 감지는 복구 가능한 최대 지연 시간 조각이자 존재한다고 느끼는 에이전트와 전화 트리처럼 느껴지는 에이전트 간의 차이이기 때문입니다. 중단 정책은 발신자가 첫 번째 오해 이후에 해당 사물을 신뢰하는지 여부를 결정하기 때문입니다. 그리고 꼬리 지연 시간은 p95가 고객이 실제로 경험하는 것이며 대략적으로 고객이 전화를 끊는 지점이기 때문입니다.

모든 공급업체는 중앙값을 표시합니다. p95를 요청하고 어떻게 측정했는지 물어본 다음 직접 측정해 보세요.

첫 번째 비서가 몇 분 거리에 있습니다

귀하의 비즈니스 지식을 업무에 적용해 보세요.

무료 Cody 계정으로 시작하세요. 오늘 콘텐츠를 추가하고, 어시스턴트를 구축하고, 첫 번째 유용한 답변을 공유하세요.