실시간 AI 에이전트 경험이 실제로 작동하는 방식: 현장 가이드
이벤트, 교육실 및 공공 장소에서 실시간 대화 에이전트에 대한 공급업체 중립적 가이드 대부분의 팀이 구축한 것과 전혀 다르게 작동하는 AI 제품 범주가 있습니다. 채팅창도 없고 보내기 버튼도 없고... 더 읽기 »

이벤트, 교육실, 공공 장소에서의 실시간 대화 에이전트에 대한 벤더 중립적 가이드
대부분의 팀이 구축한 것과 전혀 다르게 작동하는 AI 제품 범주가 있습니다. 채팅창도 없고 보내기 버튼도 없고 인내심도 없습니다. 누군가 다가와 입을 열면 시계가 시작됩니다. 0.5초 만에 답장이 오면 마치 대화를 하는 듯한 느낌이 든다. 2초 안에 떨어지면 거기 서 있던 사람은 그것이 부서졌다고 생각하고 걸어가 버립니다.
이들은 라이브 에이전트입니다. 인간과 같은 방에서 또는 같은 통화로 대화를 진행하는 실시간 음성 기반 시스템입니다. 그들은 무역 박람회 부스, 훈련 시뮬레이션, 박물관 키오스크, 호텔 프론트 데스크, 전화 번호 뒤에 나타납니다. 그리고 그들은 텍스트 챗봇이 결코 하지 않는 방식으로 실패합니다.
이 문서는 해당 카테고리가 실제로 어떻게 작동하는지에 관한 것입니다. 제품 홍보물도 아니고 도구 목록도 아닙니다. 시끄러운 방에서 두 번째 기회 없이 낯선 사람에게 1초 안에 대답해야 하는 것은 엔지니어링 및 설계 현실입니다.
"라이브"가 실제로 의미하는 것
제약 조건을 정의하는 것은 지능이 아닙니다. 시간이다.
2009년에 Tanya Stivers가 이끄는 언어학자 팀은 다음과 같은 연구 결과를 발표했습니다. PNAS 영어, 일본어, 덴마크어, 라오스어, 이탈리아어, 한국어, 네덜란드어, Tzeltal, Yélî-Dnye 및 ‡Ākhoe Hai||om 등 5개 대륙의 10개 언어에 걸친 일상 대화에서 화자 간의 차이를 측정합니다. 그 결과는 놀라울 정도로 균일했습니다. 모든 언어는 모드가 0에서 +200밀리초 사이에 있고 언어 간 중앙값이 약 +100ms인 응답 오프셋의 단일 피크 분포를 보여주었습니다.
이는 귀하의 시스템이 판단되는 숫자입니다. 벤치마크가 아니라 유아기부터 조정된 신경계에 의해 이루어집니다.
아무도 기계가 100ms에 도달할 것이라고 기대하지 않습니다. 그러나 지각 절벽은 실제이며 실제로 잘 문서화되어 있습니다. 약 800ms에서 응답이 눈에 띄게 지연된 것으로 읽기 시작합니다. 대략 1,500ms가 지나면 대부분의 사람들은 뭔가 잘못되었다고 결론을 내리고 반복하거나 연결을 끊습니다. 사람이 실제로 화면 앞에 서 있는 라이브 환경에서는 이를 흡수할 네트워크 지연이 주변 환경에서 예상되지 않기 때문에 해당 임계값은 전화에서보다 더 가혹합니다.
이건 주관적인 취향이 아닙니다. 실시간 아바타 시스템에 대한 독립적인 178명의 참가자 맹검 연구에서 반응성은 전반적인 사용자 경험을 가장 강력하게 예측하는 변수였습니다. Spearman 상관관계는 시각적 품질보다 0.697로 높았습니다. 사용자는 어떤 모델이 더 나은 얼굴을 렌더링했는지 알 수 없습니다. 그들은 누가 살아 있다고 느꼈는지 즉각적이고 확실하게 알려줄 수 있습니다.
라이브 에이전트의 구조
내부적으로는 거의 모든 라이브 에이전트가 두 가지 아키텍처 중 하나입니다.
계단식 파이프라인 체인 개별 모델: 오디오가 들어오고, 음성-텍스트 모델이 이를 기록하고, 일부 로직이 사용자가 말하기를 마쳤다고 결정하고, 언어 모델이 응답을 생성하고, 텍스트-음성 모델이 오디오를 합성하고, 오디오가 재생됩니다. 각 단계는 교체 가능하고 관찰 가능하며 독립적으로 조정 가능합니다. 각 단계마다 대기 시간도 추가됩니다.
음성-음성 모델 그 사슬을 무너뜨립니다. 오디오는 단일 다중 모드 모델로 들어가고 중간 텍스트 병목 현상 없이 오디오가 나옵니다. 이것이 OpenAI의 Realtime API와 Google의 Gemini Live가 제공하는 것입니다. 이는 더 빠르고 대본에서 버리는 운율(어조, 망설임, 강조)을 보존합니다. 또한 중간에 발생한 일에 대한 통제력이 크게 떨어지므로 행동을 기록, 감사 또는 제한해야 할 때 중요합니다.
2026년의 대부분의 생산 시스템은 하이브리드입니다. 즉, 실제 작업이 필요한 모든 작업에 대해 도구 호출이 더 느리고 더 유능한 모델로 실행되는 대화 표면을 처리하는 실시간 모델입니다.
시간은 어디로 가는가
Telnyx는 긴밀하게 함께 배치된 스택과 별도의 지역에 있는 별도 공급업체에서 조립한 일반적인 스택을 비교하여 음성 턴의 유용한 분해를 게시했습니다.
| 무대 | 함께 배치된 스택 | 일반적인 스티치 스택 |
|---|---|---|
| 네트워크/전송 | 45ms | 150ms |
| 음성-텍스트 | 100ms | 225ms |
| LLM 추론 | 225ms | 650ms |
| 텍스트 음성 변환 | 80ms | 185ms |
| 합계 | 450ms | 1,210ms |
두 가지가 눈에 띕니다. 첫째, LLM은 두 열 모두에서 가장 큰 단일 항목입니다. 따라서 간단한 대화를 작고 빠른 모델로 라우팅하고 실제 추론을 위해 더 큰 모델을 예약하는 것이 가장 활용도가 높은 최적화입니다. 둘째, 두 열의 차이는 지능이 아닙니다. 지리와 배관입니다. 같은 모델을 잘못 배열하면 3/4초의 비용이 발생합니다.
여기에 렌더링된 얼굴을 추가하는 경우 상단에 아바타 생성을 위해 추가로 150~200ms의 예산을 책정하고 첫 번째 프레임이 나타나기 전에 시각적 계층에서 자체 세션 참여 지연을 추가할 것으로 예상합니다.
가장 어려운 문제는 언제 말해야 하는지 아는 것입니다
라이브 에이전트를 제공한 사람에게 무엇이 먼저 고장났는지 물어보면 언어 모델을 말하지 않을 것입니다. 그들은 차례대로 말할 것입니다.
시스템은 인간이 무의식적으로 해결하고 기계가 잘못 해결하는 질문에 대답해야 합니다. 이 사람은 말을 끝냈나요, 아니면 그냥 생각 중인가요? 한 방향으로 잘못 말하면 상담원이 문장 중간에 누군가를 방해합니다. 상대방이 틀리면 상담원은 그 사람이 기다리는 동안 조용히 앉아 있다가 두 사람이 동시에 이야기를 시작합니다.
네 가지 광범위한 접근 방식이 있으며, 서로 경쟁하기보다는 누적됩니다.
1. 음성 활동 감지(VAD)
소규모 모델은 각 오디오 프레임을 음성 또는 비음성으로 분류합니다. Silero VAD 거의 보편적인 기본값입니다. VAD는 빠르고 저렴하며 지속적인 배경 소음에 대해 강력하지만 순전히 오디오에서만 작동합니다. 소리가 멈췄다는 것을 알고 있습니다. 문장이 끝났는지는 알 수 없습니다.
2. 엔드포인트
스트리밍 기록을 관찰하고 일반적으로 묵음 임계값 이후에 발화가 완료되었는지 결정하는 논리입니다. 문제는 산술적입니다. 800ms의 무음 시간 제한은 거의 1초를 추가합니다. 반응 하나하나, 처리가 시작되기 전. 10분 이상의 대화는 구성에 따라 지불한 몇 분의 무감각한 시간입니다.
3. 의미론적 회전 감지
소규모 분류기는 부분 기록을 읽고 침묵이 아닌 의미를 통해 차례 완료를 예측합니다. "내 계좌 번호는 47입니다."는 분명히 불완전합니다. "그게 다예요, 고마워요"는 분명히 그렇지 않습니다. LiveKit는 오픈 웨이트 회전 감지기 지연 시간이 짧은 CPU 추론을 위해 Qwen2.5-0.5B-Instruct를 미세 조정하여 14개 언어를 지원합니다. Pipecat Smart Turn을 개방형 대안으로 유지합니다. 이 모델은 회전을 할 수 있기 때문에 전에 후행 침묵이 지나면 그들은 종료 세금을 회수합니다.
4. 목적에 맞게 구축된 대화 음성 모델
최신 접근 방식은 탐지를 인식 모델 자체로 전환합니다. Deepgram의 플럭스2026년 4월부터 다국어 형식으로 일반적으로 사용 가능하며 대기 시간을 정확성과 교환하기 위한 구성 가능한 임계값을 사용하여 260ms의 중앙 턴 종료 감지를 보고하고 기존 STT-plus-VAD에 비해 에이전트 응답 대기 시간이 200~600ms 감소한다고 주장합니다. Tavus는 어휘, 의미, 운율 및 음향 신호를 함께 사용하는 Sparrow 대화 흐름 모델과 유사한 접근 방식을 취합니다.
| 접근 | 사용된 신호 | 대기 시간이 추가되었습니다. | 특징적인 실패 |
|---|---|---|---|
| VAD만 해당 | 오디오 에너지 | 무음 임계값과 동일 | 생각하기 위해 잠시 멈추는 사람을 차단합니다 |
| STT 엔드포인트 | 성적 증명서 스트림 | 보통 | 똑같아, 조금 더 똑똑해 |
| 의미론적 모델 | 부분 성적 증명서 의미 | 낮음; 침묵을 선점할 수 있다 | 불완전한 문장에 대한 거짓 커밋 |
| 대화형 STT | 오디오 + 어휘 + 운율 | 최저 | 통제력이 떨어집니다. 더 새롭고, 덜 전투 테스트를 거쳤습니다. |
중단은 설정이 아니라 정책이다
참여(사용자가 문장 중간에 에이전트를 끊도록 허용)는 일반적으로 단일 부울로 노출됩니다. 이는 실수이며, 누구도 이유를 말할 수 없는 상태에서 에이전트가 "잘못되었다고 느끼는" 가장 일반적인 단일 원인입니다.
문제는 들어오는 모든 오디오가 동일한 것을 의미하는 것은 아니라는 것입니다. Hamming의 중단 런북에서 채택한 유용한 분류법은 이를 6개 클래스로 나눕니다.
| 입력 | 예 | 올바른 행동 |
|---|---|---|
| 진정한 교정 | "아니요, 금요일" | 즉시 중지하고, 새로운 차례를 수락하고, 작업 컨텍스트를 유지하세요. |
| 백채널 | "으흠", "그래", "맞아" | 계속 말하세요. 새로운 인텐트로 취급하지 않음 |
| 우발적인 소음 | 키보드, HVAC, 인접 대화 | 무시하고 안전한 지점에서 재개 |
| 긴 항목 일시중지 | 계좌번호 중간에 | 잠깐만요. 일찍 대답하지 마세요 |
| 무음 시간 초과 | 사람이 방황했다 | 한 번 재요청한 후 재설정하세요. |
| 안전 에스컬레이션 | "나는 사람을 원한다" | 즉시 중지하고 손을 뻗으십시오. |
신뢰를 가장 빠르게 침식하는 실패는 잘못된 중지입니다. 에이전트는 누군가가 "알았어"라고 말했기 때문에 문장 중간에 중단한 다음 "알았어"를 새로운 질문으로 처리합니다. 듣고 있지 않은 에이전트로 읽혀집니다. VAD가 주변 소리에 대해 지속적으로 실행되는 시끄러운 환경에서 순진한 바지선 설정은 이 소리를 시간당 수십 번 생성합니다.
수정 사항은 메시지 유형별 정책입니다. 인사말은 짧은 유예 기간 후에 중단될 수 있어야 합니다. 메뉴는 DTMF 및 음성을 허용해야 합니다. 개체 캡처에는 인내심이 필요합니다. 법적 공개 또는 동의서는 전혀 중단되어서는 안 됩니다. "확인해 보겠습니다" 필러는 즉시 취소할 수 있어야 합니다.
라이브 에이전트가 실제로 적합한 곳
이 섹션의 정직한 버전에는 형식이 비용을 얻지 못하는 장소가 포함됩니다.
| 설정 | 형식이 적합한 이유 | 실제로 깨지는 것 |
|---|---|---|
| 무역 박람회 및 컨퍼런스 | 참신함은 사람들의 통행을 막습니다. 직원이 바쁜 동안 상담원이 자격을 얻습니다. 사람들이 실제로 질문하는 내용을 포착합니다. | 80dB 근처의 주변 소음; 신뢰할 수 없는 장소 Wi-Fi; 방문객들은 혼자가 아닌 단체로 도착합니다. |
| 훈련 및 리허설 | 사회적 비용 없이 어려운 대화를 무제한 반복합니다. 일관된 득점; 보고는 학습이 일어나는 곳입니다 | 시나리오 현실감은 어렵습니다. 학습자가 시뮬레이터 게임을 합니다. 시뮬레이션보다 피드백 품질이 더 중요합니다 |
| 공용 키오스크 (박물관, 대중교통, 시민) | 기본적으로 다국어; 결코 피곤하지 않습니다. 터치스크린을 사용할 수 없는 사람들을 위한 진정한 접근성 향상 | 공공장소 개인정보 보호 기대치 기물 파손 및 학대; 긴 무인 가동 시간; 오프라인에서 정상적으로 성능이 저하되어야 합니다. |
| 리셉션 및 컨시어지 | 근무 외 시간 및 초과 인원을 보장합니다. 똑같은 15개의 질문을 완벽하게 처리합니다 | 흥미로운 것은 모두 예외입니다. 에스컬레이션 경로는 전체 제품입니다. |
| 전화선 | 무한한 동시성; 렌더링할 시각적 레이어가 없습니다. 성숙하고 잘 이해되는 운송 수단 | 규제 노출; 캐리어 대기 시간; 발신자는 떠나는 것보다 더 빨리 전화를 끊는다 |
| 소매층 | 진열대에서 제품 조회 및 비교 | 소음, 혼잡함, 3m 떨어진 사람을 선호하는 경향이 강함 |
| 어디에 맞지 않는지 | 지속적인 읽기, 정확한 데이터 입력, 복잡한 문서 검토 또는 방문자가 1분 이상 생각해야 하는 결정이 필요한 모든 것. 실시간 대화는 대화형이 아닌 모든 것에 대한 나쁜 인터페이스입니다. | |

훈련은 라이브 에이전트가 새로움이 가장 적고 반복이 가장 중요한 환경입니다. GPT 이미지 2로 생성된 이미지.
좋은 배포와 데모를 구분하는 패턴
위의 모든 설정에서 결과를 생성하는 배포는 하나의 속성, 즉 에이전트를 공유합니다. 뭔가를 만든다 질문에만 대답하는 것이 아니라 대화 중에도 말이죠.
"당신의 제품이 어떤 역할을 하는지"라고 대답하는 부스 에이전트는 말하는 브로셔입니다. 방문자의 회사 URL을 가져와 60초 만에 화면에 한 페이지 분석을 생성하는 부스 에이전트가 거래를 변경했습니다. 이제 방문자는 귀하에게 이메일 주소를 제공할 이유가 있고 나중에 동료에게 경험을 설명할 이유가 있습니다. 역할극을 실행하는 훈련 에이전트가 유용합니다. 점수가 매겨진 구체적인 보고로 끝나는 훈련 에이전트가 바로 제품입니다.
대화는 인터페이스입니다. 유물은 가치입니다.
방이 가장 어려운 부분이다
이 부분은 건너뛰는 부분이고, 그날 일이 잘 되는지 판단하는 부분이다.

당일 소프트웨어의 작동 여부를 결정하는 부품 목록입니다. 하드웨어 반향 제거 기능이 있는 스피커폰은 가장 큰 위험에 대한 가장 저렴한 해결책입니다. GPT 이미지 2로 생성된 이미지.
소음. 전시장은 개방형 마이크 음성 감지가 성공하는 것보다 실패하는 경우가 더 많을 정도로 시끄럽습니다. 실용적인 대답은 방향성 또는 빔포밍 마이크, 눌러서 말하기 또는 탭해서 말하기 어포던스, 시각적 텍스트 대체입니다. 하드웨어 음향 반향 제거 기능이 있는 USB 회의 스피커폰은 가장 큰 위험에 대한 가장 저렴한 해결책입니다. USB 회의 스피커폰이 없으면 화면 자체 스피커가 마이크에 피드백되고 상담원이 스스로 중단되기 때문입니다.
연결성. 장소 Wi-Fi는 동전 뒤집기입니다. 셀룰러 핫스팟을 가져와 이더넷을 통해 기계에 연결하고 미리 준비된 답변 세트를 캐시하여 유인 루프와 기본 답변이 드롭아웃 후에도 유지되도록 합니다.
세션 위생. 방문자 간의 하드 재설정은 선택 사항이 아닙니다. 누구도 이전 사람의 이메일 주소, 회사 이름, 대화를 화면에서 볼 수 없습니다. 누군가가 문장 중간에서 방황할 때 디스플레이를 유치 모드로 되돌리는 시간 제한을 구축하세요. 계속 그렇게 될 것입니다.
세션 제한. 실시간 세션에는 기간 제한이 있으며 세션이 중단됩니다. 새 세션에 짧은 요약을 전달하는 재연결을 구축하세요. 그렇지 않으면 상담원이 군중 앞에서 대화 중에 누군가의 이름을 잊어버릴 것입니다.
난간. 실시간 상담원은 절대로 맞춤 가격을 제시하거나 일정을 약속하거나 약속을 해서는 안 됩니다. 거래 형태의 모든 것은 인간에게 전달됩니다. 이는 시스템 프롬프트에서 시행할 가치가 있습니다. 그리고 실패는 공개적이고 할당 가능하기 때문에 생성 후 확인에서.
당신을 만나야 할까요?
카메라는 라이브 에이전트에게 가장 유혹적이고 가장 위험한 추가 요소입니다.
실제로 유용한 애플리케이션은 범위가 좁습니다. 누군가 접근하여 화면을 바라보고 있음을 감지하여 시스템을 깨울 수 있습니다. 얼마나 많은 사람이 있는지 계산하여 조정할 수 있습니다. 누군가 다른 곳을 바라보고 있다는 것을 알아차리고 잠시 멈출 수 있습니다. 배지, 명함, 웹 사이트가 표시된 휴대폰 등 사람이 고의로 들고 있는 것을 읽는 것입니다. 마지막 항목은 명시적으로 선택되어 있기 때문에 가장 강력합니다. "배지를 카메라에 대세요"는 누구도 입력하지 않고도 회사 이름을 알려주는 자연스러운 지시입니다.
해서는 안 되는 두 가지 일: 누군가의 외모에 대해 언급하는 것과 이전에 방문한 사람을 알아보는 것입니다. 둘 다 2초 동안 파티 트릭으로 읽혀지고 그 이후에는 감시로 읽혀집니다.
팀을 늦게 잡는 비용 함정도 있습니다. 실시간 다중 모달 API는 누적된 세션 컨텍스트에 대해 턴당 요금을 청구합니다. 지속적으로 스트리밍되는 카메라를 사용하면 이미 전송한 모든 프레임이 해당 컨텍스트에 위치하며 이후 턴마다 다시 요금이 청구됩니다. 오픈 카메라로 8시간 동안 진행된 세션을 통해 정말 놀라운 송장이 생성되었습니다. 아키텍처적인 대답은 MediaPipe와 같은 온디바이스 모델을 사용하여 현재 상태 감지를 로컬로 유지하는 것입니다. 포즈 랜드마크 또는 얼굴 랜드마크 오프라인으로 즉시 실행됩니다. 실제로 사람이 참여한 후에만 유료 실시간 세션을 열 수 있습니다. 활성 상태이거나 요청 시에만 프레임을 초당 1개씩 드물게 전송하고 프레임이 나갈 때 세션을 강제로 닫습니다. 보너스로 유인 모드는 비용이 전혀 들지 않으며 네트워크가 필요하지 않습니다.
공개, 동의 및 새로운 규칙
2026년 8월 2일부터 EU AI법 제50조가 적용됩니다. 자연인과 직접 상호작용하는 AI 시스템은 사람들이 AI와 상호작용하고 있다는 사실을 알 수 있도록 설계되어야 하며, 합성 또는 조작된 콘텐츠는 처음 노출 시 명확하게 공개되어야 합니다. 고위험 AI가 전혀 없는 조직도 고객과 대면하는 대화 에이전트나 합성 발표자를 실행하는 것만으로도 이러한 의무를 정면으로 준수할 수 있습니다. 유럽연합 집행위원회는 다음과 같이 발표했습니다. 지침 의무가 어떻게 적용되는지에 대해.
미국 내 전화선에서는 FCC의 결정 이후 입장이 확정되었습니다. 2024년 2월 선언적 판결이는 TCPA에서 AI가 생성한 음성이 "인공 또는 사전 녹음된 음성"으로 간주됨을 확인했습니다. 여기에는 동의, 신원 확인, 공개 및 거부 요구 사항이 포함되며 위반당 500달러부터 시작하는 법정 손해 배상이 포함됩니다.
법적 근거를 넘어 물리적 공간에서 유지되는 관행은 화려하지 않습니다.
- 바닥글이 아닌 첫 문장에 AI라고 명시하세요.
- 카메라나 마이크가 있는 모든 시설에 눈에 띄는 간판을 설치하세요.
- 카메라 프레임을 처리하고 폐기합니다. 고집하지 말고, 누가 물어보면 솔직하게 말할 수 있어야 합니다.
- 하드웨어 표시기(물리적 셔터 또는 활성 세션 중에만 켜지는 LED)를 사용하십시오.
- 공연장 계약을 확인하세요. 일부 회의 계약에서는 현장에서의 녹화를 제한하고 있으며 "우리는 스트리밍만 하고 녹화는 하지 않습니다"라는 구분은 주최자가 받아들이지 않을 수도 있습니다.
- 생체인식 개인정보 보호법이 적용되는 관할권에서 얼굴이나 성문을 캡처하는 경우 먼저 서면 동의를 받으세요. 특히 일리노이주의 BIPA는 개인 소송권을 보유하고 있습니다.
측정 대상
대부분의 라이브 에이전트 배포는 분위기를 기준으로 평가됩니다. 실제로 다음과 같은 내용을 알려주는 도구입니다.
| 미터법 | 왜 중요한가요? |
|---|---|
| 첫 번째 오디오 바이트까지의 시간, p50 그리고 p95 | 중앙값은 데모의 느낌입니다. p95는 사용자가 느끼는 것입니다. 꼬리 대기 시간은 사람들이 이탈하는 지점입니다. |
| 허위 중단 비율 | 소음이나 백채널이 실제 회전으로 착각합니다. "깨진 느낌"의 주요 동인. |
| 중단되지 않은 비율 | 실제 수정 사항은 무시되었습니다. 사람들이 반복하고 포기하게 만듭니다. |
| 세션당 회전수 | 원턴 세션은 오프닝이 실패했음을 의미합니다. 15차례 세션은 에이전트가 아무것도 해결하지 못하고 있음을 의미할 수 있습니다. |
| 포기 지점 | 흐름에서 사람들이 떠나거나 전화를 끊는 곳. 일반적으로 하나의 특정 프롬프트가 표시됩니다. |
| 에스컬레이션 속도 및 품질 | 핸드오프는 실패가 아니라 성공입니다. 핸드오프에 컨텍스트가 전달되는 경우입니다. |
| 답이 없는 질문 기록 | 공개 배포의 가장 가치 있는 결과입니다. 무료 포지셔닝 연구입니다. |
하나의 시계에 오디오의 양면을 기록합니다. 공유 시계가 없으면 실제 대기 시간을 측정할 수 없으며 자신의 스택이 자체적으로 보고하는 것만 측정할 수 있습니다. 그리고 이 두 숫자는 1초 정도 다를 수 있습니다.
비행 전 체크리스트
실시간 배포 전에 대략적인 순서대로 문제가 발생합니다.
- 자신의 로그가 아닌 녹음된 오디오에서 p50 및 p95 턴 대기 시간을 측정하세요.
- 장소의 실제 볼륨에서 실제 배경 소음을 테스트해 보세요.
- 6개 중단 클래스 모두에 대해 개별적으로 참여를 테스트합니다.
- 화면을 포함하여 사용자 간에 세션이 완전히 재설정되는지 확인합니다.
- 누군가가 문장 중간에 나갈 때 유인 모드 시간 초과가 발생하는지 확인하세요.
- 네트워크 케이블을 당겨 오류가 정상적인지 확인합니다.
- 다시 연결하면 세션이 중단된 후 컨텍스트가 전달되는지 확인합니다.
- 상담원에게 가격을 제시하거나, 날짜를 약속하거나, 인용 가능한 말을 하도록 하세요.
- 첫 번째 교환에서 AI 공개가 발생하는지 확인합니다.
- 간판, 카메라 표시기, 데이터 보존 스토리가 실제 작업과 일치하는지 확인하세요.
- 롤백: 정적 화면, QR 코드 및 사람.
결론
라이브 에이전트는 마이크가 연결된 챗봇이 아닙니다. 채팅 인터페이스는 사람들이 기꺼이 기다릴 수 있는 텍스트 상자 뒤에 대기 시간, 모호함 및 오류를 숨깁니다. 그것을 없애면 스택의 모든 약점이 낯선 사람 앞에서 일어나는 사회적 이벤트가 됩니다.
이를 올바르게 수행하는 팀은 턴 테이킹 모델, 마이크, 네트워크, 재설정, 핸드오프 등 지루한 작업을 최적화합니다. 그들은 상담원의 업무를 소규모로 유지하고 조기에 넘겨줍니다. 그들은 그 사람이 무언가를 가지고 떠나는지 확인합니다. 그리고 그들은 모든 인간이 태어날 때부터 훈련받아온 200밀리초의 대화 간격을 있으면 좋은 것이 아니라 실제 사양으로 취급합니다.
다른 모든 것은 데모입니다.
