- AI 도구
- 인공지능
GPT Live 1 API 출시: 가격, 기능 및 작동 방식
GPT Live 1는 OpenAI API에 전이중 음성 대화를 제공합니다. 작동 방식, 분당 $0.05 포함 내용, GPT-Realtime-2.1와 비교하는 방법을 알아보세요.

OpenAI는 ChatGPT 스타일의 전이중 대화를 개발자에게 제공했습니다. 중요한 변화는 단지 새로운 목소리가 아니라 대화와 그 뒤에 일어나는 작업 사이의 새로운 업무 분업입니다.
음성 비서가 빠르게 개선되었지만 여전히 많은 사람들이 자신의 기계를 공개하고 있습니다. 그들은 일시 정지 중에 너무 열성적으로 기다리거나, 방해한 후에도 계속 말하거나, 도구가 주문을 찾는 동안 조용해집니다. OpenAI의 GPT-Live 1 API 출시 그 기계를 덜 눈에 띄게 만들려는 시도입니다.
2026년 9월 10일에 출시된 GPT-Live 1는 듣기와 말하기를 동시에 할 수 있습니다. 대화 자체의 리듬을 처리하는 반면, 별도의 백엔드 모델이나 에이전트는 추론, 검색, 승인된 도구 호출 및 결과 반환을 수행할 수 있습니다. 해당 아키텍처는 가격이나 벤치마크를 비교하기 전에 이해해야 할 핵심 아이디어입니다.
이 가이드에서는 GPT Live 1가 무엇인지, 분당 $0.05 가격에는 위임의 작동 방식 및 위임의 차이점이 포함됩니다. GPT-Realtime-2.1 그리고 전통적인 음성 파이프라인. 우리는 사람들이 검색할 가능성이 높은 곳에 “GPT Live 1”를 사용합니다. OpenAI는 제품 이름 스타일을 지정합니다. GPT-Live 1, 정확한 API 모델 ID는 다음과 같습니다. gpt-live-1.
빠른 답변 — 2026년 9월 11일에 확인됨
GPT-Live 1는 이제 OpenAI API에서 사용할 수 있습니다. 전이중 음성 프런트엔드 비용 세션 분당 $0.05, 초당 청구됩니다. 백엔드 모델 사용, 도구, 전화 통신 및 애플리케이션 인프라는 별도의 비용입니다. 텍스트 및 오디오 입력/출력, 스트리밍 및 위임 도구 사용을 지원합니다. 이미지와 비디오는 라이브 프런트엔드에서 지원되지 않습니다.
| GPT Live 1 사실 | 확인된 내용 |
|---|---|
| 출시일 | 2026년 9월 10일 |
| API 모델 ID | gpt-live-1 |
| 가격 | 음성 세션 분당 $0.05, 초당 청구됨 |
| 추가요금 | 백엔드 모델, 도구, 전화 통신, 스토리지 및 애플리케이션 인프라 |
| 입력 → 출력 | 텍스트 및 오디오 → 텍스트 및 오디오 |
| 연결 | WebRTC, WebSocket, 측대역 서버 제어 및 전화 통신/SIP 경로 |
| 지식 차단 | 2025년 7월 31일 |
| 무료 API 계층 | 지원되지 않음 |
GPT Live 1란 무엇입니까?
GPT-Live 1는 애플리케이션의 대화 계층을 관리하기 위해 구축된 실시간 음성 모델입니다. 지속적인 오디오 스트림을 수신하고, 음성을 생성하고, 들어오고 나가는 오디오에 대한 이유를 함께 생성합니다. 평범한 영어에서는 말하기 시작했다고 해서 듣기를 멈출 필요가 없습니다.
따라서 이 모델은 실제 연설의 지저분한 부분(예: "mm-hm" 인정, 망설임, 웃음, 배경 대화, 문장 중간에 수정, 화자가 실제로 원하는 것을 변경하는 중단)에 매우 적합합니다.
GPT-Live 1는 음성 모델 내에서 모든 어려운 비즈니스 워크플로우를 수행하기 위한 것이 아닙니다. 더 깊은 추론과 도구 사용을 위해 개발자가 선택한 백엔드에 위임합니다. OpenAI는 대량 예약 또는 주문 업데이트를 위해 Luna와 같은 소형 모델을 사용하고 복잡한 고객 문제를 위해 Astra와 같은 모델을 사용하는 등의 예를 제공합니다. 클라이언트 위임을 사용하면 백엔드가 OpenAI 모델일 필요가 전혀 없습니다.
정확한 API 사실, 현재 액세스 링크 및 공급자 소스에 대해서는 새로운 내용을 참조하세요. GPT-Live 1 모델 페이지 Cody의 모델 라이브러리에 있습니다.
전이중 음성이 다르게 느껴지는 이유
대부분의 사람들은 깔끔하게 번갈아 가며 말하지 않습니다. 우리는 바닥을 포기하지 않고 생각하기 위해 잠시 멈춘다. 다른 사람이 우리가 따르고 있음을 보여주기 위해 말하는 동안 우리는 "맞습니다"라고 말합니다. 상대방이 끝나기 전에 수정을 시작합니다. 턴 기반 시스템은 각각의 침묵이나 소리가 "지금 응답", "계속 듣기" 또는 "말하기 중지"를 의미하는지 추측해야 합니다.
전이중 시스템이 말하는 동안 들을 수 있음을 의미합니다. 이는 그 자체로 자연스러운 대화를 보장하지는 않지만, 중첩이 발생할 때 반응하는 데 필요한 음향 컨텍스트를 모델에 제공합니다. 짧은 승인은 실제 중단과 다르게 처리될 수 있습니다. 사려 깊은 일시 중지는 보조자가 뛰어들도록 초대하는 대신 일시 중지로 남아 있을 수 있습니다.
이는 또한 단순한 "첫 번째 오디오까지의 시간" 수치가 전체 경험을 설명할 수 없는 이유이기도 합니다. 음성 에이전트는 빠르게 말하기 시작할 수 있지만 생각하고 있는 사용자를 방해하면 여전히 무례하다고 느낄 수 있습니다. 백엔드 도구가 실행될 때마다 조용해지면 음성 품질이 좋아도 여전히 느린 느낌을 받을 수 있습니다. 회전 타이밍, 복구, 배경 소음 동작 및 작업 완료가 모두 함께 중요합니다.
GPT Live 1 위임 작동 방식
위임은 백엔드 에이전트에서 음성 프런트엔드를 분리합니다. GPT-Live 1는 요청을 승인하거나 유용한 후속 조치를 요청하는 등 대화를 계속 진행할 수 있으며, 동시에 더 깊은 작업은 다른 곳에서 실행됩니다. OpenAI는 해당 작업을 연결하는 두 가지 방법을 문서화합니다.
응답 위임
와 응답 위임, GPT-Live 1는 백엔드 요청을 준비하고 관련 대화 컨텍스트를 세션에 대해 선택된 OpenAI 응답 모델로 보낸 다음 결과를 음성 대화로 다시 가져옵니다. 하나의 응답 모델과 지원되는 도구가 작업에 적합할 때 더 관리되는 경로이고 시작하기 더 쉬운 곳입니다.
백엔드 선택은 음성 모델과 무관합니다. 팀은 일상적인 작업을 더 빠르거나 저렴한 모델로 라우팅하고 이를 정당화하는 사례에 대해 더 무거운 추론을 보류할 수 있습니다. 이는 또한 GPT-Live 1 에이전트의 품질과 총 비용이 음성 프런트엔드뿐만 아니라 백엔드 구성에 부분적으로 의존한다는 것을 의미합니다.
고객 위임
와 고객 위임, 애플리케이션은 위임 이벤트를 수신하고, 적절한 기록과 비즈니스 컨텍스트를 조합하고, 모델, 에이전트, 서비스 또는 사용자 정의 워크플로우를 호출한 다음 어떤 결과를 다시 보낼지 결정합니다. 이 경로는 엔지니어링 작업을 추가하지만 훨씬 더 많은 제어 기능을 제공합니다.
클라이언트 위임은 결과를 발표하기 전에 검증하거나 수정해야 하거나, 여러 백엔드에 사용자 지정 라우팅이 필요하거나, 개인 시스템이 기존 에이전트 하네스 내에 있어야 하거나, 팀에 자체 예산, 체크포인트 및 대체 논리가 필요한 경우에 더 적합합니다.
두 모드 모두에서 GPT-Live 1가 아닌 애플리케이션이 권한, 확인, 비즈니스 기록 및 내구성 있는 작업 상태를 담당합니다. 위임은 인증 시스템이 아닌 통신 메커니즘입니다.
중요한 GPT Live 1 기능
- 동시 듣기 및 말하기: 모델은 들어오고 나가는 오디오를 각각 분리된 회전으로 처리하는 대신 함께 고려합니다.
- 자연적인 중단 처리: 백채널, 수정 또는 발언권을 장악하려는 진정한 시도에 다르게 반응할 수 있습니다.
- 위임된 추론 및 도구: 더 심층적인 작업은 선택된 응답 모델이나 애플리케이션 운영 백엔드를 통해 실행할 수 있습니다.
- 프롬프트된 음성 동작: 개발자는 어조, 속도, 스타일, 백채널, 중단 동작 및 모델이 위임해야 하는 시기를 형성할 수 있습니다.
- 원어민 성적표: ASR 스크립트와 응답 텍스트는 오디오 스트림과 함께 제공됩니다.
- 영숫자 및 키워드 지원: OpenAI는 이름, 코드 및 기타 정확한 문자열에 대한 보다 강력한 처리와 키워드 바이어스를 강조합니다.
- 침묵 및 배경 소음 처리: 이 모델은 모든 소리나 일시 정지를 응답 명령으로 처리하지 않도록 설계되었습니다.
- 장기 세션 안정성: OpenAI는 더 긴 상호 작용에서 컨텍스트 유지 및 대화 품질을 향상시켰다고 말합니다.
- 브라우저, 서버 및 전화 연결: 문서화된 경로에는 WebRTC, WebSockets, 측파대 제어 및 전화 통신/SIP가 포함됩니다.
모델 페이지에는 지원되는 스트리밍 및 함수 호출도 나열되어 있습니다. GPT-Live 1에서는 구조화된 출력, 미세 조정 및 예측 출력이 지원되지 않습니다.
GPT Live 1 가격
헤드라인 요율은 간단합니다. 프런트엔드 음성 세션의 경우 분당 0.05 USD. OpenAI는 초 단위로 요금이 청구되므로 61초 세션은 2분으로 반올림되지 않습니다.
음성 세션 비용
| 음성 사용 | GPT-Live 1 프런트엔드 비용 |
|---|---|
| 10분 | $0.50 |
| 30분 | $1.50 |
| 100시간(6,000분) | $300 |
| 1,000시간(60,000분) | $3,000 |
이러한 예는 간단한 정가 곱셈입니다. 이는 대화 계층을 추정하는 데 유용하지만 음성 에이전트를 운영하는 데 드는 총 비용이 아닙니다..
분당 $0.05에 포함되지 않은 비용
- 추론을 수행하거나 위임된 결과를 생성하는 백엔드 모델입니다.
- 웹 검색이나 기타 제공업체 서비스와 같은 유료 도구.
- 통신사, 전화번호, SIP 또는 파트너 플랫폼 요금.
- 서버, 스토리지, 모니터링, 관찰 가능성 및 오디오 인프라.
- 인적 에스컬레이션, 품질 검토, 지원 운영
따라서 현실적인 예측은 다음과 같습니다. 음성 세션 시간 + 백엔드 사용량 + 도구 + 전화/교통 + 애플리케이션 비용. 파일럿 중에 해당 조각을 별도로 캡처하십시오. 보다 자연스러운 통화가 더 빨리 해결되거나 더 긴 대화를 유도할 수 있기 때문에 완료된 작업당 비용이 분당 비용보다 더 유용한 경우가 많습니다.
OpenAI의 모델 페이지는 동시 세션의 속도 제한을 측정합니다. 현재 Tier 1의 경우 25개, Tier 2의 경우 50개, Tier 3의 경우 200개, Tier 4의 경우 300개, Tier 5의 경우 500개 세션이 나열되어 있습니다. 프로덕션 팀은 대규모 출시 전에 현재 제한을 확인하고 용량을 요청해야 합니다.
GPT Live 1 대 GPT-Realtime-2.1
둘 다 OpenAI 음성 모델이지만 아키텍처를 다르게 해결합니다. GPT-Realtime-2.1는 실시간 세션 내에서 텍스트, 이미지, 오디오 컨텍스트 및 호출 기능을 수신할 수 있는 음성-음성 추론 모델입니다. GPT-Live 1는 더 깊은 추론과 작업을 별도의 백엔드에 위임하는 전용 전이중 대화 프런트엔드입니다.
| 질문 | GPT-Live 1 | GPT-Realtime-2.1 |
|---|---|---|
| 핵심 디자인 | 전이중 음성 프런트엔드와 위임된 백엔드 | 세션에서 추론 및 함수 호출이 포함된 실시간 음성 대 음성 모델 |
| 게시된 청구서 | 세션 분당 $0.05 및 백엔드 사용량 | 토큰 기반: 오디오, 텍스트 및 이미지 속도는 입력/출력 클래스에 따라 다릅니다. |
| 음성 행동 | 동시 듣기 및 말하기를 중심으로 설계됨 | 회전 감지 및 방해 처리를 통한 실시간 대화 |
| 프런트엔드 입력 | 텍스트 및 오디오 | 텍스트, 이미지, 오디오 |
| 백엔드 유연성 | 응답 모델 또는 클라이언트 운영 모델, 에이전트 또는 서비스 | 하나의 구성된 실시간 모델과 사용 가능한 도구 |
| 테스트를 하는 가장 좋은 이유 | 보다 자연스러운 오버랩과 독립적인 백엔드 라우팅 | 토큰 기반 사용이 가능한 통합 다중 모드 실시간 세션 |
가격 행은 공정하고 보편적인 "저렴한 모델" 판정으로 변환될 수 없습니다. GPT-Live 1는 경과된 세션 시간에 대해 요금을 부과하고 백엔드 청구서를 추가합니다. GPT-Realtime-2.1는 여러 미디어 클래스에 걸쳐 토큰을 청구합니다. 침묵, 말하기 비율, 응답 길이, 이미지 사용, 도구, 캐싱 및 백엔드 선택 모두 결과를 변경합니다.
Cody의 모델 라이브러리를 사용하여 현재 검사 GPT-Live 1 대 GPT-Realtime-2.1 비교 또는 GPT-Live 1를 다른 모델과 비교하십시오. 음성 및 실시간 카테고리.
GPT Live 1와 기존 STT-LLM-TTS 파이프라인 비교
기존 음성 에이전트는 일반적으로 음성-텍스트, 언어 모델, 텍스트-음성이라는 세 가지 시스템을 연결합니다. 그 모듈성은 가치가 있습니다. 팀은 언어에 가장 적합한 전사 모델을 선택하고, 음성이 시작되기 전에 전체 텍스트 응답을 검증하고, 모든 것을 교체하지 않고도 하나의 구성 요소를 교체할 수 있습니다.
절충안은 오케스트레이션입니다. 모든 핸드오프는 또 다른 대기열, 또 다른 형식 변환, 타이밍이나 컨텍스트가 손실될 수 있는 또 다른 장소를 생성합니다. 애플리케이션은 발언이 끝나는 시점, 호출자가 합성된 음성을 중단하는 경우 수행할 작업, 자체 수정 후 기록이 어떻게 변경되어야 하는지를 결정해야 합니다.
GPT-Live 1는 청취 및 말하기 단계를 하나의 연속 음성 레이어로 축소하는 동시에 더 깊은 작업을 위해 별도의 백엔드를 유지합니다. 이는 차례대로 진행하는 것을 단순화하고 "워키토키" 느낌을 줄일 수 있지만 애플리케이션 계층의 필요성을 제거하지는 않습니다. 앱은 여전히 작업, 개인 정보 보호, 오류 복구, 전화 통신 및 작업에 대한 정보 소스를 관리해야 합니다.
가장 어려운 요구사항을 기준으로 선택하세요. 완전한 음성 전 검증과 구성 요소 수준 제어가 필수인 경우 계단식 파이프라인이 여전히 매력적일 수 있습니다. 작업이 실행되는 동안 대화 흐름, 중복 및 지속적인 참여가 핵심이라면 GPT-Live 1는 테스트하기에 매력적인 아키텍처입니다.
OpenAI의 벤치마크가 증명하는 것과 증명하지 않는 것
OpenAI는 GPT-Live 1가 Full Duplex Bench 결과를 다음과 같이 개선했다고 보고합니다. 30퍼센트 포인트 GPT-Realtime-2.1보다 턴 테이킹 대기 시간과 대화형 동작이 향상되었습니다. 중간 수준의 추론 노력으로 GPT-6 Astra와 결합된 OpenAI는 엔드 투 엔드 음성 에이전트 작업에 대한 최고의 Tau3 결과도 보고합니다.
초기 고객 평가에서 언어 학습 회사인 Speak는 이전 턴 기반 시스템보다 학습자의 사고가 잠시 중단되는 동안 방해가 거의 80% 적다고 보고했습니다. OpenAI는 Yelp, Fin, Cognition 등의 호의적인 고객 계정도 게시했습니다.
이러한 결과는 유용한 신호이지만 여전히 남아 있습니다. 공급자가 게시한 평가 및 고객 보고서. Astra 결과는 GPT-Live 1 단독이 아닌 결합된 시스템을 측정합니다. 어떤 숫자도 전화 통신사, 악센트, 소음, 도구 대기 시간, 메시지 또는 비즈니스 작업 흐름에 대한 성능을 보장하지 않습니다. 우리는 이를 Cody 벤치마크로 재현하지 않았습니다.
강력한 평가는 최소한 완료된 작업, 부적절한 중단, 수정 후 복구, 턴 종료 시점, 도구 정확도, 대기 시간 백분위수, 에스컬레이션 품질, 완료된 작업당 비용, 대표 통화에 대한 인간 선호도를 평가해야 합니다.
GPT Live 1 음성 및 언어 지원
OpenAI 출시에는 12가지 목소리가 나열되어 있습니다. 쿼츠, 리플, 베스퍼, 윌로우, 스톤, 글림, 자오선, 보사, 템포, 비컨, 델타, 신더. 회사는 이번 선택으로 악센트, 방언, 언어 전반에 걸쳐 적용 범위가 확대되었으며 시간이 지남에 따라 더 많은 기능을 추가할 계획이라고 밝혔습니다.
OpenAI는 GPT-Live 1 모델 페이지에 하나의 정확한 언어 목록을 게시하지 않습니다. 따라서 "광범위한 언어 가용성"이 모든 로케일, 악센트 또는 코드 전환 패턴을 보장하는 것으로 해석되어서는 안 됩니다. 실제 스피커, 배경 조건, 이름, 주소, 확인 문구 및 제품이 지원하기로 약속한 언어를 테스트하세요.
사용자 정의 음성 액세스는 셀프 서비스 기본값이 아닙니다. OpenAI는 관심 있는 조직이 영업 담당자에게 자격 여부 및 요청 프로세스를 문의하도록 지시합니다.
GPT Live 1 연결 방법
OpenAI는 여러 연결 패턴을 문서화합니다. 올바른 것은 오디오가 발생하는 위치와 세션 제어가 필요한 시스템에 따라 다릅니다.
브라우저 음성 앱용 WebRTC
WebRTC는 브라우저 기반 음성 애플리케이션에 권장되는 시작점입니다. 미디어 트랙은 마이크와 스피커 오디오를 전달하고, 데이터 채널은 세션 이벤트를 전달합니다. 신뢰할 수 있는 서버는 세션을 생성하고 OpenAI API 키를 브라우저에서 보호해야 합니다.
서버측 오디오용 WebSocket
WebSocket은 애플리케이션이 오디오 스트림을 소유하는 서버 측 통합에 적합합니다. 메인 소켓은 오디오 및 제어 이벤트를 전달합니다. 브라우저가 WebRTC 연결을 소유하고 있지만 서버에 여전히 기록, 모니터링 또는 수정 지침이 필요한 경우 측파대 WebSocket는 WebRTC에서 오디오를 이동하지 않고 서버 컨트롤을 연결할 수 있습니다.
전화 상담원을 위한 전화 통신 및 SIP
OpenAI는 전화 통신 및 SIP 통합 경로를 문서화하고 LiveKit, Twilio, Telnyx, Daily 및 Pipecat와 같은 시스템에 대한 파트너 지침을 제공합니다. 이동통신사 및 파트너 요금은 GPT-Live 1 세션 요금과 별도로 유지됩니다.
실용적인 GPT Live 1 설정 계획
- 하나의 좁은 통화를 선택하십시오. 다목적 상담원이 아닌 주문 확인, 리드 선별, 약속 찾기 등 제한된 워크플로로 시작하세요.
- 연결을 선택하세요. 브라우저 프로토타입에는 WebRTC를 사용하고, 서버가 오디오를 소유하는 경우에는 WebSocket을 사용하고, 전화 통화를 위해 문서화된 전화 통신 경로를 사용하세요.
- 실시간 프롬프트를 짧게 유지하세요. 음성 프롬프트에 어조, 속도, 방해 스타일, 백채널 및 위임 정책을 입력하세요. 백엔드에 상세한 비즈니스 워크플로우와 도구 규칙을 유지하세요.
- 위임을 선택합니다. 관리형 OpenAI 백엔드에 대한 응답 위임으로 시작하세요. 사용자 정의 컨텍스트, 검증, 라우팅 또는 비OpenAI 서비스가 필요한 경우 클라이언트 위임을 사용하십시오.
- 코드에 작업 규칙을 적용합니다. 도구가 실행되기 전에 신원, 권한 부여, 확인, 예산 및 허용된 상태 변경을 확인하세요.
- 기록 및 작업 상태를 보존합니다. 성적 증명서 델타가 불완전하거나 잘못되었을 수 있습니다. '예', '대신 금요일' 및 이전 세부정보를 참조하는 수정 사항을 이해할 수 있도록 충분한 기록을 저장하세요.
- 지저분한 오디오를 테스트합니다. 생각이 느린 사람, 방해, 잡담, 소음, 철자법, 계좌 번호, 침묵, 연결 끊김 및 사람에게 에스컬레이션하는 내용을 포함합니다.
- 전체 시스템을 측정합니다. 대화 품질과 백엔드 작업 성공을 모두 추적하고 음성 분당 비율을 벗어나는 모든 비용을 추적합니다.
실시간 또는 계단식 음성 스택에서 마이그레이션
마이그레이션은 단순히 모델 ID를 변경하는 것이 아닙니다. 가장 중요한 변화는 의도적으로 책임을 분할하는 것입니다.
- 대화 스타일을 라이브 프롬프트로 옮깁니다. 음성이 말하고, 기다리고, 확인하고, 중단하고, 위임하는 방법을 정의합니다.
- 백엔드에 세부적인 워크플로우를 유지하세요. 비즈니스 규칙, 도구 스키마, 유효성 검사, 권한 및 긴 출력은 작업을 수행하는 에이전트에 속합니다.
- 지속적인 오디오 이벤트에 적응합니다. GPT-Live 1는 오디오를 지속적으로 스트리밍하며 실시간 API와는 다른 세션 이벤트를 갖습니다. 동일한 수동 커밋 및 트리거 흐름을 가정하지 마십시오.
- 함수 호출을 위임으로 변환합니다. 라이브 프런트엔드는 텍스트나 실시간 에이전트와 같은 방식으로 일반적인 구조화된 도구 인수를 발행하는 대신 백엔드에 도움을 요청합니다.
- 기존 보호 장치를 유지하십시오. 모니터링, 조치 블록, 확인, 감사 기록, 취소 및 에스컬레이션을 유지합니다. 검사가 실행되는 동안 계속 말할 수 있는 모델에 맞게 조정하세요.
정책이 허용하는 동일한 기록 시나리오에 대해 이전 아키텍처와 새 아키텍처를 실행합니다. 세련된 데모가 아닌 전체 통화 결과를 비교하세요. 우리의 별도 음성 에이전트 대기 시간 안내 전송, 전사, 추론, 도구 및 재생을 함께 측정해야 하는 이유를 설명합니다.
이해할만한 생산 주의 사항
귀하의 애플리케이션은 여전히 위험한 결정을 소유하고 있습니다.
GPT-Live 1는 대화를 자신감있게 만들 수 있습니다. 이는 외부 조치가 승인되었거나 완료되었음을 증명하지 않습니다. 약속 변경, 카드 충전, 계좌 기록 노출, 성공 발표 전에 권한과 필수 확인 사항을 확인하세요. 음성 세션 외부에서 진실의 근원(source-of-truth) 작업 상태를 유지합니다.
중단은 취소가 아니다
목요일 조회가 실행되는 동안 발신자가 "실제로는 대신 금요일입니다."라고 말하면 통화를 중단해도 해당 조회가 취소되지 않습니다. 애플리케이션은 활성 작업을 수정하고, 오래된 확인을 무효화하고, 가능한 경우 작업을 취소하고, 목요일 늦은 결과가 최신 결과로 표시되지 않도록 해야 합니다.
지속적인 음성으로 인해 가드레일 디자인이 변경됨
텍스트 에이전트는 전체 답변을 표시하기 전에 완료하고 유효성을 검사할 수 있습니다. GPT-Live 1는 백엔드 작업 또는 정책 확인이 계속되는 동안 말할 수 있습니다. 도구 결과를 보류한다고 해서 음성 프런트엔드가 침묵을 유지한다는 보장은 없습니다. 대화 내용과 작업을 모두 모니터링하고, 애플리케이션 코드에서 안전하지 않은 도구를 차단하고, 연설 전 승인이 필요한 재생을 제어하세요.
일부 결정에는 여전히 원본 오디오가 필요합니다.
위임된 백엔드는 원시 파형을 자동으로 수신하지 않습니다. 워크플로가 음성 메일 경고음, 화자 흐름, 두 번째 사람 참여 또는 기타 비텍스트 신호 등 음향 증거에 의존하는 경우 원본 오디오를 적절한 감지기나 검토자에게 라우팅합니다. 프런트엔드에서 들었던 모든 신호가 녹취록에 포함되어 있다고 가정하지 마세요.
GPT Live 1를 테스트해야 하는 사람은 누구입니까?
GPT-Live 1는 고객 지원, 약속 일정 관리, 레스토랑 예약, 언어 교육, 판매 자격, 접근성, 핸즈프리 작업, 협업 음성 인터페이스 등 대화 타이밍이 업무의 일부인 제품에 가장 흥미롭습니다.
단방향 내레이션, 파일 전사, 간단한 텍스트 음성 변환 또는 오디오를 재생하기 전에 모든 완전한 문장을 검증해야 하는 워크플로에는 그다지 필요하지 않습니다. 전문 음성 서비스 또는 계단식 스택은 이러한 경우에 대해 보다 직접적인 제어를 제공할 수 있습니다.
현실적인 결정은 “GPT-Live 1가 최고의 음성 모델인가?”가 아니다. 그것은: 전이중 대화와 별도로 선택한 백엔드가 아키텍처와 총 비용을 정당화할 만큼 작업 성공을 향상합니까? 대표 조종사가 이에 답할 수 있습니다. 벤치마크 헤드라인은 그럴 수 없습니다.
자주 묻는 질문
GPT Live 1란 무엇입니까?
GPT-Live 1는 실시간 대화를 위한 OpenAI의 전이중 음성 모델입니다. 동시에 듣고 말하는 다음, 더 깊은 추론과 도구 작업을 별도의 백엔드 에이전트에 위임합니다.
GPT Live 1의 가격은 얼마입니까?
프런트 엔드 음성 세션 비용은 분당 0.05달러이며 초당 요금이 청구됩니다. 백엔드 모델 사용, 도구, 전화 통신, 스토리지 및 애플리케이션 인프라 비용은 추가로 발생합니다.
GPT Live 1를 지금 사용할 수 있나요?
예. OpenAI는 2026년 9월 10일 API에서 GPT-Live 1를 출시했습니다. 정확한 API 모델 ID는 gpt-live-1. OpenAI의 모델 페이지에는 무료 API 계층이 지원되지 않는다고 나와 있습니다.
전이중 음성 AI란?
전이중은 음성 시스템이 말하는 동안 들을 수 있음을 의미합니다. 따라서 한 번에 한 명의 화자가 엄격한 방식으로 교환하는 것보다 겹치는 연설, 승인, 중단 및 자연스러운 일시 중지를 더 쉽게 처리할 수 있습니다.
GPT Live 1와 GPT-Realtime-2.1의 차이점은 무엇입니까?
GPT-Live 1는 백엔드 모델에 더 심층적인 작업을 위임하는 분당 청구되는 전이중 음성 프런트엔드입니다. GPT-Realtime-2.1는 실시간 세션 내에서 오디오, 추론 및 함수 호출을 처리하는 토큰 청구 음성 간 모델입니다.
GPT Live 1는 도구를 호출할 수 있나요?
예, 위임을 통해 가능합니다. 응답 위임은 선택된 OpenAI 응답 모델을 사용합니다. 클라이언트 위임을 통해 애플리케이션은 다른 모델, 에이전트, 서비스 또는 사용자 정의 워크플로를 호출하고 어떤 확인된 결과가 반환되는지 결정할 수 있습니다.
GPT Live 1를 중단하면 백엔드 작업이 취소되나요?
아니요. 음성을 중단해도 백엔드 작업이 자동으로 취소되지는 않습니다. 애플리케이션은 오래된 결과를 취소, 수정 또는 삭제할지 결정해야 합니다.
GPT Live 1는 WebRTC, WebSocket 및 전화 통화를 지원합니까?
예. OpenAI는 브라우저 음성 앱용 WebRTC, 서버 측 오디오용 WebSocket, 측대역 서버 제어 및 전화 통신 또는 SIP 통합 경로를 문서화합니다.
GPT Live 1에는 어떤 음성을 사용할 수 있나요?
OpenAI 출시에는 Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta 및 Cinder가 포함됩니다. 맞춤형 음성 액세스에는 자격 및 판매 프로세스가 필요합니다.
출처와 방법론
이 기사는 2026년 9월 11일 자사 OpenAI 자료와 비교하여 확인되었습니다. 벤치마크 및 고객 결과는 독립적인 Cody 측정값으로 표시되지 않고 OpenAI 보고로 표시됩니다.
- OpenAI: GPT-Live 1 API 출시 발표
- OpenAI: GPT-Live 1 모델 페이지, 가격, 기능 및 속도 제한
- OpenAI: GPT-Live 시작하기
- OpenAI: GPT-Live 프롬프트 가이드
- OpenAI: GPT-Live 위임 및 도구
- OpenAI: GPT-Live에 대한 마이그레이션 지침
- OpenAI: API 가격
결론
GPT-Live 1는 새로운 합성 음성 그 이상입니다. 음성 에이전트의 모양을 변경합니다. 하나의 전이중 모델이 인간의 대화 리듬을 관리하는 반면, 별도로 선택된 백엔드는 더 어려운 작업을 처리합니다.
분당 0.05달러의 가격으로 인해 프런트엔드를 쉽게 예측할 수 있지만 백엔드, 도구, 전화 네트워크 및 애플리케이션은 여전히 총 비용과 작업 품질의 상당 부분을 결정합니다. 가장 유용한 다음 단계는 깔끔한 스크립트 데모가 아닌 현실적인 중단, 수정, 소음 및 권한을 갖춘 좁은 파일럿입니다.
탐색 GPT-Live 1 모델 가이드, 직접 비교해보세요 GPT-Realtime-2.1, 또는 전체 내용을 찾아보세요. 음성 AI 모델 디렉토리.


