일반 영어 개요
GPT-Realtime-2.1는 실제로 무엇입니까?
GPT-Realtime-2.1는 모델이 하나의 실시간 세션에서 듣고, 말하고, 지침을 따르고, 도구를 호출해야 하는 실시간 대화용으로 설계되었습니다. OpenAI는 이전 버전에 비해 향상된 중단, 무음, 소음 및 영숫자 처리를 강조합니다.
오디오, 텍스트 및 이미지 입력은 다양한 토큰 클래스로 청구됩니다. 따라서 현실적인 예산에는 오디오 시간만으로 단순한 변환이 아닌 전체 대화에서 캡처된 사용량이 필요합니다.
다음에 적합
- 도구를 사용하는 고객 또는 직원 음성 에이전트
- 다중 모드 실시간 도우미
- OpenAI 기본 에이전트 스택
카테고리 비교
음성 모델에 중요한 사실
이는 Cody 벤치마크 점수가 아닌 공급자가 게시한 사양입니다. 현재 제한 및 엔드포인트별 예외는 연결된 소스를 따르세요.
- 가격 기준
- 오디오 $32 입력 · $64 출력 / 100만 토큰나열된 액세스 경로에 대한 토큰, 문자 또는 분 기반 가격입니다.
- 상호작용 모드
- 텍스트/이미지 컨텍스트를 갖춘 음성 대 음성음성-음성, 오디오-오디오 또는 스트리밍된 텍스트-음성 동작.
- 게시된 지연 시간
- 게시되지 않음명시된 제외 사항이 포함된 공급자 게시 측정값 Cody 테스트가 아닙니다.
- 언어
- 다국어; 여기에 게시되지 않은 정확한 목록제공자가 문서화한 언어 적용 범위 또는 명확한 미발표 표시.
- 도구 및 제어
- 함수 호출 및 구성 가능한 추론기본 함수 호출, 추론 또는 음성 제어 기능.
- 컨텍스트 또는 입력 제한
- 128K 입력 · 32K 최대 출력의미 있는 경우 문서화된 토큰 또는 문자 제한입니다.
가용성
지역 및 액세스 단계
지원되는 국가 및 지역에서 OpenAI의 Realtime API를 통해 사용할 수 있습니다.
직접 액세스는 OpenAI의 실시간 지원 국가 목록을 따릅니다.
실시간 가용성 확인데이터 및 교육
경로가 중요합니다.
OpenAI는 API 콘텐츠가 기본적으로 교육에 사용되지 않는다고 말합니다. 기본 남용 모니터링 로그는 최대 30일까지 보관될 수 있으며 자격을 갖춘 조직에서는 추가 제어가 가능합니다.
이는 법적 조언이 아닌 인용된 제공자 자료에 대한 간략한 설명입니다. 타사 게이트웨이는 모델 제작자의 직접 API와 다른 스토리지, 라우팅, 교육 및 상주 조건을 가질 수 있습니다.
공급자 정책 읽기자주 묻는 질문
GPT-Realtime-2.1 FAQ
GPT-Realtime-2.1란 무엇입니까?
텍스트 및 이미지 컨텍스트도 필요한 도구 사용 음성 에이전트를 위한 OpenAI의 실시간 음성 대 음성 추론 모델입니다. GPT-Realtime-2.1는 모델이 하나의 실시간 세션에서 듣고, 말하고, 지침을 따르고, 도구를 호출해야 하는 실시간 대화용으로 설계되었습니다. OpenAI는 이전 버전에 비해 향상된 중단, 무음, 소음 및 영숫자 처리를 강조합니다.
GPT-Realtime-2.1는 언제 출시되었나요?
공급자는 Cody가 검토한 소스 자료에 GPT-Realtime-2.1의 명확한 출시 날짜를 게시하지 않습니다.
GPT-Realtime-2.1에 어디서 접속할 수 있나요?
지원되는 국가 및 지역에서 OpenAI의 Realtime API를 통해 사용할 수 있습니다. 이 가이드에 나열된 액세스 경로는 OpenAI입니다.
GPT-Realtime-2.1의 가격은 얼마입니까?
$32 오디오 입력 · $64 오디오 출력 / 100만 토큰. 텍스트는 백만 토큰당 입력 4달러, 출력 24달러입니다. 이미지 입력은 백만 토큰당 5달러입니다. 캐시된 입력 속도는 다릅니다.
GPT-Realtime-2.1는 어디에서 사용할 수 있나요?
지원되는 국가 및 지역에서 OpenAI의 Realtime API를 통해 사용할 수 있습니다. 직접 액세스는 OpenAI의 실시간 지원 국가 목록을 따릅니다.
내 GPT-Realtime-2.1 API 데이터가 교육에 사용됩니까?
OpenAI는 API 콘텐츠가 기본적으로 교육에 사용되지 않는다고 말합니다. 기본 남용 모니터링 로그는 최대 30일까지 보관될 수 있으며 자격을 갖춘 조직에서는 추가 제어가 가능합니다. 정책은 공급자 경로 및 계정 조건에 속하므로 프로덕션 사용 전에 다시 확인하십시오.
관련 비교
일대일 비교
GPT-Realtime-2.1 vs Gemini 3.1 Flash Live Preview
Google의 미리 보기 오디오-오디오 모델은 다중 모드 인식, 사고, 검색 기반 및 기능 호출을 통해 지연 시간이 짧은 대화를 제공합니다.
전체 비교 열기GPT-Realtime-2.1 vs Eleven v3 Conversational
ElevenLabs' 자연스러운 대화, 감정 전달, 오디오 태그 및 70개 이상의 언어를 위한 표현력이 풍부한 실시간 텍스트 음성 변환 모델입니다.
전체 비교 열기GPT-Realtime-2.1 vs Inworld Realtime TTS-2
Inworld의 최신 표현력이 풍부한 실시간 텍스트 음성 변환 모델은 대화 내용을 기억하고 100개 이상의 언어로 말할 수 있도록 설계되었습니다.
전체 비교 열기GPT-Realtime-2.1 vs Grok Voice Think Fast 2.0
도구 액세스가 가능한 1초 미만의 대화 에이전트를 위한 SpaceXAI의 현재 실시간 음성 대 음성 모델입니다.
전체 비교 열기