Inworld Realtime TTS-2
Inworld의 최신 표현력이 풍부한 실시간 텍스트 음성 변환 모델은 대화 내용을 기억하고 100개 이상의 언어로 말할 수 있도록 설계되었습니다.
Inworld의 최신 표현력이 풍부한 실시간 텍스트 음성 변환 모델은 대화 내용을 기억하고 100개 이상의 언어로 말할 수 있도록 설계되었습니다.
일반 영어 개요
Inworld Realtime TTS-2는 텍스트를 스트리밍 음성으로 변환하는 동시에 이전 오디오 변환을 사용하여 캐릭터 전달을 일관되게 유지합니다. 개발자는 원하는 분위기나 전달을 자연어로 설명하고, 언어를 전환하고, 권리와 계정 설정이 허용하는 경우 음성 복제를 사용할 수 있습니다.
가격은 오디오 토큰이 아닌 문자를 기준으로 책정되므로 스크립트를 더 쉽게 추정할 수 있습니다. Inworld는 첫 번째 오디오까지의 평균 시간을 200ms 미만으로 보고하지만 네트워크 거리, 애플리케이션 작업 및 업스트림 언어 모델은 여전히 전체 응답 시간에 영향을 미칩니다.
카테고리 비교
이는 Cody 벤치마크 점수가 아닌 공급자가 게시한 사양입니다. 현재 제한 및 엔드포인트별 예외는 연결된 소스를 따르세요.
API 및 공급자 액세스
가용성
일반적으로 Inworld의 REST TTS API 및 OpenAI 호환 Realtime API를 통해 사용할 수 있습니다.
표준 지역 적용 범위는 모델 페이지에 나열되지 않습니다. 엔터프라이즈 플랜은 EU 및 인도 데이터 상주 옵션을 광고합니다.
실시간 가용성 확인데이터 및 교육
Inworld는 엔터프라이즈 추가 기능으로 데이터 보존 제로를 광고하지만 현재 게시된 ZDR 지원 페이지에는 TTS-1.5 Mini 및 Max만 나와 있습니다. 규제 또는 기밀 문자를 보내기 전에 TTS-2 적용 범위를 직접 확인하세요.
이는 법적 조언이 아닌 인용된 제공자 자료에 대한 간략한 설명입니다. 타사 게이트웨이는 모델 제작자의 직접 API와 다른 스토리지, 라우팅, 교육 및 상주 조건을 가질 수 있습니다.
공급자 정책 읽기자주 묻는 질문
Inworld의 최신 표현력이 풍부한 실시간 텍스트 음성 변환 모델은 대화 내용을 기억하고 100개 이상의 언어로 말할 수 있도록 설계되었습니다. Inworld Realtime TTS-2는 텍스트를 스트리밍 음성으로 변환하는 동시에 이전 오디오 변환을 사용하여 캐릭터 전달을 일관되게 유지합니다. 개발자는 원하는 분위기나 전달을 자연어로 설명하고, 언어를 전환하고, 권리와 계정 설정이 허용하는 경우 음성 복제를 사용할 수 있습니다.
Inworld Realtime TTS-2는 인용된 공급자 자료에 따라 2026년 8월 31일에서 릴리스되었습니다.
일반적으로 Inworld의 REST TTS API 및 OpenAI 호환 Realtime API를 통해 사용할 수 있습니다. 이 가이드에 나열된 액세스 경로는 Inworld AI입니다.
$25 / 주문형 1백만 자. 게시된 구독 요금은 계층별로 백만 문자당 20달러, 17.50달러, 15달러, 12.50달러로 떨어지며 기업 가격은 5달러까지 낮습니다.
일반적으로 Inworld의 REST TTS API 및 OpenAI 호환 Realtime API를 통해 사용할 수 있습니다. 표준 지역 적용 범위는 모델 페이지에 나열되지 않습니다. 엔터프라이즈 플랜은 EU 및 인도 데이터 상주 옵션을 광고합니다.
Inworld는 엔터프라이즈 추가 기능으로 데이터 보존 제로를 광고하지만 현재 게시된 ZDR 지원 페이지에는 TTS-1.5 Mini 및 Max만 나와 있습니다. 규제 또는 기밀 문자를 보내기 전에 TTS-2 적용 범위를 직접 확인하세요. 정책은 공급자 경로 및 계정 조건에 속하므로 프로덕션 사용 전에 다시 확인하십시오.
관련 비교
130개 언어로 표현력 있는 내레이션, 캐릭터 음성, 대화를 생성하는 Google 음성 모델입니다.
전체 비교 열기101개 언어의 읽어주기 기능과 대량 오디오 제작을 위한 Google의 저비용 음성 생성 모델입니다.
전체 비교 열기별도의 백엔드 에이전트에 더 깊은 추론과 작업을 위임하는 자연스러운 대화를 위한 OpenAI의 전이중 음성 프런트엔드입니다.
전체 비교 열기오디오, 텍스트, 시각적 맥락을 활용해 빠르게 대화하는 Google의 실시간 음성 모델.
전체 비교 열기대화를 이어가면서 복잡한 요청을 백그라운드에서 처리하는 별도의 Gemini 음성 모델.
전체 비교 열기텍스트 및 이미지 컨텍스트도 필요한 도구 사용 음성 에이전트를 위한 OpenAI의 실시간 음성 대 음성 추론 모델입니다.
전체 비교 열기Google의 미리 보기 오디오-오디오 모델은 다중 모드 인식, 사고, 검색 기반 및 기능 호출을 통해 지연 시간이 짧은 대화를 제공합니다.
전체 비교 열기ElevenLabs' 자연스러운 대화, 감정 전달, 오디오 태그 및 70개 이상의 언어를 위한 표현력이 풍부한 실시간 텍스트 음성 변환 모델입니다.
전체 비교 열기도구 액세스가 가능한 1초 미만의 대화 에이전트를 위한 SpaceXAI의 현재 실시간 음성 대 음성 모델입니다.
전체 비교 열기