모델 비교
MAI-Transcribe-2 대 Chirp 3
동일한 공급자 소스 음성 인식 및 전사 루브릭을 사용하여 MAI-Transcribe-2와 Chirp 3를 비교합니다. 미스터리 점수도 없고 벤치마크 순위도 만들어지지 않았습니다.
모델 비교
동일한 공급자 소스 음성 인식 및 전사 루브릭을 사용하여 MAI-Transcribe-2와 Chirp 3를 비교합니다. 미스터리 점수도 없고 벤치마크 순위도 만들어지지 않았습니다.
사용량을 입력하면 예상 비용이 바로 업데이트됩니다.
녹음 길이를 시간 단위로 입력합니다. 30분은 0.5시간입니다. 추가 기능과 최소 요금에 따라 청구액이 달라질 수 있습니다.
세금, 도구, 캐시 저장·쓰기, 무료 할당량, 개별 할인은 제외됩니다. 이미지 비용은 출력만 포함하며 프롬프트와 참조 이미지 비용은 제외됩니다. 품질 모드는 모델마다 다릅니다. 미등록 설정은 무료로 간주하지 않습니다.
| 모델 | 액세스 | 예상 총액 (USD) |
|---|---|---|
| Chirp 3Google Cloud | Google Cloud | 검토된 요금 없음 |
| MAI-Transcribe-2Microsoft | Microsoft | 검토된 요금 없음 |
빠른 테이크
긴 녹음, 화자 레이블, 단어 타이밍, 키워드 편향 및 깔끔한 또는 축어적 대본을 위한 Microsoft의 빠른 일괄 대본 모델입니다.
Microsoft의 약 10초당 1시간 수치는 보장된 SLA가 아니라 공급자의 주장입니다. 자신의 오디오를 벤치마킹하고 미리 보기 후 가격, 배포 지역, 할당량 및 보존 구성을 확인하세요.
다양한 언어와 지역에서 스트리밍, 파일 및 저렴한 동적 배치 전사를 위한 Google Cloud의 일반 음성-텍스트 모델입니다.
정확한 언어와 지역은 Chirp 3 표를 확인하세요. 화자 라벨, 타임스탬프, 적응 및 일괄 동작에는 단일 적용 범위 번호로 숨길 수 있는 경로별 제약이 있습니다.
공개된 사실을 비교해보세요
값은 각 공급자가 게시한 단위와 한도를 사용합니다. 공백은 공급자가 검토된 소스에서 직접적으로 비교할 수 있는 값을 게시하지 않았음을 의미합니다.
| 음성 인식 및 전사 | MAI-Transcribe-2 | Chirp 3 |
|---|---|---|
| 전사 가격나열된 처리 경로에 대한 오디오 시간 또는 분당 현재 공급자 가격입니다. | $0.10 / 오디오 시간 제한 요금 | $0.016/분 표준 · $0.003/분 동적 배치 |
| 라이브 또는 배치모델이 실시간 스트림, 업로드된 녹음 또는 둘 다를 처리하는지 여부입니다. | 빠른 배치 및 장문 전사 | 스트리밍, 동기 및 배치 |
| 언어공급자가 게시한 언어 적용 범위, 필요한 경우 특별히 검증된 언어와 훈련되거나 광고된 적용 범위를 분리합니다. | 60개 언어 | 85개 이상의 언어 및 로케일 |
| 화자 라벨모델이 발언한 사람과 발표된 발언자 수 제한을 식별하는지 여부입니다. | 예 | 문서화된 언어 하위 집합에 대해 지원됩니다. |
| 타임스탬프사용 가능한 단어, 세그먼트 또는 발화 수준 타이밍 정보. | 단어 수준 타임스탬프 | 경로 제약 조건이 있는 단어 수준 타임스탬프 |
| 어휘 통제키워드 부스팅, 맞춤 철자법, 문맥, 프롬프트 또는 도메인 용어를 개선하는 기타 방법입니다. | 키워드 바이어스, 정리/말 그대로 출력, 자동 언어 감지 | 음성 적응, 맞춤형 어휘, 언어 감지, 노이즈 제거 |
| 사용처공급자가 문서화한 다이렉트 API, 클라우드 카탈로그, 애플리케이션 또는 지역 엔드포인트입니다. | Microsoft Foundry / 푸른빛 | Google Cloud 음성-텍스트 V2 |
선택 방법
완료해야 하는 작업부터 시작한 다음 정확한 공급자 경로에 대한 비용, 액세스 및 정책 세부 정보를 확인하세요.
Microsoft에 따르면 Foundry 모델에 제출된 프롬프트, 출력, 임베딩 및 교육 데이터는 모델 제공자가 사용할 수 없으며 허가 없이 기초 모델을 교육하는 데 사용되지 않습니다. 보관 및 남용 모니터링 세부정보는 배포된 서비스에 따라 다릅니다.
Google는 고객이 데이터 로깅을 선택하지 않는 한 Speech-to-Text 콘텐츠는 서비스 제공 외에는 사용되지 않는다고 말합니다. 스트리밍 및 동기 콘텐츠는 메모리에서 처리됩니다. 비동기 결과는 문서화된 대로 일시적으로 유지될 수 있습니다.
자주 묻는 질문
MAI-Transcribe-2: 긴 녹음, 화자 레이블, 단어 타이밍, 키워드 편향 및 깔끔한 또는 축어적 대본을 위한 Microsoft의 빠른 일괄 대본 모델입니다. Chirp 3: 다양한 언어와 지역에서 스트리밍, 파일 및 저렴한 동적 배치 전사를 위한 Google Cloud의 일반 음성-텍스트 모델입니다.
우선순위가 대용량 녹음 통화 및 회의인 경우 MAI-Transcribe-2를 고려하세요. 우선순위가 다국어 클라우드 전사인 경우 Chirp 3를 고려하세요. 커밋하기 전에 자체 데이터와 공급자 경로를 모두 테스트하세요.
아니요. 이 비교는 음성 인식 및 전사 범주에 대해 공급자가 게시한 사실과 일치합니다. 보편적인 승자를 주장하거나 호환되지 않는 타사 벤치마크 점수를 결합하지 않습니다.