機種比較
Chirp 3 vs Scribe v2
Compare Chirp 3 and Scribe v2 using the same provider-sourced 音声認識と文字起こし rubric.謎のスコアや発明されたベンチマークランキングはありません。
事実確認済み 2026年9月4日
機種比較
Compare Chirp 3 and Scribe v2 using the same provider-sourced 音声認識と文字起こし rubric.謎のスコアや発明されたベンチマークランキングはありません。
事実確認済み 2026年9月4日
利用量を入力すると、見積もりが自動で更新されます。
録音時間を時間単位で入力します。30分=0.5時間です。追加機能や最低料金で請求額が変わる場合があります。
税金、ツール、キャッシュ保存・書き込み、無料枠、個別割引は含みません。画像は出力料金のみで、プロンプトや参照画像の料金は含みません。品質モードはモデルごとに異なります。未掲載の設定を無料とは扱いません。
クイックテイク
Google Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。
正確な言語と地域については、Chirp 3 表を確認してください。スピーカー ラベル、タイムスタンプ、適応、およびバッチ動作には、単一のカバレッジ番号では隠蔽できるルート固有の制約があります。
ElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。
バッチとリアルタイムが同じルートまたは価格であると想定しないでください。ゼロデータ保持は自動ではなく条件付きであるため、機密オーディオを処理する前に、プラン、エンドポイント、リージョン、およびenable_loggingの動作を確認してください。
公表された事実を比較する
値には、各プロバイダーが独自に公開している単位と制限が使用されます。空白は、プロバイダーがレビューされた情報源で直接比較可能な値を公開していないことを意味します。
| 音声認識と文字起こし | Chirp 3 | Scribe v2 |
|---|---|---|
| 転写価格リストされた処理ルートの音声時間または分あたりの現在のプロバイダーの料金。 | 標準 $0.016/分 · 動的バッチ $0.003/分 | $0.22/音声時間。リアルタイムは別途記載 |
| ライブまたはバッチモデルがリアルタイム ストリーム、アップロードされた録画、またはその両方を処理するかどうか。 | ストリーミング、同期、バッチ | バッチおよび長い音声。別のリアルタイムルート |
| 言語プロバイダーが公開する言語のカバレッジ。必要に応じて、トレーニングまたは宣伝されたカバレッジを、特別に検証された言語から分離します。 | 85 以上の言語とロケール | 90以上の言語 |
| スピーカーラベルモデルが誰が発言したか、および公開されている発言者の制限を識別するかどうか。 | 文書化された言語のサブセットをサポート | 最大 32 個のスピーカー |
| タイムスタンプ利用可能な単語、セグメント、または発話レベルのタイミング情報。 | ルート制約のあるワードレベルのタイムスタンプ | ワードレベルのタイムスタンプ |
| 語彙コントロールキーワードブースティング、カスタムスペル、コンテキスト、プロンプト、またはドメイン用語を改善するその他の方法。 | 音声適応、カスタム語彙、言語検出、ノイズ除去 | 最大 1,000 個のキーワード。オーディオタグと言語検出 |
| どこで使用するかプロバイダーによって文書化されたダイレクト API、クラウド カタログ、アプリケーション、または地域のエンドポイント。 | Google Cloud 音声テキスト変換 V2 | ElevenLabs Speech-to-Text API |
選び方
完了する必要があるジョブから始めて、正確なプロバイダー ルートのコスト、アクセス、ポリシーの詳細を検証します。
Google によれば、顧客がデータ ログにオプトインしない限り、Speech-to-Text コンテンツはサービスの提供以外には使用されません。ストリーミングおよび同期コンテンツはメモリ内で処理されます。非同期結果は文書化されたとおりに一時的に保持される場合があります。
プロバイダーと API のリンク
ElevenLabs を使用すると、対象となる API 顧客がデータ使用設定を管理できます。 Enable_logging=false によるゼロデータ保持は、Scribe v2 を含む、対象となるエンタープライズ構成およびサポートされているモデルに限定されます。ライブ プランとリージョン エンドポイントを確認します。
プロバイダーと API のリンク
よくある質問
Chirp 3: Google Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。 Scribe v2: ElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。
優先順位が 多言語クラウド転写 の場合は、Chirp 3 を検討してください。優先順位が 多言語メディアの文字起こし の場合は、Scribe v2 を検討してください。 Test both with your own data and provider route before committing.
いいえ。この比較は、プロバイダーが公開した 音声認識と文字起こし カテゴリの事実を一致させます。普遍的な勝者を主張したり、互換性のないサードパーティのベンチマーク スコアを組み合わせたりするものではありません。