Chirp 3
Google Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。
Google Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。
平易な英語による概要
Chirp 3 は Google Cloud Speech-to-Text V2 内に組み込まれているため、1 つの固定アプリではなく、複数の操作パターンをサポートします。チームはこれをライブ ストリーム、短い同期リクエスト、または非同期バッチに使用でき、選択した地域と言語がサポートしている場合は言語検出、音声適応、ノイズ除去を追加できます。
その特徴マトリックスは、言語ごとに均一ではありません。ダイアライゼーションと一部の適応オプションは文書化されたサブセットに適用され、エンドポイントの場所は可用性に影響します。したがって、適切な比較は、見出しの言語数だけではなく、言語、地域、リクエスト モードを正確に比較することになります。
カテゴリ比較
これらはプロバイダーが公開した仕様であり、Cody ベンチマーク スコアではありません。現在の制限とエンドポイント固有の例外については、リンクされたソースに従ってください。
料金と比較
利用量を入力すると、見積もりが自動で更新されます。
録音時間を時間単位で入力します。30分=0.5時間です。追加機能や最低料金で請求額が変わる場合があります。
Chirp 3
Google Cloud
合計見積額(USD)
上記の利用量に対する概算 · 米ドル · API料金(サブスクリプションではありません)
税金、ツール、キャッシュ保存・書き込み、無料枠、個別割引は含みません。画像は出力料金のみで、プロンプトや参照画像の料金は含みません。品質モードはモデルごとに異なります。未掲載の設定を無料とは扱いません。
APIとプロバイダーへのアクセス
可用性
ストリーミング、同期、バッチ認識ルートを備えた Google Cloud Speech-to-Text V2 で一般提供されます。
機能とサポートされる言語は Google Cloud 地域によって異なります。ライブ Chirp 3 ドキュメントからリージョン エンドポイントを選択します。
ライブの空き状況を確認するデータとトレーニング
Google によれば、顧客がデータ ログにオプトインしない限り、Speech-to-Text コンテンツはサービスの提供以外には使用されません。ストリーミングおよび同期コンテンツはメモリ内で処理されます。非同期結果は文書化されたとおりに一時的に保持される場合があります。
これは、引用された提供者の資料を簡潔にまとめたものであり、法的アドバイスではありません。サードパーティのゲートウェイには、モデル メーカーの直接 API とは異なるストレージ、ルーティング、トレーニング、常駐条件が適用される場合があります。
プロバイダーポリシーを読むよくある質問
Google Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。 Chirp 3 は Google Cloud Speech-to-Text V2 内に組み込まれているため、1 つの固定アプリではなく、複数の操作パターンをサポートします。チームはこれをライブ ストリーム、短い同期リクエスト、または非同期バッチに使用でき、選択した地域と言語がサポートしている場合は言語検出、音声適応、ノイズ除去を追加できます。
引用されたプロバイダーの資料によると、Chirp 3 は 2025年10月13日 でリリースされました。
ストリーミング、同期、バッチ認識ルートを備えた Google Cloud Speech-to-Text V2 で一般提供されます。 このガイドに記載されているアクセスルートは Google Cloud です。
標準 $0.016/分 · 動的バッチ $0.003/分. これらは、関連する認識ルートの現在の Google Cloud Speech-to-Text レートです。対象となるボリューム階層とクラウド契約によっては、実効コストが変化する可能性があります。
ストリーミング、同期、バッチ認識ルートを備えた Google Cloud Speech-to-Text V2 で一般提供されます。 機能とサポートされる言語は Google Cloud 地域によって異なります。ライブ Chirp 3 ドキュメントからリージョン エンドポイントを選択します。
Google によれば、顧客がデータ ログにオプトインしない限り、Speech-to-Text コンテンツはサービスの提供以外には使用されません。ストリーミングおよび同期コンテンツはメモリ内で処理されます。非同期結果は文書化されたとおりに一時的に保持される場合があります。 このポリシーはプロバイダーのルートとアカウントの条件に属しているため、運用環境で使用する前に再度確認してください。
関連する比較
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。
完全な比較を開くMicrosoft の高速バッチ文字起こしモデルは、長時間の録音、話者ラベル、単語のタイミング、キーワードのバイアス、クリーンなトランスクリプトまたは逐語的なトランスクリプトに対応します。
完全な比較を開くコードスイッチング、スピーカーラベル、タイムスタンプ、コンテキストプロンプトを備えた、ファイルとライブオーディオ用の AssemblyAI の精度重視の文字起こしモデル。
完全な比較を開くElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。
完全な比較を開く