Muse Voice Transcribe
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。
平易な英語による概要
Muse Voice Transcribe は、アップロード完了としてではなく、継続的に受信される音声向けに設計されています。小さな音声の塊を処理し、発話がいつ終了したかを判断し、多くの話者にラベルを付け、言語、キーワード、文脈のヒントを使用して名前や専門用語を改善できます。
Meta は、具体的に検証された少数の言語セットを特定しながら、広範な多言語トレーニングを宣伝しています。この区別は調達に役立ちます。より広範なトレーニング セットを本番カバレッジとして扱う前に、自分の通話で正確なアクセント、コード スイッチング パターン、ノイズ、話者の重複をテストします。
カテゴリ比較
これらはプロバイダーが公開した仕様であり、Cody ベンチマーク スコアではありません。現在の制限とエンドポイント固有の例外については、リンクされたソースに従ってください。
料金と比較
利用量を入力すると、見積もりが自動で更新されます。
録音時間を時間単位で入力します。30分=0.5時間です。追加機能や最低料金で請求額が変わる場合があります。
Muse Voice Transcribe
Meta
合計見積額(USD)
上記の利用量に対する概算 · 米ドル · API料金(サブスクリプションではありません)
税金、ツール、キャッシュ保存・書き込み、無料枠、個別割引は含みません。画像は出力料金のみで、プロンプトや参照画像の料金は含みません。品質モードはモデルごとに異なります。未掲載の設定を無料とは扱いません。
APIとプロバイダーへのアクセス
可用性
Model API パブリック プレビュー中に、Meta Model API、Meta AI for Mac、および Muse Code を通じて利用できます。
Meta には、公開開始ページにモデル固有の国または処理地域のリストが 1 つも列挙されていません。現在の開発者アカウントの規約を使用してください。
ライブの空き状況を確認するデータとトレーニング
Meta の開始ページでは、完全なモデル API の保持やトレーニング使用の約束ではなく、公開デモのプライバシーについて説明しています。機密音声を送信する前に、現在の Model API 規約とエンタープライズ コントロールを確認してください。
これは、引用された提供者の資料を簡潔にまとめたものであり、法的アドバイスではありません。サードパーティのゲートウェイには、モデル メーカーの直接 API とは異なるストレージ、ルーティング、トレーニング、常駐条件が適用される場合があります。
プロバイダーポリシーを読むよくある質問
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。 Muse Voice Transcribe は、アップロード完了としてではなく、継続的に受信される音声向けに設計されています。小さな音声の塊を処理し、発話がいつ終了したかを判断し、多くの話者にラベルを付け、言語、キーワード、文脈のヒントを使用して名前や専門用語を改善できます。
引用されたプロバイダーの資料によると、Muse Voice Transcribe は 2026年9月1日 でリリースされました。
Model API パブリック プレビュー中に、Meta Model API、Meta AI for Mac、および Muse Code を通じて利用できます。 このガイドに記載されているアクセスルートは Meta Model API、Meta です。
$0.18 / 音声時間. Meta は、レビューされたカタログにこのモデル API レートをリストします。 Meta AI for Mac または Muse Code の製品許容量は異なる場合があります。
Model API パブリック プレビュー中に、Meta Model API、Meta AI for Mac、および Muse Code を通じて利用できます。 Meta には、公開開始ページにモデル固有の国または処理地域のリストが 1 つも列挙されていません。現在の開発者アカウントの規約を使用してください。
Meta の開始ページでは、完全なモデル API の保持やトレーニング使用の約束ではなく、公開デモのプライバシーについて説明しています。機密音声を送信する前に、現在の Model API 規約とエンタープライズ コントロールを確認してください。 このポリシーはプロバイダーのルートとアカウントの条件に属しているため、運用環境で使用する前に再度確認してください。
関連する比較
Microsoft の高速バッチ文字起こしモデルは、長時間の録音、話者ラベル、単語のタイミング、キーワードのバイアス、クリーンなトランスクリプトまたは逐語的なトランスクリプトに対応します。
完全な比較を開くGoogle Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。
完全な比較を開くコードスイッチング、スピーカーラベル、タイムスタンプ、コンテキストプロンプトを備えた、ファイルとライブオーディオ用の AssemblyAI の精度重視の文字起こしモデル。
完全な比較を開くElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。
完全な比較を開く