MAI-Transcribe-2
Microsoft の高速バッチ文字起こしモデルは、長時間の録音、話者ラベル、単語のタイミング、キーワードのバイアス、クリーンなトランスクリプトまたは逐語的なトランスクリプトに対応します。
Microsoft の高速バッチ文字起こしモデルは、長時間の録音、話者ラベル、単語のタイミング、キーワードのバイアス、クリーンなトランスクリプトまたは逐語的なトランスクリプトに対応します。
平易な英語による概要
MAI-Transcribe-2 は、大きなオーディオ ファイルをすぐに使用可能なテキストに変換することを目的としています。 Microsoft は、多言語認識とダイアライゼーション、単語レベルのタイムスタンプ、自動言語検出を組み合わせて、トランスクリプトでつなぎ言葉を保持するか、よりクリーンな散文を返すかを制御します。
アクセスは Microsoft Foundry を通じて実行されるため、このモデルは既に Azure で ID、リージョン、データ コントロールを管理している組織に自然に適合します。発売価格は明らかに期間限定であるため、コスト予測には将来の標準料金に対するマージンを保持する必要があります。
カテゴリ比較
これらはプロバイダーが公開した仕様であり、Cody ベンチマーク スコアではありません。現在の制限とエンドポイント固有の例外については、リンクされたソースに従ってください。
料金と比較
利用量を入力すると、見積もりが自動で更新されます。
録音時間を時間単位で入力します。30分=0.5時間です。追加機能や最低料金で請求額が変わる場合があります。
MAI-Transcribe-2
Microsoft
合計見積額(USD)
上記の利用量に対する概算 · 米ドル · API料金(サブスクリプションではありません)
税金、ツール、キャッシュ保存・書き込み、無料枠、個別割引は含みません。画像は出力料金のみで、プロンプトや参照画像の料金は含みません。品質モードはモデルごとに異なります。未掲載の設定を無料とは扱いません。
APIとプロバイダーへのアクセス
可用性
Microsoft Foundry を通じてバッチおよび長文音声認識を利用できます。
デプロイの可用性は、ライブ Microsoft Foundry モデル カタログとお客様が選択した Azure リージョンに従います。
ライブの空き状況を確認するデータとトレーニング
Microsoft によれば、Foundry Models に送信されたプロンプト、出力、埋め込み、トレーニング データはモデル プロバイダーには利用できず、許可なく基盤モデルのトレーニングに使用されることはありません。保持および不正行為の監視の詳細は、デプロイされたサービスによって異なります。
これは、引用された提供者の資料を簡潔にまとめたものであり、法的アドバイスではありません。サードパーティのゲートウェイには、モデル メーカーの直接 API とは異なるストレージ、ルーティング、トレーニング、常駐条件が適用される場合があります。
プロバイダーポリシーを読むよくある質問
Microsoft の高速バッチ文字起こしモデルは、長時間の録音、話者ラベル、単語のタイミング、キーワードのバイアス、クリーンなトランスクリプトまたは逐語的なトランスクリプトに対応します。 MAI-Transcribe-2 は、大きなオーディオ ファイルをすぐに使用可能なテキストに変換することを目的としています。 Microsoft は、多言語認識とダイアライゼーション、単語レベルのタイムスタンプ、自動言語検出を組み合わせて、トランスクリプトでつなぎ言葉を保持するか、よりクリーンな散文を返すかを制御します。
引用されたプロバイダーの資料によると、MAI-Transcribe-2 は 2026年9月3日 でリリースされました。
Microsoft Foundry を通じてバッチおよび長文音声認識を利用できます。 このガイドに記載されているアクセスルートは Microsoft AI、Microsoft Foundry です。
期間限定プレビュー料金の場合、音声 1 時間あたり $0.10. Microsoft では、これを期間限定価格としてラベル付けします。継続的な生産コストを予測する前に、Foundry のライブ カタログを確認してください。
Microsoft Foundry を通じてバッチおよび長文音声認識を利用できます。 デプロイの可用性は、ライブ Microsoft Foundry モデル カタログとお客様が選択した Azure リージョンに従います。
Microsoft によれば、Foundry Models に送信されたプロンプト、出力、埋め込み、トレーニング データはモデル プロバイダーには利用できず、許可なく基盤モデルのトレーニングに使用されることはありません。保持および不正行為の監視の詳細は、デプロイされたサービスによって異なります。 このポリシーはプロバイダーのルートとアカウントの条件に属しているため、運用環境で使用する前に再度確認してください。
関連する比較
Meta のストリーミング音声認識モデルは、ライブ キャプション、長い音声、多数のスピーカー、コード スイッチング、ドメイン対応の文字起こしに対応します。
完全な比較を開くGoogle Cloud の一般的な音声テキスト変換モデル。多くの言語と地域にわたるストリーミング、ファイル、低コストの動的バッチ文字起こしに使用されます。
完全な比較を開くコードスイッチング、スピーカーラベル、タイムスタンプ、コンテキストプロンプトを備えた、ファイルとライブオーディオ用の AssemblyAI の精度重視の文字起こしモデル。
完全な比較を開くElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。
完全な比較を開く