全モデル
ElevenLabs

Scribe v2

ElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。

平易な英語による概要

Scribe v2 とは実際には何ですか

Scribe v2 は、言語検出、単語タイムスタンプ、話者ダイアライゼーション、音声以外のイベントの音声タグを使用して、長い音声またはビデオを構造化されたトランスクリプトに変換します。キータームプロンプトは、チームが一般的な認識モデルが見逃しがちな名前、製品、語彙を保存するのに役立ちます。

ElevenLabs は、ファイル トランスクリプションと別途料金のリアルタイム ルートを提供します。より広範なプラットフォームでは、音声およびエージェント製品も提供されており、単一ベンダーのオーディオ パイプラインを簡素化できますが、各機能には独自の請求およびデータ制御があります。

ぴったりフィット

  • 多言語メディアの文字起こし
  • 多数のスピーカーまたはサウンドイベントによる録音
  • オーディオ スタックはすでに ElevenLabs を使用しています

カテゴリ比較

転写 モデルにとって重要な事実

これらはプロバイダーが公開した仕様であり、Cody ベンチマーク スコアではありません。現在の制限とエンドポイント固有の例外については、リンクされたソースに従ってください。

転写価格
$0.22/音声時間。リアルタイムは別途記載リストされた処理ルートの音声時間または分あたりの現在のプロバイダーの料金。
ライブまたはバッチ
バッチおよび長い音声。別のリアルタイムルートモデルがリアルタイム ストリーム、アップロードされた録画、またはその両方を処理するかどうか。
言語
90以上の言語プロバイダーが公開する言語のカバレッジ。必要に応じて、トレーニングまたは宣伝されたカバレッジを、特別に検証された言語から分離します。
スピーカーラベル
最大 32 個のスピーカーモデルが誰が発言したか、および公開されている発言者の制限を識別するかどうか。
タイムスタンプ
ワードレベルのタイムスタンプ利用可能な単語、セグメント、または発話レベルのタイミング情報。
語彙コントロール
最大 1,000 個のキーワード。オーディオタグと言語検出キーワードブースティング、カスタムスペル、コンテキスト、プロンプト、またはドメイン用語を改善するその他の方法。
どこで使用するか
ElevenLabs Speech-to-Text APIプロバイダーによって文書化されたダイレクト API、クラウド カタログ、アプリケーション、または地域のエンドポイント。

料金と比較

コストを見積もる

利用量を入力すると、見積もりが自動で更新されます。

録音時間を時間単位で入力します。30分=0.5時間です。追加機能や最低料金で請求額が変わる場合があります。

Scribe v2

ElevenLabs

合計見積額(USD)

確認済み料金なし

上記の利用量に対する概算 · 米ドル · API料金(サブスクリプションではありません)

見積もりの仕組み

税金、ツール、キャッシュ保存・書き込み、無料枠、個別割引は含みません。画像は出力料金のみで、プロンプトや参照画像の料金は含みません。品質モードはモデルごとに異なります。未掲載の設定を無料とは扱いません。

APIとプロバイダーへのアクセス

Scribe v2の入手場所

可用性

地域とアクセス段階

ElevenLabs speech-to-text API および製品インターフェイスを通じて利用できます。 realtime は別のモデル ルートを使用します。

グローバルおよびデータ常駐オプションは、ElevenLabs プラン、エンドポイント、およびエンタープライズ構成によって異なります。

ライブの空き状況を確認する

データとトレーニング

ルートは重要です。

ElevenLabs を使用すると、対象となる API 顧客がデータ使用設定を管理できます。 Enable_logging=false によるゼロデータ保持は、Scribe v2 を含む、対象となるエンタープライズ構成およびサポートされているモデルに限定されます。ライブ プランとリージョン エンドポイントを確認します。

これは、引用された提供者の資料を簡潔にまとめたものであり、法的アドバイスではありません。サードパーティのゲートウェイには、モデル メーカーの直接 API とは異なるストレージ、ルーティング、トレーニング、常駐条件が適用される場合があります。

プロバイダーポリシーを読む

よくある質問

Scribe v2 よくある質問

Scribe v2とは何ですか?

ElevenLabs の多言語音声テキスト変換モデル。多数の話者、単語のタイミング、音声イベント、および大規模なカスタム キーターム リストによる詳細なトランスクリプトを作成します。 Scribe v2 は、言語検出、単語タイムスタンプ、話者ダイアライゼーション、音声以外のイベントの音声タグを使用して、長い音声またはビデオを構造化されたトランスクリプトに変換します。キータームプロンプトは、チームが一般的な認識モデルが見逃しがちな名前、製品、語彙を保存するのに役立ちます。

Scribe v2 はいつリリースされましたか?

引用されたプロバイダーの資料によると、Scribe v2 は 2026年1月9日 でリリースされました。

Scribe v2 にはどこからアクセスできますか?

ElevenLabs speech-to-text API および製品インターフェイスを通じて利用できます。 realtime は別のモデル ルートを使用します。 このガイドに記載されているアクセスルートは ElevenLabs、ElevenLabs API です。

Scribe v2の価格はいくらですか?

Scribe v2 の場合 $0.22 / オーディオ時間. ElevenLabs には、バッチ Scribe v2 と Scribe v2 リアルタイムの個別の価格がリストされています。エンティティの検出と編集は個別に請求できます。

Scribe v2 はどこで入手できますか?

ElevenLabs speech-to-text API および製品インターフェイスを通じて利用できます。 realtime は別のモデル ルートを使用します。 グローバルおよびデータ常駐オプションは、ElevenLabs プラン、エンドポイント、およびエンタープライズ構成によって異なります。

私の Scribe v2 API データはトレーニングに使用されますか?

ElevenLabs を使用すると、対象となる API 顧客がデータ使用設定を管理できます。 Enable_logging=false によるゼロデータ保持は、Scribe v2 を含む、対象となるエンタープライズ構成およびサポートされているモデルに限定されます。ライブ プランとリージョン エンドポイントを確認します。 このポリシーはプロバイダーのルートとアカウントの条件に属しているため、運用環境で使用する前に再度確認してください。