リソース

音声およびリアルタイム エージェント向けのトップ AI モデル

アシスタント、サポート、キャラクター、ライブ インターフェイス用のリアルタイム音声モデルと表現力豊かな音声モデル。請求単位、対話モード、待ち時間ベース、言語、ツール、およびコンテキストを比較します。

5 モデルの 1 ~ 5 を表示

OpenAI · 安定した

GPT-Realtime-2.1

OpenAI のリアルタイム音声合成推論モデルは、テキストと画像のコンテキストも必要とするツールを使用する音声エージェント向けです。

価格ベース
オーディオ $32 イン · $64 アウト / 100 万トークン
インタラクションモード
テキスト/画像コンテキストを使用した音声合成
モデルガイドを見る

Google のプレビュー オーディオツーオーディオ モデル。マルチモーダルな認識、思考、検索グラウンディング、機能呼び出しを備えた低遅延対話を実現します。

価格ベース
オーディオ $0.005/分入力 · $0.018/分出力
インタラクションモード
リアルタイムオーディオツーオーディオ、マルチモーダル入力
モデルガイドを見る

Inworld の最新の表現力豊かなリアルタイム テキスト読み上げモデル。会話の内容を記憶し、100 以上の言語で話すように設計されています。

価格ベース
オンデマンドで 25 ドル / 100 万文字。ボリュームディスカウント
インタラクションモード
事前音声コンテキストを備えたステアリング可能なリアルタイム TTS
モデルガイドを見る

比較のポイント

価格ベース
リストされたアクセス ルートのトークン、文字、または分ベースの価格。
インタラクションモード
音声合成、音声合成、またはストリーミングされたテキスト読み上げの動作。
公表されたレイテンシ
プロバイダーが公表した測定値と、明示された除外事項。 Cody テストではありません。

このライブラリの使い方

誇大宣伝ではなく、仕事を比較してください。

実際の製品を決定するための実用的な API 情報を備えた、フロンティア、スペシャリスト、およびカテゴリ定義モデルの精選されたクロスカテゴリ セット。

Cody does not run a universal quality leaderboard.プロバイダーの主張にはラベルが付けられており、価格には税金とオプションのツールは含まれていません。製品の購入者は、モデルを選択する前にライブプロバイダーの条件を確認する必要があります。

  1. 01

    技術的な制限、ライフサイクル、価格設定、地域アクセス、およびデータ ポリシーについては、ファーストパーティのドキュメントが存在する場合は必ずそれを使用します。

  2. 02

    同じカテゴリ内のモデルのみを比較し、各プロバイダーの測定基準を保持します。

  3. 03

    Show プロバイダーが比較可能な事実を推定せずに公表していない場合は、「未公表」と表示されます。

  4. 04

    価格と在庫状況を日付のスナップショットとして扱い、すべてのページをプロバイダーのライブ ドキュメントにリンクします。

スピードは単位を維持する

音声遅延、テキスト スループット、ビデオ レンダリング時間、ワールド モデル フレーム レートは互換性がありません。

未知は未知のまま

リリース日、国リスト、またはレイテンシ番号が欠落している場合は、推定ではなく未公開としてラベルが付けられます。

すべての事実には日付がある

モデル ページは基礎となるソースにリンクし、価格設定、アクセス、ポリシーが最後にチェックされた時期を示します。

モデルを機能させる

モデルを選択し、より適切な概要を説明します。

Cody の拡張されたプロンプト プレイブックと厳選されたエージェント スキルを使用して、モデルの選択を反復可能なワークフローに変えます。