- AIツール
- 人工知能
GPT Live 1 API の登場: 価格、機能、および動作方法
GPT Live 1 は、OpenAI API に全二重音声会話をもたらします。その仕組み、1 分あたり 0.05 ドルの料金、GPT-Realtime-2.1 との比較について学びましょう。

OpenAI は、ChatGPT スタイルの全二重会話を開発者に提供します。重要な変化は、単なる新しい声ではなく、会話とその背後で行われている作業との間の新しい役割分担です。
音声アシスタントは急速に改良されていますが、多くはまだその仕組みを明らかにしています。一時停止中に熱心に待ちすぎたり、中断した後も話し続けたり、ツールが注文を調べている間黙ってしまったりします。 OpenAI GPT-Live 1 API の発売 その機械を目立たなくする試みです。
2026 年 9 月 10 日にリリースされた GPT-Live 1 は、聞くことと話すことを同時に行うことができます。これは会話自体のリズムを処理し、別のバックエンド モデルまたはエージェントが推論、検索、承認されたツールの呼び出しを行い、結果を返すことができます。このアーキテクチャは、価格やベンチマークを比較する前に理解しておくべき中心的な考え方です。
このガイドでは、GPT Live 1 とは何か、その内容について説明します。 1 分あたり 0.05 ドル 価格に含まれるもの、委任の仕組み、および委任との違い GPT-Realtime-2.1 そして従来の音声パイプライン。ユーザーが検索する可能性が高い場所では「GPT Live 1」を使用します。 OpenAI は製品名のスタイルを設定します GPT-Live 1、正確な API モデル ID は次のとおりです。 gpt-live-1.
クイックアンサー — 2026 年 9 月 11 日に確認
GPT-Live 1 は OpenAI API で入手可能になりました。全二重音声フロントエンドのコスト セッション 1 分あたり $0.05、秒ごとに請求されます。バックエンド モデルの使用、ツール、テレフォニー、アプリケーション インフラストラクチャには別のコストがかかります。テキストとオーディオの入出力、ストリーミング、および委任されたツールの使用をサポートします。画像とビデオは Live フロントエンドではサポートされていません。
| GPT Live 1 事実 | 確認した内容 |
|---|---|
| 発売日 | 2026 年 9 月 10 日 |
| API モデルID | gpt-live-1 |
| 価格 | 音声セッション 1 分あたり 0.05 ドル、1 秒ごとに請求されます |
| 追加料金 | バックエンド モデル、ツール、テレフォニー、ストレージ、アプリケーション インフラストラクチャ |
| 入力→出力 | テキストと音声 → テキストと音声 |
| 接続 | WebRTC、WebSocket、サイドバンドサーバー制御、およびテレフォニー/SIP パス |
| 知識の遮断 | 2025年7月31日 |
| 無料の API 層 | サポートされていません |
GPT Live 1とは何ですか?
GPT-Live 1 は、アプリケーションの会話層を管理するために構築されたリアルタイム音声モデルです。継続的なオーディオ ストリームを受信し、音声を生成し、受信音声と送信音声を一緒に判断します。わかりやすい英語で言えば、話し始めたからといって聞くのをやめる必要はありません。
そのため、このモデルは、「うーん」という応答、ためらい、笑い、背景の会話、文の途中での修正、話者が実際に望んでいることを変える中断など、実際の音声の厄介な部分によく適しています。
GPT-Live 1 は、音声モデル内であらゆる困難なビジネス ワークフローを実行することを意図したものではありません。より深い推論とツールの使用のために、開発者が選択したバックエンドに委任します。 OpenAI では、大量のスケジュールや注文の更新には Luna のような小規模なモデルを使用し、複雑な顧客の問題には Astra のようなモデルを使用する例を示します。クライアント委任を使用する場合、バックエンドは OpenAI モデルである必要はまったくありません。
API の正確な事実、現在のアクセス リンク、プロバイダー ソースについては、新しい GPT-Live 1 モデルページ Cody のモデル ライブラリにあります。
全二重音声が異なると感じられる理由
ほとんどの人は、きちんと交互のブロックで話していません。私たちは発言を放棄することなく、立ち止まって考えます。私たちは、他の人が話しているときに「正しい」と言い、自分が従うことを示します。他の人が終わる前に私たちは修正を開始します。ターンベースのシステムでは、それぞれの沈黙や音声が「すぐに応答する」、「聞き続ける」、または「話すのをやめる」のいずれを意味するかを推測する必要があります。
全二重 システムが発話中に聞くことができることを意味します。これ自体は自然な会話を保証するものではありませんが、重複が発生したときに反応するために必要な音響コンテキストをモデルに提供します。短い確認応答は、本物の中断とは異なる方法で処理できます。思慮深い一時停止は、アシスタントが介入するよう促す代わりに、一時停止のままになる可能性があります。
これは、単純な「最初のオーディオまでの時間」の数値ではエクスペリエンス全体を説明できない理由でもあります。音声エージェントはすぐに話し始めても、考えているユーザーの邪魔をすると失礼に感じられることがあります。バックエンド ツールを実行するたびに音声が聞こえなくなると、音声品質は良くても速度が遅く感じられることがあります。方向転換のタイミング、回復、バックグラウンドノイズの動作、タスクの完了はすべて重要です。
GPT Live 1 委任の仕組み
委任により、音声フロントエンドがバックエンド エージェントから分離されます。 GPT-Live 1 は、他の場所でより深い作業を実行している間も、要求を承認したり、有益なフォローアップを求めたりして、会話を進め続けることができます。 OpenAI は、その作業を接続する 2 つの方法を文書化しています。
応答代表団
と 応答代表団, GPT-Live 1 はバックエンド リクエストを準備し、関連する会話コンテキストをセッション用に選択された OpenAI 応答モデルに送信し、結果を音声会話に戻します。これは、より管理されたルートであり、1 つの応答モデルとそのサポートされているツールがジョブに適合する場合に開始しやすい場所です。
バックエンドの選択は音声モデルとは無関係です。チームは日常的な作業をより高速なモデルまたはより安価なモデルにルーティングし、それが正当化されるケースのためにより重い推論を予約することができます。これは、GPT-Live 1 エージェントの品質と総コストが、音声フロントエンドだけでなくバックエンド構成にも部分的に依存することも意味します。
クライアントの委任
と クライアントの委任、アプリケーションは委任イベントを受信し、適切なトランスクリプトとビジネス コンテキストを組み立て、モデル、エージェント、サービス、またはカスタム ワークフローを呼び出して、どのような結果を返すかを決定します。このルートではエンジニアリング作業が追加されますが、より詳細な制御が可能になります。
クライアント委任は、結果を読み上げる前に検証または編集する必要がある場合、複数のバックエンドでカスタム ルーティングが必要な場合、プライベート システムを既存のエージェント ハーネス内に留める必要がある場合、またはチームが独自の予算、チェックポイント、およびフォールバック ロジックを必要とする場合に適しています。
どちらのモードでも、GPT-Live 1 ではなく、アプリケーションが引き続きアクセス許可、確認、ビジネス レコード、永続タスクの状態を担当します。委任は通信メカニズムであり、承認システムではありません。
GPT Live 1 の重要な機能
- リスニングとスピーキングを同時に行う: このモデルは、受信音声と送信音声を個別のターンとして扱うのではなく、一緒に判断します。
- 自然な中断の処理: 裏口や訂正、あるいは発言権を主張しようとする真の試みに対しては、異なる反応を示す可能性があります。
- 委任された推論とツール: より深い作業は、選択した応答モデルまたはアプリケーション操作のバックエンドを通じて実行できます。
- プロンプト音声の動作: 開発者は、トーン、ペース、スタイル、相槌、割り込み動作、およびモデルが委任されるタイミングを形成できます。
- ネイティブのトランスクリプト: ASR トランスクリプトと応答テキストは、オーディオ ストリームと一緒に利用できます。
- 英数字とキーワードのサポート: OpenAI は、名前、コード、その他の正確な文字列の強力な処理に加えて、キーワードのバイアスを強調します。
- 沈黙と背景雑音の処理: このモデルは、すべての音や一時停止を応答コマンドとして扱うことを避けるように設計されています。
- 長時間セッションの信頼性: OpenAI は、長時間のやり取りにおけるコンテキストの保持と会話の品質を向上させたと述べています。
- ブラウザ、サーバー、電話接続: 文書化されたパスには、WebRTC、WebSocket、サイドバンド制御、テレフォニー/SIP が含まれます。
モデル ページには、サポートされているストリーミングと関数呼び出しもリストされています。 GPT-Live 1 では、構造化出力、微調整、および予測出力はサポートされていません。
GPT Live 1の価格
ヘッドラインレートはシンプルです: フロントエンド音声セッションは 1 分あたり 0.05 ドル。 OpenAI は秒単位で請求するため、61 秒のセッションは 2 分に切り上げられません。
音声セッションの費用
| 音声の使用 | GPT-Live 1 フロントエンドのコスト |
|---|---|
| 10分 | $0.50 |
| 30分 | $1.50 |
| 100時間(6,000分) | $300 |
| 1,000時間(60,000分) | $3,000 |
これらの例は、単純な定価の乗算です。これらは会話層を推定するのに役立ちますが、 音声エージェントの運用にかかる総コストではありません.
1 分あたり 0.05 ドルに含まれない費用
- 推論を実行するか、委任された結果を生成するバックエンド モデル。
- Web 検索やその他のプロバイダー サービスなどの有料ツール。
- 電話会社、電話番号、SIP、またはパートナー プラットフォームの料金。
- サーバー、ストレージ、モニタリング、可観測性、オーディオ インフラストラクチャ。
- 人的エスカレーション、品質レビュー、およびサポート業務。
したがって、現実的な予測は次のようになります。 音声セッションの分 + バックエンドの使用量 + ツール + 電話/交通費 + アプリケーションの費用。パイロット中にこれらの部分を個別にキャプチャします。完了したタスクあたりのコストは、より自然な通話のほうが早く解決する可能性があるため、またはより長い会話を促す可能性があるため、分あたりのコストよりも役立つことがよくあります。
OpenAI のモデル ページでは、同時セッションのレート制限を測定します。現在、Tier 1 に 25 セッション、Tier 2 に 50 セッション、Tier 3 に 200 セッション、Tier 4 に 300 セッション、Tier 5 に 500 セッションがリストされています。運用チームは、大規模なリリースの前に現在の制限を確認し、キャパシティを要求する必要があります。
GPT Live 1 vs GPT-Realtime-2.1
どちらも OpenAI 音声モデルですが、アーキテクチャの解決方法が異なります。 GPT-Realtime-2.1 は、テキスト、画像、音声コンテキストを受け取り、リアルタイム セッション内で関数を呼び出すことができる音声対音声推論モデルです。 GPT-Live 1 は、より深い推論とアクションを別のバックエンドに委任する専用の全二重会話フロントエンドです。
| 質問 | GPT-Live 1 | GPT-Realtime-2.1 |
|---|---|---|
| コア設計 | 全二重音声フロントエンドと委任されたバックエンド | セッション内で推論と関数呼び出しを行うリアルタイム音声合成モデル |
| 公開された請求書 | セッション 1 分あたり 0.05 ドル、バックエンドの使用量に加えて | トークンベース: オーディオ、テキスト、画像のレートは入力/出力クラスによって異なります |
| 音声動作 | 同時に聞くことと話すことを中心に設計されています | 方向転換検出と割り込み処理によるリアルタイム対話 |
| フロントエンド入力 | テキストと音声 | テキスト、画像、音声 |
| バックエンドの柔軟性 | 応答モデル、またはクライアント操作のモデル、エージェント、またはサービス | 構成された 1 つのリアルタイム モデルとその利用可能なツール |
| テストする最大の理由 | より自然なオーバーラップと独立したバックエンド ルーティング | トークンベースの使用による統合されたマルチモーダル リアルタイム セッション |
価格行は、公正で普遍的な「より安価なモデル」の判定に変換することはできません。 GPT-Live 1 では、セッションの経過時間に対して料金が発生し、バックエンドの請求が追加されます。 GPT-Realtime-2.1 は、複数のメディア クラスにわたってトークンを請求します。沈黙、発言率、応答の長さ、画像の使用、ツール、キャッシュ、バックエンドの選択はすべて結果を変えます。
Cody のモデル ライブラリを使用して、現在の GPT-Live 1 と GPT-Realtime-2.1 の比較 または、GPT-Live 1 を他のモデルと比較してください。 音声とリアルタイムのカテゴリ.
GPT Live 1 と従来の STT-LLM-TTS パイプライン
従来の音声エージェントは通常、音声テキスト変換、言語モデル、テキスト音声変換の 3 つのシステムを接続します。このモジュール性は貴重です。チームは、言語に最適な文字起こしモデルを選択し、音声が始まる前に完全なテキスト応答を検証し、すべてを置き換えることなく 1 つのコンポーネントを置き換えることができます。
トレードオフはオーケストレーションです。ハンドオフごとに、別のキュー、別のフォーマット変換、およびタイミングやコンテキストが失われる可能性のある別の場所が作成されます。アプリケーションは、発話がいつ終了するか、発信者が合成音声を中断した場合にどうするか、自己修正後にトランスクリプトをどのように変更するかを決定する必要があります。
GPT-Live 1 は、リスニングとスピーキングの段階を 1 つの連続した音声レイヤーにまとめますが、より深い作業のために別のバックエンドを保持します。これにより順番待ちが簡素化され、「トランシーバー」の感覚が軽減されますが、アプリケーション層の必要性がなくなるわけではありません。アプリは引き続き、アクション、プライバシー、障害回復、電話、およびタスクの信頼できる情報源を管理する必要があります。
最も難しい要件に基づいて選択してください。完全な音声前の検証とコンポーネントレベルの制御が必須である場合、カスケードパイプラインは依然として魅力的である可能性があります。会話の流れ、重複、タスクの実行中の継続的な関与が中心である場合、GPT-Live 1 はテストすべき魅力的なアーキテクチャです。
OpenAI のベンチマークで何が証明され、何が証明されないのか
OpenAI は、GPT-Live 1 が Full Duplex Bench の結果を改善したと報告しています。 30パーセントポイント GPT-Realtime-2.1 を超え、ターンテイキングのレイテンシーとインタラクティブな動作が向上します。中程度の推論労力で GPT-6 Astra と組み合わせると、OpenAI もエンドツーエンドの音声エージェント タスクでナンバー 1 の Tau3 結果を報告します。
言語学習会社の Speak は、初期の顧客評価で、以前のターンベース システムに比べて、学習者の思考停止中の中断がほぼ 80% 少ないと報告しました。 OpenAI は、Yelp、Fin、Cognition などからの好意的な顧客アカウントも公開しました。
これらの結果は有用なシグナルですが、依然として残ります。 プロバイダーが公開した評価と顧客レポート。 Astra の結果は、GPT-Live 1 単独ではなく、組み合わせたシステムを測定します。どの数値も、電話会社、アクセント、ノイズ、ツールの遅延、プロンプト、またはビジネス ワークフローでのパフォーマンスを保証するものではありません。 Cody ベンチマークとしては再現していません。
強力な評価では、少なくとも、完了したタスク、不適切な中断、修正後の回復、ターン終了のタイミング、ツールの精度、レイテンシーのパーセンタイル、エスカレーションの品質、完了したタスクごとのコスト、および代表的なコールにわたる人間の好みのスコアが必要です。
GPT Live 1 の音声と言語のサポート
OpenAI のリリースには 12 の音声がリストされています。 クォーツ、リップル、ヴェスパー、ウィロー、ストーン、グリム、メリディアン、ボッサ、テンポ、ビーコン、デルタ、シンダー。同社によれば、この選択により、対象範囲がアクセント、方言、言語全体に拡大され、今後さらに追加する予定だという。
OpenAI は、GPT-Live 1 モデル ページで 1 つの正確な言語リストを公開していません。したがって、「より幅広い言語が利用可能」ということは、すべてのロケール、アクセント、またはコード切り替えパターンを保証するものとして解釈されるべきではありません。実際の話者、背景条件、名前、住所、確認フレーズ、製品がサポートすると約束している言語をテストします。
カスタム音声アクセスはセルフサービスのデフォルトではありません。 OpenAI は、関心のある組織が資格とリクエスト プロセスについて営業担当者に連絡するよう指示します。
GPT Live 1の接続方法
OpenAI には、いくつかの接続パターンが記載されています。どちらが適切かは、オーディオの発信元と、どのシステムがセッションの制御を必要とするかによって異なります。
ブラウザ音声アプリ用 WebRTC
WebRTC は、ブラウザベースの音声アプリケーションの開始点として推奨されます。メディア トラックはマイクとスピーカーの音声を伝送し、データ チャネルはセッション イベントを伝送します。信頼できるサーバーはセッションを作成し、OpenAI API キーがブラウザーに表示されないようにする必要があります。
サーバー側オーディオ用の WebSocket
WebSocket は、アプリケーションがオーディオ ストリームを所有するサーバー側の統合に適合します。メインソケットはオーディオイベントと制御イベントを伝送します。ブラウザが WebRTC 接続を所有しているが、サーバーがトランスクリプト、監視、または修正指示をまだ必要としている場合、サイドバンド WebSocket は、オーディオを WebRTC から移動することなくサーバー コントロールを接続できます。
電話エージェント向けのテレフォニーと SIP
OpenAI はテレフォニーと SIP の統合パスを文書化し、LiveKit、Twilio、Telnyx、Daily、Pipecat などのシステムに関するパートナー ガイダンスを提供します。キャリアおよびパートナーの料金は、GPT-Live 1 セッション料金とは別のままです。
実践的な GPT Live 1 セットアップ プラン
- ナロー コールを 1 つ選択します。 万能のエージェントではなく、注文の確認、見込み客の評価、予約の検索など、限定されたワークフローから始めます。
- 接続を選択します。 ブラウザーのプロトタイプ、サーバーが音声を所有する場合の WebSocket、または電話の文書化されたテレフォニー ルートには WebRTC を使用します。
- ライブプロンプトは短くしてください。 音声プロンプトに口調、ペース、割り込みスタイル、相槌、委任ポリシーを入力します。詳細なビジネス ワークフローとツール ルールをバックエンドに保持します。
- 委任を選択します。 マネージド OpenAI バックエンドの応答委任から始めます。カスタム コンテキスト、検証、ルーティング、または非 OpenAI サービスが必要な場合は、クライアント委任を使用します。
- コード内でアクション ルールを強制します。 ツールを実行する前に、ID、承認、確認、予算、および許可された状態の変更を確認します。
- トランスクリプトとタスクの状態を保存します。 転写デルタは不完全であるか、間違っている可能性があります。 「はい」、「代わりに金曜日に」、および以前の詳細を参照する修正を理解するのに十分な履歴を保存します。
- 乱雑なオーディオをテストします。 思考の遅い人、割り込み、余談、騒音、綴り、口座番号、沈黙、切断、人間へのエスカレーションなどを含めます。
- システム全体を測定します。 会話の品質とバックエンド タスクの成功の両方に加えて、音声分料金以外のすべてのコストを追跡します。
リアルタイムまたはカスケード音声スタックからの移行
移行は単にモデル ID を変更することではありません。最も重要な変更は、意図的に責任を分割することです。
- 会話スタイルを Live プロンプトに移行します。 音声がどのように話し、待ち、確認し、中断し、委任するかを定義します。
- 詳細なワークフローをバックエンドに保持します。 ビジネス ルール、ツール スキーマ、検証、権限、および長い出力は、作業を実行するエージェントに属します。
- 継続的な音声イベントに適応します。 GPT-Live 1 はオーディオを継続的にストリーミングし、リアルタイム API とは異なるセッション イベントを持ちます。同じ手動のコミットとトリガーのフローを想定しないでください。
- 関数呼び出しを委任に変換します。 Live フロントエンドは、テキスト エージェントやリアルタイム エージェントと同じ方法で通常の構造化ツールの引数を発行するのではなく、バックエンドにヘルプを求めます。
- 既存の安全策を維持します。 モニタリング、アクションブロック、確認、監査記録、キャンセル、エスカレーションを保持します。チェックの実行中に話し続ける可能性があるモデルにそれらを適応させます。
ポリシーで許可されている同じ記録済みシナリオに対して、古いアーキテクチャと新しいアーキテクチャを実行します。洗練されたデモではなく、コール全体の結果を比較してください。私たちの別個の 音声エージェントの遅延に関するガイド トランスポート、転写、推論、ツール、再生を一緒に測定する必要がある理由を説明します。
理解しておくべき制作上の注意点
アプリケーションは依然としてリスクのある決定を行っています
GPT-Live 1 は会話を自信に満ちたものにします。外部アクションが承認または完了したことを証明するものではありません。予定の変更、カードへの請求、アカウント記録の公開、または成功の発表を行う前に、権限と必要な確認を確認してください。音声セッションの外部で信頼できる情報源タスクの状態を保持します。
中断はキャンセルではありません
木曜日の検索の実行中に発信者が「実は、代わりに金曜日に」と言った場合、発言を中断してもその検索はキャンセルされません。アプリケーションは、アクティブなタスクを修正し、古い確認を無効にし、可能であれば作業をキャンセルし、木曜遅くの結果が最新のものとして読み上げられるのを防ぐ必要があります。
連続発話によりガードレールのデザインが変わる
テキスト エージェントは、回答を表示する前に回答全体を終了して検証できます。 GPT-Live 1 は、バックエンドの作業またはポリシー チェックの継続中に発言する可能性があります。ツールの結果を保留しても、音声フロントエンドが沈黙を保つことが保証されるわけではありません。トランスクリプトとアクションの両方を監視し、アプリケーション コード内の安全でないツールをブロックし、スピーチ前の承認が必要な場合は再生を制御します。
一部の決定には依然としてオリジナルの音声が必要です
委任されたバックエンドは、生の波形を自動的に受信しません。ワークフローが音響的な証拠 (ボイスメールのビープ音、話者のリズム、2 人目の参加者、または別の非テキスト信号) に依存している場合は、元の音声が適切な検出器またはレビュー担当者にルーティングされます。トランスクリプトには、フロントエンドが聞いたすべての信号が含まれていると想定しないでください。
誰が GPT Live 1 をテストすべきですか?
GPT-Live 1 は、顧客サポート、予約スケジュール、レストラン予約、語学指導、販売資格、アクセシビリティ、ハンズフリー作業、共同音声インターフェイスなど、会話のタイミングが仕事の一部である製品に最も興味深いものです。
一方向のナレーション、ファイルの転写、単純なテキスト読み上げ、または音声を再生する前にすべての完全な文を検証する必要があるワークフローでは、これが必要であることはあまり明らかではありません。専門の音声サービスまたはカスケード スタックは、そのような場合により直接的な制御を提供する可能性があります。
実際の決定は、「GPT-Live 1 が最適な音声モデルか?」ということではありません。それは次のとおりです。 全二重会話と個別に選択されたバックエンドにより、アーキテクチャと総コストを正当化できるほどタスクの成功率が向上しますか? 代表的なパイロットならそれに答えることができます。ベンチマークの見出しにはできません。
よくある質問
GPT Live 1とは何ですか?
GPT-Live 1 は、リアルタイム会話用の OpenAI の全二重音声モデルです。聞きながら同時に話し、その後、より深い推論とツールの作業を別のバックエンド エージェントに委任します。
GPT Live 1の価格はいくらですか?
フロントエンド音声セッションの料金は 1 分あたり 0.05 ドルで、1 秒ごとに請求されます。バックエンド モデルの使用、ツール、テレフォニー、ストレージ、アプリケーション インフラストラクチャには追加料金がかかります。
GPT Live 1 は現在入手可能ですか?
はい。 OpenAI は、2026 年 9 月 10 日に API で GPT-Live 1 をリリースしました。その正確な API モデル ID は次のとおりです。 gpt-live-1。 OpenAI のモデル ページには、Free API 層はサポートされていないと記載されています。
全二重音声AIとは何ですか?
全二重とは、音声システムが話している間も聞くことができることを意味します。これにより、一度に 1 人の話者が厳密にやり取りするよりも、重複したスピーチ、確認応答、中断、自然な休止を処理することが容易になります。
GPT Live 1 と GPT-Realtime-2.1 の違いは何ですか?
GPT-Live 1 は、分単位で課金される全二重音声フロントエンドであり、より深い作業をバックエンド モデルに委任します。 GPT-Realtime-2.1 は、リアルタイム セッション内で音声、推論、関数呼び出しを処理する、トークン課金の音声認識モデルです。
GPT Live 1 はツールを呼び出すことができますか?
はい、委任を通じて可能です。応答委任は、選択された OpenAI 応答モデルを使用します。クライアント委任により、アプリケーションは別のモデル、エージェント、サービス、またはカスタム ワークフローを呼び出し、どの検証結果が返されるかを決定できます。
GPT Live 1 を中断するとバックエンド タスクがキャンセルされますか?
いいえ。音声を中断しても、バックエンドの作業は自動的にキャンセルされません。アプリケーションは、古い結果をキャンセルするか、修正するか、破棄するかを決定する必要があります。
GPT Live 1 は WebRTC、WebSocket、および電話をサポートしていますか?
はい。 OpenAI は、ブラウザー音声アプリ、サーバー側オーディオ用の WebSocket、サイドバンド サーバー コントロール、およびテレフォニーまたは SIP 統合パス用の WebRTC を文書化します。
GPT Live 1 ではどの音声が利用できますか?
OpenAI のローンチリストには、Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder が含まれています。カスタム音声アクセスには資格と販売プロセスが必要です。
情報源と方法論
この記事は、2026 年 9 月 11 日にファーストパーティの OpenAI 資料と照合してチェックされました。ベンチマークと顧客の結果は、独立した Cody 測定値として提示されるのではなく、OpenAI レポートとしてラベル付けされています。
- OpenAI: GPT-Live 1 API 発売のお知らせ
- OpenAI: GPT-Live 1 のモデル ページ、価格、機能、レート制限
- OpenAI: GPT-Live を始める
- OpenAI: GPT-Live プロンプト ガイド
- OpenAI: GPT-Live 委任とツール
- OpenAI: GPT-Live の移行ガイダンス
- OpenAI: API の価格
結論
GPT-Live 1 は単なる新しい合成音声ではありません。音声エージェントの形状を変更します。 1 つの全二重モデルが会話の人間的なリズムを管理し、個別に選択されたバックエンドがより困難な作業を処理します。
1 分あたり 0.05 ドルの料金なので、フロントエンドの見積もりは簡単ですが、バックエンド、ツール、電話ネットワーク、アプリケーションによって合計料金とタスクの品質の多くが決まります。最も役立つ次のステップは、きれいにスクリプト化されたデモではなく、現実的な中断、修正、ノイズ、権限を備えた限定的なパイロットです。
を探索してください GPT-Live 1 モデルガイドと直接比較してください。 GPT-Realtime-2.1、または全文を参照してください 音声AIモデルディレクトリ.


