- أدوات الذكاء الاصطناعي
- الذكاء الاصطناعي
GPT Live 1 API موجود هنا: التسعير والميزات وكيفية العمل
يقدم GPT Live 1 محادثات صوتية ثنائية الاتجاه إلى OpenAI API. تعرف على كيفية عمله، وما يتضمنه 0.05 دولار للدقيقة، وكيفية مقارنته بـ GPT-Realtime-2.1.

جلبت OpenAI محادثة مزدوجة الاتجاه على غرار ChatGPT للمطورين. التغيير المهم ليس مجرد صوت جديد، بل هو تقسيم جديد للعمل بين المحادثة والعمل الذي يحدث خلفها.
لقد تحسنت أجهزة المساعدة الصوتية بسرعة، إلا أن العديد منها ما زال يكشف عن أجهزتها. فهم ينتظرون بفارغ الصبر أثناء فترة التوقف المؤقت، أو يستمرون في الحديث بعد أن تقاطعهم، أو يظلون هادئين أثناء قيام الأداة بالبحث عن أمر ما. OpenAI إطلاق GPT-Live 1 API هي محاولة لجعل تلك الآلة أقل وضوحًا.
تم إصدار GPT-Live 1 في 10 سبتمبر 2026، ويمكنه الاستماع والتحدث في نفس الوقت. فهو يتعامل مع إيقاع المحادثة نفسها، في حين يمكن لنموذج أو وكيل منفصل للواجهة الخلفية التفكير والبحث والاتصال بالأدوات المعتمدة وإرجاع النتيجة. هذه البنية هي الفكرة المركزية التي يجب فهمها قبل مقارنة الأسعار أو المعايير.
يغطي هذا الدليل ما هو GPT Live 1 وما هو عليه 0.05 دولار للدقيقة يشمل السعر كيفية عمل التفويض وكيف يختلف عنه GPT-Realtime-2.1 وخطوط الكلام التقليدية. نحن نستخدم "GPT Live 1" حيث من المرجح أن يبحث عنه الأشخاص؛ OpenAI يصمم اسم المنتج GPT-Live 1، ومعرف طراز API الدقيق هو gpt-live-1.
إجابة سريعة – تم التحقق في 11 سبتمبر 2026
GPT-Live 1 متاح في OpenAI API الآن. تكاليف الواجهة الأمامية للصوت مزدوج الاتجاه 0.05 دولار لكل دقيقة جلسة، تتم محاسبته في الثانية. يعتبر استخدام نموذج الواجهة الخلفية، والأدوات، والاتصال الهاتفي، والبنية التحتية للتطبيقات الخاصة بك تكاليف منفصلة. وهو يدعم إدخال/إخراج النص والصوت والبث واستخدام الأدوات المفوضة؛ الصورة والفيديو غير مدعومين بالواجهة الأمامية المباشرة.
| حقيقة GPT Live 1 | تفاصيل مؤكدة |
|---|---|
| تاريخ الإصدار | 10 سبتمبر 2026 |
| معرف الطراز API | gpt-live-1 |
| السعر | 0.05 USD لكل دقيقة جلسة صوتية، تتم محاسبتها بالثانية |
| رسوم إضافية | نموذج الواجهة الخلفية والأدوات والاتصالات الهاتفية والتخزين والبنية التحتية للتطبيقات |
| المدخلات → المخرجات | النص والصوت → النص والصوت |
| اتصالات | WebRTC وWebSockets والتحكم في خادم النطاق الجانبي ومسارات الهاتف/SIP |
| قطع المعرفة | 31 يوليو 2025 |
| طبقة API مجانية | غير معتمد |
ما هو GPT Live 1؟
GPT-Live 1 هو نموذج صوتي في الوقت الفعلي تم تصميمه لإدارة طبقة المحادثة الخاصة بالتطبيق. يتلقى دفقًا صوتيًا مستمرًا، وينتج الكلام، ويسبب الصوت الوارد والصادر معًا. في اللغة الإنجليزية البسيطة، ليس من الضروري أن يتوقف عن الاستماع لمجرد أنه بدأ الحديث.
وهذا يجعل النموذج مناسبًا تمامًا للأجزاء الفوضوية من الكلام الحقيقي: الاعترافات، والتردد، والضحك، والمحادثة في الخلفية، والتصحيحات في منتصف الجملة، والمقاطعات التي تغير ما يريده المتحدث بالفعل.
ليس المقصود من GPT-Live 1 أن يحمل كل سير عمل الأعمال الصعب داخل النموذج الصوتي. للحصول على تفكير أعمق واستخدام الأداة، يتم تفويضها إلى الواجهة الخلفية التي يحددها المطور. يقدم OpenAI أمثلة مثل استخدام نموذج أصغر مثل Luna للجدولة كبيرة الحجم أو تحديثات الطلبات ونموذج مثل Astra لمشاكل العملاء المعقدة. مع تفويض العميل، لا يلزم أن تكون الواجهة الخلفية من طراز OpenAI على الإطلاق.
للحصول على حقائق API الدقيقة، وروابط الوصول الحالية، ومصادر الموفر، راجع الجديد صفحة النموذج GPT-Live 1 في مكتبة نماذج Cody.
لماذا يبدو الصوت المزدوج الكامل مختلفًا؟
معظم الناس لا يتحدثون في كتل متناوبة مرتبة. نتوقف للتفكير دون أن نتخلى عن الكلمة. نقول "صحيح" بينما يتحدث شخص آخر لإظهار أننا نتابع. نبدأ بالتصحيح قبل أن ينتهي الشخص الآخر. يجب على النظام القائم على الأدوار أن يخمن ما إذا كان كل صمت أو صوت يعني "الرد الآن"، أو "الاستمرار في الاستماع"، أو "التوقف عن التحدث".
دوبلكس كامل يعني أن النظام يمكنه الاستماع أثناء التحدث. وهذا لا يضمن إجراء محادثة طبيعية في حد ذاته، ولكنه يمنح النموذج السياق الصوتي اللازم للتفاعل مع التداخل أثناء حدوثه. يمكن التعامل مع الإقرار القصير بشكل مختلف عن الانقطاع الحقيقي. يمكن للتوقف المؤقت المدروس أن يظل مؤقتًا بدلاً من أن يصبح دعوة للمساعد للتدخل.
ولهذا السبب أيضًا، لا يمكن لرقم "الوقت لأول صوت" البسيط أن يصف التجربة بأكملها. يمكن أن يبدأ وكيل الصوت في التحدث بسرعة ويظل يشعر بالوقاحة إذا قاطع المستخدم الذي يفكر. يمكن أن يتمتع بجودة كلام جيدة ويظل يشعر بالبطء إذا أصبح صامتًا في كل مرة يتم فيها تشغيل أداة الواجهة الخلفية. يعد التوقيت، والتعافي، وسلوك الضوضاء في الخلفية، وإكمال المهام أمرًا مهمًا معًا.
كيف يعمل تفويض GPT Live 1
يفصل التفويض الواجهة الأمامية الصوتية عن وكيل الواجهة الخلفية. يمكن لـ GPT-Live 1 أن يحافظ على استمرار المحادثة - من خلال الإقرار بالطلب أو طلب متابعة مفيدة - بينما يتم تنفيذ العمل الأعمق في مكان آخر. يوثق OpenAI طريقتين لربط هذا العمل.
تفويض الردود
مع تفويض الردود، يقوم GPT-Live 1 بإعداد طلب الواجهة الخلفية، ويرسل سياق المحادثة ذي الصلة إلى نموذج ردود OpenAI الذي تم اختياره للجلسة، ويعيد النتيجة إلى المحادثة المنطوقة. إنه المسار الأكثر إدارة والمكان الأسهل للبدء عندما يناسب نموذج الردود والأدوات المدعومة الخاصة به المهمة.
اختيار الواجهة الخلفية مستقل عن النموذج الصوتي. يمكن للفريق توجيه العمل الروتيني إلى نموذج أسرع أو أقل تكلفة والاحتفاظ بالتفكير الأثقل للحالات التي تبرر ذلك. وهذا يعني أيضًا أن الجودة والتكلفة الإجمالية لوكيل GPT-Live 1 تعتمد جزئيًا على تكوين الواجهة الخلفية، وليس فقط على الواجهة الأمامية الصوتية.
تفويض العميل
مع وفد العميل، يتلقى التطبيق حدث تفويض، ويجمع النص المناسب وسياق الأعمال، ويستدعي أي نموذج أو وكيل أو خدمة أو سير عمل مخصص، ثم يقرر النتيجة التي سيتم إرسالها مرة أخرى. يضيف هذا المسار عملاً هندسيًا ولكنه يوفر المزيد من التحكم.
يكون تفويض العميل هو الأنسب عندما يجب التحقق من صحة النتائج أو تنقيحها قبل التحدث بها، أو تحتاج العديد من الواجهات الخلفية إلى توجيه مخصص، أو يجب أن تظل الأنظمة الخاصة داخل مجموعة أدوات الوكيل الحالية، أو عندما يحتاج الفريق إلى ميزانياته الخاصة ونقاط التفتيش والمنطق الاحتياطي.
في كلا الوضعين، يظل التطبيق - وليس GPT-Live 1 - مسؤولاً عن الأذونات والتأكيدات وسجلات الأعمال وحالة المهمة الدائمة. التفويض هو آلية اتصال، وليس نظام تفويض.
ميزات GPT Live 1 مهمة
- الاستماع والتحدث في نفس الوقت: يفكر النموذج في الصوت الوارد والصادر معًا بدلاً من التعامل مع كل منهما على أنه منعطف معزول.
- معالجة الانقطاع الطبيعي: يمكن أن تستجيب بشكل مختلف لقناة خلفية، أو تصحيح، أو محاولة حقيقية لأخذ الكلمة.
- الاستدلال والأدوات المفوضة: يمكن تنفيذ العمل الأعمق من خلال نموذج استجابات محدد أو واجهة خلفية يتم تشغيلها بواسطة التطبيق.
- السلوك الصوتي الموجه: يمكن للمطورين تشكيل النغمة، والوتيرة، والأسلوب، والقنوات الخلفية، وسلوك المقاطعة، ومتى يجب أن يفوض النموذج.
- النصوص الأصلية: تتوفر نصوص ASR ونص الاستجابة جنبًا إلى جنب مع الدفق الصوتي.
- دعم الحروف الأبجدية الرقمية والكلمات الرئيسية: يسلط OpenAI الضوء على معالجة أقوى للأسماء والرموز والسلاسل الدقيقة الأخرى، بالإضافة إلى انحياز الكلمات الرئيسية.
- التعامل مع الصمت والضوضاء الخلفية: تم تصميم النموذج لتجنب التعامل مع كل صوت أو توقف مؤقت كأمر للاستجابة.
- موثوقية الجلسة الطويلة: تقول OpenAI إنها تعمل على تحسين الاحتفاظ بالسياق وجودة المحادثة عبر التفاعلات الأطول.
- اتصالات المتصفح والخادم والهاتف: تتضمن المسارات الموثقة WebRTC وWebSockets والتحكم في النطاق الجانبي والاتصال الهاتفي/SIP.
تسرد صفحة النموذج أيضًا الدفق واستدعاء الوظائف على النحو المدعوم. لا يتم دعم المخرجات المنظمة والضبط الدقيق والمخرجات المتوقعة لـ GPT-Live 1.
تسعير GPT Live 1
معدل العنوان بسيط: 0.05 دولارًا أمريكيًا للدقيقة للجلسة الصوتية الأمامية. يتم إصدار فاتورة OpenAI بالثانية، لذلك لا يتم تقريب الجلسة التي تبلغ مدتها 61 ثانية إلى دقيقتين كاملتين.
ما هي تكلفة الجلسة الصوتية
| استخدام الصوت | تكلفة الواجهة الأمامية GPT-Live 1 |
|---|---|
| 10 دقائق | $0.50 |
| 30 دقيقة | $1.50 |
| 100 ساعة (6000 دقيقة) | $300 |
| 1,000 ساعة (60,000 دقيقة) | $3,000 |
هذه الأمثلة هي مضاعفة بسيطة لقائمة الأسعار. إنها مفيدة لتقدير طبقة المحادثة، لكنها كذلك ليست التكلفة الإجمالية لتشغيل وكيل الصوت.
التكاليف غير متضمنة في 0.05 دولار للدقيقة
- نموذج الواجهة الخلفية الذي ينفذ الاستدلال أو ينشئ نتائج مفوضة.
- الأدوات المدفوعة مثل بحث الويب أو خدمات المزود الأخرى.
- رسوم شركة الاتصالات الهاتفية أو رقم الهاتف أو SIP أو النظام الأساسي الشريك.
- الخوادم والتخزين والمراقبة وإمكانية المراقبة والبنية التحتية الصوتية.
- التصعيد البشري ومراجعة الجودة وعمليات الدعم.
وبالتالي فإن التوقعات الواقعية هي: دقائق الجلسة الصوتية + استخدام الواجهة الخلفية + الأدوات + الهاتف/النقل + تكاليف التطبيق. التقط تلك القطع بشكل منفصل خلال فترة تجريبية. غالبًا ما تكون التكلفة لكل مهمة مكتملة أكثر فائدة من تكلفة الدقيقة لأن المكالمة الأكثر طبيعية قد يتم حلها بشكل أسرع - أو قد تشجع على إجراء محادثة أطول.
تقيس صفحة نموذج OpenAI حدود المعدل في الجلسات المتزامنة. وهي تدرج حاليًا 25 جلسة للمستوى 1، و50 للمستوى 2، و200 للمستوى 3، و300 للمستوى 4، و500 للمستوى 5. ويجب على فرق الإنتاج تأكيد الحدود الحالية وطلب السعة قبل الإطلاق الكبير.
GPT Live 1 مقابل GPT-Realtime-2.1
كلاهما عبارة عن نماذج صوتية OpenAI، لكنهما يحلان البنية بشكل مختلف. GPT-Realtime-2.1 هو نموذج استدلال تحويل الكلام إلى كلام يمكنه استقبال النص والصورة وسياق الصوت ووظائف الاتصال داخل جلسة الوقت الفعلي. GPT-Live 1 عبارة عن واجهة أمامية مخصصة للمحادثة ثنائية الاتجاه تقوم بتفويض التفكير والإجراءات الأعمق إلى واجهة خلفية منفصلة.
| سؤال | GPT-Live 1 | GPT-Realtime-2.1 |
|---|---|---|
| التصميم الأساسي | واجهة أمامية صوتية مزدوجة كاملة بالإضافة إلى واجهة خلفية مفوضة | نموذج تحويل الكلام إلى كلام في الوقت الفعلي مع الاستدلال واستدعاء الوظيفة في الجلسة |
| الفواتير المنشورة | 0.05 دولارًا أمريكيًا لكل دقيقة جلسة، بالإضافة إلى استخدام الواجهة الخلفية | يعتمد على الرمز المميز: تختلف معدلات الصوت والنص والصورة حسب فئة الإدخال/الإخراج |
| السلوك الصوتي | مصممة حول الاستماع والتحدث في وقت واحد | حوار في الوقت الحقيقي مع اكتشاف الدور والتعامل مع الانقطاع |
| مدخلات الواجهة الأمامية | النص والصوت | النص والصورة والصوت |
| مرونة الواجهة الخلفية | نموذج الاستجابات أو أي نموذج أو وكيل أو خدمة يديرها العميل | نموذج واحد تم تكوينه في الوقت الفعلي وأدواته المتاحة |
| أفضل سبب للاختبار | المزيد من التداخل الطبيعي بالإضافة إلى التوجيه الخلفي المستقل | جلسة موحدة متعددة الوسائط في الوقت الفعلي مع استخدام قائم على الرمز المميز |
لا يمكن تحويل صفوف الأسعار إلى حكم "نموذج أرخص" عالمي عادل. GPT-Live 1 يفرض رسومًا على وقت الجلسة المنقضي ويضيف فاتورة الواجهة الخلفية. يقوم GPT-Realtime-2.1 بشحن الرموز عبر العديد من فئات الوسائط. الصمت، ونسبة التحدث، وطول الاستجابة، واستخدام الصورة، والأدوات، والتخزين المؤقت، واختيار الواجهة الخلفية كلها تغير النتيجة.
استخدم مكتبة نماذج Cody لفحص التيار مقارنة GPT-Live 1 مع GPT-Realtime-2.1 أو قارن GPT-Live 1 مع الموديلات الأخرى في فئة الصوت والوقت الحقيقي.
GPT Live 1 مقابل خط أنابيب STT-LLM-TTS التقليدي
عادةً ما يربط وكيل الصوت التقليدي ثلاثة أنظمة: تحويل الكلام إلى نص، ونموذج اللغة، وتحويل النص إلى كلام. هذه النمطية ذات قيمة. يمكن للفرق اختيار أفضل نموذج نسخ للغة، والتحقق من صحة الاستجابة النصية الكاملة قبل بدء الكلام، واستبدال مكون واحد دون استبدال كل شيء.
المقايضة هي التنسيق. تؤدي كل عملية تسليم إلى إنشاء قائمة انتظار أخرى، وتحويل تنسيق آخر، ومكان آخر حيث يمكن فقدان التوقيت أو السياق. يجب أن يقرر التطبيق متى ينتهي الكلام، وماذا تفعل إذا قاطع المتصل الكلام المركب، وكيف يجب أن يتغير النص بعد التصحيح الذاتي.
يقوم GPT-Live 1 بدمج مرحلتي الاستماع والتحدث في طبقة صوتية واحدة متواصلة مع الحفاظ على واجهة خلفية منفصلة للعمل بشكل أعمق. يمكن أن يؤدي ذلك إلى تبسيط عملية تبادل الأدوار وتقليل الشعور "بجهاز الاتصال اللاسلكي"، لكنه لا يلغي الحاجة إلى طبقة التطبيق. لا يزال يتعين على التطبيق إدارة الإجراءات والخصوصية واسترداد الفشل والاتصال الهاتفي ومصدر الحقيقة للمهمة.
اختر بناءً على المتطلبات الأصعب. إذا كان التحقق الكامل من صحة ما قبل الكلام والتحكم على مستوى المكونات إلزاميًا، فقد يظل خط الأنابيب المتتالي جذابًا. إذا كان تدفق المحادثة والتداخل والاستمرار في المشاركة أثناء تشغيل المهمة أمرًا أساسيًا، فإن GPT-Live 1 هي بنية مقنعة للاختبار.
ما الذي تفعله وما لا تثبته معايير OpenAI
تشير OpenAI إلى أن GPT-Live 1 قام بتحسين نتيجة Full Duplex Bench بمقدار 30 نقطة مئوية أكثر من GPT-Realtime-2.1، مع مكاسب في زمن انتقال الأدوار والسلوك التفاعلي. عند إقرانه مع GPT-6 Astra في جهد تفكير متوسط، يُبلغ OpenAI أيضًا عن نتيجة Tau3 رقم واحد لمهام الوكيل الصوتي الشاملة.
في تقييم مبكر للعملاء، أبلغت شركة تعلم اللغات Speak عن انقطاعات أقل بنسبة 80٪ تقريبًا أثناء توقف تفكير المتعلم مقارنة بأنظمتها السابقة القائمة على الأدوار. كما نشر OpenAI أيضًا حسابات عملاء إيجابية من Yelp وFin وCognition وغيرها.
وتمثل هذه النتائج إشارات مفيدة، لكنها لا تزال قائمة التقييمات التي ينشرها المزود وتقارير العملاء. تقيس نتيجة Astra النظام المدمج، وليس GPT-Live 1 وحده. لا يضمن أي من الأرقام الأداء على مشغل شبكة الهاتف أو اللهجات أو الضوضاء أو زمن وصول الأداة أو المطالبة أو سير العمل. لم نقم بإعادة إنتاجها كمعيار Cody.
يجب أن يسجل التقييم القوي على الأقل: المهام المكتملة، والانقطاعات غير المناسبة، والاسترداد بعد التصحيحات، وتوقيت نهاية الدور، ودقة الأداة، والنسب المئوية لزمن الوصول، وجودة التصعيد، والتكلفة لكل مهمة مكتملة، والتفضيل البشري عبر المكالمات التمثيلية.
GPT Live 1 الأصوات ودعم اللغة
يسرد إطلاق OpenAI اثني عشر صوتًا: كوارتز، تموج، فيسبر، ويلو، ستون، بصيص، ميريديان، بوسا، تيمبو، بيكون، دلتا، وسيندر. وتقول الشركة إن الاختيار يوسع التغطية عبر اللهجات واللهجات واللغات، وتخطط لإضافة المزيد بمرور الوقت.
لا يقوم OpenAI بنشر قائمة لغات محددة في صفحة نموذج GPT-Live 1. لذلك لا ينبغي قراءة "توفر اللغة على نطاق أوسع" على أنها ضمان لكل لغة أو لهجة أو نمط تبديل التعليمات البرمجية. اختبر المتحدثين الحقيقيين، وظروف الخلفية، والأسماء، والعناوين، وعبارات التأكيد، واللغات التي يعد منتجك بدعمها.
الوصول الصوتي المخصص ليس خيارًا افتراضيًا للخدمة الذاتية. يوجه OpenAI المؤسسات المهتمة للاتصال بالمبيعات لتحديد الأهلية وعملية الطلب.
كيفية توصيل GPT Live 1
يوثق OpenAI العديد من أنماط الاتصال. يعتمد الخيار الصحيح على مصدر الصوت والنظام الذي يحتاج إلى التحكم في الجلسة.
WebRTC للتطبيقات الصوتية للمتصفح
WebRTC هي نقطة البداية الموصى بها للتطبيقات الصوتية المعتمدة على المتصفح. تحمل مسارات الوسائط صوت الميكروفون ومكبر الصوت، بينما تحمل قناة البيانات أحداث الجلسة. يجب على الخادم الموثوق به إنشاء الجلسة وإبقاء مفتاح OpenAI API خارج المتصفح.
WebSockets للصوت من جانب الخادم
تتلاءم WebSockets مع عمليات التكامل من جانب الخادم حيث يمتلك التطبيق دفق الصوت. يحمل المقبس الرئيسي أحداث الصوت والتحكم. إذا كان المتصفح يمتلك اتصال WebRTC ولكن الخادم لا يزال يحتاج إلى نصوص أو مراقبة أو تعليمات تصحيحية، فيمكن للنطاق الجانبي WebSocket إرفاق عناصر تحكم الخادم دون نقل الصوت بعيدًا عن WebRTC.
الاتصالات الهاتفية وSIP لوكلاء الهاتف
يقوم OpenAI بتوثيق مسارات تكامل الاتصالات الهاتفية وSIP ويوفر إرشادات الشركاء لأنظمة مثل LiveKit وTwilio وTelnyx وDaily وPipecat. تظل رسوم الناقل والشريك منفصلة عن رسوم جلسة GPT-Live 1.
خطة إعداد GPT Live 1 عملية
- اختر مكالمة واحدة ضيقة. ابدأ بسير عمل محدد مثل التحقق من أمر ما، أو تأهيل عميل متوقع، أو البحث عن موعد - وليس وكيلًا متعدد الأغراض.
- اختر الاتصال. استخدم WebRTC لنموذج أولي للمتصفح، أو WebSockets عندما يمتلك الخادم الصوت، أو مسار هاتفي موثق للمكالمات الهاتفية.
- اجعل الرسالة المباشرة قصيرة. ضع النغمة والوتيرة وأسلوب المقاطعة والقنوات الخلفية وسياسة التفويض في الموجه الصوتي. احتفظ بسير عمل الأعمال التفصيلي وقواعد الأداة في الواجهة الخلفية.
- اختر التفويض. ابدأ بتفويض الاستجابات للواجهة الخلفية OpenAI المُدارة. استخدم تفويض العميل عندما تحتاج إلى سياق مخصص أو التحقق من الصحة أو التوجيه أو خدمة غير OpenAI.
- فرض قواعد العمل في التعليمات البرمجية. تحقق من الهوية والترخيص والتأكيدات والميزانيات وتغييرات الحالة المسموح بها قبل تشغيل الأداة.
- الحفاظ على النصوص وحالة المهمة. يمكن أن تكون دلتا النص غير مكتملة أو خاطئة. قم بتخزين سجل كافٍ لفهم "نعم"، و"الجمعة بدلاً من ذلك"، والتصحيحات التي تشير إلى تفاصيل سابقة.
- اختبار الصوت الفوضوي. تشمل بطيئي التفكير، والمقاطعات، والمحادثات الجانبية، والضوضاء، والتهجئة، وأرقام الحسابات، والصمت، وقطع الاتصال، والتصعيد للإنسان.
- قياس النظام الكامل. تتبع جودة المحادثة ونجاح مهمة الواجهة الخلفية، بالإضافة إلى كل تكلفة تقع خارج معدل دقيقة الصوت.
الترحيل من الوقت الفعلي أو مكدس الصوت المتتالي
لا تقتصر عملية الترحيل على مجرد تغيير معرف النموذج. التغيير الأكثر أهمية هو تقسيم المسؤوليات عمدا.
- انقل نمط المحادثة إلى المطالبة المباشرة. حدد كيف يجب أن يتحدث الصوت، وينتظر، ويعترف، ويقاطع، ويفوض.
- احتفظ بسير العمل التفصيلي في الواجهة الخلفية. تنتمي قواعد العمل ومخططات الأدوات والتحقق من الصحة والأذونات والمخرجات الطويلة إلى الوكيل الذي يقوم بالعمل.
- التكيف مع الأحداث الصوتية المستمرة. يقوم GPT-Live 1 ببث الصوت بشكل مستمر وله أحداث جلسة مختلفة عن Realtime API؛ لا تفترض نفس تدفق الالتزام والتشغيل اليدوي.
- ترجمة استدعاءات الوظائف إلى تفويض. تطلب الواجهة الأمامية المباشرة من الواجهة الخلفية المساعدة بدلاً من إصدار وسيطات أداة منظمة عادية بنفس طريقة استخدام النص أو وكيل الوقت الفعلي.
- الحفاظ على الضمانات الحالية. احتفظ بالمراقبة وكتل الإجراءات والتأكيدات وسجلات التدقيق والإلغاء والتصعيد. قم بتكييفها مع النموذج الذي قد يستمر في التحدث أثناء تشغيل عمليات التحقق.
قم بتشغيل البنية القديمة والجديدة مقابل نفس السيناريوهات المسجلة حيثما تسمح السياسة بذلك. قارن نتائج المكالمة الكاملة، وليس العرض التوضيحي المصقول. لدينا منفصلة دليل لزمن وصول وكيل الصوت يشرح لماذا يجب قياس النقل والنسخ والتفكير والأدوات والتشغيل معًا.
محاذير الإنتاج تستحق الفهم
لا يزال طلبك يمتلك القرارات المحفوفة بالمخاطر
يمكن لـ GPT-Live 1 أن يجعل المحادثة تبدو واثقة؛ لا يثبت أن الإجراء الخارجي قد تم التصريح به أو اكتماله. تحقق من الأذونات والتأكيدات المطلوبة قبل تغيير الموعد أو شحن البطاقة أو الكشف عن سجل الحساب أو الإعلان عن النجاح. استمر في حالة مهمة مصدر الحقيقة خارج الجلسة الصوتية.
الانقطاع ليس إلغاءً
إذا قال المتصل "في الواقع، الجمعة بدلاً من ذلك" أثناء إجراء بحث يوم الخميس، فإن مقاطعة الحديث لا تلغي هذا البحث. يجب أن يقوم التطبيق بمراجعة المهمة النشطة، وإبطال التأكيدات القديمة، وإلغاء العمل حيثما أمكن ذلك، ومنع نطق نتيجة يوم الخميس المتأخرة كنتيجة حالية.
الكلام المستمر يغير تصميم الدرابزين
يمكن لوكيل النص إنهاء الإجابة بأكملها والتحقق من صحتها قبل عرضها. قد يتحدث GPT-Live 1 أثناء استمرار العمل الخلفي أو فحوصات السياسة. لا يضمن حجب نتيجة الأداة بقاء الواجهة الصوتية صامتة. قم بمراقبة كل من النصوص والإجراءات، وحظر الأدوات غير الآمنة في كود التطبيق، والتحكم في التشغيل حيث تكون الموافقة المسبقة على الكلام مطلوبة.
لا تزال بعض القرارات بحاجة إلى الصوت الأصلي
لا تتلقى الواجهة الخلفية المفوضة شكل الموجة الخام تلقائيًا. إذا كان سير العمل يعتمد على دليل صوتي - صوت تنبيه للبريد الصوتي، أو إيقاع السماعة، أو انضمام شخص آخر، أو إشارة أخرى غير نصية - قم بتوجيه الصوت الأصلي إلى كاشف أو مراجع مناسب. لا تفترض أن النص يحتوي على كل إشارة سمعتها الواجهة الأمامية.
من يجب عليه اختبار GPT Live 1؟
يعد GPT-Live 1 أكثر إثارة للاهتمام بالنسبة للمنتجات التي يكون فيها توقيت المحادثة جزءًا من الوظيفة: دعم العملاء، وجدولة المواعيد، وحجوزات المطاعم، وتعليم اللغة، وتأهيل المبيعات، وإمكانية الوصول، والعمل بدون استخدام اليدين، والواجهات الصوتية التعاونية.
من غير الواضح أنه ضروري للسرد أحادي الاتجاه، أو نسخ الملفات، أو تحويل النص إلى كلام بسيط، أو سير العمل الذي يجب أن يتحقق من صحة كل جملة كاملة قبل تشغيل أي صوت. قد توفر خدمات الكلام المتخصصة أو المكدس المتتالي مزيدًا من التحكم المباشر في تلك الحالات.
القرار العملي ليس "هل GPT-Live 1 هو أفضل نموذج صوتي؟" إنه: هل تعمل المحادثة ثنائية الاتجاه بالإضافة إلى الواجهة الخلفية المختارة بشكل منفصل على تحسين نجاح المهمة بما يكفي لتبرير البنية والتكلفة الإجمالية؟ يمكن للطيار التمثيلي الإجابة على ذلك؛ لا يمكن أن يكون العنوان القياسي.
الأسئلة المتداولة
ما هو GPT Live 1؟
GPT-Live 1 هو نموذج صوتي مزدوج الاتجاه من OpenAI للمحادثات في الوقت الفعلي. فهو يستمع ويتحدث في نفس الوقت، ثم يقوم بتفويض التفكير العميق وعمل الأدوات إلى وكيل خلفي منفصل.
كم تكلفة GPT Live 1؟
تبلغ تكلفة الجلسة الصوتية الأمامية 0.05 دولارًا أمريكيًا للدقيقة ويتم محاسبتها بالثانية. يتطلب استخدام نموذج الواجهة الخلفية والأدوات والاتصال الهاتفي والتخزين والبنية التحتية للتطبيقات تكلفة إضافية.
هل GPT Live 1 متاح الآن؟
نعم. أصدرت OpenAI GPT-Live 1 في API في 10 سبتمبر 2026. معرف نموذج API الدقيق هو gpt-live-1. تشير صفحة نموذج OpenAI إلى أن طبقة API المجانية غير مدعومة.
ما هو الذكاء الاصطناعي الصوتي ثنائي الاتجاه؟
الازدواج الكامل يعني أن النظام الصوتي يمكنه الاستماع أثناء التحدث. وهذا يجعل التعامل مع الكلام المتداخل والاعترافات والمقاطعات والتوقفات الطبيعية أسهل من التعامل مع التبادل الصارم لمتحدث واحد في كل مرة.
ما الفرق بين GPT Live 1 وGPT-Realtime-2.1؟
GPT-Live 1 عبارة عن واجهة أمامية صوتية مزدوجة كاملة تتم فواتيرها بالدقيقة والتي تقوم بتفويض العمل الأعمق إلى نموذج الواجهة الخلفية. GPT-Realtime-2.1 هو نموذج تحويل الكلام إلى كلام الذي تتم فوترته برمز مميز والذي يتعامل مع الصوت والاستدلال واستدعاء الوظائف خلال جلسته الفعلية.
هل يمكن لـ GPT Live 1 استدعاء الأدوات؟
نعم عن طريق التفويض يستخدم تفويض الاستجابات نموذج استجابات OpenAI المحدد. يتيح تفويض العميل للتطبيق الاتصال بنموذج أو وكيل أو خدمة أو سير عمل مخصص آخر وتحديد النتيجة التي تم التحقق منها والتي ستعود.
هل تؤدي مقاطعة GPT Live 1 إلى إلغاء مهمة الواجهة الخلفية؟
لا. لا تؤدي مقاطعة الكلام إلى إلغاء العمل الخلفي تلقائيًا. يجب أن يقرر التطبيق ما إذا كان سيتم إلغاء النتيجة القديمة أو مراجعتها أو تجاهلها.
هل يدعم GPT Live 1 WebRTC وWebSockets والمكالمات الهاتفية؟
نعم. يوثق OpenAI WebRTC للتطبيقات الصوتية للمتصفح، وWebSockets للصوت من جانب الخادم، وعناصر تحكم خادم النطاق الجانبي، ومسارات الاتصال الهاتفي أو تكامل SIP.
ما هي الأصوات المتوفرة لـ GPT Live 1؟
يسرد إطلاق OpenAI الكوارتز، والريبل، وVesper، وWillow، وStone، وGleam، وMeridian، وBossa، وTempo، وBeacon، وDelta، وCinder. يتطلب الوصول الصوتي المخصص عملية الأهلية والمبيعات.
المصادر والمنهجية
تم فحص هذه المقالة مقابل مواد OpenAI الخاصة بالطرف الأول في 11 سبتمبر 2026. وتم تصنيف النتائج المعيارية ونتائج العملاء على أنها تم الإبلاغ عنها بواسطة OpenAI بدلاً من تقديمها كقياسات Cody مستقلة.
- OpenAI: إعلان إطلاق GPT-Live 1 API
- OpenAI: صفحة نموذج GPT-Live 1 والسعر والميزات وحدود الأسعار
- OpenAI: البدء مع GPT-Live
- OpenAI: دليل المطالبة GPT-Live
- OpenAI: تفويض وأدوات GPT-Live
- OpenAI: إرشادات الترحيل لـ GPT-Live
- OpenAI: تسعير API
خلاصة القول
GPT-Live 1 هو أكثر من مجرد صوت اصطناعي جديد. يغير شكل الوكيل الصوتي: يدير نموذج مزدوج كامل الإيقاع البشري للمحادثة، بينما تتعامل الواجهة الخلفية المختارة بشكل منفصل مع العمل الأصعب.
يجعل سعر الدقيقة 0.05 دولارًا أمريكيًا من السهل تقدير الواجهة الأمامية، لكن الواجهة الخلفية والأدوات وشبكة الهاتف والتطبيقات لا تزال تحدد إجمالي الفاتورة وجزءًا كبيرًا من جودة المهمة. الخطوة التالية الأكثر فائدة هي إصدار تجريبي ضيق يحتوي على مقاطعات وتصحيحات وضوضاء وأذونات واقعية - وليس عرضًا توضيحيًا مكتوبًا نظيفًا.
استكشف دليل نموذج GPT-Live 1، قارنها مباشرة مع GPT-Realtime-2.1، أو تصفح كاملا دليل نماذج الذكاء الاصطناعي الصوتي.


