Gemini 3.1 Flash Live Preview
نموذج معاينة الصوت إلى الصوت الخاص بـ Google للحوار منخفض زمن الوصول مع الوعي متعدد الوسائط والتفكير وتأريض البحث واستدعاء الوظائف.
نموذج معاينة الصوت إلى الصوت الخاص بـ Google للحوار منخفض زمن الوصول مع الوعي متعدد الوسائط والتفكير وتأريض البحث واستدعاء الوظائف.
نظرة عامة على اللغة الإنجليزية البسيطة
يقبل Gemini 3.1 Flash Live الصوت المباشر إلى جانب النصوص والصور والفيديو، ثم يقوم بإرجاع النص والصوت. إنه يهدف إلى المحادثات التي تستفيد من الفروق الصوتية والسياق المرئي بدلاً من تشغيل تحويل النص إلى كلام بسيط.
ينشر Google كلاً من معدلات الرمز المميز ومعادلات الصوت لكل دقيقة. وهذا يجعل إعداد الميزانية المبكرة أسهل، ولكن لا يزال بإمكان مدخلات البحث ومدخلات الوسائط المتعددة إضافة استخدام منفصل.
مقارنة الفئة
هذه مواصفات منشورة من قبل الموفر، وليست درجات معيار Cody. اتبع المصادر المرتبطة للحدود الحالية والاستثناءات الخاصة بنقطة النهاية.
الوصول إلى واجهة برمجة التطبيقات والموفر
التوفر
معاينة الوصول من خلال Gemini Live API وGoogle AI Studio في المناطق المدعومة.
استخدم قائمة مناطق Gemini API المباشرة الخاصة بـ Google وتأكد من أهلية المعاينة.
تحقق من التوفر المباشرالبيانات والتدريب
تقول Google أن محتوى Gemini API المدفوع لا يُستخدم لتحسين منتجاتها؛ يمكن أن تكون بيانات الخدمة غير المدفوعة بشكل عام. تأكد من حالة الفوترة والشروط الحالية قبل إرسال المحادثات الحساسة.
هذه قراءة موجزة لمواد المزود المذكورة، وليست نصيحة قانونية. يمكن أن تحتوي بوابة الطرف الثالث على شروط تخزين وتوجيه وتدريب وإقامة مختلفة من واجهة برمجة التطبيقات المباشرة الخاصة بصانع النموذج.
اقرأ سياسة المزودالأسئلة المتداولة
نموذج معاينة الصوت إلى الصوت الخاص بـ Google للحوار منخفض زمن الوصول مع الوعي متعدد الوسائط والتفكير وتأريض البحث واستدعاء الوظائف. يقبل Gemini 3.1 Flash Live الصوت المباشر إلى جانب النصوص والصور والفيديو، ثم يقوم بإرجاع النص والصوت. إنه يهدف إلى المحادثات التي تستفيد من الفروق الصوتية والسياق المرئي بدلاً من تشغيل تحويل النص إلى كلام بسيط.
تم إصدار Gemini 3.1 Flash Live Preview على 1 مارس 2026 وفقًا لمواد الموفر المذكورة.
معاينة الوصول من خلال Gemini Live API وGoogle AI Studio في المناطق المدعومة. مسارات الوصول المدرجة في هذا الدليل هي Google.
إدخال الصوت 0.005 دولار/الدقيقة · إخراج الصوت 0.018 دولار/الدقيقة. مكافئات الطبقة المدفوعة لـ Google؛ تبلغ تكلفة إدخال/إخراج النص 0.75 دولارًا أمريكيًا/4.50 دولارًا أمريكيًا لكل مليون رمز مميز، كما تبلغ تكلفة إدخال الصور/الفيديو 0.002 دولارًا أمريكيًا لكل دقيقة.
معاينة الوصول من خلال Gemini Live API وGoogle AI Studio في المناطق المدعومة. استخدم قائمة مناطق Gemini API المباشرة الخاصة بـ Google وتأكد من أهلية المعاينة.
تقول Google أن محتوى Gemini API المدفوع لا يُستخدم لتحسين منتجاتها؛ يمكن أن تكون بيانات الخدمة غير المدفوعة بشكل عام. تأكد من حالة الفوترة والشروط الحالية قبل إرسال المحادثات الحساسة. تنتمي السياسة إلى مسار الموفر وشروط الحساب، لذا تحقق منها مرة أخرى قبل استخدام الإنتاج.
المقارنات ذات الصلة
نموذج OpenAI للاستدلال المنطقي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء الصوت الذين يستخدمون الأدوات والذين يحتاجون أيضًا إلى سياق النص والصورة.
فتح المقارنة الكاملةنموذج ElevenLabs المعبّر لتحويل النص إلى كلام في الوقت الفعلي للحوار الطبيعي والتوصيل العاطفي والعلامات الصوتية وأكثر من 70 لغة.
فتح المقارنة الكاملةأحدث نموذج تعبيري لتحويل النص إلى كلام في العالم في الوقت الفعلي، مصمم لتذكر تسليم المحادثة والتحدث بأكثر من 100 لغة.
فتح المقارنة الكاملةنموذج SpaceXAI الحالي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء المحادثة دون الثانية مع إمكانية الوصول إلى الأداة.
فتح المقارنة الكاملة