كل القدرات الصورة والصوت والفيديو
تحدّث إليه بصوتك واسمع جوابه
ليست تفريغًا ثم إجابة ثم تركيبًا للصوت. جلسة واحدة على gpt-realtime-2.1 يدخل فيها الصوت ويخرج صوتًا، وتبادل الأدوار متكفَّل به.
التوثيقموثّق رسميًاالاختبارلم يختبره benchr
واجهة OpenAI البرمجية
نظرة عامة
- يعمل عبر ثلاثة نواقل: WebRTC لعملاء المتصفّح والجوال، وWebSocket لخطوط المعالجة على الخادم، وSIP للاتصال الهاتفي.
- يلغي خط المعالجة المخيَّط، وهذا ما يلغي أكثر التأخير الذي يلاحظه الناس في وكلاء الصوت.
- يتيح ضبط جهد الاستدلال، فيمكن معايرة وكيل صوتي إنتاجي على سرعة الاستجابة.
كيف تعمل
- 01اختر الناقل حسب موضع الصوت: متصفّح إلى WebRTC، وخادم إلى WebSocket، ورقم هاتف إلى SIP.
- 02ابدأ بجهد استدلال منخفض، فالتوثيق يسمّيه نقطة البدء الإنتاجية لوكلاء الصوت.
- 03اضبط تأخير التفريغ بوعي: التأخير الأقل يعطي نصًا جزئيًا أبكر، والأعلى يحسّن جودة النص.
- 04صمّم سلوك المقاطعة قبل الموجّه؛ فالمقاطعة هي الفارق بين عرض تجريبي وشيء يستخدمه الناس.
القيود
- هو بروتوكول جلسة لا نقطة طلب واستجابة؛ فإعادة الاتصال والحالة وتخزين الصوت مسؤوليتك.
- المفاضلة بين الزمن والجودة معلنة في التوثيق ولا يمكن تحسينها بعيدًا، بل اختيارها فقط.
- الاتصال الهاتفي عبر SIP يضعك داخل قيود شركات الاتصال التي لا يغطيها توثيق النموذج.
التحقق
تشغيلات اختبار benchr
لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.
الأدلة
المصادر
- OpenAI - الواجهة الآنية: gpt-realtime-2.1 والنواقل الثلاثة وإرشاد جهد الاستدلال المستوى 1 · 1 سبتمبر 2026
لم يذكره المصدر
- أرقام زمن الاستجابة الكلي لأي ناقل
- حدود التزامن لكل مؤسسة
سجل الفحوص
- 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. معرّف النموذج والنواقل الثلاثة وإرشاد جهد الاستدلال المنخفض للإنتاج مقروءة من الدليل الآني.