كل القدرات الصورة والصوت والفيديو

تحدّث إليه بصوتك واسمع جوابه

ليست تفريغًا ثم إجابة ثم تركيبًا للصوت. جلسة واحدة على gpt-realtime-2.1 يدخل فيها الصوت ويخرج صوتًا، وتبادل الأدوار متكفَّل به.

التوثيقموثّق رسميًاالاختبارلم يختبره benchr عميق · واجهة برمجية فُحص التوثيق 1 سبتمبر 2026
واجهة OpenAI البرمجية

نظرة عامة

  • يعمل عبر ثلاثة نواقل: WebRTC لعملاء المتصفّح والجوال، وWebSocket لخطوط المعالجة على الخادم، وSIP للاتصال الهاتفي.
  • يلغي خط المعالجة المخيَّط، وهذا ما يلغي أكثر التأخير الذي يلاحظه الناس في وكلاء الصوت.
  • يتيح ضبط جهد الاستدلال، فيمكن معايرة وكيل صوتي إنتاجي على سرعة الاستجابة.

كيف تعمل

  1. 01اختر الناقل حسب موضع الصوت: متصفّح إلى WebRTC، وخادم إلى WebSocket، ورقم هاتف إلى SIP.
  2. 02ابدأ بجهد استدلال منخفض، فالتوثيق يسمّيه نقطة البدء الإنتاجية لوكلاء الصوت.
  3. 03اضبط تأخير التفريغ بوعي: التأخير الأقل يعطي نصًا جزئيًا أبكر، والأعلى يحسّن جودة النص.
  4. 04صمّم سلوك المقاطعة قبل الموجّه؛ فالمقاطعة هي الفارق بين عرض تجريبي وشيء يستخدمه الناس.

القيود

  • هو بروتوكول جلسة لا نقطة طلب واستجابة؛ فإعادة الاتصال والحالة وتخزين الصوت مسؤوليتك.
  • المفاضلة بين الزمن والجودة معلنة في التوثيق ولا يمكن تحسينها بعيدًا، بل اختيارها فقط.
  • الاتصال الهاتفي عبر SIP يضعك داخل قيود شركات الاتصال التي لا يغطيها توثيق النموذج.

التحقق

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

الأدلة

لم يذكره المصدر

  • أرقام زمن الاستجابة الكلي لأي ناقل
  • حدود التزامن لكل مؤسسة
سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. معرّف النموذج والنواقل الثلاثة وإرشاد جهد الاستدلال المنخفض للإنتاج مقروءة من الدليل الآني.