GPT-Realtime-2.1: قيّم المكالمة كاملة، لا بطاقة سعر النص فقط

نموذج OpenAI صوت إلى صوت يدعم الاستدلال والأدوات؛ لكن فاتورة الصوت تحتاج اختباراً منفصلاً.

بقلم فريق benchr التحريري · · · سجل التغييرات · تحققنا من الحقائق المنشورة في المصادر الرسمية في 29 يوليو 2026

GPT-Realtime-2.1: قيّم المكالمة كاملة، لا بطاقة سعر النص فقط: خطوط توجيه داكنة وشرائط خضراء للقياس.
لوحة نموذج من benchr GPT-Realtime-2.1 دورة صوت · أدوات · مقاطعة
OpenAIتظهر هوية GPT-Realtime-2.1: قيّم المكالمة كاملة، لا بطاقة سعر النص فقط عبر خطوط توجيه داكنة وشرائط خضراء للقياس.
النص / 1M$4الإخراج: $24
الصوت / 1M$32الإخراج: $64
السياق128Kإخراج 32K
الإصدار6 يوليو2026

النموذج جزء واحد من نظام حي: اكتشاف الدور والمقاطعة ونقل الصوت واستدعاء الأداة وحالة الجلسة وسياسة الاستعادة. قد يكون النموذج ممتازاً بينما تفشل المكالمة بسبب اتصال يعيد الصوت القديم أو أداة تنفذ على رقم غير مؤكد.

اختر بنية الصوت قبل اختيار الحجم

يفرق دليل OpenAI بين صوت إلى صوت مباشرة، وبين سلسلة: تحويل الكلام إلى نص، ثم نموذج نصي، ثم تحويل النص إلى كلام. المسار المباشر أفضل للحوار الطبيعي وزمن الاستجابة المحسوس. السلسلة أفضل حين تحتاج نصاً واضحاً للمراجعة، أو موافقة قبل النطق، أو مراقبة مستقلة لكل مرحلة.

مصفوفة البنية والاتصال
المطلبالمسار الأنسبالسبب
متصفح أو تطبيق جوالصوت مباشر عبر WebRTCإدارة وسائط العميل ودور حديث طبيعي
وسائط يملكها الخادمصوت مباشر عبر WebSocketالخادم يراقب الأحداث والتدفق
هاتفSIPربط اتصالات مباشر
نص وسيط قابل للتدقيقسلسلة صوتيةيمكن إيقاف كل مرحلة ومراجعتها
عقد JSON صارمسلسلة مع نموذج نصي مناسبRealtime لا يدعم structured outputs

اختيار الاتصال يحدد مكان المفتاح، والتليمترية، وسلوك إعادة الاتصال، ومن يملك التخزين المؤقت. عميل المتصفح يحتاج تفويضاً مؤقتاً لا مفتاح خادم دائم، وخادم الصوت أو SIP يحتاج ربط معرّف المكالمة بأحداث النموذج والأدوات والاستخدام.

عبء عمل للمقاطعة والتعافي

تذكر OpenAI تحسناً في الحروف والأرقام والصمت والضجيج والمقاطعة والتعليمات والأدوات. حوّل ذلك إلى مكالمات ثابتة: اسم يحتاج تهجئة، ورقم يجمع حروفاً وأرقاماً، وضوضاء خلفية، وصمت طويل، ومقاطعة في منتصف الإجابة، وأداة بطيئة، وأداة تفشل، ومستخدم يصحح معلومة سابقة.

سجل قبول المحادثة
حالة الفشلشرط النجاحالدليل
مقاطعة أثناء الإجابةيتوقف الصوت ويُستخدم القصد الجديدالصوت وأحداث المقاطعة
أداة بطيئة أو فاشلةلا نتيجة مخترعة وتعافٍ صريحمدخلات الأداة ونتيجتها والرد
رقم وسط ضجيجتأكيد القيمة قبل الإجراءالقيمة ودور التأكيد
تصحيح معلومةتحل المعلومة الجديدة محل القديمةتغير الحالة والأداة التالية
إعادة اتصال أو تحويللا كلام مكرر ولا إجراء غير مصرححد الجلسة والحالة المستعادة

في كل مسار سجّل إتمام هدف المستخدم، والتوقف عند المقاطعة، والكلمات المكررة، ومدخلات الأداة، وطريقة التعامل مع نتيجة قديمة، وسبب نهاية المكالمة. استمع للصوت واقرأ سجل الأحداث معاً؛ النص وحده يخفي التوقيت، والصوت وحده يخفي حالة الأداة.

مستوى الاستدلال قرار زمن ومخاطر

يوصي دليل Realtime بالبدء بمستوى استدلال منخفض ثم زيادته حسب المهمة. لا تجعل الإعداد واحداً لكل المكالمة. التحية والاستعلام البسيط لا يحتاجان إعداد الاستثناء المعقد. اختبر المجموعة نفسها عند التغيير حتى لا تشتري سرعة على حساب شرط أو أداة.

يدعم النموذج function calling، ولا يدعم structured outputs. ضيق مخططات الأدوات، وافحص الوسائط في التطبيق، واطلب تأكيداً صريحاً قبل دفع أو حذف أو حجز أو تعديل حساب. لا تمنح النموذج كل الأدوات في كل دور.

احسب المكالمة المكتملة حسب الوسيط

الأسعار الرسمية لكل مليون توكن: النص $4 للإدخال و$0.40 للإدخال المخزن و$24 للإخراج؛ الصوت $32 و$0.40 و$64؛ الصورة $5 للإدخال و$0.50 للمخزن. لا تجمعها في سعر توكن واحد. احسب المكالمات الناجحة والفاشلة وإعادات المحاولة والتحويل للبشر.

السياق 128 ألف توكن والإخراج 32 ألفاً، لكن هذا لا يعني حفظ المكالمة كلها. لخّص الأدوار القديمة، وأبطل نتائج الأدوات التي انتهت صلاحيتها، واحذف الوسائط الحساسة وفق السياسة.

متى تستخدم سلسلة أو mini؟

استخدم سلسلة إذا وجب فحص النص قبل النطق أو كان هناك عقد منظم واعتماد بين المراحل. ابدأ بـmini في المكالمات الكثيفة والمحدودة، وارفع فقط أنواع الفشل التي يحلها الكامل. لا تسمح بإجراء غير قابل للعكس بلا تحقق في التطبيق وتأكيد وسجل أداة.

الأسعار والقدرات الرسمية في 29 يوليو 2026
الفئةالإدخال / المخزنالإخراج أو القدرة
النص لكل مليون$4 / $0.40$24 إخراج
الصوت لكل مليون$32 / $0.40$64 إخراج
الصورة لكل مليون$5 / $0.50إدخال فقط
الواجهةنص وصوت وصورةنص وصوت وأدوات؛ لا structured outputs
السعة128K سياق32K إخراج أقصى

أسئلة شائعة

هل أستخدم WebRTC أم WebSocket؟

توصي OpenAI بـWebRTC للمتصفح والجوال، وWebSocket لوسائط الخادم، وSIP للاتصالات الهاتفية.

متى تكون السلسلة الصوتية أفضل؟

حين تحتاج نصاً وسيطاً واضحاً أو موافقة قبل النطق أو مراقبة مستقلة لكل مرحلة. الصوت المباشر أفضل للمحادثة الطبيعية منخفضة الكمون.

هل يدعم الأدوات والمخرجات المنظمة؟

يدعم function calling ولا يدعم structured outputs. افحص مدخلات الأدوات في التطبيق، واستخدم سلسلة عند الحاجة إلى عقد منظم صارم.

كيف أختبره؟

أعد مكالمات ثابتة فيها مقاطعة وضجيج ورقم وأداة بطيئة أو فاشلة وتصحيح وإعادة اتصال، ثم قِس الإتمام والتعافي ودقة الأداة وتكلفة النجاح.

ما السعة وكيف أحسب التكلفة؟

السياق 128K والإخراج 32K. افصل النص والصوت والإدخال المخزن والصورة كما في الجدول الرسمي أعلاه.

سجل التغييرات

  • 29 يوليو 2026 — أعدنا التحقق من الأسعار والوسائط والاتصالات ودليل الوكلاء، وأضفنا مصفوفتين للبنية وسجل المحادثة واختبار فشل وضوابط أدوات واستدلال.
  • 28 يوليو 2026 — نُشرت الصفحة بعد مراجعة المصادر الرسمية وتسجيل الفجوات غير المنشورة.

المراجع

  1. سجل الإصدار الرسمي للـAPI: سجل تغييرات OpenAI API
  2. صفحة النموذج والأسعار والوسائط: GPT-Realtime-2.1
  3. دليل الاتصال والجلسات: Realtime API
  4. دليل بنية الوكلاء الصوتيين: Voice agents