النموذج جزء واحد من نظام حي: اكتشاف الدور والمقاطعة ونقل الصوت واستدعاء الأداة وحالة الجلسة وسياسة الاستعادة. قد يكون النموذج ممتازاً بينما تفشل المكالمة بسبب اتصال يعيد الصوت القديم أو أداة تنفذ على رقم غير مؤكد.
اختر بنية الصوت قبل اختيار الحجم
يفرق دليل OpenAI بين صوت إلى صوت مباشرة، وبين سلسلة: تحويل الكلام إلى نص، ثم نموذج نصي، ثم تحويل النص إلى كلام. المسار المباشر أفضل للحوار الطبيعي وزمن الاستجابة المحسوس. السلسلة أفضل حين تحتاج نصاً واضحاً للمراجعة، أو موافقة قبل النطق، أو مراقبة مستقلة لكل مرحلة.
| المطلب | المسار الأنسب | السبب |
|---|---|---|
| متصفح أو تطبيق جوال | صوت مباشر عبر WebRTC | إدارة وسائط العميل ودور حديث طبيعي |
| وسائط يملكها الخادم | صوت مباشر عبر WebSocket | الخادم يراقب الأحداث والتدفق |
| هاتف | SIP | ربط اتصالات مباشر |
| نص وسيط قابل للتدقيق | سلسلة صوتية | يمكن إيقاف كل مرحلة ومراجعتها |
| عقد JSON صارم | سلسلة مع نموذج نصي مناسب | Realtime لا يدعم structured outputs |
اختيار الاتصال يحدد مكان المفتاح، والتليمترية، وسلوك إعادة الاتصال، ومن يملك التخزين المؤقت. عميل المتصفح يحتاج تفويضاً مؤقتاً لا مفتاح خادم دائم، وخادم الصوت أو SIP يحتاج ربط معرّف المكالمة بأحداث النموذج والأدوات والاستخدام.
عبء عمل للمقاطعة والتعافي
تذكر OpenAI تحسناً في الحروف والأرقام والصمت والضجيج والمقاطعة والتعليمات والأدوات. حوّل ذلك إلى مكالمات ثابتة: اسم يحتاج تهجئة، ورقم يجمع حروفاً وأرقاماً، وضوضاء خلفية، وصمت طويل، ومقاطعة في منتصف الإجابة، وأداة بطيئة، وأداة تفشل، ومستخدم يصحح معلومة سابقة.
| حالة الفشل | شرط النجاح | الدليل |
|---|---|---|
| مقاطعة أثناء الإجابة | يتوقف الصوت ويُستخدم القصد الجديد | الصوت وأحداث المقاطعة |
| أداة بطيئة أو فاشلة | لا نتيجة مخترعة وتعافٍ صريح | مدخلات الأداة ونتيجتها والرد |
| رقم وسط ضجيج | تأكيد القيمة قبل الإجراء | القيمة ودور التأكيد |
| تصحيح معلومة | تحل المعلومة الجديدة محل القديمة | تغير الحالة والأداة التالية |
| إعادة اتصال أو تحويل | لا كلام مكرر ولا إجراء غير مصرح | حد الجلسة والحالة المستعادة |
في كل مسار سجّل إتمام هدف المستخدم، والتوقف عند المقاطعة، والكلمات المكررة، ومدخلات الأداة، وطريقة التعامل مع نتيجة قديمة، وسبب نهاية المكالمة. استمع للصوت واقرأ سجل الأحداث معاً؛ النص وحده يخفي التوقيت، والصوت وحده يخفي حالة الأداة.
مستوى الاستدلال قرار زمن ومخاطر
يوصي دليل Realtime بالبدء بمستوى استدلال منخفض ثم زيادته حسب المهمة. لا تجعل الإعداد واحداً لكل المكالمة. التحية والاستعلام البسيط لا يحتاجان إعداد الاستثناء المعقد. اختبر المجموعة نفسها عند التغيير حتى لا تشتري سرعة على حساب شرط أو أداة.
يدعم النموذج function calling، ولا يدعم structured outputs. ضيق مخططات الأدوات، وافحص الوسائط في التطبيق، واطلب تأكيداً صريحاً قبل دفع أو حذف أو حجز أو تعديل حساب. لا تمنح النموذج كل الأدوات في كل دور.
احسب المكالمة المكتملة حسب الوسيط
الأسعار الرسمية لكل مليون توكن: النص $4 للإدخال و$0.40 للإدخال المخزن و$24 للإخراج؛ الصوت $32 و$0.40 و$64؛ الصورة $5 للإدخال و$0.50 للمخزن. لا تجمعها في سعر توكن واحد. احسب المكالمات الناجحة والفاشلة وإعادات المحاولة والتحويل للبشر.
السياق 128 ألف توكن والإخراج 32 ألفاً، لكن هذا لا يعني حفظ المكالمة كلها. لخّص الأدوار القديمة، وأبطل نتائج الأدوات التي انتهت صلاحيتها، واحذف الوسائط الحساسة وفق السياسة.
متى تستخدم سلسلة أو mini؟
استخدم سلسلة إذا وجب فحص النص قبل النطق أو كان هناك عقد منظم واعتماد بين المراحل. ابدأ بـmini في المكالمات الكثيفة والمحدودة، وارفع فقط أنواع الفشل التي يحلها الكامل. لا تسمح بإجراء غير قابل للعكس بلا تحقق في التطبيق وتأكيد وسجل أداة.
| الفئة | الإدخال / المخزن | الإخراج أو القدرة |
|---|---|---|
| النص لكل مليون | $4 / $0.40 | $24 إخراج |
| الصوت لكل مليون | $32 / $0.40 | $64 إخراج |
| الصورة لكل مليون | $5 / $0.50 | إدخال فقط |
| الواجهة | نص وصوت وصورة | نص وصوت وأدوات؛ لا structured outputs |
| السعة | 128K سياق | 32K إخراج أقصى |