قدمت OpenAI GPT-Live-1 في 8 يوليو 2026 لصوت ChatGPT وقالت إن API مخططة.
الإتاحة داخل ChatGPT فقط حتى الآن
تقول OpenAI إن GPT-Live-1 أصبح النموذج الافتراضي للصوت لدى مستخدمي Go وPlus وPro المؤهلين مع استمرار الإطلاق. هذا يخص تجربة ChatGPT، ولا يعني وجود API يستطيع المطور تشغيلها في منتجه.
نموذج يسمع ويتحدث في المحادثة نفسها
بحسب OpenAI، تستمع نماذج Live وتتحدث مباشرة، وتحوّل الأعمال الأعمق إلى نماذج أخرى عند الحاجة. لكن الإعلان لا يذكر سعراً أو سعة سياق أو حداً للإخراج، لذلك لا تستنتج هذه الأرقام من نموذج GPT آخر.
جرّب التجربة وانتظر وثائق الدمج
يستطيع فريق المنتج تقييم جودة الصوت والمقاطعة وسلاسة الحوار داخل ChatGPT. أما فريق التطوير، فيحتاج إلى معرّف API وفوترة وحدود واضحة قبل تقدير التكلفة أو بدء مشروع تكامل.
| الحقل | المعلومة الموثقة |
|---|---|
| مكان الاستخدام | ChatGPT Voice |
| نوع التفاعل | محادثة صوتية مباشرة |
| معرّف API | غير منشور في الإعلان |
| السعر والحدود | غير منشورة في الإعلان |
قيّم المحادثة لا جمال الصوت وحده
تصف OpenAI تفاعلاً مستمراً يستطيع الاستماع أثناء الكلام واتخاذ قرار بالتوقف أو المقاطعة أو استدعاء أداة. لذلك يحتاج الاختبار إلى محادثات مؤقتة لا إلى عينات صوت معزولة. سجّل المقاطعات الخاطئة والتعافي بعد تداخل الكلام والتعامل مع الصمت والضوضاء، وهل يبقى السياق واضحاً بعد عودة نتيجة مهمة مفوضة.
| السيناريو | الدليل المطلوب | ما لا يجوز استنتاجه |
|---|---|---|
| مقاطعة المستخدم | زمن التوقف واستعادة السياق | ضمان كمون API |
| صمت طويل | هل ينتظر النظام أم يقاطع؟ | إعداد كشف الدور |
| بحث أو استدلال | وضوح التفويض والنتيجة العائدة | قدرة نموذج واحد |
| جلسة غير إنجليزية | اللكنة والطلاقة وسوء الفهم | تكافؤ كل اللغات |
GPT-Live حدّ لنظام كامل
يقول الإعلان إن الأعمال الأعمق قد تُفوّض إلى نموذج متقدم بينما يحافظ GPT-Live على المحادثة. لهذا فإن الجواب المسموع نتيجة نظام، وليس معياراً نظيفاً للنموذج الصوتي وحده. افصل في ملاحظاتك بين التفاعل المستمر والذكاء المفوض والبحث أو الأدوات وواجهة ChatGPT.
قيود الإطلاق جزء من خطة الاختبار
تذكر OpenAI أن بعض اللغات قد تعاني لكنة غير طبيعية أو فجوات في الطلاقة، وأن الصوت مع الفيديو أو مشاركة الشاشة غير مدعوم عند الإطلاق. هذه حدود قائمة الآن. وعلى فريق الدعم متعدد اللغات أو المساعدة البصرية اختبار المنتج الحالي من دون افتراض أن الإضافات المستقبلية أصبحت متاحة.
قائمة جاهزية API
لا تثبت معمارية قبل نشر معرّف النموذج ووسيلة النقل ووحدات الفوترة وحدود المعدل وعقد الأدوات وضوابط البيانات وسلوك الفشل. تقول صفحة الإطلاق إن API مخططة قريباً؛ كلمة «مخططة» إشارة متابعة، وليست عقد واجهة.
نفّذ جلسة مراقبة بمعيار مكتوب
استخدم تعليمات افتتاحية وتسلسلاً ثابتاً لكل مشارك. أدرج تصحيحاً ومقاطعة وصمتاً وضوضاء وطلباً يستدعي عملاً أعمق. يسجل المشرف توقيت بداية كلام المستخدم ونهايته وتنازل النظام عن الدور، وهل اضطر المشارك إلى تكرار معلومة. وبعد الجلسة اسأل عما ظن المستخدم أنه يحدث أثناء التفويض.
افصل سلاسة المحادثة عن جودة الإجابة. قد تكون المحادثة طبيعية وسريعة لكن جوابها ضعيف، وقد تعود إجابة مفوضة قوية بعد صمت مربك. وسجّل ميزات ChatGPT مثل الذاكرة والبطاقات المرئية والبحث والملفات بعيداً عن السلوك المنسوب إلى GPT-Live؛ صفحة الإطلاق تصف منتجاً متكاملاً لا نموذجاً معزولاً.
قبل تقديم الصوت للعملاء حدد الموافقة والاحتفاظ بالنص ومسار التصعيد والتحويل إلى إنسان. اختبر الأسماء وأرقام الحساب والعناوين وغيرها من التفاصيل المكلفة عند سماعها خطأ، من دون بيانات عملاء حقيقية. هذه متطلبات منتج الآن ولا يجب تأجيلها إلى جدول أسعار API.