عرضت OpenAI GPT-5.6 في 26 يونيو لمجموعة صغيرة من الشركاء الذين اجتازوا مراجعة حكومية. وفي 9 يوليو، نقل سجل تغييرات الواجهة العائلة إلى الإتاحة العامة. التغييرات المهمة في الوثائق الحية واضحة: يظهر GPT-5.6 الآن في صفحتي النماذج والأسعار العامتين لدى OpenAI، ويوجّه الاسم المختصر gpt-5.6 إلى Sol، وتدرج الطبقات الثلاث سياق 1.05 مليون رمز وأقصى إخراج 128 ألفًا.
ثلاثة نماذج، ولأي شيء كل منها
GPT-5.6 سلسلة، لا نموذج واحد. قسّمته OpenAI ثلاث طبقات حسب التكلفة والقدرة:
- Sol — النموذج الرائد. هذا هو النموذج الذي تطلق OpenAI بشأنه ادعاءات الريادة المتقدمة، وحوله بُنيت المراجعة الحكومية.
- Terra — الطبقة المتوازنة. تصفه OpenAI بأنه يقارب قدرة فئة GPT-5.5 بنحو نصف التكلفة، وهذه هي قصة الكفاءة الأبرز في الإصدار.
- Luna — الأرخص والأسرع. الخيار عالي الحجم للعمل الذي لا يحتاج النموذج الرائد.
التسمية قطيعة متعمّدة مع لاحقتَي OpenAI «Mini / Nano». تُقرأ Sol وTerra وLuna كعائلة بطبقات لا كنسخ مصغّرة — صدى بنيوي لطريقة Anthropic في ترتيب Opus وSonnet وHaiku.
وضعا استدلال جديدان: «max» و«ultra»
إلى جانب النماذج الثلاثة، يقدّم GPT-5.6 وضعَي استدلال يغيّران كيف يعمل النموذج لا أيّ نموذج تختار. max يرفع جهد الاستدلال — تأمّل أعمق وأطول على مسار عمل واحد. أما ultra فيتوسّع بدل أن يتعمّق: يشغّل وكلاء فرعيين لتوزيع المهمة المعقدة على عدة عمّال بالتوازي، وهي الفكرة المعمارية نفسها وراء دفعة OpenAI الوكيلية الأخيرة في Codex.
ما لم تقله OpenAI هو ماذا يفعل أيّ من الوضعين بفاتورتك أو بزمن استجابتك. الاستدلال الأعمق والوكلاء الفرعيون المتوازون كلاهما يميل إلى حرق رموز إخراج أكثر، أحياناً أكثر بكثير، لكن لم يُنشر أي تسعير لكل وضع أو معامل ضرب للرموز. عامِل تكلفة «max» و«ultra» على أنها مجهولة حتى توثّقها OpenAI.
الأسعار — رسمية على صفحة واجهة OpenAI، وأرخص من الإطلاق
تدرج صفحة أسعار OpenAI GPT-5.6 مباشرة، وخفّضت طبقتين من الثلاث في 30 يوليو 2026. الأسعار القياسية للسياق القصير لكل مليون رمز صارت Sol 5$/30$ (بلا تغيير)، وTerra 2$/12$ (كانت 2.50$/15$)، وLuna 0.20$/1.20$ (كانت 1$/6$).
| النموذج | الإدخال | الإخراج | الإدخال المخزّن |
|---|---|---|---|
| Sol (الرائد) | $5.00 | $30.00 | $0.50 |
| Terra (المتوازن) | $2.00 | $12.00 | $0.20 |
| Luna (الأرخص) | $0.20 | $1.20 | $0.02 |
الإدخال المخبأ هو 0.50$ و0.20$ و0.02$ لكل من Sol وTerra وLuna. لم تُعِد OpenAI نشر أسعار الدُفعات أو flex أو الأولوية منذ خفض 30 يوليو.
تتضح مواقع الفئات عند مقارنتها بالنماذج السابقة. ما زال سعر Sol البالغ $5/$30 مطابقًا لسعر GPT-5.5 دون تغيير. أما Terra فصار سعره البالغ $2/$12 أرخص من سعر GPT-5.4 القديم (2.50$/15$)، وهو ما يعزّز وصفه بأنه يقدم فئة GPT-5.5 دون سعر GPT-5.4، لا عنده فقط. وLuna بسعره الجديد $0.20/$1.20 صار يتفوّق على GPT-5 Mini البالغ $0.25/$2 في الجانبين، بعدما كان يقع بين GPT-5 ($1.25/$10) وMini.
للمقارنة خارج OpenAI، يبلغ سعر Claude Opus 4.8 نحو $5/$25، وGemini 3.1 Pro نحو $2/$12، وDeepSeek V4-Pro نحو $0.435/$0.87 — يتفوّق إدخال Luna الجديد عليه، لكنّ DeepSeek ما زال أرخص على الإخراج. تعرض صفحة أسعار GPT-5.6 التفاصيل الكاملة، بما فيها سعر السياق الطويل وسيناريوهات التكلفة المحدّثة.
من يستطيع استخدامها: عملاء API
كانت معاينة يونيو محدودة بنحو 20 شريكًا موثوقًا. تغيّر ذلك مع إصدار الواجهة في 9 يوليو: أصبح GPT-5.6 مدرجًا في وثائق واجهة OpenAI العامة. يظل على العملاء التحقق من إعدادات الحساب والمنطقة والمؤسسة، لكن عائلة النماذج لم تعد موصوفة بأنها معاينة للشركاء فقط.
تبقى المعاينة المحجوزة بمراجعة حكومية جزءًا من تاريخ الإصدار، وهي تفسر سبب تعامل benchr بحذر مع الإتاحة في البداية. أما مصدر الحقيقة الحي الآن فهو سجل تغييرات واجهة OpenAI وصفحتا النماذج والأسعار.
المعيار التي نشرتها OpenAI
عند المعاينة كانت الأرقام صندوقاً مغلقاً — لكن بطاقة نظام معاينة GPT-5.6 من OpenAI تنشر بطاقات الدرجات، وهي تؤيّد الادعاء الرئيسي. على Terminal-Bench 2.1، معيار سطر الأوامر الوكيلي، يضع Sol معياراً رائداً جديداً — وفي وضع ultra يبتعد عن بقية الميدان. إليك الترتيب الكامل، مُعاد إنتاجه من رسوم OpenAI نفسها.
TerminalBench 2.1
سطر أوامر وكيلي · الأعلى أفضلالمصدر: بطاقة نظام معاينة GPT-5.6 من OpenAI. البنفسجي = عائلة GPT-5.6؛ ووضع ultra في Sol يشغّل وكلاء فرعيين بالتوازي.
المعياران الآخران حدود كفاءة — يرسمان النتيجة مقابل رموز الإخراج المُنفقة، فالمنحنى الأعلى والأقصى يساراً ينجز أكثر بأقل. على كليهما يتصدّر Sol، وتتوزّع طبقات GPT-5.6 الثلاث بحسب قدر الاستدلال الذي يُنفقه كلٌّ منها.
GeneBench v1
أحياء · النتيجة مقابل رموز الإخراجالقمم: Sol ~30.7% · Terra ~28.3% · GPT-5.5 ~23% · Luna ~14.5%. المنحنيات مُعاد إنتاجها من بطاقة نظام المعاينة؛ والعبرة في الشكل — يبلغ Sol أعلى النتائج بأقل رموز إخراج.
ExploitGym
سيبراني · الاستغلالات مقابل رموز الإخراج (حد 6 ساعات)القمم (حد 6 ساعات): Sol ~33.7% · Terra ~23.3% · GPT-5.5 ~15.2% · Luna ~12.4% · GPT-5.4 ~7%. المتقطّع = حدّ ميزانية 6 ساعات؛ مُعاد إنتاجه من بطاقة نظام المعاينة.
إذن يصمد ادعاء الريادة: يتصدّر Sol معيار Terminal-Bench 2.1 صراحةً، ووضع ultra يمدّ الفارق إلى 91.9%. لكن اقرأ الميدان بتمعّن — تحطّ Terra عند 84.3%، مساويةً تماماً لـ Claude Fable 5 ومتقدّمةً بالكاد على 83.4% لـ GPT-5.5، بينما تقع 82.5% لـ Luna أسفل GPT-5.5 مباشرةً. السلسلة تفوز في القمة؛ أما في الوسط فهي نقاط قليلة مزدحمة. هذه الأرقام على Terminal-Bench 2.1 لم تتغيّر عن معاينة 26 يونيو.
SWE-bench Verified وGPQA Diamond، أُضيفا إلى بطاقة النظام
بطاقة نظام المعاينة من OpenAI تحمل أيضًا بطاقتَي درجات لم تكونا موجودتين حين غطّى benchr هذه المعاينة أول مرة: SWE-bench Verified وGPQA Diamond، لكل الطبقات الثلاث.
| النموذج | SWE-bench Verified | GPQA Diamond |
|---|---|---|
| GPT-5.6 Sol | 89.8% | 91.2% |
| GPT-5.6 Terra | 85.2% | 88.0% |
| GPT-5.6 Luna | 79.8% | 82.0% |
تفوّق Sol في Terminal-Bench 2.1 لا ينتقل إلى أيٍّ من المعيارين الجديدين: درجته 89.8% على SWE-bench Verified تتأخر عن 91.0% لـ Claude Fable 5، ودرجته 91.2% على GPQA Diamond تتأخر عن 93.6% لـ Claude Opus 4.8. بطاقة النظام نفسها تُدرج مجموعة تقييمات Sol الأوسع: LMSYS Arena بـ1440، وMMLU بـ93.8%، وHumanEval بـ95.5%، وMATH بـ96.0%، وARC-AGI-2 بـ23.5.
تؤكد صفحة النماذج الحية لدى OpenAI الآن نافذة السياق — 1,050,000 رمز لكل من Sol وTerra وLuna — وأقصى طول إخراج البالغ 128,000 رمز للطبقات الثلاث — ومعرّفات API الدقيقة: gpt-5.6-sol وgpt-5.6-terra وgpt-5.6-luna. ويبقى GPT-5.6 Sol مدخل benchr القياسي في models.json لهذه السلسلة، فيما يُتتبّع Terra وLuna في model-figures.json.
ماذا يعني هذا لك
تغيّرت الإجابة العملية: يمكن الآن استدعاء GPT-5.6 عبر الواجهة حيث يتيح حسابك الوصول. يتصدر Sol معيار Terminal-Bench 2.1 (88.8%، و91.9% في وضع ultra)، لكنه يتأخر عن Claude Fable 5 على SWE-bench Verified وعن Claude Opus 4.8 على GPQA Diamond؛ لذلك ما زال اختيار النموذج يستحق التحقق على حملك الفعلي.
إن كنت تعمل أصلًا على OpenAI، فـTerra هو الطبقة الجديرة بالاختبار أولًا: صار سعره أرخص من سعر GPT-5.4 القديم مع بقاء 85.2% على SWE-bench Verified و88.0% على GPQA Diamond. أما Luna، بعد خفض سعره إلى 0.20$/1.20$، فيستحق نظرة ثانية حتى لو تجاوزته عند الإطلاق. للتفصيل الكامل راجع صفحة أسعار GPT-5.6.