المواصفات في جدول واحد
| البُعد | GPT-5 | Claude Opus 4.8 |
|---|---|---|
| المزوّد | OpenAI | Anthropic |
| تاريخ الإصدار | 7 أغسطس 2025 | 28 مايو 2026 |
| الإدخال / 1M | $1.25 | $5.00 |
| الإخراج / 1M | $10.00 | $25.00 |
| الإدخال المخزَّن / 1M | $0.125 (خصم 90%) | $0.50 (خصم 90%) |
| سعة السياق | 400,000 توكن | 1,000,000 توكن |
| أقصى إخراج | 128,000 توكن | 128,000 توكن |
| SWE-bench Verified | 74.9% | 88.6% |
| GPQA Diamond | غير منشور | 93.6% |
| الوضع السريع | لا | نعم — $10/$50، سرعة ~2.5× |
فجوة السعر بأرقام حقيقية
عند 10 ملايين توكن إدخال شهريًا، تبلغ كلفة الإدخال $12.50 على GPT-5 و$50 على Opus 4.8. وعند 500 مليون توكن تصبح $625 و$2,500 على الترتيب. هذه حسبة إدخال فقط؛ أضف الإخراج وإعادة المحاولة وأي رسوم أخرى قبل اعتماد الميزانية.
يمنح النموذجان خصمًا بنسبة 90% على الإدخال المؤهل للتخزين المؤقت: $0.125 لكل مليون توكن لدى GPT-5 و$0.50 لدى Opus. لذلك تكلّف قراءة بادئة مخزّنة بحجم 40 ألف توكن نحو $0.005 لكل استدعاء على GPT-5 و$0.02 على Opus. احسب معدل الإصابة الفعلي وحجم الإخراج بدل افتراض أن كل الإدخال مؤهل للخصم.
ماذا تعني فعلاً فجوة البرمجة البالغة 14 نقطة
يستخدم SWE-bench Verified مشكلات حقيقية من مستودعات Python، لكن النتيجة تعتمد على إعداد الاختبار والأدوات وسياسة المحاولة. الرقم 88.6% لا يعني أن Opus سيصلح 88 من كل 100 مشكلة في مستودعك، كما أن 74.9% لا يحدد معدل نجاح GPT-5 لديك.
تستحق الفجوة الاهتمام عندما تكون البرمجة محور المنتج، لكنها تظل نقطة بداية للاختبار. اختر عينة من الأخطاء التي أصلحها فريقك سابقًا، وثبّت الأدوات وحدود الوقت وعدد المحاولات، ثم قارن الإصلاحات المقبولة ووقت المراجعة. بهذه الطريقة تتحول الدرجة العامة إلى قرار يخص بيئتك.
أما الكتابة والتلخيص وشرح الشيفرة، فلا تقيسها SWE-bench مباشرةً. لا تفترض أن فارق البرمجة سيظهر بالحجم نفسه في تلك المهام؛ ضع لها معايير منفصلة.
سعة السياق: حين لا يكفي 400K
قد تكفي سعة GPT-5 البالغة 400 ألف توكن لكثير من الطلبات، لكنها تصبح قيدًا إذا تجاوزت مواد المهمة هذا الحد. يتيح Opus 4.8 سعة معلنة تبلغ مليون توكن، إلا أن قبول النص لا يضمن استرجاع كل جزء منه بدقة. اختبر مواضع الدليل المختلفة، وزمن الاستجابة، والكلفة قبل الاعتماد على الطلبات الطويلة.