يتقارب النموذجان كخيارين عامّين، لكنهما يختلفان في السعر وسعة السياق ونتيجة البرمجة المنشورة. لهذا لا تكفي مقارنة اسمَي النموذجين أو سعر الإدخال وحده؛ القرار يتغيّر بحسب طول الطلب، وحجم الإخراج، ونسبة التخزين المؤقت، ونوع الأخطاء التي يقبلها فريقك.
المواصفات جنباً إلى جنب
| البُعد | Claude Sonnet 4.6 | GPT-5 |
|---|---|---|
| الإدخال / 1M | $3.00 | $1.25 |
| الإخراج / 1M | $15.00 | $10.00 |
| الإدخال المخزَّن / 1M | $0.30 | $0.125 |
| سعة السياق | 1,000,000 | 400,000 |
| أقصى إخراج | 64,000 | 128,000 |
| SWE-bench Verified | 79.6% | 74.9% |
| الإنتاجية (تقدير benchr) | 95 tok/s | 90 tok/s |
يبقى GPT-5 أقل كلفة مع التخزين المؤقت
يمنح النموذجان خصمًا بنسبة 90% على الإدخال المؤهل للتخزين المؤقت: $0.30 لكل مليون توكن لدى Sonnet و$0.125 لدى GPT-5. إذا كانت لديك تعليمات نظام ثابتة بحجم 40 ألف توكن، فتكلّف قراءتها بعد التخزين نحو $0.012 لكل استدعاء على Sonnet و$0.005 على GPT-5. أما الطلبات القصيرة التي لا تعيد استخدام بادئة ثابتة فتُحاسَب بالسعر القياسي. أدخل نسب الاستخدام الفعلية في حاسبة التكلفة.
مثال شهري واضح
لنفترض أداة لمراجعة الشيفرة تستهلك 15 ألف توكن إدخال وتنتج 3 آلاف توكن إخراج في كل تشغيل، بمعدل 20 ألف تشغيل شهريًا. من دون تخزين مؤقت، تبلغ الكلفة نحو $975 على GPT-5 و$1,800 على Sonnet 4.6. وإذا كانت 10 آلاف من توكنات الإدخال بادئة ثابتة مؤهلة للتخزين، ينخفض الإجمالي إلى نحو $750 و$1,260 على الترتيب. يبقى السؤال: هل يقلّل Sonnet وقت المراجعة أو الأخطاء بما يغطي فرق $510؟ لا يجيب البنشمارك عن ذلك؛ اختبار فريقك هو الذي يجيب.
متى يميل القرار إلى كل نموذج؟
يميل القرار إلى Sonnet 4.6 عندما تحتاج المهمة سياقًا يتجاوز 400 ألف توكن، أو عندما يثبت اختبار مستودعاتك أنه يقلّل الأخطاء بما يبرر السعر. ويميل إلى GPT-5 عندما تكون الكلفة أهم، أو حين تعتمد المنظومة بالفعل على أدوات OpenAI، أو حين تحتاج سقف إخراج يبلغ 128 ألف توكن مقابل 64 ألفًا لدى Sonnet. هذه مزايا قابلة للقياس، وليست حكمًا عامًا على النموذجين.