تفصل نقطة واحدة بين نتيجتَي SWE-bench المنشورتين، بينما تختلف أسعار الواجهة بأكثر من سبعة أضعاف على الإدخال. لا يحدد أي من الرقمين فائزًا عامًا. اختبر عينة لم تُستخدم في إعداد التعليمات، وثبّت الأدوات وعدد المحاولات وحد زمن الاستجابة في النموذجين.
المواصفات في جدول واحد
| البُعد | DeepSeek V4-Pro | Claude Sonnet 4.6 |
|---|---|---|
| المدخلات / 1M | $0.435 | $3.00 |
| المخرجات / 1M | $0.87 | $15.00 |
| مدخلات cache-hit / 1M | $0.0036 | $0.30 |
| سعة السياق | 1,000,000 | 1,000,000 |
| أقصى مخرجات | 384,000 | 64,000 |
| SWE-bench Verified | 80.6% | 79.6% |
| GPQA Diamond | 90.1% | 89.9% |
| الترخيص | MIT (قابل للتشغيل الذاتي) | API احتكاري فقط |
الفاتورة، على خط معالجة حقيقي
وفق لقطة الأسعار المستخدمة هنا، يكلّف خط معالجة مستندات يستهلك 50M توكن إدخال وينتج 8M توكن إخراج شهريًا نحو $150 للإدخال و$120 للإخراج على Sonnet — $270/شهر — مقابل $21.75 + $6.96 = $28.71 على V4-Pro. وعند عشرة أضعاف الحجم تصبح الحسابات نحو $2,700 مقابل $287 قبل الخصومات والاستدعاءات الفاشلة وإعادة المحاولة والبنية والضرائب. يدرج DeepSeek سعر إدخال أقل لضربات الذاكرة المؤهلة؛ ويتوقف الوفر الفعلي على الأهلية ونسبة الإصابة.
ما لا تحسمه ورقة الأسعار
لا يقيس SWE-bench ولا سعر القائمة موثوقية الأدوات في المهام الطويلة، أو التعافي من الاستدعاءات غير الصالحة، أو زمن الاستجابة تحت الضغط، أو ملاءمة الخدمة لضوابط مؤسستك. شغّل النموذجين على سجلات تشغيل متكافئة، وقِس إتمام المهمة وإعادة المحاولة والكلفة لكل نتيجة مقبولة. وراجع شروط معالجة البيانات والاحتفاظ ومناطق النشر ووثائق الأمان ودعم الوسائط لكل مزوّد. لا تستنتج السلامة أو الامتثال من بلد النموذج أو رخصته وحدهما.
متى تكون الاستضافة الذاتية خيارًا؟
ينشر DeepSeek أوزان V4-Pro برخصة MIT، لذلك يمكن للمؤسسة تقييم التشغيل الذاتي بدل إرسال الموجّهات إلى API المستضاف. يستبدل ذلك رسوم التوكن بالعتاد والأمان والمراقبة وأعمال التشغيل — وتستعرض مقالة الاستدلال المحلي فئات التكلفة. قد يدعم التشغيل الذاتي بعض أهداف إقامة البيانات، لكنه لا يثبت الامتثال التنظيمي بمفرده.