ترتيب نماذج الذكاء الاصطناعي
٣٨ نموذجًا من الفئات المتقدمة والمتوسطة ومفتوحة الأوزان. يبدأ الجدول بعدسة القدرة، ويمكنك اختيار القيمة لإدخال أسعار API المنشورة في الحساب. ملفات القدرة أحكام تحريرية وليست قياسات مستقلة، وتبقى السرعة فارغة ما لم يتوفر رقم قابل لإعادة الاختبار أو منسوب بوضوح إلى مصدره.
| # | النموذج | تقييم benchr | SWE-bench % | إدخال $/مليون | إخراج $/مليون | السياق | توكن/ث | الإصدار |
|---|---|---|---|---|---|---|---|---|
| جارٍ تحميل النماذج… | ||||||||
كيف يعمل تقييم benchr
يتغير معنى الدرجة حسب خيار الترتيب. وضع القدرة يقارن ما يستطيع النموذج فعله من دون احتساب السعر. وضع القيمة يضيف كفاءة أسعار API المنشورة. طريقة الحساب منشورة، لكن جزءًا من الدرجة تحريري؛ تعامل معها كأداة فرز لا كقياس مختبري.
القدرة — الافتراضي
درجة قدرة تستخدم التوليفة نفسها في بقية الموقع. قيم البرمجة والاستدلال والكتابة داخلها أحكام تحريرية من benchr مستندة إلى أدلة عامة، وليست نتائج اختبار أجريناه أو أعدنا إنتاجه. يمكنك فحص القيم في models.json ومراجعة حقائق المزوّد المنفصلة في model-figures.json.
القيمة — عدسة اختيارية
تجمع هذه العدسة القدرة مع كفاءة سعر API. السعر هو متوسط الإدخال والإخراج لكل مليون توكن. النموذج المستضاف ذاتيًا الذي لا يملك سعر API لكل توكن يحصل على أعلى درجة سعر؛ ولا تشمل المقارنة تكلفة العتاد أو التشغيل أو الاستضافة، لذلك لا تمثل التكلفة الكلية.
المعادلتان تعملان في models.ar.js فتقرأهما وتتحقق منهما بنفسك. كلٌّ تنتج قيمة 0–100 معروضة على مقياس 0–10، والسعر معروض في عمودَي الإدخال/الإخراج في الوضعين. للأرقام الرسمية المحقّقة راجع model-figures.json.
أسئلة متكررة
ما تقييم benchr؟
يبدأ الجدول بدرجة القدرة التي تجمع البرمجة والاستدلال والكتابة. ويحوّل خيار «القيمة» الترتيب إلى عدسة تدخل فيها كفاءة السعر. يمكنك مراجعة المعادلة في models.ar.js، كما تظهر الأسعار في أعمدة مستقلة.
أي نموذج هو الأفضل في 2026؟
يعتمد على المهمة والميزانية. ترتيب «القدرة» تحريري، بينما يضيف ترتيب «القيمة» الأسعار المدرجة. استخدم الجدول لاختيار مجموعة صغيرة، ثم اختبرها على عمل يشبه استخدامك. لا تثبت أي درجة هنا وجود فائز عام.
هل التصنيفات مدفوعة؟
لا. تُحسب بالكامل من البيانات في models.json، ولم يدفع أي مزوّد مقابل موضعه. راجع المعايير التحريرية.
ما الفرق بين نتيجة البنشمارك وتقدير القدرة؟
نتيجة البنشمارك المنشورة تحمل اسم الاختبار ونسخته ومصدرها. أما ملف القدرة من 0 إلى 100 فهو حكم تحريري من benchr يستند إلى أدلة عامة، وليس نتيجة اختبار أجرته benchr أو أعادت إنتاجه. تبقى القيمة الرسمية المفقودة فارغة، ويمكن مراجعة الأدلة في model-figures.json.