من أين تأتي بيانات benchr؟

مصادر الأسعار والبنشماركات، وطريقة تمييز الحقائق عن التقديرات.

بيانات الأسعار

نأخذ أسعار التوكنات للنماذج المغلقة من صفحات المزوّدين الرسمية: Anthropic وOpenAI وGoogle وMistral وDeepSeek. وعندما نذكر سعر استضافة نموذج مفتوح المصدر، نربطه بالمزوّد الذي نشره. عند تغيّر السعر، نحدّث الصفحة ونسجّل التغيير.

نتائج معايير الأداء

نأخذ أرقام البنشماركات من الجداول التي تنشرها الجهات القائمة عليها. نتائج SWE-bench Verified من swebench.com، وLMSYS Arena من lmarena.ai، وARC-AGI من arcprize.org. وإذا نشر المزوّد نتيجة قبل ظهورها في الجدول المستقل، نذكر بوضوح أنها نتيجة منشورة من المزوّد.

تقييمات القدرات

حين يُسند هذا الموقع تقييمات قدرات (البرمجة والتفكير والكتابة والرؤية والسياق الطويل وتعدد اللغات) على مقياس من 0 إلى 100، فهي تقديرات تحريرية. تجمع بين معايير عامة مستشهَد بها، ووثائق المزوّدين، وتقارير خارجية منشورة. وليست قياسات أجراها benchr، ولا نتائج أعاد الموقع إنتاجها بصورة مستقلة، ولا حقائق صادرة من المزوّد. حتى الرقم الدقيق شكلاً يبقى أداة تخطيط تحريرية لا نتيجة مختبرية.

التقديرات التحريرية مقابل الأرقام المصدَّقة (في الأدوات)

الأدوات التفاعلية — الموصي والحاسبة والرسوم البيانية ومستكشف معايير الأداء — تقرأ جميعها من ملف واحد هو assets/data/models.json، ويحافظ هذا الملف على خط فاصل بين نوعين من الأرقام:

  • مواصفة رسمية: السعر وسعة السياق والحد الأقصى للإخراج وتاريخ الإصدار وحالة التوفر من وثيقة مزوّد مرتبطة. وتعني «رسمية» أن المزوّد نشرها، لا أن benchr تحقّق منها مختبرياً بصورة مستقلة.
  • معيار منشور من المزوّد أو طرف ثالث: تقييم عام مُسمّى مع تحديد الجهة الناشرة. لا تُقدَّم نتيجة المزوّد كأنها مستقلة. وحين لا ينشر المزوّد نتيجة، يُترك الحقل فارغاً أو يُوسم صراحةً «تقدير benchr»؛ ولا يُملأ بصمت.
  • تقدير تحريري: تقييمات القدرات المركبة وجميع قيم الكمون وأول رمز وسرعة الرموز في الأدوات. هي وسائل تخطيط مشتقة من معلومات عامة، وقد تختلف كثيراً باختلاف المنطقة والعتاد وإصدار النموذج وشكل الطلب وحمل المزوّد. ليست قياسات benchr ولا أداءً مضموناً.
  • حساب توضيحي: مثال تكلفة مبني على افتراضات معلنة وبطاقة سعر مستشهَد بها. يشرح طريقة الحساب، ولا يصف فاتورة عميل حقيقية.

لهذا تجمع أدوات الترتيب بين حقائق منشورة وتقديرات تحريرية موسومة. وهي وسيلة لفرز المرشحين، لا لوحة صدارة محايدة. إذا غابت بيانات بُعد معيّن، يُحتسب بصفر عند إدخاله في الوزن ولا يُحذف بصمت. وقبل الاستخدام في الإنتاج، أعد الاختبار بأسئلتك ومنطقتك وعتادك ومعيار الجودة لديك.

ما هذا الموقع وما ليس كذلك

هذا منشور تحريري يُلخّص المعلومات العامة، وليس مختبراً لمعايير الأداء. لا تدّعي المقالات الحالية تشغيل اختبارات خاصة غير منشورة من benchr أو إجماليات تكاليف API خاصة أو نتائج تجربة بصيغة المتكلم. أحكام ملاءمة أعباء العمل تفسيرات تحريرية لمعايير مستشهَد بها وبطاقات أسعار ومواصفات رسمية وتقارير عامة منسوبة إلى أصحابها؛ والحكم نفسه ليس نتيجة مقاسة.

عملياً، تُفضَّل الأحكام النوعية («موثّق بصورة أفضل لتحليل المستندات الطويلة» و«أداء اللهجات يحتاج تحققاً محلياً») على الدقة غير المسندة. ينبغي لكل رقم واقعي أن يوضح منشأه في النص المحيط أو المراجع. ويجب وسم القيم المقدرة كتقديرات تحريرية، وذكر افتراضات حسابات أعباء العمل الافتراضية. وإذا تعذر دعم مقارنة بمصدر عام قابل للاستشهاد، تُقدَّم كسؤال مفتوح لا كتجربة خاصة.

إذا نشر benchr اختباراً أصلياً مستقبلاً، فستذكر الصفحة اسم المختبِر والتاريخ وإصدارات النماذج والبرمجيات والعتاد أو المنطقة والمطالبات أو مجموعة البيانات ومعيار التقييم وعدد التشغيلات والقيود الجوهرية، مع أمثلة خام كافية لتدقيق النتيجة. وحتى تتوفر هذه العناصر، لا يقدّم الموقع أي سيناريو بصفته اختباراً من benchr.

دورية التحديث

نراجع الأسعار عند تحديث المقالات، ونسجّل الإصدارات وحالات الإيقاف بعد إعلانها. كما نعيد فحص بيانات النماذج قبل المراجعات الكبيرة. لا ندّعي وجود دورة أسبوعية أو شهرية ثابتة.

التصحيحات والنزاعات

إن وجدت رقماً أو تاريخاً أو نسبةً لا تتطابق مع المصدر الأولي، أرسل ملاحظة إلى corrections@benchr.org. التصحيحات الجوهرية تُسجَّل في صفحة التصحيحات وفي سجل التغييرات الخاص بكل مقال.