الرسوم البيانية · محدَّث أغسطس 2026

الرسوم البيانية لنماذج الذكاء الاصطناعي

قارن قدرة النماذج بسعر API، واعرف أيّها لا يتفوّق عليه أرخص منه، ثم اضبط الأولويات بحسب استخدامك. خط حدّ القيمة وعمود تكلفة النقطة يُحسبان من فهرس التسعير، لا يُختاران يدوياً.

البيانات من models.json الترتيب محسوب من البيانات — لا مواضع مدفوعة أبداً

القدرة مقابل سعر API

تمثّل كل نقطة نموذجاً، والمحور الأفقي هو متوسط سعري الإدخال والإخراج لكل مليون توكن. أما المحور الرأسي فلك أن تُبقيه على وزن القدرات من 100 (برمجة 40%، استدلال 40%، كتابة 20%)، أو تبدّله إلى نتيجة اختبار رسمية، وعندها تُرسم فقط النماذج التي نشر مزوّدها ذلك الرقم فعلاً. الخط البنفسجي هو حدّ القيمة: النماذج التي لا يتفوّق عليها أرخص منها. ويبقى الجدول أدناه متاحاً بلوحة المفاتيح وقارئ الشاشة.

حدّ القيمة — لا يوجد نموذج أرخص يتفوّق عليه

اعرض بيانات الرسم في جدول، مع تكلفة النقطة الواحدة

جارٍ تحميل بيانات الرسم…

نطاقات المحاور تتكيّف مع البيانات — لا نموذج مثبّت عند الحافة. الأسعار من فهرس التسعير المبني على وثائق المزوّدين الرسمية؛ والنماذج المجانية أو بالاستضافة الذاتية مُزاحة قليلاً عن محور الـ $0 كي لا تتكدّس تسمياتها، وتبقى خارج حساب حدّ القيمة لأنه لا يوجد سعر لكل توكن تجري مقارنته.

مستكشف نتائج الاختبارات

حرّك الأشرطة لتحديد ما يهمك، وسيتحدّث الترتيب فوراً. يمكنك تصفير أي بُعد لا تحتاجه؛ فمثلاً قد تصفّر فرق البرمجة وزني الكتابة وتعدد اللغات. وإذا منحت وزناً لبُعد لا يملك النموذج بيانات فيه، مثل الرؤية في نموذج نصّي، فسيُحتسب بصفر كي لا تختفي البيانات الناقصة من الحساب.

البرمجة 40%
الاستدلال 40%
الكتابة 20%
الرؤية 0%
سعة السياق 0%
تعدد اللغات 0%

جارٍ التحميل…

كيف تُحتسب هذه الدرجة. رقم كل نموذج متوسط موزون (0–100) للأبعاد التي ضبطتها أعلاه. تستخدم البرمجة نتيجة SWE-bench Verified، ويستخدم الاستدلال نتيجة GPQA Diamond. كلاهما اختبار مرجعي موثق: نعرض رقم المزوّد حين ينشره، ونضع علامة «تقديري» حين تكون القيمة من تقدير benchr. أما الكتابة والرؤية وسعة السياق وتعدد اللغات فهي تقييمات تحريرية من benchr وليست اختبارات مختبرية؛ راجع المنهجية. يحتسب أي بُعد بلا بيانات بقيمة 0 ولا يُسقط من الحساب. تُقاس الأشرطة إلى المتصدر الحالي، وتظهر الدرجات بخانة عشرية واحدة لتمييز النماذج المتقاربة.

مفيد أيضاً

→ الفهرس المرتّب الكامل مع تقييم benchr → حاسبة التكلفة — تقدير شهري حسب الاستهلاك → اقتراح نموذج — أجب عن ثلاثة أسئلة → المقارنة جنباً إلى جنب

أسئلة شائعة

أي نموذج ذكاء اصطناعي يقدّم أفضل قدرة لكل دولار؟

لا يوجد فائز ثابت؛ تتغير النتيجة مع أوزان البرمجة والاستدلال والكتابة ومزيج الإدخال والإخراج. استخدم الرسم لبناء قائمة قصيرة، ثم احسب تكلفتك واختبر النماذج على حالاتك.

ما هو حدّ القيمة؟

حساب بسيط، لا رأي. يقع النموذج على الحدّ حين لا يوجد نموذج آخر له سعر API منشور يجمع بين كونه أرخص ومساوياً له أو أفضل في المقياس الذي اخترته. وما عدا ذلك يتفوّق عليه شيء أرخص، والجدول يسمّي لك النموذج المتفوّق. أما النماذج بلا سعر لكل توكن فتبقى خارج هذا الحساب، لأنه لا يوجد سعر تجري مقارنته — وهذا ليس معناه أن تشغيلها مجاني.

ماذا يقيس المحور الرأسي؟

ما تختاره أنت. الافتراضي هو وزن القدرة من 100 لدى benchr: برمجة 40%، استدلال 40%، كتابة 20%؛ وتقرأ البرمجة والاستدلال من حقول اختبار موثّقة، والبقية تقييمات تحريرية. ويمكنك تبديله إلى SWE-bench Verified أو GPQA Diamond، وعندها تُرسم فقط النماذج التي نشر مزوّدها ذلك الرقم فعلاً — فالرقم الغائب يُخرج النموذج من الرسم بدل أن يُحتسب له صفراً. والمستكشف أدناه يغيّر الوزن نفسه.

لماذا تظهر نماذج الاستضافة الذاتية قرب سعر الصفر؟

يشير موضعها إلى غياب سعر API عام لكل توكن أو إلى رسوم رخصة صفرية، لا إلى أن تشغيلها مجاني. تبقى تكلفة العتاد أو السحابة والتخزين والشبكات والمراقبة والعمل الهندسي خارج هذا المحور.

هل يمكنني مشاركة الرسوم أو بياناتها؟

يمكنك مشاركة رابط الصفحة، وتنزيل ملف models.json العام وإعادة استخدام بياناته بموجب رخصة CC BY 4.0 مع الإسناد. لا يدعم الموقع تضمين صفحات الأدوات خارجياً عبر iframe بسبب سياسة الأمان.

تحديثات benchr

تابع الإصدارات الجديدة وتغيّرات الأسعار عبر RSS وصفحات التحديث المنشورة.