دليل اختيار النماذج المتقدمة في 2026

قائمة قصيرة بالنماذج المستضافة المتقدمة وطريقة واضحة لمقارنتها على مهامك، من دون تحويل أرقام المزوّدين إلى ترتيب عام.

بقلم فريق benchr ·

ماذا يغطي هذا الدليل

يغطي الدليل المرشحين المستضافين في سبتمبر 2026: Claude Opus 5 وClaude Fable 5.1 من Anthropic، وGPT-5.6 Sol وGPT-6 Astra من OpenAI، وGemini 3.1 Pro من Google (وما زالت Google تصفه بـ Preview)، وGrok 4.6 من xAI، مع DeepSeek-V4-Pro وKimi K3 كنقطتي مقارنة مفتوحتي الأوزان. كُتبت المراجعات والمقارنة أدناه للنماذج الرائدة السابقة، Claude Opus 4.7 وGPT-5، وتبقى سجلًا لتلك النماذج، أما طريقة التقييم فيها فتنطبق كما هي على النماذج الحالية. نفصل بين المواصفات والنتائج المنشورة من المزوّدين وبين ملاحظاتنا التحريرية، ولا ندّعي اختبارًا خاصًا غير منشور ولا فائزًا عامًا.

القائمة القصيرة الحالية

أسعار API المعلنة من المزوّدين لكل مليون توكن (إدخال / إخراج) وسعة السياق، كما سجّلها benchr في 11 سبتمبر 2026. أرقام البنشمارك منشورة من المزوّدين.
النموذجالسعر / 1Mالسياقما ينشره المزوّد
Claude Opus 5$5 / $251Mتوصي Anthropic بالبدء به لمعظم أعباء العمل، ولا يسجّل benchr له جدول بنشماركات منشورًا من Anthropic.
Claude Fable 5.1$10 / $501Mتوجّه Anthropic إليه الاستدلال الصعب وعمل الوكلاء طويل المدى. تعيد الواجهة الخطأ HTTP 400 إذا كانت قيمة tool_choice هي any أو أداة مسمّاة.
GPT-6 Astra$10 / $501.05Mأقدر نماذج OpenAI، بلا جدول بنشماركات منشور. يتطلب استدعاء الأدوات واجهة Responses API.
GPT-5.6 Sol$4 / $201.05MSWE-bench Verified 89.8 وGPQA Diamond 91.2 (بحسب OpenAI).
Gemini 3.1 Pro$2 / $12 حتى مطالبات 200K توكن، و$4 / $18 فوقهانحو 1MGPQA Diamond 94.3 وSWE-bench Verified 80.6 (بحسب Google). ما زال أحدث نماذج Pro من Google.
Grok 4.6$2 / $6 دون مطالبات 200K توكن، و$4 / $12 عندها وفوقها500Kالنموذج الرائد من xAI، ولا يسجّل benchr له رقم بنشمارك منشورًا من المزوّد.
DeepSeek-V4-Pro (مفتوح الأوزان، MIT)$1.32 / $3.96 في الذروة، و$0.66 / $1.98 خارجها1MSWE-bench Verified 80.6 وTerminal-Bench 2.1 87.9 (بحسب DeepSeek).
Kimi K3 (رخصة Kimi K3 License)$3 / $151MTerminal-Bench 2.1 88.3 وGPQA 93.5 (بحسب Moonshot)، بلا رقم على SWE-bench Verified.

المراجعات

  • مراجعة · نوفمبر 2025

    Claude Opus 4.7، مراجعة

    تنشر Anthropic سعر Opus 4.7 ونتائج اختبارات مرجعية للبرمجة والاستدلال. اختبره على مسائل لم تُستخدم في إعداد التعليمات وعلى مستندات تمثل عملك، ثم قارن الأخطاء ووقت المراجعة.

  • مراجعة · يناير 2026

    GPT-5، مراجعة

    تنشر OpenAI مواصفات GPT-5 ونتائج اختبارات مرجعية تجعله مرشحًا للمخرجات المنظّمة والاستدلال. أما السرعة والأسلوب ومعدل الخطأ فتتأثر بطريقة النشر والتعليمات؛ قِسها على البيئة نفسها.

  • مراجعة · ديسمبر 2025

    Gemini 3 Pro، مراجعة

    توثّق Google سعة سياق النموذج وتكاملاته مع Workspace. تمثل الأعمال كثيفة الصور والمرتبطة بـWorkspace فرضيات تحريرية معقولة تختبرها بلقطات شاشة ومستندات واستشهادات وحالات فشل ممثلة.

المقارنات

  • مقارنة · ديسمبر 2025

    GPT-5 مقابل Claude Opus 4.7: خطة تقييم من سبع مهام

    سبع فئات عمل بقالب مطالبة وتقييم مشترك. الميول حسب الفئة فرضيات تحريرية لا نتائج خاصة مقاسة؛ أعد تنفيذها بإصدارات مثبتة ومخرجات محفوظة ومراجعة معماة. كُتبت الخطة للنموذجين السابقين، وتنطبق كما هي على Claude Opus 5 وGPT-5.6 Sol.

  • مقارنة · مارس 2026

    خطة تقييم متعدد الوسائط: اثنتا عشرة صورة، أربعة نماذج

    مقياس قابل للإعادة لـClaude وGPT-5 وGemini 3 وLlama 4 عبر الواجهات الكثيفة وصور المستندات والرسوم والخط العربي. مواضع النماذج فرضيات للتحقق، لا جدول فائزين غير منشور.

  • تحليل · أبريل 2026

    جدول السعر لكل حالة استخدام

    ستة أشكال لأعباء العمل باستخدام أسعار رموز مؤرخة ومنشورة من المزودين. أعد الحساب بمزيج الإدخال والإخراج ونسبة إصابة التخزين المؤقت واستدعاءات الأدوات والإعادات وصفحات السعر الحالية قبل قرار الميزانية.

أيها يجب أن تستخدم؟

ابدأ بالمرشح الذي تتوافق قدراته الموثّقة مع عبء عملك الغالب. في البرمجة وعمل الوكلاء، ضع GPT-5.6 Sol ‏(SWE-bench Verified 89.8 بحسب OpenAI) إلى جانب Claude Opus 5، الذي تنصح Anthropic بالبدء به لمعظم أعباء العمل، مع أن benchr لا يسجّل له جدول بنشماركات منشورًا من Anthropic. وفي المهام متعددة الوسائط أو المستندات الطويلة أو المرتبطة بـWorkspace، اختبر Gemini 3.1 Pro ‏(GPQA Diamond 94.3 بحسب Google). وأضف Grok 4.6 حين تطغى كلفة الإخراج: بسعر $2 / $6 لكل مليون توكن دون مطالبات 200K توكن، يملك أدنى سعر إخراج بين النماذج المغلقة في هذه القائمة. هذه نقطة بداية تحريرية وليست ترتيباً مقاساً.

احتفظ بـ GPT-6 Astra وClaude Fable 5.1، وكلاهما بسعر $10 / $50 لكل مليون توكن، للمهام التي يثبت تقييمك أن السقف الأعلى فيها يستحق كلفته. وافحص التكامل قبل ذلك: يتطلب GPT-6 Astra واجهة Responses API لاستدعاء الأدوات ولا يقبل قيمة temperature مخصّصة، ويعيد Claude Fable 5.1 الخطأ HTTP 400 إذا كانت قيمة tool_choice هي any أو أداة مسمّاة. وإذا كان يجب أن تبقى الأوزان على عتادك، فاجعل DeepSeek-V4-Pro ‏(رخصة MIT، وSWE-bench Verified 80.6 بحسب DeepSeek) نقطة المقارنة المفتوحة الأوزان.

إذا كنت تفكر في استخدام نموذجين، شغّل مجموعة الاختبار نفسها على كل نموذج منفرداً ثم على مسار التوجيه المقترح. سجّل تغطية المهام ووقت المراجعة والإخفاقات والفاتورة الشهرية، ولا تضف النموذج الثاني إلا إذا حقق فائدة قابلة للقياس.

إذا كانت مهمتك تعتمد على لقطات الشاشة أو ملفات PDF أو صور المستندات، فأضف Gemini إلى الاختبار لأن Google توثّق دعمه للوسائط المتعددة. قارن دقة الاستخراج وربط الإجابة بموضعها في الصورة والتعامل مع الخط العربي والاستشهادات وزمن الاستجابة والكلفة قبل توسيع الاستخدام.

لسياق أعمق: أداة المقارنة تتيح لك اختيار أيٍّ من هذه النماذج وأي بُعد للمقارنة، مع PDF قابل للتنزيل. ودليل التكاليف يغطي ديناميكيات التسعير بالتفصيل.