طبقة النماذج مفتوحة المصدر الآن: Llama 4 وMistral وQwen وDeepSeek

أين لحقت النماذج مفتوحة المصدر بالمغلقة، وما الذي تبقى من الفجوة بعد تحديث ربيع 2026.

من فريق benchr · · عرض سجل التغييرات

عائلات النماذج 4 Llama وMistral وQwen وDeepSeek
أنظف رخصة Apache Qwen3.6 وMistral Large 3، وMIT لـ DeepSeek
أرخص إدخال $0.14 DeepSeek-V4-Flash / 1M رمز
أعلى SWE-Bench مفتوح 80.6% DeepSeek-V4-Pro، بطاقة النموذج الرسمية

غيّر ربيع 2026 مجموعة المرشحين مفتوحي الأوزان بوضوح: أصدرت DeepSeek نموذج V4 في أبريل، وأصدرت Alibaba سلسلة Qwen3.6 في الشهر نفسه، وكانت Mistral قد نقلت Large 3 إلى Apache 2.0 في ديسمبر. تُظهر النتائج العامة تقدماً، لكنها لا تثبت أن المفتوح «لحق» عموماً في المحادثة أو البرمجة أو تعدد اللغات أو الاسترجاع الطويل أو الوكلاء. السؤال المفيد أضيق: أي مرشح يحقق عتبة الجودة المقاسة لديك ضمن قيود الترخيص والخصوصية والكمون والتكلفة؟

القائمة: Llama 4 في إعداديه المشحونين (Maverick بـ400B إجمالية ونحو 17B نشطة، وScout بـ109B مع سياق 10M رمز)، وMistral Large 3 بـ675B إجمالية و41B نشطة، وQwen3.6 بنسختي 27B الكثيفة و35B-A3B، وDeepSeek-V4 بحجمي Pro وFlash — الأوزان نفسها بحجمي استضافة، مع Pro عند 1.6T معامل إجمالي و49B نشطة لكل رمز. كل رقم صلب أدناه يأتي من بطاقة النموذج أو صفحة التسعير الرسمية للمزود نفسه. إذا أردت تشغيل أي من هذه على عتادك الخاص، فراجع تشغيل النماذج على جهازك.

تحفظ واحد قبل القائمة. قفزات المعايير في DeepSeek-V4 مقارنة بـ V3.1 حقيقية ومنشورة على بطاقة النموذج الرسمية. هل تترجم إلى الفرق نفسه في عبء الرياضيات المحدد لديك (نمذجة مالية، أو تفكير صعب تحت عدم اليقين) فهذا لا يخبرك به إلا اختبارك الخاص. تميل فجوة لوحة الترتيب إلى أن تبدو أكبر مما يظهر على مستوى عبء العمل.

Llama 4

أصدرت Meta نموذج Llama 4 في أبريل 2025، وفق إعلان Llama 4 من Meta AI، في إعدادين رئيسيين. Maverick هو نموذج MoE بـ400B معامل (نحو 17B نشطة لكل رمز) موجه للنشر الجاد على GPU. وScout هو متغير MoE بـ109B يفعّل نحو 17B معامل في كل مرور أمامي ويعمل على H100 واحد بسعة 80GB مع تكميم معقول. الأوزان والتنزيلات متاحة في llama.com.

بعد أكثر من عام على الإطلاق، ضاقت حصة Llama 4 من الطبقة إلى شيء واحد لا يقدمه غيره: نافذة سياق Scout البالغة 10M رمز على عتاد تتحكم فيه أنت. ما زال Maverick نموذجاً عاماً كفؤاً، لكن إصدارات ربيع 2026 من DeepSeek وQwen تجاوزته في الكود والتفكير — بطاقته الرسمية تُظهر 69.8% على GPQA Diamond، وهو أقل بوضوح من 87.8% لـ Qwen3.6-27B و90.1% لـ DeepSeek-V4-Pro. Scout هو حصان العمل: يبادل القدرة القصوى بتشغيل على H100 واحد بسعة 80GB مع تكميم معقول، ومعه تلك النافذة العملاقة.

الرخصة هي Llama 4 Community License: متساهلة تقريباً للجميع، مع بند يمنع الاستخدام من خدمات لديها أكثر من 700M مستخدم نشط شهرياً. هذا البند غير ذي صلة لفريق صغير أو مطور منفرد. في شركة كبيرة، اقرأ الرخصة بعناية مقابل سياق النشر المحدد.

Mistral Large 3

صدر في 2 ديسمبر 2025 بـ675B معامل إجمالي و41B نشطة، وفق إعلان Mistral وصفحة النموذج الرسمية. التغيير الأبرز عن Large 2 ليس القدرة — بل الرخصة. يأتي Large 3 تحت Apache 2.0، متخلياً عن رخصة البحث القديمة وشروطها التجارية المنفصلة تماماً. تستطيع نشره تجارياً اليوم من دون التحدث مع أحد.

تضع Mistral النموذج للأعمال متعددة اللغات والمخرجات المنظمة. سعر واجهته الموثق في هذه اللقطة 0.50 / 1.50 دولار لكل مليون رمز، وسياقه 256K. لا تثبت المصادر المذكورة أن أسلوبه أو إخراجه في اللغات الأوروبية أقوى من كل البدائل. أدرجه حين تهم هذه الأبعاد وApache 2.0، ثم قارن وفاء اللغة وصحة البنية ودقة المهمة على مجموعة محجوبة واحدة.

Qwen3.6

سلسلة Alibaba الحالية، صدرت في أبريل 2026، مع بطاقات النماذج على Hugging Face تحت منظمة Qwen. النسختان المفتوحتان المؤكدتان هما نموذج 27B الكثيف و35B-A3B MoE الذي يفعّل 3B معامل فقط لكل رمز. تُبلغ بطاقة 27B عن 77.2% على SWE-bench Verified و87.8% على GPQA Diamond. هذه إشارات معيارية ينشرها المزود، وليست دليلاً على أداء الإنتاج أو الصدارة اللغوية. على الفرق العاملة بالصينية أو العربية أو اليابانية استخدام مراجعين متمكنين ومجموعة محلية محجوبة.

تأتي النسختان تحت Apache 2.0؛ راجع الترخيص الحالي واعتماديات النشر لحالتك. للعمل الوكيلي اختبر حفظ التعليمات والتعافي عبر محادثات طويلة، وللطلبات القصيرة قِس الجودة والسرعة والذاكرة على عتادك. لا تثبت المادة المذكورة فائزاً عاماً في الجودة لكل معامل.

DeepSeek-V4

صدر في 24 أبريل 2026، مع الإعلان والتسعير في api-docs.deepseek.com. يأتي V4 بحجمي استضافة مبنيين على الأوزان المفتوحة نفسها برخصة MIT: نسخة Flash عند 0.14 / 0.28 دولار لكل مليون رمز، ونسخة Pro — 1.6T معامل إجمالي و49B نشطة — عند 0.435 / 0.87 دولار. كلاهما بنافذة سياق 1M رمز وحد إخراج كبير على غير المعتاد عند 384K. حافظت DeepSeek على أكثر قصة مفتوحة المصدر جرأة بين المختبرات: تقارير تقنية مفصلة، وبطاقات نماذج تنشر الأرقام بدلاً من لغة التسويق، وتسعير أقل بكثير من البدائل الغربية.

تبلغ البطاقة الرسمية عن V4-Pro عند 80.6% على SWE-bench Verified و90.1% على GPQA Diamond و93.5% على LiveCodeBench. أرقام المزود مفيدة للقائمة القصيرة، لكن المقارنات بين المزودين قد تستخدم إعدادات مختلفة ولا تثبت موثوقية الإنتاج أو سلوك الوكلاء أو السلامة. اختبر مهام المستودعات وفشل الأدوات وحالات الإساءة وتكلفة الخدمة الكلية تحت إعدادك.

الرخصة هي MIT للأوزان. متساهلة ونظيفة؛ اقرأ شروط الواجهة المستضافة منفصلةً إذا كان النشر يلامس أي شيء حساس.

متوسط القدرة عبر ستة أبعاد

تقييمات benchr التحريرية للقدرة، بمتوسط عبر البرمجة والتفكير والكتابة والرؤية والسياق الطويل وتعدد اللغات — ليست أرقاماً رسمية. الدرجات نفسها في الفهرس المرتب.

DeepSeek-V4-Pro
88
Qwen3.6-27B
86
DeepSeek-V4-Flash
85
Mistral Large 3
80
Claude Opus 4.8 (مرجع)
92
80.6% DeepSeek-V4-Pro على SWE-bench Verified — بأقل من عُشر أسعار رموز النماذج المغلقة المتقدمة

ثلاثة مجالات تستحق اختبار الأوزان المفتوحة

تجعل النتائج العامة ثلاثة مجالات مرشحة معقولة لتقييم الأوزان المفتوحة. هل الجودة قريبة بما يكفي سؤال خاص بعبء العمل؛ قِسها قبل أن تحسم الرخصة أو التكلفة أو تفضيل النشر القرار.

المعرفة العامة والتفكير الحواري عند الأطوال المعتادة. النماذج مفتوحة المصدر الأعلى قريبة بما يكفي من الحد المغلق في استخدام المحادثة، والأسئلة الواقعية، والتفكير المنظم الذي يناسب نافذة سياق واحدة. تلتقط لوحات الترتيب هذا بدقة، حتى لو فاتتها الفئات التالية. للمزيد عن مشكلة لوحات الترتيب، راجع لماذا توقفت المعايير عن إخبارك بأي شيء.

توليد الكود هو الثاني، ولم يعد محصوراً في المهام المعزولة. نتيجة DeepSeek-V4-Pro البالغة 80.6% على SWE-bench Verified هي درجة على مستوى المستودع — إصلاحات حقيقية متعددة الملفات لا دوال تجريبية — وتقترب من النماذج المغلقة المتقدمة. الفجوة المتبقية تظهر على النطاق المعماري، في قرارات التصميم التي تمتد عبر قاعدة كود إنتاجية. لمعظم البرمجة اليومية، صارت النماذج مفتوحة المصدر ببساطة جيدة بما يكفي.

الثالث هو القدرة متعددة اللغات في اللغات عالية الموارد. تنافس النماذج مفتوحة المصدر العليا بقوة عبر اللغات الأوروبية والصينية واليابانية وبشكل متزايد العربية، وتدفع Qwen3.6 تحديداً الحد الصيني إلى أمام أي نموذج مغلق تستطيع شراءه. للمؤسسات التي تعمل بجدية على تعدد اللغات، صارت طبقة مفتوح المصدر خياراً أول حقيقياً لا احتياطياً.

القدرات التي تتأخر النماذج مفتوحة المصدر في مضاهاة المغلقة فيها هي بالضبط ما صبت المختبرات المغلقة أكبر قدر من الهندسة فيه. أصعب الفجوات إغلاقاً هي التي تساوي أكبر مال.

مجالان يحتاجان تحققاً إضافياً

الاسترجاع طويل السياق واستخدام الأدوات متعدد الخطوات حساسان خصوصاً للإعداد ومعالجة الفشل. لا تبرر نتائج المعايير العامة قاعدة شاملة بين المفتوح والمغلق.

الأول هو الاسترجاع طويل السياق عند النطاقات القصوى. لا تضمن نافذة السياق القصوى استدعاءً مرتفعاً أو هلوسة منخفضة في نموذج مغلق أو مفتوح. تبلغ DeepSeek عن 83.5% على MRCR عند 1M لـV4-Pro، لكن نتيجة المزود لا تتنبأ بمجموعة مستنداتك. أنشئ مستندات بإجابات مرجعية على أعماق مختلفة وقِس الاستشهاد والامتناع تحت إعدادات استرجاع متساوية.

الثاني هو استخدام الأدوات وسلوك الوكلاء. ينشر المزودون معايير للوكلاء، لكن الإنتاج يعتمد على المطالبات ومخططات الأدوات وسياسة الإعادة والصلاحيات والمراقبة. نفذ المهام متعددة الخطوات نفسها مع حقن فشل الأدوات، وسجّل الإكمال والإجراءات غير الآمنة والتعافي والكمون والتكلفة. استخدم موافقة بشرية للإجراءات المؤثرة أياً كانت عائلة النموذج.

Llama 4 Scout

10M رخصة مجتمعية · ملك السياق

Mistral Large 3

675B Apache 2.0 · لغات أوروبية

Qwen3.6-27B

27B Apache 2.0 · على GPU واحد

DeepSeek-V4-Pro

1.6T MIT · كود + رياضيات
  1. Feb 2024 Mistral Large

    أول منافس مفتوح المصدر جاد لـ GPT-4.

  2. Jul 2024 Llama 3.1 405B

    أول نموذج مفتوح من Meta بفئة متقدمة.

  3. Dec 2024 DeepSeek-V3

    MoE مفتوح أغلق فجوة التكلفة.

  4. Apr 2025 Llama 4 Maverick / Scout

    جيل MoE من Meta؛ يجلب Scout سياق 10M رمز.

  5. Dec 2025 Mistral Large 3

    675B MoE — والانتقال إلى رخصة Apache 2.0 نظيفة.

  6. Apr 2026 Qwen3.6 + DeepSeek-V4

    التجديد الجيلي: 77-81% على SWE-bench Verified في الطبقة المفتوحة.

جدول المقارنة

نماذج متقدمة مفتوحة المصدر، مسح benchr، يونيو 2026
النموذجالمعاملاتالرخصةإشارة منشورةتحقّق محلياً
DeepSeek-V4-Pro1.6T (49B نشطة)MITدرجات مزود للبرمجة والاستدلالالسلامة والأدوات متعددة الخطوات
DeepSeek-V4-Flashالأوزان نفسها، استضافة أصغرMITلقطة إدخال 0.14$/Mالجودة وتكلفة الخدمة الكلية
Qwen3.6-27B27B كثيفApache 2.0مرشح مدمج متعدد اللغاتالمحادثات الوكيلية الطويلة
Mistral Large 3675B (41B نشطة)Apache 2.0تموضع متعدد اللغات وبنيةجودة اللغة والكود والرياضيات
Llama 4 Scout109B (17B نشطة)Llama 4 Communityسياق معلن 10M رمزالاستدعاء ودقة المهمة
Llama 4 Maverick400B (17B نشطة)Llama 4 Communityنموذج عام من Metaالكود والاستدلال والعتاد

Granite (خط IBM المرخص ترخيصاً مفتوحاً) وPhi (عائلة النماذج الصغيرة من Microsoft) ليسا ضمن هذا المسح. Granite قوي في عمل نصوص المؤسسات لكنه لا ينافس عند الحد المتقدم. يحصل Phi على مقالته الخاصة في مراجعة النماذج الصغيرة.

قاعدة القرار

إذا تعذر خروج البيانات من شبكتك، فالأوزان المفتوحة المستضافة ذاتياً مرشح مهم. لكنها لا تصبح ممتثلة تلقائياً؛ راجع الترخيص ومصدر النموذج وضوابط الأمن والسجلات والبنية ومتطلبات قطاعك مع المسؤولين القانونيين والأمنيين.

إذا هيمن سعر الرمز على عبء عملك، يجعل سعر DeepSeek-V4-Flash الموثق عند 0.14 دولار لكل مليون رمز إدخال النموذج جديراً بالحساب. سعر الرمز ليس التكلفة الكلية؛ أضف الإخراج والتخزين المؤقت والإعادات والاستضافة والكمون والمراجعة ومعدل الفشل في حاسبة التكلفة.

إذا كان عبء عملك يعتمد على الاسترجاع عبر مئات الآلاف من الرموز أو أدوات متعددة الخطوات، فاشترط اختبار قبول قبل النشر. قارن المرشحين المفتوحين والمغلقين على المجموعة نفسها وفشل الأدوات وحدود الإعادة وسياسة الموافقة البشرية، بدلاً من الاختيار حسب عائلة النموذج.

عندما لا توجد أولوية قوية لأي اتجاه، اصنع النموذج الأولي على نموذج مغلق لسرعة التطوير، ثم أعد اختبار مسار الإنتاج على DeepSeek-V4 أو Qwen3.6-27B قبل التوسع. كثيراً ما سيعمل النموذج المفتوح جيداً ويوفر مالاً يتراكم مع الوقت. وكثيراً بما يكفي، ستصطدم بنمط فشل محدد يبرر علاوة النموذج المغلق. اتجاه النتيجة يعتمد على حالة الاستخدام أكثر من أي قاعدة عامة.

النماذج مفتوحة الأوزان في منتصف 2026 مرشحون إنتاجيون معقولون لأعباء كثيرة، لكن يجب تعريف «جيد بما يكفي» محلياً. أضافت إصدارات أبريل درجات برمجة على مستوى المستودعات ينشرها المزودون ونتائج سياق طويل وخيارات تراخيص متساهلة؛ ولا تحسم أي من هذه الحقائق وحدها جودة المحادثة أو الكود أو العمل متعدد اللغات في الإنتاج.

يحسّن المزودون المفتوحون والمغلقون أسطح منتجات مختلفة، ولا تقيس الجداول العامة مسافة عالمية بينهم. تتبع أنماط الفشل والاقتصاديات المهمة لنشرك بدلاً من استنتاج الاستراتيجية أو قيمة الإنتاج من حركة المعايير.

للقائمة الأولية، أدرج DeepSeek-V4-Pro حين تناسب نتائجه البرمجية المنشورة وسعر استضافته، وQwen3.6-27B كمرشح أصغر للاستضافة الذاتية، وMistral Large 3 لتقييم تعدد اللغات والبنية، وLlama 4 Scout حين يكون سياقه المعلن مهماً. دع نتيجة عبء العمل المقاسة — لا العلامة ولا هذه القائمة التحريرية — تختار.

أسئلة شائعة

ما أفضل نموذج مفتوح المصدر في 2026؟

لا يوجد أفضل نموذج مثبت لكل الأعباء. تبلغ بطاقة DeepSeek-V4-Pro عن 80.6% على SWE-bench Verified، ويستهدف Qwen3.6-27B الاستضافة المدمجة، ويوثق Mistral Large 3 ترخيص Apache 2.0 والاستخدام متعدد اللغات، ويعلن Llama 4 Scout سياق 10M رمز. تعامل مع هذه كحقائق لاختيار المرشحين، ثم اختبر الجودة والعتاد والترخيص والسلامة والتكلفة الكلية محلياً.

هل النماذج مفتوحة المصدر جيدة بما يكفي للإنتاج؟

قد تكون مناسبة، لكن المعايير العامة لا تجيب عن ذلك لـ«معظم الأعباء». عرّف مجموعة قبول لمهمتك وقارن الدقة والإخفاقات غير الآمنة والكمون والموثوقية والتكلفة الكلية في إعداد النشر الذي ستستخدمه فعلاً.

أي رخصة مفتوحة المصدر أنظف للاستخدام التجاري؟

تنشر Qwen3.6 وMistral Large 3 شروط Apache 2.0، وتنشر DeepSeek-V4 وPhi-4 شروط MIT، وتستخدم Llama رخصة مجتمعية منفصلة بشروط إضافية. يعتمد «الأنظف» على التوزيع والاعتماديات والتزامات الاستخدام والاختصاص. تحقق من نص الرخصة الحالي واطلب مراجعة قانونية عند الحاجة.

كيف يقارن DeepSeek-V4 بالنماذج المغلقة؟

تبلغ بطاقة DeepSeek الرسمية عن 80.6% على SWE-bench Verified و90.1% على GPQA Diamond. قد تختلف إعدادات المعايير والأسعار بين المزودين، ولا تثبت الأرقام موثوقية الأدوات أو السلامة. قارن المرشحين ببروتوكول واحد لمهمتك.

هل أستضيف نموذجي مفتوح المصدر بنفسي؟

قد تناسب الاستضافة الذاتية التحكم في البيانات أو الكمون أو التكلفة المتوقعة عند الحجم العالي أو الضبط الدقيق، لكنها تضيف عتاداً وتشغيلاً وأمناً وسعة خاملة. قارن اختبار حمل مقاساً وتكلفة تشغيل كاملة بعروض الاستضافة الحالية؛ لا توجد عتبة عامة لعدد الطلبات.

سجل التغييرات

  • 23 يوليو 2026 — استُبدلت أحكام الفائز العام واستنتاجات المفتوح مقابل المغلق غير المسندة بإشارات منسوبة للمزود وخطوات تحقق محلية قابلة للإعادة.
  • 10 يونيو 2026 — تحديث شامل إلى الطبقة المفتوحة الحالية. يغطي المسح الآن DeepSeek-V4 (Pro/Flash) وQwen3.6 (27B و35B-A3B) وMistral Large 3 برخصته Apache 2.0 وLlama 4 — بدلاً من تشكيلة يناير (DeepSeek-V3.1 وQwen 3 وMistral Large 2) في كامل المقال. أعيد التحقق من جميع الأرقام مقابل بطاقات النماذج وصفحات التسعير الرسمية.
  • 1 يونيو 2026 — أضيفت ملاحظة أبريل 2026 بأن DeepSeek V4 (V4-Pro وV4-Flash) صدر لاحقاً، لتصحيح مرجع يناير القديم.
  • 25 مايو 2026 — تم التحقق من الأسعار وفق وثائق المزودين الحالية. حُدثت أرقام التكلفة في كامل المقال لتعكس تعديلات أسعار Anthropic وطرح Google لـ Gemini 3.1 Pro Preview.
  • 24 أبريل 2026 — أصدرت DeepSeek نموذج V4 (V4-Pro وV4-Flash) كنماذج مفتوحة المصدر، لذلك أصبحت ملاحظة يناير أدناه سابقة للإصدار: يوجد DeepSeek V4 فعلاً. يجري تحديث هذه المقالة لإدخال عائلة V4 في ترتيب مفتوح المصدر.
  • 22 يناير 2026 — صُححت مراجع نماذج غير موجودة: استُبدل Mistral Large 3 بـ Large 2 (Large 3 لم يصدر)، وDeepSeek-V4 بـ V3.1 (V4 لم يكن قد صدر آنذاك).
  • 18 يناير 2026 — نُشرت النسخة الأولى.

المراجع

  1. Meta AI، "Llama 4: ذكاء متعدد الوسائط"، ai.meta.com/blog/llama-4-multimodal-intelligence, April 2025.
  2. Meta، "Llama"، llama.com، اطُّلع عليه في مايو 2026.
  3. Mistral AI، "Mistral 3" (إصدار Mistral Large 3)، mistral.ai/news/mistral-3، ديسمبر 2025.
  4. DeepSeek، "ملاحظات إصدار DeepSeek-V4 والتسعير"، api-docs.deepseek.com/news/news260424، أبريل 2026.
  5. DeepSeek، "بطاقة نموذج DeepSeek-V4-Pro"، huggingface.co/deepseek-ai/DeepSeek-V4-Pro، اطُّلع عليه في يونيو 2026.
  6. فريق Qwen، "بطاقة نموذج Qwen3.6-27B"، huggingface.co/Qwen/Qwen3.6-27B، اطُّلع عليه في يونيو 2026.