الحرف A في الاسم يشرح عدد البارامترات النشطة، ولا يختصر متطلبات الذاكرة إلى 4B. بطاقة Google توضح أن الموجّه يحتاج كل الخبراء متاحين، لذلك تُحمّل 25.2B كاملة حتى لو استخدم التوكن جزءاً منها في كل مرة.
ما الذي تكسبه من MoE فعلاً؟
يضم النموذج 128 خبيراً موجهاً وخبيراً مشتركاً، ويستخدم ثمانية خبراء لكل توكن. إجمالي البارامترات 25.2B والنشط 3.8B. الفائدة المتوقعة هي تقليل الحساب أثناء التوليد مقارنة بنموذج كثيف بالحجم نفسه، لا تحويل النموذج إلى ملف صغير.
هذا الفرق مهم في خادم يقدّم عدة طلبات أو في محطة عمل تحاول الحفاظ على سرعة مقبولة. لكنه لا يعفيك من حساب ذاكرة الأوزان وKV cache وبيئة التشغيل والتوازي. أي قرار مبني على الرقم 3.8B وحده قرار ناقص.
وجود 16 GB في البطاقة لا يعني أن نافذة 256K ستعمل كاملة مع Q4_0. رقم 14.4 GB يخص تحميل الأوزان مع حمل إضافي محدد في الجدول. اترك مساحة للسياق وللخادم، أو قلل طول السياق والتوازي.
مقارنة 26B و31B تكشف القرار
| الحقل | 26B A4B | 31B كثيف |
|---|---|---|
| البنية | 25.2B إجمالي، 3.8B نشط | 30.7B كثيف |
| السياق | 256K | 256K |
| تحميل Q4_0 | 14.4 GB | 17.5 GB |
| LiveCodeBench v6 | 77.1% | 80.0% |
| GPQA Diamond | 82.3% | 84.3% |
| MRCR v2 عند 128K | 44.1% | 66.4% |
هذه نتائج Google، وليست اختبارات من benchr. الفارق المنشور يوضح المقايضة: 26B أخف في الذاكرة ويستخدم حساباً متفرقاً، بينما يتقدم 31B في النتائج المعروضة، خصوصاً اختبار السياق الطويل. لا تفترض أن الفارق نفسه سيظهر في OCR عربي أو كودك الداخلي؛ اختبر.
متى تختاره؟
اختبر 26B عندما تكون سعة الجهاز أو معدل المعالجة هما القيد، وعندما تعمل على نصوص وصور بمهام يمكن قياسها. دعم دور النظام واستدعاء الدوال يجعله مرشحاً لوكيل مضبوط، لا لوكيل مفتوح بلا حد للدورات. والسياق 256K مفيد للوثائق، لكن الأفضل أن تسترجع الجزء المطلوب بدلاً من تعبئة النافذة دائماً.
المعرّف في AI Studio وGemini API هو gemma-4-26b-a4b-it. وإذا شغّلت الأوزان محلياً فسجّل نسخة الملف والquantization والمحرك. نتيجة Q4_0 لا تمثل نتيجة BF16 تلقائياً.
متى تتجاوزه؟
إذا كانت لديك ذاكرة كافية وكان هدفك أقوى نتيجة منشورة ضمن هذين النموذجين، ابدأ بـ31B. وإذا كانت المهمة صوتية، فهذان النموذجان ليسا الفرع المناسب؛ Google تقصر الصوت الأصلي على E2B وE4B و12B. وإذا كنت تريد ميزانية API دقيقة، انتظر سعراً منشوراً لهذا المعرّف بدلاً من استعارة سعر Gemini آخر.
اختبر سعتين: التحميل والتشغيل المستمر
نجاح تحميل النموذج لا يعني أن الخادم يتحمل العمل. في الاختبار الأول شغّل الأوزان والمحرك وسياقاً ممثلاً على طلب واحد. وفي الثاني حافظ على المزيج المتوقع من أطوال الطلبات والجلسات المتزامنة، وسجّل الذاكرة بعد الإحماء لا عند بدء العملية فقط.
اربط كل نتيجة بملف التكميم ونسخة المحرك وتقسيم الأجهزة وسياسة الدفعات وإعداد السياق، ثم كرر المسار نفسه مع 31B. المقياس المفيد هو عدد المهام المقبولة قبل تجاوز حد الذاكرة أو الزمن أو الجودة، لا سرعة توكن مع طلب فارغ.
أعد الاختبار بعد أي تغيير للمحرك أو ملف الأوزان؛ اختلاف التنفيذ قد يغيّر الذاكرة والسرعة حتى لو بقي اسم النموذج نفسه.
اختبار قبول يستحق الوقت
شغّل عينة نصوص وصور واحدة على 26B و31B، بالإعداد والكمية والسياق نفسيهما. سجّل نجاح المهمة، وأول توكن، والتوكنز في الثانية، وأعلى ذاكرة، والمحاولات الإضافية. هنا تعرف هل وفّر MoE شيئاً حقيقياً على جهازك، أم أن فرق الدقة يفرض الرجوع إلى 31B.