Gemma 4 26B A4B IT: نموذج MoE سريع لكنه ليس صغيراً في الذاكرة

ينشّط 3.8B بارامتر لكل توكن، لكن تشغيله يحتاج تحميل 25.2B كاملة. هنا يتغير قرار الجهاز والنموذج.

بقلم فريق benchr التحريري · · سجل التغييرات · أعدنا فحص ملاحظة الإطلاق وبطاقة النموذج ودليل الذاكرة الرسمي في 29 يوليو 2026

Gemma 4 26B A4B IT: نموذج MoE سريع لكنه ليس صغيراً في الذاكرة: كتل بنفسجية ومسارات للأوزان المفتوحة.
لوحة نموذج من benchr Gemma 4 26B سجل مفتوح · فجوات مثبتة
نموذج Google مفتوحتظهر هوية Gemma 4 26B A4B IT: نموذج MoE سريع لكنه ليس صغيراً في الذاكرة عبر كتل بنفسجية ومسارات للأوزان المفتوحة.
الإجمالي / النشط25.2B3.8B لكل توكن
السياق256Kحد الإخراج غير منشور
تحميل Q4_014.4 GBتقدير Google
الترخيصApache 2.0أوزان مفتوحة

الحرف A في الاسم يشرح عدد البارامترات النشطة، ولا يختصر متطلبات الذاكرة إلى 4B. بطاقة Google توضح أن الموجّه يحتاج كل الخبراء متاحين، لذلك تُحمّل 25.2B كاملة حتى لو استخدم التوكن جزءاً منها في كل مرة.

ما الذي تكسبه من MoE فعلاً؟

يضم النموذج 128 خبيراً موجهاً وخبيراً مشتركاً، ويستخدم ثمانية خبراء لكل توكن. إجمالي البارامترات 25.2B والنشط 3.8B. الفائدة المتوقعة هي تقليل الحساب أثناء التوليد مقارنة بنموذج كثيف بالحجم نفسه، لا تحويل النموذج إلى ملف صغير.

هذا الفرق مهم في خادم يقدّم عدة طلبات أو في محطة عمل تحاول الحفاظ على سرعة مقبولة. لكنه لا يعفيك من حساب ذاكرة الأوزان وKV cache وبيئة التشغيل والتوازي. أي قرار مبني على الرقم 3.8B وحده قرار ناقص.

تقديرات Google لذاكرة الأوزان الثابتة

تتضمن 20% حملاً إضافياً عند التحميل، ولا تتضمن برنامج التشغيل أو ذاكرة السياق.

Q4_0
14.4 GB
SFP8
28.8 GB
BF16
57.7 GB

وجود 16 GB في البطاقة لا يعني أن نافذة 256K ستعمل كاملة مع Q4_0. رقم 14.4 GB يخص تحميل الأوزان مع حمل إضافي محدد في الجدول. اترك مساحة للسياق وللخادم، أو قلل طول السياق والتوازي.

مقارنة 26B و31B تكشف القرار

حقائق نشرتها Google عن الشقيقين
الحقل26B A4B31B كثيف
البنية25.2B إجمالي، 3.8B نشط30.7B كثيف
السياق256K256K
تحميل Q4_014.4 GB17.5 GB
LiveCodeBench v677.1%80.0%
GPQA Diamond82.3%84.3%
MRCR v2 عند 128K44.1%66.4%

هذه نتائج Google، وليست اختبارات من benchr. الفارق المنشور يوضح المقايضة: 26B أخف في الذاكرة ويستخدم حساباً متفرقاً، بينما يتقدم 31B في النتائج المعروضة، خصوصاً اختبار السياق الطويل. لا تفترض أن الفارق نفسه سيظهر في OCR عربي أو كودك الداخلي؛ اختبر.

متى تختاره؟

اختبر 26B عندما تكون سعة الجهاز أو معدل المعالجة هما القيد، وعندما تعمل على نصوص وصور بمهام يمكن قياسها. دعم دور النظام واستدعاء الدوال يجعله مرشحاً لوكيل مضبوط، لا لوكيل مفتوح بلا حد للدورات. والسياق 256K مفيد للوثائق، لكن الأفضل أن تسترجع الجزء المطلوب بدلاً من تعبئة النافذة دائماً.

المعرّف في AI Studio وGemini API هو gemma-4-26b-a4b-it. وإذا شغّلت الأوزان محلياً فسجّل نسخة الملف والquantization والمحرك. نتيجة Q4_0 لا تمثل نتيجة BF16 تلقائياً.

متى تتجاوزه؟

إذا كانت لديك ذاكرة كافية وكان هدفك أقوى نتيجة منشورة ضمن هذين النموذجين، ابدأ بـ31B. وإذا كانت المهمة صوتية، فهذان النموذجان ليسا الفرع المناسب؛ Google تقصر الصوت الأصلي على E2B وE4B و12B. وإذا كنت تريد ميزانية API دقيقة، انتظر سعراً منشوراً لهذا المعرّف بدلاً من استعارة سعر Gemini آخر.

اختبر سعتين: التحميل والتشغيل المستمر

نجاح تحميل النموذج لا يعني أن الخادم يتحمل العمل. في الاختبار الأول شغّل الأوزان والمحرك وسياقاً ممثلاً على طلب واحد. وفي الثاني حافظ على المزيج المتوقع من أطوال الطلبات والجلسات المتزامنة، وسجّل الذاكرة بعد الإحماء لا عند بدء العملية فقط.

اربط كل نتيجة بملف التكميم ونسخة المحرك وتقسيم الأجهزة وسياسة الدفعات وإعداد السياق، ثم كرر المسار نفسه مع 31B. المقياس المفيد هو عدد المهام المقبولة قبل تجاوز حد الذاكرة أو الزمن أو الجودة، لا سرعة توكن مع طلب فارغ.

أعد الاختبار بعد أي تغيير للمحرك أو ملف الأوزان؛ اختلاف التنفيذ قد يغيّر الذاكرة والسرعة حتى لو بقي اسم النموذج نفسه.

اختبار قبول يستحق الوقت

شغّل عينة نصوص وصور واحدة على 26B و31B، بالإعداد والكمية والسياق نفسيهما. سجّل نجاح المهمة، وأول توكن، والتوكنز في الثانية، وأعلى ذاكرة، والمحاولات الإضافية. هنا تعرف هل وفّر MoE شيئاً حقيقياً على جهازك، أم أن فرق الدقة يفرض الرجوع إلى 31B.

أسئلة شائعة

هل 3.8B نشطاً يعني أن Gemma 4 26B A4B يعمل مثل نموذج 4B في الذاكرة؟

لا. تقول Google إن 3.8B بارامتر تنشط لكل توكن، لكن يجب تحميل 25.2B كاملة حتى يستطيع الموجّه الوصول إلى الخبراء.

كم يحتاج Gemma 4 26B A4B من الذاكرة؟

تقدّر Google تحميل الأوزان الثابتة بـ57.7 GB عند BF16 و28.8 GB عند SFP8 و14.4 GB عند Q4_0 مع 20% حمل إضافي. تحتاج بيئة التشغيل وKV cache إلى ذاكرة إضافية.

ما سعة السياق؟

تسجل بطاقة Gemma 4 الرسمية سياقاً قدره 256K. لم تنشر المصادر المفحوصة حداً أقصى خاصاً بالإخراج لهذا المعرّف.

أختار 26B A4B أم 31B؟

ابدأ بـ26B إذا كانت الذاكرة والحساب المتفرق يحلان قيداً في التشغيل. ابدأ بـ31B إذا كان جهازك يتحمله وكانت نتائج Google الأقوى أهم من فرق الذاكرة.

سجل التغييرات

  • 29 يوليو 2026 — أعدنا بناء الصفحة بعد نشر Google تفاصيل البنية والسياق والذاكرة والترخيص والبنشماركات، وأضافت المراجعة مقارنة تشغيلية وقرار 26B مقابل 31B.
  • 28 يوليو 2026 — نُشرت الصفحة من سجل الإطلاق عندما لم تكن التفاصيل التقنية متاحة في المصدر المفحوص.

المراجع

  1. Google، ملاحظة إطلاق معرّفي Gemma 4، أُعيد فحصها في 29 يوليو 2026: Gemini API changelog.
  2. Google DeepMind، البنية والسياق والترخيص والبنشماركات الرسمية، أُعيد فحصها في 29 يوليو 2026: Gemma 4 model card.
  3. Google، صيغ التكميم وتقديرات ذاكرة الأوزان، أُعيد فحصها في 29 يوليو 2026: Gemma 4 model overview.