أتاحت Google النموذج Gemini 3.8 Flash للجميع في 2 سبتمبر 2026، أي بعد Gemini 3.7 Flash بعشرين يوماً. وأعاد benchr فحص جدول الأسعار وصفحة النموذج ومنشور الإطلاق في 7 سبتمبر. والمقارنة هنا غير معتادة، لأن النقطتين لا يفصل بينهما سعر ولا سياق ولا حدّ إخراج. يفصل بينهما السلوك، والسلوك هو الجزء الذي لا تسعّره أي بطاقة أسعار.
بطاقة الأسعار هي نفسها، إلى آخر سنت
كل مسار منشور يطابق نظيره في 3.7 Flash تماماً. وهذا ليس تقريباً من جدول مختصر، بل ما ينصّ عليه سجلّا التسعير كلاهما.
| المسار | حتى 31 ديسمبر 2026 | من 1 يناير 2027 | يختلف عن 3.7؟ |
|---|---|---|---|
| الإدخال القياسي | $0.75 | $1.50 | لا |
| الإخراج القياسي | $3.75 | $7.50 | لا |
| الإدخال المخزَّن | $0.075 | $0.15 | لا |
| تخزين الكاش / مليون / ساعة | $0.50 | $1.00 | لا |
| إدخال الدفعات والمرن | $0.375 | $0.75 | لا |
| إخراج الدفعات والمرن | $1.875 | $3.75 | لا |
| إدخال الأولوية | $1.35 | $2.70 | لا |
| إخراج الأولوية | $6.75 | $13.50 | لا |
ونافذة الإدخال 1,048,576 توكناً وحدّ الإخراج الأقصى 65,536 في الاثنين، وتتوفّر طبقة مجانية في الاثنين. أي أن الترحيل لا يُبرَّر ولا يُرفَض من ورقة الأسعار، وأي تقدير تكلفة يكتفي بتبديل معرّف النموذج سيعيد الرقم نفسه لنموذجين لا يتصرّفان بالطريقة نفسها.
ما غيّرته Google هو مقدار ما ينفقه النموذج
منشور الإطلاق صريح في ذلك. تكتب Google أن 3.8 Flash «يعمل بجهد أكبر»، وأنه في المهام المعقّدة «يُظهر اجتهاداً أعلى — فينفّذ خطوات استدلال إضافية، ويستدعي الأدوات على نحو متكرّر». ومستويات التفكير معروضة في صفحة النموذج بثلاث درجات: منخفض ومتوسط وعالٍ.
وإذا قُرئت تلك الجملة بوصفها بياناً عن التكلفة لا عن الجودة، فهي تقول إن النموذج سينتج — بحكم التصميم — توكنز إخراج أكثر واستدعاءات أدوات أكثر للمُدخل نفسه. والإخراج مسعَّر بخمسة أضعاف الإدخال في هذه البطاقة، وتوكنز التفكير تُحاسب كإخراج. لذا قد يكلّف حِمل كان مريحاً على 3.7 Flash أكثر بوضوح على 3.8 Flash بالأسعار المنشورة نفسها، ولن تظهر الزيادة في أي مكان سوى عدّاد التوكنز.
وتقول Google ذلك بنفسها: حين تكون كفاءة الحوسبة هي القيد الأول، يمكن للمطوّرين استخدام مستويات جهد أدنى أو «الاستمرار على Gemini 3.7 Flash، الذي يبقى مدعوماً بالكامل للأحمال التي تقدّم الكفاءة». وهذا مزوّد يخبرك أن النموذج الأحدث ليس تلقائياً هو الصحيح.
رقم منشور واحد، وبقيّة ليست أرقاماً
تنشر Google رقماً واحداً للنموذج العام عند الإطلاق: 54.9% على HLE-Verified. وهي نتيجة معلنة من المزوّد لا قياس من benchr، ولم يُعِد benchr إنتاجها.
أما بقيّة ادّعاءات الإطلاق فبيانات مقارنة بلا أرقام منشورة: أن 3.8 Flash يتفوّق على معظم النماذج الحدودية الأكبر في DeepSWE v1.1، وأنه يتفوّق على 3.7 Flash وغيره في Vals Finance Agent V2 وHarvey's Legal Agent Benchmark. وقد تكون صحيحة. لكنها غير صالحة في مقارنة شرائية، لأن ادّعاءً بلا رقم لا يمكن التحقّق منه ولا ترتيبه ولا إدخاله في جدول. يسجّل benchr الرقم الواحد ويترك الباقي على حاله.
نسخة Cyber ليست شيئاً تبني عليه خطة
يقدّم الإعلان نفسه Gemini 3.8 Flash Cyber، وهو متغيّر متخصّص لاكتشاف الثغرات والترقيع الآلي، بنتيجة 47.2% pass@1 على CWE-Bench ومعدّل اكتشاف ثغرات واقعية تقول Google إنه يتجاوز 70%.
ولا يُبلَغ إلا عبر برنامج Fairwind من Google، وهو مقصور على جهات حكومية موثوقة ومشغّلي بنى تحتية حرجة وصائني برمجيات. وليس له سجل في توثيق أسعار الواجهة ولا معرّف واجهة منشور هناك، فلا يحمل benchr سجلاً له. وإن لم تكن داخل ذلك البرنامج أصلاً، فتعامل معه بوصفه غير متاح، لا بوصفه نموذجاً قد تتبنّاه لاحقاً.
ما تفعله النقطة وما لا تفعله
يقبل النموذج إدخال النص والصورة والفيديو والصوت وملفات PDF، ويعيد نصاً. ومُدرَج له استدعاء الدوال والمخرجات المهيكلة وتنفيذ الكود والبحث في الملفات وسياق الروابط والتأريض بالبحث والتأريض بخرائط Google والتخزين المؤقّت ومسارات الدفعات والمرن والأولوية، مع استخدام الحاسوب بوصفه معاينة.
أما توليد الصور وتوليد الصوت وواجهة Live API فغير مدعومة صراحةً لهذا النموذج. فإن كانت مرحلة من خطّ عملك تنتج صوراً أو صوتاً أو تُبقي جلسة حيّة، فمكانها نقطة أخرى مهما كان أداء مرحلة الاستدلال.
الاختيار بين 3.7 و3.8
| إذا كان قيدك | يشير السجل إلى | لماذا |
|---|---|---|
| التكلفة لكل مهمة مكتملة، على عمل يؤدّيه النموذج الحالي أصلاً | Gemini 3.7 Flash | تسمّيه Google خيار الكفاءة وتُبقيه مدعوماً بالكامل |
| عمل وكيل متعدّد الخطوات يتعثّر حالياً أو يستسلم مبكّراً | Gemini 3.8 Flash | خطوات الاستدلال الإضافية والاستدعاء المتكرّر للأدوات هي التغيير المعلن |
| ميزانية توكنز ثابتة لكل طلب | 3.7 Flash، أو 3.8 بمستوى تفكير منخفض | مستويات الجهد الأعلى تنفق توكنز إخراج، وهي مسعَّرة بخمسة أضعاف الإدخال |
| توليد صور أو صوت أو جلسة حيّة | لا هذا ولا ذاك | مسارات الإخراج تلك غير مُدرَجة لأي منهما |
| ميزانية تمتدّ إلى 2027 | نمذج الفترتين أولاً | كل الشرائح تتضاعف في 1 يناير 2027 في الاثنين |
ما يجب أن تقيسه التجربة
لأن الأسعار متطابقة، فمقارنة سعر التوكن لا تخبرك بشيء. القياس الذي يفصل بين النموذجين هو التكلفة لكل مهمة مكتملة لا التكلفة لكل توكن، ويحتاج تشغيل الحالات التمثيلية نفسها على النقطتين مع عدّ استدعاءات الأدوات.
سجّل لكل حالة: مجموع توكنز الإدخال، ومجموع توكنز الإخراج شاملةً التفكير، وعدد استدعاءات الأدوات، وهل اكتملت المهمة دون تدخّل بشري، والزمن الفعلي. فنموذج يكلّف أكثر بـ40% لكل مهمة ويكمل 20% أكثر منها قرار مختلف عن نموذج يكلّف أكثر بـ40% ويكمل المجموعة نفسها. ولا تظهر أيّ من النتيجتين على بطاقة الأسعار، ولا يمكن التنبّؤ بأيّ منهما من منشور الإطلاق.
وإن كان الحِمل يستخدم بادئات متكرّرة، فسعّر التخزين المؤقّت للسياق بدقّة في الاثنين: نسبة إصابة الكاش سلوك خاص بكل نموذج، ويجب أن يحمل التقدير تخزين الكاش بسعر $0.50 لكل مليون توكن في الساعة بدل معاملة كل إصابة على أنها مجانية.