أعاد benchr فحص صفحة أسعار Moonshot وبطاقة النموذج الرسمية في 8 سبتمبر 2026. وفي هذا الإصدار أمران يستحقّان قراراً، وليس أيّ منهما موقعاً في جدول.
ادّعاء توكنز التفكير هو ادّعاء التكلفة
تقول Moonshot إن K2.7-Code يخفض استهلاك توكنز التفكير «بنحو 30%» مقارنةً بـK2.6 مع تحسّن في مهام البرمجة طويلة المدى. وتوكنز التفكير تُحاسَب كإخراج، والإخراج هنا $4.00 مقابل $0.95 إدخالاً — نسبة 4.2 إلى واحد.
فخفض 30% من توكنز التفكير ليس حاشية عن الكفاءة. في حِمل تغلب عليه الاستدلال، هو قريب من خفض 30% من النصف الغالي من الفاتورة، ويأتي بلا تغيير في السعر. وهذا عكس النمط المعتاد، حيث يكلّف النموذج الأحدث أكثر لكل توكن وتتجادل هل يستحقّ الفارق.
وهو أيضاً أسهل ادّعاء يمكنك التحقّق منه بنفسك. شغّل مهمّة المستودع نفسها على الاثنين، وعُدّ توكنز الإخراج، فالنسبة إمّا موجودة أو لا.
السريعة تكلّف الضعف بالضبط، في كل بند
النسخة المستضافة السريعة، Kimi K2.7-Code-Highspeed، وتُستدعى بالمعرّف kimi-k2.7-code-highspeed، ليست نموذجاً مختلفاً. النافذة نفسها 262,144، والمعمارية نفسها 1T/32B، وكل سعر منشور ضعف الأساس تماماً.
| السعر | kimi-k2.7-code | السريعة | المضاعف |
|---|---|---|---|
| إدخال، دون إصابة مخزون | $0.95 | $1.90 | 2.0x |
| إدخال، بإصابة مخزون | $0.19 | $0.38 | 2.0x |
| الإخراج | $4.00 | $8.00 | 2.0x |
| نافذة السياق | 262,144 | 262,144 | نفسها |
ومضاعفة ثابتة في كل بند تجعل القرار نظيفاً على غير العادة: أنت تشتري زمن استجابة لا غير، بسعر ثابت مقروء. لا جدال قدرة، ولا مقايضة سياق، ولا فارق اختبارات تزنه. إمّا أن الزمن الفعلي يستحقّ الضعف لهذا الحِمل، أو لا.
ولا تنشر Moonshot حدّ إخراج ولا رخصة للنسخة السريعة في صفحة الأسعار، فلا يسجّل benchr أياً منهما. وأوزان النموذج الأساس modified-MIT ليست دليلاً على شروط نقطة مستضافة.
إصابة المخزون هي موضع فاتورة الإدخال فعلاً
الإدخال بإصابة المخزون $0.19، أي خُمس سعر $0.95 بالضبط. وفي عمل البرمجة الذي يرسل سياق المستودع نفسه مراراً، الفرق بين بادئة مُحكمة البناء وأخرى رديئة هو تأرجح بخمسة أضعاف في جانب الإدخال.
وهذه رافعة أكبر من الاختيار بين النسختين لمعظم الفرق، وهي كلياً تحت سيطرتك. قِس نسبة الإصابة قبل مقارنة النماذج؛ فنسبة منخفضة تجعل كل نموذج يبدو غالياً وتخفي أيّها أرخص فعلاً للعمل.
النتائج المنشورة، وما هي
تأتي مع بطاقة النموذج ستة أرقام. وكلها أرقام Moonshot نفسها؛ ولم يُعِد benchr إنتاج أيّ منها.
| الاختبار | النتيجة | K2.6 |
|---|---|---|
| MCP Mark Verified | 81.1 | غير منشور |
| MCP Atlas | 76.0 | غير منشور |
| Kimi Code Bench v2 | 62.0 | 50.9 |
| Program Bench | 53.6 | غير منشور |
| Kimi Claw 24/7 Bench | 46.9 | 42.9 |
| MLS Bench Lite | 35.1 | غير منشور |
اثنان من الستة يحملان مقارنة بـK2.6، وهما المفيدان: Kimi Code Bench v2 يرتفع من 50.9 إلى 62.0، وKimi Claw 24/7 من 42.9 إلى 46.9. ولاحظ أن أكبر مكسب منشور هو على اختبار Moonshot المسمّى باسمها، وهو الشكل المعتاد لإصدار مزوّد وسبب لترجيح مهامّك أنت على أيّ منها.
لمن يناسب
| إن كنت | يقول السجل |
|---|---|
| تشغّل وكلاء برمجة طويلة المدى وتراقب تكلفة الإخراج | اختبره. خفض توكنز التفكير هو الادّعاء، والإخراج هو النصف الغالي |
| محجوزاً على زمن الاستجابة لا التكلفة | النسخة السريعة مضاعفة نظيفة للسرعة وحدها، بلا فارق آخر |
| مضطرّاً للاستضافة الذاتية أو تدقيق الأوزان | النموذج الأساس ينشر أوزاناً modified-MIT بـ1T إجمالاً و32B نشطة |
| ترسل سياق مستودع كبيراً ومتكرّراً | أصلح نسبة إصابة المخزون أولاً؛ $0.19 مقابل $0.95 رافعة أكبر من اختيار النموذج |
| تختار بناءً على الاختبارات المنشورة وحدها | لا تفعل. أربعة من ستة بلا مقارنة بالجيل السابق، وأكبر مكسب على اختبار المزوّد نفسه |