أطلقت Z.AI GLM-5.3 على خدماتها المستضافة في 14 أغسطس 2026، وتفصل benchr بين المسار الحي وإصدار الأوزان المستقبلي المعلن.
اسم النموذج يغطي قرارين مختلفين. الأول شراء خدمة مستضافة يمكنك اختبارها اليوم. الثاني انتظار أوزان للاستضافة الذاتية لم تُنشر بعد. إذا كتبت «متاح» فقط في مذكرة الشراء، ستخفي هذا الفرق، وقد يوافق فريق الامتثال على مسار لا يحقق شرطه الأساسي.
حدّد المنتج قبل تقييم النموذج
| الاحتياج | الدليل الحالي | القرار |
|---|---|---|
| برمجة أو وكيل عبر خدمة مستضافة | Z.AI API وCoding Plan يعملان الآن | يستحق تجربة مضبوطة |
| استضافة ذاتية أو نسخ الأوزان إلى سجل داخلي | الأوزان معلنة لإصدار لاحق بعد التقوية | انتظر الملف والترخيص الرسميين |
| طلب يعطّل الاستدلال | الاستدلال دائم في GLM-5.3 | أصلح الطلب قبل تبديل المعرّف |
| عميل يستخدم صيغة OpenAI أو Anthropic | ثلاثة بروتوكولات متوافقة موثقة | اختبر الـadapter نفسه الذي سيعمل في الإنتاج |
| فهم صورة أو صوت | الواجهة المسجلة نصية في الاتجاهين | استخدم نموذجاً آخر لهذه المرحلة |
هذه البوابة لا تمنح النموذج درجة جودة. هي تمنع تجربة غير صالحة من البداية. التوافق لا يثبت نجاح مهمة برمجية، ووعد الأوزان لا يحقق شرط on-premises حتى يظهر الملف ويمكن تدقيقه.
للتوفر حالتان مختلفتان
المعرّف glm-5.3 يعمل عبر API وCoding Plan. وتقول المدونة إن الأوزان ستأتي بعد فترة تقوية أمان. لا تخلط الحالتين: الوصول المستضاف حي، أما الاستضافة الذاتية فتحتاج ملفاً منشوراً وترخيصاً. ستغيّر benchr الحالة عندما يظهر الإصدار الرسمي.
تحسين بعد التدريب لا قاعدة جديدة
تقول Z.AI إن GLM-5.3 يستخدم قاعدة 5.2 نفسها وينسب التحسن إلى تدريب لاحق للبرمجة والوكلاء. يسجل جدولها 28.3 في Terminal-Bench 3.0 و66.9 في DeepSWE v1.1. احتفظ باسم النسخة واختبر البناء والاختبارات والفحص الأمني والرقع المقبولة.
التوافق يقلل كلفة الترحيل لا كلفة التقييم
تسجل الوثائق توافق Chat Completions وResponses وAnthropic Messages، مع البث والدوال والتخزين والمخرجات المنظمة. الاستدلال دائم بمستويات low وhigh وmax والافتراضي max. أعد تشغيل معاملات طلباتك وقس حجم الإخراج قبل تغيير المسار.
توافق البروتوكول فحص للـadapter فقط
اكتب شكل الاتصال الحالي قبل تغيير اسم النموذج: endpoint الطلب، وأحداث streaming، وتعريف الأدوات، وقيود structured output، وحقول الكاش، ومعالجة الأخطاء، وإعداد الاستدلال. توضح تعليمات الإطلاق أن الطلب الذي يعطّل التفكير يجب أن ينتقل إلى enabled ومستوى مدعوم قبل استخدام معرّف GLM-5.3. وإلا ستفشل الدعوة بدلاً من أن ترث سلوكاً قديماً.
أعد الاختبار عبر البروتوكول الذي سيصل إلى الإنتاج. نجاح مثال على Chat Completions لا يختبر Responses أو Anthropic Messages. افحص أسماء الدوال وبنية arguments وأحداث البث وكيف يقرأ عميلك المخطط النهائي. هنا تظهر أخطاء الترحيل التي لا يلتقطها تشابه الـAPI على الورق.
اختبر وحدة عمل كاملة
- اختر مهاماً لها جواب مقبول معروف. استخدم issues مغلقة تمثل إصلاحاً أو refactor أو تغيير اختبار أو تحقيقاً يستدعي أداة. تجنب البرومبت الجميل الذي لا يملك شرط نجاح.
- ثبّت البيئة. سجّل حالة المستودع والتعليمات وصلاحيات الأدوات والإصدارات وسياسة المهلة. لا تمنح النموذج أسراراً أو أوامر مدمرة ليبرهن أنه يعمل.
- سمّ مستوى الاستدلال. اختبر المستوى الذي تنوي تشغيله. لا تجمع نتائج low وhigh وmax في حكم واحد، لأن السلوك وحجم الإخراج قد يختلفان.
- قيّم الناتج لا الشرح. راجع نتيجة build والاختبارات وحدود التعديل والالتزام بالتعليمات والفحص الأمني وتدخل المهندس وفشل الأدوات وتكلفة الإخراج. كلام مقنع من دون patch مقبول يعد فشلاً.
- اترك الرجوع جاهزاً. مرر فقط أنواع المهام التي نجحت، واحتفظ بالـendpoint السابق حتى تختبر التنبيهات والأخطاء والرجوع.
يمكنك وضع المخرجات والـrubric في مختبر benchr، ثم نقل استهلاك التوكنات الفعلي إلى الحاسبة. هذا لا يغني عن اختبارات المستودع أو حاجز الأمان أو مراجعة الفريق المسؤول عن الكود.
بوابة مستقلة لإصدار الأوزان
أبقِ خطة الاستضافة الذاتية متوقفة إلى أن تنشر Z.AI الملفات فعلياً. عندها تحقق من حساب الجهة الناشرة، وبصمات الملفات، ونص الترخيص، وبطاقة النموذج، ومتطلبات التشغيل، وإرشادات الأمان قبل إدخال أي ملف إلى السجل الداخلي. بعد ذلك أعد مجموعة العمل نفسها على النسخة المستضافة والنسخة التي ستشغلها. تطابق الاسم لا يثبت تطابق الملف أو السلوك.
متى تختاره ومتى ترفضه
اختر GLM-5.3 لتجربة مستضافة في البرمجة أو الوكلاء عندما يلائم السياق النصي الطويل، واستدعاء الأدوات، والمخرجات المنظمة، والـadapter الموثق تطبيقك. ويصبح خياراً عملياً عندما يستطيع فريقك قياس أثر الاستدلال الدائم على التكلفة وزمن المهمة.
ارفض الالتزام به إذا كانت الاستضافة الذاتية مطلوبة الآن، أو كان التطبيق يحتاج تعطيل الاستدلال، أو كانت المهمة تعتمد على صورة أو صوت. ولا تستبدل اختبار المستودع بجدول بنشمارك من المزوّد. إذا فشل الـadapter أو لم يقبل الفريق الناتج، ابقَ على المسار الحالي مهما بدا السعر جيداً.
حدود الدليل
نتائج البنشماركات في الصفحة منشورة من Z.AI وليست قياسات مستقلة من benchr. لم تنشر benchr مخرجات للنموذج أو تشغيل برمجة خاصاً أو درجة من اختبار داخلي. الخطة أعلاه طريقة قابلة للتكرار لفريقك؛ وأي حكم على الأداء يجب أن يسمي البروتوكول ومستوى الاستدلال وحالة المستودع والـrubric والملفات المقبولة.
| الحقل | السجل المثبت |
|---|---|
| معرّف API | glm-5.3 |
| إدخال / إخراج / مخزن | $1.40 / $4.40 / $0.26 لكل 1M |
| السياق / الإخراج | 1,000,000 / 128,000 توكن |
| الاستدلال | دائم؛ low وhigh وmax؛ والافتراضي max |