أطلقت Anthropic Claude Opus 4.8 في 28 مايو 2026، وفق إعلان الإطلاق. ما هو غير معتاد هو التوقيت: Opus 4.7 وصل في منتصف أبريل، إذن هذا دوران في غضون ستة أسابيع تقريباً، أسرع من الوتيرة المعتادة للشركة. السعر لم يتحرك. الأسعار القياسية لا تزال $5 لكل مليون رمز مدخل و$25 لكل مليون رمز مخرج، نفس الأرقام التي حملها Opus 4.7.
إذن هذه ليست قفزة جيلية، وAnthropicلا تقدّمها كذلك. إنها تجديد في المكان: قائمة الترتيب ترتفع بضع نقاط، يصبح النموذج أكثر ثباتاً في العمل الأتمتي الطويل، ويُصقل الحواف الخشنة. الجزء المثير مدفون تحت رسم معيار الأداء، وهو الشيء الأصعب قياساً: أصبح النموذج أكثر صدقاً.
فيما يلي ما تقوله الأدلة العامة، مستمدة من إعلان Anthropic وتوثيق نموذج Claude، مع الإشارة إلى الأرقام التي تأتي مع حاشية يجب قراءتها قبل اقتباسها.
قائمة الترتيب تحركت قليلاً
لدى Opus 4.8 الرقم الأعلى في ستة من سبعة صفوف في مقارنة إطلاق Anthropic. وتبلغ نتيجة SWE-bench Pro 69.2% مقابل 64.3% لـOpus 4.7. هذه نتائج منشورة من المزوّد تحت إعدادات بنشمارك محددة، وليست إثباتًا لتصدر عام أو ميزة جودة إنتاجية.
| معيار الأداء | Opus 4.8 | Opus 4.7 |
|---|---|---|
| SWE-bench Pro (برمجة أتمتية) | 69.2% | 64.3% |
| SWE-bench Verified | 88.6% | 87.6% |
| Humanity's Last Exam (بدون أدوات) | 49.8% | 46.9% |
| GPQA Diamond | 93.6% | 94.2% |
اقرأ صف GPQA Diamond بأمانة: Opus 4.8 ينخفض نصف نقطة عن 4.7. معيار الأداء هذا قريب من السقف، حيث تندرج تأرجحة ستة أعشار ضمن الضجيج ولا تخبرك شيئاً عن أي نموذج أذكى. نفس القصة على SWE-bench Verified، حيث الارتفاع بنقطة إلى 88.6% حالة من التشبع أكثر من كونه قصة قدرة. جادل benchr بأن معايير الأداء المتشبّعة توقفت عن التمييز بين النماذج الحدّية، وهذا الإطلاق مثال واضح.
على أرقام أسلوب الوكيل، يُسجّل Opus 4.8 83.4% على OSWorld-Verified، أعلى نتيجة على معيار أداء استخدام الحاسوب ذلك. تحفظ يجب معرفته: قامت Anthropic بتحديث منظومة الاختبار لهذه الجولة وأعادت توضيح نتيجة Opus 4.7 إلى الأعلى في مطلع الثمانينيات، لذا جزء من القفز الظاهر هو إعداد التقييم الجديد لا النموذج. تُفيد الشركة بذلك في الإعلان وهي الطريقة الصحيحة للإبلاغ. في العمل المعرفي، GDPval-AA Elo عند 1890 إشارة أوضح، يجلس 121 نقطة أمام GPT-5.5.
أين يخسر
يوجد بالضبط معيار أداء واحد في الجدول حيث يأتي Opus 4.8 ثانياً، ويستحق التسمية. على Terminal-Bench 2.1، اختبار حلقات وكيل سطر الأوامر، يُسجّل Opus 4.8 74.6% ويتصدر GPT-5.5 بنسبة 78.2%. إذا كان عبء عملك اليومي نموذجاً يُشغّل شل، يُشغّل أوامر، يقرأ المخرجات ويعيد المحاولة، فهذا المكان الوحيد الذي لا يزال فيه منافس في الصدارة.
الفجوة ضيقة وعبء العمل ضيق، لكنها حقيقية، وهي أنظف سبب لعدم افتراض أن Opus 4.8 يفوز في كل شيء. لمعظم البرمجة، معايير أداء البرمجة الأتمتية التي يهيمن عليها Opus هي الوكيل الأفضل. للقيادة الطرفية الصرفة، اختبر كليهما على إعدادك الخاص قبل الالتزام.
الصدق هو الترقية المهمة
الرقم الذي يجب أن يغير طريقة عملك ليس على قائمة الترتيب. تُفيد Anthropic بأن Opus 4.8 أقل احتمالاً بنحو أربع مرات من 4.7 للسماح لخلل في الكود بالمرور دون الإشارة إليه. السلوك غير المتوافق — النوع الذي يتماشى فيه النموذج مع خطة سيئة أو يتستر على مشكلة ليبدو مفيداً — ينخفض إلى معدلات تضعها الشركة قريبة من نموذجها Mythos preview المقيَّد.
عملياً يظهر كنموذج يطرح السؤال الصحيح قبل الكتابة، يكتشف الخطأ في الفهرس الذي فاتك، ويتراجع عندما الخطة التي سلّمته إياها لا تتماسك. هذه علاقة مختلفة عن "الإكمال التلقائي السريع الذي يوافقك". إنها تتوافق أيضاً مع المسار الذي يتجه إليه المجال، بعيداً عن القدرة الخام ونحو ما إذا كان يمكنك تسليم الشيء مهمة والابتعاد. تقرير benchr الميداني عن وكلاء الذكاء الاصطناعي استمر في الاصطدام بنفس الجدار: القدرة لم تكن الحاجز أبداً، الثقة كانت.
ما صدر مصاحباً له
جاء النموذج مع بعض تغييرات المنصة الجديرة بالمعرفة. العنوان الرئيسي هو Dynamic Workflows، ميزة معاينة بحثية في Claude Code يخطط فيها Opus 4.8 لمهمة كبيرة، يوزّع وكلاء فرعيين متوازيين يهاجمونها من زوايا مستقلة، ويجعلهم يتحقق بعضهم من بعض قبل الإبلاغ. تستهدف الوظائف بحجم ترحيل قاعدة كود كاملة — النوع الذي لا يتناسب مع نافذة سياق واحدة.
تغييران أصغر مهمان لأي شخص يبني على API. التحكم في الجهد الآن متاح في claude.ai وCowork، لا في API فقط، لذا يمكنك ضبط عمق التفكير المنطقي يدوياً. وMessages API ستقبل الآن تعليمة نظام محدّثة في منتصف مهمة طويلة دون إعادة صياغة الأمر كله، مما يُبقي ضرباتك في ذاكرة التخزين المؤقت للأمر سليمة ويُقلل تكلفة المدخلات في حلقات الوكيل الطويلة.
ما يكلّفه، وحسابات الوضع السريع
لا شيء تغيّر على المستوى القياسي. تدفع $5 لكل مليون مدخل و$25 لكل مليون مخرج، مع مدخل مخزّن مؤقتاً بعُشر ذلك وخصم 50% على الدُفعات للوظائف غير المتزامنة. الرافعة الجديدة هي الوضع السريع: مقابل ضعفي سعر الرمز، $10 مدخل و$50 مخرج، يعمل النموذج بنحو 2.5× سرعة المخرجات. العنوان هنا أن الوضع السريع أرخص ثلاث مرات مما كان عليه في جيل Opus السابق، حيث كان نفس التسريع يُكلّف $30 و$150.
الوضع السريع يشتري لك الكمون لا نموذجاً أذكى، لذا الجأ إليه في العمل التفاعلي حيث ينتظر مستخدم، لا في الوظائف الدُفعية حيث تُفضّل الخصم 50%. للسؤال الأشمل عن أي مستوى Anthropic تتخذ افتراضياً، مراجعة Sonnet 4.6 تُفصّل أين يكون النموذج الأرخص هو الاختيار الصحيح. Opus هو المستوى الذي ترتقي إليه، لا الذي تُشغّل كل شيء عليه.
الحكم
Claude Opus 4.8 مرشح للترحيل لأن سعر التوكن المدرج يطابق 4.7 وتفيد Anthropic بعدة مكاسب في البنشمارك. تشابه شكل API لا يضمن تطابق السلوك، ونتيجة مراجعة الكود المنشورة من المزوّد لا تبرر التبديل وحدها. شغّل اختبارات انحدار ذات إصدارات قبل الترحيل.
أبقِ 4.7 أو استبدله وفق نتائج المهام المقاسة والكمون والانحدارات وجهد الترحيل. تساوي سعر التوكن لا يجعل الترحيل مجانيًا، وفجوات البنشمارك لا تثبت أن المستخدمين سيلاحظون فرقًا.
الأسئلة الشائعة
هل يستحق الترقية إلى Claude Opus 4.8 من Opus 4.7؟
هو مرشح للترحيل لا ترقية تلقائية. يطابق سعره المدرج 5$/25$ سعر 4.7 وتفيد Anthropic بأرقام أعلى في معظم الصفوف، لكن الترحيل يظل بحاجة إلى اختبار انحدار. بدّل فقط حيث تُظهر المهام المتطابقة مكسبًا مفيدًا بعد احتساب الكمون والأخطاء وجهد الترحيل.
ما تكلفة Claude Opus 4.8؟
الأسعار القياسية هي $5 لكل مليون رمز مدخل و$25 لكل مليون رمز مخرج، دون تغيير عن Opus 4.7. الوضع السريع الاختياري يعمل بنحو 2.5× سرعة المخرجات مقابل $10 مدخل و$50 مخرج لكل مليون، أرخص ثلاث مرات من الوضع السريع في جيل Opus السابق.
بكم يفوق Opus 4.8 في البرمجة على 4.7؟
تفيد Anthropic بنتيجة 69.2% مقابل 64.3% على SWE-bench Pro و88.6% مقابل 87.6% على SWE-bench Verified. لا تحدد هذه الفجوات فرق جودة البرمجة في مستودعك؛ شغّل مهامًا متطابقة بمعايير نجاح ثابتة.
ما هو تحسّن الصدق في Claude Opus 4.8؟
تفيد Anthropic بأن النموذج كان أقل احتمالًا بنحو أربع مرات من Opus 4.7 للسماح بمرور خلل في تقييمها. هذه نتيجة من المزوّد وليست ضمانًا لمراجعة الكود الإنتاجي. أعد إنتاجها بقياس العيوب الفائتة والإيجابيات الكاذبة والشدة ووقت المراجعة.
ما هي Dynamic Workflows في Claude Opus 4.8؟
ميزة معاينة بحثية في Claude Code يخطط فيها النموذج لمهمة كبيرة، يولّد وكلاء فرعيين متوازيين يقتربون من المشكلة من زوايا مستقلة، ويتحقق من مخرجاتهم ببعضها قبل الإبلاغ. تستهدف الوظائف بحجم ترحيل قاعدة كود كاملة.
سجل التغييرات
- 24 يوليو 2026 — استُبدلت ادعاءات الترقية التلقائية والتصدر والتوافق والجودة المضمونة بإسناد للمزوّد وإرشاد إلى اختبارات انحدار متطابقة، مع مزامنة الأسئلة الشائعة.
- 30 مايو 2026 — نُشر أصلاً، بعد يومين من إصدار النموذج. الأسعار ونتائج معايير الأداء وادعاءات الميزات مُتحقَّق منها مقابل إعلان إطلاق Anthropic وتوثيق نموذج Claude.
المراجع
- Anthropic، "Introducing Claude Opus 4.8"، anthropic.com/news/claude-opus-4-8، 28 مايو 2026.
- Anthropic، "What's new in Claude Opus 4.8"، platform.claude.com، وصول مايو 2026.
- Anthropic، "Models overview"، platform.claude.com، وصول مايو 2026.
- Anthropic، "Pricing"، platform.claude.com، وصول مايو 2026.
- "متصدر SWE-benchboards"، swebench.com، مايو 2026.