GPT-5 ضد Claude Opus 4.7: سبعة عوامل لاتخاذ القرار

مقارنة تحريرية لسبع فئات من أعباء العمل، تستند إلى أدلة عامة معلنة لا إلى اختبار خاص غير منشور.

من فريق benchr · · عرض سجل التغييرات

نوع المقارنة تحريرية لا توجد نتيجة خاصة لأعباء العمل
Opus في SWE-bench Verified 87.6% معلن من Anthropic
GPT-5 في SWE-bench Verified 74.9% معلن من OpenAI
فارق سعر الإدخال $5 vs $1.25 Opus / GPT-5 لكل 1M رمز

تقارن هذه المقالة سبع فئات من أعباء العمل: إعادة هيكلة كود، وصفحة هبوط تسويقية، وتفكير تحت عدم اليقين، ومهمة مقيدة بالتعليمات، وملخص ورقة، ورسالة عميل صعبة، وتصحيح Python. تأتي الأدلة من معايير عامة مذكورة مثل SWE-bench Verified وLMArena، ومن تموضع كل مختبر المنشور. لا تقيس المعايير العامة السيناريوهات السبعة مباشرة، ولذلك فالميول أدناه فرضيات تحريرية ينبغي التحقق منها وليست نتائج مقاسة.

مرجع السعر مهم لأن النموذجين يظهران في كل قرار عبء عمل: يُسعّر Claude Opus 4.7 عند $5 لكل مليون رمز إدخال و$25 للإخراج، وفق صفحة أسعار Anthropic. ويُسعّر GPT-5 عند $1.25 و$10 وفق أسعار API من OpenAI. للصورة الكاملة للتكلفة عبر الأعباء، راجع السعر حسب حالة الاستخدام. ولكل نموذج بشروطه الخاصة، راجع مراجعة Opus ومراجعة GPT-5.

ملاحظة تأطير قبل الفئات السبع: هذه عوامل لاتخاذ القرار، وليست سجلاً لسبع جولات خاصة. وحين لا يطابق المعيار العام عبء العمل تماماً توضّح المقالة ذلك. يبقى قرار الشراء القابل للدفاع محتاجاً إلى الأوامر نفسها، وإصدارات وإعدادات مثبتة، وسُلّم تقييم، ومراجعة عمياء على حالات محجوبة من عملك.

الفئة الأولى: إعادة هيكلة تسلسل أصناف

عبء العمل: خذ صنفاً إنتاجياً له خمسة أنواع مشتقة ومخاوف متداخلة، سمّ رائحة التصميم المعماري، واقترح إعادة هيكلة، وأنتج الملفات الجديدة. هذا النوع من العمل هو ما صُمم معيار SWE-bench Verified لقياسه. تعلن Anthropic نسبة 87.6% لـ Opus 4.7، بينما تعلن OpenAI نحو 74.9% لـ GPT-5. هذه أرقام منشورة من المزوّدين وقد تختلف تفاصيل أدوات القياس، ولذلك تفيد في اختيار المرشحين ولا تمثل مقارنة مضبوطة أجراها benchr.

يقدم SWE-bench دليلاً مفيداً على حل مسائل على مستوى المستودع، لكنه لا يثبت كيف سيتعامل أي نموذج مع طلب المعمارية المحدد. استخدم السيناريو اختباراً محلياً: ثبّت الإصدارات والإعدادات، وأخفِ هوية النموذج عن المراجعين، وقيّم الصحة والنطاق غير المطلوب وتغطية الاختبارات وقابلية الصيانة. يجعل الترتيب العام Claude مرشحاً أولياً معقولاً، لا فائزاً مضموناً.

الميل التحريري: ابدأ بـ Claude ثم تحقّق على حالات المستودع نفسها.

الفئة الثانية: كتابة صفحة هبوط تسويقية

عبء العمل: إنتاج موقع تسويقي من صفحة واحدة لجمهور تقني شاب. HTML وCSS بسيطان، أولوية للجوال، وتسلسل طباعي جريء. يؤكد تموضع OpenAI لـ GPT-5 التصميم البصري والمخرجات المنظمة كنقاط قوة. وهذا سبب لإدخاله في التجربة، لا دليلاً على أن الطلب نفسه سيعطي دائماً تخطيطاً أقرب للنشر.

قيّم هذه الفئة بحسب الالتزام بالمتطلبات، والاستجابة للشاشات، وإتاحة الوصول، والتسلسل البصري، والأصالة، ومقدار التعديل البشري المطلوب. شغّل عدة أوامر ورتّب المخرجات عشوائياً للمراجعة البصرية؛ فعينة جميلة واحدة لا تثبت أفضلية على مستوى النموذج.

الميل التحريري: ابدأ بـ GPT-5 للنموذج البصري، ثم راجع مخرجات الاثنين تعميةً.

الفئة الثالثة: التفكير تحت عدم اليقين

عبء العمل: سؤال تنظيمي أو سياساتي محدد، حيث تحتاج الإجابة الصحيحة معرفة بالنص الأساسي ومسار تطبيقه. الإجابة الجيدة تسمي المادة ذات الصلة، وتفصل النص عن طريقة إنفاذه عملياً، وتكون صريحة بشأن حدود ما يستطيع غير المختص تأكيده.

تضع Anthropic نموذج Opus حول الاستدلال المتزن وإظهار عدم اليقين المناسب. تعامل مع هذا الادعاء من المزود كفرضية للاختبار لا كإثبات مستقل. في التقييم عالي المخاطر، أعدّ أسئلة ذات مراجع تحقق منها خبير، وقيّم صحة الاستشهادات، والفصل بين النص وتفسيره، والمعايرة، وطلب المراجعة البشرية في الموضع المناسب.

نمط الفشل الخطير لدى أي من النموذجين هو إجابة شبه صحيحة مع استشهاد مقنع لكنه خاطئ. لا تحل الثقة ولا لغة التحفظ محل التحقق من المصدر؛ لذلك اشترط فحصاً خبيراً أو مدعوماً بالاسترجاع مهما كان النموذج الذي يكتب المسودة.

الميل التحريري: Claude مرشح أول، لكن الاستشهادات المتحققة والمراجعة الخبيرة تحسمان.

الفئة الرابعة: مهمة مقيدة لاتباع التعليمات

عبء العمل: مهمة يومية لها قيد كمي، مثل ميزانية وقت أو وصفة مبنية من مجموعة مكونات ثابتة. السؤال المثير هو أي نموذج يحترم القيد من دون توسيع النطاق.

لا تجيب المعايير العامة بدقة عن هذا السؤال الضيق. ابنِ مجموعة قيود صغيرة بفحوص نجاح وفشل واضحة تشمل الوقت والطول والمدخلات المسموحة والإضافات الممنوعة ومخطط المخرجات. النتيجة المفيدة هي نسبة الالتزام بحسب إصدار النموذج، لا سمعته العامة في الاختصار أو التوسع.

لا فائز مدعوماً بالدليل هنا: استخدم فحوصاً حتمية على قيودك أنت.

الفئة الخامسة: تلخيص ورقة تقنية طويلة

عبء العمل: خذ ورقة تقنية من 60 صفحة وأنتج ملخصاً من 1500 كلمة لمهندس يعرف الأساسيات لكنه لم يقرأها. هناك طريقتان معقولتان للبناء: حسب الأقسام (السير في الورقة بالترتيب) أو حسب الادعاءات (تحديد المساهمات وجلب التجارب الداعمة لكل واحدة).

تعتمد البنية الصحيحة على الجمهور: قد يفضل المهندس الادعاءات والآثار، بينما يحتاج المراجع الأكاديمي تغطية قسماً بقسم. حدّد البنية في الطلب بدلاً من الاعتماد على افتراض عن سلوك النموذج، ثم قيّم التغطية الواقعية مقارنة بمخطط مرجعي أُعد من الورقة.

الخطر الثانوي لدى النموذجين هو ضغط قسم التجارب حين يحمل جوهر حجة الورقة. افحص كل مساهمة وحدّ ونتيجة كمية مقابل المصدر؛ جودة النثر تأتي بعد اكتمال التغطية الواقعية.

الميل التحريري: Claude لمسودة تبدأ بالادعاءات، لكن التغطية المرتبطة بالمصدر هي الحكم.

الفئة السادسة: رسالة عميل صعبة

عبء العمل: سيناريو خدمة عملاء يبدو حقيقياً. عميل يدفع المال غاضب. استغرق إصلاح خطأ وقتاً أطول مما ينبغي. أثر جانبي لاحق مس شيئاً يهم العميل. اكتب رداً يتحمل المسؤولية، ويشرح الموقف من دون أعذار، ويقدم علاجاً محدداً، ويُقرأ كأن إنساناً كتبه.

سمعة أي نموذج في الدفء أو التحفظ أعمّ من أن تحسم هذا العبء. أنشئ أمثلة مجهولة الهوية تعكس سياسة دعمك الحقيقية، واطلب من المراجعين تقييم تحمل المسؤولية والوضوح والوعود المحظورة ودقة التعويض والنبرة. أبقِ موافقة بشرية قبل إرسال أي رسالة.

سجّل قبول المسودة الأولى ووقت المراجعة خلال ذلك التقييم. تستطيع هذه القياسات دعم قرار محلي؛ أما حكاية غير منشورة عن النموذج الذي يصل في المحاولة الأولى أو الثانية فلا تفعل.

الميل التحريري: جرّب Claude أولاً، لكن المراجعة العمياء والالتزام بالسياسة يحسمان.

الفئة السابعة: تصحيح سكربت Python معطوب

عبء عمل محلي مفيد هو سكربت Python أُدخلت فيه أخطاء عمداً، بينها خطأ لا يظهر إلا في أنماط استدعاء async محددة. أخفِ مفتاح الإجابة واطلب من كل إصدار مثبت التشخيص والإصلاح وإضافة اختبارات ارتداد من دون تلميحات.

يوفر SWE-bench Verified دليلاً عاماً ذا صلة، لكنه لا يثبت نتيجة ذلك السكربت الخاص. قيّم الأخطاء المكتشفة والتعديلات الخاطئة وجودة اختبارات الارتداد وما إذا كان النموذج يكشف الغموض بدلاً من التخمين الصامت. كرر ذلك على عدة سكربتات قبل التعميم.

يهم سلوك المرور الأول لأن سير التصحيح الإنتاجي لا يكشف للمراجع ما فاته. سجّله صراحة في سُلّم التقييم واحتفظ بالمخرجات حتى يستطيع مراجع آخر تكرار الاستنتاج.

الميل التحريري: Claude وفق دليل البرمجة العام المذكور؛ ومجموعة الأخطاء المحجوبة لديك هي الحكم.

برمجة المستودعات

جرّب Claude أولاً ميل تحريري من دليل البرمجة العام المذكور

النموذج البصري

جرّب GPT-5 أولاً تموضع المزود؛ راجع محلياً بتعمية

النبرة والتلخيص

شغّل الاثنين لا يحسم معيار عام سُلّمك الخاص
7 عوامل قرار تحريرية؛ بلا نتائج مقارنة خاصة غير منشورة

كيف تستخدم العوامل السبعة

استخدم Claude مرشحاً أولياً حين يكون دليل البرمجة العام المذكور ذا صلة، وأدخل GPT-5 مبكراً حين يطابق العمل البصري أو المخرجات المنظمة تموضع OpenAI المنشور. أما الالتزام بالقيود والتلخيص ونبرة العملاء والاستدلال المتخصص فلا يحسمها السجل العام ولا تسويق المزود لحالتك. تحدد الأقسام السبعة ما ينبغي اختباره وكيفية تقييمه؛ ولا تجمع نتيجة خاصة.

الأسلوب ← الدقة ↑ Claude Opus 4.7 GPT-5 Gemini 3.1 Pro Preview
رسم تموضع تحريري، لا إحداثيات مقاسة. تحقق من المحاور التي تهم عملك.

تفيد مقارنة النماذج حين تخبرك بما تختبره لاحقاً، لا حين تحوّل حكماً تحريرياً إلى نتيجة بلا تفسير.

إعادة هيكلة

Claude ذوق معماري

صفحة هبوط

GPT-5 حس بصري

التفكير

Claude تحفّظ صادق

وصفة

Claude التزام بالقيود

ملخص ورقة

Claude ملاءمة الجمهور

رسالة صعبة

Claude إتقان النبرة

تصحيح سكربت

Claude التقط العلة الخفية
1. حدّد عبء العمل

الصحة التقنية، التصميم البصري، عمل النبرة، المخرجات المنظمة، السياق الطويل، أو الاتساع.

2. اقرأ تموضع المختبر

تنشر Anthropic وOpenAI تموضعاً تفصيلياً. يخبرك المختبر أين يناسب النموذج.

3. راجع السجل العام

استخدم المعايير المنشورة من المزوّد فقط للمهام الضيقة التي تقيسها، وعامل نقاشات المنتديات كإشارات قصصية لا كدليل.

4. تحقّق على عبء عملك

يوفر المعيار دليلاً ضمن شروط محددة، وتحدد أمثلة محجوبة من عبء عملك الملاءمة المحلية.

أي نموذج لأي عمل؟

للكود ذي البنية غير البسيطة، أدخل Claude مبكراً لأن معيار البرمجة المنشور من المزوّد يجعله مرشحاً معقولاً. لا تضمن تلك النتيجة أداءه على مستودعك؛ ثبّت الإصدارات واستخدم مسائل محجوبة وقيّم الصحة والنطاق والاختبارات وقابلية الصيانة تعميةً.

لصفحات الهبوط والعروض ونماذج لوحات التحكم، أدخل GPT-5 لأن تموضع OpenAI المنشور يشدد على العمل البصري والمخرجات المنظمة. قارن المخرجات المجهولة بالمعايير نفسها: الوصول والاستجابة والتسلسل البصري وجهد المراجعة.

لا تسند قراراً قانونياً أو طبياً أو مالياً إلى أي من النموذجين اعتماداً على السمعة. استخدم مصادر تحقق منها خبير، وقيّم صحة الاستشهادات والمعايرة، وأبقِ المراجعة البشرية المؤهلة ضمن مسار الاعتماد.

للكتابة بغير الإنجليزية حين تهم اللهجة أو نبرة جمهور محدد، أنشئ مجموعة مراجعة معماة خاصة باللغة. لا تثبت لوحات الترتيب العامة ولا سمعة النموذج فائزاً لجمهورك؛ وتقدم مقالة المحتوى العربي تصميم اختبار محلياً.

إذا كان عبء عملك كبير الحجم وحساساً للكمون، فأضف مرشحين أقل كلفة مثل Claude Sonnet 4.6 وGPT-5 Mini إلى الاختبار نفسه. قِس الجودة وكمون p50/p95 ومعدل الفشل والتكلفة بعد المراجعة؛ وتشرح مقالة النماذج الصغيرة هذا القرار.

لا توجد قاعدة اشتراك قابلة للدفاع لكل الفرق. ابدأ بتجربة API محدودة أو الخطط الموجودة لديك، واحفظ إصدارات النموذج والمطالبة، ولا تدفع لمزوّد ثانٍ إلا إذا أظهر التقييم المحجوب قيمة مختلفة تتجاوز كلفته الكلية.

أسئلة شائعة

من يفوز بين GPT-5 وClaude Opus 4.7؟

لا يوجد فائز عام. تجعل معايير البرمجة العامة Claude مرشحاً أولياً معقولاً لعمل المستودعات، بينما يجعل تموضع OpenAI المنشور نموذج GPT-5 مرشحاً للعمل البصري والمخرجات المنظمة. تقدم المقالة نقاط بداية تحريرية لا سبع نتائج مقارنة خاصة غير منشورة؛ اختبر الاثنين على عمل محجوب.

هل أشترك في Claude وGPT-5 معاً؟

فقط إذا أظهر تقييم محجوب قيمة مختلفة من الاثنين. ابدأ بتجارب API محدودة أو الخطط الموجودة، وأدخل وقت المراجعة في التكلفة الكلية، ثم أضف المزوّد الثاني عندما تبرر الفائدة المقاسة ذلك.

أيهما أفضل في البرمجة؟

لا يوجد فائز عام في البرمجة. تجعل نتائج SWE-bench المعلنة من المزوّد Claude مرشحاً معقولاً لعمل المستودعات، لكن شروط المختبرين قد تختلف. ثبّت الإصدارين وقيّمهما تعميةً على مسائل محجوبة من مستودعك.

أيهما أفضل في الكتابة؟

لا يثبت الدليل العام فائزاً واحداً في جميع مهام الكتابة. راجع الاثنين تعميةً وفق الصوت المطلوب والدقة الواقعية والالتزام بالتعليمات وجهد التحرير، وبأمثلة من الجمهور المقصود.

أي نموذج أسرع؟

لا يثبت أي مصدر مذكور هنا فائزاً عاماً في السرعة. قِس زمن أول رمز والكمون الكلي بالمنطقة وطبقة المزوّد والمطالبة وطول الإخراج والتزامن وإصداري النموذج نفسها.

سجل التغييرات

  • 23 يوليو 2026 — سُحبت نتيجة المقارنة وأشرطة الملاءمة الرقمية غير المفسرة. أُعيد تأطير الأعباء السبعة كعوامل قرار تحريرية وتصاميم تقييم محلي، من دون ادعاء أن benchr أجرى مقارنة خاصة مباشرة.
  • 25 مايو 2026 — أُعيدت كتابة الأقسام حسب الفئة حتى تستند الأحكام إلى سجل المعايير العام وتموضع كل مختبر المنشور، لا إلى اختبار مختبر خاص. تم التحقق من الأسعار وفق وثائق المزودين الحالية.
  • 30 أبريل 2026 — صُحح مرجع تسعير GPT-5 إلى السعر المنشور: $1.25 للإدخال و$10 للإخراج لكل مليون رمز.
  • 28 أبريل 2026 — نُشرت النسخة الأولى.

المراجع

  1. Anthropic، "وثائق Claude API"، docs.claude.com، اطُّلع عليه في مايو 2026.
  2. Anthropic، "أسعار Claude"، anthropic.com/pricing، اطُّلع عليه في مايو 2026.
  3. OpenAI، "وثائق API"، platform.openai.com/docs، اطُّلع عليه في مايو 2026.
  4. OpenAI، "أسعار API"، openai.com/api/pricing، اطُّلع عليه في مايو 2026.
  5. "لوحة ترتيب Chatbot Arena"، lmarena.ai, May 2026 snapshot.
  6. "لوحة ترتيب SWE-bench Verified"، swebench.com, May 2026.