تقارن هذه المقالة سبع فئات من أعباء العمل: إعادة هيكلة كود، وصفحة هبوط تسويقية، وتفكير تحت عدم اليقين، ومهمة مقيدة بالتعليمات، وملخص ورقة، ورسالة عميل صعبة، وتصحيح Python. تأتي الأدلة من معايير عامة مذكورة مثل SWE-bench Verified وLMArena، ومن تموضع كل مختبر المنشور. لا تقيس المعايير العامة السيناريوهات السبعة مباشرة، ولذلك فالميول أدناه فرضيات تحريرية ينبغي التحقق منها وليست نتائج مقاسة.
مرجع السعر مهم لأن النموذجين يظهران في كل قرار عبء عمل: يُسعّر Claude Opus 4.7 عند $5 لكل مليون رمز إدخال و$25 للإخراج، وفق صفحة أسعار Anthropic. ويُسعّر GPT-5 عند $1.25 و$10 وفق أسعار API من OpenAI. للصورة الكاملة للتكلفة عبر الأعباء، راجع السعر حسب حالة الاستخدام. ولكل نموذج بشروطه الخاصة، راجع مراجعة Opus ومراجعة GPT-5.
ملاحظة تأطير قبل الفئات السبع: هذه عوامل لاتخاذ القرار، وليست سجلاً لسبع جولات خاصة. وحين لا يطابق المعيار العام عبء العمل تماماً توضّح المقالة ذلك. يبقى قرار الشراء القابل للدفاع محتاجاً إلى الأوامر نفسها، وإصدارات وإعدادات مثبتة، وسُلّم تقييم، ومراجعة عمياء على حالات محجوبة من عملك.
الفئة الأولى: إعادة هيكلة تسلسل أصناف
عبء العمل: خذ صنفاً إنتاجياً له خمسة أنواع مشتقة ومخاوف متداخلة، سمّ رائحة التصميم المعماري، واقترح إعادة هيكلة، وأنتج الملفات الجديدة. هذا النوع من العمل هو ما صُمم معيار SWE-bench Verified لقياسه. تعلن Anthropic نسبة 87.6% لـ Opus 4.7، بينما تعلن OpenAI نحو 74.9% لـ GPT-5. هذه أرقام منشورة من المزوّدين وقد تختلف تفاصيل أدوات القياس، ولذلك تفيد في اختيار المرشحين ولا تمثل مقارنة مضبوطة أجراها benchr.
يقدم SWE-bench دليلاً مفيداً على حل مسائل على مستوى المستودع، لكنه لا يثبت كيف سيتعامل أي نموذج مع طلب المعمارية المحدد. استخدم السيناريو اختباراً محلياً: ثبّت الإصدارات والإعدادات، وأخفِ هوية النموذج عن المراجعين، وقيّم الصحة والنطاق غير المطلوب وتغطية الاختبارات وقابلية الصيانة. يجعل الترتيب العام Claude مرشحاً أولياً معقولاً، لا فائزاً مضموناً.
الميل التحريري: ابدأ بـ Claude ثم تحقّق على حالات المستودع نفسها.
الفئة الثانية: كتابة صفحة هبوط تسويقية
عبء العمل: إنتاج موقع تسويقي من صفحة واحدة لجمهور تقني شاب. HTML وCSS بسيطان، أولوية للجوال، وتسلسل طباعي جريء. يؤكد تموضع OpenAI لـ GPT-5 التصميم البصري والمخرجات المنظمة كنقاط قوة. وهذا سبب لإدخاله في التجربة، لا دليلاً على أن الطلب نفسه سيعطي دائماً تخطيطاً أقرب للنشر.
قيّم هذه الفئة بحسب الالتزام بالمتطلبات، والاستجابة للشاشات، وإتاحة الوصول، والتسلسل البصري، والأصالة، ومقدار التعديل البشري المطلوب. شغّل عدة أوامر ورتّب المخرجات عشوائياً للمراجعة البصرية؛ فعينة جميلة واحدة لا تثبت أفضلية على مستوى النموذج.
الميل التحريري: ابدأ بـ GPT-5 للنموذج البصري، ثم راجع مخرجات الاثنين تعميةً.
الفئة الثالثة: التفكير تحت عدم اليقين
عبء العمل: سؤال تنظيمي أو سياساتي محدد، حيث تحتاج الإجابة الصحيحة معرفة بالنص الأساسي ومسار تطبيقه. الإجابة الجيدة تسمي المادة ذات الصلة، وتفصل النص عن طريقة إنفاذه عملياً، وتكون صريحة بشأن حدود ما يستطيع غير المختص تأكيده.
تضع Anthropic نموذج Opus حول الاستدلال المتزن وإظهار عدم اليقين المناسب. تعامل مع هذا الادعاء من المزود كفرضية للاختبار لا كإثبات مستقل. في التقييم عالي المخاطر، أعدّ أسئلة ذات مراجع تحقق منها خبير، وقيّم صحة الاستشهادات، والفصل بين النص وتفسيره، والمعايرة، وطلب المراجعة البشرية في الموضع المناسب.
نمط الفشل الخطير لدى أي من النموذجين هو إجابة شبه صحيحة مع استشهاد مقنع لكنه خاطئ. لا تحل الثقة ولا لغة التحفظ محل التحقق من المصدر؛ لذلك اشترط فحصاً خبيراً أو مدعوماً بالاسترجاع مهما كان النموذج الذي يكتب المسودة.
الميل التحريري: Claude مرشح أول، لكن الاستشهادات المتحققة والمراجعة الخبيرة تحسمان.
الفئة الرابعة: مهمة مقيدة لاتباع التعليمات
عبء العمل: مهمة يومية لها قيد كمي، مثل ميزانية وقت أو وصفة مبنية من مجموعة مكونات ثابتة. السؤال المثير هو أي نموذج يحترم القيد من دون توسيع النطاق.
لا تجيب المعايير العامة بدقة عن هذا السؤال الضيق. ابنِ مجموعة قيود صغيرة بفحوص نجاح وفشل واضحة تشمل الوقت والطول والمدخلات المسموحة والإضافات الممنوعة ومخطط المخرجات. النتيجة المفيدة هي نسبة الالتزام بحسب إصدار النموذج، لا سمعته العامة في الاختصار أو التوسع.
لا فائز مدعوماً بالدليل هنا: استخدم فحوصاً حتمية على قيودك أنت.
الفئة الخامسة: تلخيص ورقة تقنية طويلة
عبء العمل: خذ ورقة تقنية من 60 صفحة وأنتج ملخصاً من 1500 كلمة لمهندس يعرف الأساسيات لكنه لم يقرأها. هناك طريقتان معقولتان للبناء: حسب الأقسام (السير في الورقة بالترتيب) أو حسب الادعاءات (تحديد المساهمات وجلب التجارب الداعمة لكل واحدة).
تعتمد البنية الصحيحة على الجمهور: قد يفضل المهندس الادعاءات والآثار، بينما يحتاج المراجع الأكاديمي تغطية قسماً بقسم. حدّد البنية في الطلب بدلاً من الاعتماد على افتراض عن سلوك النموذج، ثم قيّم التغطية الواقعية مقارنة بمخطط مرجعي أُعد من الورقة.
الخطر الثانوي لدى النموذجين هو ضغط قسم التجارب حين يحمل جوهر حجة الورقة. افحص كل مساهمة وحدّ ونتيجة كمية مقابل المصدر؛ جودة النثر تأتي بعد اكتمال التغطية الواقعية.
الميل التحريري: Claude لمسودة تبدأ بالادعاءات، لكن التغطية المرتبطة بالمصدر هي الحكم.
الفئة السادسة: رسالة عميل صعبة
عبء العمل: سيناريو خدمة عملاء يبدو حقيقياً. عميل يدفع المال غاضب. استغرق إصلاح خطأ وقتاً أطول مما ينبغي. أثر جانبي لاحق مس شيئاً يهم العميل. اكتب رداً يتحمل المسؤولية، ويشرح الموقف من دون أعذار، ويقدم علاجاً محدداً، ويُقرأ كأن إنساناً كتبه.
سمعة أي نموذج في الدفء أو التحفظ أعمّ من أن تحسم هذا العبء. أنشئ أمثلة مجهولة الهوية تعكس سياسة دعمك الحقيقية، واطلب من المراجعين تقييم تحمل المسؤولية والوضوح والوعود المحظورة ودقة التعويض والنبرة. أبقِ موافقة بشرية قبل إرسال أي رسالة.
سجّل قبول المسودة الأولى ووقت المراجعة خلال ذلك التقييم. تستطيع هذه القياسات دعم قرار محلي؛ أما حكاية غير منشورة عن النموذج الذي يصل في المحاولة الأولى أو الثانية فلا تفعل.
الميل التحريري: جرّب Claude أولاً، لكن المراجعة العمياء والالتزام بالسياسة يحسمان.
الفئة السابعة: تصحيح سكربت Python معطوب
عبء عمل محلي مفيد هو سكربت Python أُدخلت فيه أخطاء عمداً، بينها خطأ لا يظهر إلا في أنماط استدعاء async محددة. أخفِ مفتاح الإجابة واطلب من كل إصدار مثبت التشخيص والإصلاح وإضافة اختبارات ارتداد من دون تلميحات.
يوفر SWE-bench Verified دليلاً عاماً ذا صلة، لكنه لا يثبت نتيجة ذلك السكربت الخاص. قيّم الأخطاء المكتشفة والتعديلات الخاطئة وجودة اختبارات الارتداد وما إذا كان النموذج يكشف الغموض بدلاً من التخمين الصامت. كرر ذلك على عدة سكربتات قبل التعميم.
يهم سلوك المرور الأول لأن سير التصحيح الإنتاجي لا يكشف للمراجع ما فاته. سجّله صراحة في سُلّم التقييم واحتفظ بالمخرجات حتى يستطيع مراجع آخر تكرار الاستنتاج.
الميل التحريري: Claude وفق دليل البرمجة العام المذكور؛ ومجموعة الأخطاء المحجوبة لديك هي الحكم.
برمجة المستودعات
جرّب Claude أولاً ميل تحريري من دليل البرمجة العام المذكورالنموذج البصري
جرّب GPT-5 أولاً تموضع المزود؛ راجع محلياً بتعميةالنبرة والتلخيص
شغّل الاثنين لا يحسم معيار عام سُلّمك الخاصكيف تستخدم العوامل السبعة
استخدم Claude مرشحاً أولياً حين يكون دليل البرمجة العام المذكور ذا صلة، وأدخل GPT-5 مبكراً حين يطابق العمل البصري أو المخرجات المنظمة تموضع OpenAI المنشور. أما الالتزام بالقيود والتلخيص ونبرة العملاء والاستدلال المتخصص فلا يحسمها السجل العام ولا تسويق المزود لحالتك. تحدد الأقسام السبعة ما ينبغي اختباره وكيفية تقييمه؛ ولا تجمع نتيجة خاصة.
تفيد مقارنة النماذج حين تخبرك بما تختبره لاحقاً، لا حين تحوّل حكماً تحريرياً إلى نتيجة بلا تفسير.
إعادة هيكلة
Claude ذوق معماريصفحة هبوط
GPT-5 حس بصريالتفكير
Claude تحفّظ صادقوصفة
Claude التزام بالقيودملخص ورقة
Claude ملاءمة الجمهوررسالة صعبة
Claude إتقان النبرةتصحيح سكربت
Claude التقط العلة الخفيةالصحة التقنية، التصميم البصري، عمل النبرة، المخرجات المنظمة، السياق الطويل، أو الاتساع.
تنشر Anthropic وOpenAI تموضعاً تفصيلياً. يخبرك المختبر أين يناسب النموذج.
استخدم المعايير المنشورة من المزوّد فقط للمهام الضيقة التي تقيسها، وعامل نقاشات المنتديات كإشارات قصصية لا كدليل.
يوفر المعيار دليلاً ضمن شروط محددة، وتحدد أمثلة محجوبة من عبء عملك الملاءمة المحلية.
أي نموذج لأي عمل؟
للكود ذي البنية غير البسيطة، أدخل Claude مبكراً لأن معيار البرمجة المنشور من المزوّد يجعله مرشحاً معقولاً. لا تضمن تلك النتيجة أداءه على مستودعك؛ ثبّت الإصدارات واستخدم مسائل محجوبة وقيّم الصحة والنطاق والاختبارات وقابلية الصيانة تعميةً.
لصفحات الهبوط والعروض ونماذج لوحات التحكم، أدخل GPT-5 لأن تموضع OpenAI المنشور يشدد على العمل البصري والمخرجات المنظمة. قارن المخرجات المجهولة بالمعايير نفسها: الوصول والاستجابة والتسلسل البصري وجهد المراجعة.
لا تسند قراراً قانونياً أو طبياً أو مالياً إلى أي من النموذجين اعتماداً على السمعة. استخدم مصادر تحقق منها خبير، وقيّم صحة الاستشهادات والمعايرة، وأبقِ المراجعة البشرية المؤهلة ضمن مسار الاعتماد.
للكتابة بغير الإنجليزية حين تهم اللهجة أو نبرة جمهور محدد، أنشئ مجموعة مراجعة معماة خاصة باللغة. لا تثبت لوحات الترتيب العامة ولا سمعة النموذج فائزاً لجمهورك؛ وتقدم مقالة المحتوى العربي تصميم اختبار محلياً.
إذا كان عبء عملك كبير الحجم وحساساً للكمون، فأضف مرشحين أقل كلفة مثل Claude Sonnet 4.6 وGPT-5 Mini إلى الاختبار نفسه. قِس الجودة وكمون p50/p95 ومعدل الفشل والتكلفة بعد المراجعة؛ وتشرح مقالة النماذج الصغيرة هذا القرار.
لا توجد قاعدة اشتراك قابلة للدفاع لكل الفرق. ابدأ بتجربة API محدودة أو الخطط الموجودة لديك، واحفظ إصدارات النموذج والمطالبة، ولا تدفع لمزوّد ثانٍ إلا إذا أظهر التقييم المحجوب قيمة مختلفة تتجاوز كلفته الكلية.