وكلاء الذكاء الاصطناعي بعد ثمانية عشر شهراً

قراءة متشككة في LangGraph وOpenAI Assistants v2 وAnthropic computer use وAutogen، إضافةً إلى مشكلة فرانكنشتاين في تسلسل استدعاءات LLM.

من فريق benchr · · عرض سجل التغييرات

أطر عمل مُغطَّاة 4 LangGraph · Assistants · CU · Autogen
الفجوة بين الضجيج والشحن 18 شهراً منذ انطلاق موجة الوكلاء
خط الأساس الأول 1 قارن أي إضافة بوكيل واحد
حدود صارمة مطلوبة دائماً رموز، وقت، إنفاق، إعادة محاولات

بعد ثمانية عشر شهراً على انطلاق موجة الوكلاء في 2024، لا تزال عروض الموردين تركز على سير عمل مستقلة واسعة. نقطة البداية الهندسية الأكثر حذراً هي مهام محدودة وشروط إيقاف صريحة وحدود للرموز والوقت ومفتاح إيقاف بشري. هذا موقف تحريري لإدارة المخاطر، لا وصفاً لكل عملية نشر إنتاجية.

يقارن هذا المقال أربع أطر عمل للوكلاء (LangGraph، وOpenAI Assistants v2، وAnthropic computer use، وMicrosoft Autogen) عبر بنيتها الموثقة وأسطح التحكم المقصودة. التوصيات أدناه فرضيات ينبغي التحقق منها على عبء عملك. في العمل عالي المخاطر، التوصية الافتراضية هي الموافقة البشرية إلى أن يثبت تقييم محدد أن سلوك الإخفاق والتعافي مقبول.

تعتمد موثوقية حلقة الوكيل على النموذج والإطار معاً. يُشكّل الإطار الطوبولوجيا وقابلية الملاحظة والتعافي، لكنه لا يضمن جودة التخطيط عبر استدعاءات الأدوات. اختبر اختيار النموذج منفصلاً: شغّل النماذج المرشحة على الآثار ومخططات الأدوات وشروط الإيقاف نفسها، ثم قارن نجاح المهمة وأخطاء الأدوات والزمن والتكلفة. تُناقش القدرة العامة في مراجعة Opus؛ ولا يعلن هذا المقال فائزاً عاماً للوكلاء.

ما الذي ينبغي استخدام كل إطار من أجله

الأطر الأربعة ليست بدائل مباشرة لبعضها. لكل منها نقطة تصميم مختلفة وملف تكلفة خطأ مختلف. الإطار المناسب لك هو الذي تتطابق نقطة تصميمه مع عبء العمل الذي ستضعه عليه.

ما الذي يفعله الوكيل؟ اختر فرعاً أدناه إجراء عالي المخاطر مال، ثقة، أمان إنسان في الحلقة الوكيل يصيغ، الإنسان يرسل قيّم الإطار والنموذج حلقة إنتاجية منخفض المخاطر، كثيف الحجم LangGraph طوبولوجيا صريحة حدود + مفتاح إيقاف نموذج أولي / عرض السرعة قبل الرؤية Assistants v2 مرشح للنموذج الأولي اختبر سير التصحيح أتمتة واجهة المستخدم بلا سطح API Computer use هش مع الواجهات المتغيرة مناسب للواجهات الثابتة إن أردت إضافة وكيل ثانٍ… جرّب أولاً وكيلاً واحداً أفضل قارنه بخط أساس من وكيل واحد
أداة قرار تحريرية وليست دليلاً معيارياً. استخدم عبء العمل لاختيار مرشحين: طوبولوجيا صريحة ← قيّم LangGraph؛ سرعة النموذج الأولي ← قيّم Assistants v2؛ واجهة بلا API ← قيّم computer use؛ إجراء عالي المخاطر ← اشترط موافقة بشرية. قارن التصميم متعدد الوكلاء بخط أساس من وكيل واحد.

LangGraph: طوبولوجيا صريحة وجاهزية إنتاجية

نقطة تصميم LangGraph هي أن LLM لا يُقرر طوبولوجيا الحلقة؛ أنت تُقررها. الوكيل عبارة عن رسم بياني من العقد (كل عقدة إما استدعاء LLM أو استدعاء أداة أو دالة حتمية) والحواف بينها صريحة. يمنحك الإطار سطح التحكم الذي يُتيح الإبقاء على الحلقة محدودة.

يجعل هذا التصميم LangGraph مرشحاً حين يتطلب العمل حالات وانتقالات ومسارات تعافٍ صريحة. اختبر الملاءمة بتقييم صغير: أدخل مهلة أداة ونتيجة مشوهة وإجراءً مكرراً، ثم تأكد أن الأثر يفسر الإخفاق وأن الرسم يصل إلى حالة نهائية آمنة. إذا كان الوكيل يلمس المال أو بيانات العملاء أو شيئاً مكلف الخطأ، فقيّم تلك الضوابط قبل مقارنة السهولة.

المقايضة المحتملة هي جهد التطوير: قد تتطلب الرسوم الصريحة كود تطبيق أكثر من الحلقة المُدارة. قِس ذلك بدلاً من افتراضه؛ وقّت تنفيذ مهمة صغيرة في كل مرشح وأدخل وقت التصحيح والتعافي في المقارنة.

OpenAI Assistants v2: نموذج أولي سريع، تصحيح أبطأ

التكرار الإنتاجي الحالي من Assistants API من OpenAI أعلى مستوىً من LangGraph. تصف الأدوات والتعليمات؛ المنصة تتولى الحلقة. إنه أقرب شيء في هذا المجال إلى "صِف ما تريد فقط."

الفرضية المطلوب اختبارها هي سرعة النموذج الأولي مقابل التحكم في التصحيح. ابنِ مهمة استدعاء أداة ضيقة نفسها في Assistants v2 والبديل المرشح. سجّل زمن التنفيذ، ثم أدخل نتيجة أداة خاطئة وقارن سرعة كشف السبب ودعم التعافي في كل أثر. اختر من النتائج؛ ولا تفترض أن إطار النموذج الأولي يجب أن يكون إطار الإنتاج.

Anthropic computer use: نوع مختلف من الوكيل

Anthropic computer use فئة مختلفة. بدلاً من استدعاء APIs، يرى الوكيل شاشة افتراضية ويُحرك الماوس ويكتب ويقرأ النتيجة. هذا يُتيح مهام بلا سطح API: تطبيق سطح مكتب، موقع ويب بلا واجهة برمجية نظيفة، منتج موردّ يحتفظ بوظائفه خلف واجهة المستخدم.

يصلح computer use كمرشح حين لا توجد API قابلة للاستخدام، لكن انجراف الواجهة فرضية إخفاق مهمة. اختبره بتغيير التسميات ونقل عناصر التحكم وإظهار نافذة منبثقة وتبديل حجم العرض. قِس الإكمال والنقرات غير الآمنة والتعافي والتدخلات البشرية. إذا وُجد مسار API، فشغّل الحالات نفسها عبره وقارن عبء الصيانة بدلاً من افتراض فوز أحد المسارين.

Microsoft Autogen: فخ تعدد الوكلاء

طرح Autogen هو تعدد الوكلاء. بدلاً من وكيل واحد يفعل كل شيء، يتيح تكوين وكلاء متخصصين يتعاونون. فرضية المخاطر التحريرية هي أن كل تسليم يضيف موضعاً آخر لانحراف الحالة أو النية أو نتيجة الأداة. ليست هذه نتيجة عامة؛ بل شيء ينبغي قياسه.

سمّه اختبار فرانكنشتاين. نفّذ خط أساس من وكيل واحد وتقسيماً متعدد الوكلاء على المهام المحجوزة نفسها. قِس نجاح المهمة النهائية والتسليمات الخاطئة واستدعاءات الأدوات والزمن والتكلفة والتعافي بعد إخفاق مُدخل. احتفظ بالتصميم المتعدد فقط إذا حسّن مقياساً مهماً دون تجاوز حدود السلامة والتكلفة.

المسافة بين عرض يبهر ونشر تثق به دون رقابة هي المشكلة بأكملها. ردمها هو عمل السنتين القادمتين.

أين يقع كل إطار اليوم

فرضيات تحريرية توضيحية فقط؛ أطوال الأشرطة ليست درجات معيارية مقاسة.

LangGraph: الحلقات الإنتاجية المحدودة
قوي
Computer use: أتمتة واجهات ثابتة
جيد
Assistants v2: نماذج أولية وعروض
مقبول
Autogen: إنتاج متعدد الوكلاء
ضعيف
1 خط الأساس الذي يُختبر قبل إضافة عبء التنسيق.

أين تبدأ تقييم الوكلاء

ابدأ بالفئات التي تكون أخطاؤها محدودة وسهلة الرصد. ما يلي أعباء مرشحة، لا ادعاء بأن الوكيل موثوق تلقائياً فيها.

المرشح الأول: التصنيف أو التوجيه عالي الحجم منخفض المخاطر. ابنِ مجموعة محجوزة موسومة، وحدد أقصى معدل خطأ مقبول لكل فئة، وأدخل تكلفة المراجعة البشرية والمحاولات. لا تشحن إلا إذا تفوقت التكلفة الكلية وملف الأخطاء المقاسان على سير العمل الحالي.

المرشح الثاني: استدعاء أداة ضيق النطاق؛ أداة واحدة وقرار واحد وشرط إيقاف واضح. ابحث في التوثيق أو سجل عميل أو بيانات الطقس. اختبر صحة الوسائط وحدود الصلاحيات والتعافي من المهلة وما إذا كان الوكيل يتوقف بعد الاستدعاء المتوقع.

المرشح الثالث: المساعدة مع وجود إنسان في الحلقة. يجهز الوكيل إجراءً ويوافق عليه إنسان أو يرفضه. قِس وقت المراجع ومعدل القبول والأخطاء المتسربة وما إذا كانت شاشة الموافقة تعرض دليلاً كافياً لقرار حقيقي. تناقش منافسة مساعدات البرمجة منتجات تستخدم هذا النمط.

1. رصد الحالة

قراءة العالم (API، قاعدة بيانات، لقطة شاشة).

2. التخطيط والتفكير المنطقي

اللغوي النموذجي LLM يختار الإجراء التالي من قائمة أدوات.

3. تنفيذ استدعاء الأداة

التأثيرات الجانبية تحدث هنا. هذا أين يختفي المال.

4. التكرار أو الإنهاء

تحقق الهدف ← انتهى. وإلا ← الخطوة 1. ضع سقفاً للحلقة.

  1. مارس 2024 LangChain Agents

    الإطار الأول واسع الاستخدام. قوالب استدعاء أدوات أخفت الحلقة.

  2. أغسطس 2024 LangGraph

    طوبولوجيا رسم بياني صريحة وانتقالات قابلة للفحص.

  3. سبتمبر 2024 OpenAI Assistants v2

    API أعلى مستوىً. أسرع للنمذجة الأولية، أصعب تصحيحاً.

  4. أكتوبر 2024 Anthropic computer use

    وكيل يرى شاشة ويستخدم ماوساً ولوحة مفاتيح.

  5. 2025 تعدد الوكلاء في كل مكان

    Autogen وتصاميم مشابهة. قارنها بخط أساس من وكيل واحد.

LangGraph

الإنتاج أفضل تحكم بالطوبولوجيا

Assistants v2

النماذج الأولية مرشح لاختبار الفكرة إلى العرض

Computer use

مهام الواجهة هش مع الواجهات المتغيرة

Autogen

البحث تجارب متعددة الوكلاء

أين ينبغي أن يكون معيار التقييم أعلى

التخطيط طويل المدى. كلما زادت استدعاءات الأدوات المترابطة، اختبر تراكم الأخطاء وقدرة الوكيل على التعافي من حالة وسيطة خاطئة. أنشئ حالات بعواقب متأخرة ونتائج أدوات مفقودة وأدلة متعارضة، ولا تستنتج موثوقية الإنتاج من معيار قصير وحده. تُناقش مشكلة القياس في لماذا توقفت معايير الأداء عن إخبارك بشيء.

الإجراء المستقل عالي المخاطر. حين يكلّف الإجراء الخاطئ مالاً أو ثقةً أو أماناً، ضع حدوداً خاصة بكل درجة خطورة بدلاً من استعارة متوسط نجاح من مهمة منخفضة المخاطر. أبقِ الموافقة البشرية حيث يمكن لإجراء ضار واحد أن يفلت من المراجعة اللاحقة.

الاستكشاف المفتوح. تحتاج المهام بلا شرط إيقاف واضح إلى ميزانيات واختبارات إنهاء صريحة. أعطِ الوكيل عمداً هدفاً غير قابل للتحقق وتأكد أن حدود الرموز والمحاولات واستدعاءات الأدوات والوقت والإنفاق توقف الحلقة بأمان.

ما الذي ينبغي بناؤه، إن كنت تبني

للمطوّر الراغب في التجربة، ابدأ بوكيل واحد ومهمة واحدة وحدود صارمة. تعامل مع LangGraph والنماذج التي يمكنك الوصول إليها كخيارات تقييم لا كفائزين محسومين. أنشئ خط أساس من وكيل واحد يحقق هدف الموثوقية قبل اختبار ما إذا كان الوكيل الثاني يضيف قيمة تبرر تكلفة التنسيق.

فرضيتنا التحريرية أن القيمة القريبة ستأتي من أنظمة محدودة بعناية، لا من جدول زمني ثابت لاستبدال فئات واسعة من العمل المعرفي. هذا توقع غير يقيني؛ والموثوقية والتعافي وتصميم الأدوات هي المتغيرات الجديرة بالمتابعة. تُحوّل مقالة هندسة الأوامر خيارات الأوامر داخل الحلقة إلى بدائل قابلة للاختبار.

ستستمر الأطر والنماذج في التغير. الفرضية المفيدة هي أن توسيع النطاق يضيف مسارات إخفاق؛ اختبرها بتوسيع بُعد واحد كل مرة ورسم النجاح والتعافي والزمن والتكلفة. احتفظ بأضيق نطاق يحقق حاجة المنتج.

الأسئلة الشائعة

أي إطار عمل لوكلاء الذكاء الاصطناعي يجب استخدامه في 2026؟

اختر المرشحين بحسب عبء العمل ثم اختبرهم. يصلح LangGraph كمرشح حين تهم الطوبولوجيا الصريحة، وAssistants v2 حين تهم سرعة النموذج الأولي، وcomputer use حين لا توجد API. قارن أي تصميم متعدد الوكلاء بخط أساس من وكيل واحد قبل اعتماده.

هل وكلاء الذكاء الاصطناعي جاهزون للإنتاج؟

الجاهزية للإنتاج مرتبطة بعبء العمل. ابدأ بمهام محدودة منخفضة المخاطر وبموافقة بشرية. حدّد حالات اختبار محجوزة وحدود الإخفاق والوقت والإنفاق ومسار التراجع قبل السماح بأي أثر جانبي مستقل.

هل تتفوق الوكلاء الفردية على الإعدادات متعددة الوكلاء؟

لا تفترض ذلك. تعامل مع التصميمين الفردي والمتعدد كفرضيتين متنافستين. شغّلهما على المهام المحجوزة نفسها وقارن نجاح المهمة وأخطاء الأدوات والزمن والتكلفة وسلوك التعافي.

كيف أمنع الوكلاء من استنزاف ميزانيتي؟

ضع حدوداً صارمة للرموز والمحاولات واستدعاءات الأدوات والوقت وتكلفة الجلسة والإنفاق اليومي لدى المزوّد. فعّل تنبيهاً قبل كل حد، وأوقف بأمان عند بلوغه، واختبر الضوابط بمهمة تتعمد الدوران.

سجل التغييرات

  • 23 يوليو 2026 — أُعيدت صياغة توصيات البنية كفرضيات تحريرية وخطط تقييم قابلة للتنفيذ؛ وأُزيلت ادعاءات الإجماع والأداء الخاص غير الموثقة؛ ووُحّدت الأسئلة المرئية والمنظمة.
  • 25 مايو 2026 — أُضيفت أقسام تركز على بنية الأطر وشجرة قرار SVG تربط نوع عبء العمل بمرشحي التقييم.
  • 18 مارس 2026 — نُشر أصلاً.

المراجع

  1. LangChain، "LangGraph"، langchain.com/langgraph، بتاريخ مايو 2026.
  2. OpenAI، "Assistants API overview"، platform.openai.com/docs/assistants/overview، بتاريخ مايو 2026.
  3. Anthropic، "Introducing computer use"، anthropic.com/news/3-5-models-and-computer-use، أكتوبر 2024.
  4. Microsoft، "AutoGen"، microsoft.github.io/autogen، بتاريخ مايو 2026.