فعله أحدهم

في أصعب مهام الويب، ينهي البشر 10%. وأفضل وكيل ينهي 8%.

نقلًا عن Zejun Xu and colleagues9 أغسطس 2026لم يختبره benchr

ما الذي حدث

اختبار CAP، المنشور على arXiv يوم 9 أغسطس 2026، يضم 420 مهمة عابرة للمواقع على 108 مواقع حقيقية في 24 مجالًا، مبنية حول تفاعلات تتطلب فهمًا بصريًا حقيقيًا لا مجرد ملء نماذج. نسب النجاح الكامل: Manus 8.0%، و Fellou 7.0%، و Comet 6.0%، و Genspark 5.0%، و Claude-4.5-Sonnet 5.0%، و Dia 4.0%، و DeepSeek-V4-Flash 2.9%، و GPT-5 2.0%، مقابل خط أساس بشري 10.0%. أما في الإنجاز الجزئي فتتّسع الصورة: البشر 35.0%، و Comet 48.0%، و Manus 23.0%.

كيف أُنجز

  1. الداخل420 مهمة، و108 مواقع حقيقية، و24 مجالًا
  2. ثممقسّمة إلى أفعال معقّدة وإدراك معقّد
  3. ثمثمانية وكلاء وخط أساس بشري على المجموعة نفسها
  4. الخارجالإدراك لا التحكّم هو الفشل الغالب
اقرأ الورقة

ما الذي لا يثبته هذا

  • ورقة أوّلية لا مُحكَّمة.
  • قيست النتائج على مواقع حيّة وستنجرف مع تغيّرها.
  • خط الأساس البشري مجموعة مقارنة صغيرة تحت ضغط الوقت نفسه، لا قياس لما يستطيعه شخص مصمّم لديه يوم كامل.

فعله أحدهم · لم يختبره benchr

غير قابل للتكرارسجّله benchr في

ورقة أوّلية. نتائج الوكلاء من تشغيل الباحثين أنفسهم على مواقع حيّة، فتحمل التحفّظ المعتاد: الموقع قد يتغيّر تحت الاختبار.

المصدر الأصلي: arxiv.org

إلى أين يقودك هذا