فعله أحدهم
في أصعب مهام الويب، ينهي البشر 10%. وأفضل وكيل ينهي 8%.
نقلًا عن Zejun Xu and colleagues9 أغسطس 2026لم يختبره benchr
ما الذي حدث
اختبار CAP، المنشور على arXiv يوم 9 أغسطس 2026، يضم 420 مهمة عابرة للمواقع على 108 مواقع حقيقية في 24 مجالًا، مبنية حول تفاعلات تتطلب فهمًا بصريًا حقيقيًا لا مجرد ملء نماذج. نسب النجاح الكامل: Manus 8.0%، و Fellou 7.0%، و Comet 6.0%، و Genspark 5.0%، و Claude-4.5-Sonnet 5.0%، و Dia 4.0%، و DeepSeek-V4-Flash 2.9%، و GPT-5 2.0%، مقابل خط أساس بشري 10.0%. أما في الإنجاز الجزئي فتتّسع الصورة: البشر 35.0%، و Comet 48.0%، و Manus 23.0%.
كيف أُنجز
- الداخل420 مهمة، و108 مواقع حقيقية، و24 مجالًا
- ثممقسّمة إلى أفعال معقّدة وإدراك معقّد
- ثمثمانية وكلاء وخط أساس بشري على المجموعة نفسها
- الخارجالإدراك لا التحكّم هو الفشل الغالب
ما الذي لا يثبته هذا
- ورقة أوّلية لا مُحكَّمة.
- قيست النتائج على مواقع حيّة وستنجرف مع تغيّرها.
- خط الأساس البشري مجموعة مقارنة صغيرة تحت ضغط الوقت نفسه، لا قياس لما يستطيعه شخص مصمّم لديه يوم كامل.
فعله أحدهم · لم يختبره benchr
غير قابل للتكرارسجّله benchr في
ورقة أوّلية. نتائج الوكلاء من تشغيل الباحثين أنفسهم على مواقع حيّة، فتحمل التحفّظ المعتاد: الموقع قد يتغيّر تحت الاختبار.