فعله أحدهم
الوكلاء ينفقون عشرة ملايين توكن و85 دقيقة على مهمة واحدة. وأفضلهم ينهي 15% منها.
نقلًا عن Zongxia Li and colleagues9 يوليو 2026لم يختبره benchr
ما الذي حدث
اختبار Long-Horizon-Terminal-Bench، المنشور على arXiv في 9 يوليو 2026، يقيّم الوكلاء على 46 مهمة طرفية في تسع فئات بدرجات جزئية لا بنجاح أو رسوب. شُغِّل خمسة عشر نموذجًا متقدّمًا. وعند عتبة مكافأة 0.95 يجتاز أقوى نموذج 15.2% من المهام من المحاولة الأولى، و10.9% عند الدرجة الكاملة. والمتوسط عبر الخمسة عشر 4.3% و1.7%. وتستهلك المهمة الواحدة في المتوسط 9.9 مليون توكن، ونحو 231 حلقة، و85.3 دقيقة تشغيل.
كيف أُنجز
- الداخل46 مهمة طرفية في تسع فئات
- ثمتقييم بدرجات جزئية كثيفة لا بنجاح أو رسوب
- ثم15 نموذجًا متقدّمًا، نحو 231 حلقة و85 دقيقة لكل مهمة
- الخارجالأفضل 15.2% من أول محاولة، والمتوسط 4.3%
كم كلّف
9.9 مليون توكن للمهمة الواحدة في المتوسط، عبر خمسة عشر نموذجًا.
ما الذي لا يثبته هذا
- ورقة أوّلية غير محكّمة.
- ستّ وأربعون مهمة مجموعة صغيرة، وقلّة من المهام الشديدة الصعوبة تحرّك المتوسط كثيرًا.
- النتائج من تشغيل الباحثين أنفسهم، مع التحفّظ المعتاد أن بنية الوكلاء تختلف بين الفرق.
فعله أحدهم · لم يختبره benchr
غير قابل للتكرارسجّله benchr في
ورقة أوّلية، والتشغيل من الباحثين أنفسهم. والأرقام اللافتة هنا أرقام التكلفة لا الترتيب، وهي أقل حساسية لطريقة بناء الاختبار.
المصدر الأصلي: arxiv.orgغطّته أيضًا LHTB repository
الدليل
ما الذي يثبته كل عنصر، ومن أثبته.
- منشور من الجهة التي فعلته
ما الذي يُظهره نسب الاجتياز وأعداد التوكنات والحلقات وتوزيع المهام في ملخّص الورقة وجداولها نفسها.
Li et al., arXiv 2607.08964 · 9 يوليو 2026arxiv.org