فعله أحدهم

الوكلاء ينفقون عشرة ملايين توكن و85 دقيقة على مهمة واحدة. وأفضلهم ينهي 15% منها.

نقلًا عن Zongxia Li and colleagues9 يوليو 2026لم يختبره benchr

ما الذي حدث

اختبار Long-Horizon-Terminal-Bench، المنشور على arXiv في 9 يوليو 2026، يقيّم الوكلاء على 46 مهمة طرفية في تسع فئات بدرجات جزئية لا بنجاح أو رسوب. شُغِّل خمسة عشر نموذجًا متقدّمًا. وعند عتبة مكافأة 0.95 يجتاز أقوى نموذج 15.2% من المهام من المحاولة الأولى، و10.9% عند الدرجة الكاملة. والمتوسط عبر الخمسة عشر 4.3% و1.7%. وتستهلك المهمة الواحدة في المتوسط 9.9 مليون توكن، ونحو 231 حلقة، و85.3 دقيقة تشغيل.

كيف أُنجز

  1. الداخل46 مهمة طرفية في تسع فئات
  2. ثمتقييم بدرجات جزئية كثيفة لا بنجاح أو رسوب
  3. ثم15 نموذجًا متقدّمًا، نحو 231 حلقة و85 دقيقة لكل مهمة
  4. الخارجالأفضل 15.2% من أول محاولة، والمتوسط 4.3%
اقرأ الورقة

كم كلّف

9.9 مليون توكن للمهمة الواحدة في المتوسط، عبر خمسة عشر نموذجًا.

ما الذي لا يثبته هذا

  • ورقة أوّلية غير محكّمة.
  • ستّ وأربعون مهمة مجموعة صغيرة، وقلّة من المهام الشديدة الصعوبة تحرّك المتوسط كثيرًا.
  • النتائج من تشغيل الباحثين أنفسهم، مع التحفّظ المعتاد أن بنية الوكلاء تختلف بين الفرق.

فعله أحدهم · لم يختبره benchr

غير قابل للتكرارسجّله benchr في

ورقة أوّلية، والتشغيل من الباحثين أنفسهم. والأرقام اللافتة هنا أرقام التكلفة لا الترتيب، وهي أقل حساسية لطريقة بناء الاختبار.

المصدر الأصلي: arxiv.orgغطّته أيضًا LHTB repository

الدليل

ما الذي يثبته كل عنصر، ومن أثبته.

  • منشور من الجهة التي فعلته

    ما الذي يُظهره نسب الاجتياز وأعداد التوكنات والحلقات وتوزيع المهام في ملخّص الورقة وجداولها نفسها.

    Li et al., arXiv 2607.08964 · 9 يوليو 2026arxiv.org

إلى أين يقودك هذا