فعله أحدهم

أعطوا وكيل البرمجة منصّة التقييم وتركوه يضبط الوكيل الآخر

نقلًا عن Magnus Müller, Browser Use25 مارس 2026لم يختبره benchr

ما الذي حدث

يصف Magnus Müller من Browser Use كيف سلّموا Claude Code واجهة سطر أوامر لمنصّة التقييم الخاصة بهم مع أمر يعمل في حلقة، عشرين دورة، بالتوازي، ووصفوها بأنها «شجرة بحث في فضاء الوكلاء الممكنين». حقّق الوكيل الناتج 97% على Online-Mind2Web، وهو اختبار من 300 مهمة على 136 موقعًا حقيقيًا (83 سهلة، 143 متوسطة، 74 صعبة). ويصفها المنشور بأنها أعلى نتيجة سُجّلت عليه.

كيف أُنجز

  1. الداخلوكيل متصفّح يعمل أصلًا، ومنصّة التقييم الخاصة به
  2. ثمأُعطي Claude Code واجهة أوامر للتقييمات وأمرًا يعمل في حلقة
  3. ثمعشرون دورة بالتوازي، مقسّمة إلى مجموعتَي تدريب وتحقّق
  4. الخارج97% على Online-Mind2Web
افتحه

كيف تجرّبه

الفكرة القابلة لإعادة الاستخدام أصغر من العنوان: ضع تقييمك خلف أمر يستطيع الوكيل تشغيله بنفسه، ثم دعه يكرّر مقابل مجموعة تحقّق لا يراها أثناء الضبط. بدون هذا الفصل أنت تقيس الحفظ لا القدرة.

ما الذي لا يثبته هذا

  • يسمّي الكاتبون فرط التخصيص باعتباره الميل الطبيعي للحلقة، ويواجهونه بفصل التدريب عن التحقّق.
  • يُنسب ما تبقّى من الإخفاقات إلى مواقع غير متاحة، وأوامر ملتبسة، ومواقع تغيّرت بعد بناء الاختبار.
  • الاختبار نفسه يغفل أشكالًا أصعب من العمل؛ ويضرب المنشور مثالًا لا يغطّيه: «استخرج 1000 منتج بصفحاتها الفرعية وقارنها عبر المنصّات».
  • النتيجة ذاتية التقرير. لم يعد benchr إنتاجها، ولا يوجد تكرار مستقل مرتبط بها.

فعله أحدهم · لم يختبره benchr

قابل للتكرار جزئيًاسجّله benchr في

من الجهة نفسها: الفريق يتحدث عن منتجه، والنتيجة مُشغَّلة ذاتيًا. والمنشور صريح على نحو لافت في هذا، إذ يشير في موضع آخر إلى أن التحقق المستقل غير ممكن حين لا ينشر المنافس بياناته.

المصدر الأصلي: browser-use.com

إلى أين يقودك هذا