ما يوثَّق أن الذكاء الاصطناعي يفعله

كل سجل شيء واحد محدّد يوثّق مزوّده أن نموذجًا أو وكيلًا يفعله، مع الخطوات والقيود والأسطح التي يعمل عليها والصفحة الرسمية التي قرأها benchr. ولم يختبر benchr أيًّا منها بعد.

تصف هذه السجلات ما يوثّقه المزوّدون رسميًا. ولم يشغّل benchr هذه القدرات بنفسه، فليس فيها نتيجة اختبار. ويعرض كل سجل صفحة المزوّد التي قُرئت وتاريخ قراءتها.

آخر تحديث للسجل: 3 سبتمبر 2026

لقطة شاشة تدخل، وصفحة تعمل تخرج

التوثيقموثّق جزئيًاالاختبارلم يختبره benchr

بناء البرمجياتسريعتطبيق محادثةفُحص التوثيق 1 سبتمبر 2026

تعطي النموذج صورة شاشة، فيعيد بنية وأنماطًا تعيد إنتاج التخطيط والمسافات والنص بدقة تكفي للتعديل عليها.

ماذا تفعل

  • يقرأ الصورة على هيئة رموز بصرية لا وحدات بكسل، فتبقى تفاصيل الواجهة الكثيفة قائمة حتى سقف الدقة الخاص بالنموذج.
  • يعيد البنية التي استنتجها: الأقسام والتسلسل والحالات، لا وصفًا للصورة.
  • يقبل صورًا إضافية في الأدوار التالية، فتصحّح النتيجة بأن تريه الخطأ بدل أن تصفه.

كيف تنفّذها

  1. صدّر الشاشة بمقاس ينجو من التصغير. الطبقة عالية الدقة لدى Anthropic تحدّ الضلع الأطول بـ2576 بكسل على Claude 4.7 وما بعده، والطبقة القياسية عند 1568 بكسل، وما زاد يُصغَّر قبل أن يراه النموذج.
  2. ضع الصورة أولًا والتعليمات بعدها؛ دليل الرؤية ينص على أن الصور السابقة للنص تعطي أفضل أداء.
  3. اطلب ناتجًا واحدًا لا مراجعة: ملفًا واحدًا، وإطار عمل محدّدًا بالاسم، والرموز أو أسماء الأصناف التي تريدها بالضبط.
  4. التقط صورة لما بنيته، وأرسل الصورتين موسومتين Image 1 وImage 2، واطلب الفروق وحدها.

القيود

  • المخرجات الإحداثية موصوفة رسميًا بأنها تقريبية، والدقة البكسلية ليست وعدًا من المزوّد.
  • عدّ العناصر الصغيرة المتكرّرة موثّق بأنه غير موثوق.
  • الصور دون مئتي بكسل تقريبًا والمائلة والمضغوطة بشدة مذكورة صراحةً ضمن حالات الفشل في قائمة القيود الرسمية.
  • إرسال عشرين صورة أو أكثر في طلب واحد يفعّل سقف أبعاد أشد على كل صور الطلب.

ما ينبغي أن تحصل عليه: محاولة أولى تصيب البنية والنص وتقارب المسافات، ثم تقارب أدق خلال دورين أو ثلاثة من التصحيح.

الموجّه

Here is a screenshot of one screen. Rebuild it as a single self-contained HTML file with inline CSS. Match the layout, the vertical rhythm and the exact copy. Use CSS custom properties for colour. Do not invent content that is not visible in the image. Where something is ambiguous, choose the simpler reading and add an HTML comment saying what you assumed.

مصاغ ليفرض ناتجًا واحدًا وقائمة افتراضات صريحة، فيجد دور التصحيح شيئًا محدّدًا يناقشه.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • أي رقم دقّة يقيس مطابقة الكود المولَّد للتصميم الأصلي
  • أفضلية نموذج على آخر في هذه المهمة، فلا مزوّد ينشر قياسًا لها

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار. 1 تشغيلة ذاتية التقرير بانتظار مراجعة مستقلة.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق جزئيًاأول تسجيل. التوثيق الرسمي يؤكد قراءة لقطات الشاشة وحدودها، ولا يوثّق أي مزوّد نتيجة توليد الكود، فسُجّل موثّقًا جزئيًا لا موثّقًا كاملًا.

قيادة متصفّح حقيقي لا كاشط صفحات

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الوكلاء والأدوات وMCPمتوسطواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

يحصل النموذج على متصفّح حيّ: يتنقّل، ويقرأ شجرة الوصول، وينقر بمرجع العنصر، ويملأ النماذج، ويدير التبويبات، في حلقة متصلة حتى تنتهي المهمة.

ماذا تفعل

  • يوفّر 31 أداة فرعية ضمن مجموعة واحدة: التنقّل ولقطة الشاشة وقراءة الصفحة والبحث وإدخال النماذج وإدارة التبويبات وأفعال المؤشر ولوحة المفاتيح.
  • يعيد شجرة وصول بمراجع عناصر، فيصير النقر موجّهًا إلى عنصر لا إلى تخمين إحداثي.
  • يعمل كحلقة وكيل: النموذج يصدر نداءات فرعية، ومنفّذك يشغّلها، وتعود النتائج، فيكمل.

كيف تنفّذها

  1. أضف المجموعة إلى الطلب باسم browser_toolset_20260801 على نموذج مدعوم.
  2. شغّل المتصفّح داخل حاوية أو جهاز افتراضي معزول خلف قائمة نطاقات مسموحة على مستوى الشبكة. التوثيق يجعل هذا شرطًا لا اقتراحًا.
  3. فضّل قراءة الصفحة والبحث على لقطات الشاشة عند التحقق من النص والبنية، فالمراجع أرخص وأقل التباسًا من الإحداثيات.
  4. أبقِ تنفيذ جافاسكربت ورفع الملفات وقراءة الطرفية والشبكة معطّلة ما لم تحتجها المهمة فعلًا، فالأربع معطّلة افتراضيًا لأسباب يشرحها التوثيق.
  5. اشترط تأكيدًا بشريًا قبل أي فعل ذي أثر: شراء أو تغيير حساب أو إرسال رسالة.

القيود

  • مراجع العناصر محصورة بتبويبها وتفسد لحظة انتقال التبويب أو تغيّر DOM جوهريًا.
  • الإحداثيات بكسلات إطار العرض فقط، بلا إطار سطح مكتب أو نافذة، ولقطات الشاشة لا تُصغَّر تلقائيًا إلى حد صور النموذج.
  • ناتج قراءة الصفحة محدود بخمسين ألف حرف.
  • النداءات المجمّعة تتوقف عند أول فشل، ومع ذلك يجب الرد على كل نداء متبقٍ.
  • غير متاح على Amazon Bedrock ولا Claude Platform on AWS ولا Microsoft Foundry، ومحتوى الصفحة وعناوين التبويبات أسطح حقن تعليمات معلنة.

ما ينبغي أن تحصل عليه: مرور قابل للتكرار على صفحات لا يبلغها الكاشط، بمساحة فشل شبيهة بمن ينقر بسرعة زائدة.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • نسب النجاح على موقع بعينه
  • زمن أو كلفة كل فعل خارج تسعير التوكنات المعتاد

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار. 1 تشغيلة ذاتية التقرير بانتظار مراجعة مستقلة.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل مقابل browser_toolset_20260801، مع قائمة النماذج والأدوات الفرعية الإحدى والثلاثين والمجموعة المعطّلة افتراضيًا، مقروءة من صفحة الأداة مباشرة.

تشغيل تطبيق سطح مكتب

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الوكلاء والأدوات وMCPعميقواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

لقطة وتحريك ونقر وكتابة. يشغّل النموذج تطبيقًا أصليًا كما يفعل الإنسان، لبرمجيات لم تحصل يومًا على واجهة برمجية.

ماذا تفعل

  • يوفّر 17 أداة فرعية تغطي العرض والفأرة ولوحة المفاتيح والتمرير والانتظار.
  • يعمل على سطح المكتب كله لا على صفحة واحدة: نوافذ الملفات، والمثبّتات، وبرمجيات الأعمال القديمة.
  • يدعم فعل تقريب، فيفحص النموذج منطقة بعينها بدل التحديق في لقطة كاملة.

كيف تنفّذها

  1. استخدم computer_toolset_20260801 على نموذج مدعوم. نماذج Claude 4.5 إلى 4.7 تصل إلى هذه الأداة عبر الإصدار الأقدم computer_20251124 خلف ترويسة تجريبية فقط.
  2. أبقِ دقة الشاشة الافتراضية عند 1920×1080 أو دونها، فالتوثيق يسمّي هذا السقف الموصى به لتفادي مشكلات الأداء.
  3. قِس الإحداثيات بنفسك إن غيّرت حجم اللقطات، لأن الإحداثيات في فضاء بكسلات اللقطة.
  4. قلّم سجل اللقطات بلا تردّد، فكل لقطة تكلّف نحو ألف إلى ألف وثمانمئة توكن، والحلقة الطويلة تراكمها بسرعة.

القيود

  • لأي عمل يبقى داخل صفحة ويب يوصي المزوّد بأداة المتصفّح بدلًا منها.
  • يجب أن تلائم اللقطات حدود صور النموذج، والواجهة ترفض صورة نتيجة أداة أكبر من الحد بدل تصغيرها.
  • الخطر الأمني أعلى في المهام المتصلة بالإنترنت، والتوثيق يشترط العزل واحتياطات حقن التعليمات.
  • غير متاحة داخل Claude Managed Agents.

ما ينبغي أن تحصل عليه: أتمتة بطيئة يمكن مراقبتها لبرمجيات لا تقبل السكربتات، ومنحنى تكلفتها تحكمه اللقطات لا الاستدلال.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • نسبة نجاح المهام على تطبيق بعينه
  • توفّر أداة التقريب على كل منصة تقدّم المجموعة

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. إصدار الأداة والأدوات الفرعية السبع عشرة وتوصية 1920×1080 ومدى توكنات اللقطة كلها مقروءة من صفحة المزوّد.

احصل على JSON يطابق مخططك دائمًا

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

بناء البرمجياتسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

تعطي مخططًا، فتلتزم استجابة النموذج به: لا مفتاح مطلوب ناقص، ولا قيمة تعداد مخترعة، ولا محلّل دفاعي.

ماذا تفعل

  • يقيّد التوليد بالمخطط الذي ترسله بدل مناشدة النموذج أن يعيد JSON.
  • يلغي حلقة إعادة المحاولة التي تبنيها معظم الفرق حول المخرجات الحرة.
  • يجعل خطوة النموذج آمنة في وسط خط المعالجة لا في نهايته فقط.

كيف تنفّذها

  1. اكتب المخطط أولًا وأبقِه مسطّحًا، فالتداخل الاختياري العميق هو موضع الميزات غير المدعومة.
  2. أرسله على نموذج مدعوم؛ التوثيق ينص على بدء المشاريع الجديدة بـgpt-5.6 وأن الدعم يبدأ من GPT-4o.
  3. عالج المخارج الثلاثة الموثّقة: الرفض، والرفض لأسباب سلامة، والاستجابة المقطوعة عند حد التوكنات. صحة المخطط لا تعني اكتمال الرد.
  4. تحقق عند الحدود على أي حال، فالالتزام بالمخطط شيء وصحة القيم شيء آخر.

القيود

  • ليست كل ميزات JSON Schema مدعومة؛ بعضها مستبعد لأسباب أداء أو تقنية.
  • الرفض أو رفض السلامة أو بلوغ حد التوكنات قد ينتج عنه غياب كائن صالح.
  • مع مدخلات مستخدم لا صلة لها بالمخطط، يحذّر التوثيق من أن النموذج سيحاول ملأه، وهذا مسار هلوسة لا خطأ تحليل.
  • المخرجات المهيكلة قد تحتوي أخطاء. الشكل مضمون، والمحتوى لا.

ما ينبغي أن تحصل عليه: مخرجات صحيحة البنية كلما اكتمل الرد، ومساحة معالجة أخطاء أصغر كثيرًا.

المصادر والقيود والروابط والسجل
النماذج
GPT-5.6, GPT-5.5, GPT-5

المصادر

لم يذكره المصدر

  • أثر التقييد بالمخطط على جودة الإجابة في مهمة بعينها
  • أي رقم يقيس زمن التأخير الناتج عن فرض المخطط

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

  • 1 يونيو 2026GPT-5إصدار نموذج
  • 1 يونيو 2026GPT-5.5إصدار نموذج
سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. ضمان الالتزام وحد الدعم من GPT-4o وتوصية gpt-5.6 والمخارج الثلاثة مقروءة من الدليل.

أن يكتب النموذج كودًا حقيقيًا وينفّذه أثناء الإجابة

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

البيانات والتحليلسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

بدل وصف التحليل، ينفّذه النموذج في بيئة معزولة، ويقرأ المخرجات الفعلية، ويصحّح نفسه قبل أن يجيب.

ماذا تفعل

  • يشغّل بايثون، ومع أداة Anthropic يشغّل bash أيضًا، داخل حاوية معزولة لها نظام ملفات يقرأ منه ويكتب فيه.
  • يحوّل أسئلة الحساب والبيانات من تخمين إلى نتيجة محسوبة.
  • يرسم الأشكال داخل الرد على Gemini، حيث تعود مخرجات Matplotlib صورًا ضمن الاستجابة.

كيف تنفّذها

  1. أرفق أداة تنفيذ الكود وارفع ملف المدخلات بدل لصق البيانات في الموجّه.
  2. اطلب الناتج والكود الذي أنتجه معًا، لتصير النتيجة قابلة للتدقيق.
  3. أبقِ كل تشغيلة صغيرة؛ بيئة Gemini تتوقف عند ثلاثين ثانية وتسمح بخمس محاولات إعادة توليد تلقائية بعد الخطأ.
  4. توقّع أن يعمل النص وملفات CSV على أفضل وجه، فكلا المزوّدين يصفهما بأنهما المدخلان الأكثر دعمًا.

القيود

  • تنفيذ الكود لدى Anthropic غير مؤهل لسياسة عدم الاحتفاظ بالبيانات، وغير متاح على Amazon Bedrock وGoogle Cloud.
  • على Claude Haiku 4.5 لا يتوفّر النداء البرمجي للأدوات ولا استمرار حالة الجلسة، فتتصرف الإصدارات الأحدث كإصدار 2025.
  • بيئة Gemini تحدّ زمن التشغيل بثلاثين ثانية ولا تعيد ملفات وسائط عدا مخرجات Matplotlib داخل الرد.
  • المهارات العاملة داخل بيئة واجهة Claude بلا وصول شبكي ولا تثبيت حزم أثناء التشغيل.

ما ينبغي أن تحصل عليه: أرقام يمكنك التحقق منها، أنتجها كود يمكنك قراءته، بدل فقرة معقولة الشكل.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • قائمة الحزم المتاحة في بيئة كل مزوّد في يوم بعينه
  • حصة الذاكرة أو المعالج في أي من البيئتين

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل من صفحتي الأداة الحاليتين لدى المزوّدين، بما في ذلك استثناء Haiku 4.5 وسقف Gemini البالغ ثلاثين ثانية.

قراءة ملف PDF من ستمئة صفحة بما فيه الرسوم

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

المستندات والملفاتسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

ليست قراءة ضوئية. يقرأ النموذج النص وينظر إلى كل صفحة، فيبقى الرقم الموجود داخل رسم بياني قابلًا للإجابة عنه.

ماذا تفعل

  • يقبل ملفات PDF قياسية حتى 32 ميغابايت للطلب وحتى ستمئة صفحة، وتنزل إلى مئة صفحة حين تكون نافذة سياق النموذج دون مليون توكن.
  • يقرأ الجداول والرسوم بوصفها صورًا إلى جانب النص المستخرج، وهذا ما يجعل المستندات المالية والقانونية قابلة للعمل.
  • يعمل بمعرّف ملف من واجهة الملفات، فيمكن الإشارة إلى المستند نفسه مرارًا دون إعادة رفعه.

كيف تنفّذها

  1. ارفع مرة واحدة عبر واجهة الملفات وأشر إلى المعرّف بدل إرسال base64 في كل دور.
  2. اطرح أسئلة مربوطة بالصفحات؛ طلب رقم الصفحة مع كل إجابة يجعل التحقق رخيصًا.
  3. قسّم ما تجاوز سقف الصفحات إلى مدَيات ثابتة، لتبقى الإجابات قابلة للمقارنة.
  4. اقرنها بمخطط JSON حين يذهب الناتج إلى قاعدة بيانات لا إلى عين قارئ.

القيود

  • الملفات المحمية بكلمة مرور أو المشفّرة خارج النطاق، فالشرط ملف PDF قياسي.
  • حدّا 32 ميغابايت والصفحات يسريان على حمولة الطلب كلها لا على الملف وحده.
  • فوق عشرين كتلة صورة أو مستند في طلب واحد، يسري سقف أبعاد أشد عليها جميعًا.
  • الصفحات الممسوحة ضوئيًا ترث كل قيود الرؤية، ومنها عدم موثوقية العدّ وتقريبية التموضع.

ما ينبغي أن تحصل عليه: إجابات تشير إلى مصدرها، بما في ذلك صفحات لا يظهر فيها الرقم إلا داخل رسم.

الموجّه

Read the attached document. For every figure you report, give the page number it came from and say whether it was printed as text or read from a chart or table image. If a figure is not stated in the document, write "not stated" rather than estimating it.

اشتراط الصفحة والمصدر هو ما يحوّل التلخيص إلى شيء يمكن التحقق منه.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • دقة الاستخراج على صنف مستندات بعينه
  • أيّهما يحكم التكلفة أكثر: عدد الصفحات أم تعقيدها

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. شروط الحجم والصفحات والصيغة مقروءة من صفحة الدعم الرسمية.

إجابة من الويب الحيّ مع استشهادات مرفقة

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

البحث والويب الحيّسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

النموذج يقرّر متى يبحث، والواجهة تنفّذ البحث، والإجابة النهائية تحمل روابط المصادر وعناوينها والمقطع المقتبس بعينه.

ماذا تفعل

  • يعيد استشهادات تحمل الرابط والعنوان وحتى مئة وخمسين حرفًا من النص المقتبس، وحقول الاستشهاد هذه لا تُحسب ضمن استهلاك التوكنات.
  • يقبل قائمة نطاقات مسموحة أو محظورة، فيمكن توجيه وكيل بحثي إلى المصادر الأولية وحدها.
  • منذ الإصدار web_search_20260209 يكتب كودًا وينفّذه لتصفية النتائج قبل دخولها نافذة السياق، فتقلّ التوكنات في التشغيلات كثيفة البحث.

كيف تنفّذها

  1. أضف الأداة واضبط الحد الأقصى للاستخدامات؛ الأسئلة الواقعية البسيطة تستهلك بحثًا إلى ثلاثة، والبحث المقارن قد يبلغ عشرة أو أكثر.
  2. قيّد النطاقات. لأي شيء تنوي نشره، قائمة المصادر الرسمية هي الفارق بين البحث والتجميع.
  3. أعد كتل محتوى المساعد كما وردت، بما فيها المحتوى المشفّر، وإلا فشل الدور التالي برمز 400.
  4. عالج توقف الدور المؤقّت بإعادة إرسال الرسالة الموقوفة دون تغيير.

القيود

  • عشرة دولارات لكل ألف عملية بحث على واجهة Claude، فوق تكلفة التوكنات المعتادة، والنتائج المستهلكة في الدور تُحسب توكنات إدخال.
  • أرسل قائمة النطاقات المسموحة أو المحظورة، لا كلتيهما؛ وإرسالهما معًا يعيد خطأ 400.
  • غير متاحة على Amazon Bedrock، وعلى Google Cloud وعمليات Microsoft Foundry المستضافة على Azure يعمل الإصدار الأساسي فقط بلا تصفية ديناميكية.
  • يمكن لمسؤول المؤسسة تعطيل البحث كليًا، فيفشل الطلب عند التحقق لا داخل نتيجة.

ما ينبغي أن تحصل عليه: إجابات حديثة يمكن تدقيقها سطرًا سطرًا، بتسعير لكل عملية بحث فوق تكلفة التوكنات.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • أي فهرس بحث يقف خلف الأداة
  • ضمانات حداثة النتائج لاستعلام بعينه

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار. 1 تشغيلة ذاتية التقرير بانتظار مراجعة مستقلة.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. سعر الألف بحث وإصدارات الأداة الثلاثة وبنية الاستشهاد وفجوات المنصات مقروءة من صفحة الأداة.

منح النموذج أدواتك وبياناتك عبر MCP

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الوكلاء والأدوات وMCPمتوسطواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

بروتوكول مفتوح واحد بين تطبيق الذكاء الاصطناعي وأنظمتك، فيصير الموصل الذي تكتبه مرة واحدة صالحًا في كل عميل يتحدث اللغة نفسها.

ماذا تفعل

  • يوحّد كيف يعرض التطبيق مصادر البيانات والأدوات وقوالب الموجّهات للنموذج.
  • مدعوم عبر عملاء متعددين لا مزوّد واحد؛ موقع المواصفة يسمّي Claude وChatGPT وVS Code وCursor وغيرها.
  • يتيح لوكيل برمجي بلوغ ملف تصميم أو متتبّع مهام أو قاعدة بيانات داخلية دون تكامل خاص لكل عميل.

كيف تنفّذها

  1. حدّد ما يحتاجه النموذج فعلًا: مورد للقراءة فقط، أو أداة قابلة للنداء، أو قالب موجّه. وأغلب الخوادم الأولى ينبغي أن تكون للقراءة فقط.
  2. ابنِ الخادم على مراجعة المواصفة الحالية واختبره في عميل واحد قبل ربطه بحلقة وكيل.
  3. اربط بيانات الاعتماد بالخادم لا بالنموذج، فالخادم هو حدّ الثقة.
  4. عامل كل قيمة تعود عبر خادم بوصفها محتوى غير موثوق، تمامًا كصفحة ويب.

القيود

  • يوحّد MCP الاتصال لا أمان ما تصله. خادم بصلاحيات كتابة واسعة يسلّم تلك الصلاحيات لأي شيء يقوده.
  • دعم العملاء يتفاوت بحسب الميزة؛ فخادم يعمل في عميل ليس بالضرورة كامل الميزات في آخر.
  • المواصفة مؤرّخة وتُراجع؛ التوثيق منظّم بمراجعات مؤرّخة، فثبّت المراجعة التي تبني عليها.

ما ينبغي أن تحصل عليه: موصل واحد قابل لإعادة الاستخدام عبر العملاء، بدل تكامل لكل تطبيق تعيد كتابته كل ربع سنة.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • أي ميزات ينفّذها كل عميل اليوم بالتحديد
  • أي أرقام أداء أو مقياس توسّع لنواقل MCP

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل من مقدمة البروتوكول نفسه، بما في ذلك قائمة العملاء المذكورة وبنية مراجعات المواصفة المؤرّخة.

لا تدفع مرتين على نفس الملف

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

التكلفة والإنتاجيةسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

علّم الجزء الثابت من الموجّه بأنه قابل للتخزين، فتقرأه الطلبات التالية بعُشر سعر الإدخال بدل دفع السعر كاملًا من جديد.

ماذا تفعل

  • يحسب 1.25 ضعف سعر الإدخال لكتابة مدخل تخزين مدته خمس دقائق، وضعفين لمدخل مدته ساعة، وعُشر السعر لقراءة أيّ منهما.
  • ينطبق على الجزء الذي لا يتغيّر: موجّه النظام، وتعريفات الأدوات، والمستند، والأمثلة.
  • يبلّغ عمّا حدث فعلًا في كتلة الاستهلاك، فيصير التوفير قابلًا للقياس لا مفترضًا.

كيف تنفّذها

  1. انقل كل ما هو ثابت إلى مقدمة الموجّه وضع المتغيّر في آخره، فالتخزين يعمل على البادئة.
  2. علّم الحدّ بـcache_control، ولا تضف مدة الساعة إلا حين يُعاد استخدام البادئة على فترات أطول من خمس دقائق.
  3. تحقق من الحد الأدنى: Claude Opus 5 وFable 5 وMythos 5 تحتاج 512 توكنًا، وOpus 4.8 وSonnet 5 وSonnet 4.6 وSonnet 4.5 تحتاج 1024، وHaiku 4.5 يحتاج 4096.
  4. اقرأ حقلي توكنات إنشاء التخزين وقراءته في الاستجابة؛ صفران يعنيان أن الموجّه كان دون الحد الأدنى، ولا يُرفع أي خطأ.

القيود

  • الموجّهات القصيرة لا تُخزَّن بصمت، فالواجهة لا تعيد خطأ بل أصفارًا.
  • مدخل الساعة يكلّف ضعف سعر الإدخال كتابةً، فلا يفيد إلا إذا أُعيد استخدام البادئة فعلًا.
  • أي تغيير داخل البادئة المخزّنة يبطلها، وإعادة ترتيب تعريفات الأدوات وحدها تكفي.
  • التوفير على توكنات الإدخال فقط، والإخراج غير متأثر.

ما ينبغي أن تحصل عليه: على موجّه نظام طويل ثابت أو مستند مرفق كبير، تنخفض كلفة إدخال الطلبات المتكررة بمرتبة قدر تقريبًا.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • نسب إصابة التخزين في الإنتاج لحمل عمل بعينه
  • هل يبقى مدخل التخزين صالحًا بعد تغيّر إصدار النموذج

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. المضاعفات ومدّتا الصلاحية وكل حد أدنى لكل نموذج مقروءة من دليل التخزين.

تشغيل العمل كله ليلًا بنصف السعر

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

التكلفة والإنتاجيةسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

أرسل طلبات كثيرة دفعةً واحدة غير متزامنة، واستعلم عن اكتمالها، وادفع خمسين بالمئة أقل من العمل ذاته لو أُرسل طلبًا طلبًا.

ماذا تفعل

  • يعالج كل طلب في الدفعة باستقلال وبشكل غير متزامن، وتنتهي أغلب الدفعات في أقل من ساعة.
  • يخفض التكلفة خمسين بالمئة مقارنة بالمسار المتزامن، وهذا كل المقصد في التقييمات والتصنيف بالجملة.
  • يرفع الإنتاجية في أحمال العمل التي لا ينتظر أحد إجابتها.

كيف تنفّذها

  1. حدّد العمل الذي لا ينتظره إنسان: تشغيلات التقييم، وإعادة المعالجة، والوسم بالجملة، ومعالجة أرشيف قديم.
  2. أرسل الدفعة، ثم استعلم عن حالة الدفعة لا عن الطلبات فرادى.
  3. استرجع النتائج بعد انتهاء المعالجة للدفعة كاملة.
  4. اجمعها مع تخزين الموجّهات حين تتشارك الطلبات بادئة طويلة.

القيود

  • غير متزامنة بحكم تعريفها، فلا يصلح لها أي مسار يواجه المستخدم.
  • البحث في الويب داخل الدفعات مقيّد لكل مؤسسة حمايةً للسعة المشتركة، فقد تطول الدفعات كثيفة البحث.
  • خصم الخمسين بالمئة على تكلفة التوكنات؛ أما أدوات الخادم مثل البحث فتُسعَّر كما في الطلبات المعتادة.

ما ينبغي أن تحصل عليه: المخرجات نفسها، بنصف سعر التوكنات، وفق جدول زمني بدل الطلب الفوري.

المصادر والقيود والروابط والسجل
إن توقّفت عن العمل
لا تدفع مرتين على نفس الملف

المصادر

لم يذكره المصدر

  • زمن اكتمال مضمون لأي حجم دفعة
  • حدود حجم الدفعة لكل مؤسسة على كل منصة

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. نسبة الخمسين بالمئة وزمن الاكتمال المعتاد دون ساعة مقروءان من دليل معالجة الدفعات.

العمل على مستودع كامل لا على ملف ملصوق

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

بناء البرمجياتمتوسطوكيل أو طرفيةفُحص التوثيق 1 سبتمبر 2026

وكيل يقرأ قاعدة الكود بنفسه، ويعدّل عبر ملفات كثيرة، ويشغّل الأوامر، ويقرأ الإخفاقات، ويفتح طلب الدمج.

ماذا تفعل

  • يقرأ ملفات المشروع ويعدّلها، ويشغّل الأوامر، ويتعامل مع git مباشرة: يهيّئ التغييرات، ويكتب رسائل الالتزام، وينشئ الفروع، ويفتح طلبات الدمج.
  • يعمل في الطرفية، وفي VS Code وJetBrains، وفي تطبيق سطح مكتب، وفي المتصفّح، على المحرّك نفسه وإعدادات المشروع نفسها.
  • يقبل المدخلات الممرّرة، فيمكن تمرير السجلات أو قائمة الملفات المتغيّرة من الصدفة مباشرة.

كيف تنفّذها

  1. ضع قواعد المشروع في ملف CLAUDE.md في جذر المستودع، فهو يُقرأ في بداية كل جلسة.
  2. اطلب الحلقة كاملة لا الفرق وحده: اكتب التغيير، وشغّل الاختبارات، وأصلح ما يفشل.
  3. غلّف ما تكرّره في مهارة، فتصير الإجراءة نفسها أمرًا واحدًا في المرة القادمة.
  4. استخدم الخطافات لما لا يقبل التفاوض: تنسيق بعد كل تعديل، وفحص قبل كل التزام، بدل إعادة كتابتها نثرًا.

القيود

  • أغلب الأسطح تتطلب اشتراك Claude أو حساب لوحة تحكم.
  • تثبيتات Homebrew وWinGet لا تُحدَّث تلقائيًا، والتحديث التلقائي في التثبيت الأصلي وحده.
  • هو وكيل بصلاحيات تنفيذ حقيقية، ونموذج الأمان هو ما تضبطه من أذونات وخطافات لا الإعدادات الافتراضية.

ما ينبغي أن تحصل عليه: العمل الممل الذي تؤجّله، منجَزًا في فرع قابل للمراجعة: اختبارات لكود بلا اختبارات، وتنظيف تحذيرات، ورفع اعتماديات، وملاحظات إصدار.

المصادر والقيود والروابط والسجل
تعمل على
Claude Code

المصادر

لم يذكره المصدر

  • نسبة نجاح المهام على مستودع أو لغة بعينها
  • مقارنة النتائج بوكلاء برمجة آخرين، فلا قياس محايد منشور

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار. 1 تشغيلة ذاتية التقرير بانتظار مراجعة مستقلة.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل من نظرة المنتج الحالية، بما فيها الأسطح الأربعة وقنوات التثبيت التي لا تُحدَّث تلقائيًا.

علّم النموذج إجراءً مرة واحدة وأعد استخدامه

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الوكلاء والأدوات وMCPمتوسطوكيل أو طرفيةفُحص التوثيق 1 سبتمبر 2026

مجلّد فيه ملف SKILL.md وملفات مرجعية وسكربتات اختيارية. يقرأ النموذج الاسم والوصف دائمًا، ولا يقرأ التعليمات إلا حين يطابق طلبك.

ماذا تفعل

  • يحمَّل على ثلاث مراحل: البيانات الوصفية دائمًا بنحو مئة توكن لكل مهارة، ومتن الملف عند التفعيل بأقل من خمسة آلاف توكن، والملفات والسكربتات المرفقة عند قراءتها فقط.
  • يشغّل السكربتات المرفقة عبر bash، فلا يدخل كودها نافذة السياق أبدًا، بل مخرجاتها وحدها.
  • يعمل في Claude Code من مجلّد المهارات الشخصي أو مجلّد المشروع، وفي الواجهة بمعرّف المهارة داخل حاوية تنفيذ الكود، وعلى claude.ai بملف مضغوط مرفوع.

كيف تنفّذها

  1. اكتب الوصف ليقول ما تفعله المهارة ومتى تُستخدم معًا، فهذا النص هو ما يُطابَق عليه الطلب.
  2. أبقِ متن الملف دون خمسة آلاف توكن تقريبًا، وادفع التفاصيل إلى ملفات مرجعية منفصلة لا يقرؤها النموذج إلا عند الحاجة.
  3. حوّل كل ما هو حتمي إلى سكربت بدل تعليمات، فالسكربتات أرخص ولا تنحرف.
  4. ثبّتها لكل سطح على حدة، فالمهارات لا تتزامن بين Claude Code والواجهة وclaude.ai.

القيود

  • لا يجوز أن يحتوي الاسم كلمتي anthropic أو claude المحجوزتين، ويجب أن يكون بأحرف صغيرة وشرطات، وبحد أقصى أربعة وستين حرفًا، والوصف بحد ألف وأربعة وعشرين.
  • على واجهة Claude تعمل المهارة بلا وصول شبكي وبلا تثبيت حزم أثناء التشغيل.
  • المهارات المخصّصة لا تتزامن بين الأسطح، ولا توفّر claude.ai توزيعًا مركزيًا على مستوى المؤسسة.
  • المهارة ثقة قابلة للتنفيذ؛ والتوثيق يحذّر من أن مهارة خبيثة قد توجّه النموذج لإساءة استخدام الأدوات أو تسريب البيانات.

ما ينبغي أن تحصل عليه: إجراءة فريق تُنفَّذ بالطريقة نفسها كل مرة، بكلفة سياق تكاد تكون صفرًا حتى تُستدعى فعلًا.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • كم مهارة يمكن تثبيتها قبل أن تصير كلفة البيانات الوصفية مؤثرة
  • هل تتفاوت دقة التفعيل بين النماذج

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. مستويات التحميل الثلاثة وحدود الاسم والوصف وقيد انعدام الشبكة في الواجهة مقروءة من صفحة النظرة العامة.

تفريغ تسجيل مع تمييز من قال ماذا

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الصورة والصوت والفيديوسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

تحويل الكلام إلى نص هو النصف السهل، والنصف المفيد نصٌّ يُنسب كل سطر فيه إلى متحدّث.

ماذا تفعل

  • يفرّغ بنموذج gpt-transcribe بوصفه التوصية العامة، مع بقاء whisper-1 ونماذج gpt-4o الأقدم موثّقة.
  • يفصل المتحدّثين بنموذج gpt-4o-transcribe-diarize الذي يعيد صيغة استجابة مخصّصة لذلك.
  • يعيد طوابع زمنية على مستوى الكلمة والمقطع في whisper-1، وهذا ما يجعل النص قابلًا للتنقّل.

كيف تنفّذها

  1. قسّم التسجيل قبل الرفع؛ الحد الموثّق خمسة وعشرون ميغابايت للملف، ويتجاوزه اجتماع طويل بسهولة.
  2. اختر بوعي: الفصل بين المتحدّثين والطوابع الزمنية على مستوى الكلمة موثّقان على نموذجين مختلفين، فاختر بحسب المخرج الذي تحتاجه.
  3. أبقِ الصوت في حاوية مدعومة: mp3 أو mp4 أو mpeg أو mpga أو m4a أو wav أو webm.
  4. مرّر النص إلى تمريرة ثانية للتلخيص أو استخراج المهام؛ فالتفريغ والفهم عملان منفصلان.

القيود

  • خمسة وعشرون ميغابايت للملف سقف صارم، والتقسيم مسؤوليتك، وحدود المقاطع قد تشطر جملة أو دور متحدّث.
  • دقة الطوابع الزمنية والفصل بين المتحدّثين ليسا في نموذج واحد، فلا يعطيك طلب واحد كليهما دائمًا.
  • تسميات المتحدّثين معرّفات لا هويات؛ النموذج يفصل الأصوات ولا يعرف أصحابها.

ما ينبغي أن تحصل عليه: نصّ مفرّغ بطوابع زمنية ونسبة إلى المتحدّثين، قابل للبحث والاقتباس والتمرير إلى نموذج آخر.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • معدّل خطأ الكلمات على صوت بلكنة أو مع ضوضاء
  • أقصى مدة صوتية بعد احترام حد حجم الملف

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. أسماء النماذج وسقف 25 ميغابايت وقائمة الصيغ والنموذج الحامل للفصل بين المتحدثين مقروءة من الدليل.

تحدّث إليه بصوتك واسمع جوابه

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الصورة والصوت والفيديوعميقواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

ليست تفريغًا ثم إجابة ثم تركيبًا للصوت. جلسة واحدة على gpt-realtime-2.1 يدخل فيها الصوت ويخرج صوتًا، وتبادل الأدوار متكفَّل به.

ماذا تفعل

  • يعمل عبر ثلاثة نواقل: WebRTC لعملاء المتصفّح والجوال، وWebSocket لخطوط المعالجة على الخادم، وSIP للاتصال الهاتفي.
  • يلغي خط المعالجة المخيَّط، وهذا ما يلغي أكثر التأخير الذي يلاحظه الناس في وكلاء الصوت.
  • يتيح ضبط جهد الاستدلال، فيمكن معايرة وكيل صوتي إنتاجي على سرعة الاستجابة.

كيف تنفّذها

  1. اختر الناقل حسب موضع الصوت: متصفّح إلى WebRTC، وخادم إلى WebSocket، ورقم هاتف إلى SIP.
  2. ابدأ بجهد استدلال منخفض، فالتوثيق يسمّيه نقطة البدء الإنتاجية لوكلاء الصوت.
  3. اضبط تأخير التفريغ بوعي: التأخير الأقل يعطي نصًا جزئيًا أبكر، والأعلى يحسّن جودة النص.
  4. صمّم سلوك المقاطعة قبل الموجّه؛ فالمقاطعة هي الفارق بين عرض تجريبي وشيء يستخدمه الناس.

القيود

  • هو بروتوكول جلسة لا نقطة طلب واستجابة؛ فإعادة الاتصال والحالة وتخزين الصوت مسؤوليتك.
  • المفاضلة بين الزمن والجودة معلنة في التوثيق ولا يمكن تحسينها بعيدًا، بل اختيارها فقط.
  • الاتصال الهاتفي عبر SIP يضعك داخل قيود شركات الاتصال التي لا يغطيها توثيق النموذج.

ما ينبغي أن تحصل عليه: محادثة تشبه مكالمة لا جهاز لاسلكي، بثمنِ عميلٍ أكثر تعقيدًا بكثير.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • أرقام زمن الاستجابة الكلي لأي ناقل
  • حدود التزامن لكل مؤسسة

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. معرّف النموذج والنواقل الثلاثة وإرشاد جهد الاستدلال المنخفض للإنتاج مقروءة من الدليل الآني.

توليد صورة بنصّ مقروء داخلها

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الصورة والصوت والفيديوسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

الإخفاق الذي يتذكّره الجميع من نماذج الصور الأولى، وهو الحروف المشوّهة، صار قدرةً موثّقة اليوم للرسوم المعلوماتية والقوائم والمخططات والأصول التسويقية.

ماذا تفعل

  • يولّد الصور ويحرّرها على gemini-3.1-flash-lite-image وgemini-3.1-flash-image وgemini-3-pro-image وgemini-2.5-flash-image.
  • يواصل التحرير حواريًا عبر الأدوار بمعرّف التفاعل السابق، فلا يبدأ التصحيح الصورة من جديد.
  • يقبل حتى أربع عشرة صورة مرجعية على Gemini 3.1 Flash Image، وهذا ما يتيح ثبات الأسلوب والمنتج.

كيف تنفّذها

  1. اكتب النص المطلوب بين علامتي اقتباس داخل الموجّه وحدّد موضعه، ولا تترك الصياغة للنموذج إن كان يجب أن تكون صحيحة.
  2. أرفق صورًا مرجعية لأصول العلامة بدل وصفها.
  3. صحّح داخل المحادثة نفسها بدل إعادة الموجّه من الصفر، لتبقى التركيبة قائمة.
  4. تحقق من سقف الدقة قبل اختيار النموذج، فنموذج Flash Lite للصور يدعم دقة 1K فقط.

القيود

  • كل الصور المولَّدة تحمل علامة SynthID المائية.
  • نموذج gemini-3.1-flash-lite-image يدعم دقة 1K فقط.
  • الصور المرجعية محدودة بأربع عشرة على Gemini 3.1 Flash Image.
  • وضوح النص موصوف بأنه نقطة قوة لا ضمان، وتبقى السلاسل الطويلة والخطوط الصغيرة الحالة الأضعف.

ما ينبغي أن تحصل عليه: أصول تسويقية ومخططات صالحة كمسودة أولى بكلمات مكتوبة صحيحة، في الدور الثالث أو الرابع لا الأول.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • نسب دقة الحروف في عرض النص
  • هل تبقى العلامة المائية بعد التحرير اللاحق

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. معرّفات النماذج وادعاء النص المقروء وسقف الصور المرجعية ودقة 1K في Flash Lite وعلامة SynthID مقروءة من صفحة المزوّد.

توليد فيديو من موجّه أو صورة ثابتة

التوثيقموثّق جزئيًاالاختبارلم يختبره benchr

الصورة والصوت والفيديوسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

يدخل نصّ أو صورة، فيخرج مقطع قصير، ومع أحد النموذجين الموثّقين يخرج بصوت أصلي.

ماذا تفعل

  • يحوّل الموجّهات النصية والصور إلى مقاطع قصيرة على Gemini Omni Flash، وهو التوصية الافتراضية في التوثيق.
  • يولّد فيديو بصوت أصلي على Veo 3.1.
  • يقبل صورة ثابتة إطارًا أولًا، وهي الطريقة الموثوقة للتحكم في التركيب.

كيف تنفّذها

  1. ابدأ من صورة تعجبك فعلًا لا من نص وحده، فالتحكم في التركيب هو الجزء الصعب.
  2. اكتب اللقطة لا الحكاية: حركة كاميرا واحدة، وفعل موضوع واحد، وحالة إضاءة واحدة.
  3. ولّد مقاطع قصيرة عدة وركّبها، بدل طلب لقطة واحدة طويلة.
  4. خصّص ميزانية للتكرار؛ فهذه أقل قدرة في هذه القائمة قابليةً للتوجيه.

القيود

  • صفحة المزوّد التي قرأها benchr توثّق القدرة والنموذجين، ولا تنشر في تلك الصفحة طول المخرجات ولا دقتها ولا حدود المعدّل.
  • ولأن تلك الحدود غير موثّقة في الصفحة المفحوصة، عامِل أي رقم رأيته في مكان آخر على أنه غير متحقق.
  • الصوت الأصلي موثّق لـVeo 3.1 وحده لا للنموذج الافتراضي.

ما ينبغي أن تحصل عليه: مقاطع قصيرة تكفي للقطة منتج أو أصل اجتماعي، بعد محاولات عدة.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • أقصى طول للمقطع
  • دقة المخرجات ومعدّل الإطارات
  • تسعير التوليد أو حصصه

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق جزئيًاأول تسجيل بوصفه موثّقًا جزئيًا: الصفحة تسمّي النموذجين والقدرة ولا تنشر الطول ولا الدقة ولا حدود المعدّل، فبقيت تلك في قائمة ما لم يذكره المصدر بدل ملئها من الذاكرة.

مستودع كامل في موجّه واحد، ومعرفة حدّه

التوثيقموثّق جزئيًاالاختبارلم يختبره benchr

البيانات والتحليلسريعواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

قاعدة كود كاملة، أو إفادة طويلة، أو ساعة فيديو. النافذة حقيقية، لكن سلوك الاسترجاع داخلها هو ما يخطئ فيه الناس.

ماذا تفعل

  • يقبل سياقًا حتى مليون توكن على نماذج Gemini الموثّقة، مقابل نوافذ من ثمانية واثنين وثلاثين ألفًا في ماضٍ قريب.
  • يغطّي حالات النص والفيديو والصوت صراحةً: التلخيص، والإجابة عن الأسئلة، وتدفقات الوكلاء، وضبط المحتوى، وملخصات الاجتماعات.
  • يلغي طبقة الاسترجاع للمسائل التي تتّسع له، فيلغي معها صنفًا كاملًا من أخطاء التقطيع.

كيف تنفّذها

  1. اسأل سؤالًا واحدًا في كل طلب؛ فالدقة الموثّقة أعلى ما تكون لاسترجاع واحد وتتراجع حين يطلب السؤال حقائق منفصلة عدة.
  2. ضع المدوّنة أولًا والسؤال آخرًا، وأبقِ المدوّنة مطابقة بايتًا ببايت بين الطلبات إن أردت أن يصيب تخزين الموجّهات أيضًا.
  3. للعمل متعدّد الحقائق، شغّل تمريرات مفردة عدة واجمع الإجابات بنفسك بدل طلبها كلها دفعة واحدة.
  4. قِس الزمن لا التكلفة وحدها؛ فالاستعلامات الأطول تزيد التأخير، وهذا منصوص عليه في التوثيق.

القيود

  • تعدّد المطلوبات في استعلام واحد يخفض الدقة مقارنةً باسترجاع مفرد، وهذا موثّق لا متوارث.
  • الأداء يتفاوت بحسب السياق، والاستعلامات الأطول تزيد التأخير.
  • التوثيق يصف السياق الطويل بأنه مفاضلة بين دقة الاسترجاع وكفاءة التكلفة، لا ترقية مجانية.
  • نافذة مليون توكن في ورقة المواصفات ليست هي الاسترجاع الصالح عبر النافذة كلها.

ما ينبغي أن تحصل عليه: استرجاع ممتاز لحقيقة واحدة من مدوّنة ضخمة، وسلوك أسوأ بوضوح كلما احتاج السؤال حقائق منفصلة أكثر.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • منحنى دقة منشور بحسب طول السياق
  • موضع عتبة التراجع لأي نموذج بعينه

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق جزئيًاأول تسجيل بوصفه جزئيًا. أحجام النوافذ وحالات الاستخدام موثّقة، وسلوك الدقة موصوف وصفيًا بلا منحنى منشور، فلا يدّعي السجل وجوده.

تشغيل نموذج قادر على جهازك أنت

التوثيقموثّق جزئيًاالاختبارلم يختبره benchr

محلي وخاصمتوسطمحليفُحص التوثيق 3 سبتمبر 2026

نماذج مفتوحة الأوزان على عتادك، حيث القيد حسابُ ذاكرة لا سعرٌ لكل توكن.

ماذا تفعل

  • يعمل كليًا على جهازك، فلا يغادره موجّه ولا مستند.
  • يلغي التكلفة لكل توكن ويستبدل بها سقفًا عتاديًا ثابتًا.
  • يواصل العمل دون اتصال، وهذا أهم مما يبدو في البيئات المنظَّمة والعمل الميداني.

كيف تنفّذها

  1. ابدأ من الذاكرة لا من القياسات. مخطّط benchr يقدّر أوزان أربع بتات بضرب إجمالي المعاملات في نصف غيغابايت، وهذا الرقم يستثني مخازن التشغيل وذاكرة السياق ونظام التشغيل.
  2. افحص وسم الملاءمة قبل تنزيل أي شيء: مريح، أو ضيّق، أو غير موصى به.
  3. عامِل السياق الممتد المعلن على أنه مكلف لا مجاني، فقد يحتاج قياسًا خاصًا بزمن التشغيل وذاكرة تخزين أكبر بكثير.
  4. قارن بنموذج مستضاف صغير بإنصاف؛ فالمحلي يفوز في الخصوصية والتكلفة الحدية، لا في الجودة لكل واط عادةً.

القيود

  • أرقام الذاكرة تقديرات لتخطيط النشر، لا قياسات إنتاجية ولا ضمانات.
  • حين لا ينشر المزوّد ذاكرة النسخة المكمَّمة، يكون التقدير حسابيًا، وbenchr يسمّيه كذلك.
  • السياق الممتد ليس ذاكرة مجانية، والمخطّط يرفض صراحةً معاملته هكذا.
  • هذا السجل مفحوص مقابل فهرس النشر المحلي الخاص بـbenchr لا صفحة مزوّد واحدة، ولذلك الفهرس تاريخ إصدار خاص به.

ما ينبغي أن تحصل عليه: مساعد خاص يعمل دون اتصال، سقفه ذاكرة جهازك لا ميزانيتك.

المصادر والقيود والروابط والسجل
إن توقّفت عن العمل
لا تدفع مرتين على نفس الملف

المصادر

لم يذكره المصدر

  • عدد التوكنات في الثانية على جهاز بعينه
  • تكافؤ الجودة مع نموذج متقدّم مستضاف على حمل عملك

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 3 سبتمبر 2026التوثيقموثّق جزئيًاأُضيف مصدر رسمي لبيئة تشغيل محلية. كان السجل يستند سابقًا إلى فهرس النشر الخاص بـbenchr، وهو ليس مصدر مزوّد ولا يكفي وحده لدعم حالة موثّقة.
  • 1 سبتمبر 2026التوثيقموثّق جزئيًاأول تسجيل بوصفه موثّقًا جزئيًا. الدليل هنا فهرس benchr المحلي المستند إلى مصادره لا صفحة مزوّد واحدة، وكل رقم فيه تقدير تخطيطي، فلا يدّعي السجل توثيقًا رسميًا كاملًا.

تسليم مهمة والانصراف عن الجهاز

التوثيقموثّق رسميًاالاختبارلم يختبره benchr

الوكلاء والأدوات وMCPمتوسطوكيل أو طرفيةفُحص التوثيق 1 سبتمبر 2026

ابدأ العمل في الطرفية، وانقله إلى السحابة، وتفقّده من الهاتف، ودعه يعيد نفسه الثلاثاء القادم من دونك.

ماذا تفعل

  • يشغّل الجلسات في المتصفّح بلا إعداد محلي، فتستمر المهمة الطويلة بعد إغلاق الحاسوب.
  • ينقل الجلسة بين الأسطح: من الطرفية إلى الويب، ومن الويب إلى الطرفية، ومن الطرفية إلى سطح المكتب، على المحرّك وإعدادات المشروع نفسها.
  • يعمل وفق جدول: مهام سحابية تنجو من إطفاء الجهاز، ومهام مجدولة على سطح المكتب بوصول إلى الملفات المحلية، وحلقة داخل الجلسة للاستطلاع السريع.
  • يمكن تشغيله بإشارة في محادثة الفريق أو بحدث في GitHub بدل إنسان أمام لوحة مفاتيح.

كيف تنفّذها

  1. اكتب المهمة نتيجةً مع خطوة تحقق؛ فالوكيل يحتاج أن يعرف متى ينتهي لا ماذا يفعل فحسب.
  2. اختر موضع التشغيل بحسب ما يحتاج لمسه: السحابة للمستودعات، والجدولة على سطح المكتب للملفات المحلية.
  3. أعطه قواعد المشروع في ملف CLAUDE.md كي لا تخترع تشغيلة غير مراقَبة أعرافًا من عندها.
  4. راجع الفرع لا سجل المحادثة؛ فالعمل غير المراقَب يُحكم عليه بفروقه.

القيود

  • التسليمات السحابية والهاتفية تتطلب اشتراك claude.ai، وبعضها محصور بـmacOS وويندوز x64.
  • الوكيل غير المراقَب آمن بقدر الأذونات والخطافات المحيطة به.
  • التشغيلات المجدولة تكلّف توكنات في كل مرة، سواء وُجد ما يُفعل أم لا.

ما ينبغي أن تحصل عليه: مراجعات طلبات الدمج صباحًا، وتحليل إخفاقات التكامل ليلًا، وتدقيق الاعتماديات أسبوعيًا، منجزًا قبل أن تجلس.

المصادر والقيود والروابط والسجل
تعمل على
Claude Code

المصادر

لم يذكره المصدر

  • أقصى مدة تشغيل غير مراقَب
  • حدود التزامن للمهام المجدولة

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

تغيّرات المزوّدين التي تمسّه

سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. جلسات الويب والمهام الدورية والمجدولة على سطح المكتب ومحفّزات المحادثة وGitHub وشرط الاشتراك كلها مقروءة من نظرة المنتج.

الضبط الدقيق لنموذج OpenAI مستضاف

التوثيققيد الإيقافالاختبارلم يختبره benchr

بناء البرمجياتعميقواجهة برمجيةفُحص التوثيق 1 سبتمبر 2026

مغلق أمام المستخدمين الجدد. التوثيق ينص على أن منصة الضبط الدقيق في طور الإغلاق ولم تعد متاحة للمستخدمين الجدد، مع بقاء إنشاء المهام مؤقتًا للمستخدمين الحاليين.

ماذا تفعل

  • الطرق الموثّقة كانت الضبط الخاضع للإشراف، والضبط البصري، وتحسين التفضيل المباشر، والضبط التعزيزي.
  • النماذج الأساسية الموثّقة كانت gpt-4.1 وgpt-4.1-mini وgpt-4.1-nano وgpt-4o وo4-mini، وكلها نقاط تفتيش من جيل 2025.
  • يُحتفظ بهذا السجل لأن أي خطة بُنيت عليه تحتاج بديلًا لا صفحة محذوفة.

كيف تنفّذها

  1. إن كنت مستخدمًا جديدًا فلا تبنِ تصميمك عليه، فهو مغلق.
  2. إن كانت لديك مهام قائمة فعامل النافذة على أنها مؤقتة وخطّط للخروج الآن.
  3. انقل عمل تشكيل السلوك إلى مهارة أو موجّه نظام مخزَّن؛ كلاهما أرخص ولا يحتاج تشغيلة تدريب.
  4. انقل التخصيص الحقيقي على مستوى الأوزان إلى نموذج مفتوح الأوزان تستضيفه بنفسك.

القيود

  • لم يعد متاحًا للمستخدمين الجدد.
  • قائمة النماذج الأساسية لم تتجاوز جيل 2025، فحتى حيث يوجد وصول لا يبلغ نقاط التفتيش المتقدّمة الحالية.
  • التوثيق لا ينص على حد أدنى لعدد الأمثلة.

ما ينبغي أن تحصل عليه: لا شيء للمستخدم الجديد. وللمستخدم الحالي نافذة تُغلق.

المصادر والقيود والروابط والسجل

المصادر

لم يذكره المصدر

  • التاريخ الدقيق لانتهاء الوصول الحالي
  • هل هناك مسار تخصيص بديل مخطّط له

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

سجل الفحوص
  • 1 سبتمبر 2026التوثيققيد الإيقافسُجّل متوقّفًا من أول إدخال: دليل الضبط الدقيق لدى المزوّد نفسه ينص على أن المنصة في طور الإغلاق ومغلقة أمام الجدد. أُبقي سجلًا كي تجد الخطط التي اعتمدت عليه مكانًا تحطّ فيه.