معظم معايير سعات السياق تقيس الشيء الخطأ. تخبرك كم نصاً يتسع، وتصمت عما يستطيع النموذج فعلياً العثور عليه بعد أن يدخل النص.
1M رمز لدى Claude، وفق وثائق API من Anthropic. و1M لدى Gemini 3.1 Pro Preview، وفق صفحة نماذج Gemini من Google. و1M لدى GPT-5، وفق وثائق منصة OpenAI. كانت الحجة التسويقية خلف هذه الأرقام أن السياق الأكبر يساوي قدرة أكبر، وأن النماذج ذات النوافذ الطويلة ستجعل الاسترجاع مجرد أثر من عصر النوافذ الصغيرة. ما تجده عملياً أكثر فوضى من العرض التسويقي. تستحق النافذة الطويلة مكانها في مجموعة ضيقة من سير العمل، وتجلس كعبء مكلف في معظم غيرها، وتخسر صراحة أمام الاسترجاع الصحيح في فئة ثالثة ما زالت الفرق تحاول إجبارها عليها.
تقدم هذه المقالة خطة مقارنة قابلة للإعادة لأربعة تطبيقات للسياق الطويل؛ ولا تزعم أن benchr شغّلها على عبء عمل خاص واحد. أسعار الرموز مأخوذة من صفحة أسعار Anthropic، وأسعار API من OpenAI، وأسعار Google المنشورة. أوزان Llama 4 وشروط الترخيص موثقة في llama.com. يعتمد تفوق السياق الطويل أو الاسترجاع على السؤال والمجموعة وسلوك التخزين المخبأ وعتبة الجودة واستخدام الرموز المقاس. للحجة ضد استخدام السياق الطويل كافتراضي، راجع مقالة تسويق المليون رمز.
الأرقام المعلنة مقابل الأرقام العملية
| النموذج | السياق المعلن | نقطة بدء تحريرية لاختبار الضغط | التكلفة لكل 1M رمز إدخال |
|---|---|---|---|
| Claude Opus 4.7 | 1M | اختبر قرب 600K ثم غيّر الطول والمهمة | $5 |
| Gemini 3.1 Pro Preview | 1M | اختبر قرب 800K ثم غيّر الطول والمهمة | $2 |
| GPT-5 | 400K | اختبر قرب 250K ثم غيّر الطول والمهمة | $1.25 |
| Llama 4 Maverick | 1M | اختبر قرب 250K ثم غيّر الطول والمهمة | تختلف (استضافة ذاتية) |
العمود الثالث خطة اختبار تحريرية مستمدة من أدبيات عامة متباينة عن السياق الطويل، وليس تقدير إجماع ولا نتيجة مقارنة مباشرة. تخبرك الأرقام أين تضيف حالات اختبار ضغط، لا أين ثبت توقف الموثوقية. اختبر البحث عن حقيقة واحدة، والتركيب متعدد الحقائق، والمشتتات، والترتيب، والاستشهادات، والحذف عند أطوال عدة؛ فالحد القابل للاستخدام يعتمد على المجموعة ومعيار التقييم.
25% من السياق المعلن
خط أساسقيّم الاسترجاع والتركيب والاستشهادات والحذف50% من السياق المعلن
ضغطثبّت المستندات والأسئلة ومعيار التقييم75% من السياق المعلن
ضغطأضف مشتتات وأسئلة عابرة للأقسام100% من السياق المعلن
الحدقِس الجودة والكمون والرفض والتكلفة الكليةلا يثبت معيار مضبوط مستشهد به فائزاً عالمياً أو نقطة تدهور ثابتة بين هذه النماذج الأربعة. استخدم الحدود المعلنة لبناء حالات قابلة للمقارنة، وأرقام العمود الثالث كنقاط فحص إضافية فقط. يجب أن تأتي النتيجة المنشورة من مجموعتك المحجوبة ومعيار تقييمك.
تقيس اختبارات needle-in-haystack والتركيب متعدد الحقائق سلوكيات مختلفة، ولا تكون نتائج الأوراق المختلفة قابلة للمقارنة تلقائياً. شغّل عائلتي الاختبارات بالإصدارات والمدخلات نفسها؛ فهذه الصفحة لا تحول تقارير متباينة إلى منطقة موثوقية مقاسة.
ثلاثة أشكال عمل، وثلاثة أحكام مختلفة
لجعل النمط ملموساً، تخيل تقرير سياسة حكومية من 280,000 رمز (نحو 200 صفحة من نثر كثيف) وثلاثة أسئلة مختلفة قد تسألها عنه. أشكال العمل الثلاثة التالية تظهر في المراجعة القانونية وتركيب الأبحاث، وفي أي تحليل عبر المستندات قد تشغله.
عبء العمل الأول: سؤال الركائز الواسع. ما الركائز الثلاث في المستند، وماذا يقول عن التقدم في كل واحدة؟ هذا تصميم تقييم لا نتيجة. قيّم هل يحدد كل مرشح الركائز الثلاث، ويستشهد بالأقسام ذات الصلة، ويحافظ على العمق المطلوب، ويصرّح بعدم اليقين؛ فالمصادر المستشهد بها لا تثبت فائزاً لهذا التقرير الافتراضي.
عبء العمل الثاني: البحث الدقيق. ما المقياس المحدد الذي يستخدمه التقرير لمساهمة القطاع الخاص في الناتج المحلي، وما القيم الحالية والمستهدفة؟ قارن السياق الكامل والاسترجاع في دقة التطابق والاستشهاد بالمصدر والكمون والتكلفة الكلية. لا تفترض أن أياً منهما سيعيد الإجابة الصحيحة؛ فجودة الاسترجاع تعتمد على التقسيم والترتيب، وجودة السياق الطويل تعتمد على موضع المعلومة والمشتتات وسلوك النموذج. في مقالة RAG مقابل الضبط الدقيق إطار للتكلفة.
عبء العمل الثالث: التركيب عبر الأقسام. هل توجد تناقضات داخلية بين ادعاءات القدرة على تحمل تكاليف السكن في الفصول الأولى وتوقعات مزيج الناتج المحلي في الفصول اللاحقة؟ اختبر هل يجد كل نهج القسمين ويشرح العلاقة ويستشهد بالدليل. قد يفوّت استرجاع top-k بسيط اعتماداً بعيداً، بينما قد تستعيده توسعة الاستعلام أو الاسترجاع البياني أو تمريرة سياق طويل؛ ولا تزعم الصفحة فائزاً.
الخيار المعماري تجريبي. استخدم أشكال العمل الثلاثة لتعرف أين يتجاوز السياق الطويل أو الاسترجاع أو النهج الهجين عتبات الجودة والتكلفة لديك.
يستحق السياق الطويل الاختبار للأسئلة العابرة للأقسام، ويستحق الاسترجاع الاختبار للبحث الدقيق. قِس الاثنين قبل اختيار مسار الإنتاج.
طلب 8K
$0.12 لكل طلب Opusطلب 50K
$0.75 لكل طلب Opusطلب 200K
$1.00 لكل طلب Opusطلب 600K
$9.00 لكل طلب Opusاسترجاع RAG
$0.06 مدخل مسترجع توضيحي بحجم 4Kبادئة مخبأة
10% من سعر الإدخال المعياري-
2022
4K · GPT-3.5
رسالة واحدة، بريد واحد، مقال قصير واحد. هذا كل شيء.
-
2023
32K · GPT-4 Turbo
تقرير قصير، قاعدة كود صغيرة، مذكرة طويلة.
-
2024
200K · Claude 2
رواية قصيرة، مستند تقني طويل، وقواعد كود إنتاجية.
-
Feb 2024
1M · Gemini 1.5 Pro
أول سياق مليون رمز واسع الانتشار. كتاب دراسي في طلب واحد.
-
Sep 2025
10M · Llama 4 Scout
حد معلن 10M؛ ولا تزال الجودة القابلة للاستخدام تحتاج اختباراً محلياً.
أرقام نقاط الفحص فرضيات بدء تحريرية مجمعة من مواد عامة متباينة، وليست مناطق موثوقية مقاسة. ولا تعمم تلقائياً على المجموعات القانونية أو العلمية أو السياساتية أو البرمجية أو المنظمة أو الحوارية. سجّل إصدار النموذج وبناء المدخلات والأسئلة وقاعدة التقييم والكمون والتكلفة عند اختبارها.
صورة التكلفة
نسخة الطلب ذات 280,000 رمز على Claude Opus 4.7 تكلف نحو $1.40 لكل سؤال في رموز الإدخال. السؤال نفسه عند إجابته عبر مخزن متجهات مناسب يسترجع المقاطع ذات الصلة يكلف نحو $0.04. هذا فرق 35×. عند سؤال واحد يومياً لن يلاحظ أحد. عند 500 سؤال يومياً، تحسم هذه الفجوة المعمارية نيابة عنك.
يغير التخزين المخبأ هذه الصورة كثيراً. إذا كان المستند الطويل نفسه يُسأل مراراً، يخفض مخبأ المطالبات في Claude تكلفة الإدخال في الطلبات اللاحقة إلى نحو 10% من السعر القياسي. يعمل تخزين Gemini بالآلية نفسها ويخرج أرخص بالقيمة المطلقة. مع التخزين المخبأ، يكلف طلب السياق الطويل على مستند كثير الاستخدام نحو $0.40 لكل سؤال على Claude. هذا ما زال عشرة أضعاف ما سيتقاضاه الاسترجاع، لكنه يقع داخل النطاق الذي تستطيع فيه سير العمل التي تحتاج السياق الطويل فعلاً تبرير دفعه. لصورة التكلفة الأوسع عبر الأعباء، راجع السعر حسب حالة الاستخدام.
قاعدة القرار
للأسئلة الاستكشافية أو العابرة للأقسام، أدرج السياق الطويل في التقييم لأنه يعرض أجزاء بعيدة من المصدر في طلب واحد. اختبر أيضاً خط أساس للاسترجاع أو نهجاً هجيناً؛ فقد تُظهر توسعة الاستعلام والاسترجاع متعدد المراحل الدليل نفسه برموز أقل.
للبحث الدقيق، يعد الاسترجاع معمارية بدء قوية لأنه قد يقلل المدخل المرسل إلى النموذج. تحقق من استدعاء المرتّب ودقة الإجابة والكمون والتكلفة الكلية بدلاً من افتراض فوزه في كل بعد.
للإجابة عالية الحجم ضد مجموعة ثابتة، قارن الاسترجاع أولاً وسعّر بديلاً مخبأً للسياق الطويل أو نهجاً هجيناً. يعتمد الخيار المعقول على معدل إصابة المخبأ وتحديث المجموعة وتشغيل الاسترجاع وتكلفة الفشل والجودة المقاسة.
للمجموعات التي تتجاوز حد سياق النموذج، يجب على النظام اختيار المواد أو ضغطها أو استرجاعها أو تقسيمها قبل الطلبات أو بينها. وتبقى الآلية الأفضل سؤال تصميم للنظام.
تفتح حدود المليون رمز خيارات تقييم جديدة، لكن السعة المعلنة وحدها لا تثبت جودة قابلة للاستخدام لعبء عمل. تعامل مع السياق الطويل والاسترجاع كمكوّنين مرشحين، واختر من قياسات قابلة للإعادة للجودة والتكلفة.
لا تثبت مقارنة مباشرة مضبوطة مستشهد بها أقوى نموذج للسياق الطويل بين هذه الأربعة. أدرج المرشحين الذين يلبون قيود السعة المعلنة والوسائط والنشر والسعر لديك، ثم قارنهم على المجموعة المحجوبة نفسها. أرقام نحو 600K و800K و250K أعلاه مواضع للفحص، لا ترتيبات ولا حدوداً مضمونة.
في نظام إنتاجي، يفيد خط أساس للاسترجاع لأنه يجعل الدليل المختار واستخدام الرموز ظاهرين. أضف مرشحي السياق الطويل والنهج الهجين حيث تبرر الأسئلة العابرة للأقسام ذلك، ثم وجّه الطلبات بحسب الجودة والتكلفة المقاسة. لإطار تقييم أوسع، راجع RAG مقابل الضبط الدقيق، مع الحسابات.