انتقل تشغيل النماذج اللغوية الكبيرة محلياً من مشروع هواة إلى خيار إنتاجي مشروع. لكن المقارنات يسهل إساءة قراءتها لأن الأداء يتغير مع الشريحة وعرض حزمة الذاكرة وبناء بيئة التشغيل والتكميم وطول السياق وشكل المطالبة والحمل الخلفي. لذلك يركز هذا الدليل على قرارات تنتقل بين الأجهزة: تقدير الذاكرة واختيار البيئة وحساب التكلفة الإجمالية وتحديد أعباء العمل المناسبة للمحلي.
محطة Apple Silicon عالية الذاكرة إعداد ممكن، ومحطة NVIDIA أو خادم CPU أو حاسوب محمول عادي إعدادات أخرى. لا يتدرج الأداء بصورة متوقعة بينها، لذلك لا يدّعي هذا المقال نتيجة اختبار من benchr على جهاز بعينه. لاختيار النموذج راجع فئة الأوزان المفتوحة والنماذج اللغوية الصغيرة، ثم تحقّق من حجم الملف والتوافق في وثائق المشروع المرتبطة.
تستخدم Apple Silicon عادةً Ollama أو llama.cpp أو MLX، وقد تستخدم نشرات NVIDIA أدوات مثل vLLM وTensorRT-LLM وllama.cpp. تعامل مع كل رقم إنتاجية خارجي على أنه خاص بتهيئته، وأعد قياسه على نظامك المخطط قبل الشراء.
البرمجيات التي تستحق الاستخدام
تمثل بيئات التشغيل الأربع أدناه طبقات نشر مختلفة. التوصية تحريرية مبنية على تصميمها الموثق ومنظومتها العامة، لا على اختبار خاص غير منشور من benchr.
Ollama هي بيئة التشغيل التي يُوصى بها لأي بادئ اليوم. ملف Go صغير يعمل كخدمة خلفية، يدير تنزيلات النماذج عبر أمر بأسلوب السجلّ، ويعرض واجهة HTTP نظيفة على المنفذ 11434. الإعدادات الافتراضية معقولة ومكتبة النماذج واسعة وحديثة. التثبيت أمر واحد، وبإمكان مستخدم كفء أن ينتقل من البدء البارد إلى محادثة نموذج محلي في أقل من خمس دقائق.
llama.cpp هي بيئة التشغيل للإنتاج. مشروع C++ بنوى مُحسَّنة يدوياً لـ Apple Silicon وNVIDIA وAMD والمعالج. أسرع بكثير من Ollama على النموذج نفسه في بعض التهيئات، ويعرض معاملات يخفيها Ollama. الثمن أنه يحتاج تجميعاً يدوياً، وإدارة يدوية لملفات النماذج، وقراءة توثيق أكثر مما هو ممتع تماماً. Ollama مبني فوق llama.cpp، فهذا ليس رفضاً لـ Ollama بقدر ما هو طبقة مختلفة من المنظومة نفسها.
LM Studio يغلّف الاستدلال المحلي في واجهة رسومية لسطح المكتب، وهو مصمم لتصفح النماذج ومقارنتها جنباً إلى جنب. للمستخدمين الذين يبدأون بالواجهة، هو نقطة دخول أسهل من التجميع أو تشغيل عملية خادم.
MLX إطار تعلّم الآلة الرسمي من Apple مع دعم Apple Silicon. تجعله معماريته خياراً مهماً للنشر المقتصر على Apple، بينما تختلف منظومته وتكاملاته عن بيئات llama.cpp. قارن دعم النماذج الحالي وأعد إنتاج الأداء على تهيئتك قبل اختياره للسرعة.
تخطيط الذاكرة بحسب حجم النموذج
النطاقات أدناه تقديرات تخطيط تحريرية وليست قياسات benchr. تختلف الملفات المكمّمة، وتحتاج البيئة أيضاً ذاكرة لمخبأ KV والسياق والنظام والعمليات الأخرى. ابدأ بحجم ملف النموذج الفعلي واترك هامشاً.
| فئة النموذج | التكميم الشائع | نطاق التخطيط | الملاءمة العملية | ما يجب التحقق منه |
|---|---|---|---|---|
| 3B–9B | 4-bit أو 5-bit | نحو 3–8GB مع حمل إضافي | حواسيب محمولة ومكتبية حديثة | حجم الملف وذاكرة السياق والواجهة المدعومة |
| 14B–32B | 4-bit أو 5-bit | نحو 10–24GB مع حمل إضافي | حواسيب عالية الذاكرة أو محطات عمل | عرض حزمة الذاكرة والحمل المستمر |
| فئة 70B | 4-bit أو 5-bit | غالباً أكثر من 40GB مع حمل إضافي | محطة عالية الذاكرة أو خادم | الملف الدقيق ومخبأ KV والهامش المتاح |
لا تقارن نموذجاً محلياً صغيراً بواجهة حدودية على الإنتاجية وحدها. هما يحلان فئات مختلفة من العمل، وتتغير سرعة المحلي وAPI مع التهيئة والحمل. قِس زمن أول رمز ومعدل الإخراج وجودة المهمة ونسبة الفشل على المطالبات التمثيلية نفسها.
تحل API الحدودية والنموذج المحلي مشكلات مختلفة. قد يحفظ المحلي البيانات داخل شبكتك ويلغي فاتورة كل رمز، لكن العتاد والطاقة والصيانة والمراجعة تبقى لها تكلفة.
التعقيد النسبي للنشر المحلي
دليل تخطيط تحريري لا أداء مقاس. تحقّق من الملف والتكميم وإعداد السياق وبيئة التشغيل قبل شراء العتاد.
فئة 3B–9B
تعقيد منخفض أسهل فئة للحاسوب المحمول؛ تحقّق من الذاكرةفئة 14B
متوسط افحص التكميم ودعم بيئة التشغيلفئة 32B
عالٍ خطّط لموارد من فئة محطة العملفئة 70B
عالٍ جداً تحتاج عادةً ذاكرة كبيرة أو عدة أجهزةلا يمكن تعميم نقطة التعادل مع API. فهي تعتمد على سعر الشراء والعمر النافع والكهرباء والصيانة ووقت الهندسة وشكل العبء والاستفادة والنداءات التي يستبدلها النموذج المحلي فعلاً.
التكلفة مقابل العائد، مكتوبة دون بيع أي شيء
استخدم هذه المعادلة: التكلفة المحلية الشهرية = سعر الشراء ÷ أشهر الاستخدام + الكهرباء + التخزين + الصيانة + وقت الهندسة. وقارنها فقط بجزء فاتورة API الذي يستطيع المحلي استبداله بجودة مقبولة. هذه معادلة توضيحية لا ادعاء عن فاتورة خاصة لـbenchr. ولجانب API راجع السعر بحسب حالة الاستخدام.
- التحكم في مكان معالجة بيانات الاستدلال. يمكن لمنظومة محلية معزولة ومضبوطة أن تبقي المواد الحساسة داخل شبكة معتمدة، لكن وجود الأوزان محلياً لا يثبت ذلك وحده: راجع القياس عن بعد، والأدوات البعيدة، وتنزيلات النماذج، والسجلات، والنسخ الاحتياطية، وصادرات المراقبة، ووصول المسؤولين، وكل خدمة متصلة.
- لا توجد رحلة عبر الإنترنت. قد يقلل المحلي التأخير المعتمد على الشبكة، لكن حساب النموذج يستغرق وقتاً؛ قِس زمن الاستجابة من البداية إلى النهاية على إعدادك.
- تكلفة بنية أكثر قابلية للتوقع عند الحجم المستمر. لا تنشئ الطلبات فاتورة لكل رمز، لكنها تستهلك الكهرباء والسعة والتخزين ووقت المشغّل.
إن كانت هذه الخصائص تهم عملك، فقد تبرر البنية المحلية نفسها حتى حين تكون التكلفة النقدية المباشرة متقاربة. وإن لم تهم، تبقى API المُدارة الخيار الأبسط.
تحفّظ يستحق الذكر: العروض التفاعلية لا تثبت السلوك تحت حمل 24/7. ضجيج المروحة والخنق الحراري والتزامن والطوابير والتعافي بعد الأعطال كلها تحتاج اختبار تحمّل على العتاد الذي ستنشره.
أين يُجدي المحلي
ثلاثة أعباء عمل يكون المحلي فيها الخيار الصحيح في 2026، مُسمّاة تحديداً.
الاستخراج المُهيكل من المستندات الواردة: رسائل الدعم ومسودات العقود ونماذج الطلبات. قد يكون نموذج محلي صغير مرشحاً جيداً حين يكون المخطط ضيقاً ويجب أن تبقى البيانات داخل شبكتك. لا تفترض فجوة دقة ثابتة؛ قارنه ببديل API على عينة معنونة من عبء عملك.
إعادة كتابة المحتوى بالجملة مقابل مدوّنة ثابتة، مئات نبذات الميزات وأوصاف المنتجات، وتمريرات النصوص الصغيرة، وأي شيء يتراكم بهدوء لو مُرّرت كل تكراراته عبر API. ينتج النموذج المحلي المسودات وتحرّرها أنت، فالتكلفة الوحيدة وقت تنفقه أصلاً.
التجريب الاستكشافي الذي قد تثبّطه ميزانية API. تلغي السعة المحلية فاتورة كل رمز، لكنها ليست بلا تكلفة؛ احسب وقت الجهاز والكهرباء والمراجعة ومخاطر التدريب على أمثلة اصطناعية.
أين ليس المحلي هو الجواب الصحيح
أي شيء يحتاج قدرة حدّية. تبقى النماذج المحلية، حتى أكبرها التي تتسع على جهاز 64GB، خلف Claude Opus 4.7 وGPT-5 بوضوح في الاستدلال الصعب وفهم الكود متعدد الملفات، وفي ذلك النوع من الكتابة الحساسة للنبرة حيث تهم نبرة النموذج. ادفع نموذجاً محلياً من فئة 70B في عمل ينتمي إلى الحدود فتقضي اليوم تصارع الفجوة.
أي شيء كثيف الوسائط. قصة فهم الصور المحلية أضعف بكثير من واجهات البرمجة المغلقة، ولمهام الرؤية يجب ببساطة أن يذهب العمل إلى Gemini 3.1 Pro Preview عبر واجهته. راجع ترتيب القدرات متعددة الوسائط للصورة الكاملة.
أي شيء لا يملك فريقك شهيةً لصيانة إعداده. المحلي يعني التعامل مع التحديثات وتصحيح ضغط الذاكرة، وقراءة سجل التغييرات كلما شحن llama.cpp تغييراً كاسراً. الفريق الذي لا يريد أن يكون فريق العمليات الخاص به ينبغي أن يبقى على API وأن يتجاوز الإعداد المحلي كلياً.
16GB
Phi-4 mini فئة الحافة، التصنيف32GB
Gemma 2 9B الفئة الوسطى، أعباء مختلطة64GB
Llama 3.3 70B الفئة الاحترافية، عمل جاد128GB+
Maverick 400B محطة عمل، من فئة الحدودOllama للسهولة، llama.cpp للتحكم.
Q4_K_M للسرعة. Q5/Q6 للجودة.
ولّد 500 رمز. وقّت العملية. سجّل رموز/ث.
نقطة نهاية HTTP متوافقة مع OpenAI، المنفذ 11434.
إعداد مرجعي
يمكن لمعمارية مرجعية أن تستخدم Ollama للعمل العابر، وllama.cpp أو خادم موثق آخر خلف المصادقة والطوابير والمراقبة وتثبيت إصدار النموذج للخدمة. احتفظ فقط بالنماذج التي تبررها مجموعة تقييمك، واحصل على الملفات المكمّمة من ناشرين تستطيع التحقق من مصدرهم وترخيصهم. تبدأ المراجع من بطاقة Phi-4 mini وبطاقات Hugging Face ووثائق كل بيئة تشغيل.
ينبغي أن يستخدم الوصول البعيد شبكة خاصة أو بوابة مصادقة. تعتمد موثوقية الإنتاج على المراقبة وتخطيط السعة وعملية التحديث واختبارات التعافي؛ لا يدّعي المقال سجل تشغيل خاصاً لـbenchr.
قد تجعل محطة عالية الذاكرة النماذج الأكبر المكمّمة عملية، بينما تلائم النماذج الصغيرة نطاقاً أوسع من الأجهزة. ولا يوجد جهاز واحد «أرخص وجاد» من دون تحديد النموذج والسياق والتزامن والجودة والسعر المحلي.
إن كنت تتحمّل التكلفة الرأسمالية ولديك أعباء عمل تستفيد من المحلي، بيانات مقيّدة بالخصوصية، ومسارات حساسة لزمن الاستجابة، ومعالجة بالجملة، فالحساب يعمل. اقرن الجهاز المحلي بحساب API حدّية للنداءات التي تحتاج فعلاً قدرة حدّية. للعمل الفردي أو الجاد للفرق الصغيرة في 2026، يصعب التغلّب على هذا الإعداد ذي الطبقتين.
إن لم يبرر عبء عملك العتاد أو التشغيل، فالزم API. راحة البنية المُدارة حقيقية وغالباً تستحق الدفع عند الحجم الصغير أو المتقطع. استخدم معادلة التكلفة أعلاه ومجموعة تقييمك؛ لا يدّعي المقال نقطة تقاطع مالية عالمية.