تشغيل النماذج على جهازك

العتاد وبيئات التشغيل وتخطيط الذاكرة وطريقة حساب التكلفة الإجمالية أمام API.

من فريق benchr · · عرض سجل التغييرات

فئة الحاسوب المحمول 3–9B نماذج صغيرة مكمّمة
قاعدة الذاكرة الملف + هامش افحص ملف النموذج الفعلي
الإنتاجية متغيرة العتاد والسياق والبيئة والتكميم
نموذج التكلفة الإجمالية عتاد + طاقة + تشغيل

انتقل تشغيل النماذج اللغوية الكبيرة محلياً من مشروع هواة إلى خيار إنتاجي مشروع. لكن المقارنات يسهل إساءة قراءتها لأن الأداء يتغير مع الشريحة وعرض حزمة الذاكرة وبناء بيئة التشغيل والتكميم وطول السياق وشكل المطالبة والحمل الخلفي. لذلك يركز هذا الدليل على قرارات تنتقل بين الأجهزة: تقدير الذاكرة واختيار البيئة وحساب التكلفة الإجمالية وتحديد أعباء العمل المناسبة للمحلي.

محطة Apple Silicon عالية الذاكرة إعداد ممكن، ومحطة NVIDIA أو خادم CPU أو حاسوب محمول عادي إعدادات أخرى. لا يتدرج الأداء بصورة متوقعة بينها، لذلك لا يدّعي هذا المقال نتيجة اختبار من benchr على جهاز بعينه. لاختيار النموذج راجع فئة الأوزان المفتوحة والنماذج اللغوية الصغيرة، ثم تحقّق من حجم الملف والتوافق في وثائق المشروع المرتبطة.

تستخدم Apple Silicon عادةً Ollama أو llama.cpp أو MLX، وقد تستخدم نشرات NVIDIA أدوات مثل vLLM وTensorRT-LLM وllama.cpp. تعامل مع كل رقم إنتاجية خارجي على أنه خاص بتهيئته، وأعد قياسه على نظامك المخطط قبل الشراء.

البرمجيات التي تستحق الاستخدام

تمثل بيئات التشغيل الأربع أدناه طبقات نشر مختلفة. التوصية تحريرية مبنية على تصميمها الموثق ومنظومتها العامة، لا على اختبار خاص غير منشور من benchr.

Ollama هي بيئة التشغيل التي يُوصى بها لأي بادئ اليوم. ملف Go صغير يعمل كخدمة خلفية، يدير تنزيلات النماذج عبر أمر بأسلوب السجلّ، ويعرض واجهة HTTP نظيفة على المنفذ 11434. الإعدادات الافتراضية معقولة ومكتبة النماذج واسعة وحديثة. التثبيت أمر واحد، وبإمكان مستخدم كفء أن ينتقل من البدء البارد إلى محادثة نموذج محلي في أقل من خمس دقائق.

llama.cpp هي بيئة التشغيل للإنتاج. مشروع C++ بنوى مُحسَّنة يدوياً لـ Apple Silicon وNVIDIA وAMD والمعالج. أسرع بكثير من Ollama على النموذج نفسه في بعض التهيئات، ويعرض معاملات يخفيها Ollama. الثمن أنه يحتاج تجميعاً يدوياً، وإدارة يدوية لملفات النماذج، وقراءة توثيق أكثر مما هو ممتع تماماً. Ollama مبني فوق llama.cpp، فهذا ليس رفضاً لـ Ollama بقدر ما هو طبقة مختلفة من المنظومة نفسها.

LM Studio يغلّف الاستدلال المحلي في واجهة رسومية لسطح المكتب، وهو مصمم لتصفح النماذج ومقارنتها جنباً إلى جنب. للمستخدمين الذين يبدأون بالواجهة، هو نقطة دخول أسهل من التجميع أو تشغيل عملية خادم.

MLX إطار تعلّم الآلة الرسمي من Apple مع دعم Apple Silicon. تجعله معماريته خياراً مهماً للنشر المقتصر على Apple، بينما تختلف منظومته وتكاملاته عن بيئات llama.cpp. قارن دعم النماذج الحالي وأعد إنتاج الأداء على تهيئتك قبل اختياره للسرعة.

تخطيط الذاكرة بحسب حجم النموذج

النطاقات أدناه تقديرات تخطيط تحريرية وليست قياسات benchr. تختلف الملفات المكمّمة، وتحتاج البيئة أيضاً ذاكرة لمخبأ KV والسياق والنظام والعمليات الأخرى. ابدأ بحجم ملف النموذج الفعلي واترك هامشاً.

نطاقات تحريرية لتخطيط الذاكرة؛ تحقّق من ملف النموذج المنشور قبل النشر
فئة النموذجالتكميم الشائعنطاق التخطيطالملاءمة العمليةما يجب التحقق منه
3B–9B4-bit أو 5-bitنحو 3–8GB مع حمل إضافيحواسيب محمولة ومكتبية حديثةحجم الملف وذاكرة السياق والواجهة المدعومة
14B–32B4-bit أو 5-bitنحو 10–24GB مع حمل إضافيحواسيب عالية الذاكرة أو محطات عملعرض حزمة الذاكرة والحمل المستمر
فئة 70B4-bit أو 5-bitغالباً أكثر من 40GB مع حمل إضافيمحطة عالية الذاكرة أو خادمالملف الدقيق ومخبأ KV والهامش المتاح

لا تقارن نموذجاً محلياً صغيراً بواجهة حدودية على الإنتاجية وحدها. هما يحلان فئات مختلفة من العمل، وتتغير سرعة المحلي وAPI مع التهيئة والحمل. قِس زمن أول رمز ومعدل الإخراج وجودة المهمة ونسبة الفشل على المطالبات التمثيلية نفسها.

تحل API الحدودية والنموذج المحلي مشكلات مختلفة. قد يحفظ المحلي البيانات داخل شبكتك ويلغي فاتورة كل رمز، لكن العتاد والطاقة والصيانة والمراجعة تبقى لها تكلفة.

التعقيد النسبي للنشر المحلي

دليل تخطيط تحريري لا أداء مقاس. تحقّق من الملف والتكميم وإعداد السياق وبيئة التشغيل قبل شراء العتاد.

فئة 3B–9B

تعقيد منخفض أسهل فئة للحاسوب المحمول؛ تحقّق من الذاكرة

فئة 14B

متوسط افحص التكميم ودعم بيئة التشغيل

فئة 32B

عالٍ خطّط لموارد من فئة محطة العمل

فئة 70B

عالٍ جداً تحتاج عادةً ذاكرة كبيرة أو عدة أجهزة

لا يمكن تعميم نقطة التعادل مع API. فهي تعتمد على سعر الشراء والعمر النافع والكهرباء والصيانة ووقت الهندسة وشكل العبء والاستفادة والنداءات التي يستبدلها النموذج المحلي فعلاً.

التكلفة مقابل العائد، مكتوبة دون بيع أي شيء

استخدم هذه المعادلة: التكلفة المحلية الشهرية = سعر الشراء ÷ أشهر الاستخدام + الكهرباء + التخزين + الصيانة + وقت الهندسة. وقارنها فقط بجزء فاتورة API الذي يستطيع المحلي استبداله بجودة مقبولة. هذه معادلة توضيحية لا ادعاء عن فاتورة خاصة لـbenchr. ولجانب API راجع السعر بحسب حالة الاستخدام.

  • التحكم في مكان معالجة بيانات الاستدلال. يمكن لمنظومة محلية معزولة ومضبوطة أن تبقي المواد الحساسة داخل شبكة معتمدة، لكن وجود الأوزان محلياً لا يثبت ذلك وحده: راجع القياس عن بعد، والأدوات البعيدة، وتنزيلات النماذج، والسجلات، والنسخ الاحتياطية، وصادرات المراقبة، ووصول المسؤولين، وكل خدمة متصلة.
  • لا توجد رحلة عبر الإنترنت. قد يقلل المحلي التأخير المعتمد على الشبكة، لكن حساب النموذج يستغرق وقتاً؛ قِس زمن الاستجابة من البداية إلى النهاية على إعدادك.
  • تكلفة بنية أكثر قابلية للتوقع عند الحجم المستمر. لا تنشئ الطلبات فاتورة لكل رمز، لكنها تستهلك الكهرباء والسعة والتخزين ووقت المشغّل.

إن كانت هذه الخصائص تهم عملك، فقد تبرر البنية المحلية نفسها حتى حين تكون التكلفة النقدية المباشرة متقاربة. وإن لم تهم، تبقى API المُدارة الخيار الأبسط.

تحفّظ يستحق الذكر: العروض التفاعلية لا تثبت السلوك تحت حمل 24/7. ضجيج المروحة والخنق الحراري والتزامن والطوابير والتعافي بعد الأعطال كلها تحتاج اختبار تحمّل على العتاد الذي ستنشره.

أين يُجدي المحلي

ثلاثة أعباء عمل يكون المحلي فيها الخيار الصحيح في 2026، مُسمّاة تحديداً.

الاستخراج المُهيكل من المستندات الواردة: رسائل الدعم ومسودات العقود ونماذج الطلبات. قد يكون نموذج محلي صغير مرشحاً جيداً حين يكون المخطط ضيقاً ويجب أن تبقى البيانات داخل شبكتك. لا تفترض فجوة دقة ثابتة؛ قارنه ببديل API على عينة معنونة من عبء عملك.

إعادة كتابة المحتوى بالجملة مقابل مدوّنة ثابتة، مئات نبذات الميزات وأوصاف المنتجات، وتمريرات النصوص الصغيرة، وأي شيء يتراكم بهدوء لو مُرّرت كل تكراراته عبر API. ينتج النموذج المحلي المسودات وتحرّرها أنت، فالتكلفة الوحيدة وقت تنفقه أصلاً.

التجريب الاستكشافي الذي قد تثبّطه ميزانية API. تلغي السعة المحلية فاتورة كل رمز، لكنها ليست بلا تكلفة؛ احسب وقت الجهاز والكهرباء والمراجعة ومخاطر التدريب على أمثلة اصطناعية.

أين ليس المحلي هو الجواب الصحيح

أي شيء يحتاج قدرة حدّية. تبقى النماذج المحلية، حتى أكبرها التي تتسع على جهاز 64GB، خلف Claude Opus 4.7 وGPT-5 بوضوح في الاستدلال الصعب وفهم الكود متعدد الملفات، وفي ذلك النوع من الكتابة الحساسة للنبرة حيث تهم نبرة النموذج. ادفع نموذجاً محلياً من فئة 70B في عمل ينتمي إلى الحدود فتقضي اليوم تصارع الفجوة.

أي شيء كثيف الوسائط. قصة فهم الصور المحلية أضعف بكثير من واجهات البرمجة المغلقة، ولمهام الرؤية يجب ببساطة أن يذهب العمل إلى Gemini 3.1 Pro Preview عبر واجهته. راجع ترتيب القدرات متعددة الوسائط للصورة الكاملة.

أي شيء لا يملك فريقك شهيةً لصيانة إعداده. المحلي يعني التعامل مع التحديثات وتصحيح ضغط الذاكرة، وقراءة سجل التغييرات كلما شحن llama.cpp تغييراً كاسراً. الفريق الذي لا يريد أن يكون فريق العمليات الخاص به ينبغي أن يبقى على API وأن يتجاوز الإعداد المحلي كلياً.

16GB

Phi-4 mini فئة الحافة، التصنيف

32GB

Gemma 2 9B الفئة الوسطى، أعباء مختلطة

64GB

Llama 3.3 70B الفئة الاحترافية، عمل جاد

128GB+

Maverick 400B محطة عمل، من فئة الحدود
1. ثبّت بيئة التشغيل

Ollama للسهولة، llama.cpp للتحكم.

2. اسحب نموذجاً مُكمَّماً

Q4_K_M للسرعة. Q5/Q6 للجودة.

3. اختبر الإنتاجية

ولّد 500 رمز. وقّت العملية. سجّل رموز/ث.

4. اربطه بتطبيقك

نقطة نهاية HTTP متوافقة مع OpenAI، المنفذ 11434.

إعداد مرجعي

يمكن لمعمارية مرجعية أن تستخدم Ollama للعمل العابر، وllama.cpp أو خادم موثق آخر خلف المصادقة والطوابير والمراقبة وتثبيت إصدار النموذج للخدمة. احتفظ فقط بالنماذج التي تبررها مجموعة تقييمك، واحصل على الملفات المكمّمة من ناشرين تستطيع التحقق من مصدرهم وترخيصهم. تبدأ المراجع من بطاقة Phi-4 mini وبطاقات Hugging Face ووثائق كل بيئة تشغيل.

ينبغي أن يستخدم الوصول البعيد شبكة خاصة أو بوابة مصادقة. تعتمد موثوقية الإنتاج على المراقبة وتخطيط السعة وعملية التحديث واختبارات التعافي؛ لا يدّعي المقال سجل تشغيل خاصاً لـbenchr.

قد تجعل محطة عالية الذاكرة النماذج الأكبر المكمّمة عملية، بينما تلائم النماذج الصغيرة نطاقاً أوسع من الأجهزة. ولا يوجد جهاز واحد «أرخص وجاد» من دون تحديد النموذج والسياق والتزامن والجودة والسعر المحلي.

إن كنت تتحمّل التكلفة الرأسمالية ولديك أعباء عمل تستفيد من المحلي، بيانات مقيّدة بالخصوصية، ومسارات حساسة لزمن الاستجابة، ومعالجة بالجملة، فالحساب يعمل. اقرن الجهاز المحلي بحساب API حدّية للنداءات التي تحتاج فعلاً قدرة حدّية. للعمل الفردي أو الجاد للفرق الصغيرة في 2026، يصعب التغلّب على هذا الإعداد ذي الطبقتين.

إن لم يبرر عبء عملك العتاد أو التشغيل، فالزم API. راحة البنية المُدارة حقيقية وغالباً تستحق الدفع عند الحجم الصغير أو المتقطع. استخدم معادلة التكلفة أعلاه ومجموعة تقييمك؛ لا يدّعي المقال نقطة تقاطع مالية عالمية.

أسئلة شائعة

هل أستطيع تشغيل نماذج الذكاء الاصطناعي على حاسوب محمول؟

نعم، إذا كان النموذج المكمّم وبيئة التشغيل يتسعان في الذاكرة. نماذج 3B–9B هي الفئة العملية للحاسوب المحمول. ويحتاج نموذج 70B مكمّم عادةً إلى أكثر من 40GB قبل حمل البيئة؛ افحص الملف الفعلي واترك هامشاً. تختلف الإنتاجية بالشريحة والسياق والتكميم والبيئة.

هل أستخدم Ollama أم llama.cpp؟

Ollama للبدء، أمر واحد للتثبيت، وإعدادات افتراضية معقولة، وإدارة نماذج سهلة. وllama.cpp للإنتاج، إعداد يدوي لكنه أسرع وأكثر قابلية للتهيئة. Ollama مبني على llama.cpp، فهما طبقتان مختلفتان من المنظومة نفسها.

هل الذكاء الاصطناعي المحلي أرخص من استخدام API؟

لا توجد نقطة تعادل عالمية. قارن استهلاك العتاد والكهرباء والتخزين والصيانة ووقت الهندسة بالنداءات التي يستطيع النموذج المحلي استبدالها فعلاً بجودة مقبولة.

كم يكلّف تشغيل Phi-4 mini محلياً؟

تستخدم أوزان النموذج الترخيص المبين في بطاقة Microsoft، لكن الاستدلال المحلي ليس مجانياً حرفياً. احسب العتاد والكهرباء والتخزين والصيانة ووقت الهندسة؛ فالإجمالي يعتمد على الاستخدام.

ما أفضل عتاد للذكاء الاصطناعي المحلي في 2026؟

اختر العتاد من حجم ملف النموذج والهامش المطلوب. أنظمة 16GB–32GB هي المجال العملي للنماذج الصغيرة المكمّمة، وقد تحتاج النماذج الأكبر إلى 64GB أو أكثر. تحقّق من التوافق والأداء قبل الشراء.

سجل التغييرات

  • 24 يوليو 2026 — استُبدلت عبارة «البيانات لا تغادر أبداً» بشروط نشر تغطي القياس عن بعد والأدوات البعيدة والسجلات والنسخ الاحتياطية والمراقبة والوصول والخدمات المتصلة.
  • 25 مايو 2026 — تم التحقق من التسعير مقابل توثيق المزوّدين الحالي. حُدِّثت أرقام التكلفة في كل المقالة لتعكس تعديلات أسعار Anthropic وطرح Google لـ Gemini 3.1 Pro Preview.
  • 7 مارس 2026 — نُشر أول مرة.

المراجع

  1. Ollama, ollama.com, اطُّلع عليه في مايو 2026.
  2. "llama.cpp project repository," github.com/ggerganov/llama.cpp, اطُّلع عليه في مايو 2026.
  3. Apple, "MLX framework," github.com/ml-explore/mlx, اطُّلع عليه في مايو 2026.
  4. Hugging Face, "Model hub," huggingface.co, اطُّلع عليه في مايو 2026.