هذا دليل تقييم لأربعة منتجات، لا سجل اختبار خاص من benchr. يفصل القدرات والأسعار المنشورة من المزوّد عن اختبارات الكمون والطبيعية والعربية والموافقة التي يجب أن يعيد فريقك إنتاجها.
اختر مكدس الصوت من هذه النماذج الإنتاجية الأربعة الجادة. الاختيارات أدناه تخبرك أي نموذج ينتمي إلى أي مسار في تطبيقك.
يغطي المقال أربعة أدوار شائعة: السرد بالإنجليزية والعربية، والتعرّف على الكلام، والمحادثة التفاعلية. كما يفصل موافقة الصوت المخصص كقرار منتج وقانوني مستقل. قد تقلل معمارية متعددة المزودين الارتهان، لكن جدواها تعتمد على عبء عملك المقاس.
المغطى: ElevenLabs لتوليد الكلام، وWhisper Large V3 للتعرّف، وRealtime API من OpenAI للتفاعل الصوتي الأصلي، وCartesia Sonic لبث تحويل النص إلى كلام. البدائل المفتوحة خارج نطاق الصفحة، ولا يُدّعى تفوق عربي مقارن بلا تقييم منشور.
تبدأ القائمة التحريرية بـElevenLabs للسرد المسجل، وبـCartesia أو OpenAI Realtime للمسارات التفاعلية لأن هذا هو تموضع المنتجات. ذلك ليس ترتيباً مقاساً. يتغير الكمون بحسب المنطقة والاتصال والصوت وشكل الطلب وحمل المزوّد، فلا ينبغي لرقم مستعار أن يحسم المعمارية.
السرد بالإنجليزية
للسرد المسجل، ينتمي ElevenLabs إلى القائمة لأن المنتج يركز على اختيار الأصوات والتعبير. لا تحوّل هذا التموضع إلى نتيجة طبيعية عالمية؛ اطلب من مستمعي الجمهور مراجعة مقاطع طويلة وأسماء وأرقام واختصارات وأنماط ترقيم حقيقية.
ينتمي Realtime من OpenAI إلى قائمة التفاعل لأنه يجمع مدخل الصوت ومخرجه. قيّم نطق المصطلحات التقنية والمقاطعة واستدعاء الأدوات وكمون الدور الكامل؛ لا تدّعي الصفحة مقارنة خاصة لملمس الصوت أو زمن أول صوت.
يتموضع Cartesia Sonic لبث النص إلى كلام منخفض الكمون. ضعه ضمن المرشحين عندما تهم الاستجابة، ثم قيّم الطبيعية والإيقاع منفصلين عن السرعة. لا يثبت التموضع وحده أن كل اتصال أو صوت سيكون أسرع.
ما إذا كانت فجوة الطبيعية في Cartesia ستغلق مع تدريب النموذج على بيانات أكثر، أو أنها اختلاف معماري جوهري عن طريقة ElevenLabs في التعامل مع الإيقاع، سؤال مفتوح لا تستطيع التقارير العامة حسمه بعد.
اختبارات الكمون التي تعيد إنتاجها
لا توجد هنا قيم مللي ثانية مقاسة من benchr. استخدم النص والمنطقة والاتصال والصوت والتزامن نفسها.
Cartesia Sonic
أول صوت قِس الزمن من النص إلى أول صوتOpenAI Realtime
الدور الكامل قِس نهاية الكلام إلى صوت الاستجابةElevenLabs v3
بدء البث قِس الزمن من النص إلى أول صوتWhisper (تعرّف فقط)
التفريغ قِس اكتمال تحويل الكلام إلى نصنقطة عدم يقين واحدة: موافقة استنساخ الصوت. القدرة التقنية لاستنساخ الصوت سبقت بنية الموافقة. لا تقدم هذه المقالة توصية سياساتية؛ ينبغي أن يكون الافتراض العملي في الإنتاج أن النظام القانوني سيشتد، وربما بأثر رجعي. ابنِ تدفق الموافقة داخل تطبيقك الآن.
السرد بالعربية
تثبت صفحات الدعم أي المنتجات يعرض أصواتاً عربية، لكن الدعم لا يعني سرداً بمستوى متحدث أصلي. قيّم الفصحى منفصلة عن كل لهجة، وأدخل الأرقام والأسماء والغموض الحركي والنص العربي-الإنجليزي في المراجعة.
استخدم المراجعة نفسها لصوت OpenAI بدلاً من افتراض الجودة من وسم دعم اللغة، وسجّل إصدار النموذج أو الصوت لأن تحديث المزوّد قد يغير النطق بلا تغيير في كودك.
تحقّق من إتاحة العربية الحالية في وثائق Cartesia واختبر الأصوات المتاحة فعلياً. لا تستنتج وفاء اللهجة من دعم الفصحى؛ الخليجية والمصرية وغيرها تحتاج عينات ومراجعين منفصلين.
Whisper Large V3 خط أساس مفتوح شائع، لكن بحثه المستشهَد به لا يثبت الأداء على مزيج لهجاتك أو ظروف الصوت. قارنه بالبدائل الحالية على الفصحى وكل لهجة تخدمها، بما في ذلك الضوضاء وتبديل اللغة والأسماء والأرقام. للمزيد راجع الذكاء الاصطناعي للمحتوى العربي.
في معظم أعمال الصوت الإنتاجية، تكون النماذج العليا أقرب مما يوحي التسويق، والمواضع القليلة التي تتباعد فيها هي التي تحدد معماريتك.
كمون المحادثة في الوقت الحقيقي
للمنتج التفاعلي، قِس الزمن من نهاية كلام المستخدم إلى بداية صوت النموذج. الجدول أدناه ورقة قياس لا نتيجة benchr.
| المكدس | ما تقيسه | ما تثبته | ما تنشره |
|---|---|---|---|
| Cartesia Sonic (TTS فقط) | النص إلى أول صوت | الصوت والمنطقة والنص والاتصال | P50 وP95 والأخطاء |
| OpenAI Realtime API | نهاية الكلام إلى صوت الرد | المطالبة والأدوات والمنطقة والاتصال | P50 وP95 والمقاطعات |
| بث ElevenLabs | النص إلى أول صوت | الصوت والنموذج والنص والاتصال | P50 وP95 والأخطاء |
| ASR ← LLM ← TTS مخصص | الدور الكامل وكل مرحلة | كل الإصدارات والتزامن | P50 وP95 ومرحلة الفشل |
الخط المخصص هو خط الأساس الواقعي إذا كنت تبني وكيل صوتك بنفسك. هذا ما يحدث عندما تُسلسل التفريغ وLLM وTTS واحداً بعد الآخر. حلول المكدس الكامل أسرع بكثير مما ستبنيه لأنها توازي الخطوات وتبدأ توليد الصوت قبل اكتمال استجابة LLM.
ضع ميزانية تفاعل من بحث المستخدمين لمنتجك، ثم انشر الوسيط وذيل الكمون لا أفضل تشغيل منفرد. تستطيع المنتجات الأصلية المتزامنة موازاة المراحل، بينما يكشف خط ASR ثم LLM ثم TTS مكونات أكثر للتحسين. لا يفترض الجدول أي خيار يجتاز عتبتك.
مراجعة الطبيعية
استخدم مراجعة بشرية معماة؛ التسميات أدناه أدوار تقييم لا درجات benchr.
ElevenLabs v3
مرشح للسرد راجع الصوت الطويل والتنغيمOpenAI Realtime
مرشح للتفاعل راجع تبادل الأدوار والمقاطعةCartesia Sonic
مرشح للبث راجع الإيقاع منفصلاً عن السرعةاستنساخ الصوت
وصفت الصفحة سابقاً تجربة استنساخ بلوحة استماع صغيرة من دون نشر التسجيلات أو سجل الموافقة أو الإصدارات أو البروتوكول. وقد سُحبت النتائج ولا ينبغي معاملتها كدليل على أي مزوّد.
لتقييم صوت مخصص بصورة مشروعة، استخدم متحدثاً أعطى موافقة واعية موثقة، واتبع قواعد الأهلية والإفصاح الحالية، وأمّن التسجيلات، وحدد إجراءات الحذف وسحب الموافقة قبل الرفع.
يجب أن تكون مراجعة الجودة معماة وتفصل تشابه المتحدث وقابلية الفهم والإيقاع والعيوب ومقاومة الإساءة. لا تنشر عينة معرّفة من دون إذن صريح.
الآثار الأخلاقية لاستنساخ صوت بهذه الجودة حقيقية وليست ضمن نطاق هذه المراجعة. إذا كنت تبني بهذه التقنية، تحتاج ميزتك إلى قصة موافقة ووسم مائي قبل الشحن. تجاهل ذلك وأنت تهيئ نفسك لحادثة.
التسعير حتى أبريل 2026
يتقاضى ElevenLabs نحو $0.30 لكل دقيقة صوت مولدة في الطبقة القياسية، وينخفض إلى نحو $0.15 لكل دقيقة في طبقة الحجم العالي، وفق صفحة أسعار ElevenLabs. يعمل OpenAI Realtime API حول $0.06 لكل دقيقة إدخال صوتي و$0.24 لكل دقيقة إخراج صوتي، وفق أسعار API من OpenAI. Cartesia هو الأرخص عند نحو $0.04 لكل دقيقة مولدة، مع خصومات حجم تهبط أكثر. Whisper للتفريغ حول $0.006 لكل دقيقة، وهو رخيص بما يكفي لأن تكون تكلفة جانب التعرّف غالباً خطأ تقريب مقارنة بالتركيب. لسياق تكلفة أوسع عبر الأعباء، راجع السعر حسب حالة الاستخدام.
حساب توضيحي فقط: ضرب ألف دقيقة يومياً في ثلاثين يوماً وفي الأسعار المدرجة لكل دقيقة يعطي نحو $9,000 مقابل $1,200 قبل خصومات الحجم والضرائب وإعادة المحاولة والخدمات المصاحبة. تحقّق من الأسعار الحالية واستبدل كل افتراض باستخدامك الفعلي قبل قرار المعمارية.
ElevenLabs v3
سرد مرشح سرد؛ راجع السعر الحاليWhisper Large V3
ASR تعرّف على الكلام، $0.006/دقيقةOpenAI Realtime
محادثة طبقة وسطى، حزمة كاملةCartesia Sonic
فوري مرشح بث؛ قِس الكمون محلياًجملة ستُقرأ بصوت مسموع.
النموذج الصوتي يقرر التوقيت والتشديد.
تُولد مقاطع الصوت أثناء معالجة النص.
قِس أول صوت كما يراه العميل على الاتصال المستهدف.
تقسيم المكدس مجدٍ
المعمارية الصحيحة لعمل صوت جاد في 2026 تشغّل مزودين لا واحداً.
للمسارات الحساسة للكمون، اختصر قائمة منتج بث وطبقة تعرّف ثم قِس الدور الكامل. Cartesia وOpenAI Realtime مرشحان أوليان معقولان، وWhisper خط أساس شائع للتعرّف. لا تدّعي الصفحة نتيجة دون 300 ms أو نسبة تكلفة عالمية.
لمسارات السرد (الكتب الصوتية، والمحتوى المنطوق الطويل، والبودكاست المسجل) استخدم ElevenLabs v3. فرق الجودة مسموع بعد بضع جمل، والكمون لا يهم عندما يُشغّل الصوت لاحقاً.
لمساراتك متعددة اللغات حيث الجمهور المستهدف عربي، يتعامل ElevenLabs مع الفصحى بما يكفي لشحن محتوى عالي الجودة. ويتعامل Cartesia مع الفصحى بما يكفي لشحن محتوى نفعي. لا يتعامل أي منهما مع اللهجة بمستوى متحدث أصلي. إذا كان العمل اللهجي مهماً لجمهورك، فضع ميزانية لموهبة صوتية بشرية.
نضج سوق الصوت بالذكاء الاصطناعي إلى درجة أصبح فيها اختيار المزود قرار معمارية لا قرار جودة فقط. كل لاعب جاد من الأربعة يناسب عبء عمل مختلفاً ويقصر في الباقي. أكثر خطأ ترتكبه الفرق في 2026 هو اختيار مزود واحد لكل شيء (غالباً ElevenLabs بسبب معرفة الاسم) وتحمل عقوبة الكمون أو التكلفة بدلاً من تقسيم المكدس عبر مسارات تطبيقك.
إذا كنت تبني ميزات صوتية في العام المقبل، فصمم نظامك ليدعم عدة مزودين من البداية. غلّف طبقات التركيب والتعرّف خلف واجهات نظيفة. استخدم النموذج الصحيح لكل مسار.
معظم النشرات الإنتاجية التي ستصادفها تعتمد على ElevenLabs للسرد وWhisper للتعرّف، مع Cartesia لمسارات الوقت الحقيقي. اختر ما يناسب كل مهمة؛ فرق التكلفة أكبر من أن تشغّل أداة واحدة لكل شيء.