Gemini 3.1 Flash TTS Preview: صوت قابل للتوجيه بحدود المعاينة

نموذج صوت تجريبي من Google بحدود واضحة ودعم للدفعات، لكن سعره العام لم يُنشر بعد.

بقلم فريق benchr التحريري · · · سجل التغييرات · تحققنا من الحقائق المنشورة في المصادر الرسمية في 29 يوليو 2026

Gemini 3.1 Flash TTS Preview: صوت قابل للتوجيه بحدود المعاينة: شرائط طيفية ومسارات للسياق الطويل.
لوحة نموذج من benchr Gemini Flash TTS نص داخل · صوت موجّه خارج
Googleيرافق Gemini 3.1 Flash TTS Preview: صوت قابل للتوجيه بحدود المعاينة تصميم يقوم على شرائط طيفية ومسارات للسياق الطويل.
حد الإدخال8,192رمز نص
حد الإخراج16,384رمز صوت
Batch APIنعمموثق
الإطلاق15 أبريل2026

هذه ليست نسخة صوتية من Gemini العام، بل محطة لإخراج نص محدد كملف صوت. فائدتها تظهر حين تكون الجملة النهائية قد مرت بالمراجعة، ويكون المطلوب اختيار الصوت والنبرة وتقسيم النص ثم اعتماد الأصل الناتج.

فرّق بين قراءة النص والمحادثة

دليل Google يضع TTS لقراءة النص كما هو، بينما يوجه التطبيقات التفاعلية غير المنظمة إلى Live API. بطاقة النموذج لا تسجل Live API أو function calling أو structured output أو grounding أو code execution. إذا كان المستخدم سيقاطع ويسأل ويطلب تنفيذ إجراء، فلا تبنِ الحلقة حول هذا النموذج.

أما السرد والإعلانات والمحتوى الميسر والبودكاست والتعريب، فالفصل مفيد: يراجع المحرر النص أولاً، ثم ينتج الصوت، ثم يحفظ الملف مع نسخة النص والصوت والإعدادات. هذه سلسلة يمكن تدقيقها وإعادة إنتاجها.

دعم العربية بداية الاختبار لا نهايته

العربية موجودة في قائمة اللغات الرسمية، لكن ذلك لا يضمن كل لهجة واسم وعلامة تجارية. اجمع نصوصاً بالفصحى وصياغة منتجك المحلية، وأسماء عربية وأجنبية، وأرقاماً وتواريخ، وانتقالاً بين العربية والإنجليزية. يجب أن يحدد المراجع العبارة التي أخطأت ونوع الخطأ: نطق أم تشديد أم سرعة أم هوية متحدث.

تتيح Google صوتاً واحداً أو متحدثين اثنين، مع ثلاثين صوتاً جاهزاً. في الحوار ثبّت اسم كل شخصية واربطه بصوت واحد، ثم اختبر دوراً قصيراً بعد فقرة طويلة وعودة المتحدث الأول. العينة الأولى لا تثبت أن التوزيع سيبقى صحيحاً حتى نهاية الحلقة.

مصفوفة قرار الاستوديو
الحاجةالمسار الموثقدليل القبول
سارد واحدصوت جاهز وتعليمات أسلوبيةنجاح الأسماء والأرقام والاستمرارية
حوار مكتوبمتحدثان وصوتانلا تبديل للأصوات ولا انجراف في الشخصية
تعريبالعربية مدعومة رسمياًمراجعة لهجة وأسماء وتبديل لغوي
طابور إنتاج كبيرBatch APIتسمية ملفات وإعادة محاولة قابلة للتتبع
وكيل صوتيانتقل إلى Live APIلا تحوّل TTS إلى حلقة حوار مصطنعة

اختبار عملي يقيس تكلفة التحرير

ثبت نصاً قصيراً وآخر طويلاً وأسماء وأرقاماً وتعليمة انفعال وعلامة صوتية مناسبة وحواراً من متحدثين ومقطعاً يحتاج تقسيماً. شغّلها بالصوت والتوزيع والإعدادات نفسها. قِس دقة الكلمات والنطق والالتزام بالنبرة وثبات المتحدث وجودة الوصلة وعدد مرات إعادة التوليد وزمن المراجع حتى الملف المقبول.

لا تجعل النتيجة «أعجب المستمعين» فقط. أحياناً يكون الصوت محبوباً لكنه يحتاج تعديلات كثيرة على النص كي ينطق اسماً واحداً. احتفظ بالنص الأصلي والبرومبت والأصوات ومعرّف النموذج وترتيب المقاطع والملف المعتمد في سجل واحد.

البث وBatch يعالجان مسارين مختلفين

البث يسمح ببدء التشغيل قبل اكتمال المقطع، أما Batch فيخدم طابوراً غير فوري. اختبر في البث بداية الصوت والإلغاء والوقفة بين المقاطع، وفي Batch إعادة المحاولة الجزئية وثبات أسماء الملفات. كلاهما يحتاج مراجعة بشرية.

حد الإدخال المنشور 8,192 توكن، والإخراج 16,384. هذه سقوف وليست طولاً مناسباً لكل مقطع. قسّم النص عند نهاية معنى أو مشهد، واحمل توجيه النطق والنبرة بين الأجزاء، ثم استمع إليها متتابعة لا منفردة.

متى تستبعدها أو تؤجلها؟

استبعدها من وكيل محادثة حية أو تدفق يحتاج أدوات. وأجّل الإنتاج إذا كانت حالة GA شرطاً، أو لا يمكن اعتماد الميزانية بلا سعر عام، أو لم تنجح لهجتك وأسماؤك لدى مراجعين عرب. لا تنقل سعر نموذج Gemini نصي إلى توليد الصوت.

الحدود الموثقة في 29 يوليو 2026
الحقلالمعلومة الرسميةأثرها
الإدخال والإخراجنص / صوتراجع النص قبل التوليد
السعة8,192 إدخال / 16,384 إخراجقسّم النصوص الطويلة دلالياً
الصوت واللغة30 صوتاً؛ متحدثان كحد أقصى؛ العربية مدعومةاختبر الصوت واللهجة والتوزيع نفسه
التنفيذبث وBatchمسارا استعادة مختلفان
السعرغير منشور في الصفحة المفحوصةالميزانية غير مكتملة

أسئلة شائعة

هل هو نموذج وكيل صوتي؟

لا. تضع Google TTS لقراءة نص محدد، وتوجه الحوار الصوتي التفاعلي إلى Live API. بطاقة هذا النموذج لا توثق Live API أو function calling.

هل يدعم العربية وأكثر من متحدث؟

نعم. دليل Google يدرج العربية ويدعم صوتاً واحداً أو متحدثين اثنين. تبقى جودة اللهجة والأسماء وتوزيع الشخصيات بحاجة إلى اختبار بشري.

كم صوتاً جاهزاً توثق Google؟

يدرج دليل توليد الكلام 30 صوتاً جاهزاً. العدد لا يثبت ملاءمة صوت بعينه لهوية المنتج أو اللغة.

ما السعة وطرق التنفيذ؟

تسجل الصفحة 8,192 توكن إدخال و16,384 إخراج ودعم Batch، ويسجل سجل التغييرات إضافة التوليد المتدفق في 17 يونيو 2026.

هل يوجد سعر عام منشور؟

لم نجد سعراً عاماً لكل توكن في صفحة النموذج الرسمية المفحوصة. أبقِ التكلفة غير محسومة حتى توفر Google شروطاً حالية.

سجل التغييرات

  • 29 يوليو 2026 — أعدنا التحقق من بطاقة النموذج وسجل التغييرات ودليل الصوت، وأضفنا تغطية العربية والمتحدثين ومصفوفة استوديو وعبء تعريب وتشغيل البث وBatch.
  • 28 يوليو 2026 — نُشرت الصفحة بعد مراجعة المصادر الرسمية وتسجيل الفجوات غير المنشورة.

المراجع

  1. بطاقة النموذج الرسمية: Gemini 3.1 Flash TTS Preview
  2. سجل الإطلاق وإضافة البث: سجل تغييرات Gemini API
  3. دليل الأصوات واللغات والمتحدثين: توليد الكلام