هذه ليست نسخة صوتية من Gemini العام، بل محطة لإخراج نص محدد كملف صوت. فائدتها تظهر حين تكون الجملة النهائية قد مرت بالمراجعة، ويكون المطلوب اختيار الصوت والنبرة وتقسيم النص ثم اعتماد الأصل الناتج.
فرّق بين قراءة النص والمحادثة
دليل Google يضع TTS لقراءة النص كما هو، بينما يوجه التطبيقات التفاعلية غير المنظمة إلى Live API. بطاقة النموذج لا تسجل Live API أو function calling أو structured output أو grounding أو code execution. إذا كان المستخدم سيقاطع ويسأل ويطلب تنفيذ إجراء، فلا تبنِ الحلقة حول هذا النموذج.
أما السرد والإعلانات والمحتوى الميسر والبودكاست والتعريب، فالفصل مفيد: يراجع المحرر النص أولاً، ثم ينتج الصوت، ثم يحفظ الملف مع نسخة النص والصوت والإعدادات. هذه سلسلة يمكن تدقيقها وإعادة إنتاجها.
دعم العربية بداية الاختبار لا نهايته
العربية موجودة في قائمة اللغات الرسمية، لكن ذلك لا يضمن كل لهجة واسم وعلامة تجارية. اجمع نصوصاً بالفصحى وصياغة منتجك المحلية، وأسماء عربية وأجنبية، وأرقاماً وتواريخ، وانتقالاً بين العربية والإنجليزية. يجب أن يحدد المراجع العبارة التي أخطأت ونوع الخطأ: نطق أم تشديد أم سرعة أم هوية متحدث.
تتيح Google صوتاً واحداً أو متحدثين اثنين، مع ثلاثين صوتاً جاهزاً. في الحوار ثبّت اسم كل شخصية واربطه بصوت واحد، ثم اختبر دوراً قصيراً بعد فقرة طويلة وعودة المتحدث الأول. العينة الأولى لا تثبت أن التوزيع سيبقى صحيحاً حتى نهاية الحلقة.
| الحاجة | المسار الموثق | دليل القبول |
|---|---|---|
| سارد واحد | صوت جاهز وتعليمات أسلوبية | نجاح الأسماء والأرقام والاستمرارية |
| حوار مكتوب | متحدثان وصوتان | لا تبديل للأصوات ولا انجراف في الشخصية |
| تعريب | العربية مدعومة رسمياً | مراجعة لهجة وأسماء وتبديل لغوي |
| طابور إنتاج كبير | Batch API | تسمية ملفات وإعادة محاولة قابلة للتتبع |
| وكيل صوتي | انتقل إلى Live API | لا تحوّل TTS إلى حلقة حوار مصطنعة |
اختبار عملي يقيس تكلفة التحرير
ثبت نصاً قصيراً وآخر طويلاً وأسماء وأرقاماً وتعليمة انفعال وعلامة صوتية مناسبة وحواراً من متحدثين ومقطعاً يحتاج تقسيماً. شغّلها بالصوت والتوزيع والإعدادات نفسها. قِس دقة الكلمات والنطق والالتزام بالنبرة وثبات المتحدث وجودة الوصلة وعدد مرات إعادة التوليد وزمن المراجع حتى الملف المقبول.
لا تجعل النتيجة «أعجب المستمعين» فقط. أحياناً يكون الصوت محبوباً لكنه يحتاج تعديلات كثيرة على النص كي ينطق اسماً واحداً. احتفظ بالنص الأصلي والبرومبت والأصوات ومعرّف النموذج وترتيب المقاطع والملف المعتمد في سجل واحد.
البث وBatch يعالجان مسارين مختلفين
البث يسمح ببدء التشغيل قبل اكتمال المقطع، أما Batch فيخدم طابوراً غير فوري. اختبر في البث بداية الصوت والإلغاء والوقفة بين المقاطع، وفي Batch إعادة المحاولة الجزئية وثبات أسماء الملفات. كلاهما يحتاج مراجعة بشرية.
حد الإدخال المنشور 8,192 توكن، والإخراج 16,384. هذه سقوف وليست طولاً مناسباً لكل مقطع. قسّم النص عند نهاية معنى أو مشهد، واحمل توجيه النطق والنبرة بين الأجزاء، ثم استمع إليها متتابعة لا منفردة.
متى تستبعدها أو تؤجلها؟
استبعدها من وكيل محادثة حية أو تدفق يحتاج أدوات. وأجّل الإنتاج إذا كانت حالة GA شرطاً، أو لا يمكن اعتماد الميزانية بلا سعر عام، أو لم تنجح لهجتك وأسماؤك لدى مراجعين عرب. لا تنقل سعر نموذج Gemini نصي إلى توليد الصوت.
| الحقل | المعلومة الرسمية | أثرها |
|---|---|---|
| الإدخال والإخراج | نص / صوت | راجع النص قبل التوليد |
| السعة | 8,192 إدخال / 16,384 إخراج | قسّم النصوص الطويلة دلالياً |
| الصوت واللغة | 30 صوتاً؛ متحدثان كحد أقصى؛ العربية مدعومة | اختبر الصوت واللهجة والتوزيع نفسه |
| التنفيذ | بث وBatch | مسارا استعادة مختلفان |
| السعر | غير منشور في الصفحة المفحوصة | الميزانية غير مكتملة |