Gemini 3.8 Flash-Lite TTS

‫Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) هو نموذج سريع وفعّال من حيث التكلفة لتحويل النص إلى كلام من Google، وقد تم تصميمه ليحلّ محل gemini-3.1-flash-tts-preview في أحمال العمل الإنتاجية العالية الإنتاجية.

نظرة عامة والإمكانات

يجمع Gemini 3.8 Flash-Lite TTS بين وقت الاستجابة المنخفض والكلام الطبيعي المعبر:

  • الكفاءة العالية في معالجة البيانات: تم تحسينها لتناسب الإنتاج بكميات كبيرة، وسلاسل وكلاء المحادثات الصوتية، وميزات القراءة بصوت عالٍ، وإنشاء الكلام اليومي من متحدث واحد باللغات الرئيسية.
  • توافق مخطط واجهة برمجة التطبيقات (API) بدون تعديل: يشارك مخطط واجهة برمجة التطبيقات (API) نفسه وتنسيق الطلبات المنظَّمة مع gemini-3.8-flash-tts، ما يتيح لك التبديل بين النماذج من خلال تغيير مَعلمة واحدة.
  • التوافق الكامل مع منظومة الصوت المتكاملة: تتوافق هذه الميزة مع الأصوات الجاهزة، و"مكتبة الأصوات الموسّعة" (GET /v1beta/voices)، وشخصيات تصميم الصوت المخصّصة، واستنساخ الصوت (الأصوات المخزّنة بشكل دائم تلقائيًا، بالإضافة إلى مفاتيح اختيارية بدون حالة). يمكنك أيضًا تصميم أصوات ونسخها بشكل تفاعلي في Google AI Studio.

يمكنك الانتقال إلى دليل تحويل النص إلى كلام للحصول على تغطية كاملة للميزات وأفضل الممارسات المتعلقة بتقديم الطلبات وأمثلة على الرموز البرمجية.

حالات استخدام نماذج تحويل النص إلى كلام

يتشارك كلا النموذجين Gemini 3.8 لتحويل النص إلى كلام مخطط واجهة برمجة التطبيقات وبنية الطلبات نفسها. اختَر النموذج الذي يناسب حجم عملك:

الميزة أو حجم المعالجة Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
قوة الإعلان الأساسية معدّل أعلى لنقل البيانات ووقت استجابة سريع وفعالية من حيث التكلفة أقصى دقة صوتية وأداء تمثيلي دقيق وتغطية لهجات متنوعة
أفضل حالات الاستخدام الإنتاج بكميات كبيرة، وتتالي وكلاء الصوت في الوقت الفعلي، وميزات القراءة بصوت عالٍ، وتكرار الصوت، وإنشاء محتوى يومي باستخدام مكبّر صوت واحد الكتب المسموعة، والتعليق الصوتي في الاستوديو، والحوارات المعقّدة بين عدة أشخاص، والأداء الصوتي المكثّف، وطريقة اللفظ الصعبة، واللهجات المحلية
اللغات المتاحة ‫101 لغة ‫130 لغة
البديل المقترَح لـ gemini-3.1-flash-tts-preview فئة جديدة من المواد الإبداعية الرئيسية

دليل نقل البيانات

إذا كنت تريد الترقية من gemini-3.1-flash-tts-preview إلى gemini-3.8-flash-lite-tts، عليك تعديل طلباتك لتتوافق مع مخطط Gemini 3.8 لتحويل النص إلى كلام:

  1. نقل التوجيهات على مستوى المنعطف إلى speech_metadata: يعامل محرك تحويل النص إلى كلام 3.8 من Gemini النص المدخل على أنّه نسخة طبق الأصل. قد تتم قراءة توجيهات النص المضمّنة، مثل "Say cheerfully: Hello!" أو "Speaker 1: Hello!"، بصوت عالٍ. نقل تعليمات التسليم المستدام (style) وتصنيفات المتحدّثين (speaker) إلى البيانات الوصفية المنظَّمة:
    • واجهة Interactions API: أرفِق تعليقًا توضيحيًا يتضمّن "type": "speech_metadata" و"speaker" و"style" بكل فقرة من المحتوى النصي.
    • ‫GenerateContent API: أرفِق "speech_metadata": {"speaker": "...", "style": "..."} بكل part.
  2. استخدام علامات مضمّنة بين قوسين زاويين فقط للأحداث الصوتية في نقطة زمنية محددة: يجب تضمين التعبيرات الصوتية غير الكلامية المؤقتة والفواصل في نص الفيديو باستخدام قوسين زاويين (مثل <laugh> أو <sigh> أو <cough> أو <breath> أو <short pause>). يجب وضع أساليب الأداء، مثل الهمس، بين speech_metadata.style.
  3. تحديد speaker في كل منعطف في طلبات المتحدثين المتعددين: يجب أن يتضمّن كل منعطف في طلب المتحدثين المتعددين speaker بشكل صريح داخل speech_metadata بما يتطابق مع أحد المتحدثين الذين تم ضبطهم.
  4. تصميم شخصيات مسبقًا باستخدام "تصميم الصوت": استبدِل فقرات "ملف الصوت" / "ملاحظات المخرج" الطويلة القديمة بصوت مخصّص تم إنشاؤه في تصميم الصوت، ثم استخدِم معرّف voice_... في طلبات تحويل النص إلى كلام مع سلاسل style فارغة أو بأقل قدر من المحتوى.
  5. احتساب الناتج التلقائي بتنسيق WAV (audio/wav) في الطلبات الأحادية: على عكس إصدارات gemini-3.1-flash-tts-preview والإصدارات الأقدم من نماذج تحويل النص إلى كلام (التي كانت تعرض audio/l16 بتنسيق PCM الأولي بدون عنوان تلقائيًا)، يعرض الإصدار 3.8 من ميزة "تحويل النص إلى كلام" في Gemini صوت WAV (audio/wav / AUDIO_WAV) مع عنوان RIFF عادي تلقائيًا للطلبات الأحادية.
    • إذا كان الرمز البرمجي يغلّف وحدات بايت PCM الأولية في رأس WAV (على سبيل المثال، باستخدام الوحدة wave أو ffmpeg في Python)، عليك إزالة غلاف الرأس اليدوي وكتابة وحدات البايت التي تم إرجاعها مباشرةً في ملف .wav.
    • إذا كان مسار التعلّم يتطلّب صوت PCM الأولي بدون عنوان أو صوت mu-law أو A-law، اضبط response_format.mime_type بشكل صريح على "audio/l16" أو "audio/mulaw" أو "audio/alaw" (على سبيل المثال، {"response_format": {"type": "audio", "mime_type": "audio/l16"}} في Interactions API أو AUDIO_L16 أو AUDIO_MULAW أو AUDIO_ALAW في generateContent). راجِع تنسيقات إخراج الصوت.

gemini-3.8-flash-lite-tts

الموقع الوصف
رمز النموذج gemini-3.8-flash-lite-tts
أنواع البيانات المتوافقة

المدخلات

نص

الناتج

الصوت

حدود الرموز المميزة[*]

الحدّ الأقصى لرموز الإدخال المميزة

8,192

الحدّ الأقصى لرموز الناتج المميزة

‫16,384 (الحد الأقصى لعدد الرموز المميزة التي يمكن أن تعرضها Gemini API)

الإمكانات

إنشاء الصوت

متاح

التخزين المؤقت

غير متاح

تنفيذ الرموز البرمجية

غير متاح

البحث عن الملفات

غير متاح

استدعاء الدوال

غير متاح

استخدام "خرائط Google" كمصدر

غير متاح

إنشاء الصور

غير متاح

Live API

غير متاح

تحديد المصادر في "بحث Google"

غير متاح

المُخرجات المنظَّمة

غير متاح

التفكير

غير متاح

سياق عنوان URL

غير متاح

خيارات الاستهلاك

Batch API

متاح

الاستنتاج المرن

متاح

استنتاج الأولوية

متاح

Versions
يمكنك الاطّلاع على أنماط إصدارات النماذج لمزيد من التفاصيل.
  • gemini-3.8-flash-lite-tts
آخر تعديل سبتمبر 2026

اللغات المتاحة

يتعرّف gemini-3.8-flash-lite-tts تلقائيًا على لغة الإدخال ويتيح استخدام أكثر من 100 لغة:

اللغة اللغة اللغة
الأتشيهية (نص عربي) الألمانية المانيبورية
الأفريقانية اليونانية المراثية
الأكانية الغوجاراتية المينانجكاباو (الخط العربي)
الأمهرية الكريولية الهايتية ميزو
الأرمينية المنغولية الخالخية النيبالية (لغة فردية)
الأسامية الهوسا الفولانية النيجيرية
الأوادية العبرية الأذربيجانية الشمالية
باليني الهندية السوتو الشمالية
البنغالية الهنغارية الأوزبكية الشمالية
البنجرية (نص لاتيني) الأيسلندية البوكمالية النرويجية
الباسك الايلوكو النرويجية الجديدة
Belarusian الإندونيسية النيانجا
البهوجبورية الفارسية الإيرانية الأورية (لغة فردية)
البوسنية الإيطالية الفارسية (أفغانستان)
بوغينيز اليابانية البولندية
البلغارية الجافانية البرتغالية
الكَنْتونية الكامبا البنجابية
الكتالانية الكانادا الرومانية
السيبيوانية الكشميرية (نص عربي) الروسية
الكردية الوسطى الكشميرية (نص ديفا) السنتالية
التشاتيسغارهية الكازاخستانية الصربية
الصينية (نص هان) الخميرية السنهالية
الصينية (نص هان) الكيكويو السلوفاكية
الكرواتية الكينيارواندا الأذربيجانية الجنوبية
التشيكية كونغو باشتو جنوبية
الدانماركية الكورية الإسبانية
الهولندية القيرغيزية العربية العادية (نص عربي)
العربية المصرية لاو العربية الفصحى (نص لاتيني)
الإنجليزية اللينجالا اللاتفية العادية
الإستونية المقدونية الماليزية المعيارية
الفلبينية ماجادهي التاميلية
الفرنسية المايثيلية التيلوغوية
الغليشيانية المالايالامية التركية
الجاندا المالطية الفيتنامية
الجورجية — —