Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) هو نموذج سريع وفعّال من حيث التكلفة لتحويل النص إلى كلام من Google، وقد تم تصميمه ليحلّ محل gemini-3.1-flash-tts-preview في أحمال العمل الإنتاجية العالية الإنتاجية.
نظرة عامة والإمكانات
تجمع ميزة "تحويل النص إلى كلام" في Gemini 3.8 Flash-Lite بين وقت الاستجابة المنخفض والكلام الطبيعي المعبر:
- الكفاءة العالية في الإنتاج: تم تحسينها لتناسب الإنتاج بكميات كبيرة، والتفاعلات المتسلسلة مع وكيل صوتي، وميزات القراءة بصوت عالٍ، وإنشاء الكلام اليومي من متحدث واحد باللغات الرئيسية.
- التوافق مع المخطط بدون الحاجة إلى تعديل: يشارك مخطط واجهة برمجة التطبيقات (API) وتنسيق الطلبات المنظَّمة نفسه مع
gemini-3.8-flash-tts، ما يتيح لك التبديل بين النماذج من خلال تغيير مَعلمة واحدة. - التوافق الكامل مع منظومة الصوت المتكاملة: تتوافق مع الأصوات الجاهزة، و"مكتبة الأصوات الموسّعة" (
GET /v1beta/voices)، وشخصيات تصميم الصوت المخصّصة، واستنساخ الصوت (الأصوات المخزّنة بشكل دائم تلقائيًا، بالإضافة إلى المفاتيح الاختيارية غير المحفوظة). يمكنك أيضًا تصميم أصوات ومحاكاتها بشكل تفاعلي في Google AI Studio.
يمكنك الانتقال إلى دليل تحويل النص إلى كلام للحصول على تغطية كاملة للميزات وأفضل الممارسات المتعلقة بتقديم الطلبات وأمثلة على الرموز البرمجية.
حالات استخدام نماذج تحويل النص إلى كلام
يتشارك كلا النموذجين Gemini 3.8 لتحويل النص إلى كلام مخطط واجهة برمجة التطبيقات وبنية الطلبات نفسها. اختَر النموذج الذي يناسب حجم عملك:
| الميزة / حجم المعالجة | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| قوة الإعلان الأساسية | معدّل أعلى لنقل البيانات ووقت استجابة سريع وفعالية من حيث التكلفة | أقصى دقة صوتية وأداء تمثيلي دقيق وتغطية لهجات متنوعة |
| أفضل حالات الاستخدام | الإنتاج بكميات كبيرة، وتتالي وكلاء الصوت في الوقت الفعلي، وميزات القراءة بصوت عالٍ، وتكرار الصوت، وإنشاء محتوى يومي بصوت متحدث واحد | الكتب المسموعة، والتعليق الصوتي في الاستوديو، والحوارات المعقّدة بين عدة أشخاص، والأداء التمثيلي الذي يتضمّن الكثير من الصراخ، والكلمات الصعبة اللفظ، واللهجات المحلية |
| اللغات المتاحة | 101 لغة | 130 لغة |
| البديل المقترَح لـ | gemini-3.1-flash-tts-preview |
فئة جديدة من المواد الإبداعية الرئيسية |
دليل نقل البيانات
إذا كنت تريد الترقية من gemini-3.1-flash-tts-preview إلى gemini-3.8-flash-lite-tts، عليك تعديل طلباتك لتتوافق مع مخطط Gemini 3.8 لتحويل النص إلى كلام:
- نقل التوجيهات على مستوى المنعطف إلى
speech_metadata: يعامل نظام تحويل النص إلى كلام 3.8 في Gemini النص المدخل على أنّه نسخة طبق الأصل. قد يتم نطق التوجيهات المضمّنة في النص، مثل"Say cheerfully: Hello!"أو"Speaker 1: Hello!"، بصوت عالٍ. نقل تعليمات التسليم المستدام (style) وتصنيفات المتحدّثين (speaker) إلى البيانات الوصفية المنظَّمة:- Interactions API: أرفِق تعليقًا توضيحيًا يتضمّن
"type": "speech_metadata"و"speaker"و"style"بكل فقرة من المحتوى النصي. - GenerateContent API: أرفِق
"speech_metadata": {"speaker": "...", "style": "..."}بكلpart.
- Interactions API: أرفِق تعليقًا توضيحيًا يتضمّن
- استخدام العلامات المضمّنة بين قوسين زاويين فقط للأحداث الصوتية في نقطة زمنية محددة: يجب تضمين التعبيرات الصوتية غير الكلامية والوقفات المؤقتة في النص باستخدام قوسين زاويين (مثل
<laugh>أو<sigh>أو<cough>أو<breath>أو<short pause>). يجب وضع أساليب التسليم، مثل الهمس، بينspeech_metadata.style. - تحديد
speakerفي كل دورة في الطلبات التي تتضمّن عدة متحدثين: يجب أن تتضمّن كل دورة في الطلبات التي تتضمّن عدة متحدثينspeakerبشكل صريح داخلspeech_metadataبما يتطابق مع أحد المتحدثين الذين تم ضبطهم. - تصميم شخصيات مسبقًا باستخدام "تصميم الصوت": استبدِل فقرات "ملف الصوت" / "ملاحظات المخرج" الطويلة القديمة بصوت مخصّص تم إنشاؤه في تصميم الصوت، ثم استخدِم معرّف
voice_...نفسه في طلبات تحويل النص إلى كلام مع الحد الأدنى من سلاسلstyleأو بدونها. - حساب إخراج WAV التلقائي (
audio/wav) في الطلبات الأحادية: على عكس الإصداراتgemini-3.1-flash-tts-previewالسابقة من نماذج تحويل النص إلى كلام (التي كانت تعرضaudio/l16PCM الأولي بدون عنوان تلقائيًا)، يعرض الإصدار 3.8 من نموذج تحويل النص إلى كلام في Gemini صوت WAV (audio/wav/AUDIO_WAV) مع عنوان RIFF عادي تلقائيًا للطلبات الأحادية.- إذا كان الرمز البرمجي يضمّن سابقًا وحدات بايت PCM أولية في عنوان WAV (على سبيل المثال، باستخدام الوحدة
waveأوffmpegفي Python)، عليك إزالة تضمين العنوان اليدوي وكتابة وحدات البايت التي تم إرجاعها مباشرةً في ملف.wav. - إذا كان مسار التعلّم يتطلّب محتوًى صوتيًا بتنسيق PCM الأولي بدون رأس أو بتنسيق mu-law أو A-law، اضبط
response_formatعلى"audio/l16"("AUDIO_L16") أو"audio/mulaw"("AUDIO_MULAW") أو"audio/alaw"("AUDIO_ALAW"). راجِع تنسيقات إخراج الصوت.
- إذا كان الرمز البرمجي يضمّن سابقًا وحدات بايت PCM أولية في عنوان WAV (على سبيل المثال، باستخدام الوحدة
gemini-3.8-flash-lite-tts
| الموقع | الوصف |
|---|---|
| رمز النموذج | gemini-3.8-flash-lite-tts |
| أنواع البيانات المتوافقة |
المدخلات نص الناتج الصوت |
| حدود الرموز المميزة[*] |
الحدّ الأقصى لعدد الرموز المميزة التي يمكن إدخالها 8,192 الحدّ الأقصى لرموز الناتج المميزة 16,384 |
| الإمكانات | متاح متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح |
| خيارات الاستهلاك |
متاح متاح متاح |
| Versions |
|
| آخر تعديل | يوليو 2026 |
اللغات المتاحة
تتعرّف gemini-3.8-flash-lite-tts تلقائيًا على لغة الإدخال وتتيح استخدام 101 لغة:
| اللغة | اللغة | اللغة |
|---|---|---|
| الأتشيهية (نص عربي) | الجورجية | المالطية |
| الأفريقانية | الألمانية | المانيبورية |
| الأكانية | اليونانية | الماراثية |
| الأمهرية | الغوجاراتية | المينانجكاباو (الخط العربي) |
| الأرمينية | الكريولية الهايتية | ميزو |
| الأسامية | المنغولية الخالخية | النيبالية (لغة فردية) |
| الأوادية | الهوسا | الفولانية النيجيرية |
| باليني | العبرية | الأذربيجانية الشمالية |
| البنغالية | الهندية | السوتو الشمالية |
| البنجرية (نص لاتيني) | الهنغارية | الأوزبكية الشمالية |
| الباسك | الأيسلندية | البوكمالية النرويجية |
| البيلاروسية | الايلوكو | النرويجية الجديدة |
| البهوجبورية | الإندونيسية | النيانجا |
| البوسنية | الفارسية الإيرانية | الأودية (لغة فردية) |
| بوغينيز | الإيطالية | الفارسية (أفغانستان) |
| البلغارية | اليابانية | البولندية |
| الكَنْتونية | الجافانية | البرتغالية |
| الكتالانية | الكامبا | البنجابية |
| السيبيوانية | الكانادا | الرومانية |
| الكردية الوسطى | الكشميرية (الخط العربي) | الروسية |
| التشاتيسغارهية | الكشميرية (نص ديفا) | السنتالية |
| الصينية (نص هان) | الكازاخستانية | الصربية |
| الصينية (نص هان) | الخميرية | السنهالية |
| الكرواتية | الكيكويو | السلوفاكية |
| التشيكية | الكينيارواندا | الأذربيجانية الجنوبية |
| الدانماركية | كونغو | باشتو الجنوبية |
| الهولندية | الكورية | الإسبانية |
| العربية المصرية | القيرغيزية | العربية المعيارية (نص عربي) |
| الإنجليزية | لاو | العربية الفصحى (نص لاتيني) |
| الإستونية | اللينجالا | اللاتفية العادية |
| الفلبينية | المقدونية | الملايو القياسية |
| الفرنسية | ماجادهي | التاميلية |
| الغليشيانية | المايثيلية | التيلوغوية |
| الجاندا | المالايالامية | — |