Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) هو نموذج رائد من Google لتحويل النص إلى كلام، وهو مصمّم لتقديم صوت عالي الجودة، وأداء معبّر، ولهجات محلية أصيلة، وثبات قوي في المحادثات الطويلة المتعددة الأدوار.
نظرة عامة والإمكانات
يضع نظام إنشاء الصوت (TTS) من Gemini 3.8 Flash معيارًا جديدًا لإنشاء محتوى صوتي معبّر:
- دقة صوتية عالية وتفاصيل دقيقة في الأداء: توفّر هذه الميزة نطاقًا عاطفيًا غنيًا، وإيقاعًا طبيعيًا، والتزامًا دقيقًا بالتعليمات
styleعلى مستوى الجمل والأحداث الصوتية المضمّنة (<laugh>و<sigh>و<short pause>). - ثبات المحتوى الطويل المتعدد الجلسات: الحفاظ على اتساق هوية الصوت وطبقة الصوت ومستوى الصوت ونبرة الغرفة الصوتية خلال الحوارات الطويلة والسرد الذي يستغرق عدة دقائق بدون حدوث أي انحراف في الصوت
- اللهجات واللفظ الإقليميان الأصيلان: تتوافق هذه الميزة مع اللهجات الإقليمية واللهجات الخاصة بالأقليات.
- التوافق الكامل مع منظومة الصوت المتكاملة: تتوافق هذه الميزة بسلاسة مع الأصوات الجاهزة،
و"مكتبة الأصوات الموسّعة" (
GET /v1beta/voices)، وتصميم الأصوات المخصّصة، واستنساخ الأصوات (يتم تلقائيًا تخزين الأصوات بشكل دائم، بالإضافة إلى مفاتيح اختيارية بدون حالة). يمكنك أيضًا تصميم أصوات ونسخها بشكل تفاعلي في Google AI Studio.
يمكنك الانتقال إلى دليل تحويل النص إلى كلام للحصول على تغطية كاملة للميزات وأفضل الممارسات المتعلقة بتقديم الطلبات وأمثلة على الرموز البرمجية.
حالات استخدام نماذج تحويل النص إلى كلام
يتشارك كلا النموذجين Gemini 3.8 لتحويل النص إلى كلام مخطط واجهة برمجة التطبيقات وبنية الطلبات نفسها. اختَر النموذج الذي يناسب حجم عملك:
| الميزة أو حجم المعالجة | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| قوة الإعلان الأساسية | أقصى دقة صوتية وأداء تمثيلي دقيق وتغطية لهجات متنوعة | معدّل أعلى لنقل البيانات ووقت استجابة سريع وفعالية من حيث التكلفة |
| أفضل حالات الاستخدام | الكتب المسموعة، والتعليق الصوتي في الاستوديو، والحوارات المعقّدة بين عدة أشخاص، والأداء الصوتي المكثّف، وطريقة اللفظ الصعبة، واللهجات المحلية | الإنتاج بكميات كبيرة، وتتالي وكلاء الصوت في الوقت الفعلي، وميزات القراءة بصوت عالٍ، وتكرار الصوت، وإنشاء محتوى يومي باستخدام مكبّر صوت واحد |
| اللغات المتاحة | 130 لغة | 101 لغة |
| البديل المقترَح لـ | فئة جديدة من المواد الإبداعية الرئيسية | gemini-3.1-flash-tts-preview |
دليل نقل البيانات
إذا كنت تنقل البيانات من إصدار gemini-3.1-flash-tts-preview أو إصدار أقدم من نماذج Gemini لتحويل النص إلى كلام، عدِّل طلباتك لتتوافق مع مخطط Gemini 3.8 لتحويل النص إلى كلام:
- نقل التوجيهات على مستوى المنعطف إلى
speech_metadata: يعامل محرك تحويل النص إلى كلام 3.8 من Gemini النص المدخل على أنّه نسخة طبق الأصل. قد تتم قراءة توجيهات النص المضمّنة، مثل"Say cheerfully: Hello!"أو"Speaker 1: Hello!"، بصوت عالٍ. نقل تعليمات التسليم المستدام (style) وتصنيفات المتحدّثين (speaker) إلى البيانات الوصفية المنظَّمة:- واجهة Interactions API: أرفِق تعليقًا توضيحيًا يتضمّن
"type": "speech_metadata"و"speaker"و"style"بكل فقرة من المحتوى النصي. - GenerateContent API: أرفِق
"speech_metadata": {"speaker": "...", "style": "..."}بكلpart.
- واجهة Interactions API: أرفِق تعليقًا توضيحيًا يتضمّن
- استخدام علامات مضمّنة بين قوسين زاويين فقط للأحداث الصوتية في نقطة زمنية محددة: يجب تضمين التعبيرات الصوتية غير الكلامية المؤقتة والفواصل في نص الفيديو باستخدام قوسين زاويين (مثل
<laugh>أو<sigh>أو<cough>أو<breath>أو<short pause>). يجب وضع أساليب الأداء، مثل الهمس، بينspeech_metadata.style. - تحديد
speakerفي كل منعطف في طلبات المتحدثين المتعددين: يجب أن يتضمّن كل منعطف في طلب المتحدثين المتعددينspeakerبشكل صريح داخلspeech_metadataبما يتطابق مع أحد المتحدثين الذين تم ضبطهم. - تصميم شخصيات مسبقًا باستخدام "تصميم الصوت": استبدِل فقرات "ملف الصوت" / "ملاحظات المخرج" الطويلة القديمة بصوت مخصّص تم إنشاؤه في تصميم الصوت، ثم استخدِم معرّف
voice_...في طلبات تحويل النص إلى كلام مع سلاسلstyleفارغة أو بأقل قدر من المحتوى. - احتساب الناتج التلقائي بتنسيق WAV (
audio/wav) في الطلبات الأحادية: على عكس إصداراتgemini-3.1-flash-tts-previewوالإصدارات الأقدم من نماذج تحويل النص إلى كلام (التي كانت تعرضaudio/l16بتنسيق PCM الأولي بدون عنوان تلقائيًا)، يعرض الإصدار 3.8 من ميزة "تحويل النص إلى كلام" في Gemini صوت WAV (audio/wav/AUDIO_WAV) مع عنوان RIFF عادي تلقائيًا للطلبات الأحادية.- إذا كان الرمز البرمجي يغلّف وحدات بايت PCM الأولية في رأس WAV (على سبيل المثال، باستخدام الوحدة
waveأوffmpegفي Python)، عليك إزالة غلاف الرأس اليدوي وكتابة وحدات البايت التي تم إرجاعها مباشرةً في ملف.wav. - إذا كان مسار التعلّم يتطلّب صوت PCM الأولي بدون عنوان أو صوت mu-law أو A-law، اضبط
response_format.mime_typeبشكل صريح على"audio/l16"أو"audio/mulaw"أو"audio/alaw"(على سبيل المثال،{"response_format": {"type": "audio", "mime_type": "audio/l16"}}في Interactions API أوAUDIO_L16أوAUDIO_MULAWأوAUDIO_ALAWفيgenerateContent). راجِع تنسيقات إخراج الصوت.
- إذا كان الرمز البرمجي يغلّف وحدات بايت PCM الأولية في رأس WAV (على سبيل المثال، باستخدام الوحدة
gemini-3.8-flash-tts
| الموقع | الوصف |
|---|---|
| رمز النموذج | gemini-3.8-flash-tts |
| أنواع البيانات المتوافقة |
المدخلات نص الناتج الصوت |
| حدود الرموز المميزة[*] |
الحدّ الأقصى لرموز الإدخال المميزة 8,192 الحدّ الأقصى لرموز الناتج المميزة 16,384 (الحد الأقصى لعدد الرموز المميزة التي يمكن أن تعرضها Gemini API) |
| الإمكانات | متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح غير متاح |
| خيارات الاستهلاك |
متاح متاح متاح |
| Versions |
|
| آخر تعديل | سبتمبر 2026 |
اللغات المتاحة
يرصد gemini-3.8-flash-tts لغة الإدخال تلقائيًا ويتيح استخدام
أكثر من 130 لغة:
| اللغة | اللغة | اللغة |
|---|---|---|
| الأتشيهية (نص عربي) | اليونانية | النيبالية (لغة فردية) |
| الأفريقانية | الجورانية | الفولانية النيجيرية |
| الأكانية | الغوجاراتية | الأذربيجانية الشمالية |
| الأمهرية | الكريولية الهايتية | السوتو الشمالية |
| الأرمينية | Halh Mongolian | الأوزبكية الشمالية |
| الأسامية | الهوسا | البوكمالية النرويجية |
| الأوادية | العبرية | النرويجية الجديدة |
| باليني | الهندية | النيانجا |
| البنغالية | الهنغارية | الأوكسيتانية |
| البنجرية (الخط العربي) | الأيسلندية | الأورية (لغة فردية) |
| البنجرية (نص لاتيني) | الإيجبو | البانغاسينية |
| الباشكيرية | الايلوكو | الفارسية (أفغانستان) |
| الباسك | الإندونيسية | البولندية |
| Belarusian | الفارسية الإيرانية | البرتغالية |
| البيمبا | الإيطالية | البنجابية |
| البهوجبورية | اليابانية | الرومانية |
| البوسنية | الجافانية | الروسية |
| بوغينيز | القبائلية | السنتالية |
| البلغارية | الكامبا | الصربية |
| البورمية | الكانادا | السندية |
| الكَنْتونية | الكشميرية (نص عربي) | السنهالية |
| الكتالانية | الكشميرية (نص ديفا) | السلوفاكية |
| السيبيوانية | الكازاخستانية | السلوفينية |
| الكردية الوسطى | الخميرية | الصومالية |
| التشاتيسغارهية | الكيكويو | الأذربيجانية الجنوبية |
| الصينية (نص هان) | الكينيارواندا | باشتو جنوبية |
| الصينية (نص هان) | كونغو | السوتو الجنوبية |
| التتارية القرمية | الكورية | الإسبانية |
| الكرواتية | القيرغيزية | العربية العادية (نص عربي) |
| التشيكية | لاو | العربية الفصحى (نص لاتيني) |
| الدانماركية | اللاتغالية | اللاتفية العادية |
| الهولندية | اللينجالا | الماليزية المعيارية |
| الدايلا | الليتوانية | السواحيلية (لغة فردية) |
| الدزونغا | اللكسمبورغية | السواتي |
| العربية المصرية | المقدونية | السويدية |
| الإنجليزية | ماجادهي | الطاجيكية |
| الإستونية | المايثيلية | التاميلية |
| الفلبينية | المالايالامية | التيلوغوية |
| الفنلندية | المالطية | التايلاندية |
| الفرنسية | المانيبورية | التيجرينيا |
| الغليشيانية | المراثية | الألبانية التوسكية |
| الجاندا | المينانجكاباو (الخط العربي) | التركية |
| الجورجية | المينانجكاباو (نص لاتيني) | الأويغورية |
| الألمانية | ميزو | الفيتنامية |