Gemini 3.8 Flash TTS

‫Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) هو نموذج رائد من Google لتحويل النص إلى كلام، وهو مصمّم لتقديم صوت عالي الجودة، وأداء معبّر، ولهجات محلية أصيلة، وثبات قوي في المحادثات المترابطة الطويلة المتعددة الأدوار.

نظرة عامة والإمكانات

يضع نموذج تحويل النص إلى كلام (TTS) من Gemini 3.8 Flash معيارًا جديدًا لإنشاء محتوى صوتي معبّر:

  • دقة صوتية عالية وتفاصيل دقيقة في الأداء: توفّر هذه الميزة نطاقًا عاطفيًا غنيًا، وإيقاعًا طبيعيًا، والتزامًا دقيقًا بالتعليمات style على مستوى الجمل والأحداث الصوتية المضمّنة (<laugh> و<sigh> و<short pause>).
  • ثبات المحتوى الطويل المتعدد الأدوار: الحفاظ على اتساق هوية الصوت وطبقة الصوت ومستوى الصوت ونبرة الغرفة الصوتية خلال الحوارات الطويلة والسرد الذي يستغرق عدة دقائق بدون حدوث أي انحراف في الصوت
  • اللهجات الإقليمية والنطق الأصلي: تتوافق مع اللهجات الإقليمية واللهجات الخاصة بالأقليات وعمليات التجاوز المضمّنة في الأبجدية الصوتية الدولية (IPA).
  • التوافق الكامل مع منظومة الصوت المتكاملة: تتوافق هذه الميزة بسلاسة مع الأصوات المسبقة الإنشاء، و مكتبة الأصوات الموسّعة (GET /v1beta/voices)، وشخصيات تصميم الصوت المخصّصة، و استنساخ الصوت (يتم تلقائيًا تخزين الأصوات بشكل دائم، بالإضافة إلى مفاتيح اختيارية بدون حالة). يمكنك أيضًا تصميم أصوات ومحاكاتها بشكل تفاعلي في Google AI Studio.

يمكنك الانتقال إلى دليل تحويل النص إلى كلام للحصول على تغطية كاملة للميزات وأفضل الممارسات المتعلقة بتقديم الطلبات وأمثلة على الرموز البرمجية.

حالات استخدام نماذج تحويل النص إلى كلام

يتشارك كلا النموذجين Gemini 3.8 لتحويل النص إلى كلام مخطط واجهة برمجة التطبيقات وبنية الطلبات نفسها. اختَر النموذج الذي يناسب حجم عملك:

الميزة / حجم المعالجة Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
قوة الإعلان الأساسية أقصى دقة صوتية وأداء تمثيلي دقيق وتغطية لهجات متنوعة معدّل أعلى لنقل البيانات ووقت استجابة سريع وفعالية من حيث التكلفة
أفضل حالات الاستخدام الكتب المسموعة، والتعليق الصوتي في الاستوديو، والحوارات المعقّدة بين عدة أشخاص، والأداء التمثيلي الذي يتضمّن الكثير من الصراخ، والكلمات الصعبة اللفظ، واللهجات المحلية الإنتاج بكميات كبيرة، وتتالي وكلاء الصوت في الوقت الفعلي، وميزات القراءة بصوت عالٍ، وتكرار الصوت، وإنشاء محتوى يومي بصوت متحدث واحد
اللغات المتاحة ‫130 لغة ‫101 لغة
البديل المقترَح لـ فئة جديدة من المواد الإبداعية الرئيسية gemini-3.1-flash-tts-preview

دليل نقل البيانات

إذا كنت تنفّذ عملية نقل بيانات من إصدار gemini-3.1-flash-tts-preview أو إصدار أقدم من نماذج Gemini لتحويل النص إلى كلام، عليك تعديل طلباتك لتتوافق مع مخطط Gemini 3.8 لتحويل النص إلى كلام:

  1. نقل التوجيهات على مستوى المنعطف إلى speech_metadata: يعامل نظام تحويل النص إلى كلام 3.8 في Gemini النص المدخل على أنّه نسخة طبق الأصل. قد يتم نطق التوجيهات المضمّنة في النص، مثل "Say cheerfully: Hello!" أو "Speaker 1: Hello!"، بصوت عالٍ. نقل تعليمات التسليم المستدام (style) وتصنيفات المتحدّثين (speaker) إلى البيانات الوصفية المنظَّمة:
    • ‫Interactions API: أرفِق تعليقًا توضيحيًا يتضمّن "type": "speech_metadata" و"speaker" و"style" بكل فقرة من المحتوى النصي.
    • ‫GenerateContent API: أرفِق "speech_metadata": {"speaker": "...", "style": "..."} بكل part.
  2. استخدام العلامات المضمّنة بين قوسين زاويين فقط للأحداث الصوتية في نقطة زمنية محددة: يجب تضمين التعبيرات الصوتية غير الكلامية والوقفات المؤقتة في النص باستخدام قوسين زاويين (مثل <laugh> أو <sigh> أو <cough> أو <breath> أو <short pause>). يجب وضع أساليب التسليم، مثل الهمس، بين speech_metadata.style.
  3. تحديد speaker في كل دورة في الطلبات التي تتضمّن عدة متحدثين: يجب أن تتضمّن كل دورة في الطلبات التي تتضمّن عدة متحدثين speaker بشكل صريح داخل speech_metadata بما يتطابق مع أحد المتحدثين الذين تم ضبطهم.
  4. تصميم شخصيات مسبقًا باستخدام "تصميم الصوت": استبدِل فقرات "ملف تعريف الصوت" / "ملاحظات المخرج" القديمة والطويلة بصوت مخصّص تم إنشاؤه في تصميم الصوت، ثم استخدِم معرّف voice_... نفسه في طلبات تحويل النص إلى كلام مع سلاسل style فارغة أو قليلة المحتوى.
  5. احتساب الناتج التلقائي بتنسيق WAV (audio/wav) في الطلبات الأحادية: على عكس gemini-3.1-flash-tts-preview ونماذج تحويل النص إلى كلام السابقة (التي كانت تعرض ملف PCM الأولي audio/l16 بدون عنوان تلقائيًا)، تعرض ميزة تحويل النص إلى كلام في Gemini 3.8 ملف صوت بتنسيق WAV (audio/wav / AUDIO_WAV) مع عنوان RIFF عادي تلقائيًا للطلبات الأحادية.
    • إذا كان الرمز البرمجي يضمّن سابقًا وحدات بايت PCM أولية في عنوان WAV (على سبيل المثال، باستخدام الوحدة wave أو ffmpeg في Python)، عليك إزالة تضمين العنوان اليدوي وكتابة وحدات البايت التي تم إرجاعها مباشرةً في ملف .wav.
    • إذا كان مسار التعلّم يتطلّب محتوًى صوتيًا بتنسيق PCM الأولي بدون رأس أو بتنسيق mu-law أو A-law، اضبط response_format على "audio/l16" ("AUDIO_L16") أو "audio/mulaw" ("AUDIO_MULAW") أو "audio/alaw" ("AUDIO_ALAW"). راجِع تنسيقات إخراج الصوت.

gemini-3.8-flash-tts

الموقع الوصف
رمز النموذج gemini-3.8-flash-tts
أنواع البيانات المتوافقة

المدخلات

نص

الناتج

الصوت

حدود الرموز المميزة[*]

الحدّ الأقصى لعدد الرموز المميزة التي يمكن إدخالها

8,192

الحدّ الأقصى لرموز الناتج المميزة

16,384

الإمكانات

إنشاء الصوت

متاح

التخزين المؤقت

متاح

تنفيذ الرموز البرمجية

غير متاح

البحث عن الملفات

غير متاح

استدعاء الدوال

غير متاح

استخدام "خرائط Google" كمصدر

غير متاح

إنشاء الصور

غير متاح

Live API

غير متاح

تحديد المصادر في "بحث Google"

غير متاح

المُخرجات المنظَّمة

غير متاح

التفكير

غير متاح

سياق عنوان URL

غير متاح

خيارات الاستهلاك

Batch API

متاح

الاستنتاج المرن

متاح

استنتاج الأولوية

متاح

Versions
يمكنك الاطّلاع على أنماط إصدارات النماذج لمزيد من التفاصيل.
  • gemini-3.8-flash-tts
آخر تعديل يوليو 2026

اللغات المتاحة

تتعرّف أداة gemini-3.8-flash-tts تلقائيًا على لغة الإدخال وتتيح استخدام 130 لغة:

اللغة اللغة اللغة
الأتشيهية (نص عربي) اليونانية النيبالية (لغة فردية)
الأفريقانية الجورانية الفولانية النيجيرية
الأكانية الغوجاراتية الأذربيجانية الشمالية
الأمهرية الكريولية الهايتية السوتو الشمالية
الأرمينية المنغولية الخالخية الأوزبكية الشمالية
الأسامية الهوسا البوكمالية النرويجية
الأوادية العبرية النرويجية الجديدة
باليني الهندية النيانجا
البنغالية الهنغارية الأوكسيتانية
البنجرية (الخط العربي) الأيسلندية الأودية (لغة فردية)
البنجرية (نص لاتيني) الإيجبو البانغاسينية
الباشكيرية الايلوكو الفارسية (أفغانستان)
الباسك الإندونيسية البولندية
البيلاروسية الفارسية الإيرانية البرتغالية
البيمبا الإيطالية البنجابية
البهوجبورية اليابانية الرومانية
البوسنية الجافانية الروسية
بوغينيز القبائلية السنتالية
البلغارية الكامبا الصربية
البورمية الكانادا السندية
الكَنْتونية الكشميرية (الخط العربي) السنهالية
الكتالانية الكشميرية (نص ديفا) السلوفاكية
السيبيوانية الكازاخستانية السلوفينية
الكردية الوسطى الخميرية الصومالية
التشاتيسغارهية الكيكويو الأذربيجانية الجنوبية
الصينية (نص هان) الكينيارواندا باشتو الجنوبية
الصينية (نص هان) كونغو السوتو الجنوبية
التتارية القرمية الكورية الإسبانية
الكرواتية القيرغيزية العربية المعيارية (نص عربي)
التشيكية لاو العربية الفصحى (نص لاتيني)
الدانماركية اللاتغالية اللاتفية العادية
الهولندية اللينجالا الملايو القياسية
الدايلا الليتوانية السواحيلية (لغة فردية)
الدزونغا اللكسمبورغية السواتي
العربية المصرية المقدونية السويدية
الإنجليزية ماجادهي الطاجيكية
الإستونية المايثيلية التاميلية
الفلبينية المالايالامية التيلوغوية
الفنلندية المالطية التايلاندية
الفرنسية المانيبورية التيجرينيا
الغليشيانية الماراثية الألبانية التوسكية
الجاندا المينانجكاباو (الخط العربي) الأويغورية
الجورجية المينانجكاباو (نص لاتيني)
الألمانية ميزو