جمینی ۳.۸ فلش TTS

جمینی ۳.۸ فلش تی‌تی‌اس ( gemini-3.8-flash-tts ) مدل متن به گفتار خلاقانه و پرچمدار گوگل است که برای وفاداری به صدا در سطح استودیویی، بازیگری رسا، لهجه‌های محلی اصیل و پایداری چندترمینال بسیار قوی در فرم‌های طولانی مهندسی شده است.

نمای کلی و قابلیت‌ها

Gemini 3.8 Flash TTS معیار جدیدی را برای تولید صدای رسا تعیین می‌کند:

  • دقت بالای آکوستیک و ظرافت‌های اجرایی: ارائه دهنده‌ی طیف احساسی غنی، ریتم طبیعی و پایبندی دقیق به جهت‌های style ترن لول و رویدادهای صوتی درون خطی ( <laugh> ، <sigh> ، <short pause> ).
  • پایداری چند نوبتی در فرم طولانی: هویت صدا، طنین، بلندی صدا و تُن آکوستیک اتاق را در دیالوگ‌های طولانی و روایت‌های چند دقیقه‌ای بدون تغییر صدا حفظ می‌کند.
  • لهجه‌ها و تلفظ‌های منطقه‌ای اصیل: از لهجه‌های منطقه‌ای، گویش‌های اقلیت‌ها و لغو الفبای آوانگاری بین‌المللی (IPA) درون‌خطی پشتیبانی می‌کند.
  • پشتیبانی کامل از اکوسیستم صدا: به طور یکپارچه با صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته ( GET /v1beta/voices )، شخصیت‌های طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) کار می‌کند. همچنین می‌توانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.

برای پوشش کامل ویژگی‌ها، ارائه بهترین شیوه‌ها و نمونه‌های کد، از راهنمای تبدیل متن به گفتار دیدن کنید.

چه زمانی از کدام مدل TTS استفاده کنیم؟

هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:

ویژگی / حجم کار جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts ) جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts )
قدرت اولیه حداکثر دقت در صدا، ظرافت‌های بازیگری و پوشش گویش‌ها توان عملیاتی بالا، تأخیر کم و بهره‌وری هزینه
بهترین موارد استفاده کتاب‌های صوتی، روایت استودیویی، دیالوگ‌های پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویش‌های منطقه‌ای تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگی‌های خواندن با صدای بلند، تکثیر صدا، تولید تک‌بلندگوی روزمره
زبان‌های پشتیبانی‌شده ۱۳۰ زبان ۱۰۱ زبان
جایگزین پیشنهادی برای رده خلاقانه پرچمدار جدید gemini-3.1-flash-tts-preview

راهنمای مهاجرت

اگر از gemini-3.1-flash-tts-preview یا مدل‌های قدیمی‌تر Gemini TTS مهاجرت می‌کنید، درخواست‌های خود را برای طرحواره Gemini 3.8 TTS به‌روزرسانی کنید:

  1. انتقال دستورالعمل‌های سطح نوبت به ابرداده‌های گفتاری ( speech_metadata : جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر می‌گیرد. دستورالعمل‌های متنی درون‌خطی مانند "Say cheerfully: Hello!" یا "Speaker 1: Hello!" می‌توان با صدای بلند بیان کرد. دستورالعمل‌های تحویل پایدار ( style ) و برچسب‌های گوینده ( speaker ) را به ابرداده‌های ساختاریافته منتقل کنید:
    • API تعاملات: یک حاشیه‌نویسی با "type": "speech_metadata" ، "speaker" و "style" به هر بلوک محتوای متن پیوست کنید.
    • GenerateContent API: "speech_metadata": {"speaker": "...", "style": "..."} را به هر part اضافه کنید.
  2. فقط برای رویدادهای صوتیِ لحظه‌ای از برچسب‌های درون‌خطیِ براکت زاویه‌دار استفاده کنید: صداهای غیرگفتاریِ لحظه‌ای و مکث‌ها را با استفاده از براکت زاویه‌دار در متن به صورت درون‌خطی نگه دارید (مانند <laugh> ، <sigh> ، <cough> ، <breath> یا <short pause> ). سبک‌های بیان مانند زمزمه را در speech_metadata.style قرار دهید.
  3. مشخص کردن speaker در هر نوبت در درخواست‌های چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاً speaker در داخل speech_metadata که با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند.
  4. طراحی شخصیت‌ها از قبل با طراحی صدا: بلوک‌های قدیمی و طولانی پروفایل صوتی / یادداشت‌های کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه voice_... را از طریق درخواست‌های TTS خود با رشته‌های style حداقلی یا خالی منتقل کنید.
  5. در نظر گرفتن خروجی پیش‌فرض WAV ( audio/wav ) در درخواست‌های unary: برخلاف gemini-3.1-flash-tts-preview و مدل‌های TTS قبلی (که به طور پیش‌فرض PCM audio/l16 خام بدون سربرگ را برمی‌گرداندند)، Gemini 3.8 TTS به طور پیش‌فرض برای درخواست‌های unary، صدای WAV ( audio/wav / AUDIO_WAV ) را با یک سربرگ استاندارد RIFF برمی‌گرداند.
    • اگر کد شما قبلاً بایت‌های خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول wave پایتون یا ffmpeg )، پوشش هدر دستی را حذف کرده و بایت‌های برگردانده شده را مستقیماً در یک فایل .wav بنویسید.
    • اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً response_format را روی "audio/l16" ( "AUDIO_L16" ) ، "audio/mulaw" ( "AUDIO_MULAW" ) یا "audio/alaw" ( "AUDIO_ALAW" ) تنظیم کنید. به بخش فرمت‌های خروجی صدا مراجعه کنید.

gemini-3.8-flash-tts

ملک توضیحات
کد مدل gemini-3.8-flash-tts
انواع داده پشتیبانی شده را

ورودی‌ها

متن

خروجی

صوتی

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۸,۱۹۲

محدودیت توکن خروجی

۱۶,۳۸۴

قابلیت‌های

تولید صدا

پشتیبانی شده

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی نمی‌شود

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی نمی‌شود

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی نمی‌شود

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی شده

استنتاج اولویت

پشتیبانی شده

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • gemini-3.8-flash-tts
آخرین به‌روزرسانی ژوئیه ۲۰۲۶

زبان‌های پشتیبانی‌شده

gemini-3.8-flash-tts زبان ورودی را به طور خودکار تشخیص می‌دهد و از ۱۳۰ زبان پشتیبانی می‌کند:

زبان زبان زبان
آچه‌ای (خط عربی) یونانی نپالی (زبان شخصی)
آفریکانس گوارانی فولفولد نیجریه‌ای
آکان گجراتی آذربایجان شمالی
امهری کریول هائیتیایی سوتوی شمالی
ارمنی هاله مغولی ازبکی شمالی
آسامی هوسا بوکمال نروژی
عوضی عبری نروژی نینورسک
بالیایی هندی نیانیا
بنگلا مجارستانی اکسیتان
بنجار (خط عربی) ایسلندی اودیا (زبان شخصی)
بنجار (خط لاتین) ایگبو پانگاسینان
باشقیر ایلوکو فارسی (افغانستان)
باسک اندونزیایی لهستانی
بلاروسی فارسی ایرانی پرتغالی
بمبا ایتالیایی پنجابی
بوجپوری ژاپنی رومانیایی
بوسنیایی جاوه ای روسی
بوگینی کابل سانتالی
بلغاری کامبا صربی
برمه‌ای کانارا سندی
کانتونی کشمیری (خط عربی) سینهالی
کاتالان کشمیری (خط دیوه) اسلواکی
سبوانو قزاق اسلوونیایی
کردی مرکزی خمر سومالیایی
چتیسگری کیکویو آذربایجان جنوبی
چینی (خط هانس) کینیارواندایی پشتو جنوبی
چینی (خط هانت) کنگو سوتوی جنوبی
تاتاری کریمه کره ای اسپانیایی
کرواتی قرقیز عربی استاندارد (خط عربی)
چک لائو عربی استاندارد (خط لاتین)
دانمارکی لاتگالیایی استاندارد لتونی
هلندی لینگالا مالایی استاندارد
دیولا لیتوانیایی سواحیلی (زبان شخصی)
دزونگخا لوکزامبورگی سواتی
عربی مصری مقدونی سوئدی
انگلیسی ماگای تاجیک
استونیایی میثیلی تامیل
فیلیپینی مالایالامی تلوگو
فنلاندی مالتی تایلندی
فرانسوی مانیپوری تیگرینیا
گالیسیایی مراتی آلبانیایی توسک
گاندا مینانگکابائو (خط عربی) اویغوری
گرجی مینانگکابائو (خط لاتین)
آلمانی میزو