جمینی ۳.۸ فلش-لایت TTS

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) مدل متن به گفتار سریع، مقرون به صرفه و کارآمد گوگل است که برای جایگزینی gemini-3.1-flash-tts-preview برای بارهای کاری تولیدی با توان عملیاتی بالا ساخته شده است.

نمای کلی و قابلیت‌ها

Gemini 3.8 Flash-Lite TTS تأخیر کم را با گفتار رسا و طبیعی ترکیب می‌کند:

  • بهره‌وری با توان عملیاتی بالا: برای تولید انبوه، آبشارهای عامل صوتی مکالمه‌ای، ویژگی‌های خواندن با صدای بلند و تولید گفتار تک‌گوینده روزمره در زبان‌های اصلی بهینه شده است.
  • سازگاری با طرحواره Drop-in: دقیقاً همان طرحواره API و قالب اعلان ساختاریافته gemini-3.8-flash-tts را به اشتراک می‌گذارد و به شما امکان می‌دهد مدل‌ها را با تغییر یک پارامتر واحد تغییر دهید.
  • پشتیبانی کامل از اکوسیستم صدا: از صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته ( GET /v1beta/voices )، شخصیت‌های طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) پشتیبانی می‌کند. همچنین می‌توانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.

برای پوشش کامل ویژگی‌ها، ارائه بهترین شیوه‌ها و نمونه‌های کد، از راهنمای تبدیل متن به گفتار دیدن کنید.

چه زمانی از کدام مدل TTS استفاده کنیم؟

هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:

ویژگی / حجم کار جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts ) جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts )
قدرت اولیه توان عملیاتی بالا، تأخیر کم و بهره‌وری هزینه حداکثر دقت در صدا، ظرافت‌های بازیگری و پوشش گویش‌ها
بهترین موارد استفاده تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگی‌های خواندن با صدای بلند، تکثیر صدا، تولید تک‌بلندگوی روزمره کتاب‌های صوتی، روایت استودیویی، دیالوگ‌های پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویش‌های منطقه‌ای
زبان‌های پشتیبانی‌شده ۱۰۱ زبان ۱۳۰ زبان
جایگزین پیشنهادی برای gemini-3.1-flash-tts-preview رده خلاقانه پرچمدار جدید

راهنمای مهاجرت

اگر در حال ارتقا از gemini-3.1-flash-tts-preview به gemini-3.8-flash-lite-tts هستید، درخواست‌های خود را برای طرحواره Gemini 3.8 TTS به‌روزرسانی کنید:

  1. انتقال دستورالعمل‌های سطح نوبت به ابرداده‌های گفتاری ( speech_metadata : جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر می‌گیرد. دستورالعمل‌های متنی درون‌خطی مانند "Say cheerfully: Hello!" یا "Speaker 1: Hello!" می‌توان با صدای بلند بیان کرد. دستورالعمل‌های تحویل پایدار ( style ) و برچسب‌های گوینده ( speaker ) را به ابرداده‌های ساختاریافته منتقل کنید:
    • API تعاملات: یک حاشیه‌نویسی با "type": "speech_metadata" ، "speaker" و "style" به هر بلوک محتوای متن پیوست کنید.
    • GenerateContent API: "speech_metadata": {"speaker": "...", "style": "..."} را به هر part اضافه کنید.
  2. فقط برای رویدادهای صوتیِ لحظه‌ای از برچسب‌های درون‌خطیِ براکت زاویه‌دار استفاده کنید: صداهای غیرگفتاریِ لحظه‌ای و مکث‌ها را با استفاده از براکت زاویه‌دار در متن به صورت درون‌خطی نگه دارید (مانند <laugh> ، <sigh> ، <cough> ، <breath> یا <short pause> ). سبک‌های بیان مانند زمزمه را در speech_metadata.style قرار دهید.
  3. مشخص کردن speaker در هر نوبت در درخواست‌های چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاً speaker در داخل speech_metadata که با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند.
  4. طراحی شخصیت‌ها از قبل با طراحی صدا: بلوک‌های قدیمی و طولانی پروفایل صوتی / یادداشت‌های کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه voice_... را از طریق درخواست‌های TTS خود با رشته‌های style حداقلی یا خالی منتقل کنید.
  5. در نظر گرفتن خروجی پیش‌فرض WAV ( audio/wav ) در درخواست‌های unary: برخلاف gemini-3.1-flash-tts-preview و مدل‌های TTS قبلی (که به طور پیش‌فرض PCM audio/l16 خام بدون سربرگ را برمی‌گرداندند)، Gemini 3.8 TTS به طور پیش‌فرض برای درخواست‌های unary، صدای WAV ( audio/wav / AUDIO_WAV ) را با یک سربرگ استاندارد RIFF برمی‌گرداند.
    • اگر کد شما قبلاً بایت‌های خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول wave پایتون یا ffmpeg )، پوشش هدر دستی را حذف کرده و بایت‌های برگردانده شده را مستقیماً در یک فایل .wav بنویسید.
    • اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً response_format را روی "audio/l16" ( "AUDIO_L16" ) ، "audio/mulaw" ( "AUDIO_MULAW" ) یا "audio/alaw" ( "AUDIO_ALAW" ) تنظیم کنید. به بخش فرمت‌های خروجی صدا مراجعه کنید.

بخش‌های موردنیاز علامت‌گذاری شده‌اند

ملک توضیحات
کد مدل gemini-3.8-flash-lite-tts
انواع داده پشتیبانی شده را

ورودی‌ها

متن

خروجی

صوتی

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۸,۱۹۲

محدودیت توکن خروجی

۱۶,۳۸۴

قابلیت‌های

تولید صدا

پشتیبانی شده

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی نمی‌شود

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی نمی‌شود

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی نمی‌شود

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی شده

استنتاج اولویت

پشتیبانی شده

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • gemini-3.8-flash-lite-tts
آخرین به‌روزرسانی ژوئیه ۲۰۲۶

زبان‌های پشتیبانی‌شده

gemini-3.8-flash-lite-tts زبان ورودی را به طور خودکار تشخیص می‌دهد و از 101 زبان پشتیبانی می‌کند:

زبان زبان زبان
آچه‌ای (خط عربی) گرجی مالتی
آفریکانس آلمانی مانیپوری
آکان یونانی مراتی
امهری گجراتی مینانگکابائو (خط عربی)
ارمنی کریول هائیتیایی میزو
آسامی هاله مغولی نپالی (زبان شخصی)
عوضی هوسا فولفولد نیجریه‌ای
بالیایی عبری آذربایجان شمالی
بنگلا هندی سوتوی شمالی
بنجار (خط لاتین) مجارستانی ازبکی شمالی
باسک ایسلندی بوکمال نروژی
بلاروسی ایلوکو نروژی نینورسک
بوجپوری اندونزیایی نیانیا
بوسنیایی فارسی ایرانی اودیا (زبان شخصی)
بوگینی ایتالیایی فارسی (افغانستان)
بلغاری ژاپنی لهستانی
کانتونی جاوه ای پرتغالی
کاتالان کامبا پنجابی
سبوانو کانارا رومانیایی
کردی مرکزی کشمیری (خط عربی) روسی
چتیسگری کشمیری (خط دیوه) سانتالی
چینی (خط هانس) قزاق صربی
چینی (خط هانت) خمر سینهالی
کرواتی کیکویو اسلواکی
چک کینیارواندایی آذربایجان جنوبی
دانمارکی کنگو پشتو جنوبی
هلندی کره ای اسپانیایی
عربی مصری قرقیز عربی استاندارد (خط عربی)
انگلیسی لائو عربی استاندارد (خط لاتین)
استونیایی لینگالا استاندارد لتونی
فیلیپینی مقدونی مالایی استاندارد
فرانسوی ماگای تامیل
گالیسیایی میثیلی تلوگو
گاندا مالایالامی