جمینی ۳.۸ فلش-لایت TTS

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) مدل متن به گفتار سریع، مقرون به صرفه و کارآمد گوگل است که برای جایگزینی gemini-3.1-flash-tts-preview برای بارهای کاری تولیدی با توان عملیاتی بالا ساخته شده است.

نمای کلی و قابلیت‌ها

Gemini 3.8 Flash-Lite TTS تأخیر کم را با گفتار رسا و طبیعی ترکیب می‌کند:

  • بهره‌وری با توان عملیاتی بالا: برای تولید انبوه، آبشارهای عامل صوتی مکالمه‌ای، ویژگی‌های خواندن با صدای بلند و تولید گفتار تک‌گوینده روزمره در زبان‌های اصلی بهینه شده است.
  • سازگاری با طرحواره Drop-in: دقیقاً همان طرحواره API و قالب اعلان ساختاریافته gemini-3.8-flash-tts را به اشتراک می‌گذارد و به شما امکان می‌دهد مدل‌ها را با تغییر یک پارامتر واحد تغییر دهید.
  • پشتیبانی کامل از اکوسیستم صدا: از صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته ( GET /v1beta/voices )، شخصیت‌های طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) پشتیبانی می‌کند. همچنین می‌توانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.

برای پوشش کامل ویژگی‌ها، ارائه بهترین شیوه‌ها و نمونه‌های کد، از راهنمای تبدیل متن به گفتار دیدن کنید.

چه زمانی از کدام مدل TTS استفاده کنیم؟

هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:

ویژگی / حجم کار جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts ) جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts )
قدرت اولیه توان عملیاتی بالا، تأخیر کم و بهره‌وری هزینه حداکثر دقت در صدا، ظرافت‌های بازیگری و پوشش گویش‌ها
بهترین موارد استفاده تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگی‌های خواندن با صدای بلند، تکثیر صدا، تولید تک‌بلندگوی روزمره کتاب‌های صوتی، روایت استودیویی، دیالوگ‌های پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویش‌های منطقه‌ای
زبان‌های پشتیبانی‌شده ۱۰۱ زبان ۱۳۰ زبان
جایگزین پیشنهادی برای gemini-3.1-flash-tts-preview رده خلاقانه پرچمدار جدید

راهنمای مهاجرت

اگر در حال ارتقا از gemini-3.1-flash-tts-preview به gemini-3.8-flash-lite-tts هستید، درخواست‌های خود را برای طرحواره Gemini 3.8 TTS به‌روزرسانی کنید:

  1. انتقال دستورالعمل‌های سطح نوبت به ابرداده‌های گفتاری ( speech_metadata : جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر می‌گیرد. دستورالعمل‌های متنی درون‌خطی مانند "Say cheerfully: Hello!" یا "Speaker 1: Hello!" می‌توان با صدای بلند بیان کرد. دستورالعمل‌های تحویل پایدار ( style ) و برچسب‌های گوینده ( speaker ) را به ابرداده‌های ساختاریافته منتقل کنید:
    • API تعاملات: یک حاشیه‌نویسی با "type": "speech_metadata" ، "speaker" و "style" به هر بلوک محتوای متن پیوست کنید.
    • GenerateContent API: "speech_metadata": {"speaker": "...", "style": "..."} را به هر part اضافه کنید.
  2. فقط برای رویدادهای صوتیِ لحظه‌ای از برچسب‌های درون‌خطیِ براکت زاویه‌دار استفاده کنید: صداهای غیرگفتاریِ لحظه‌ای و مکث‌ها را با استفاده از براکت زاویه‌دار در متن به صورت درون‌خطی نگه دارید (مانند <laugh> ، <sigh> ، <cough> ، <breath> یا <short pause> ). سبک‌های بیان مانند زمزمه را در speech_metadata.style قرار دهید.
  3. مشخص کردن speaker در هر نوبت در درخواست‌های چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاً speaker در داخل speech_metadata که با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند.
  4. طراحی شخصیت‌ها از قبل با طراحی صدا: بلوک‌های قدیمی و طولانی پروفایل صوتی / یادداشت‌های کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه voice_... را از طریق درخواست‌های TTS خود با رشته‌های style حداقلی یا خالی منتقل کنید.
  5. در نظر گرفتن خروجی پیش‌فرض WAV ( audio/wav ) در درخواست‌های unary: برخلاف gemini-3.1-flash-tts-preview و مدل‌های TTS قبلی (که به طور پیش‌فرض PCM audio/l16 خام بدون سربرگ را برمی‌گرداندند)، Gemini 3.8 TTS به طور پیش‌فرض برای درخواست‌های unary، صدای WAV ( audio/wav / AUDIO_WAV ) را با یک سربرگ استاندارد RIFF برمی‌گرداند.
    • اگر کد شما قبلاً بایت‌های خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول wave پایتون یا ffmpeg )، پوشش هدر دستی را حذف کرده و بایت‌های برگردانده شده را مستقیماً در یک فایل .wav بنویسید.
    • اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً response_format را روی "audio/l16" ( "AUDIO_L16" ) ، "audio/mulaw" ( "AUDIO_MULAW" ) یا "audio/alaw" ( "AUDIO_ALAW" ) تنظیم کنید. به بخش فرمت‌های خروجی صدا مراجعه کنید.

بخش‌های موردنیاز علامت‌گذاری شده‌اند

ملک توضیحات
کد مدل gemini-3.8-flash-lite-tts
انواع داده پشتیبانی شده را

ورودی‌ها

متن

خروجی

صوتی

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۸,۱۹۲

محدودیت توکن خروجی

۱۶۳۸۴ (محدودیت سرویس‌دهی API جمینی)

قابلیت‌های

تولید صدا

پشتیبانی شده

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی نمی‌شود

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی نمی‌شود

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی نمی‌شود

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی شده

استنتاج اولویت

پشتیبانی شده

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • gemini-3.8-flash-lite-tts
آخرین به‌روزرسانی سپتامبر ۲۰۲۶

زبان‌های پشتیبانی‌شده

gemini-3.8-flash-lite-tts زبان ورودی را به طور خودکار تشخیص می‌دهد و بیش از ۱۰۰ زبان را پشتیبانی می‌کند:

زبان زبان زبان
آچه‌ای (خط عربی) آلمانی مانیپوری
آفریکانس یونانی مراتی
آکان گجراتی مینانگکابائو (خط عربی)
امهری کریول هائیتیایی میزو
ارمنی هاله مغولی نپالی (زبان شخصی)
آسامی هوسا فولفولد نیجریه‌ای
عوضی عبری آذربایجان شمالی
بالیایی هندی سوتوی شمالی
بنگلا مجارستانی ازبکی شمالی
بنجار (خط لاتین) ایسلندی بوکمال نروژی
باسک ایلوکو نروژی نینورسک
بلاروسی اندونزیایی نیانیا
بوجپوری فارسی ایرانی اودیا (زبان شخصی)
بوسنیایی ایتالیایی فارسی (افغانستان)
بوگینی ژاپنی لهستانی
بلغاری جاوه ای پرتغالی
کانتونی کامبا پنجابی
کاتالان کانارا رومانیایی
سبوانو کشمیری (خط عربی) روسی
کردی مرکزی کشمیری (خط دیوه) سانتالی
چتیسگری قزاق صربی
چینی (خط هانس) خمر سینهالی
چینی (خط هانت) کیکویو اسلواکی
کرواتی کینیارواندایی آذربایجان جنوبی
چک کنگو پشتو جنوبی
دانمارکی کره ای اسپانیایی
هلندی قرقیز عربی استاندارد (خط عربی)
عربی مصری لائو عربی استاندارد (خط لاتین)
انگلیسی لینگالا استاندارد لتونی
استونیایی مقدونی مالایی استاندارد
فیلیپینی ماگای تامیل
فرانسوی میثیلی تلوگو
گالیسیایی مالایالامی ترکی
گاندا مالتی ویتنامی
گرجی — —
،

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) مدل متن به گفتار سریع، مقرون به صرفه و کارآمد گوگل است که برای جایگزینی gemini-3.1-flash-tts-preview برای بارهای کاری تولیدی با توان عملیاتی بالا ساخته شده است.

نمای کلی و قابلیت‌ها

Gemini 3.8 Flash-Lite TTS تأخیر کم را با گفتار رسا و طبیعی ترکیب می‌کند:

  • بهره‌وری با توان عملیاتی بالا: برای تولید انبوه، آبشارهای عامل صوتی مکالمه‌ای، ویژگی‌های خواندن با صدای بلند و تولید گفتار تک‌گوینده روزمره در زبان‌های اصلی بهینه شده است.
  • سازگاری با طرحواره Drop-in: دقیقاً همان طرحواره API و قالب اعلان ساختاریافته gemini-3.8-flash-tts را به اشتراک می‌گذارد و به شما امکان می‌دهد مدل‌ها را با تغییر یک پارامتر واحد تغییر دهید.
  • پشتیبانی کامل از اکوسیستم صدا: از صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته ( GET /v1beta/voices )، شخصیت‌های طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) پشتیبانی می‌کند. همچنین می‌توانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.

برای پوشش کامل ویژگی‌ها، ارائه بهترین شیوه‌ها و نمونه‌های کد، از راهنمای تبدیل متن به گفتار دیدن کنید.

چه زمانی از کدام مدل TTS استفاده کنیم؟

هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:

ویژگی / حجم کار جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts ) جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts )
قدرت اولیه توان عملیاتی بالا، تأخیر کم و بهره‌وری هزینه حداکثر دقت در صدا، ظرافت‌های بازیگری و پوشش گویش‌ها
بهترین موارد استفاده تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگی‌های خواندن با صدای بلند، تکثیر صدا، تولید تک‌بلندگوی روزمره کتاب‌های صوتی، روایت استودیویی، دیالوگ‌های پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویش‌های منطقه‌ای
زبان‌های پشتیبانی‌شده ۱۰۱ زبان ۱۳۰ زبان
جایگزین پیشنهادی برای gemini-3.1-flash-tts-preview رده خلاقانه پرچمدار جدید

راهنمای مهاجرت

اگر در حال ارتقا از gemini-3.1-flash-tts-preview به gemini-3.8-flash-lite-tts هستید، درخواست‌های خود را برای طرحواره Gemini 3.8 TTS به‌روزرسانی کنید:

  1. انتقال دستورالعمل‌های سطح نوبت به ابرداده‌های گفتاری ( speech_metadata : جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر می‌گیرد. دستورالعمل‌های متنی درون‌خطی مانند "Say cheerfully: Hello!" یا "Speaker 1: Hello!" می‌توان با صدای بلند بیان کرد. دستورالعمل‌های تحویل پایدار ( style ) و برچسب‌های گوینده ( speaker ) را به ابرداده‌های ساختاریافته منتقل کنید:
    • API تعاملات: یک حاشیه‌نویسی با "type": "speech_metadata" ، "speaker" و "style" به هر بلوک محتوای متن پیوست کنید.
    • GenerateContent API: "speech_metadata": {"speaker": "...", "style": "..."} را به هر part اضافه کنید.
  2. فقط برای رویدادهای صوتیِ لحظه‌ای از برچسب‌های درون‌خطیِ براکت زاویه‌دار استفاده کنید: صداهای غیرگفتاریِ لحظه‌ای و مکث‌ها را با استفاده از براکت زاویه‌دار در متن به صورت درون‌خطی نگه دارید (مانند <laugh> ، <sigh> ، <cough> ، <breath> یا <short pause> ). سبک‌های بیان مانند زمزمه را در speech_metadata.style قرار دهید.
  3. مشخص کردن speaker در هر نوبت در درخواست‌های چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاً speaker در داخل speech_metadata که با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند.
  4. طراحی شخصیت‌ها از قبل با طراحی صدا: بلوک‌های قدیمی و طولانی پروفایل صوتی / یادداشت‌های کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه voice_... را از طریق درخواست‌های TTS خود با رشته‌های style حداقلی یا خالی منتقل کنید.
  5. در نظر گرفتن خروجی پیش‌فرض WAV ( audio/wav ) در درخواست‌های unary: برخلاف gemini-3.1-flash-tts-preview و مدل‌های TTS قبلی (که به طور پیش‌فرض PCM audio/l16 خام بدون سربرگ را برمی‌گرداندند)، Gemini 3.8 TTS به طور پیش‌فرض برای درخواست‌های unary، صدای WAV ( audio/wav / AUDIO_WAV ) را با یک سربرگ استاندارد RIFF برمی‌گرداند.
    • اگر کد شما قبلاً بایت‌های خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول wave پایتون یا ffmpeg )، پوشش هدر دستی را حذف کرده و بایت‌های برگردانده شده را مستقیماً در یک فایل .wav بنویسید.
    • اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً response_format را روی "audio/l16" ( "AUDIO_L16" ) ، "audio/mulaw" ( "AUDIO_MULAW" ) یا "audio/alaw" ( "AUDIO_ALAW" ) تنظیم کنید. به بخش فرمت‌های خروجی صدا مراجعه کنید.

بخش‌های موردنیاز علامت‌گذاری شده‌اند

ملک توضیحات
کد مدل gemini-3.8-flash-lite-tts
انواع داده پشتیبانی شده را

ورودی‌ها

متن

خروجی

صوتی

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۸,۱۹۲

محدودیت توکن خروجی

۱۶۳۸۴ (محدودیت سرویس‌دهی API جمینی)

قابلیت‌های

تولید صدا

پشتیبانی شده

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی نمی‌شود

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی نمی‌شود

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی نمی‌شود

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی شده

استنتاج اولویت

پشتیبانی شده

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • gemini-3.8-flash-lite-tts
آخرین به‌روزرسانی سپتامبر ۲۰۲۶

زبان‌های پشتیبانی‌شده

gemini-3.8-flash-lite-tts زبان ورودی را به طور خودکار تشخیص می‌دهد و بیش از ۱۰۰ زبان را پشتیبانی می‌کند:

زبان زبان زبان
آچه‌ای (خط عربی) آلمانی مانیپوری
آفریکانس یونانی مراتی
آکان گجراتی مینانگکابائو (خط عربی)
امهری کریول هائیتیایی میزو
ارمنی هاله مغولی نپالی (زبان شخصی)
آسامی هوسا فولفولد نیجریه‌ای
عوضی عبری آذربایجان شمالی
بالیایی هندی سوتوی شمالی
بنگلا مجارستانی ازبکی شمالی
بنجار (خط لاتین) ایسلندی بوکمال نروژی
باسک ایلوکو نروژی نینورسک
بلاروسی اندونزیایی نیانیا
بوجپوری فارسی ایرانی اودیا (زبان شخصی)
بوسنیایی ایتالیایی فارسی (افغانستان)
بوگینی ژاپنی لهستانی
بلغاری جاوه ای پرتغالی
کانتونی کامبا پنجابی
کاتالان کانارا رومانیایی
سبوانو کشمیری (خط عربی) روسی
کردی مرکزی کشمیری (خط دیوه) سانتالی
چتیسگری قزاق صربی
چینی (خط هانس) خمر سینهالی
چینی (خط هانت) کیکویو اسلواکی
کرواتی کینیارواندایی آذربایجان جنوبی
چک کنگو پشتو جنوبی
دانمارکی کره ای اسپانیایی
هلندی قرقیز عربی استاندارد (خط عربی)
عربی مصری لائو عربی استاندارد (خط لاتین)
انگلیسی لینگالا استاندارد لتونی
استونیایی مقدونی مالایی استاندارد
فیلیپینی ماگای تامیل
فرانسوی میثیلی تلوگو
گالیسیایی مالایالامی ترکی
گاندا مالتی ویتنامی
گرجی — —
،

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) مدل متن به گفتار سریع، مقرون به صرفه و کارآمد گوگل است که برای جایگزینی gemini-3.1-flash-tts-preview برای بارهای کاری تولیدی با توان عملیاتی بالا ساخته شده است.

نمای کلی و قابلیت‌ها

Gemini 3.8 Flash-Lite TTS تأخیر کم را با گفتار رسا و طبیعی ترکیب می‌کند:

  • بهره‌وری با توان عملیاتی بالا: برای تولید انبوه، آبشارهای عامل صوتی محاوره‌ای، ویژگی‌های خواندن با صدای بلند و تولید گفتار تک‌گوینده روزمره در زبان‌های اصلی بهینه شده است.
  • سازگاری با طرحواره Drop-in: دقیقاً همان طرحواره API و قالب اعلان ساختاریافته gemini-3.8-flash-tts را به اشتراک می‌گذارد و به شما امکان می‌دهد مدل‌ها را با تغییر یک پارامتر واحد تغییر دهید.
  • پشتیبانی کامل از اکوسیستم صدا: از صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته ( GET /v1beta/voices )، شخصیت‌های طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) پشتیبانی می‌کند. همچنین می‌توانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.

برای پوشش کامل ویژگی‌ها، ارائه بهترین شیوه‌ها و نمونه‌های کد، از راهنمای تبدیل متن به گفتار دیدن کنید.

چه زمانی از کدام مدل TTS استفاده کنیم؟

هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:

ویژگی / حجم کار جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts ) جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts )
قدرت اولیه توان عملیاتی بالا، تأخیر کم و بهره‌وری هزینه حداکثر دقت در صدا، ظرافت‌های بازیگری و پوشش گویش‌ها
بهترین موارد استفاده تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگی‌های خواندن با صدای بلند، تکثیر صدا، تولید تک‌بلندگوی روزمره کتاب‌های صوتی، روایت استودیویی، دیالوگ‌های پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویش‌های منطقه‌ای
زبان‌های پشتیبانی‌شده ۱۰۱ زبان ۱۳۰ زبان
جایگزین پیشنهادی برای gemini-3.1-flash-tts-preview رده خلاقانه پرچمدار جدید

راهنمای مهاجرت

اگر در حال ارتقا از gemini-3.1-flash-tts-preview به gemini-3.8-flash-lite-tts هستید، درخواست‌های خود را برای طرحواره Gemini 3.8 TTS به‌روزرسانی کنید:

  1. انتقال دستورالعمل‌های سطح نوبت به ابرداده‌های گفتاری ( speech_metadata : جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر می‌گیرد. دستورالعمل‌های متنی درون‌خطی مانند "Say cheerfully: Hello!" یا "Speaker 1: Hello!" می‌توان با صدای بلند بیان کرد. دستورالعمل‌های تحویل پایدار ( style ) و برچسب‌های گوینده ( speaker ) را به ابرداده‌های ساختاریافته منتقل کنید:
    • API تعاملات: یک حاشیه‌نویسی با "type": "speech_metadata" ، "speaker" و "style" به هر بلوک محتوای متن پیوست کنید.
    • GenerateContent API: "speech_metadata": {"speaker": "...", "style": "..."} را به هر part اضافه کنید.
  2. فقط برای رویدادهای صوتیِ لحظه‌ای از برچسب‌های درون‌خطیِ براکت زاویه‌دار استفاده کنید: صداهای غیرگفتاریِ لحظه‌ای و مکث‌ها را با استفاده از براکت زاویه‌دار در متن به صورت درون‌خطی نگه دارید (مانند <laugh> ، <sigh> ، <cough> ، <breath> یا <short pause> ). سبک‌های بیان مانند زمزمه را در speech_metadata.style قرار دهید.
  3. مشخص کردن speaker در هر نوبت در درخواست‌های چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاً speaker در داخل speech_metadata که با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند.
  4. طراحی شخصیت‌ها از قبل با طراحی صدا: بلوک‌های قدیمی و طولانی پروفایل صوتی / یادداشت‌های کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه voice_... را از طریق درخواست‌های TTS خود با رشته‌های style حداقلی یا خالی منتقل کنید.
  5. در نظر گرفتن خروجی پیش‌فرض WAV ( audio/wav ) در درخواست‌های unary: برخلاف gemini-3.1-flash-tts-preview و مدل‌های TTS قبلی (که به طور پیش‌فرض PCM audio/l16 خام بدون سربرگ را برمی‌گرداندند)، Gemini 3.8 TTS به طور پیش‌فرض برای درخواست‌های unary، صدای WAV ( audio/wav / AUDIO_WAV ) را با یک سربرگ استاندارد RIFF برمی‌گرداند.
    • اگر کد شما قبلاً بایت‌های خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول wave پایتون یا ffmpeg )، پوشش هدر دستی را حذف کرده و بایت‌های برگردانده شده را مستقیماً در یک فایل .wav بنویسید.
    • اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً response_format را روی "audio/l16" ( "AUDIO_L16" ) ، "audio/mulaw" ( "AUDIO_MULAW" ) یا "audio/alaw" ( "AUDIO_ALAW" ) تنظیم کنید. به بخش فرمت‌های خروجی صدا مراجعه کنید.

بخش‌های موردنیاز علامت‌گذاری شده‌اند

ملک توضیحات
کد مدل gemini-3.8-flash-lite-tts
انواع داده پشتیبانی شده را

ورودی‌ها

متن

خروجی

صوتی

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۸,۱۹۲

محدودیت توکن خروجی

۱۶۳۸۴ (محدودیت سرویس‌دهی API جمینی)

قابلیت‌های

تولید صدا

پشتیبانی شده

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی نمی‌شود

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی نمی‌شود

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی نمی‌شود

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی شده

استنتاج اولویت

پشتیبانی شده

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • gemini-3.8-flash-lite-tts
آخرین به‌روزرسانی سپتامبر ۲۰۲۶

زبان‌های پشتیبانی‌شده

gemini-3.8-flash-lite-tts زبان ورودی را به طور خودکار تشخیص می‌دهد و بیش از ۱۰۰ زبان را پشتیبانی می‌کند:

زبان زبان زبان
آچه‌ای (خط عربی) آلمانی مانیپوری
آفریکانس یونانی مراتی
آکان گجراتی مینانگکابائو (خط عربی)
امهری کریول هائیتیایی میزو
ارمنی هاله مغولی نپالی (زبان شخصی)
آسامی هوسا فولفولد نیجریه‌ای
عوضی عبری آذربایجان شمالی
بالیایی هندی سوتوی شمالی
بنگلا مجارستانی ازبکی شمالی
بنجار (خط لاتین) ایسلندی بوکمال نروژی
باسک ایلوکو نروژی نینورسک
بلاروسی اندونزیایی نیانیا
بوجپوری فارسی ایرانی اودیا (زبان شخصی)
بوسنیایی ایتالیایی فارسی (افغانستان)
بوگینی ژاپنی لهستانی
بلغاری جاوه ای پرتغالی
کانتونی کامبا پنجابی
کاتالان کانارا رومانیایی
سبوانو کشمیری (خط عربی) روسی
کردی مرکزی کشمیری (خط دیوه) سانتالی
چتیسگری قزاق صربی
چینی (خط هانس) خمر سینهالی
چینی (خط هانت) کیکویو اسلواکی
کرواتی کینیارواندایی آذربایجان جنوبی
چک کنگو پشتو جنوبی
دانمارکی کره ای اسپانیایی
هلندی قرقیز عربی استاندارد (خط عربی)
عربی مصری لائو عربی استاندارد (خط لاتین)
انگلیسی لینگالا استاندارد لتونی
استونیایی مقدونی مالایی استاندارد
فیلیپینی ماگای تامیل
فرانسوی میثیلی تلوگو
گالیسیایی مالایالامی ترکی
گاندا مالتی ویتنامی
گرجی — —
،

Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) مدل متن به گفتار سریع، مقرون به صرفه و کارآمد گوگل است که برای جایگزینی gemini-3.1-flash-tts-preview برای بارهای کاری تولیدی با توان عملیاتی بالا ساخته شده است.

نمای کلی و قابلیت‌ها

Gemini 3.8 Flash-Lite TTS تأخیر کم را با گفتار رسا و طبیعی ترکیب می‌کند:

  • بهره‌وری با توان عملیاتی بالا: برای تولید انبوه، آبشارهای عامل صوتی مکالمه‌ای، ویژگی‌های خواندن با صدای بلند و تولید گفتار تک‌گوینده روزمره در زبان‌های اصلی بهینه شده است.
  • سازگاری با طرحواره Drop-in: دقیقاً همان طرحواره API و قالب اعلان ساختاریافته gemini-3.8-flash-tts را به اشتراک می‌گذارد و به شما امکان می‌دهد مدل‌ها را با تغییر یک پارامتر واحد تغییر دهید.
  • پشتیبانی کامل از اکوسیستم صدا: از صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته ( GET /v1beta/voices )، شخصیت‌های طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) پشتیبانی می‌کند. همچنین می‌توانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.

برای پوشش کامل ویژگی‌ها، ارائه بهترین شیوه‌ها و نمونه‌های کد، از راهنمای تبدیل متن به گفتار دیدن کنید.

چه زمانی از کدام مدل TTS استفاده کنیم؟

هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:

ویژگی / حجم کار جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts ) جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts )
قدرت اولیه توان عملیاتی بالا، تأخیر کم و بهره‌وری هزینه حداکثر دقت در صدا، ظرافت‌های بازیگری و پوشش گویش‌ها
بهترین موارد استفاده تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگی‌های خواندن با صدای بلند، تکثیر صدا، تولید تک‌بلندگوی روزمره کتاب‌های صوتی، روایت استودیویی، دیالوگ‌های پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویش‌های منطقه‌ای
زبان‌های پشتیبانی‌شده ۱۰۱ زبان ۱۳۰ زبان
جایگزین پیشنهادی برای gemini-3.1-flash-tts-preview رده خلاقانه پرچمدار جدید

راهنمای مهاجرت

اگر در حال ارتقا از gemini-3.1-flash-tts-preview به gemini-3.8-flash-lite-tts هستید، درخواست‌های خود را برای طرحواره Gemini 3.8 TTS به‌روزرسانی کنید:

  1. انتقال دستورالعمل‌های سطح نوبت به ابرداده‌های گفتاری ( speech_metadata : جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر می‌گیرد. دستورالعمل‌های متنی درون‌خطی مانند "Say cheerfully: Hello!" یا "Speaker 1: Hello!" می‌توان با صدای بلند بیان کرد. دستورالعمل‌های تحویل پایدار ( style ) و برچسب‌های گوینده ( speaker ) را به ابرداده‌های ساختاریافته منتقل کنید:
    • API تعاملات: یک حاشیه‌نویسی با "type": "speech_metadata" ، "speaker" و "style" به هر بلوک محتوای متن پیوست کنید.
    • API تولید محتوا: "speech_metadata": {"speaker": "...", "style": "..."} را به هر part پیوست کنید.
  2. فقط برای رویدادهای صوتیِ لحظه‌ای از برچسب‌های درون‌خطیِ براکت زاویه‌دار استفاده کنید: صداهای غیرگفتاریِ لحظه‌ای و مکث‌ها را با استفاده از براکت زاویه‌دار در متن به صورت درون‌خطی نگه دارید (مانند <laugh> ، <sigh> ، <cough> ، <breath> یا <short pause> ). سبک‌های بیان مانند زمزمه را در speech_metadata.style قرار دهید.
  3. مشخص کردن speaker در هر نوبت در درخواست‌های چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاً speaker در داخل speech_metadata که با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند.
  4. طراحی شخصیت‌ها از قبل با طراحی صدا: بلوک‌های قدیمی و طولانی پروفایل صوتی / یادداشت‌های کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه voice_... را از طریق درخواست‌های TTS خود با رشته‌های style حداقلی یا خالی منتقل کنید.
  5. در نظر گرفتن خروجی پیش‌فرض WAV ( audio/wav ) در درخواست‌های unary: برخلاف gemini-3.1-flash-tts-preview و مدل‌های TTS قبلی (که به طور پیش‌فرض PCM audio/l16 خام بدون سربرگ را برمی‌گرداندند)، Gemini 3.8 TTS به طور پیش‌فرض برای درخواست‌های unary، صدای WAV ( audio/wav / AUDIO_WAV ) را با یک سربرگ استاندارد RIFF برمی‌گرداند.
    • اگر کد شما قبلاً بایت‌های خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول wave پایتون یا ffmpeg )، پوشش هدر دستی را حذف کرده و بایت‌های برگردانده شده را مستقیماً در یک فایل .wav بنویسید.
    • اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً response_format را روی "audio/l16" ( "AUDIO_L16" ) ، "audio/mulaw" ( "AUDIO_MULAW" ) یا "audio/alaw" ( "AUDIO_ALAW" ) تنظیم کنید. به بخش فرمت‌های خروجی صدا مراجعه کنید.

بخش‌های موردنیاز علامت‌گذاری شده‌اند

ملک توضیحات
کد مدل gemini-3.8-flash-lite-tts
انواع داده پشتیبانی شده را

ورودی‌ها

متن

خروجی

صوتی

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۸,۱۹۲

محدودیت توکن خروجی

۱۶۳۸۴ (محدودیت سرویس‌دهی API جمینی)

قابلیت‌های

تولید صدا

پشتیبانی شده

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی نمی‌شود

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی نمی‌شود

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی نمی‌شود

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی شده

استنتاج اولویت

پشتیبانی شده

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • gemini-3.8-flash-lite-tts
آخرین به‌روزرسانی سپتامبر ۲۰۲۶

زبان‌های پشتیبانی‌شده

gemini-3.8-flash-lite-tts زبان ورودی را به طور خودکار تشخیص می‌دهد و بیش از ۱۰۰ زبان را پشتیبانی می‌کند:

زبان زبان زبان
آچه‌ای (خط عربی) آلمانی مانیپوری
آفریکانس یونانی مراتی
آکان گجراتی مینانگکابائو (خط عربی)
امهری کریول هائیتیایی میزو
ارمنی هاله مغولی نپالی (زبان شخصی)
آسامی هوسا فولفولد نیجریه‌ای
عوضی عبری آذربایجان شمالی
بالیایی هندی سوتوی شمالی
بنگلا مجارستانی ازبکی شمالی
بنجار (خط لاتین) ایسلندی بوکمال نروژی
باسک ایلوکو نروژی نینورسک
بلاروسی اندونزیایی نیانیا
بوجپوری فارسی ایرانی اودیا (زبان شخصی)
بوسنیایی ایتالیایی فارسی (افغانستان)
بوگینی ژاپنی لهستانی
بلغاری جاوه ای پرتغالی
کانتونی کامبا پنجابی
کاتالان کانارا رومانیایی
سبوانو کشمیری (خط عربی) روسی
کردی مرکزی کشمیری (خط دیوه) سانتالی
چتیسگری قزاق صربی
چینی (خط هانس) خمر سینهالی
چینی (خط هانت) کیکویو اسلواکی
کرواتی کینیارواندایی آذربایجان جنوبی
چک کنگو پشتو جنوبی
دانمارکی کره ای اسپانیایی
هلندی قرقیز عربی استاندارد (خط عربی)
عربی مصری لائو عربی استاندارد (خط لاتین)
انگلیسی لینگالا استاندارد لتونی
استونیایی مقدونی مالایی استاندارد
فیلیپینی ماگای تامیل
فرانسوی میثیلی تلوگو
گالیسیایی مالایالامی ترکی
گاندا مالتی ویتنامی
گرجی — —