جمینی ۳.۸ فلش تیتیاس ( gemini-3.8-flash-tts ) مدل متن به گفتار خلاقانه و پرچمدار گوگل است که برای وفاداری به صدا در سطح استودیویی، بازیگری رسا، لهجههای محلی اصیل و پایداری چندترمینال بسیار قوی در فرمهای طولانی مهندسی شده است.
نمای کلی و قابلیتها
Gemini 3.8 Flash TTS معیار جدیدی را برای تولید صدای رسا تعیین میکند:
- دقت بالای آکوستیک و ظرافتهای اجرایی: ارائه دهندهی طیف احساسی غنی، ریتم طبیعی و پایبندی دقیق به جهتهای
styleترن لول و رویدادهای صوتی درون خطی (<laugh>،<sigh>،<short pause>). - پایداری چند نوبتی در فرم طولانی: هویت صدا، طنین، بلندی صدا و تُن آکوستیک اتاق را در دیالوگهای طولانی و روایتهای چند دقیقهای بدون تغییر صدا حفظ میکند.
- لهجهها و تلفظهای منطقهای اصیل: از لهجههای منطقهای، گویشهای اقلیتها و لغو الفبای آوانگاری بینالمللی (IPA) درونخطی پشتیبانی میکند.
- پشتیبانی کامل از اکوسیستم صدا: به طور یکپارچه با صداهای از پیش ساخته شده، کتابخانه صدای توسعه یافته (
GET /v1beta/voices)، شخصیتهای طراحی صدای سفارشی و تکثیر صدا (صداهای ذخیره شده دائمی به طور پیش فرض، به علاوه کلیدهای بدون وضعیت اختیاری) کار میکند. همچنین میتوانید صداها را به صورت تعاملی در Google AI Studio طراحی و تکثیر کنید.
برای پوشش کامل ویژگیها، ارائه بهترین شیوهها و نمونههای کد، از راهنمای تبدیل متن به گفتار دیدن کنید.
چه زمانی از کدام مدل TTS استفاده کنیم؟
هر دو مدل Gemini 3.8 TTS از طرحواره API و ساختار اعلان یکسانی برخوردارند. مدلی را انتخاب کنید که با حجم کاری شما متناسب باشد:
| ویژگی / حجم کار | جمینی ۳.۸ فلش TTS ( gemini-3.8-flash-tts ) | جمینی ۳.۸ فلش-لایت TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| قدرت اولیه | حداکثر دقت در صدا، ظرافتهای بازیگری و پوشش گویشها | توان عملیاتی بالا، تأخیر کم و بهرهوری هزینه |
| بهترین موارد استفاده | کتابهای صوتی، روایت استودیویی، دیالوگهای پیچیده چند گوینده، اجرای سنگین و پشت سر هم صدا، تلفظ دشوار، گویشهای منطقهای | تولید با حجم بالا، آبشارهای عامل صوتی بلادرنگ، ویژگیهای خواندن با صدای بلند، تکثیر صدا، تولید تکبلندگوی روزمره |
| زبانهای پشتیبانیشده | ۱۳۰ زبان | ۱۰۱ زبان |
| جایگزین پیشنهادی برای | رده خلاقانه پرچمدار جدید | gemini-3.1-flash-tts-preview |
راهنمای مهاجرت
اگر از gemini-3.1-flash-tts-preview یا مدلهای قدیمیتر Gemini TTS مهاجرت میکنید، درخواستهای خود را برای طرحواره Gemini 3.8 TTS بهروزرسانی کنید:
- انتقال دستورالعملهای سطح نوبت به ابردادههای گفتاری (
speech_metadata: جمینی ۳.۸ TTS متن ورودی را دقیقاً به عنوان یک رونوشت کلمه به کلمه در نظر میگیرد. دستورالعملهای متنی درونخطی مانند"Say cheerfully: Hello!"یا"Speaker 1: Hello!"میتوان با صدای بلند بیان کرد. دستورالعملهای تحویل پایدار (style) و برچسبهای گوینده (speaker) را به ابردادههای ساختاریافته منتقل کنید:- API تعاملات: یک حاشیهنویسی با
"type": "speech_metadata"،"speaker"و"style"به هر بلوک محتوای متن پیوست کنید. - GenerateContent API:
"speech_metadata": {"speaker": "...", "style": "..."}را به هرpartاضافه کنید.
- API تعاملات: یک حاشیهنویسی با
- فقط برای رویدادهای صوتیِ لحظهای از برچسبهای درونخطیِ براکت زاویهدار استفاده کنید: صداهای غیرگفتاریِ لحظهای و مکثها را با استفاده از براکت زاویهدار در متن به صورت درونخطی نگه دارید (مانند
<laugh>،<sigh>،<cough>،<breath>یا<short pause>). سبکهای بیان مانند زمزمه را درspeech_metadata.styleقرار دهید. - مشخص کردن
speakerدر هر نوبت در درخواستهای چند گوینده: هر نوبت در یک درخواست چند گوینده باید صریحاًspeakerدر داخلspeech_metadataکه با یکی از گویندگان پیکربندی شده مطابقت دارد، لحاظ کند. - طراحی شخصیتها از قبل با طراحی صدا: بلوکهای قدیمی و طولانی پروفایل صوتی / یادداشتهای کارگردان را با یک صدای سفارشی ایجاد شده در طراحی صدا جایگزین کنید، سپس آن شناسه
voice_...را از طریق درخواستهای TTS خود با رشتههایstyleحداقلی یا خالی منتقل کنید. - در نظر گرفتن خروجی پیشفرض WAV (
audio/wav) در درخواستهای unary: برخلافgemini-3.1-flash-tts-previewو مدلهای TTS قبلی (که به طور پیشفرض PCMaudio/l16خام بدون سربرگ را برمیگرداندند)، Gemini 3.8 TTS به طور پیشفرض برای درخواستهای unary، صدای WAV (audio/wav/AUDIO_WAV) را با یک سربرگ استاندارد RIFF برمیگرداند.- اگر کد شما قبلاً بایتهای خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول
waveپایتون یاffmpeg)، پوشش هدر دستی را حذف کرده و بایتهای برگردانده شده را مستقیماً در یک فایل.wavبنویسید. - اگر خط تولید شما به صدای خام PCM، mu-law یا A-law بدون هدر نیاز دارد، صریحاً
response_formatرا روی"audio/l16"("AUDIO_L16") ،"audio/mulaw"("AUDIO_MULAW") یا"audio/alaw"("AUDIO_ALAW") تنظیم کنید. به بخش فرمتهای خروجی صدا مراجعه کنید.
- اگر کد شما قبلاً بایتهای خام PCM را در یک هدر WAV قرار داده است (برای مثال، با استفاده از ماژول
gemini-3.8-flash-tts
| ملک | توضیحات |
|---|---|
| کد مدل | gemini-3.8-flash-tts |
| انواع داده پشتیبانی شده را | ورودیها متن خروجی صوتی |
| محدودیتهای توکن [*] | محدودیت توکن ورودی ۸,۱۹۲ محدودیت توکن خروجی ۱۶,۳۸۴ |
| قابلیتهای | پشتیبانی شده پشتیبانی شده پشتیبانی نمیشود پشتیبانی نمیشود پشتیبانی نمیشود اتصال به زمین با نقشههای گوگل پشتیبانی نمیشود پشتیبانی نمیشود پشتیبانی نمیشود پشتیبانی نمیشود پشتیبانی نمیشود پشتیبانی نمیشود پشتیبانی نمیشود |
| گزینههای مصرف | پشتیبانی شده پشتیبانی شده پشتیبانی شده |
| نسخه |
|
| آخرین بهروزرسانی | ژوئیه ۲۰۲۶ |
زبانهای پشتیبانیشده
gemini-3.8-flash-tts زبان ورودی را به طور خودکار تشخیص میدهد و از ۱۳۰ زبان پشتیبانی میکند:
| زبان | زبان | زبان |
|---|---|---|
| آچهای (خط عربی) | یونانی | نپالی (زبان شخصی) |
| آفریکانس | گوارانی | فولفولد نیجریهای |
| آکان | گجراتی | آذربایجان شمالی |
| امهری | کریول هائیتیایی | سوتوی شمالی |
| ارمنی | هاله مغولی | ازبکی شمالی |
| آسامی | هوسا | بوکمال نروژی |
| عوضی | عبری | نروژی نینورسک |
| بالیایی | هندی | نیانیا |
| بنگلا | مجارستانی | اکسیتان |
| بنجار (خط عربی) | ایسلندی | اودیا (زبان شخصی) |
| بنجار (خط لاتین) | ایگبو | پانگاسینان |
| باشقیر | ایلوکو | فارسی (افغانستان) |
| باسک | اندونزیایی | لهستانی |
| بلاروسی | فارسی ایرانی | پرتغالی |
| بمبا | ایتالیایی | پنجابی |
| بوجپوری | ژاپنی | رومانیایی |
| بوسنیایی | جاوه ای | روسی |
| بوگینی | کابل | سانتالی |
| بلغاری | کامبا | صربی |
| برمهای | کانارا | سندی |
| کانتونی | کشمیری (خط عربی) | سینهالی |
| کاتالان | کشمیری (خط دیوه) | اسلواکی |
| سبوانو | قزاق | اسلوونیایی |
| کردی مرکزی | خمر | سومالیایی |
| چتیسگری | کیکویو | آذربایجان جنوبی |
| چینی (خط هانس) | کینیارواندایی | پشتو جنوبی |
| چینی (خط هانت) | کنگو | سوتوی جنوبی |
| تاتاری کریمه | کره ای | اسپانیایی |
| کرواتی | قرقیز | عربی استاندارد (خط عربی) |
| چک | لائو | عربی استاندارد (خط لاتین) |
| دانمارکی | لاتگالیایی | استاندارد لتونی |
| هلندی | لینگالا | مالایی استاندارد |
| دیولا | لیتوانیایی | سواحیلی (زبان شخصی) |
| دزونگخا | لوکزامبورگی | سواتی |
| عربی مصری | مقدونی | سوئدی |
| انگلیسی | ماگای | تاجیک |
| استونیایی | میثیلی | تامیل |
| فیلیپینی | مالایالامی | تلوگو |
| فنلاندی | مالتی | تایلندی |
| فرانسوی | مانیپوری | تیگرینیا |
| گالیسیایی | مراتی | آلبانیایی توسک |
| گاندا | مینانگکابائو (خط عربی) | اویغوری |
| گرجی | مینانگکابائو (خط لاتین) | — |
| آلمانی | میزو | — |