Gemini 3.8 Flash TTS (gemini-3.8-flash-tts), Google का फ़्लैगशिप क्रिएटिव लिखे गए शब्दों को सुनने की सुविधा मॉडल है. इसे स्टूडियो-ग्रेड की आवाज़, शानदार एक्टिंग, स्थानीय लहजे, और लंबी सिलसिलेवार बातचीत के दौरान स्थिरता बनाए रखने के लिए बनाया गया है.
खास जानकारी और सुविधाएं
Gemini 3.8 Flash टीटीएस, भावनात्मक ऑडियो जनरेट करने के लिए एक नया बेंचमार्क सेट करता है:
- आवाज़ की क्वालिटी और ऐक्टिंग की बारीकियां: इसमें भावनाएं ज़ाहिर करने के लिए अलग-अलग तरह के शब्दों का इस्तेमाल किया जाता है. साथ ही, बोलने का तरीका स्वाभाविक होता है. इसमें बारीकी से यह ध्यान रखा जाता है कि
styleलेवल के निर्देशों और इनलाइन वोकल इवेंट (<laugh>,<sigh>,<short pause>) का सही तरीके से पालन किया जाए. - लंबे समय तक चलने वाली बातचीत में आवाज़ की स्थिरता: इसमें आवाज़ की पहचान, टोन, वॉल्यूम, और कमरे के ऐकोस्टिक टोन को लंबे डायलॉग और कई मिनट तक चलने वाले नरेशन में एक जैसा रखा जाता है. साथ ही, आवाज़ में बदलाव नहीं होता.
- क्षेत्रीय लहजे और उच्चारण का सटीक होना: इसमें क्षेत्रीय लहजे और अल्पसंख्यक बोलियों का इस्तेमाल किया जाता है.
- आवाज़ से जुड़े पूरे ईकोसिस्टम के साथ काम करता है: यह पहले से मौजूद आवाज़ों, एक्सटेंडेड वॉइस लाइब्रेरी (
GET /v1beta/voices), कस्टम वॉइस डिज़ाइन पर्सोना, और वॉइस रेप्लिकेशन (डिफ़ॉल्ट रूप से सेव की गई आवाज़ें और बिना स्टेटस वाली कुंजियां) के साथ आसानी से काम करता है. Google AI Studio में, आवाज़ों को इंटरैक्टिव तरीके से डिज़ाइन और कॉपी भी किया जा सकता है.
सुविधाओं, प्रॉम्प्ट लिखने के सबसे सही तरीकों, और कोड के उदाहरणों के बारे में पूरी जानकारी पाने के लिए, टेक्स्ट को आवाज़ में बदलने की सुविधा वाली गाइड देखें.
किस टीटीएस मॉडल का इस्तेमाल कब करना चाहिए
Gemini 3.8 के दोनों टीटीएस मॉडल, एक ही एपीआई स्कीमा और प्रॉम्प्टिंग स्ट्रक्चर का इस्तेमाल करते हैं. अपने वर्कलोड के हिसाब से मॉडल चुनें:
| सुविधा / वर्कलोड | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite टीटीएस (gemini-3.8-flash-lite-tts) |
|---|---|---|
| मुख्य ताकत | आवाज़ की क्वालिटी, ऐक्टिंग के बारीक़ अंतर, और बोली की विविधता को बेहतर बनाना | हाई थ्रूपुट, कम इंतज़ार का समय, और कम लागत |
| इस्तेमाल के सबसे सही उदाहरण | ऑडियो बुक, स्टूडियो में की गई रिकॉर्डिंग, कई लोगों के बीच की गई मुश्किल बातचीत, तेज़ आवाज़ में की गई ऐक्टिंग, मुश्किल उच्चारण, क्षेत्रीय बोलियां | ज़्यादा मात्रा में प्रोडक्शन, रीयल-टाइम में वॉइस एजेंट कैस्केड, पढ़कर सुनाने की सुविधाएं, आवाज़ की नकल करना, और रोज़ाना एक स्पीकर जनरेट करना |
| इस्तेमाल की जा सकने वाली भाषाएं | 130 भाषाएं | 101 भाषाएं |
| बदले जाने के लिए सुझाया गया | फ़्लैगशिप क्रिएटिव का नया टियर | gemini-3.1-flash-tts-preview |
माइग्रेशन गाइड
अगर आपको gemini-3.1-flash-tts-preview या इससे पहले के Gemini टीटीएस मॉडल से माइग्रेट करना है, तो Gemini 3.8 टीटीएस स्कीमा के लिए अपने अनुरोधों को अपडेट करें:
- मोड़ के हिसाब से निर्देशों को
speech_metadataमें ले जाएं: Gemini 3.8 टीटीएस, इनपुट किए गए टेक्स्ट को हूबहू ट्रांसक्रिप्ट के तौर पर लेता है."Say cheerfully: Hello!"या"Speaker 1: Hello!"जैसे इनलाइन टेक्स्ट निर्देशों को तेज़ आवाज़ में सुनाया जा सकता है. लगातार डिलीवरी से जुड़े निर्देशों (style) और स्पीकर लेबल (speaker) को स्ट्रक्चर्ड मेटाडेटा में ले जाएं:- Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में
"type": "speech_metadata","speaker", और"style"के साथ एनोटेशन अटैच करें. - GenerateContent API: हर
partमें"speech_metadata": {"speaker": "...", "style": "..."}अटैच करें.
- Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में
- सिर्फ़ कुछ समय के लिए होने वाली आवाज़ से जुड़ी घटनाओं के लिए, ऐंगल-ब्रैकेट वाले इनलाइन टैग इस्तेमाल करें: कुछ समय के लिए होने वाली आवाज़ और पॉज़ को ट्रांसक्रिप्ट में इनलाइन रखें. इसके लिए, ऐंगल ब्रैकेट (जैसे कि
<laugh>,<sigh>,<cough>,<breath>या<short pause>) का इस्तेमाल करें. बोलने के तरीके, जैसे कि फुसफुसाना,speech_metadata.styleमें रखें. - एक से ज़्यादा स्पीकर वाले अनुरोधों में, हर बार
speakerतय करें: एक से ज़्यादा स्पीकर वाले अनुरोध में, हर बारspeech_metadataके अंदरspeakerको साफ़ तौर पर शामिल किया जाना चाहिए. यह, कॉन्फ़िगर किए गए स्पीकर में से किसी एक से मेल खाना चाहिए. - वॉइस डिज़ाइन की मदद से, पहले से ही पर्सोना डिज़ाइन करना: ऑडियो प्रोफ़ाइल / डायरेक्टर के नोट वाले लंबे लेगसी ब्लॉक को वॉइस डिज़ाइन में बनाई गई कस्टम आवाज़ से बदलें. इसके बाद, टीटीएस के अनुरोधों में
voice_...आईडी को कम से कम या खालीstyleस्ट्रिंग के साथ इस्तेमाल करें. - एकल अनुरोधों पर डिफ़ॉल्ट WAV (
audio/wav) आउटपुट के लिए खाता:gemini-3.1-flash-tts-previewऔर टीटीएस के पुराने मॉडल (जो डिफ़ॉल्ट रूप से हेडरलेस रॉ पीसीएमaudio/l16दिखाते थे) के उलट, Gemini 3.8 टीटीएस, एकल अनुरोधों के लिए डिफ़ॉल्ट रूप से स्टैंडर्ड RIFF हेडर के साथ WAV ऑडियो (audio/wav/AUDIO_WAV) दिखाता है.- अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के
waveमॉड्यूल याffmpegका इस्तेमाल करके), तो मैन्युअल हेडर रैपर को हटाएं और लौटाए गए बाइट को सीधे.wavफ़ाइल में लिखें. - अगर आपकी पाइपलाइन को हेडरलेस रॉ पीसीएम, म्यू-लॉ या ए-लॉ ऑडियो की ज़रूरत है, तो
response_format.mime_typeको"audio/l16","audio/mulaw"या"audio/alaw"पर सेट करें. उदाहरण के लिए, Interactions API में{"response_format": {"type": "audio", "mime_type": "audio/l16"}}याgenerateContentमेंAUDIO_L16,AUDIO_MULAWयाAUDIO_ALAW. ऑडियो आउटपुट फ़ॉर्मैट देखें.
- अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के
gemini-3.8-flash-tts
| प्रॉपर्टी | ब्यौरा |
|---|---|
| मॉडल कोड | gemini-3.8-flash-tts |
| इस्तेमाल किए जा सकने वाले डेटा टाइप |
इनपुट टेक्स्ट आउटपुट ऑडियो |
| टोकन की सीमाएं[*] |
इनपुट टोकन की सीमा 8,192 आउटपुट टोकन की सीमा 16,384 (Gemini API की सेवा देने की सीमा) |
| सुविधाएँ | काम करता है काम नहीं करता है काम नहीं करता है काम नहीं करता है काम नहीं करता है Google Maps की मदद से जानकारी पाना काम नहीं करता है काम नहीं करता है काम नहीं करता है भरोसेमंद स्रोतों से जानकारी लेना काम नहीं करता है काम नहीं करता है काम नहीं करता है काम नहीं करता है |
| कॉन्टेंट देखने के विकल्प |
काम करता है काम करता है काम करता है |
| वर्शन |
|
| नया अपडेट | सितंबर 2026 |
इस्तेमाल की जा सकने वाली भाषाएं
gemini-3.8-flash-tts इनपुट की भाषा का अपने-आप पता लगाता है और 130 से ज़्यादा भाषाओं में काम करता है:
| भाषा | भाषा | भाषा |
|---|---|---|
| एचनीज़ (अरबी स्क्रिप्ट) | ग्रीक | नेपाली (अलग भाषा) |
| अफ़्रीकान्स | गुअरानी | नाइजीरियन फ़ुलफ़ुल्दे |
| आकान | गुजराती | उत्तरी अज़रबैजान |
| अमहैरिक | हैतियन क्रिओल | नॉर्दर्न सोथो |
| आर्मीनियन | हलह मंगोलियन | उत्तरी उज़्बेक |
| असमिया | हौसा | नॉर्वेजियन बोकमाल |
| अवधी | हिब्रू | नार्वेजियन नॉर्स्क |
| बालीनीज़ | हिन्दी | न्यान्जा |
| बांग्ला | हंगेरियन | ओसीटन |
| बंजार (अरबी लिपि) | आइसलैंडिक | ओड़िया (अलग भाषा) |
| बंजार (लैटिन स्क्रिप्ट) | इग्बो | पंगासिनान |
| बाश्कियर | ईलोको | पर्शन (अफ़ग़ानिस्तान) |
| बॉस्क | इंडोनेशियन | पोलिश |
| Belarusian | ईरानी फ़ारसी | पॉर्चुगीज़ |
| बेंबा | इटैलियन | पंजाबी |
| भोजपुरी | जापानी | रोमानियन |
| बोस्नियन | जावानीज़ | रूसी |
| ब्यूगिनी | कबाइल | संथाली |
| बल्गैरियन | कांबा | सर्बियन |
| बर्मीज़ | कन्नड़ | सिंधी |
| कैंटोनीज़ | कश्मीरी (अरबी लिपि) | सिंहला |
| कैटलैन | कश्मीरी (देव स्क्रिप्ट) | स्लोवाक |
| सेबुआनो | कज़ाक | स्लोवेनियन |
| सेंट्रल कुर्दिश | ख्मेर | सोमाली |
| छत्तीसगढ़ी | किकुयू | दक्षिणी अज़रबैजानी |
| चाइनीज़ (हंस स्क्रिप्ट) | किनयारवांडा | दक्षिणी पश्तो |
| चाइनीज़ (हंत स्क्रिप्ट) | कॉन्गो | सदर्न सुटू |
| क्राइमियन टाटर | कोरियन | स्पैनिश |
| क्रोएशियन | किर्गिज़ | स्टैंडर्ड ऐरेबिक (अरबी लिपि) |
| चेक | लाओ | स्टैंडर्ड ऐरेबिक (लैटिन स्क्रिप्ट) |
| डैनिश | लैजालियन | स्टैंडर्ड लातवियन |
| डच | लिंगाला | स्टैंडर्ड मलय |
| ड्यूला | लिथुएनियन | स्वाहिली (अलग भाषा) |
| जोंगखा | लक्ज़मबर्गिश | स्वाटी |
| मिस्री अरबी | मैसेडोनियन | स्वीडिश |
| अंग्रेज़ी | मगही | ताजिक |
| एस्टोनियन | मैथिली | तमिल |
| फ़िलिपीनी | मलयालम | तेलुगु |
| फ़िनिश | मोल्टीज़ | थाई |
| फ़्रांसीसी | मणिपुरी | तिग्रिन्या |
| गैलिशियन | मराठी | टॉस्क अल्बानियन |
| गांदा | मिनांग्काबाउ (अरबी लिपि) | टर्किश |
| जॉर्जियन | मिनांग्काबाउ (लैटिन स्क्रिप्ट) | विगर |
| जर्मन | मिज़ो | वियतनामीज़ |