Gemini 3.8 Flash TTS (gemini-3.8-flash-tts), Google का फ़्लैगशिप क्रिएटिव टेक्स्ट-टू-स्पीच मॉडल है. इसे स्टूडियो-ग्रेड की आवाज़, शानदार एक्टिंग, स्थानीय लहजे, और लंबी सिलसिलेवार बातचीत के दौरान स्थिरता बनाए रखने के लिए बनाया गया है.
खास जानकारी और सुविधाएं
Gemini 3.8 Flash TTS, भावनात्मक ऑडियो जनरेट करने के लिए एक नया बेंचमार्क सेट करता है:
- आवाज़ की क्वालिटी और ऐक्टिंग की बारीकियां: इसमें भावनाएं ज़ाहिर करने के लिए अलग-अलग तरह के शब्दों का इस्तेमाल किया जाता है. साथ ही, बोलने का तरीका स्वाभाविक होता है. इसमें बारीकी से यह ध्यान रखा जाता है कि
styleलेवल के निर्देशों और इनलाइन वोकल इवेंट (<laugh>,<sigh>,<short pause>) का सही तरीके से पालन किया जाए. - लंबे समय तक चलने वाली सिलसिलेवार बातचीत में आवाज़ की स्थिरता: लंबे डायलॉग और कई मिनट तक चलने वाले नरेशन में, आवाज़ की पहचान, टोन, वॉल्यूम, और कमरे के ऐको को एक जैसा बनाए रखता है. साथ ही, आवाज़ में बदलाव नहीं होता.
- क्षेत्र के हिसाब से उच्चारण और लहजे का सही इस्तेमाल: इसमें क्षेत्र के हिसाब से उच्चारण, अल्पसंख्यक बोलियों, और लाइन में मौजूद इंटरनेशनल फ़ोनेटिक अल्फ़ाबेट (आईपीए) को बदलने की सुविधा मिलती है.
- आवाज़ से जुड़े पूरे ईकोसिस्टम के साथ काम करता है: यह पहले से मौजूद आवाज़ों, एक्सटेंडेड वॉइस लाइब्रेरी (
GET /v1beta/voices), कस्टम वॉइस डिज़ाइन पर्सोना, और वॉइस रेप्लिकेशन के साथ बिना किसी रुकावट के काम करता है. इसमें डिफ़ॉल्ट रूप से, सेव की गई आवाज़ें और बिना स्टेटस वाली कुंजियां शामिल होती हैं. Google AI Studio में, आवाज़ों को इंटरैक्टिव तरीके से डिज़ाइन और कॉपी भी किया जा सकता है.
सुविधाओं, प्रॉम्प्ट के सबसे सही तरीकों, और कोड के उदाहरणों के बारे में पूरी जानकारी के लिए, टेक्स्ट को आवाज़ में बदलने की सुविधा वाली गाइड पर जाएं.
किस टीटीएस मॉडल का इस्तेमाल कब करना चाहिए
Gemini 3.8 के दोनों टीटीएस मॉडल, एक ही एपीआई स्कीमा और प्रॉम्प्टिंग स्ट्रक्चर का इस्तेमाल करते हैं. अपने वर्कलोड के हिसाब से मॉडल चुनें:
| सुविधा / वर्कलोड | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| प्राइमरी स्ट्रेंथ | आवाज़ की क्वालिटी, ऐक्टिंग की बारीकियां, और बोली की विविधता | हाई थ्रूपुट, कम इंतज़ार का समय, और कम लागत |
| इस्तेमाल के सबसे सही उदाहरण | ऑडियो बुक, स्टूडियो में की गई रिकॉर्डिंग, कई लोगों के बीच की गई मुश्किल बातचीत, तेज़ आवाज़ में की गई ऐक्टिंग, मुश्किल उच्चारण, क्षेत्रीय बोलियां | ज़्यादा मात्रा में प्रोडक्शन, रीयल-टाइम में वॉइस एजेंट कैस्केड, पढ़कर सुनाने की सुविधाएं, आवाज़ की नकल करना, और रोज़ाना एक स्पीकर जनरेट करना |
| इस्तेमाल की जा सकने वाली भाषाएं | 130 भाषाएं | 101 भाषाएं |
| इसके बदले यह इस्तेमाल करने का सुझाव दिया गया है | फ़्लैगशिप क्रिएटिव का नया टियर | gemini-3.1-flash-tts-preview |
माइग्रेशन गाइड
अगर आपको gemini-3.1-flash-tts-preview या इससे पहले के Gemini TTS मॉडल से माइग्रेट करना है, तो Gemini 3.8 TTS स्कीमा के लिए अपने अनुरोधों को अपडेट करें:
- मोड़ के हिसाब से दिए गए निर्देशों को
speech_metadataमें ले जाएं: Gemini 3.8 टीटीएस, इनपुट टेक्स्ट को हूबहू ट्रांसक्रिप्ट के तौर पर लेता है."Say cheerfully: Hello!"या"Speaker 1: Hello!"जैसे इनलाइन टेक्स्ट निर्देशों को तेज़ आवाज़ में सुनाया जा सकता है. सस्टेंड डिलीवरी के निर्देशों (style) और स्पीकर लेबल (speaker) को स्ट्रक्चर्ड मेटाडेटा में ले जाएं:- Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में
"type": "speech_metadata","speaker", और"style"के साथ एनोटेशन अटैच करें. - GenerateContent API: हर
partमें"speech_metadata": {"speaker": "...", "style": "..."}अटैच करें.
- Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में
- सिर्फ़ कुछ समय के लिए होने वाली आवाज़ की घटनाओं के लिए, ऐंगल-ब्रैकेट वाले इनलाइन टैग इस्तेमाल करें: कुछ समय के लिए होने वाली आवाज़ और पॉज़ को ट्रांसक्रिप्ट में इनलाइन रखें. इसके लिए, ऐंगल ब्रैकेट (जैसे कि
<laugh>,<sigh>,<cough>,<breath>या<short pause>) का इस्तेमाल करें. बोलने के तरीके, जैसे कि फुसफुसाना,speech_metadata.styleमें रखें. - एक से ज़्यादा स्पीकर वाले अनुरोधों में, हर बार
speakerतय करें: एक से ज़्यादा स्पीकर वाले अनुरोध में, हर बारspeech_metadataके अंदरspeakerको साफ़ तौर पर शामिल किया जाना चाहिए. यह, कॉन्फ़िगर किए गए किसी स्पीकर से मेल खाना चाहिए. - आवाज़ के डिज़ाइन की मदद से, पहले से ही पर्सोना डिज़ाइन करें: लेगसी ऑडियो प्रोफ़ाइल / डायरेक्टर के नोट वाले लंबे ब्लॉक को आवाज़ के डिज़ाइन में बनाई गई कस्टम आवाज़ से बदलें. इसके बाद, टीटीएस के अनुरोधों के साथ उस
voice_...आईडी को कम से कम या खालीstyleस्ट्रिंग के साथ भेजें. - एकल अनुरोधों पर डिफ़ॉल्ट WAV (
audio/wav) आउटपुट के लिए खाता:gemini-3.1-flash-tts-previewऔर इससे पहले के टीटीएस मॉडल (जो डिफ़ॉल्ट रूप से हेडरलेस रॉ पीसीएमaudio/l16दिखाते थे) के उलट, Gemini 3.8 टीटीएस, एकल अनुरोधों के लिए डिफ़ॉल्ट रूप से स्टैंडर्ड RIFF हेडर के साथ WAV ऑडियो (audio/wav/AUDIO_WAV) दिखाता है.- अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के
waveमॉड्यूल याffmpegका इस्तेमाल करके), तो मैन्युअल हेडर रैपर को हटा दें. साथ ही, लौटाए गए बाइट को सीधे.wavफ़ाइल में लिखें. - अगर आपकी पाइपलाइन के लिए, हेडरलेस रॉ पीसीएम, म्यू-लॉ या ए-लॉ ऑडियो की ज़रूरत है, तो
response_formatको"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") या"audio/alaw"("AUDIO_ALAW") पर सेट करें. ऑडियो आउटपुट फ़ॉर्मैट देखें.
- अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के
gemini-3.8-flash-tts
| प्रॉपर्टी | ब्यौरा |
|---|---|
| मॉडल कोड | gemini-3.8-flash-tts |
| के साथ इस्तेमाल किए जा सकने वाले डेटा टाइप |
इनपुट टेक्स्ट आउटपुट ऑडियो |
| टोकन की सीमाएं[*] |
इनपुट टोकन की सीमा 8,192 आउटपुट टोकन की सीमा 16,384 |
| सुविधाएँ | काम करता है काम करता है काम नहीं करता है काम नहीं करता है काम नहीं करता है Google Maps की मदद से जवाब तैयार करना काम नहीं करता है काम नहीं करता है काम नहीं करता है भरोसेमंद स्रोतों से जानकारी लेना काम नहीं करता है काम नहीं करता है काम नहीं करता है काम नहीं करता है |
| कॉन्टेंट देखने के विकल्प |
काम करता है काम करता है काम करता है |
| वर्शन |
|
| नया अपडेट | जुलाई 2026 |
इस्तेमाल की जा सकने वाली भाषाएं
gemini-3.8-flash-tts इनपुट की भाषा का अपने-आप पता लगाता है और 130 भाषाओं में काम करता है:
| भाषा | भाषा | भाषा |
|---|---|---|
| एचनीज़ (अरबी स्क्रिप्ट) | ग्रीक | नेपाली (अलग भाषा) |
| अफ़्रीकान्स | गुअरानी | नाइजीरिया की फु़लफु़लदे |
| आकान | गुजराती | उत्तरी अज़रबैजान |
| अमहैरिक | हैतियन क्रिओल | नॉर्दर्न सोथो |
| आर्मीनियन | हलह मंगोलियन | नॉर्दर्न उज़्बेक |
| असमिया | हौसा | नॉर्वेजियन बोकमाल |
| अवधी | हिब्रू | नार्वेजियन नॉर्स्क |
| बालीनीज़ | हिन्दी | न्यान्जा |
| बांग्ला | हंगेरियन | ओसीटन |
| बंजार (अरबी लिपि) | आइसलैंडिक | ओड़िया (अलग भाषा) |
| बंजार (लैटिन स्क्रिप्ट) | इग्बो | पंगासिनान |
| बाश्कियर | ईलोको | पर्शन (अफ़ग़ानिस्तान) |
| बॉस्क | इंडोनेशियन | पोलिश |
| बेलारूसी | ईरानी फ़ारसी | पॉर्चुगीज़ |
| बेंबा | इटैलियन | पंजाबी |
| भोजपुरी | जापानी | रोमानियन |
| बोस्नियन | जावानीज़ | रूसी |
| ब्यूगिनी | कबाइल | संथाली |
| बल्गैरियन | कांबा | सर्बियन |
| बर्मीज़ | कन्नड़ | सिंधी |
| कैंटोनीज़ | कश्मीरी (अरबी लिपि) | सिंहला |
| कैटलैन | कश्मीरी (देव स्क्रिप्ट) | स्लोवाक |
| सेबुआनो | कज़ाक | स्लोवेनियन |
| सेंट्रल कुर्दिश | ख्मेर | सोमाली |
| छत्तीसगढ़ी | किकुयू | दक्षिणी अज़रबैजानी |
| चाइनीज़ (हंस स्क्रिप्ट) | किनयारवांडा | दक्षिणी पश्तो |
| चाइनीज़ (हंत स्क्रिप्ट) | कॉन्गो | सदर्न सुटू |
| क्राइमियन टाटर | कोरियन | स्पैनिश |
| क्रोएशियन | किर्गिज़ | स्टैंडर्ड ऐरेबिक (अरबी लिपि) |
| चेक | लाओ | स्टैंडर्ड ऐरेबिक (लैटिन स्क्रिप्ट) |
| डैनिश | लैजालियन | स्टैंडर्ड लातवियन |
| डच | लिंगाला | स्टैंडर्ड मलय |
| ड्यूला | लिथुएनियन | स्वाहीली (अलग भाषा) |
| जोंगखा | लक्ज़मबर्गिश | स्वाटी |
| मिस्री अरबी | मैसेडोनियन | स्वीडिश |
| अंग्रेज़ी | मगही | ताजिक |
| एस्टोनियन | मैथिली | तमिल |
| फ़िलिपीनी | मलयालम | तेलुगु |
| फ़िनिश | मोल्टीज़ | थाई |
| फ़्रांसीसी | मणिपुरी | तिग्रिन्या |
| गैलिशियन | मराठी | टॉस्क अल्बानियन |
| गांदा | मिनांग्काबाउ (अरबी लिपि) | विगर |
| जॉर्जियन | मिनांग्काबाउ (लैटिन स्क्रिप्ट) | — |
| जर्मन | मिज़ो | — |