Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts), Google का फ़्लैगशिप क्रिएटिव टेक्स्ट-टू-स्पीच मॉडल है. इसे स्टूडियो-ग्रेड की आवाज़, शानदार एक्टिंग, स्थानीय लहजे, और लंबी सिलसिलेवार बातचीत के दौरान स्थिरता बनाए रखने के लिए बनाया गया है.

खास जानकारी और सुविधाएं

Gemini 3.8 Flash TTS, भावनात्मक ऑडियो जनरेट करने के लिए एक नया बेंचमार्क सेट करता है:

  • आवाज़ की क्वालिटी और ऐक्टिंग की बारीकियां: इसमें भावनाएं ज़ाहिर करने के लिए अलग-अलग तरह के शब्दों का इस्तेमाल किया जाता है. साथ ही, बोलने का तरीका स्वाभाविक होता है. इसमें बारीकी से यह ध्यान रखा जाता है कि style लेवल के निर्देशों और इनलाइन वोकल इवेंट (<laugh>, <sigh>, <short pause>) का सही तरीके से पालन किया जाए.
  • लंबे समय तक चलने वाली सिलसिलेवार बातचीत में आवाज़ की स्थिरता: लंबे डायलॉग और कई मिनट तक चलने वाले नरेशन में, आवाज़ की पहचान, टोन, वॉल्यूम, और कमरे के ऐको को एक जैसा बनाए रखता है. साथ ही, आवाज़ में बदलाव नहीं होता.
  • क्षेत्र के हिसाब से उच्चारण और लहजे का सही इस्तेमाल: इसमें क्षेत्र के हिसाब से उच्चारण, अल्पसंख्यक बोलियों, और लाइन में मौजूद इंटरनेशनल फ़ोनेटिक अल्फ़ाबेट (आईपीए) को बदलने की सुविधा मिलती है.
  • आवाज़ से जुड़े पूरे ईकोसिस्टम के साथ काम करता है: यह पहले से मौजूद आवाज़ों, एक्सटेंडेड वॉइस लाइब्रेरी (GET /v1beta/voices), कस्टम वॉइस डिज़ाइन पर्सोना, और वॉइस रेप्लिकेशन के साथ बिना किसी रुकावट के काम करता है. इसमें डिफ़ॉल्ट रूप से, सेव की गई आवाज़ें और बिना स्टेटस वाली कुंजियां शामिल होती हैं. Google AI Studio में, आवाज़ों को इंटरैक्टिव तरीके से डिज़ाइन और कॉपी भी किया जा सकता है.

सुविधाओं, प्रॉम्प्ट के सबसे सही तरीकों, और कोड के उदाहरणों के बारे में पूरी जानकारी के लिए, टेक्स्ट को आवाज़ में बदलने की सुविधा वाली गाइड पर जाएं.

किस टीटीएस मॉडल का इस्तेमाल कब करना चाहिए

Gemini 3.8 के दोनों टीटीएस मॉडल, एक ही एपीआई स्कीमा और प्रॉम्प्टिंग स्ट्रक्चर का इस्तेमाल करते हैं. अपने वर्कलोड के हिसाब से मॉडल चुनें:

सुविधा / वर्कलोड Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
प्राइमरी स्ट्रेंथ आवाज़ की क्वालिटी, ऐक्टिंग की बारीकियां, और बोली की विविधता हाई थ्रूपुट, कम इंतज़ार का समय, और कम लागत
इस्तेमाल के सबसे सही उदाहरण ऑडियो बुक, स्टूडियो में की गई रिकॉर्डिंग, कई लोगों के बीच की गई मुश्किल बातचीत, तेज़ आवाज़ में की गई ऐक्टिंग, मुश्किल उच्चारण, क्षेत्रीय बोलियां ज़्यादा मात्रा में प्रोडक्शन, रीयल-टाइम में वॉइस एजेंट कैस्केड, पढ़कर सुनाने की सुविधाएं, आवाज़ की नकल करना, और रोज़ाना एक स्पीकर जनरेट करना
इस्तेमाल की जा सकने वाली भाषाएं 130 भाषाएं 101 भाषाएं
इसके बदले यह इस्तेमाल करने का सुझाव दिया गया है फ़्लैगशिप क्रिएटिव का नया टियर gemini-3.1-flash-tts-preview

माइग्रेशन गाइड

अगर आपको gemini-3.1-flash-tts-preview या इससे पहले के Gemini TTS मॉडल से माइग्रेट करना है, तो Gemini 3.8 TTS स्कीमा के लिए अपने अनुरोधों को अपडेट करें:

  1. मोड़ के हिसाब से दिए गए निर्देशों को speech_metadata में ले जाएं: Gemini 3.8 टीटीएस, इनपुट टेक्स्ट को हूबहू ट्रांसक्रिप्ट के तौर पर लेता है. "Say cheerfully: Hello!" या "Speaker 1: Hello!" जैसे इनलाइन टेक्स्ट निर्देशों को तेज़ आवाज़ में सुनाया जा सकता है. सस्टेंड डिलीवरी के निर्देशों (style) और स्पीकर लेबल (speaker) को स्ट्रक्चर्ड मेटाडेटा में ले जाएं:
    • Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में "type": "speech_metadata", "speaker", और "style" के साथ एनोटेशन अटैच करें.
    • GenerateContent API: हर part में "speech_metadata": {"speaker": "...", "style": "..."} अटैच करें.
  2. सिर्फ़ कुछ समय के लिए होने वाली आवाज़ की घटनाओं के लिए, ऐंगल-ब्रैकेट वाले इनलाइन टैग इस्तेमाल करें: कुछ समय के लिए होने वाली आवाज़ और पॉज़ को ट्रांसक्रिप्ट में इनलाइन रखें. इसके लिए, ऐंगल ब्रैकेट (जैसे कि <laugh>, <sigh>, <cough>, <breath> या <short pause>) का इस्तेमाल करें. बोलने के तरीके, जैसे कि फुसफुसाना, speech_metadata.style में रखें.
  3. एक से ज़्यादा स्पीकर वाले अनुरोधों में, हर बार speaker तय करें: एक से ज़्यादा स्पीकर वाले अनुरोध में, हर बार speech_metadata के अंदर speaker को साफ़ तौर पर शामिल किया जाना चाहिए. यह, कॉन्फ़िगर किए गए किसी स्पीकर से मेल खाना चाहिए.
  4. आवाज़ के डिज़ाइन की मदद से, पहले से ही पर्सोना डिज़ाइन करें: लेगसी ऑडियो प्रोफ़ाइल / डायरेक्टर के नोट वाले लंबे ब्लॉक को आवाज़ के डिज़ाइन में बनाई गई कस्टम आवाज़ से बदलें. इसके बाद, टीटीएस के अनुरोधों के साथ उस voice_... आईडी को कम से कम या खाली style स्ट्रिंग के साथ भेजें.
  5. एकल अनुरोधों पर डिफ़ॉल्ट WAV (audio/wav) आउटपुट के लिए खाता: gemini-3.1-flash-tts-preview और इससे पहले के टीटीएस मॉडल (जो डिफ़ॉल्ट रूप से हेडरलेस रॉ पीसीएम audio/l16 दिखाते थे) के उलट, Gemini 3.8 टीटीएस, एकल अनुरोधों के लिए डिफ़ॉल्ट रूप से स्टैंडर्ड RIFF हेडर के साथ WAV ऑडियो (audio/wav / AUDIO_WAV) दिखाता है.
    • अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के wave मॉड्यूल या ffmpeg का इस्तेमाल करके), तो मैन्युअल हेडर रैपर को हटा दें. साथ ही, लौटाए गए बाइट को सीधे .wav फ़ाइल में लिखें.
    • अगर आपकी पाइपलाइन के लिए, हेडरलेस रॉ पीसीएम, म्यू-लॉ या ए-लॉ ऑडियो की ज़रूरत है, तो response_format को "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") या "audio/alaw" ("AUDIO_ALAW") पर सेट करें. ऑडियो आउटपुट फ़ॉर्मैट देखें.

gemini-3.8-flash-tts

प्रॉपर्टी ब्यौरा
मॉडल कोड gemini-3.8-flash-tts
के साथ इस्तेमाल किए जा सकने वाले डेटा टाइप

इनपुट

टेक्स्ट

आउटपुट

ऑडियो

टोकन की सीमाएं[*]

इनपुट टोकन की सीमा

8,192

आउटपुट टोकन की सीमा

16,384

सुविधाएँ

ऑडियो जनरेट करने की सुविधा

काम करता है

कैश मेमोरी में सेव होना

काम करता है

कोड एक्ज़ीक्यूट करना

काम नहीं करता है

फ़ाइल खोजना

काम नहीं करता है

फ़ंक्शन कॉलिंग

काम नहीं करता है

Google Maps की मदद से जवाब तैयार करना

काम नहीं करता है

इमेज जनरेट करने की सुविधा

काम नहीं करता है

Live API

काम नहीं करता है

भरोसेमंद स्रोतों से जानकारी लेना

काम नहीं करता है

स्ट्रक्चर्ड आउटपुट

काम नहीं करता है

सोचना

काम नहीं करता है

यूआरएल का कॉन्टेक्स्ट

काम नहीं करता है

कॉन्टेंट देखने के विकल्प

Batch API

काम करता है

Flex inference

काम करता है

प्राथमिकता का अनुमान लगाना

काम करता है

वर्शन
ज़्यादा जानकारी के लिए, मॉडल वर्शन के पैटर्न पढ़ें.
  • gemini-3.8-flash-tts
नया अपडेट जुलाई 2026

इस्तेमाल की जा सकने वाली भाषाएं

gemini-3.8-flash-tts इनपुट की भाषा का अपने-आप पता लगाता है और 130 भाषाओं में काम करता है:

भाषा भाषा भाषा
एचनीज़ (अरबी स्क्रिप्ट) ग्रीक नेपाली (अलग भाषा)
अफ़्रीकान्स गुअरानी नाइजीरिया की फु़लफु़लदे
आकान गुजराती उत्तरी अज़रबैजान
अमहैरिक हैतियन क्रिओल नॉर्दर्न सोथो
आर्मीनियन हलह मंगोलियन नॉर्दर्न उज़्बेक
असमिया हौसा नॉर्वेजियन बोकमाल
अवधी हिब्रू नार्वेजियन नॉर्स्क
बालीनीज़ हिन्दी न्यान्जा
बांग्ला हंगेरियन ओसीटन
बंजार (अरबी लिपि) आइसलैंडिक ओड़िया (अलग भाषा)
बंजार (लैटिन स्क्रिप्ट) इग्बो पंगासिनान
बाश्कियर ईलोको पर्शन (अफ़ग़ानिस्तान)
बॉस्क इंडोनेशियन पोलिश
बेलारूसी ईरानी फ़ारसी पॉर्चुगीज़
बेंबा इटैलियन पंजाबी
भोजपुरी जापानी रोमानियन
बोस्नियन जावानीज़ रूसी
ब्‍यूगिनी कबाइल संथाली
बल्गैरियन कांबा सर्बियन
बर्मीज़ कन्नड़ सिंधी
कैंटोनीज़ कश्मीरी (अरबी लिपि) सिंहला
कैटलैन कश्मीरी (देव स्क्रिप्ट) स्लोवाक
सेबुआनो कज़ाक स्लोवेनियन
सेंट्रल कुर्दिश ख्मेर सोमाली
छत्तीसगढ़ी किकुयू दक्षिणी अज़रबैजानी
चाइनीज़ (हंस स्क्रिप्ट) किनयारवांडा दक्षिणी पश्तो
चाइनीज़ (हंत स्क्रिप्ट) कॉन्गो सदर्न सुटू
क्राइमियन टाटर कोरियन स्पैनिश
क्रोएशियन किर्गिज़ स्टैंडर्ड ऐरेबिक (अरबी लिपि)
चेक लाओ स्टैंडर्ड ऐरेबिक (लैटिन स्क्रिप्ट)
डैनिश लैजालियन स्टैंडर्ड लातवियन
डच लिंगाला स्टैंडर्ड मलय
ड्यूला लिथुएनियन स्वाहीली (अलग भाषा)
जोंगखा लक्ज़मबर्गिश स्वाटी
मिस्री अरबी मैसेडोनियन स्वीडिश
अंग्रेज़ी मगही ताजिक
एस्टोनियन मैथिली तमिल
फ़िलिपीनी मलयालम तेलुगु
फ़िनिश मोल्टीज़ थाई
फ़्रांसीसी मणिपुरी तिग्रिन्या
गैलिशियन मराठी टॉस्क अल्बानियन
गांदा मिनांग्काबाउ (अरबी लिपि) विगर
जॉर्जियन मिनांग्काबाउ (लैटिन स्क्रिप्ट)
जर्मन मिज़ो