Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts), Google का फ़्लैगशिप क्रिएटिव लिखे गए शब्दों को सुनने की सुविधा मॉडल है. इसे स्टूडियो-ग्रेड की आवाज़, शानदार एक्टिंग, स्थानीय लहजे, और लंबी सिलसिलेवार बातचीत के दौरान स्थिरता बनाए रखने के लिए बनाया गया है.

खास जानकारी और सुविधाएं

Gemini 3.8 Flash टीटीएस, भावनात्मक ऑडियो जनरेट करने के लिए एक नया बेंचमार्क सेट करता है:

  • आवाज़ की क्वालिटी और ऐक्टिंग की बारीकियां: इसमें भावनाएं ज़ाहिर करने के लिए अलग-अलग तरह के शब्दों का इस्तेमाल किया जाता है. साथ ही, बोलने का तरीका स्वाभाविक होता है. इसमें बारीकी से यह ध्यान रखा जाता है कि style लेवल के निर्देशों और इनलाइन वोकल इवेंट (<laugh>, <sigh>, <short pause>) का सही तरीके से पालन किया जाए.
  • लंबे समय तक चलने वाली बातचीत में आवाज़ की स्थिरता: इसमें आवाज़ की पहचान, टोन, वॉल्यूम, और कमरे के ऐकोस्टिक टोन को लंबे डायलॉग और कई मिनट तक चलने वाले नरेशन में एक जैसा रखा जाता है. साथ ही, आवाज़ में बदलाव नहीं होता.
  • क्षेत्रीय लहजे और उच्चारण का सटीक होना: इसमें क्षेत्रीय लहजे और अल्पसंख्यक बोलियों का इस्तेमाल किया जाता है.
  • आवाज़ से जुड़े पूरे ईकोसिस्टम के साथ काम करता है: यह पहले से मौजूद आवाज़ों, एक्सटेंडेड वॉइस लाइब्रेरी (GET /v1beta/voices), कस्टम वॉइस डिज़ाइन पर्सोना, और वॉइस रेप्लिकेशन (डिफ़ॉल्ट रूप से सेव की गई आवाज़ें और बिना स्टेटस वाली कुंजियां) के साथ आसानी से काम करता है. Google AI Studio में, आवाज़ों को इंटरैक्टिव तरीके से डिज़ाइन और कॉपी भी किया जा सकता है.

सुविधाओं, प्रॉम्प्ट लिखने के सबसे सही तरीकों, और कोड के उदाहरणों के बारे में पूरी जानकारी पाने के लिए, टेक्स्ट को आवाज़ में बदलने की सुविधा वाली गाइड देखें.

किस टीटीएस मॉडल का इस्तेमाल कब करना चाहिए

Gemini 3.8 के दोनों टीटीएस मॉडल, एक ही एपीआई स्कीमा और प्रॉम्प्टिंग स्ट्रक्चर का इस्तेमाल करते हैं. अपने वर्कलोड के हिसाब से मॉडल चुनें:

सुविधा / वर्कलोड Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite टीटीएस (gemini-3.8-flash-lite-tts)
मुख्य ताकत आवाज़ की क्वालिटी, ऐक्टिंग के बारीक़ अंतर, और बोली की विविधता को बेहतर बनाना हाई थ्रूपुट, कम इंतज़ार का समय, और कम लागत
इस्तेमाल के सबसे सही उदाहरण ऑडियो बुक, स्टूडियो में की गई रिकॉर्डिंग, कई लोगों के बीच की गई मुश्किल बातचीत, तेज़ आवाज़ में की गई ऐक्टिंग, मुश्किल उच्चारण, क्षेत्रीय बोलियां ज़्यादा मात्रा में प्रोडक्शन, रीयल-टाइम में वॉइस एजेंट कैस्केड, पढ़कर सुनाने की सुविधाएं, आवाज़ की नकल करना, और रोज़ाना एक स्पीकर जनरेट करना
इस्तेमाल की जा सकने वाली भाषाएं 130 भाषाएं 101 भाषाएं
बदले जाने के लिए सुझाया गया फ़्लैगशिप क्रिएटिव का नया टियर gemini-3.1-flash-tts-preview

माइग्रेशन गाइड

अगर आपको gemini-3.1-flash-tts-preview या इससे पहले के Gemini टीटीएस मॉडल से माइग्रेट करना है, तो Gemini 3.8 टीटीएस स्कीमा के लिए अपने अनुरोधों को अपडेट करें:

  1. मोड़ के हिसाब से निर्देशों को speech_metadata में ले जाएं: Gemini 3.8 टीटीएस, इनपुट किए गए टेक्स्ट को हूबहू ट्रांसक्रिप्ट के तौर पर लेता है. "Say cheerfully: Hello!" या "Speaker 1: Hello!" जैसे इनलाइन टेक्स्ट निर्देशों को तेज़ आवाज़ में सुनाया जा सकता है. लगातार डिलीवरी से जुड़े निर्देशों (style) और स्पीकर लेबल (speaker) को स्ट्रक्चर्ड मेटाडेटा में ले जाएं:
    • Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में "type": "speech_metadata", "speaker", और "style" के साथ एनोटेशन अटैच करें.
    • GenerateContent API: हर part में "speech_metadata": {"speaker": "...", "style": "..."} अटैच करें.
  2. सिर्फ़ कुछ समय के लिए होने वाली आवाज़ से जुड़ी घटनाओं के लिए, ऐंगल-ब्रैकेट वाले इनलाइन टैग इस्तेमाल करें: कुछ समय के लिए होने वाली आवाज़ और पॉज़ को ट्रांसक्रिप्ट में इनलाइन रखें. इसके लिए, ऐंगल ब्रैकेट (जैसे कि <laugh>, <sigh>, <cough>, <breath> या <short pause>) का इस्तेमाल करें. बोलने के तरीके, जैसे कि फुसफुसाना, speech_metadata.style में रखें.
  3. एक से ज़्यादा स्पीकर वाले अनुरोधों में, हर बार speaker तय करें: एक से ज़्यादा स्पीकर वाले अनुरोध में, हर बार speech_metadata के अंदर speaker को साफ़ तौर पर शामिल किया जाना चाहिए. यह, कॉन्फ़िगर किए गए स्पीकर में से किसी एक से मेल खाना चाहिए.
  4. वॉइस डिज़ाइन की मदद से, पहले से ही पर्सोना डिज़ाइन करना: ऑडियो प्रोफ़ाइल / डायरेक्टर के नोट वाले लंबे लेगसी ब्लॉक को वॉइस डिज़ाइन में बनाई गई कस्टम आवाज़ से बदलें. इसके बाद, टीटीएस के अनुरोधों में voice_... आईडी को कम से कम या खाली style स्ट्रिंग के साथ इस्तेमाल करें.
  5. एकल अनुरोधों पर डिफ़ॉल्ट WAV (audio/wav) आउटपुट के लिए खाता: gemini-3.1-flash-tts-preview और टीटीएस के पुराने मॉडल (जो डिफ़ॉल्ट रूप से हेडरलेस रॉ पीसीएम audio/l16 दिखाते थे) के उलट, Gemini 3.8 टीटीएस, एकल अनुरोधों के लिए डिफ़ॉल्ट रूप से स्टैंडर्ड RIFF हेडर के साथ WAV ऑडियो (audio/wav / AUDIO_WAV) दिखाता है.
    • अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के wave मॉड्यूल या ffmpeg का इस्तेमाल करके), तो मैन्युअल हेडर रैपर को हटाएं और लौटाए गए बाइट को सीधे .wav फ़ाइल में लिखें.
    • अगर आपकी पाइपलाइन को हेडरलेस रॉ पीसीएम, म्यू-लॉ या ए-लॉ ऑडियो की ज़रूरत है, तो response_format.mime_type को "audio/l16", "audio/mulaw" या "audio/alaw" पर सेट करें. उदाहरण के लिए, Interactions API में {"response_format": {"type": "audio", "mime_type": "audio/l16"}} या generateContent में AUDIO_L16, AUDIO_MULAW या AUDIO_ALAW. ऑडियो आउटपुट फ़ॉर्मैट देखें.

gemini-3.8-flash-tts

प्रॉपर्टी ब्यौरा
मॉडल कोड gemini-3.8-flash-tts
इस्तेमाल किए जा सकने वाले डेटा टाइप

इनपुट

टेक्स्ट

आउटपुट

ऑडियो

टोकन की सीमाएं[*]

इनपुट टोकन की सीमा

8,192

आउटपुट टोकन की सीमा

16,384 (Gemini API की सेवा देने की सीमा)

सुविधाएँ

ऑडियो जनरेट करने की सुविधा

काम करता है

कैश मेमोरी में सेव होना

काम नहीं करता है

कोड एक्ज़ीक्यूट करना

काम नहीं करता है

फ़ाइल खोजने की सुविधा

काम नहीं करता है

फ़ंक्शन कॉलिंग

काम नहीं करता है

Google Maps की मदद से जानकारी पाना

काम नहीं करता है

इमेज जनरेट करने की सुविधा

काम नहीं करता है

Live API

काम नहीं करता है

भरोसेमंद स्रोतों से जानकारी लेना

काम नहीं करता है

स्ट्रक्चर्ड आउटपुट

काम नहीं करता है

सोचना

काम नहीं करता है

यूआरएल का कॉन्टेक्स्ट

काम नहीं करता है

कॉन्टेंट देखने के विकल्प

Batch API

काम करता है

Flex inference

काम करता है

प्राथमिकता का अनुमान लगाना

काम करता है

वर्शन
ज़्यादा जानकारी के लिए, मॉडल वर्शन के पैटर्न पढ़ें.
  • gemini-3.8-flash-tts
नया अपडेट सितंबर 2026

इस्तेमाल की जा सकने वाली भाषाएं

gemini-3.8-flash-tts इनपुट की भाषा का अपने-आप पता लगाता है और 130 से ज़्यादा भाषाओं में काम करता है:

भाषा भाषा भाषा
एचनीज़ (अरबी स्क्रिप्ट) ग्रीक नेपाली (अलग भाषा)
अफ़्रीकान्स गुअरानी नाइजीरियन फ़ुलफ़ुल्दे
आकान गुजराती उत्तरी अज़रबैजान
अमहैरिक हैतियन क्रिओल नॉर्दर्न सोथो
आर्मीनियन हलह मंगोलियन उत्तरी उज़्बेक
असमिया हौसा नॉर्वेजियन बोकमाल
अवधी हिब्रू नार्वेजियन नॉर्स्क
बालीनीज़ हिन्दी न्यान्जा
बांग्ला हंगेरियन ओसीटन
बंजार (अरबी लिपि) आइसलैंडिक ओड़िया (अलग भाषा)
बंजार (लैटिन स्क्रिप्ट) इग्बो पंगासिनान
बाश्कियर ईलोको पर्शन (अफ़ग़ानिस्तान)
बॉस्क इंडोनेशियन पोलिश
Belarusian ईरानी फ़ारसी पॉर्चुगीज़
बेंबा इटैलियन पंजाबी
भोजपुरी जापानी रोमानियन
बोस्नियन जावानीज़ रूसी
ब्‍यूगिनी कबाइल संथाली
बल्गैरियन कांबा सर्बियन
बर्मीज़ कन्नड़ सिंधी
कैंटोनीज़ कश्मीरी (अरबी लिपि) सिंहला
कैटलैन कश्मीरी (देव स्क्रिप्ट) स्लोवाक
सेबुआनो कज़ाक स्लोवेनियन
सेंट्रल कुर्दिश ख्मेर सोमाली
छत्तीसगढ़ी किकुयू दक्षिणी अज़रबैजानी
चाइनीज़ (हंस स्क्रिप्ट) किनयारवांडा दक्षिणी पश्तो
चाइनीज़ (हंत स्क्रिप्ट) कॉन्गो सदर्न सुटू
क्राइमियन टाटर कोरियन स्पैनिश
क्रोएशियन किर्गिज़ स्टैंडर्ड ऐरेबिक (अरबी लिपि)
चेक लाओ स्टैंडर्ड ऐरेबिक (लैटिन स्क्रिप्ट)
डैनिश लैजालियन स्टैंडर्ड लातवियन
डच लिंगाला स्टैंडर्ड मलय
ड्यूला लिथुएनियन स्वाहिली (अलग भाषा)
जोंगखा लक्ज़मबर्गिश स्वाटी
मिस्री अरबी मैसेडोनियन स्वीडिश
अंग्रेज़ी मगही ताजिक
एस्टोनियन मैथिली तमिल
फ़िलिपीनी मलयालम तेलुगु
फ़िनिश मोल्टीज़ थाई
फ़्रांसीसी मणिपुरी तिग्रिन्या
गैलिशियन मराठी टॉस्क अल्बानियन
गांदा मिनांग्काबाउ (अरबी लिपि) टर्किश
जॉर्जियन मिनांग्काबाउ (लैटिन स्क्रिप्ट) विगर
जर्मन मिज़ो वियतनामीज़