Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), Google का तेज़ और किफ़ायती टेक्स्ट-टू-स्पीच मॉडल है. इसे gemini-3.1-flash-tts-preview को बदलने के लिए बनाया गया है, ताकि ज़्यादा थ्रूपुट वाले प्रोडक्शन वर्कलोड को पूरा किया जा सके.

खास जानकारी और सुविधाएं

Gemini 3.8 Flash-Lite TTS में, कम समय में जवाब देने की सुविधा के साथ-साथ, नैचुरल तरीके से बोलने की सुविधा भी मिलती है:

  • ज़्यादा थ्रूपुट की सुविधा: इसे एक साथ कई प्रॉडक्ट बनाने, बातचीत करने वाले वॉइस एजेंट के कैस्केड, पढ़कर सुनाने की सुविधाओं, और मुख्य भाषाओं में रोज़ाना एक स्पीकर के भाषण जनरेट करने के लिए ऑप्टिमाइज़ किया गया है.
  • ड्रॉप-इन स्कीमा के साथ काम करने की सुविधा: यह gemini-3.8-flash-tts के साथ, एपीआई स्कीमा और स्ट्रक्चर्ड प्रॉम्प्टिंग फ़ॉर्मैट को शेयर करता है. इससे आपको एक पैरामीटर में बदलाव करके, मॉडल स्विच करने की सुविधा मिलती है.
  • आवाज़ से जुड़े पूरे ईकोसिस्टम के साथ काम करता है: इसमें पहले से तैयार की गई आवाज़ें, एक्सटेंडेड वॉइस लाइब्रेरी (GET /v1beta/voices), कस्टम वॉइस डिज़ाइन पर्सोना, और वॉइस रेप्लिकेशन (डिफ़ॉल्ट रूप से सेव की गई आवाज़ें और बिना स्टेटस वाली कुंजियां) शामिल हैं. Google AI Studio में, आवाज़ों को इंटरैक्टिव तरीके से डिज़ाइन और कॉपी भी किया जा सकता है.

सुविधाओं, प्रॉम्प्ट के सबसे सही तरीकों, और कोड के उदाहरणों के बारे में पूरी जानकारी के लिए, टेक्स्ट को आवाज़ में बदलने की सुविधा वाली गाइड पर जाएं.

किस टीटीएस मॉडल का इस्तेमाल कब करना चाहिए

Gemini 3.8 के दोनों टीटीएस मॉडल, एक ही एपीआई स्कीमा और प्रॉम्प्टिंग स्ट्रक्चर का इस्तेमाल करते हैं. अपने वर्कलोड के हिसाब से मॉडल चुनें:

सुविधा / वर्कलोड Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
मुख्य ताकत हाई थ्रूपुट, कम इंतज़ार का समय, और कम लागत आवाज़ की क्वालिटी, ऐक्टिंग की बारीकियां, और बोली की विविधता
इस्तेमाल के सबसे सही उदाहरण ज़्यादा मात्रा में प्रोडक्शन, रीयल-टाइम में वॉइस एजेंट कैस्केड, पढ़कर सुनाने की सुविधाएं, आवाज़ की नकल करना, और रोज़ाना एक स्पीकर जनरेट करना ऑडियो बुक, स्टूडियो में की गई रिकॉर्डिंग, कई लोगों के बीच की गई मुश्किल बातचीत, तेज़ आवाज़ में की गई ऐक्टिंग, मुश्किल उच्चारण, क्षेत्रीय बोलियां
इस्तेमाल की जा सकने वाली भाषाएं 101 भाषाएं 130 भाषाएं
इसके लिए सुझाया गया रीप्लेसमेंट gemini-3.1-flash-tts-preview फ़्लैगशिप क्रिएटिव का नया टियर

माइग्रेशन गाइड

अगर आपको gemini-3.1-flash-tts-preview से gemini-3.8-flash-lite-tts पर अपग्रेड करना है, तो Gemini 3.8 टीटीएस स्कीमा के लिए अपने अनुरोध अपडेट करें:

  1. मोड़ के हिसाब से दिए गए निर्देशों को speech_metadata में ले जाएं: Gemini 3.8 टीटीएस, इनपुट टेक्स्ट को हूबहू ट्रांसक्रिप्ट के तौर पर लेता है. "Say cheerfully: Hello!" या "Speaker 1: Hello!" जैसे इनलाइन टेक्स्ट निर्देशों को तेज़ आवाज़ में सुनाया जा सकता है. सस्टेंड डिलीवरी के निर्देशों (style) और स्पीकर लेबल (speaker) को स्ट्रक्चर्ड मेटाडेटा में ले जाएं:
    • Interactions API: हर टेक्स्ट कॉन्टेंट ब्लॉक में "type": "speech_metadata", "speaker", और "style" के साथ एनोटेशन अटैच करें.
    • GenerateContent API: हर part में "speech_metadata": {"speaker": "...", "style": "..."} अटैच करें.
  2. सिर्फ़ कुछ समय के लिए होने वाली आवाज़ की घटनाओं के लिए, ऐंगल-ब्रैकेट वाले इनलाइन टैग इस्तेमाल करें: कुछ समय के लिए होने वाली आवाज़ और पॉज़ को ट्रांसक्रिप्ट में इनलाइन रखें. इसके लिए, ऐंगल ब्रैकेट (जैसे कि <laugh>, <sigh>, <cough>, <breath> या <short pause>) का इस्तेमाल करें. बोलने के तरीके, जैसे कि फुसफुसाना, speech_metadata.style में रखें.
  3. एक से ज़्यादा स्पीकर वाले अनुरोधों में, हर बार speaker तय करें: एक से ज़्यादा स्पीकर वाले अनुरोध में, हर बार speech_metadata के अंदर speaker को साफ़ तौर पर शामिल किया जाना चाहिए. यह, कॉन्फ़िगर किए गए किसी स्पीकर से मेल खाना चाहिए.
  4. वॉइस डिज़ाइन की मदद से, पहले से ही पर्सोना डिज़ाइन करें: लेगसी ऑडियो प्रोफ़ाइल / डायरेक्टर के नोट वाले लंबे ब्लॉक को वॉइस डिज़ाइन में बनाई गई कस्टम आवाज़ से बदलें. इसके बाद, voice_... आईडी को अपने टीटीएस अनुरोधों में शामिल करें. इसके लिए, style स्ट्रिंग को कम से कम या खाली रखें.
  5. एकल अनुरोधों पर डिफ़ॉल्ट WAV (audio/wav) आउटपुट के लिए खाता: gemini-3.1-flash-tts-preview और टीटीएस के पुराने मॉडल (जो डिफ़ॉल्ट रूप से हेडरलेस रॉ पीसीएम audio/l16 दिखाते थे) के उलट, Gemini 3.8 टीटीएस, एकल अनुरोधों के लिए डिफ़ॉल्ट रूप से स्टैंडर्ड RIFF हेडर के साथ WAV ऑडियो (audio/wav / AUDIO_WAV) दिखाता है.
    • अगर आपके कोड में पहले रॉ पीसीएम बाइट को WAV हेडर में रैप किया गया था (उदाहरण के लिए, Python के wave मॉड्यूल या ffmpeg का इस्तेमाल करके), तो मैन्युअल हेडर रैपर को हटा दें. साथ ही, लौटाए गए बाइट को सीधे .wav फ़ाइल में लिखें.
    • अगर आपकी पाइपलाइन के लिए, हेडरलेस रॉ पीसीएम, म्यू-लॉ या ए-लॉ ऑडियो की ज़रूरत है, तो response_format को "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") या "audio/alaw" ("AUDIO_ALAW") पर सेट करें. ऑडियो आउटपुट फ़ॉर्मैट देखें.

gemini-3.8-flash-lite-tts

प्रॉपर्टी ब्यौरा
मॉडल कोड gemini-3.8-flash-lite-tts
के साथ इस्तेमाल किए जा सकने वाले डेटा टाइप

इनपुट

टेक्स्ट

आउटपुट

ऑडियो

टोकन की सीमाएं[*]

इनपुट टोकन की सीमा

8,192

आउटपुट टोकन की सीमा

16,384

सुविधाएँ

ऑडियो जनरेट करने की सुविधा

काम करता है

कैश मेमोरी में सेव होना

काम करता है

कोड एक्ज़ीक्यूट करना

काम नहीं करता है

फ़ाइल खोजना

काम नहीं करता है

फ़ंक्शन कॉलिंग

काम नहीं करता है

Google Maps की मदद से जवाब तैयार करना

काम नहीं करता है

इमेज जनरेट करने की सुविधा

काम नहीं करता है

Live API

काम नहीं करता है

भरोसेमंद स्रोतों से जानकारी लेना

काम नहीं करता है

स्ट्रक्चर्ड आउटपुट

काम नहीं करता है

सोचना

काम नहीं करता है

यूआरएल का कॉन्टेक्स्ट

काम नहीं करता है

कॉन्टेंट देखने के विकल्प

Batch API

काम करता है

Flex inference

काम करता है

प्राथमिकता का अनुमान लगाना

काम करता है

वर्शन
ज़्यादा जानकारी के लिए, मॉडल वर्शन के पैटर्न पढ़ें.
  • gemini-3.8-flash-lite-tts
नया अपडेट जुलाई 2026

इस्तेमाल की जा सकने वाली भाषाएं

gemini-3.8-flash-lite-tts में, इनपुट की गई भाषा का अपने-आप पता चल जाता है. साथ ही, यह 101 भाषाओं में काम करता है:

भाषा भाषा भाषा
एचनीज़ (अरबी स्क्रिप्ट) जॉर्जियन मोल्टीज़
अफ़्रीकान्स जर्मन मणिपुरी
आकान ग्रीक मराठी
अमहैरिक गुजराती मिनांग्काबाउ (अरबी लिपि)
आर्मीनियन हैतियन क्रिओल मिज़ो
असमिया हलह मंगोलियन नेपाली (अलग भाषा)
अवधी हौसा नाइजीरिया की फु़लफु़लदे
बालीनीज़ हिब्रू उत्तरी अज़रबैजान
बांग्ला हिन्दी नॉर्दर्न सोथो
बंजार (लैटिन स्क्रिप्ट) हंगेरियन नॉर्दर्न उज़्बेक
बॉस्क आइसलैंडिक नॉर्वेजियन बोकमाल
बेलारूसी ईलोको नार्वेजियन नॉर्स्क
भोजपुरी इंडोनेशियन न्यान्जा
बोस्नियन ईरानी फ़ारसी ओड़िया (अलग भाषा)
ब्‍यूगिनी इटैलियन पर्शन (अफ़ग़ानिस्तान)
बल्गैरियन जापानी पोलिश
कैंटोनीज़ जावानीज़ पॉर्चुगीज़
कैटलैन कांबा पंजाबी
सेबुआनो कन्नड़ रोमानियन
सेंट्रल कुर्दिश कश्मीरी (अरबी लिपि) रूसी
छत्तीसगढ़ी कश्मीरी (देव स्क्रिप्ट) संथाली
चाइनीज़ (हंस स्क्रिप्ट) कज़ाक सर्बियन
चाइनीज़ (हंत स्क्रिप्ट) ख्मेर सिंहला
क्रोएशियन किकुयू स्लोवाक
चेक किनयारवांडा दक्षिणी अज़रबैजानी
डैनिश कॉन्गो दक्षिणी पश्तो
डच कोरियन स्पैनिश
मिस्री अरबी किर्गिज़ स्टैंडर्ड ऐरेबिक (अरबी लिपि)
अंग्रेज़ी लाओ स्टैंडर्ड ऐरेबिक (लैटिन स्क्रिप्ट)
एस्टोनियन लिंगाला स्टैंडर्ड लातवियन
फ़िलिपीनी मैसेडोनियन स्टैंडर्ड मलय
फ़्रांसीसी मगही तमिल
गैलिशियन मैथिली तेलुगु
गांदा मलयालम