Voices API की मदद से, नैचुरल लैंग्वेज प्रॉम्प्ट (वॉइस डिज़ाइन) या रेफ़रंस ऑडियो और स्पीकर की सहमति वाली रिकॉर्डिंग (वॉइस रेप्लिकेशन) से कस्टम आवाज़ें बनाई जा सकती हैं. साथ ही, लिखाई को बोली में बदलने (टीटीएस) की सुविधा के लिए, कस्टम और पहले से बनी आवाज़ों को सूची में शामिल किया जा सकता है, उन्हें वापस पाया जा सकता है, और मैनेज किया जा सकता है.
CreateVoice
यह सुविधा, नैचुरल लैंग्वेज वाले प्रॉम्प्ट (`VOICE_TYPE_PROMPTED`) या रेफ़रंस और सहमति वाली ऑडियो रिकॉर्डिंग (`VOICE_TYPE_REPLICATED`) से कस्टम आवाज़ बनाती है.
अनुरोध का मुख्य भाग
अनुरोध के मुख्य हिस्से में, इस स्ट्रक्चर का डेटा शामिल होता है:
ज़रूरी नहीं. इससे पता चलता है कि बनाई गई आवाज़ को Google सेव करके रखता है या नहीं. * `true` होने पर, Google आवाज़ को सेव करता है और `Voice.id` दिखाता है. उदाहरण के लिए, `voice_abc123def456`. इसे `GetVoice`, `ListVoices`, और `DeleteVoice` के ज़रिए मैनेज किया जा सकता है. साथ ही, सिंथेसिस के अनुरोधों में आईडी के हिसाब से इसका रेफ़रंस दिया जा सकता है. प्रोजेक्ट के लिए, सेव की गई आवाज़ों का ज़्यादा से ज़्यादा कोटा तय किया गया है. कोटा पूरा होने पर, `RESOURCE_EXHAUSTED` दिखता है. * जब `false` (डिफ़ॉल्ट) होता है, तो Google आवाज़ को सेव नहीं करता है. साथ ही, क्लाइंट-साइड स्टोरेज और सिंथेसिस के लिए `Voice.key` (उदाहरण के लिए, `voicekey_...`) दिखाता है. `voice` पर मौजूद खोज के लिए मेटाडेटा के वैकल्पिक फ़ील्ड, `store` के `false` होने पर सेव नहीं किए जाते या वापस नहीं भेजे जाते. `voice.type` के `"prompted"` होने पर, इसका `true` होना ज़रूरी है. ऐसा न होने पर, `INVALID_ARGUMENT` गड़बड़ी दिखेगी.
ज़रूरी है. आवाज़ बनाने के लिए. `voice.model` पैरामीटर का इस्तेमाल करना ज़रूरी नहीं है. अगर इसे शामिल नहीं किया जाता है, तो सेवा आवाज़ बनाने के लिए डिफ़ॉल्ट मॉडल चुनती है. अगर `Voice` पर सिर्फ़ आउटपुट वाले फ़ील्ड (`id`, `key`, `expire_time`, `usage`) सेट किए जाते हैं, तो उन्हें अनदेखा कर दिया जाता है.
जवाब
अगर एपीआई सही से जुड़ जाता है, ताे जवाब के मुख्य भाग में नीचे दिए गए स्ट्रक्चर शामिल होता है.
ज़रूरी नहीं. क्षेत्रीय लहज़े के बारे में बताने वाला डिस्क्रिप्टर (जैसे, "अमेरिकन", "ब्रिटिश").
ज़रूरी नहीं. इस्तेमाल का सबसे सही कॉन्टेक्स्ट या डोमेन (जैसे, "बातचीत", "ऑडियो बुक", "खबरें").
ज़रूरी नहीं. आवाज़ की टोन, पर्सनैलिटी, और पिच के बारे में जानकारी देने वाली खास जानकारी.
ज़रूरी नहीं. यह प्रॉपर्टी, सेव की गई आवाज़ (`store = true`) के लिए, उपयोगकर्ता के दिए गए डिसप्ले नेम के बारे में जानकारी देती है. इसके अलावा, यह पहले से तैयार की गई आवाज़ के लिए कैटलॉग के नाम के बारे में भी जानकारी देती है.
सिर्फ़ आउटपुट के लिए. वह टाइमस्टैंप जिस पर कस्टम तौर पर सेव की गई आवाज़ (`store = true`) या मिलती-जुलती आवाज़ की कुंजी (`store = false`) की समयसीमा खत्म हो जाती है. प्रीबिल्ट कैटलॉग की आवाज़ों (`"prebuilt"`) के लिए, इसे अनसेट किया जाता है. इनकी समयसीमा खत्म नहीं होती.
ज़रूरी नहीं. आवाज़ के लिंग की पहचान (जैसे, "महिला", "पुरुष", "तटस्थ").
सिर्फ़ आउटपुट के लिए. आवाज़ का यूनीक आइडेंटिफ़ायर. * Google की ओर से मैनेज की जाने वाली कस्टम आवाज़ों (`store = true`) के लिए, यह जनरेट किया गया आईडी है. इसमें `voice_` प्रीफ़िक्स होता है. उदाहरण के लिए, `voice_abc123def456`. `GetVoice` और `DeleteVoice` में `name` के तौर पर `voices/{id}` पास करें. साथ ही, स्पीच सिंथेसिस के दौरान `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) में सीधे तौर पर `{id}` पास करें. * पहले से मौजूद कैटलॉग की आवाज़ों (`ListVoices` से मिली `"prebuilt"`) के लिए, यह स्पीकर का नाम होता है. उदाहरण के लिए, `Puck` या `Charon`. * `CreateVoice` को `store = false` के साथ कॉल करने पर, इसे सेट नहीं किया जाता.
सिर्फ़ आउटपुट के लिए. क्लाइंट के मैनेज की गई आवाज़ की नकल बनाने की कुंजी (प्रीफ़िक्स `voicekey_` के साथ). यह कुंजी सिर्फ़ तब `CreateVoice` से मिलती है, जब `type` की वैल्यू `"replicated"` हो और `store` की वैल्यू `false` हो. स्पीच सिंथेसिस के दौरान, इस कुंजी को `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) को पास करें.
ज़रूरी नहीं. BCP-47 भाषा का मुख्य टैग (जैसे, "en-US", "fr-FR").
ज़रूरी नहीं. आवाज़ को डिज़ाइन करने या उसकी नकल करने के लिए इस्तेमाल किया गया मॉडल. अगर `CreateVoice` में इसे शामिल नहीं किया जाता है, तो यह डिफ़ॉल्ट रूप से, आवाज़ के डिज़ाइन वाले सबसे नए मॉडल पर सेट होता है. यह वैल्यू, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में मिलती है. यह कस्टम वॉइस (`"prompted"` और `"replicated"`) के लिए सेट होती है. हालांकि, `"prebuilt"` वॉइस के लिए यह वैल्यू सेट नहीं होती. बनाई गई आवाज़ों को, टीटीएस के साथ काम करने वाले किसी भी सिंथेसिस मॉडल में इस्तेमाल किया जा सकता है.
ज़रूरी नहीं. इस्तेमाल किया जाने वाला पर्सोना या किरदार (जैसे, "दोस्ताना", "नैरेटर").
pitch Pitch (ज़रूरी नहीं)
ज़रूरी नहीं. आवाज़ की पिच को कैटगरी में बांटना.
संभावित वैल्यू
-
lowधीमी आवाज़.
-
mediumमध्यम पिच वाली आवाज़.
-
highऊंची पिच वाली आवाज़.
prompted PromptedVoice (ज़रूरी नहीं)
आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.
फ़ील्ड
ज़रूरी है. नैचुरल लैंग्वेज में दिया गया प्रॉम्प्ट, जिसमें मनचाही आवाज़ के बारे में बताया गया हो. उदाहरण के लिए: "एक बूढ़े राक्षस की गहरी, गूंजने वाली पुरुष आवाज़."
ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 वाला भौगोलिक क्षेत्र कोड (जैसे, "US", "GB", "001").
sample_audio AudioData (ज़रूरी नहीं)
सिर्फ़ आउटपुट के लिए. प्रॉम्प्ट में दी गई आवाज़ के लिए जनरेट किया गया ऑडियो (सिंथेसाइज़र प्रॉम्प्ट ऑडियो). यह सिर्फ़ `CreateVoice` और `GetVoice` के जवाबों में दिखता है, जब `type` `"prompted"` होता है. `ListVoices` के जवाबों में और `"replicated"` या `"prebuilt"` आवाज़ों के लिए यह सेट नहीं होता.
फ़ील्ड
ज़रूरी है. रॉ ऑडियो बाइट.
ज़रूरी है. ऑडियो डेटा का IANA एमआईएमई टाइप. उदाहरण के लिए, `audio/wav` या `audio/mpeg`.
type VoiceType (ज़रूरी नहीं)
ज़रूरी है. आवाज़ का टाइप. `CreateVoice` में, इसे `"replicated"` या `"prompted"` पर सेट करना ज़रूरी है. `ListVoices` के जवाबों में, इसे `"prebuilt"` पर भी सेट किया जा सकता है.
संभावित वैल्यू
-
replicatedकस्टम वॉइस, ऑडियो सैंपल और स्पीकर की सहमति वाली रिकॉर्डिंग से मिलती-जुलती होती है.
-
promptedआम बोलचाल वाली भाषा में दिए गए टेक्स्ट प्रॉम्प्ट से जनरेट की गई कस्टम आवाज़.
-
prebuiltGoogle के वॉइस कैटलॉग में मौजूद सिस्टम की आवाज़ (जैसे, `Puck`, `Charon`). यह जवाबों में दिखती है. इसे `CreateVoice` में टाइप के तौर पर नहीं बताया जा सकता.
usage Usage (ज़रूरी नहीं)
सिर्फ़ आउटपुट के लिए. आवाज़ बनाने के अनुरोध के लिए, टोकन के इस्तेमाल के आंकड़े. यह सिर्फ़ `CreateVoice` के रिस्पॉन्स में तब दिखता है, जब `type` `"prompted"` हो. `"replicated"` के लिए इसे सेट नहीं किया जाता. साथ ही, `GetVoice` और `ListVoices` के रिस्पॉन्स में भी इसे सेट नहीं किया जाता.
फ़ील्ड
cached_tokens_by_modality array (ModalityTokens) (optional)
मोड के हिसाब से, कैश मेमोरी में सेव किए गए टोकन के इस्तेमाल की जानकारी.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
grounding_tool_count array (GroundingToolCount) (optional)
ग्राउंडिंग टूल की संख्या.
फ़ील्ड
ग्राउंडिंग टूल की गिनती की संख्या.
गिनती से जुड़ा ग्राउंडिंग टूल टाइप.
इस्तेमाल की जा सकने वाली वैल्यू:
-
google_searchGoogle वेब सर्च और इमेज सर्च के साथ-साथ, एंटरप्राइज़ के लिए वेब ग्राउंडिंग की सुविधा.
-
google_mapsGoogle Maps से जानकारी लेने की सुविधा.
input_tokens_by_modality array (ModalityTokens) (optional)
मोड के हिसाब से, इनपुट टोकन के इस्तेमाल की जानकारी.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
output_tokens_by_modality array (ModalityTokens) (ज़रूरी नहीं)
मोड के हिसाब से, आउटपुट टोकन के इस्तेमाल का ब्रेकडाउन.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
tool_use_tokens_by_modality array (ModalityTokens) (ज़रूरी नहीं)
मोड के हिसाब से, टूल इस्तेमाल करने के लिए टोकन के इस्तेमाल का ब्रेकडाउन.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
प्रॉम्प्ट के कैश मेमोरी में सेव किए गए हिस्से (कैश मेमोरी में सेव किया गया कॉन्टेंट) में मौजूद टोकन की संख्या.
प्रॉम्प्ट (कॉन्टेक्स्ट) में मौजूद टोकन की संख्या.
जनरेट किए गए सभी जवाबों में मौजूद टोकन की कुल संख्या.
सूझ-बूझ वाले मॉडल के लिए, आइडिया के टोकन की संख्या.
इंटरैक्शन के अनुरोध के लिए टोकन की कुल संख्या (प्रॉम्प्ट + जवाब + अन्य इंटरनल टोकन).
टूल का इस्तेमाल करने के लिए दिए गए प्रॉम्प्ट में मौजूद टोकन की संख्या.
उदाहरण
प्रतिक्रिया का उदाहरण
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
इस सूची में, कॉल करने वाले व्यक्ति की सेव की गई कस्टम आवाज़ें होती हैं. इन्हें सबसे नए से सबसे पुराने के क्रम में लगाया जाता है. इसके बाद, Google के वॉइस कैटलॉग में मौजूद सिस्टम की पहले से तैयार की गई आवाज़ें होती हैं.
पाथ / क्वेरी पैरामीटर
ज़रूरी नहीं. लहजे की जानकारी के हिसाब से फ़िल्टर करें. जैसे, "अमेरिकन", "ब्रिटिश". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. अगर एक से ज़्यादा वैल्यू दी जाती हैं, तो यह सुविधा, बताई गई किसी भी ऐक्सेंट (OR) से मिलती-जुलती आवाज़ों को ढूंढती है.
ज़रूरी नहीं. कॉन्टेक्स्ट या डोमेन के हिसाब से फ़िल्टर करें. उदाहरण के लिए, "खबरें, कारोबार". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. एक से ज़्यादा वैल्यू तय करने पर, यह सुविधा उन आवाज़ों से मैच करती है जिनमें बताए गए किसी भी कॉन्टेक्स्ट (OR) का इस्तेमाल किया गया हो.
ज़रूरी नहीं. जेंडर प्रज़ेंटेशन के हिसाब से फ़िल्टर करें. जैसे, "महिला", "पुरुष", "न्यूट्रल". केस-इनसेंसिटिव सटीक मिलान. एक से ज़्यादा वैल्यू तय करने पर, यह एट्रिब्यूट उन आवाज़ों से मैच करता है जिनका लिंग, तय किए गए लिंगों में से कोई एक हो (OR).
ज़रूरी नहीं. BCP-47 भाषा कोड के हिसाब से फ़िल्टर करें. उदाहरण के लिए, "en-US". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. एक से ज़्यादा वैल्यू तय करने पर, यह एट्रिब्यूट किसी भी तय किए गए भाषा कोड (OR) के हिसाब से आवाज़ों से मेल खाता है.
ज़रूरी नहीं. हर पेज पर, ज़्यादा से ज़्यादा कितनी आवाज़ें दिखानी हैं. ऐसा हो सकता है कि सेवा इस वैल्यू से कम नतीजे दिखाए. अगर इसे तय नहीं किया गया है, तो ज़्यादा से ज़्यादा 50 आवाज़ें दिखाई जाती हैं. ज़्यादा से ज़्यादा वैल्यू 1,000 हो सकती है. 1,000 से ज़्यादा वैल्यू को 1,000 में बदल दिया जाता है.
ज़रूरी नहीं. यह `ListVoices` कॉल से मिला पेज टोकन है. अगला पेज पाने के लिए, यह वैल्यू दें. पेज नंबर बदलते समय, सभी फ़िल्टर क्वेरी पैरामीटर (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, और `search`) उस कॉल से मेल खाने चाहिए जिसने यह टोकन दिखाया है. ऐसा न होने पर, `INVALID_ARGUMENT` के साथ अनुरोध पूरा नहीं होगा. `page_size` पेजों के बीच बदल सकता है.
ज़रूरी नहीं. आवाज़ की स्टाइल के हिसाब से फ़िल्टर करें. जैसे, "प्यारी और दोस्ताना". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. अगर एक से ज़्यादा वैल्यू दी गई हैं, तो यह प्रॉपर्टी, बताई गई किसी भी पर्सोना (OR) से मिलती-जुलती आवाज़ों को मैच करती है.
ज़रूरी नहीं. आवाज़ की पिच के हिसाब से फ़िल्टर करें. यह "low", "medium", "high" या "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (केस-इनसेंसिटिव) वैल्यू स्वीकार करता है. एक से ज़्यादा वैल्यू तय करने पर, आवाज़ की पिच, तय की गई किसी भी पिच से मैच करती है (OR).
ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 क्षेत्र कोड (जैसे, "US", "001") के हिसाब से फ़िल्टर करें. केस-इनसेंसिटिव एग्ज़ैक्ट मैच. एक से ज़्यादा वैल्यू तय करने पर, यह फ़िल्टर किसी भी तय किए गए क्षेत्र के कोड (OR) के हिसाब से आवाज़ों को मैच करता है.
ज़रूरी नहीं. फ़्री-टेक्स्ट सबस्ट्रिंग खोज क्वेरी, `display_name` और `description`, दोनों के साथ केस-इनसेंसिटिव तरीके से मैच की गई. ज़्यादा से ज़्यादा 2048 बाइट.
ज़रूरी नहीं. आवाज़ के टाइप के हिसाब से फ़िल्टर करें. यह "prebuilt", "replicated", "prompted" या "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (केस-इनसेंसिटिव) को स्वीकार करता है. एक से ज़्यादा वैल्यू तय करने पर, यह फ़िल्टर, तय किए गए किसी भी टाइप की आवाज़ से मैच करता है (OR).
जवाब
अगर एपीआई सही से जुड़ जाता है, ताे जवाब के मुख्य भाग में नीचे दिए गए स्ट्रक्चर शामिल होता है.
यह एक ऐसा टोकन है जिसे `page_token` के तौर पर भेजा जा सकता है, ताकि अगला पेज वापस पाया जा सके. अगर यह खाली है, तो इसके बाद कोई पेज नहीं है.
चुने गए कलेक्शन की आवाज़ें.
उदाहरण
प्रतिक्रिया का उदाहरण
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
संसाधन के नाम के हिसाब से, सेव की गई कस्टम आवाज़ (`store = true`) को ऐक्सेस करता है. प्रीबिल्ट कैटलॉग की आवाज़ें (`VOICE_TYPE_PREBUILT`), `GetVoice` के ज़रिए वापस नहीं पाई जा सकतीं. इसके बजाय, `ListVoices` का इस्तेमाल करें.
पाथ / क्वेरी पैरामीटर
ज़रूरी है. कस्टम तौर पर सेव की गई आवाज़ का संसाधन नाम, जिसे वापस पाना है (उदाहरण के लिए, `voices/voice_abc123def456`).
जवाब
अगर एपीआई सही से जुड़ जाता है, ताे जवाब के मुख्य भाग में नीचे दिए गए स्ट्रक्चर शामिल होता है.
ज़रूरी नहीं. क्षेत्रीय लहज़े के बारे में बताने वाला डिस्क्रिप्टर (जैसे, "अमेरिकन", "ब्रिटिश").
ज़रूरी नहीं. इस्तेमाल का सबसे सही कॉन्टेक्स्ट या डोमेन (जैसे, "बातचीत", "ऑडियो बुक", "खबरें").
ज़रूरी नहीं. आवाज़ की टोन, पर्सनैलिटी, और पिच के बारे में जानकारी देने वाली खास जानकारी.
ज़रूरी नहीं. यह प्रॉपर्टी, सेव की गई आवाज़ (`store = true`) के लिए, उपयोगकर्ता के दिए गए डिसप्ले नेम के बारे में जानकारी देती है. इसके अलावा, यह पहले से तैयार की गई आवाज़ के लिए कैटलॉग के नाम के बारे में भी जानकारी देती है.
सिर्फ़ आउटपुट के लिए. वह टाइमस्टैंप जिस पर कस्टम तौर पर सेव की गई आवाज़ (`store = true`) या मिलती-जुलती आवाज़ की कुंजी (`store = false`) की समयसीमा खत्म हो जाती है. प्रीबिल्ट कैटलॉग की आवाज़ों (`"prebuilt"`) के लिए, इसे अनसेट किया जाता है. इनकी समयसीमा खत्म नहीं होती.
ज़रूरी नहीं. आवाज़ के लिंग की पहचान (जैसे, "महिला", "पुरुष", "तटस्थ").
सिर्फ़ आउटपुट के लिए. आवाज़ का यूनीक आइडेंटिफ़ायर. * Google की ओर से मैनेज की जाने वाली कस्टम आवाज़ों (`store = true`) के लिए, यह जनरेट किया गया आईडी है. इसमें `voice_` प्रीफ़िक्स होता है. उदाहरण के लिए, `voice_abc123def456`. `GetVoice` और `DeleteVoice` में `name` के तौर पर `voices/{id}` पास करें. साथ ही, स्पीच सिंथेसिस के दौरान `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) में सीधे तौर पर `{id}` पास करें. * पहले से मौजूद कैटलॉग की आवाज़ों (`ListVoices` से मिली `"prebuilt"`) के लिए, यह स्पीकर का नाम होता है. उदाहरण के लिए, `Puck` या `Charon`. * `CreateVoice` को `store = false` के साथ कॉल करने पर, इसे सेट नहीं किया जाता.
सिर्फ़ आउटपुट के लिए. क्लाइंट के मैनेज की गई आवाज़ की नकल बनाने की कुंजी (प्रीफ़िक्स `voicekey_` के साथ). यह कुंजी सिर्फ़ तब `CreateVoice` से मिलती है, जब `type` की वैल्यू `"replicated"` हो और `store` की वैल्यू `false` हो. स्पीच सिंथेसिस के दौरान, इस कुंजी को `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) को पास करें.
ज़रूरी नहीं. BCP-47 भाषा का मुख्य टैग (जैसे, "en-US", "fr-FR").
ज़रूरी नहीं. आवाज़ को डिज़ाइन करने या उसकी नकल करने के लिए इस्तेमाल किया गया मॉडल. अगर `CreateVoice` में इसे शामिल नहीं किया जाता है, तो यह डिफ़ॉल्ट रूप से, आवाज़ के डिज़ाइन वाले सबसे नए मॉडल पर सेट होता है. यह वैल्यू, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में मिलती है. यह कस्टम वॉइस (`"prompted"` और `"replicated"`) के लिए सेट होती है. हालांकि, `"prebuilt"` वॉइस के लिए यह वैल्यू सेट नहीं होती. बनाई गई आवाज़ों को, टीटीएस के साथ काम करने वाले किसी भी सिंथेसिस मॉडल में इस्तेमाल किया जा सकता है.
ज़रूरी नहीं. इस्तेमाल किया जाने वाला पर्सोना या किरदार (जैसे, "दोस्ताना", "नैरेटर").
pitch Pitch (ज़रूरी नहीं)
ज़रूरी नहीं. आवाज़ की पिच को कैटगरी में बांटना.
संभावित वैल्यू
-
lowधीमी आवाज़.
-
mediumमध्यम पिच वाली आवाज़.
-
highऊंची पिच वाली आवाज़.
prompted PromptedVoice (ज़रूरी नहीं)
आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.
फ़ील्ड
ज़रूरी है. नैचुरल लैंग्वेज में दिया गया प्रॉम्प्ट, जिसमें मनचाही आवाज़ के बारे में बताया गया हो. उदाहरण के लिए: "एक बूढ़े राक्षस की गहरी, गूंजने वाली पुरुष आवाज़."
ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 वाला भौगोलिक क्षेत्र कोड (जैसे, "US", "GB", "001").
sample_audio AudioData (ज़रूरी नहीं)
सिर्फ़ आउटपुट के लिए. प्रॉम्प्ट में दी गई आवाज़ के लिए जनरेट किया गया ऑडियो (सिंथेसाइज़र प्रॉम्प्ट ऑडियो). यह सिर्फ़ `CreateVoice` और `GetVoice` के जवाबों में दिखता है, जब `type` `"prompted"` होता है. `ListVoices` के जवाबों में और `"replicated"` या `"prebuilt"` आवाज़ों के लिए यह सेट नहीं होता.
फ़ील्ड
ज़रूरी है. रॉ ऑडियो बाइट.
ज़रूरी है. ऑडियो डेटा का IANA एमआईएमई टाइप. उदाहरण के लिए, `audio/wav` या `audio/mpeg`.
type VoiceType (ज़रूरी नहीं)
ज़रूरी है. आवाज़ का टाइप. `CreateVoice` में, इसे `"replicated"` या `"prompted"` पर सेट करना ज़रूरी है. `ListVoices` के जवाबों में, इसे `"prebuilt"` पर भी सेट किया जा सकता है.
संभावित वैल्यू
-
replicatedकस्टम वॉइस, ऑडियो सैंपल और स्पीकर की सहमति वाली रिकॉर्डिंग से मिलती-जुलती होती है.
-
promptedआम बोलचाल वाली भाषा में दिए गए टेक्स्ट प्रॉम्प्ट से जनरेट की गई कस्टम आवाज़.
-
prebuiltGoogle के वॉइस कैटलॉग में मौजूद सिस्टम की आवाज़ (जैसे, `Puck`, `Charon`). यह जवाबों में दिखती है. इसे `CreateVoice` में टाइप के तौर पर नहीं बताया जा सकता.
usage Usage (ज़रूरी नहीं)
सिर्फ़ आउटपुट के लिए. आवाज़ बनाने के अनुरोध के लिए, टोकन के इस्तेमाल के आंकड़े. यह सिर्फ़ `CreateVoice` के रिस्पॉन्स में तब दिखता है, जब `type` `"prompted"` हो. `"replicated"` के लिए इसे सेट नहीं किया जाता. साथ ही, `GetVoice` और `ListVoices` के रिस्पॉन्स में भी इसे सेट नहीं किया जाता.
फ़ील्ड
cached_tokens_by_modality array (ModalityTokens) (optional)
मोड के हिसाब से, कैश मेमोरी में सेव किए गए टोकन के इस्तेमाल की जानकारी.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
grounding_tool_count array (GroundingToolCount) (optional)
ग्राउंडिंग टूल की संख्या.
फ़ील्ड
ग्राउंडिंग टूल की गिनती की संख्या.
गिनती से जुड़ा ग्राउंडिंग टूल टाइप.
इस्तेमाल की जा सकने वाली वैल्यू:
-
google_searchGoogle वेब सर्च और इमेज सर्च के साथ-साथ, एंटरप्राइज़ के लिए वेब ग्राउंडिंग की सुविधा.
-
google_mapsGoogle Maps से जानकारी लेने की सुविधा.
input_tokens_by_modality array (ModalityTokens) (optional)
मोड के हिसाब से, इनपुट टोकन के इस्तेमाल की जानकारी.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
output_tokens_by_modality array (ModalityTokens) (ज़रूरी नहीं)
मोड के हिसाब से, आउटपुट टोकन के इस्तेमाल का ब्रेकडाउन.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
tool_use_tokens_by_modality array (ModalityTokens) (ज़रूरी नहीं)
मोड के हिसाब से, टूल इस्तेमाल करने के लिए टोकन के इस्तेमाल का ब्रेकडाउन.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
प्रॉम्प्ट के कैश मेमोरी में सेव किए गए हिस्से (कैश मेमोरी में सेव किया गया कॉन्टेंट) में मौजूद टोकन की संख्या.
प्रॉम्प्ट (कॉन्टेक्स्ट) में मौजूद टोकन की संख्या.
जनरेट किए गए सभी जवाबों में मौजूद टोकन की कुल संख्या.
सूझ-बूझ वाले मॉडल के लिए, आइडिया के टोकन की संख्या.
इंटरैक्शन के अनुरोध के लिए टोकन की कुल संख्या (प्रॉम्प्ट + जवाब + अन्य इंटरनल टोकन).
टूल का इस्तेमाल करने के लिए दिए गए प्रॉम्प्ट में मौजूद टोकन की संख्या.
उदाहरण
प्रतिक्रिया का उदाहरण
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
यह अनुरोध, संसाधन के नाम के हिसाब से, सेव की गई कस्टम आवाज़ (`store = true`) को मिटाता है. पहले से बनाए गए कैटलॉग की आवाज़ों (`VOICE_TYPE_PREBUILT`) को मिटाया नहीं जा सकता.
पाथ / क्वेरी पैरामीटर
ज़रूरी है. मिटाने के लिए, कस्टम तौर पर सेव की गई आवाज़ का संसाधन नाम (उदाहरण के लिए, `voices/voice_abc123def456`).
जवाब
अगर अनुरोध पूरा हो जाता है, तो जवाब में कुछ नहीं होता.
उदाहरण
संसाधन
Google Voice
यह एक वॉइस रिसॉर्स है. यह कस्टम वॉइस (इसे `CreateVoice` के ज़रिए बनाया जाता है) या पहले से बनी सिस्टम वॉइस (इसे `ListVoices` से वापस लाया जाता है) को दिखाता है.
फ़ील्ड
ज़रूरी नहीं. क्षेत्रीय लहज़े के बारे में बताने वाला डिस्क्रिप्टर (जैसे, "अमेरिकन", "ब्रिटिश").
ज़रूरी नहीं. इस्तेमाल का सबसे सही कॉन्टेक्स्ट या डोमेन (जैसे, "बातचीत", "ऑडियो बुक", "खबरें").
ज़रूरी नहीं. आवाज़ की टोन, पर्सनैलिटी, और पिच के बारे में जानकारी देने वाली खास जानकारी.
ज़रूरी नहीं. यह प्रॉपर्टी, सेव की गई आवाज़ (`store = true`) के लिए, उपयोगकर्ता के दिए गए डिसप्ले नेम के बारे में जानकारी देती है. इसके अलावा, यह पहले से तैयार की गई आवाज़ के लिए कैटलॉग के नाम के बारे में भी जानकारी देती है.
सिर्फ़ आउटपुट के लिए. वह टाइमस्टैंप जिस पर कस्टम तौर पर सेव की गई आवाज़ (`store = true`) या मिलती-जुलती आवाज़ की कुंजी (`store = false`) की समयसीमा खत्म हो जाती है. प्रीबिल्ट कैटलॉग की आवाज़ों (`"prebuilt"`) के लिए, इसे अनसेट किया जाता है. इनकी समयसीमा खत्म नहीं होती.
ज़रूरी नहीं. आवाज़ के लिंग की पहचान (जैसे, "महिला", "पुरुष", "तटस्थ").
सिर्फ़ आउटपुट के लिए. आवाज़ का यूनीक आइडेंटिफ़ायर. * Google की ओर से मैनेज की जाने वाली कस्टम आवाज़ों (`store = true`) के लिए, यह जनरेट किया गया आईडी है. इसमें `voice_` प्रीफ़िक्स होता है. उदाहरण के लिए, `voice_abc123def456`. `GetVoice` और `DeleteVoice` में `name` के तौर पर `voices/{id}` पास करें. साथ ही, स्पीच सिंथेसिस के दौरान `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) में सीधे तौर पर `{id}` पास करें. * पहले से मौजूद कैटलॉग की आवाज़ों (`ListVoices` से मिली `"prebuilt"`) के लिए, यह स्पीकर का नाम होता है. उदाहरण के लिए, `Puck` या `Charon`. * `CreateVoice` को `store = false` के साथ कॉल करने पर, इसे सेट नहीं किया जाता.
सिर्फ़ आउटपुट के लिए. क्लाइंट के मैनेज की गई आवाज़ की नकल बनाने की कुंजी (प्रीफ़िक्स `voicekey_` के साथ). यह कुंजी सिर्फ़ तब `CreateVoice` से मिलती है, जब `type` की वैल्यू `"replicated"` हो और `store` की वैल्यू `false` हो. स्पीच सिंथेसिस के दौरान, इस कुंजी को `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) को पास करें.
ज़रूरी नहीं. BCP-47 भाषा का मुख्य टैग (जैसे, "en-US", "fr-FR").
ज़रूरी नहीं. आवाज़ को डिज़ाइन करने या उसकी नकल करने के लिए इस्तेमाल किया गया मॉडल. अगर `CreateVoice` में इसे शामिल नहीं किया जाता है, तो यह डिफ़ॉल्ट रूप से, आवाज़ के डिज़ाइन वाले सबसे नए मॉडल पर सेट होता है. यह वैल्यू, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में मिलती है. यह कस्टम वॉइस (`"prompted"` और `"replicated"`) के लिए सेट होती है. हालांकि, `"prebuilt"` वॉइस के लिए यह वैल्यू सेट नहीं होती. बनाई गई आवाज़ों को, टीटीएस के साथ काम करने वाले किसी भी सिंथेसिस मॉडल में इस्तेमाल किया जा सकता है.
ज़रूरी नहीं. इस्तेमाल किया जाने वाला पर्सोना या किरदार (जैसे, "दोस्ताना", "नैरेटर").
pitch Pitch (ज़रूरी नहीं)
ज़रूरी नहीं. आवाज़ की पिच को कैटगरी में बांटना.
संभावित वैल्यू
-
lowधीमी आवाज़.
-
mediumमध्यम पिच वाली आवाज़.
-
highऊंची पिच वाली आवाज़.
prompted PromptedVoice (ज़रूरी नहीं)
आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.
फ़ील्ड
ज़रूरी है. नैचुरल लैंग्वेज में दिया गया प्रॉम्प्ट, जिसमें मनचाही आवाज़ के बारे में बताया गया हो. उदाहरण के लिए: "एक बूढ़े राक्षस की गहरी, गूंजने वाली पुरुष आवाज़."
ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 वाला भौगोलिक क्षेत्र कोड (जैसे, "US", "GB", "001").
sample_audio AudioData (ज़रूरी नहीं)
सिर्फ़ आउटपुट के लिए. प्रॉम्प्ट में दी गई आवाज़ के लिए जनरेट किया गया ऑडियो (सिंथेसाइज़र प्रॉम्प्ट ऑडियो). यह सिर्फ़ `CreateVoice` और `GetVoice` के जवाबों में दिखता है, जब `type` `"prompted"` होता है. `ListVoices` के जवाबों में और `"replicated"` या `"prebuilt"` आवाज़ों के लिए यह सेट नहीं होता.
फ़ील्ड
ज़रूरी है. रॉ ऑडियो बाइट.
ज़रूरी है. ऑडियो डेटा का IANA एमआईएमई टाइप. उदाहरण के लिए, `audio/wav` या `audio/mpeg`.
type VoiceType (ज़रूरी नहीं)
ज़रूरी है. आवाज़ का टाइप. `CreateVoice` में, इसे `"replicated"` या `"prompted"` पर सेट करना ज़रूरी है. `ListVoices` के जवाबों में, इसे `"prebuilt"` पर भी सेट किया जा सकता है.
संभावित वैल्यू
-
replicatedकस्टम वॉइस, ऑडियो सैंपल और स्पीकर की सहमति वाली रिकॉर्डिंग से मिलती-जुलती होती है.
-
promptedआम बोलचाल वाली भाषा में दिए गए टेक्स्ट प्रॉम्प्ट से जनरेट की गई कस्टम आवाज़.
-
prebuiltGoogle के वॉइस कैटलॉग में मौजूद सिस्टम की आवाज़ (जैसे, `Puck`, `Charon`). यह जवाबों में दिखती है. इसे `CreateVoice` में टाइप के तौर पर नहीं बताया जा सकता.
usage Usage (ज़रूरी नहीं)
सिर्फ़ आउटपुट के लिए. आवाज़ बनाने के अनुरोध के लिए, टोकन के इस्तेमाल के आंकड़े. यह सिर्फ़ `CreateVoice` के रिस्पॉन्स में तब दिखता है, जब `type` `"prompted"` हो. `"replicated"` के लिए इसे सेट नहीं किया जाता. साथ ही, `GetVoice` और `ListVoices` के रिस्पॉन्स में भी यह नहीं दिखता.
फ़ील्ड
cached_tokens_by_modality array (ModalityTokens) (optional)
मोड के हिसाब से, कैश मेमोरी में सेव किए गए टोकन के इस्तेमाल की जानकारी.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
grounding_tool_count array (GroundingToolCount) (optional)
ग्राउंडिंग टूल की संख्या.
फ़ील्ड
ग्राउंडिंग टूल की गिनती की संख्या.
गिनती से जुड़ा ग्राउंडिंग टूल टाइप.
इस्तेमाल की जा सकने वाली वैल्यू:
-
google_searchGoogle वेब सर्च और इमेज सर्च के साथ-साथ, एंटरप्राइज़ के लिए वेब ग्राउंडिंग की सुविधा.
-
google_mapsGoogle Maps से जानकारी लेने की सुविधा.
input_tokens_by_modality array (ModalityTokens) (optional)
मोड के हिसाब से, इनपुट टोकन के इस्तेमाल की जानकारी.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
output_tokens_by_modality array (ModalityTokens) (ज़रूरी नहीं)
मोड के हिसाब से, आउटपुट टोकन के इस्तेमाल का ब्रेकडाउन.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
tool_use_tokens_by_modality array (ModalityTokens) (ज़रूरी नहीं)
मोड के हिसाब से, टूल इस्तेमाल करने के लिए टोकन के इस्तेमाल का ब्रेकडाउन.
फ़ील्ड
modality ResponseModality (ज़रूरी नहीं)
टोकन की गिनती से जुड़ी मोडेलिटी.
संभावित वैल्यू
-
textइससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.
-
imageइससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.
-
audioइससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.
-
videoइससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.
-
documentइससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.
मोडेलिटी के लिए टोकन की संख्या.
प्रॉम्प्ट के कैश मेमोरी में सेव किए गए हिस्से (कैश मेमोरी में सेव किया गया कॉन्टेंट) में मौजूद टोकन की संख्या.
प्रॉम्प्ट (कॉन्टेक्स्ट) में मौजूद टोकन की संख्या.
जनरेट किए गए सभी जवाबों में मौजूद टोकन की कुल संख्या.
सूझ-बूझ वाले मॉडल के लिए, आइडिया के टोकन की संख्या.
इंटरैक्शन के अनुरोध के लिए टोकन की कुल संख्या (प्रॉम्प्ट + जवाब + अन्य इंटरनल टोकन).
टूल का इस्तेमाल करने के लिए दिए गए प्रॉम्प्ट में मौजूद टोकन की संख्या.