Gemini Voices API

Voices API की मदद से, नैचुरल लैंग्वेज प्रॉम्प्ट (वॉइस डिज़ाइन) या रेफ़रंस ऑडियो और स्पीकर की सहमति वाली रिकॉर्डिंग (वॉइस रेप्लिकेशन) से कस्टम आवाज़ें बनाई जा सकती हैं. साथ ही, लिखाई को बोली में बदलने (टीटीएस) की सुविधा के लिए, कस्टम और पहले से बनी आवाज़ों को सूची में शामिल किया जा सकता है, उन्हें वापस पाया जा सकता है, और मैनेज किया जा सकता है.

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

यह सुविधा, नैचुरल लैंग्वेज वाले प्रॉम्प्ट (`VOICE_TYPE_PROMPTED`) या रेफ़रंस और सहमति वाली ऑडियो रिकॉर्डिंग (`VOICE_TYPE_REPLICATED`) से कस्टम आवाज़ बनाती है.

अनुरोध का मुख्य भाग

अनुरोध के मुख्य हिस्से में, इस स्ट्रक्चर का डेटा शामिल होता है:

store boolean  (ज़रूरी नहीं)

ज़रूरी नहीं. इससे पता चलता है कि बनाई गई आवाज़ को Google सेव करके रखता है या नहीं. * `true` होने पर, Google आवाज़ को सेव करता है और `Voice.id` दिखाता है. उदाहरण के लिए, `voice_abc123def456`. इसे `GetVoice`, `ListVoices`, और `DeleteVoice` के ज़रिए मैनेज किया जा सकता है. साथ ही, सिंथेसिस के अनुरोधों में आईडी के हिसाब से इसका रेफ़रंस दिया जा सकता है. प्रोजेक्ट के लिए, सेव की गई आवाज़ों का ज़्यादा से ज़्यादा कोटा तय किया गया है. कोटा पूरा होने पर, `RESOURCE_EXHAUSTED` दिखता है. * जब `false` (डिफ़ॉल्ट) होता है, तो Google आवाज़ को सेव नहीं करता है. साथ ही, क्लाइंट-साइड स्टोरेज और सिंथेसिस के लिए `Voice.key` (उदाहरण के लिए, `voicekey_...`) दिखाता है. `voice` पर मौजूद खोज के लिए मेटाडेटा के वैकल्पिक फ़ील्ड, `store` के `false` होने पर सेव नहीं किए जाते या वापस नहीं भेजे जाते. `voice.type` के `"prompted"` होने पर, इसका `true` होना ज़रूरी है. ऐसा न होने पर, `INVALID_ARGUMENT` गड़बड़ी दिखेगी.

voice Voice  (ज़रूरी है)

ज़रूरी है. आवाज़ बनाने के लिए. `voice.model` पैरामीटर का इस्तेमाल करना ज़रूरी नहीं है. अगर इसे शामिल नहीं किया जाता है, तो सेवा आवाज़ बनाने के लिए डिफ़ॉल्ट मॉडल चुनती है. अगर `Voice` पर सिर्फ़ आउटपुट वाले फ़ील्ड (`id`, `key`, `expire_time`, `usage`) सेट किए जाते हैं, तो उन्हें अनदेखा कर दिया जाता है.

जवाब

अगर एपीआई सही से जुड़ जाता है, ताे जवाब के मुख्य भाग में नीचे दिए गए स्ट्रक्चर शामिल होता है.

accent string  (ज़रूरी नहीं)

ज़रूरी नहीं. क्षेत्रीय लहज़े के बारे में बताने वाला डिस्क्रिप्टर (जैसे, "अमेरिकन", "ब्रिटिश").

context string  (ज़रूरी नहीं)

ज़रूरी नहीं. इस्तेमाल का सबसे सही कॉन्टेक्स्ट या डोमेन (जैसे, "बातचीत", "ऑडियो बुक", "खबरें").

description string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की टोन, पर्सनैलिटी, और पिच के बारे में जानकारी देने वाली खास जानकारी.

display_name string  (optional)

ज़रूरी नहीं. यह प्रॉपर्टी, सेव की गई आवाज़ (`store = true`) के लिए, उपयोगकर्ता के दिए गए डिसप्ले नेम के बारे में जानकारी देती है. इसके अलावा, यह पहले से तैयार की गई आवाज़ के लिए कैटलॉग के नाम के बारे में भी जानकारी देती है.

expire_time string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. वह टाइमस्टैंप जिस पर कस्टम तौर पर सेव की गई आवाज़ (`store = true`) या मिलती-जुलती आवाज़ की कुंजी (`store = false`) की समयसीमा खत्म हो जाती है. प्रीबिल्ट कैटलॉग की आवाज़ों (`"prebuilt"`) के लिए, इसे अनसेट किया जाता है. इनकी समयसीमा खत्म नहीं होती.

gender string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ के लिंग की पहचान (जैसे, "महिला", "पुरुष", "तटस्थ").

id string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. आवाज़ का यूनीक आइडेंटिफ़ायर. * Google की ओर से मैनेज की जाने वाली कस्टम आवाज़ों (`store = true`) के लिए, यह जनरेट किया गया आईडी है. इसमें `voice_` प्रीफ़िक्स होता है. उदाहरण के लिए, `voice_abc123def456`. `GetVoice` और `DeleteVoice` में `name` के तौर पर `voices/{id}` पास करें. साथ ही, स्पीच सिंथेसिस के दौरान `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) में सीधे तौर पर `{id}` पास करें. * पहले से मौजूद कैटलॉग की आवाज़ों (`ListVoices` से मिली `"prebuilt"`) के लिए, यह स्पीकर का नाम होता है. उदाहरण के लिए, `Puck` या `Charon`. * `CreateVoice` को `store = false` के साथ कॉल करने पर, इसे सेट नहीं किया जाता.

key string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. क्लाइंट के मैनेज की गई आवाज़ की नकल बनाने की कुंजी (प्रीफ़िक्स `voicekey_` के साथ). यह कुंजी सिर्फ़ तब `CreateVoice` से मिलती है, जब `type` की वैल्यू `"replicated"` हो और `store` की वैल्यू `false` हो. स्पीच सिंथेसिस के दौरान, इस कुंजी को `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) को पास करें.

language_code string  (ज़रूरी नहीं)

ज़रूरी नहीं. BCP-47 भाषा का मुख्य टैग (जैसे, "en-US", "fr-FR").

model string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ को डिज़ाइन करने या उसकी नकल करने के लिए इस्तेमाल किया गया मॉडल. अगर `CreateVoice` में इसे शामिल नहीं किया जाता है, तो यह डिफ़ॉल्ट रूप से, आवाज़ के डिज़ाइन वाले सबसे नए मॉडल पर सेट होता है. यह वैल्यू, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में मिलती है. यह कस्टम वॉइस (`"prompted"` और `"replicated"`) के लिए सेट होती है. हालांकि, `"prebuilt"` वॉइस के लिए यह वैल्यू सेट नहीं होती. बनाई गई आवाज़ों को, टीटीएस के साथ काम करने वाले किसी भी सिंथेसिस मॉडल में इस्तेमाल किया जा सकता है.

persona string  (ज़रूरी नहीं)

ज़रूरी नहीं. इस्तेमाल किया जाने वाला पर्सोना या किरदार (जैसे, "दोस्ताना", "नैरेटर").

pitch Pitch  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की पिच को कैटगरी में बांटना.

संभावित वैल्यू

  • low

    धीमी आवाज़.

  • medium

    मध्यम पिच वाली आवाज़.

  • high

    ऊंची पिच वाली आवाज़.

prompted PromptedVoice  (ज़रूरी नहीं)

आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.

आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.

फ़ील्ड

input string  (ज़रूरी नहीं)

ज़रूरी है. नैचुरल लैंग्वेज में दिया गया प्रॉम्प्ट, जिसमें मनचाही आवाज़ के बारे में बताया गया हो. उदाहरण के लिए: "एक बूढ़े राक्षस की गहरी, गूंजने वाली पुरुष आवाज़."

region_code string  (ज़रूरी नहीं है)

ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 वाला भौगोलिक क्षेत्र कोड (जैसे, "US", "GB", "001").

sample_audio AudioData  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. प्रॉम्प्ट में दी गई आवाज़ के लिए जनरेट किया गया ऑडियो (सिंथेसाइज़र प्रॉम्प्ट ऑडियो). यह सिर्फ़ `CreateVoice` और `GetVoice` के जवाबों में दिखता है, जब `type` `"prompted"` होता है. `ListVoices` के जवाबों में और `"replicated"` या `"prebuilt"` आवाज़ों के लिए यह सेट नहीं होता.

आवाज़ बनाने के लिए इस्तेमाल किया गया ऑडियो पेलोड.

फ़ील्ड

data string  (ज़रूरी नहीं)

ज़रूरी है. रॉ ऑडियो बाइट.

mime_type string  (ज़रूरी नहीं)

ज़रूरी है. ऑडियो डेटा का IANA एमआईएमई टाइप. उदाहरण के लिए, `audio/wav` या `audio/mpeg`.

type VoiceType  (ज़रूरी नहीं)

ज़रूरी है. आवाज़ का टाइप. `CreateVoice` में, इसे `"replicated"` या `"prompted"` पर सेट करना ज़रूरी है. `ListVoices` के जवाबों में, इसे `"prebuilt"` पर भी सेट किया जा सकता है.

संभावित वैल्यू

  • replicated

    कस्टम वॉइस, ऑडियो सैंपल और स्पीकर की सहमति वाली रिकॉर्डिंग से मिलती-जुलती होती है.

  • prompted

    आम बोलचाल वाली भाषा में दिए गए टेक्स्ट प्रॉम्प्ट से जनरेट की गई कस्टम आवाज़.

  • prebuilt

    Google के वॉइस कैटलॉग में मौजूद सिस्टम की आवाज़ (जैसे, `Puck`, `Charon`). यह जवाबों में दिखती है. इसे `CreateVoice` में टाइप के तौर पर नहीं बताया जा सकता.

usage Usage  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. आवाज़ बनाने के अनुरोध के लिए, टोकन के इस्तेमाल के आंकड़े. यह सिर्फ़ `CreateVoice` के रिस्पॉन्स में तब दिखता है, जब `type` `"prompted"` हो. `"replicated"` के लिए इसे सेट नहीं किया जाता. साथ ही, `GetVoice` और `ListVoices` के रिस्पॉन्स में भी इसे सेट नहीं किया जाता.

इंटरैक्शन के अनुरोध में इस्तेमाल किए गए टोकन के बारे में आंकड़े.

फ़ील्ड

cached_tokens_by_modality array (ModalityTokens)  (optional)

मोड के हिसाब से, कैश मेमोरी में सेव किए गए टोकन के इस्तेमाल की जानकारी.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

grounding_tool_count array (GroundingToolCount)  (optional)

ग्राउंडिंग टूल की संख्या.

ग्राउंडिंग टूल की गिनती की संख्या.

फ़ील्ड

count integer  (optional)

ग्राउंडिंग टूल की गिनती की संख्या.

type enum (string)  (ज़रूरी नहीं)

गिनती से जुड़ा ग्राउंडिंग टूल टाइप.

इस्तेमाल की जा सकने वाली वैल्यू:

  • google_search

    Google वेब सर्च और इमेज सर्च के साथ-साथ, एंटरप्राइज़ के लिए वेब ग्राउंडिंग की सुविधा.

  • google_maps

    Google Maps से जानकारी लेने की सुविधा.

input_tokens_by_modality array (ModalityTokens)  (optional)

मोड के हिसाब से, इनपुट टोकन के इस्तेमाल की जानकारी.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

output_tokens_by_modality array (ModalityTokens)  (ज़रूरी नहीं)

मोड के हिसाब से, आउटपुट टोकन के इस्तेमाल का ब्रेकडाउन.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

tool_use_tokens_by_modality array (ModalityTokens)  (ज़रूरी नहीं)

मोड के हिसाब से, टूल इस्तेमाल करने के लिए टोकन के इस्तेमाल का ब्रेकडाउन.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

total_cached_tokens integer  (optional)

प्रॉम्प्ट के कैश मेमोरी में सेव किए गए हिस्से (कैश मेमोरी में सेव किया गया कॉन्टेंट) में मौजूद टोकन की संख्या.

total_input_tokens integer  (optional)

प्रॉम्प्ट (कॉन्टेक्स्ट) में मौजूद टोकन की संख्या.

total_output_tokens integer  (optional)

जनरेट किए गए सभी जवाबों में मौजूद टोकन की कुल संख्या.

total_thought_tokens integer  (optional)

सूझ-बूझ वाले मॉडल के लिए, आइडिया के टोकन की संख्या.

total_tokens integer  (optional)

इंटरैक्शन के अनुरोध के लिए टोकन की कुल संख्या (प्रॉम्प्ट + जवाब + अन्य इंटरनल टोकन).

total_tool_use_tokens integer  (ज़रूरी नहीं)

टूल का इस्तेमाल करने के लिए दिए गए प्रॉम्प्ट में मौजूद टोकन की संख्या.

उदाहरण

प्रतिक्रिया का उदाहरण

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

इस सूची में, कॉल करने वाले व्यक्ति की सेव की गई कस्टम आवाज़ें होती हैं. इन्हें सबसे नए से सबसे पुराने के क्रम में लगाया जाता है. इसके बाद, Google के वॉइस कैटलॉग में मौजूद सिस्टम की पहले से तैयार की गई आवाज़ें होती हैं.

पाथ / क्वेरी पैरामीटर

accent array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. लहजे की जानकारी के हिसाब से फ़िल्टर करें. जैसे, "अमेरिकन", "ब्रिटिश". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. अगर एक से ज़्यादा वैल्यू दी जाती हैं, तो यह सुविधा, बताई गई किसी भी ऐक्सेंट (OR) से मिलती-जुलती आवाज़ों को ढूंढती है.

context array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. कॉन्टेक्स्ट या डोमेन के हिसाब से फ़िल्टर करें. उदाहरण के लिए, "खबरें, कारोबार". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. एक से ज़्यादा वैल्यू तय करने पर, यह सुविधा उन आवाज़ों से मैच करती है जिनमें बताए गए किसी भी कॉन्टेक्स्ट (OR) का इस्तेमाल किया गया हो.

gender array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. जेंडर प्रज़ेंटेशन के हिसाब से फ़िल्टर करें. जैसे, "महिला", "पुरुष", "न्यूट्रल". केस-इनसेंसिटिव सटीक मिलान. एक से ज़्यादा वैल्यू तय करने पर, यह एट्रिब्यूट उन आवाज़ों से मैच करता है जिनका लिंग, तय किए गए लिंगों में से कोई एक हो (OR).

language_code array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. BCP-47 भाषा कोड के हिसाब से फ़िल्टर करें. उदाहरण के लिए, "en-US". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. एक से ज़्यादा वैल्यू तय करने पर, यह एट्रिब्यूट किसी भी तय किए गए भाषा कोड (OR) के हिसाब से आवाज़ों से मेल खाता है.

page_size integer  (ज़रूरी नहीं)

ज़रूरी नहीं. हर पेज पर, ज़्यादा से ज़्यादा कितनी आवाज़ें दिखानी हैं. ऐसा हो सकता है कि सेवा इस वैल्यू से कम नतीजे दिखाए. अगर इसे तय नहीं किया गया है, तो ज़्यादा से ज़्यादा 50 आवाज़ें दिखाई जाती हैं. ज़्यादा से ज़्यादा वैल्यू 1,000 हो सकती है. 1,000 से ज़्यादा वैल्यू को 1,000 में बदल दिया जाता है.

page_token string  (optional)

ज़रूरी नहीं. यह `ListVoices` कॉल से मिला पेज टोकन है. अगला पेज पाने के लिए, यह वैल्यू दें. पेज नंबर बदलते समय, सभी फ़िल्टर क्वेरी पैरामीटर (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, और `search`) उस कॉल से मेल खाने चाहिए जिसने यह टोकन दिखाया है. ऐसा न होने पर, `INVALID_ARGUMENT` के साथ अनुरोध पूरा नहीं होगा. `page_size` पेजों के बीच बदल सकता है.

persona array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की स्टाइल के हिसाब से फ़िल्टर करें. जैसे, "प्यारी और दोस्ताना". केस-इनसेंसिटिव एग्ज़ैक्ट मैच. अगर एक से ज़्यादा वैल्यू दी गई हैं, तो यह प्रॉपर्टी, बताई गई किसी भी पर्सोना (OR) से मिलती-जुलती आवाज़ों को मैच करती है.

pitch array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की पिच के हिसाब से फ़िल्टर करें. यह "low", "medium", "high" या "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (केस-इनसेंसिटिव) वैल्यू स्वीकार करता है. एक से ज़्यादा वैल्यू तय करने पर, आवाज़ की पिच, तय की गई किसी भी पिच से मैच करती है (OR).

region_code array (string)  (ज़रूरी नहीं है)

ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 क्षेत्र कोड (जैसे, "US", "001") के हिसाब से फ़िल्टर करें. केस-इनसेंसिटिव एग्ज़ैक्ट मैच. एक से ज़्यादा वैल्यू तय करने पर, यह फ़िल्टर किसी भी तय किए गए क्षेत्र के कोड (OR) के हिसाब से आवाज़ों को मैच करता है.

search string  (ज़रूरी नहीं)

ज़रूरी नहीं. फ़्री-टेक्स्ट सबस्ट्रिंग खोज क्वेरी, `display_name` और `description`, दोनों के साथ केस-इनसेंसिटिव तरीके से मैच की गई. ज़्यादा से ज़्यादा 2048 बाइट.

type array (string)  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ के टाइप के हिसाब से फ़िल्टर करें. यह "prebuilt", "replicated", "prompted" या "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (केस-इनसेंसिटिव) को स्वीकार करता है. एक से ज़्यादा वैल्यू तय करने पर, यह फ़िल्टर, तय किए गए किसी भी टाइप की आवाज़ से मैच करता है (OR).

जवाब

अगर एपीआई सही से जुड़ जाता है, ताे जवाब के मुख्य भाग में नीचे दिए गए स्ट्रक्चर शामिल होता है.

next_page_token string  (optional)

यह एक ऐसा टोकन है जिसे `page_token` के तौर पर भेजा जा सकता है, ताकि अगला पेज वापस पाया जा सके. अगर यह खाली है, तो इसके बाद कोई पेज नहीं है.

voices array (Voice)  (ज़रूरी नहीं)

चुने गए कलेक्शन की आवाज़ें.

उदाहरण

प्रतिक्रिया का उदाहरण

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

संसाधन के नाम के हिसाब से, सेव की गई कस्टम आवाज़ (`store = true`) को ऐक्सेस करता है. प्रीबिल्ट कैटलॉग की आवाज़ें (`VOICE_TYPE_PREBUILT`), `GetVoice` के ज़रिए वापस नहीं पाई जा सकतीं. इसके बजाय, `ListVoices` का इस्तेमाल करें.

पाथ / क्वेरी पैरामीटर

voicesId string  (ज़रूरी है)

ज़रूरी है. कस्टम तौर पर सेव की गई आवाज़ का संसाधन नाम, जिसे वापस पाना है (उदाहरण के लिए, `voices/voice_abc123def456`).

जवाब

अगर एपीआई सही से जुड़ जाता है, ताे जवाब के मुख्य भाग में नीचे दिए गए स्ट्रक्चर शामिल होता है.

accent string  (ज़रूरी नहीं)

ज़रूरी नहीं. क्षेत्रीय लहज़े के बारे में बताने वाला डिस्क्रिप्टर (जैसे, "अमेरिकन", "ब्रिटिश").

context string  (ज़रूरी नहीं)

ज़रूरी नहीं. इस्तेमाल का सबसे सही कॉन्टेक्स्ट या डोमेन (जैसे, "बातचीत", "ऑडियो बुक", "खबरें").

description string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की टोन, पर्सनैलिटी, और पिच के बारे में जानकारी देने वाली खास जानकारी.

display_name string  (optional)

ज़रूरी नहीं. यह प्रॉपर्टी, सेव की गई आवाज़ (`store = true`) के लिए, उपयोगकर्ता के दिए गए डिसप्ले नेम के बारे में जानकारी देती है. इसके अलावा, यह पहले से तैयार की गई आवाज़ के लिए कैटलॉग के नाम के बारे में भी जानकारी देती है.

expire_time string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. वह टाइमस्टैंप जिस पर कस्टम तौर पर सेव की गई आवाज़ (`store = true`) या मिलती-जुलती आवाज़ की कुंजी (`store = false`) की समयसीमा खत्म हो जाती है. प्रीबिल्ट कैटलॉग की आवाज़ों (`"prebuilt"`) के लिए, इसे अनसेट किया जाता है. इनकी समयसीमा खत्म नहीं होती.

gender string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ के लिंग की पहचान (जैसे, "महिला", "पुरुष", "तटस्थ").

id string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. आवाज़ का यूनीक आइडेंटिफ़ायर. * Google की ओर से मैनेज की जाने वाली कस्टम आवाज़ों (`store = true`) के लिए, यह जनरेट किया गया आईडी है. इसमें `voice_` प्रीफ़िक्स होता है. उदाहरण के लिए, `voice_abc123def456`. `GetVoice` और `DeleteVoice` में `name` के तौर पर `voices/{id}` पास करें. साथ ही, स्पीच सिंथेसिस के दौरान `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) में सीधे तौर पर `{id}` पास करें. * पहले से मौजूद कैटलॉग की आवाज़ों (`ListVoices` से मिली `"prebuilt"`) के लिए, यह स्पीकर का नाम होता है. उदाहरण के लिए, `Puck` या `Charon`. * `CreateVoice` को `store = false` के साथ कॉल करने पर, इसे सेट नहीं किया जाता.

key string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. क्लाइंट के मैनेज की गई आवाज़ की नकल बनाने की कुंजी (प्रीफ़िक्स `voicekey_` के साथ). यह कुंजी सिर्फ़ तब `CreateVoice` से मिलती है, जब `type` की वैल्यू `"replicated"` हो और `store` की वैल्यू `false` हो. स्पीच सिंथेसिस के दौरान, इस कुंजी को `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) को पास करें.

language_code string  (ज़रूरी नहीं)

ज़रूरी नहीं. BCP-47 भाषा का मुख्य टैग (जैसे, "en-US", "fr-FR").

model string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ को डिज़ाइन करने या उसकी नकल करने के लिए इस्तेमाल किया गया मॉडल. अगर `CreateVoice` में इसे शामिल नहीं किया जाता है, तो यह डिफ़ॉल्ट रूप से, आवाज़ के डिज़ाइन वाले सबसे नए मॉडल पर सेट होता है. यह वैल्यू, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में मिलती है. यह कस्टम वॉइस (`"prompted"` और `"replicated"`) के लिए सेट होती है. हालांकि, `"prebuilt"` वॉइस के लिए यह वैल्यू सेट नहीं होती. बनाई गई आवाज़ों को, टीटीएस के साथ काम करने वाले किसी भी सिंथेसिस मॉडल में इस्तेमाल किया जा सकता है.

persona string  (ज़रूरी नहीं)

ज़रूरी नहीं. इस्तेमाल किया जाने वाला पर्सोना या किरदार (जैसे, "दोस्ताना", "नैरेटर").

pitch Pitch  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की पिच को कैटगरी में बांटना.

संभावित वैल्यू

  • low

    धीमी आवाज़.

  • medium

    मध्यम पिच वाली आवाज़.

  • high

    ऊंची पिच वाली आवाज़.

prompted PromptedVoice  (ज़रूरी नहीं)

आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.

आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.

फ़ील्ड

input string  (ज़रूरी नहीं)

ज़रूरी है. नैचुरल लैंग्वेज में दिया गया प्रॉम्प्ट, जिसमें मनचाही आवाज़ के बारे में बताया गया हो. उदाहरण के लिए: "एक बूढ़े राक्षस की गहरी, गूंजने वाली पुरुष आवाज़."

region_code string  (ज़रूरी नहीं है)

ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 वाला भौगोलिक क्षेत्र कोड (जैसे, "US", "GB", "001").

sample_audio AudioData  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. प्रॉम्प्ट में दी गई आवाज़ के लिए जनरेट किया गया ऑडियो (सिंथेसाइज़र प्रॉम्प्ट ऑडियो). यह सिर्फ़ `CreateVoice` और `GetVoice` के जवाबों में दिखता है, जब `type` `"prompted"` होता है. `ListVoices` के जवाबों में और `"replicated"` या `"prebuilt"` आवाज़ों के लिए यह सेट नहीं होता.

आवाज़ बनाने के लिए इस्तेमाल किया गया ऑडियो पेलोड.

फ़ील्ड

data string  (ज़रूरी नहीं)

ज़रूरी है. रॉ ऑडियो बाइट.

mime_type string  (ज़रूरी नहीं)

ज़रूरी है. ऑडियो डेटा का IANA एमआईएमई टाइप. उदाहरण के लिए, `audio/wav` या `audio/mpeg`.

type VoiceType  (ज़रूरी नहीं)

ज़रूरी है. आवाज़ का टाइप. `CreateVoice` में, इसे `"replicated"` या `"prompted"` पर सेट करना ज़रूरी है. `ListVoices` के जवाबों में, इसे `"prebuilt"` पर भी सेट किया जा सकता है.

संभावित वैल्यू

  • replicated

    कस्टम वॉइस, ऑडियो सैंपल और स्पीकर की सहमति वाली रिकॉर्डिंग से मिलती-जुलती होती है.

  • prompted

    आम बोलचाल वाली भाषा में दिए गए टेक्स्ट प्रॉम्प्ट से जनरेट की गई कस्टम आवाज़.

  • prebuilt

    Google के वॉइस कैटलॉग में मौजूद सिस्टम की आवाज़ (जैसे, `Puck`, `Charon`). यह जवाबों में दिखती है. इसे `CreateVoice` में टाइप के तौर पर नहीं बताया जा सकता.

usage Usage  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. आवाज़ बनाने के अनुरोध के लिए, टोकन के इस्तेमाल के आंकड़े. यह सिर्फ़ `CreateVoice` के रिस्पॉन्स में तब दिखता है, जब `type` `"prompted"` हो. `"replicated"` के लिए इसे सेट नहीं किया जाता. साथ ही, `GetVoice` और `ListVoices` के रिस्पॉन्स में भी इसे सेट नहीं किया जाता.

इंटरैक्शन के अनुरोध में इस्तेमाल किए गए टोकन के बारे में आंकड़े.

फ़ील्ड

cached_tokens_by_modality array (ModalityTokens)  (optional)

मोड के हिसाब से, कैश मेमोरी में सेव किए गए टोकन के इस्तेमाल की जानकारी.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

grounding_tool_count array (GroundingToolCount)  (optional)

ग्राउंडिंग टूल की संख्या.

ग्राउंडिंग टूल की गिनती की संख्या.

फ़ील्ड

count integer  (optional)

ग्राउंडिंग टूल की गिनती की संख्या.

type enum (string)  (ज़रूरी नहीं)

गिनती से जुड़ा ग्राउंडिंग टूल टाइप.

इस्तेमाल की जा सकने वाली वैल्यू:

  • google_search

    Google वेब सर्च और इमेज सर्च के साथ-साथ, एंटरप्राइज़ के लिए वेब ग्राउंडिंग की सुविधा.

  • google_maps

    Google Maps से जानकारी लेने की सुविधा.

input_tokens_by_modality array (ModalityTokens)  (optional)

मोड के हिसाब से, इनपुट टोकन के इस्तेमाल की जानकारी.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

output_tokens_by_modality array (ModalityTokens)  (ज़रूरी नहीं)

मोड के हिसाब से, आउटपुट टोकन के इस्तेमाल का ब्रेकडाउन.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

tool_use_tokens_by_modality array (ModalityTokens)  (ज़रूरी नहीं)

मोड के हिसाब से, टूल इस्तेमाल करने के लिए टोकन के इस्तेमाल का ब्रेकडाउन.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

total_cached_tokens integer  (optional)

प्रॉम्प्ट के कैश मेमोरी में सेव किए गए हिस्से (कैश मेमोरी में सेव किया गया कॉन्टेंट) में मौजूद टोकन की संख्या.

total_input_tokens integer  (optional)

प्रॉम्प्ट (कॉन्टेक्स्ट) में मौजूद टोकन की संख्या.

total_output_tokens integer  (optional)

जनरेट किए गए सभी जवाबों में मौजूद टोकन की कुल संख्या.

total_thought_tokens integer  (optional)

सूझ-बूझ वाले मॉडल के लिए, आइडिया के टोकन की संख्या.

total_tokens integer  (optional)

इंटरैक्शन के अनुरोध के लिए टोकन की कुल संख्या (प्रॉम्प्ट + जवाब + अन्य इंटरनल टोकन).

total_tool_use_tokens integer  (ज़रूरी नहीं)

टूल का इस्तेमाल करने के लिए दिए गए प्रॉम्प्ट में मौजूद टोकन की संख्या.

उदाहरण

प्रतिक्रिया का उदाहरण

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

यह अनुरोध, संसाधन के नाम के हिसाब से, सेव की गई कस्टम आवाज़ (`store = true`) को मिटाता है. पहले से बनाए गए कैटलॉग की आवाज़ों (`VOICE_TYPE_PREBUILT`) को मिटाया नहीं जा सकता.

पाथ / क्वेरी पैरामीटर

voicesId string  (ज़रूरी है)

ज़रूरी है. मिटाने के लिए, कस्टम तौर पर सेव की गई आवाज़ का संसाधन नाम (उदाहरण के लिए, `voices/voice_abc123def456`).

जवाब

अगर अनुरोध पूरा हो जाता है, तो जवाब में कुछ नहीं होता.

उदाहरण

संसाधन

Google Voice

यह एक वॉइस रिसॉर्स है. यह कस्टम वॉइस (इसे `CreateVoice` के ज़रिए बनाया जाता है) या पहले से बनी सिस्टम वॉइस (इसे `ListVoices` से वापस लाया जाता है) को दिखाता है.

फ़ील्ड

accent string  (ज़रूरी नहीं)

ज़रूरी नहीं. क्षेत्रीय लहज़े के बारे में बताने वाला डिस्क्रिप्टर (जैसे, "अमेरिकन", "ब्रिटिश").

context string  (ज़रूरी नहीं)

ज़रूरी नहीं. इस्तेमाल का सबसे सही कॉन्टेक्स्ट या डोमेन (जैसे, "बातचीत", "ऑडियो बुक", "खबरें").

description string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की टोन, पर्सनैलिटी, और पिच के बारे में जानकारी देने वाली खास जानकारी.

display_name string  (optional)

ज़रूरी नहीं. यह प्रॉपर्टी, सेव की गई आवाज़ (`store = true`) के लिए, उपयोगकर्ता के दिए गए डिसप्ले नेम के बारे में जानकारी देती है. इसके अलावा, यह पहले से तैयार की गई आवाज़ के लिए कैटलॉग के नाम के बारे में भी जानकारी देती है.

expire_time string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. वह टाइमस्टैंप जिस पर कस्टम तौर पर सेव की गई आवाज़ (`store = true`) या मिलती-जुलती आवाज़ की कुंजी (`store = false`) की समयसीमा खत्म हो जाती है. प्रीबिल्ट कैटलॉग की आवाज़ों (`"prebuilt"`) के लिए, इसे अनसेट किया जाता है. इनकी समयसीमा खत्म नहीं होती.

gender string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ के लिंग की पहचान (जैसे, "महिला", "पुरुष", "तटस्थ").

id string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. आवाज़ का यूनीक आइडेंटिफ़ायर. * Google की ओर से मैनेज की जाने वाली कस्टम आवाज़ों (`store = true`) के लिए, यह जनरेट किया गया आईडी है. इसमें `voice_` प्रीफ़िक्स होता है. उदाहरण के लिए, `voice_abc123def456`. `GetVoice` और `DeleteVoice` में `name` के तौर पर `voices/{id}` पास करें. साथ ही, स्पीच सिंथेसिस के दौरान `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) में सीधे तौर पर `{id}` पास करें. * पहले से मौजूद कैटलॉग की आवाज़ों (`ListVoices` से मिली `"prebuilt"`) के लिए, यह स्पीकर का नाम होता है. उदाहरण के लिए, `Puck` या `Charon`. * `CreateVoice` को `store = false` के साथ कॉल करने पर, इसे सेट नहीं किया जाता.

key string  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. क्लाइंट के मैनेज की गई आवाज़ की नकल बनाने की कुंजी (प्रीफ़िक्स `voicekey_` के साथ). यह कुंजी सिर्फ़ तब `CreateVoice` से मिलती है, जब `type` की वैल्यू `"replicated"` हो और `store` की वैल्यू `false` हो. स्पीच सिंथेसिस के दौरान, इस कुंजी को `SpeechConfig.voice_config.voice` (या `SpeechConfig.voice`) को पास करें.

language_code string  (ज़रूरी नहीं)

ज़रूरी नहीं. BCP-47 भाषा का मुख्य टैग (जैसे, "en-US", "fr-FR").

model string  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ को डिज़ाइन करने या उसकी नकल करने के लिए इस्तेमाल किया गया मॉडल. अगर `CreateVoice` में इसे शामिल नहीं किया जाता है, तो यह डिफ़ॉल्ट रूप से, आवाज़ के डिज़ाइन वाले सबसे नए मॉडल पर सेट होता है. यह वैल्यू, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में मिलती है. यह कस्टम वॉइस (`"prompted"` और `"replicated"`) के लिए सेट होती है. हालांकि, `"prebuilt"` वॉइस के लिए यह वैल्यू सेट नहीं होती. बनाई गई आवाज़ों को, टीटीएस के साथ काम करने वाले किसी भी सिंथेसिस मॉडल में इस्तेमाल किया जा सकता है.

persona string  (ज़रूरी नहीं)

ज़रूरी नहीं. इस्तेमाल किया जाने वाला पर्सोना या किरदार (जैसे, "दोस्ताना", "नैरेटर").

pitch Pitch  (ज़रूरी नहीं)

ज़रूरी नहीं. आवाज़ की पिच को कैटगरी में बांटना.

संभावित वैल्यू

  • low

    धीमी आवाज़.

  • medium

    मध्यम पिच वाली आवाज़.

  • high

    ऊंची पिच वाली आवाज़.

prompted PromptedVoice  (ज़रूरी नहीं)

आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.

आवाज़ जनरेट करने के लिए पैरामीटर. जब `type` की वैल्यू `"prompted"` पर सेट हो, तब `CreateVoice` में इसकी ज़रूरत होती है. प्रॉम्प्ट की गई आवाज़ों के लिए, `CreateVoice`, `GetVoice`, और `ListVoices` के जवाबों में यह दिखता है.

फ़ील्ड

input string  (ज़रूरी नहीं)

ज़रूरी है. नैचुरल लैंग्वेज में दिया गया प्रॉम्प्ट, जिसमें मनचाही आवाज़ के बारे में बताया गया हो. उदाहरण के लिए: "एक बूढ़े राक्षस की गहरी, गूंजने वाली पुरुष आवाज़."

region_code string  (ज़रूरी नहीं है)

ज़रूरी नहीं. ISO 3166-1 ऐल्फ़ा-2 या UN M.49 वाला भौगोलिक क्षेत्र कोड (जैसे, "US", "GB", "001").

sample_audio AudioData  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. प्रॉम्प्ट में दी गई आवाज़ के लिए जनरेट किया गया ऑडियो (सिंथेसाइज़र प्रॉम्प्ट ऑडियो). यह सिर्फ़ `CreateVoice` और `GetVoice` के जवाबों में दिखता है, जब `type` `"prompted"` होता है. `ListVoices` के जवाबों में और `"replicated"` या `"prebuilt"` आवाज़ों के लिए यह सेट नहीं होता.

आवाज़ बनाने के लिए इस्तेमाल किया गया ऑडियो पेलोड.

फ़ील्ड

data string  (ज़रूरी नहीं)

ज़रूरी है. रॉ ऑडियो बाइट.

mime_type string  (ज़रूरी नहीं)

ज़रूरी है. ऑडियो डेटा का IANA एमआईएमई टाइप. उदाहरण के लिए, `audio/wav` या `audio/mpeg`.

type VoiceType  (ज़रूरी नहीं)

ज़रूरी है. आवाज़ का टाइप. `CreateVoice` में, इसे `"replicated"` या `"prompted"` पर सेट करना ज़रूरी है. `ListVoices` के जवाबों में, इसे `"prebuilt"` पर भी सेट किया जा सकता है.

संभावित वैल्यू

  • replicated

    कस्टम वॉइस, ऑडियो सैंपल और स्पीकर की सहमति वाली रिकॉर्डिंग से मिलती-जुलती होती है.

  • prompted

    आम बोलचाल वाली भाषा में दिए गए टेक्स्ट प्रॉम्प्ट से जनरेट की गई कस्टम आवाज़.

  • prebuilt

    Google के वॉइस कैटलॉग में मौजूद सिस्टम की आवाज़ (जैसे, `Puck`, `Charon`). यह जवाबों में दिखती है. इसे `CreateVoice` में टाइप के तौर पर नहीं बताया जा सकता.

usage Usage  (ज़रूरी नहीं)

सिर्फ़ आउटपुट के लिए. आवाज़ बनाने के अनुरोध के लिए, टोकन के इस्तेमाल के आंकड़े. यह सिर्फ़ `CreateVoice` के रिस्पॉन्स में तब दिखता है, जब `type` `"prompted"` हो. `"replicated"` के लिए इसे सेट नहीं किया जाता. साथ ही, `GetVoice` और `ListVoices` के रिस्पॉन्स में भी यह नहीं दिखता.

इंटरैक्शन के अनुरोध में इस्तेमाल किए गए टोकन के बारे में आंकड़े.

फ़ील्ड

cached_tokens_by_modality array (ModalityTokens)  (optional)

मोड के हिसाब से, कैश मेमोरी में सेव किए गए टोकन के इस्तेमाल की जानकारी.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

grounding_tool_count array (GroundingToolCount)  (optional)

ग्राउंडिंग टूल की संख्या.

ग्राउंडिंग टूल की गिनती की संख्या.

फ़ील्ड

count integer  (optional)

ग्राउंडिंग टूल की गिनती की संख्या.

type enum (string)  (ज़रूरी नहीं)

गिनती से जुड़ा ग्राउंडिंग टूल टाइप.

इस्तेमाल की जा सकने वाली वैल्यू:

  • google_search

    Google वेब सर्च और इमेज सर्च के साथ-साथ, एंटरप्राइज़ के लिए वेब ग्राउंडिंग की सुविधा.

  • google_maps

    Google Maps से जानकारी लेने की सुविधा.

input_tokens_by_modality array (ModalityTokens)  (optional)

मोड के हिसाब से, इनपुट टोकन के इस्तेमाल की जानकारी.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

output_tokens_by_modality array (ModalityTokens)  (ज़रूरी नहीं)

मोड के हिसाब से, आउटपुट टोकन के इस्तेमाल का ब्रेकडाउन.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

tool_use_tokens_by_modality array (ModalityTokens)  (ज़रूरी नहीं)

मोड के हिसाब से, टूल इस्तेमाल करने के लिए टोकन के इस्तेमाल का ब्रेकडाउन.

जवाब देने के एक तरीके के लिए टोकन की गिनती.

फ़ील्ड

modality ResponseModality  (ज़रूरी नहीं)

टोकन की गिनती से जुड़ी मोडेलिटी.

संभावित वैल्यू

  • text

    इससे पता चलता है कि मॉडल को टेक्स्ट दिखाना चाहिए.

  • image

    इससे पता चलता है कि मॉडल को इमेज दिखानी चाहिए.

  • audio

    इससे पता चलता है कि मॉडल को ऑडियो वापस भेजना चाहिए.

  • video

    इससे पता चलता है कि मॉडल को वीडियो दिखाना चाहिए.

  • document

    इससे पता चलता है कि मॉडल को दस्तावेज़ दिखाने चाहिए.

tokens integer  (optional)

मोडेलिटी के लिए टोकन की संख्या.

total_cached_tokens integer  (optional)

प्रॉम्प्ट के कैश मेमोरी में सेव किए गए हिस्से (कैश मेमोरी में सेव किया गया कॉन्टेंट) में मौजूद टोकन की संख्या.

total_input_tokens integer  (optional)

प्रॉम्प्ट (कॉन्टेक्स्ट) में मौजूद टोकन की संख्या.

total_output_tokens integer  (optional)

जनरेट किए गए सभी जवाबों में मौजूद टोकन की कुल संख्या.

total_thought_tokens integer  (optional)

सूझ-बूझ वाले मॉडल के लिए, आइडिया के टोकन की संख्या.

total_tokens integer  (optional)

इंटरैक्शन के अनुरोध के लिए टोकन की कुल संख्या (प्रॉम्प्ट + जवाब + अन्य इंटरनल टोकन).

total_tool_use_tokens integer  (ज़रूरी नहीं)

टूल का इस्तेमाल करने के लिए दिए गए प्रॉम्प्ट में मौजूद टोकन की संख्या.