Gemini API की मदद से ऑप्टिमाइज़ेशन और अनुमान लगाना

Gemini API, ऑप्टिमाइज़ेशन के कई तरीके उपलब्ध कराता है. इनकी मदद से, अपने वर्कलोड की ज़रूरतों के हिसाब से स्पीड, लागत, और भरोसेमंद तरीके से काम करने के बीच संतुलन बनाया जा सकता है. चाहे आपको रीयल-टाइम में बातचीत करने वाले बॉट बनाने हों या ऑफ़लाइन डेटा प्रोसेसिंग पाइपलाइन चलाने हों, सही पैराडाइम चुनने से लागत में काफ़ी कमी आ सकती है या परफ़ॉर्मेंस बेहतर हो सकती है.

सुविधा स्टैंडर्ड Flex प्राथमिकता बैच कैश मेमोरी में सेव करना
कीमत पूरी कीमत 50% की छूट स्टैंडर्ड वर्शन की सीमाओं के मुकाबले 75% से 100% ज़्यादा 50% की छूट 90% की छूट + टोकन के लिए स्टोरेज का हिसाब
लेटेंसी सेकंड से मिनट मिनट (1 से 15 मिनट का टारगेट) सेकंड 24 घंटे तक पहले टोकन में लगने वाला समय कम हो जाता है
भरोसेमंद होना ज़्यादा / सामान्य से ज़्यादा बेस्ट-एफ़र्ट (शेड किया जा सकता है) ज़्यादा (न झड़ने वाले) ज़्यादा (थ्रूपुट के लिए) लागू नहीं
इंटरफ़ेस सिंक्रोनस सिंक्रोनस सिंक्रोनस एसिंक्रोनस सेव की गई स्थिति
इस्तेमाल का सबसे सही उदाहरण ऐप्लिकेशन के सामान्य वर्कफ़्लो ऐसे ईमेल जो क्रम में चलने वाले होते हैं और ज़रूरी नहीं होते प्रोडक्शन, इस्तेमाल करने वाले लोगों के लिए उपलब्ध ऐप्लिकेशन बड़े डेटासेट, ऑफ़लाइन आकलन एक ही फ़ाइल के लिए बार-बार क्वेरी करना

अनुमान लगाने की सेवा के टियर (सिंक्रोनस)

अपने स्टैंडर्ड जनरेशन कॉल में service_tier पैरामीटर पास करके, रिलायबिलिटी-ऑप्टिमाइज़ किए गए और लागत-ऑप्टिमाइज़ किए गए सिंक्रोनस ट्रैफ़िक के बीच स्विच किया जा सकता है.

स्टैंडर्ड इन्फ़रेंस (डिफ़ॉल्ट)

क्रम से कॉन्टेंट जनरेट करने के लिए, स्टैंडर्ड टियर डिफ़ॉल्ट विकल्प होता है. यह बिना किसी अतिरिक्त प्रीमियम या लंबी कतार के, सामान्य समय में जवाब देता है.

  • भरोसेमंद होना: स्टैंडर्ड क्रिटिकैलिटी
  • कीमत: स्टैंडर्ड कीमत.
  • इसके लिए सबसे अच्छा है: रोज़ाना इस्तेमाल होने वाले ज़्यादातर ऐप्लिकेशन.

प्राथमिकता के आधार पर अनुमान लगाना (कम इंतज़ार के समय के लिए ऑप्टिमाइज़ किया गया)

प्राथमिकता देने पर, आपके अनुरोधों को कंप्यूटिंग के लिए सबसे ज़रूरी कतारों में भेज दिया जाता है. इस ट्रैफ़िक को कभी भी कम नहीं किया जा सकता. इसका मतलब है कि इसे कभी भी अन्य टियर से पहले नहीं भेजा जाता. साथ ही, यह सबसे ज़्यादा भरोसेमंद होता है. अगर डाइनैमिक प्राथमिकता की सीमाओं का उल्लंघन किया जाता है, तो सिस्टम गड़बड़ी दिखाने के बजाय, अनुरोध को स्टैंडर्ड प्रोसेसिंग पर डाउनग्रेड कर देगा.

  • भरोसेमंद: सबसे ज़्यादा ज़रूरी
  • कीमत: स्टैंडर्ड दरों से 75% से 100% ज़्यादा.
  • सबसे सही विकल्प: ग्राहकों के लिए चैटबॉट, रीयल-टाइम में धोखाधड़ी का पता लगाने वाले टूल, और कारोबार के लिए ज़रूरी कोपायलट.

Flex inference (लागत के हिसाब से ऑप्टिमाइज़ किया गया)

फ़्लेक्स इन्फ़्रेंस की सुविधा के तहत, स्टैंडर्ड दरों की तुलना में 50% की छूट मिलती है. ऐसा इसलिए होता है, क्योंकि इसमें कंप्यूटिंग के लिए, ऑफ़-पीक समय में उपलब्ध क्षमता का इस्तेमाल किया जाता है. अनुरोधों को सिंक्रोनस तरीके से प्रोसेस किया जाता है. इसका मतलब है कि बैच ऑब्जेक्ट को मैनेज करने के लिए, आपको कोड को फिर से लिखने की ज़रूरत नहीं है. यह "शेड किए जा सकने वाले" ट्रैफ़िक की वजह से होता है. अगर सिस्टम में ट्रैफ़िक में अचानक बढ़ोतरी होती है, तो अनुरोधों को रोका जा सकता है.

  • भरोसेमंद: बिना गारंटी, कम हो सकती है
  • कीमत: स्टैंडर्ड कीमत का 50% (हर टोकन के हिसाब से बिल किया जाता है).
  • इसके लिए सबसे सही: कई चरणों वाले एजेंटिक वर्कफ़्लो, जहां कॉल N+1, कॉल N के आउटपुट, बैकग्राउंड सीआरएम अपडेट, और ऑफ़लाइन आकलन पर निर्भर करता है.

बैच एपीआई (बल्क, असिंक्रोनस)

Batch API को बड़ी संख्या में अनुरोधों को एसिंक्रोनस तरीके से प्रोसेस करने के लिए डिज़ाइन किया गया है. इसके लिए, स्टैंडर्ड कीमत का 50% शुल्क लिया जाता है. अनुरोधों को इन-लाइन डिक्शनरी के तौर पर सबमिट किया जा सकता है. इसके अलावा, JSONL इनपुट फ़ाइल (ज़्यादा से ज़्यादा 2 जीबी) का इस्तेमाल करके भी अनुरोध सबमिट किए जा सकते हैं. यह अनुरोधों को प्रोसेस करने के लिए, बैकग्राउंड थ्रूपुट कतारों का इस्तेमाल करता है. इसका टारगेट टर्नअराउंड टाइम 24 घंटे है.

  • भरोसेमंद: यह सुविधा उपलब्ध नहीं है. हालांकि, इसमें 24 घंटे के अंदर अपने-आप फिर से कोशिश करने और कतार में लगाने की सुविधा मिलती है
  • कीमत: स्टैंडर्ड कीमत का 50%.
  • इनके लिए सबसे सही है: बड़े डेटासेट को पहले से प्रोसेस करना, समय-समय पर रिग्रेशन टेस्ट सुइट चलाना, और बड़ी संख्या में इमेज या एम्बेड जनरेट करना.

कॉन्टेक्स्ट के लिए कैश मेमोरी की सुविधा (इनपुट सेव करने की सुविधा)

कॉन्टेक्स्ट को कैश मेमोरी में सेव करने की सुविधा का इस्तेमाल तब किया जाता है, जब छोटे अनुरोधों में शुरुआती कॉन्टेक्स्ट का बार-बार रेफ़रंस दिया जाता है.

  • इंप्लिसिट कैश मेमोरी: यह सुविधा, Gemini 2.5 और इसके बाद के मॉडल पर अपने-आप चालू हो जाती है. अगर आपका अनुरोध, प्रॉम्प्ट के सामान्य प्रीफ़िक्स के आधार पर मौजूदा कैश मेमोरी से मेल खाता है, तो सिस्टम आपको लागत में बचत का फ़ायदा देता है.
  • एक्सप्लिसिट कैशिंग: मैन्युअल तरीके से, टाइम-टू-लिव (टीटीएल) के साथ कैश ऑब्जेक्ट बनाया जा सकता है. टोकन बनाने के बाद, आने वाले अनुरोधों के लिए कैश मेमोरी में सेव किए गए टोकन का इस्तेमाल करें. इससे एक ही कॉर्पस पेलोड को बार-बार पास करने से बचा जा सकता है.
  • कीमत: बिलिंग, कैश मेमोरी में सेव किए गए टोकन की संख्या और स्टोरेज की अवधि (टीटीएल) के आधार पर की जाती है.
  • इनके लिए सबसे सही: ऐसे चैटबॉट जिनके लिए सिस्टम के निर्देशों की ज़रूरत होती है, लंबी वीडियो फ़ाइलों का बार-बार विश्लेषण करना होता है या बड़े दस्तावेज़ सेट के ख़िलाफ़ क्वेरी करनी होती है.

एजेंटिक प्रोसेसिंग की मदद से, वीडियो इनपुट की लागत कम करना

लंबी अवधि के वीडियो कॉन्टेंट के लिए, एजेंटिक प्रोसेसिंग से इनपुट टोकन की लागत को 88% तक कम किया जा सकता है. साथ ही, इससे जवाब की क्वालिटी भी बेहतर होती है. मॉडल, हर फ़्रेम को 1 FPS (स्टैटिक प्रोसेसिंग) पर निकालने के बजाय, वीडियो में डाइनैमिक तरीके से खोज करता है. साथ ही, आपके प्रॉम्प्ट से जुड़ी ट्रांसक्रिप्ट और/या फ़्रेम और/या ऑडियो लोड करता है. पांच मिनट से कम अवधि वाली छोटी क्लिप के लिए, जहां लेटेन्सी बहुत ज़रूरी है वहां स्टैटिक प्रोसेसिंग से, पहले टोकन के लिए कम समय (टीटीएफ़टी) लग सकता है. ऐसा इसलिए, क्योंकि एजेंटिक मोड में जनरेशन शुरू होने से पहले, इंटरनल रीज़निंग और टूल राउंड-ट्रिपिंग होती है.

Gemini 3.8 Flash, 3.6 Flash या 3.5 Flash Lite के साथ एजेंटिक प्रोसेसिंग का इस्तेमाल करने के लिए, वीडियो इनपुट पर processing: "agentic" (Interactions API) या media_processing: "AGENTIC" (GenerateContent API) सेट करें. अगर मॉडल, एजेंट की मदद से प्रोसेस करने की सुविधा के साथ काम नहीं करता है, तो गड़बड़ी का मैसेज दिखेगा.

कोड के उदाहरणों के लिए, एजेंटिक वीडियो अंडरस्टैंडिंग देखें.