Gemini Priority API, अनुमान लगाने के लिए एक प्रीमियम टियर है. इसे कारोबार के लिए ज़रूरी वर्कलोड के लिए डिज़ाइन किया गया है. इसके लिए, कम समय में जवाब देने और सबसे ज़्यादा भरोसेमंद होने की ज़रूरत होती है. इसके लिए, प्रीमियम कीमत चुकानी पड़ती है. प्रायोरिटी टियर के ट्रैफ़िक को स्टैंडर्ड एपीआई और फ़्लेक्स टियर के ट्रैफ़िक से ज़्यादा प्राथमिकता दी जाती है.
प्राथमिकता के आधार पर अनुमान लगाने की सुविधा, Interactions API के सभी एंडपॉइंट पर उपलब्ध है.
'प्राथमिकता' फ़ील्ड का इस्तेमाल कैसे करें
प्रायोरिटी टियर का इस्तेमाल करने के लिए, अपने अनुरोध में service_tier फ़ील्ड को priority पर सेट करें. अगर फ़ील्ड को शामिल नहीं किया जाता है, तो डिफ़ॉल्ट टियर स्टैंडर्ड होता है.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Triage this critical customer support ticket immediately.",
service_tier='priority'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: "Triage this critical customer support ticket immediately.",
service_tier: "priority"
});
console.log(interaction.output_text);
}
await main();
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
Client client = new Client();
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-3.8-flash"))
.input(InteractionsInput.of("Perform a priority inference task."))
.serviceTier(ServiceTier.PRIORITY)
.build();
Interaction interaction =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(interaction.outputText().orElse(""));
ऐप पर जाएं
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
"google.golang.org/genai/interactions/models/interactions"
"google.golang.org/genai/interactions/models/operations"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
Model: interactions.Model("gemini-3.8-flash"),
Input: interactions.NewInteractionsInput("Perform a priority inference task."),
ServiceTier: interactions.ServiceTierPriority.ToPointer(),
}),
})
if err != nil {
log.Fatal(err)
}
if res.Interaction.OutputText != nil {
fmt.Println(*res.Interaction.OutputText)
}
}
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"model": "gemini-3.8-flash",
"input": "Triage this critical customer support ticket immediately.",
"service_tier": "priority"
}'
प्राथमिकता के आधार पर अनुमान लगाने की सुविधा कैसे काम करती है
प्राथमिकता के आधार पर अनुमान लगाने की सुविधा, अनुरोधों को कंप्यूटिंग की सबसे ज़रूरी कतारों पर भेजती है. इससे, इस्तेमाल करने वाले लोगों के लिए उपलब्ध ऐप्लिकेशन के लिए अनुमान लगाने की सुविधा, भरोसेमंद और तेज़ी से काम करती है. इसका मुख्य तरीका यह है कि सर्वर साइड से, डाइनैमिक सीमाओं से ज़्यादा ट्रैफ़िक के लिए स्टैंडर्ड प्रोसेसिंग पर डाउनग्रेड किया जाता है. इससे अनुरोध को पूरा न करने के बजाय, ऐप्लिकेशन की स्थिरता बनी रहती है.
| सुविधा | प्राथमिकता | स्टैंडर्ड | Flex | बैच |
|---|---|---|---|---|
| कीमत | स्टैंडर्ड वर्शन की तुलना में 75 से 100% ज़्यादा | फ़ुल टिकट | 50% की छूट | 50% की छूट |
| लेटेंसी | सेकंड | सेकंड से मिनट | मिनट (1 से 15 मिनट का टारगेट) | 24 घंटे तक |
| भरोसेमंद होना | ज़्यादा (न झड़ने वाले) | ज़्यादा / सामान्य से ज़्यादा | बेस्ट-एफ़र्ट (शेड किया जा सकता है) | ज़्यादा (थ्रूपुट के लिए) |
| इंटरफ़ेस | सिंक्रोनस | सिंक्रोनस | सिंक्रोनस | एसिंक्रोनस |
मुख्य फ़ायदे
- कम इंतज़ार का समय: इसे इंटरैक्टिव और इस्तेमाल करने वाले लोगों के लिए उपलब्ध एआई टूल के लिए डिज़ाइन किया गया है. इससे कुछ ही सेकंड में जवाब मिल जाता है.
- ज़्यादा भरोसेमंद: ट्रैफ़िक को सबसे ज़्यादा प्राथमिकता दी जाती है और इसे किसी भी हाल में कम नहीं किया जा सकता.
- ग्रेसफ़ुल डिग्रेडेशन: डाइनैमिक सीमाओं से ज़्यादा ट्रैफ़िक बढ़ने पर, उसे प्रोसेस करने के लिए स्टैंडर्ड टियर पर अपने-आप डाउनग्रेड कर दिया जाता है. इससे सेवा में रुकावट नहीं आती.
- कम रुकावट: इसमें स्टैंडर्ड और फ़्लेक्स टियर की तरह ही, सिंक्रोनस
createतरीके का इस्तेमाल किया जाता है.
उपयोग के उदाहरण
प्राथमिकता के आधार पर प्रोसेसिंग की सुविधा, कारोबार के लिए ज़रूरी वर्कफ़्लो के लिए सबसे सही है. इनमें परफ़ॉर्मेंस और भरोसेमंद सेवा सबसे अहम होती है.
- इंटरैक्टिव एआई ऐप्लिकेशन: ग्राहक सेवा के लिए चैटबॉट और कोपायलट. इनमें उपयोगकर्ता प्रीमियम चुकाते हैं और उन्हें तुरंत और लगातार जवाब मिलने की उम्मीद होती है.
- रीयल-टाइम में फ़ैसले लेने वाले इंजन: ऐसे सिस्टम जिनके लिए भरोसेमंद और कम समय में नतीजे पाना ज़रूरी होता है. जैसे, लाइव टिकट की प्राथमिकता तय करना या धोखाधड़ी का पता लगाना.
- पैसे चुकाने वाले ग्राहकों के लिए प्रीमियम सुविधाएं: ऐसे डेवलपर जिन्हें पैसे चुकाने वाले ग्राहकों के लिए, सेवा स्तर के ज़्यादा उद्देश्यों (एसएलओ) की गारंटी देनी होती है.
अनुरोधों की संख्या की सीमाएं
प्राथमिकता के आधार पर इस्तेमाल किए जाने वाले संसाधनों के लिए, अनुरोध संख्या सीमित करने से जुड़ी अपनी सीमाएं होती हैं. भले ही, इस्तेमाल को इंटरैक्टिव ट्रैफ़िक की दर से जुड़ी कुल सीमाओं में गिना जाता हो. प्राथमिकता के आधार पर अनुमान लगाने के लिए, डिफ़ॉल्ट रूप से तय की गई अनुरोध संख्या सीमित करने की सीमाएं मॉडल / टियर के लिए, दर की स्टैंडर्ड सीमा का 0.3 गुना होती हैं
ग्रेसफ़ुल डाउनग्रेड लॉजिक
अगर नेटवर्क में ज़्यादा ट्रैफ़िक की वजह से प्राथमिकता की सीमाएं पार हो जाती हैं, तो ज़्यादा अनुरोधों को 503 या 429 गड़बड़ी के साथ फ़ेल करने के बजाय, अपने-आप और आसानी से स्टैंडर्ड प्रोसेसिंग पर डाउनग्रेड कर दिया जाता है. डाउनग्रेड किए गए अनुरोधों के लिए, स्टैंडर्ड दर के हिसाब से बिल भेजा जाता है. इसके लिए, प्राथमिकता के आधार पर प्रीमियम सहायता पाने की दर लागू नहीं होती.
क्लाइंट की ज़िम्मेदारी
- जवाब की निगरानी करना: डेवलपर को एपीआई के जवाब में
x-gemini-service-tierहेडर की निगरानी करनी चाहिए, ताकि यह पता लगाया जा सके कि अनुरोधों को बार-बारstandardपर डाउनग्रेड किया जा रहा है या नहीं. - फिर से कोशिश करना: क्लाइंट को स्टैंडर्ड गड़बड़ियों के लिए, फिर से कोशिश करने का लॉजिक/एक्सपोनेंशियल बैकऑफ़ लागू करना होगा. जैसे,
DEADLINE_EXCEEDED.
कीमत
प्राथमिकता के आधार पर अनुमान लगाने की सुविधा, स्टैंडर्ड एपीआई से 75 से 100% ज़्यादा महंगी है. इसका शुल्क, हर टोकन के हिसाब से लिया जाता है.
इन मॉडल के साथ काम करता है
इन मॉडल में प्राथमिकता के आधार पर अनुमान लगाने की सुविधा काम करती है:
| मॉडल | प्राथमिकता के आधार पर अनुमान लगाना |
|---|---|
| Gemini 3.8 Flash | ✔️ |
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro की झलक | ✔️ |
| Gemini 3 Flash की झलक | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |
आगे क्या करना है
- लागत कम करने के लिए, फ़्लेक्स इन्फ़रेंस का इस्तेमाल करें.
- टोकन: टोकन के बारे में जानें.