L'API Gemini Priority è un livello di inferenza premium progettato per workload business-critical che richiedono una latenza inferiore e la massima affidabilità a un prezzo premium. Il traffico del livello di priorità ha la precedenza sul traffico dell'API standard e del livello Flex.
L'inferenza prioritaria è disponibile in tutti gli endpoint dell'API Interactions.
Come utilizzare Priorità
Per utilizzare il livello di priorità, imposta il campo service_tier nella richiesta su priority. Se il campo viene omesso, il livello predefinito è standard.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Triage this critical customer support ticket immediately.",
service_tier='priority'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: "Triage this critical customer support ticket immediately.",
service_tier: "priority"
});
console.log(interaction.output_text);
}
await main();
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
Client client = new Client();
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-3.8-flash"))
.input(InteractionsInput.of("Perform a priority inference task."))
.serviceTier(ServiceTier.PRIORITY)
.build();
Interaction interaction =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(interaction.outputText().orElse(""));
Go
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
"google.golang.org/genai/interactions/models/interactions"
"google.golang.org/genai/interactions/models/operations"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
Model: interactions.Model("gemini-3.8-flash"),
Input: interactions.NewInteractionsInput("Perform a priority inference task."),
ServiceTier: interactions.ServiceTierPriority.ToPointer(),
}),
})
if err != nil {
log.Fatal(err)
}
if res.Interaction.OutputText != nil {
fmt.Println(*res.Interaction.OutputText)
}
}
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"model": "gemini-3.8-flash",
"input": "Triage this critical customer support ticket immediately.",
"service_tier": "priority"
}'
Come funziona l'inferenza della priorità
L'inferenza con priorità indirizza le richieste a code di calcolo di alta criticità, offrendo prestazioni rapide e prevedibili per le applicazioni rivolte agli utenti. Il suo meccanismo principale è un downgrade lato server controllato all'elaborazione standard per il traffico che supera i limiti dinamici, garantendo la stabilità dell'applicazione anziché non riuscire a elaborare la richiesta.
| Funzionalità | Priorità | Standard | Flex | Batch |
|---|---|---|---|---|
| Prezzi | 75-100% in più rispetto a Standard | Intero | Sconto del 50% | Sconto del 50% |
| Latenza | Secondi | Da secondi a minuti | Minuti (obiettivo 1-15 minuti) | Fino a 24 ore |
| Affidabilità | Elevata (non rimovibile) | Alta / medio-alta | Best effort (eliminabile) | Elevata (per il throughput) |
| Interfaccia | Sincrona | Sincrona | Sincrona | Asincrona |
Vantaggi principali
- Bassa latenza: progettato per tempi di risposta di un secondo per strumenti di AI interattivi rivolti agli utenti.
- Affidabilità elevata: il traffico viene trattato con la massima criticità ed è rigorosamente non eliminabile.
- Riduzione controllata: i picchi di traffico che superano i limiti dinamici vengono declassati automaticamente al livello Standard per l'elaborazione anziché non riuscire, evitando interruzioni del servizio.
- Basso attrito: utilizza lo stesso metodo sincrono
createdei piani standard e Flex.
Casi d'uso
L'elaborazione con priorità è ideale per i workflow business-critical in cui le prestazioni e l'affidabilità sono fondamentali.
- Applicazioni di AI interattiva: chatbot e copiloti dell'assistenza clienti in cui gli utenti pagano un supplemento e si aspettano risposte rapide e coerenti.
- Motori decisionali in tempo reale: sistemi che richiedono risultati altamente affidabili e a bassa latenza, come il triage dei ticket live o il rilevamento delle frodi.
- Funzionalità per i clienti Premium: sviluppatori che devono garantire obiettivi del livello di servizio (SLO) più elevati per i clienti paganti.
Limiti di frequenza
Il consumo prioritario ha i propri limiti di frequenza, anche se il consumo viene conteggiato ai fini dei limiti di frequenza complessivi del traffico interattivo. I limiti di frequenza predefiniti per l'inferenza della priorità sono 0,3 volte il limite di frequenza standard per modello / livello
Logica di downgrade controllato
Se i limiti di priorità vengono superati a causa della congestione, le richieste di overflow vengono declassate automaticamente e senza problemi all'elaborazione standard anziché restituire un errore 503 o 429. Le richieste di downgrade vengono fatturate alla tariffa standard, non alla tariffa premium con priorità.
Responsabilità del cliente
- Monitoraggio delle risposte: gli sviluppatori devono monitorare l'intestazione
x-gemini-service-tiernella risposta API per rilevare se le richieste vengono declassate frequentemente astandard. - Nuovi tentativi: i client devono implementare la logica di ripetizione/il backoff esponenziale per
gli errori standard, ad esempio
DEADLINE_EXCEEDED.
Prezzi
L'inferenza della priorità ha un prezzo superiore del 75-100% rispetto all'API standard e viene fatturata per token.
Modelli supportati
I seguenti modelli supportano l'inferenza della priorità:
| Modello | Inferenza della priorità |
|---|---|
| Gemini 3.8 Flash | ✔️ |
| Gemini 3.7 Flash | ✔️ |
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.5 Flash | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro (anteprima) | ✔️ |
| Gemini 3 Flash (anteprima) | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |
Passaggi successivi
- Inferenza flessibile per la riduzione dei costi.
- Token: scopri di più sui token.