Gemini Priority API to płatny poziom wnioskowania przeznaczony do zbiorów zadań o kluczowym znaczeniu dla firmy, które wymagają mniejszego czasu oczekiwania i najwyższej niezawodności w wyższej cenie. Ruch na poziomie Priority ma wyższy priorytet niż ruch na poziomie Standard API i Flex.
Wnioskowanie Priority jest dostępne we wszystkich punktach końcowych interfejsu Interactions API.
Jak korzystać z poziomu Priority
Aby korzystać z poziomu Priority, ustaw w żądaniu wartość priority w polu service_tier. Jeśli to pole zostanie pominięte, domyślnym poziomem będzie Standard.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Triage this critical customer support ticket immediately.",
service_tier='priority'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.6-flash",
input: "Triage this critical customer support ticket immediately.",
service_tier: "priority"
});
console.log(interaction.output_text);
}
await main();
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"model": "gemini-3.6-flash",
"input": "Triage this critical customer support ticket immediately.",
"service_tier": "priority"
}'
Jak działa wnioskowanie Priority
Wnioskowanie Priority kieruje żądania do kolejek obliczeniowych o wysokim znaczeniu, co zapewnia przewidywalną i szybką wydajność w przypadku aplikacji dostępnych dla użytkowników. Jego głównym mechanizmem jest łagodna degradacja po stronie serwera do standardowego przetwarzania ruchu, który przekracza limity dynamiczne. Dzięki temu aplikacja zachowuje stabilność, a żądanie nie jest odrzucane.
| Funkcja | Priorytet | Standardowe | Flex | Wsad |
|---|---|---|---|---|
| Ceny | 75–100% więcej niż w przypadku poziomu Standard | Bilet normalny | 50% zniżki | 50% zniżki |
| Czas oczekiwania | Sekundy | Sekundy do minut | Minuty (docelowo 1–15 min) | Do 24 godzin |
| Niezawodność | Wysoka (nie można jej obniżyć) | Wysoka / średnio wysoka | Bez gwarancji (można ją obniżyć) | Wysoka (w przypadku przepustowości) |
| Interfejs | Synchroniczna | Synchroniczna | Synchroniczna | Asynchroniczny |
Główne korzyści
- Krótki czas oczekiwania: poziom ten został zaprojektowany z myślą o czasie odpowiedzi wynoszącym kilka sekund w przypadku interaktywnych, narzędzi AI dostępnych dla użytkowników.
- Wysoka niezawodność: ruch jest traktowany z najwyższym priorytetem i jest ściśle nieobniżalny.
- Łagodna degradacja: w przypadku nagłego wzrostu ruchu przekraczającego limity dynamiczne następuje automatyczne obniżenie poziomu przetwarzania do poziomu Standard, co zapobiega przerwom w działaniu usługi.
- Niewielkie utrudnienia: poziom ten korzysta z tej samej synchronicznej
createmetody co poziomy Standard i Flex.
Przypadki użycia
Przetwarzanie Priority idealnie sprawdza się w przypadku zbiorów zadań o kluczowym znaczeniu dla firmy, w których najważniejsza jest wydajność i niezawodność.
- Interaktywne aplikacje AI: czatboty i asystenci obsługi klienta, w przypadku których użytkownicy płacą wyższą cenę i oczekują szybkich, spójnych odpowiedzi.
- Silniki podejmowania decyzji w czasie rzeczywistym: systemy wymagające wysoce niezawodnych wyników o niskim czasie oczekiwania , takich jak triage zgłoszeń na żywo czy wykrywanie oszustw.
- Funkcje dla klientów premium: deweloperzy, którzy muszą zagwarantować wyższe cele poziomu usług (SLO) dla płacących klientów.
Ograniczenia liczby żądań
Zużycie na poziomie Priority ma własne ograniczenia liczby żądań, mimo że jest wliczane do ogólnych ograniczeń liczby żądań dotyczących ruchu interaktywnego. Domyślne ograniczenia liczby żądań w przypadku wnioskowania Priority to 0,3-krotność standardowego ograniczenia liczby żądań dla modelu / poziomu.
Logika łagodnego obniżania poziomu
Jeśli z powodu dużego natężenia ruchu zostaną przekroczone limity poziomu Priority, nadmiarowe żądania zostaną automatycznie i łagodnie obniżone do poziomu przetwarzania Standard zamiast odrzucenia z błędem 503 lub 429. Żądania obniżone do poziomu Standard są rozliczane według stawki standardowej, a nie według stawki premium Priority.
Odpowiedzialność klienta
- Monitorowanie odpowiedzi: deweloperzy powinni monitorować
x-gemini-service-tiernagłówek w odpowiedzi interfejsu API, aby wykryć, czy żądania są często obniżane do poziomustandard. - Ponawianie prób: klienci muszą zaimplementować logikę ponawiania prób lub wzrastający czas do ponowienia w przypadku standardowych błędów, takich jak
DEADLINE_EXCEEDED.
Ceny
Wnioskowanie Priority jest o 75–100% droższe niż standardowy interfejs API i rozliczane za token.
Obsługiwane modele
Wnioskowanie Priority jest obsługiwane przez te modele:
| Model | Wnioskowanie Priority |
|---|---|
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.5 Flash | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro (wersja zapoznawcza) | ✔️ |
| Gemini 3 Flash (wersja zapoznawcza) | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |
Co dalej?
- Wnioskowanie Flex w celu zmniejszenia kosztów.
- Tokeny: dowiedz się więcej o tokenach.