Gemini Priority API – это уровень вывода премиум-класса, предназначенный для критически важных рабочих нагрузок, требующих низкой задержки и высокой надежности. Он доступен по более высокой цене. Трафик уровня приоритета имеет приоритет над трафиком стандартного API и уровня Flex.
Приоритетное заключение доступно для всех конечных точек Interactions API.
Как использовать приоритет
Чтобы использовать уровень Priority, задайте для поля service_tier в запросе значение priority. Если поле не указано, по умолчанию используется стандартный уровень.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Triage this critical customer support ticket immediately.",
service_tier='priority'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: "Triage this critical customer support ticket immediately.",
service_tier: "priority"
});
console.log(interaction.output_text);
}
await main();
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
Client client = new Client();
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-3.8-flash"))
.input(InteractionsInput.of("Perform a priority inference task."))
.serviceTier(ServiceTier.PRIORITY)
.build();
Interaction interaction =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(interaction.outputText().orElse(""));
Проложить маршрут
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
"google.golang.org/genai/interactions/models/interactions"
"google.golang.org/genai/interactions/models/operations"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
Model: interactions.Model("gemini-3.8-flash"),
Input: interactions.NewInteractionsInput("Perform a priority inference task."),
ServiceTier: interactions.ServiceTierPriority.ToPointer(),
}),
})
if err != nil {
log.Fatal(err)
}
if res.Interaction.OutputText != nil {
fmt.Println(*res.Interaction.OutputText)
}
}
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"model": "gemini-3.8-flash",
"input": "Triage this critical customer support ticket immediately.",
"service_tier": "priority"
}'
Как работает определение приоритета
Запросы с приоритетом перенаправляются в очереди с высокой критичностью, что обеспечивает предсказуемую и быструю работу приложений, ориентированных на пользователей. Основной механизм работы функции – это плавный переход на стандартную обработку трафика, превышающего динамические лимиты, на стороне сервера. Это позволяет обеспечить стабильность приложения, а не отклонять запрос.
| Функция | Приоритет | Стандартный | Согнуть | Пакетное задание |
|---|---|---|---|---|
| Цены | на 75–100% больше, чем в подписке Standard; | Полная цена | Скидка 50 % | Скидка 50 % |
| Задержка | секунд | Секунды в минуты | Минуты (цель – 1–15 мин.) | До 24 часов |
| Надежность | Высокий (неосыпающийся) | Высокий / выше среднего | Негарантированное обслуживание (с возможностью отбрасывания) | Высокая (для пропускной способности) |
| Интерфейс | Синхронная | Синхронная | Синхронная | Асинхронный код |
Основные преимущества
- Низкая задержка. Предназначено для интерактивных пользовательских ИИ-инструментов, которые должны отвечать в течение нескольких секунд.
- Высокая надежность. Трафик обрабатывается с максимальной критичностью и не может быть отброшен.
- Постепенное снижение производительности. Если трафик превышает динамические лимиты, он автоматически переводится на стандартный уровень обработки, а не отклоняется, что позволяет избежать сбоев в работе сервиса.
- Простота использования. Используется тот же синхронный метод
create, что и для уровней Standard и Flex.
Примеры использования
Приоритетная обработка идеально подходит для критически важных рабочих процессов, где производительность и надежность имеют первостепенное значение.
- Интерактивные приложения на основе ИИ. Чат-боты и помощники для службы поддержки клиентов, где пользователи платят за подписку и ожидают быстрых и последовательных ответов.
- Системы принятия решений в реальном времени. Системы, требующие высокой надежности и низкой задержки, например для сортировки заявок в реальном времени или обнаружения мошенничества.
- Функции для премиум-клиентов. Разработчики, которым нужно гарантировать более высокие целевые показатели уровня обслуживания (SLO) для платных клиентов.
Ограничение частоты запросов
Для приоритетного потребления действуют собственные ограничения частоты запросов, хотя оно и учитывается в общем лимите интерактивного трафика. Ограничения по умолчанию для приоритетного вывода – 0,3x стандартного ограничения для модели или уровня.
Логика постепенного сокращения
Если лимиты приоритета превышены из-за перегрузки, запросы, превышающие лимит, автоматически и корректно понижаются до стандартной обработки, а не завершаются с ошибкой 503 или 429. Запросы, которые были понижены, оплачиваются по стандартной ставке, а не по премиум-ставке для приоритетных запросов.
Ответственность клиента
- Мониторинг ответов. Разработчикам следует отслеживать
x-gemini-service-tierзаголовок в ответе API, чтобы определить, часто ли запросы понижаются доstandard. - Повторные попытки. Клиенты должны реализовать логику повторных попыток или экспоненциальную выдержку для стандартных ошибок, например
DEADLINE_EXCEEDED.
Цены
Вывод с приоритетом стоит на 75–100% дороже, чем стандартный API, и оплачивается за токен.
Поддерживаемые модели
Приоритетный вывод поддерживают следующие модели:
| Модель | Приоритет |
|---|---|
| Gemini 3.8 Flash | ✔️ |
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.5 Flash | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro (предварительная версия) | ✔️ |
| Gemini 3 Flash (предварительная версия) | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |
Дальнейшие действия
- Гибкий инференс для снижения расходов.
- Токены. Узнайте больше о токенах.