Приоритет

Описание: узнайте, как оптимизировать задержку с помощью уровня приоритета инференса в Interactions API

Gemini Priority API – это уровень вывода премиум-класса, предназначенный для критически важных рабочих нагрузок, требующих низкой задержки и высокой надежности. Он доступен по более высокой цене. Трафик уровня приоритета имеет приоритет над трафиком стандартного API и уровня Flex.

Приоритетное заключение доступно для всех конечных точек Interactions API.

Как использовать приоритет

Чтобы использовать уровень Priority, задайте для поля service_tier в запросе значение priority. Если поле не указано, по умолчанию используется стандартный уровень.

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Triage this critical customer support ticket immediately.",
    service_tier='priority'
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from '@google/genai';

const ai = new GoogleGenAI({});

async function main() {
    const interaction = await ai.interactions.create({
        model: "gemini-3.8-flash",
        input: "Triage this critical customer support ticket immediately.",
        service_tier: "priority"
    });
    console.log(interaction.output_text);
}

await main();

Java

import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;

Client client = new Client();

CreateModelInteraction params =
    CreateModelInteraction.builder()
        .model(Model.of("gemini-3.8-flash"))
        .input(InteractionsInput.of("Perform a priority inference task."))
        .serviceTier(ServiceTier.PRIORITY)
        .build();

Interaction interaction =
    client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();

System.out.println(interaction.outputText().orElse(""));

Проложить маршрут

package main

import (
    "context"
    "fmt"
    "log"

    "google.golang.org/genai"
    "google.golang.org/genai/interactions/models/interactions"
    "google.golang.org/genai/interactions/models/operations"
)

func main() {
    ctx := context.Background()
    client, err := genai.NewClient(ctx, nil)
    if err != nil {
        log.Fatal(err)
    }

    res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
        Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
            Model:       interactions.Model("gemini-3.8-flash"),
            Input:       interactions.NewInteractionsInput("Perform a priority inference task."),
            ServiceTier: interactions.ServiceTierPriority.ToPointer(),
        }),
    })
    if err != nil {
        log.Fatal(err)
    }
    if res.Interaction.OutputText != nil {
        fmt.Println(*res.Interaction.OutputText)
    }
}

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "Content-Type: application/json" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -d '{
    "model": "gemini-3.8-flash",
    "input": "Triage this critical customer support ticket immediately.",
    "service_tier": "priority"
  }'

Как работает определение приоритета

Запросы с приоритетом перенаправляются в очереди с высокой критичностью, что обеспечивает предсказуемую и быструю работу приложений, ориентированных на пользователей. Основной механизм работы функции – это плавный переход на стандартную обработку трафика, превышающего динамические лимиты, на стороне сервера. Это позволяет обеспечить стабильность приложения, а не отклонять запрос.

Функция Приоритет Стандартный Согнуть Пакетное задание
Цены на 75–100% больше, чем в подписке Standard; Полная цена Скидка 50 % Скидка 50 %
Задержка секунд Секунды в минуты Минуты (цель – 1–15 мин.) До 24 часов
Надежность Высокий (неосыпающийся) Высокий / выше среднего Негарантированное обслуживание (с возможностью отбрасывания) Высокая (для пропускной способности)
Интерфейс Синхронная Синхронная Синхронная Асинхронный код

Основные преимущества

  • Низкая задержка. Предназначено для интерактивных пользовательских ИИ-инструментов, которые должны отвечать в течение нескольких секунд.
  • Высокая надежность. Трафик обрабатывается с максимальной критичностью и не может быть отброшен.
  • Постепенное снижение производительности. Если трафик превышает динамические лимиты, он автоматически переводится на стандартный уровень обработки, а не отклоняется, что позволяет избежать сбоев в работе сервиса.
  • Простота использования. Используется тот же синхронный метод create, что и для уровней Standard и Flex.

Примеры использования

Приоритетная обработка идеально подходит для критически важных рабочих процессов, где производительность и надежность имеют первостепенное значение.

  • Интерактивные приложения на основе ИИ. Чат-боты и помощники для службы поддержки клиентов, где пользователи платят за подписку и ожидают быстрых и последовательных ответов.
  • Системы принятия решений в реальном времени. Системы, требующие высокой надежности и низкой задержки, например для сортировки заявок в реальном времени или обнаружения мошенничества.
  • Функции для премиум-клиентов. Разработчики, которым нужно гарантировать более высокие целевые показатели уровня обслуживания (SLO) для платных клиентов.

Ограничение частоты запросов

Для приоритетного потребления действуют собственные ограничения частоты запросов, хотя оно и учитывается в общем лимите интерактивного трафика. Ограничения по умолчанию для приоритетного вывода – 0,3x стандартного ограничения для модели или уровня.

Логика постепенного сокращения

Если лимиты приоритета превышены из-за перегрузки, запросы, превышающие лимит, автоматически и корректно понижаются до стандартной обработки, а не завершаются с ошибкой 503 или 429. Запросы, которые были понижены, оплачиваются по стандартной ставке, а не по премиум-ставке для приоритетных запросов.

Ответственность клиента

  • Мониторинг ответов. Разработчикам следует отслеживать x-gemini-service-tierзаголовок в ответе API, чтобы определить, часто ли запросы понижаются до standard.
  • Повторные попытки. Клиенты должны реализовать логику повторных попыток или экспоненциальную выдержку для стандартных ошибок, например DEADLINE_EXCEEDED.

Цены

Вывод с приоритетом стоит на 75–100% дороже, чем стандартный API, и оплачивается за токен.

Поддерживаемые модели

Приоритетный вывод поддерживают следующие модели:

Модель Приоритет
Gemini 3.8 Flash ✔️
Gemini 3.6 Flash ✔️
Gemini 3.5 Flash-Lite ✔️
Gemini 3.1 Flash-Lite ✔️
Gemini 3.1 Pro (предварительная версия) ✔️
Gemini 3 Flash (предварительная версия) ✔️
Gemini 2.5 Pro ✔️
Gemini 2.5 Flash ✔️
Gemini 2.5 Flash-Lite ✔️

Дальнейшие действия