Оптимизация и вывод Gemini API

Gemini API предлагает различные механизмы оптимизации, которые помогут вам сбалансировать скорость, стоимость и надежность в зависимости от потребностей вашей рабочей нагрузки. Правильный выбор парадигмы может значительно снизить затраты или повысить производительность, независимо от того, создаете ли вы чат-ботов для общения в реальном времени или запускаете сложные конвейеры обработки данных в офлайн-режиме.

Функция Стандартный Согнуть Приоритет Пакетное задание Кеширование
Цены Полная цена Скидка 50 % на 75–100 % больше, чем обычно; Скидка 50 % Скидка 90% + пропорциональное хранилище токенов
Задержка Секунды в минуты Минуты (цель – 1–15 мин.) секунд До 24 часов Ускоренное время до первого токена
Надежность Высокий / выше среднего Негарантированное обслуживание (с возможностью отбрасывания) Высокий (неосыпающийся) Высокая (для пропускной способности) Н/Д
Интерфейс Синхронная Синхронная Синхронная Асинхронный код Сохраненное состояние
Пример использования Общие рабочие процессы приложений Несрочные последовательные цепочки Рабочие пользовательские приложения Большие наборы данных, офлайн-оценки Повторяющиеся запросы к одному и тому же файлу

Классы сервисов для логического вывода (синхронные)

Вы можете переключаться между синхронным трафиком, оптимизированным по надежности, и синхронным трафиком, оптимизированным по стоимости, передавая параметр service_tier в стандартных вызовах генерации.

Стандартный вывод (по умолчанию)

Стандартный уровень используется по умолчанию для последовательной генерации контента. Она обеспечивает нормальное время отклика без дополнительных комиссий и длительного ожидания.

  • Надежность: стандартная критичность.
  • Цена. Стандартная цена.
  • Лучше всего подходит для: большинства интерактивных приложений, используемых ежедневно.

Приоритетное умозаключение (оптимизация задержки)

При обработке приоритетных запросов они направляются в вычислительные очереди с высоким приоритетом. Этот трафик не может быть прерван другими уровнями и обеспечивает максимальную надежность. Если вы превысите лимиты динамического приоритета, система корректно понизит приоритет запроса до стандартного вместо того, чтобы возвращать ошибку.

  • Надежность: наивысшая критичность.
  • Цена: на 75–100 % выше стандартной.
  • Лучшее применение: чат-боты для клиентов, обнаружение мошенничества в реальном времени и критически важные для бизнеса помощники.

Гибкий инференс (оптимизация затрат)

Гибкий вывод позволяет получить скидку 50% по сравнению со стандартными тарифами, используя вычислительные мощности в периоды низкой нагрузки. Запросы обрабатываются синхронно, поэтому вам не нужно переписывать код для управления пакетными объектами. Поскольку это "отключаемый" трафик, запросы могут быть прерваны, если система испытывает стандартные скачки трафика.

  • Надежность: негарантированная, критичность можно снизить.
  • Цена: 50% от стандартной цены (оплата за токен).
  • Лучше всего подходит для: многоэтапных рабочих процессов с агентами, где вызов N+1 зависит от результата вызова N, фоновых обновлений CRM и офлайн-оценок.

Пакетный API (массовый, асинхронный)

Batch API предназначен для асинхронной обработки большого количества запросов с 50-процентной скидкой. Запросы можно отправлять в виде встроенных словарей или с помощью входного файла JSONL (до 2 ГБ). Запросы обрабатываются в фоновом режиме с целевым временем выполнения 24 часа.

  • Надежность. Можно отменить, но с автоматическими повторными попытками каждые 24 часа и системой очередей.
  • Цена: 50% от стандартной цены.
  • Лучше всего подходит для: предварительной обработки больших наборов данных, периодического запуска наборов регрессионных тестов и массовой генерации изображений или встраивания.

Кеширование контекста (экономия входных данных)

Кеширование контекста используется, когда значительный начальный контекст многократно упоминается в более коротких запросах.

  • Неявное кеширование. Включено автоматически в Gemini 2.5 и более новых моделях. Система передает экономию средств, если ваш запрос попадает в существующие кеши на основе общих префиксов запросов.
  • Явное кеширование. Вы можете вручную создать объект кеша с определенным временем жизни (TTL). После создания токенов вы можете использовать их в последующих запросах, чтобы не передавать один и тот же корпус данных несколько раз.
  • Цена. Оплата взимается в зависимости от количества токенов кеша и срока хранения (TTL).
  • Для чего подходит. Для чат-ботов с подробными системными инструкциями, повторяющегося анализа длинных видеофайлов или запросов к большим наборам документов.

Сокращение расходов на обработку видео с помощью агентов

При обработке длинного видеоконтента агентный подход позволяет снизить стоимость входных токенов до 88% и повысить качество ответов. Вместо того чтобы извлекать каждый кадр со скоростью 1 кадр в секунду (статическая обработка), модель динамически просматривает видео, загружая расшифровку и/или кадры и/или аудио, относящиеся к вашему запросу. Для коротких клипов (менее пяти минут), где важна задержка, статическая обработка может обеспечить более быстрое время до первого токена (TTFT), поскольку агентский режим предполагает внутренние рассуждения и использование инструментов до начала генерации.

Чтобы использовать обработку агентом с Gemini 3.8 Flash, 3.6 Flash или 3.5 Flash Lite, задайте processing: "agentic" (Interactions API) или media_processing: "AGENTIC" (GenerateContent API) для видеовхода. Если модель не поддерживает обработку с помощью агентов, она вернет ошибку.

Примеры кода можно найти в статье Понимание видео с помощью агентов.