Gemini API предлагает различные механизмы оптимизации, которые помогут вам сбалансировать скорость, стоимость и надежность в зависимости от потребностей вашей рабочей нагрузки. Правильный выбор парадигмы может значительно снизить затраты или повысить производительность, независимо от того, создаете ли вы чат-ботов для общения в реальном времени или запускаете сложные конвейеры обработки данных в офлайн-режиме.
| Функция | Стандартный | Согнуть | Приоритет | Пакетное задание | Кеширование |
|---|---|---|---|---|---|
| Цены | Полная цена | Скидка 50 % | на 75–100 % больше, чем обычно; | Скидка 50 % | Скидка 90% + пропорциональное хранилище токенов |
| Задержка | Секунды в минуты | Минуты (цель – 1–15 мин.) | секунд | До 24 часов | Ускоренное время до первого токена |
| Надежность | Высокий / выше среднего | Негарантированное обслуживание (с возможностью отбрасывания) | Высокий (неосыпающийся) | Высокая (для пропускной способности) | Н/Д |
| Интерфейс | Синхронная | Синхронная | Синхронная | Асинхронный код | Сохраненное состояние |
| Пример использования | Общие рабочие процессы приложений | Несрочные последовательные цепочки | Рабочие пользовательские приложения | Большие наборы данных, офлайн-оценки | Повторяющиеся запросы к одному и тому же файлу |
Классы сервисов для логического вывода (синхронные)
Вы можете переключаться между синхронным трафиком, оптимизированным по надежности, и синхронным трафиком, оптимизированным по стоимости, передавая параметр service_tier в стандартных вызовах генерации.
Стандартный вывод (по умолчанию)
Стандартный уровень используется по умолчанию для последовательной генерации контента. Она обеспечивает нормальное время отклика без дополнительных комиссий и длительного ожидания.
- Надежность: стандартная критичность.
- Цена. Стандартная цена.
- Лучше всего подходит для: большинства интерактивных приложений, используемых ежедневно.
Приоритетное умозаключение (оптимизация задержки)
При обработке приоритетных запросов они направляются в вычислительные очереди с высоким приоритетом. Этот трафик не может быть прерван другими уровнями и обеспечивает максимальную надежность. Если вы превысите лимиты динамического приоритета, система корректно понизит приоритет запроса до стандартного вместо того, чтобы возвращать ошибку.
- Надежность: наивысшая критичность.
- Цена: на 75–100 % выше стандартной.
- Лучшее применение: чат-боты для клиентов, обнаружение мошенничества в реальном времени и критически важные для бизнеса помощники.
Гибкий инференс (оптимизация затрат)
Гибкий вывод позволяет получить скидку 50% по сравнению со стандартными тарифами, используя вычислительные мощности в периоды низкой нагрузки. Запросы обрабатываются синхронно, поэтому вам не нужно переписывать код для управления пакетными объектами. Поскольку это "отключаемый" трафик, запросы могут быть прерваны, если система испытывает стандартные скачки трафика.
- Надежность: негарантированная, критичность можно снизить.
- Цена: 50% от стандартной цены (оплата за токен).
- Лучше всего подходит для: многоэтапных рабочих процессов с агентами, где вызов N+1 зависит от результата вызова N, фоновых обновлений CRM и офлайн-оценок.
Пакетный API (массовый, асинхронный)
Batch API предназначен для асинхронной обработки большого количества запросов с 50-процентной скидкой. Запросы можно отправлять в виде встроенных словарей или с помощью входного файла JSONL (до 2 ГБ). Запросы обрабатываются в фоновом режиме с целевым временем выполнения 24 часа.
- Надежность. Можно отменить, но с автоматическими повторными попытками каждые 24 часа и системой очередей.
- Цена: 50% от стандартной цены.
- Лучше всего подходит для: предварительной обработки больших наборов данных, периодического запуска наборов регрессионных тестов и массовой генерации изображений или встраивания.
Кеширование контекста (экономия входных данных)
Кеширование контекста используется, когда значительный начальный контекст многократно упоминается в более коротких запросах.
- Неявное кеширование. Включено автоматически в Gemini 2.5 и более новых моделях. Система передает экономию средств, если ваш запрос попадает в существующие кеши на основе общих префиксов запросов.
- Явное кеширование. Вы можете вручную создать объект кеша с определенным временем жизни (TTL). После создания токенов вы можете использовать их в последующих запросах, чтобы не передавать один и тот же корпус данных несколько раз.
- Цена. Оплата взимается в зависимости от количества токенов кеша и срока хранения (TTL).
- Для чего подходит. Для чат-ботов с подробными системными инструкциями, повторяющегося анализа длинных видеофайлов или запросов к большим наборам документов.
Сокращение расходов на обработку видео с помощью агентов
При обработке длинного видеоконтента агентный подход позволяет снизить стоимость входных токенов до 88% и повысить качество ответов. Вместо того чтобы извлекать каждый кадр со скоростью 1 кадр в секунду (статическая обработка), модель динамически просматривает видео, загружая расшифровку и/или кадры и/или аудио, относящиеся к вашему запросу. Для коротких клипов (менее пяти минут), где важна задержка, статическая обработка может обеспечить более быстрое время до первого токена (TTFT), поскольку агентский режим предполагает внутренние рассуждения и использование инструментов до начала генерации.
Чтобы использовать обработку агентом с Gemini 3.8 Flash, 3.6 Flash или 3.5 Flash Lite, задайте processing: "agentic" (Interactions API) или media_processing: "AGENTIC" (GenerateContent API) для видеовхода. Если модель не поддерживает обработку с помощью агентов, она вернет ошибку.
Примеры кода можно найти в статье Понимание видео с помощью агентов.