Кеширование контекста

В типичном рабочем процессе с ИИ одни и те же входные токены могут передаваться модели многократно. Gemini API предлагает неявное кеширование для оптимизации производительности и расходов.

Неявное кеширование

Неявное кеширование включено по умолчанию для всех моделей Gemini 2.5 и более новых. Он поддерживается как в режиме с сохранением состояния (с использованием previous_interaction_id), так и в режиме без сохранения состояния. Если ваш запрос будет обработан с помощью кеша, мы автоматически передадим вам сэкономленные средства. Вам не нужно ничего делать, чтобы включить эту функцию. Минимальное количество входных токенов для кеширования контекста указано в таблице ниже для каждой модели:

Модель Минимальное количество токенов
Gemini 3.8 Flash 4096
Gemini 3.6 Flash 4096
Gemini 3.1 Pro Preview 4096
Gemini 2.5 Flash 2048
Gemini 2.5 Pro 2048

Чтобы повысить вероятность неявного попадания в кеш:

  • Попробуйте разместить в начале запроса крупные и распространенные объекты.
  • Попробуйте отправлять запросы с похожим префиксом за короткий промежуток времени.

Количество токенов, которые были совпадениями в кеше, можно посмотреть в поле usage.total_cached_tokens объекта ответа (Python и JavaScript).