В типичном рабочем процессе ИИ вы можете передавать одни и те же входные токены модели снова и снова. API Gemini предлагает неявное кэширование для оптимизации производительности и затрат.
Неявное кэширование
Неявное кэширование включено по умолчанию для всех моделей Gemini 2.5 и более новых. Оно поддерживается как для режимов диалога с сохранением состояния (используя previous_interaction_id ), так и для режимов диалога без сохранения состояния . Мы автоматически передаем экономию средств, если ваш запрос попадает в кэш. Вам ничего не нужно делать, чтобы включить это. Минимальное количество входных токенов для контекстного кэширования указано в следующей таблице для каждой модели:
Модель
Минимальный лимит токенов
Gemini 3.7 Flash
4096
Вспышка Gemini 3.6
4096
Вспышка Gemini 3.5
4096
Gemini 3.1 Pro Preview
4096
Вспышка Gemini 2.5
2048
Gemini 2.5 Pro
2048
Чтобы повысить вероятность попадания в неявный кэш:
Попробуйте разместить часто встречающиеся и распространенные элементы в начале вашего запроса.
Постарайтесь отправлять запросы с похожим префиксом в течение короткого промежутка времени.
Количество токенов, попавших в кэш, можно увидеть в поле usage.total_cached_tokens (для Python и JavaScript) объекта ответа.
[[["Прост для понимания","easyToUnderstand","thumb-up"],["Помог мне решить мою проблему","solvedMyProblem","thumb-up"],["Другое","otherUp","thumb-up"]],[["Отсутствует нужная мне информация","missingTheInformationINeed","thumb-down"],["Слишком сложен/слишком много шагов","tooComplicatedTooManySteps","thumb-down"],["Устарел","outOfDate","thumb-down"],["Проблема с переводом текста","translationIssue","thumb-down"],["Проблемы образцов/кода","samplesCodeIssue","thumb-down"],["Другое","otherDown","thumb-down"]],["Последнее обновление: 2026-08-13 UTC."],[],[]]