脈絡快取

在典型的 AI 工作流程中,您可能會反覆將相同的輸入權杖傳遞至模型。Gemini API 提供隱含快取功能,可提升效能並節省費用。

隱含快取

所有 Gemini 2.5 以上模型都會預設啟用隱式快取功能。有狀態 (使用 previous_interaction_id) 和無狀態對話模式均支援這項功能。如果要求命中快取,我們會自動將節省的費用轉移給您。這項功能會自動啟用,下表列出各模型進行內容快取時的最低輸入權杖數:

模型 詞元數量下限
Gemini 3.8 Flash 4,096
Gemini 3.6 Flash 4,096
Gemini 3.5 Flash 4,096
Gemini 3.1 Pro 預先發布版 4,096
Gemini 2.5 Flash 2,048
Gemini 2.5 Pro 2,048

如要提高隱性快取命中率,請採取下列行動:

  • 嘗試在提示開頭放置大型且常見的內容
  • 嘗試在短時間內傳送具有類似前置字元的要求

您可以在回應物件的 usage.total_cached_tokens (Python 和 JavaScript) 欄位中,查看快取命中次數。