ذخیره‌سازی متن، ذخیره‌سازی متن

در یک گردش کار معمول هوش مصنوعی، ممکن است توکن‌های ورودی یکسانی را بارها و بارها به یک مدل ارسال کنید. API جمینی برای بهینه‌سازی عملکرد و هزینه‌ها، ذخیره‌سازی ضمنی (implicit caching) را ارائه می‌دهد.

ذخیره سازی ضمنی

Implicit caching is enabled by default for all Gemini 2.5 and newer models. It is supported for both stateful (using previous_interaction_id ) and stateless conversation modes. We automatically pass on cost savings if your request hits caches. There is nothing you need to do in order to enable this. The minimum input token count for context caching is listed in the following table for each model:

مدل حداقل محدودیت توکن
فلش جمینی ۳.۵ ۴۰۹۶ عدد
پیش‌نمایش Gemini 3.1 Pro ۴۰۹۶ عدد
فلش جمینی ۲.۵ ۲۰۴۸
جمینی ۲.۵ پرو ۲۰۴۸

برای افزایش احتمال برخورد با حافظه پنهان ضمنی:

  • سعی کنید مطالب بزرگ و رایج را در ابتدای درخواست خود قرار دهید.
  • سعی کنید درخواست‌هایی با پیشوند مشابه را در مدت زمان کوتاهی ارسال کنید

می‌توانید تعداد توکن‌هایی که در حافظه پنهان ذخیره شده‌اند را در فیلد usage.total_cached_tokens (پایتون و جاوا اسکریپت) شیء پاسخ مشاهده کنید.