ذخیره کردن بافت در حافظه نهان

در گردش کار هوش مصنوعی معمولی، ممکن است نشانه‌های ورودی یکسانی را بارها و بارها به مدل ارسال کنید. ‫Gemini API برای بهینه‌سازی عملکرد و هزینه‌ها، حافظه نهان ضمنی ارائه می‌دهد.

ذخیره ضمنی در حافظه نهان

ذخیره‌سازی نهان ضمنی به‌طور پیش‌فرض برای همه مدل‌های Gemini 2.5 و جدیدتر فعال است. این ویژگی هم برای حالت مکالمه حالت‌دار (بااستفاده از previous_interaction_id) و هم برای حالت مکالمه بدون حالت پشتیبانی می‌شود. اگر درخواست شما به حافظه‌های نهان برخورد کند، صرفه‌جویی در هزینه را به‌طور خودکار به شما منتقل می‌کنیم. برای فعال کردن این ویژگی، لازم نیست کاری انجام دهید. حداقل تعداد نشان ورودی برای حافظه نهان زمینه‌ای در جدول زیر برای هر مدل فهرست شده است:

مدل حداقل حد داده‌واحد
Gemini 3.8 Flash ۴٬۰۹۶
Gemini 3.6 Flash ۴٬۰۹۶
پیش‌نمایش Gemini 3.1 Pro ۴٬۰۹۶
Gemini 2.5 Flash ۲٬۰۴۸
Gemini 2.5 Pro ۲٬۰۴۸

برای افزایش احتمال برخورد با حافظه نهان ضمنی:

  • محتوای بزرگ و رایج را در ابتدای پیام‌واره‌تان قرار دهید
  • سعی کنید درخواست‌هایی با پیشوند مشابه را در مدت زمان کوتاهی ارسال کنید

می‌توانید تعداد نشان‌هایی را که در فیلد usage.total_cached_tokens (Python و JavaScript) شیء پاسخ در حافظه نهان وجود داشته‌اند ببینید.