Dalam alur kerja AI biasa, Anda mungkin meneruskan token input yang sama berulang kali ke model. Gemini API menawarkan penyimpanan cache implisit untuk mengoptimalkan performa dan biaya.
Penyimpanan dalam cache implisit
Penyimpanan cache implisit diaktifkan secara default untuk semua model Gemini 2.5 dan yang lebih baru. Fitur ini didukung untuk mode percakapan stateful (menggunakan previous_interaction_id) dan stateless.
Kami secara otomatis meneruskan penghematan biaya jika permintaan Anda mencapai cache. Anda tidak perlu melakukan tindakan apa pun untuk mengaktifkannya. Jumlah token input minimum untuk penyimpanan cache konteks tercantum dalam tabel berikut untuk setiap model:
Model
Batas token minimum
Gemini 3.8 Flash
4.096
Gemini 3.6 Flash
4.096
Pratinjau Gemini 3.1 Pro
4.096
Gemini 2.5 Flash
2.048
Gemini 2.5 Pro
2.048
Untuk meningkatkan peluang cache hit implisit:
Coba letakkan konten yang besar dan umum di awal perintah Anda
Mencoba mengirim permintaan dengan awalan yang serupa dalam waktu singkat
Anda dapat melihat jumlah token yang merupakan hit cache di kolom
usage.total_cached_tokens (Python dan JavaScript) objek respons.
[[["Mudah dipahami","easyToUnderstand","thumb-up"],["Memecahkan masalah saya","solvedMyProblem","thumb-up"],["Lainnya","otherUp","thumb-up"]],[["Informasi yang saya butuhkan tidak ada","missingTheInformationINeed","thumb-down"],["Terlalu rumit/langkahnya terlalu banyak","tooComplicatedTooManySteps","thumb-down"],["Sudah usang","outOfDate","thumb-down"],["Masalah terjemahan","translationIssue","thumb-down"],["Masalah kode / contoh","samplesCodeIssue","thumb-down"],["Lainnya","otherDown","thumb-down"]],["Terakhir diperbarui pada 2026-10-09 UTC."],[],[]]