Trong quy trình làm việc điển hình của AI, bạn có thể truyền đi truyền lại các mã thông báo đầu vào giống nhau cho một mô hình. Gemini API cung cấp tính năng lưu vào bộ nhớ đệm ngầm để tối ưu hoá hiệu suất và chi phí.
Lưu vào bộ nhớ đệm ngầm
Tính năng lưu vào bộ nhớ đệm ngầm định được bật theo mặc định cho tất cả các mô hình Gemini 2.5 trở lên. Chế độ này được hỗ trợ cho cả chế độ trò chuyện có trạng thái (sử dụng previous_interaction_id) và không có trạng thái.
Chúng tôi sẽ tự động chuyển các khoản tiết kiệm chi phí nếu yêu cầu của bạn truy cập vào bộ nhớ đệm. Bạn không cần làm gì để bật tính năng này. Số lượng số token đầu vào tối thiểu để lưu vào bộ nhớ đệm ngữ cảnh được liệt kê trong bảng sau cho từng mô hình:
Mô hình
Giới hạn mã thông báo tối thiểu
Gemini 3.8 Flash
4.096
Gemini 3.6 Flash
4.096
Gemini 3.1 Pro (Bản xem trước)
4.096
Gemini 2.5 Flash
2.048
Gemini 2.5 Pro
2.048
Để tăng cơ hội đạt được kết quả tìm kiếm trong bộ nhớ cache ngầm ẩn:
Hãy thử đặt nội dung lớn và phổ biến ở đầu câu lệnh
Hãy thử gửi các yêu cầu có tiền tố tương tự trong một khoảng thời gian ngắn
Bạn có thể xem số lượng token là kết quả tìm kiếm trong bộ nhớ cache trong trường usage.total_cached_tokens (Python và JavaScript) của đối tượng phản hồi.
[[["Dễ hiểu","easyToUnderstand","thumb-up"],["Giúp tôi giải quyết được vấn đề","solvedMyProblem","thumb-up"],["Khác","otherUp","thumb-up"]],[["Thiếu thông tin tôi cần","missingTheInformationINeed","thumb-down"],["Quá phức tạp/quá nhiều bước","tooComplicatedTooManySteps","thumb-down"],["Đã lỗi thời","outOfDate","thumb-down"],["Vấn đề về bản dịch","translationIssue","thumb-down"],["Vấn đề về mẫu/mã","samplesCodeIssue","thumb-down"],["Khác","otherDown","thumb-down"]],["Cập nhật lần gần đây nhất: 2026-10-09 UTC."],[],[]]