W typowym przepływie pracy AI możesz wielokrotnie przekazywać do modelu te same tokeny wejściowe. Interfejs Gemini API oferuje niejawne buforowanie, które optymalizuje wydajność i koszty.
Niejawne buforowanie
Pamięć podręczna jest domyślnie włączona w przypadku wszystkich modeli Gemini 2.5 i nowszych. Jest on obsługiwany zarówno w stanowych (z użyciem previous_interaction_id), jak i bezstanowych trybach rozmowy.
Jeśli Twoje żądanie trafi do pamięci podręcznej, automatycznie przekażemy Ci oszczędności. Aby włączyć tę funkcję, nie musisz nic robić. Minimalna liczba tokenów wejściowych w przypadku pamięci podręcznej kontekstu jest podana w tabeli poniżej dla każdego modelu:
Model
Minimalny limit tokenów
Gemini 3.8 Flash
4096
Gemini 3.6 Flash
4096
Gemini 3.1 Pro (wersja testowa)
4096
Gemini 2.5 Flash
2048
Gemini 2.5 Pro
2048
Aby zwiększyć szansę na trafienie w pamięci podręcznej:
Spróbuj umieścić na początku prompta duże i popularne treści.
Wysyłaj żądania z podobnym prefiksem w krótkim czasie.
Liczbę tokenów, które zostały trafieniami w pamięci podręcznej, możesz sprawdzić w polu usage.total_cached_tokens obiektu odpowiedzi (Python i JavaScript).
[[["Łatwo zrozumieć","easyToUnderstand","thumb-up"],["Rozwiązało to mój problem","solvedMyProblem","thumb-up"],["Inne","otherUp","thumb-up"]],[["Brak potrzebnych mi informacji","missingTheInformationINeed","thumb-down"],["Zbyt skomplikowane / zbyt wiele czynności do wykonania","tooComplicatedTooManySteps","thumb-down"],["Nieaktualne treści","outOfDate","thumb-down"],["Problem z tłumaczeniem","translationIssue","thumb-down"],["Problem z przykładami/kodem","samplesCodeIssue","thumb-down"],["Inne","otherDown","thumb-down"]],["Ostatnia aktualizacja: 2026-10-09 UTC."],[],[]]