Buforowanie kontekstu

W typowym przepływie pracy AI możesz wielokrotnie przekazywać do modelu te same tokeny wejściowe. Interfejs Gemini API oferuje niejawne buforowanie, które optymalizuje wydajność i koszty.

Niejawne buforowanie

Pamięć podręczna jest domyślnie włączona w przypadku wszystkich modeli Gemini 2.5 i nowszych. Jest on obsługiwany zarówno w stanowych (z użyciem previous_interaction_id), jak i bezstanowych trybach rozmowy. Jeśli Twoje żądanie trafi do pamięci podręcznej, automatycznie przekażemy Ci oszczędności. Aby włączyć tę funkcję, nie musisz nic robić. Minimalna liczba tokenów wejściowych w przypadku pamięci podręcznej kontekstu jest podana w tabeli poniżej dla każdego modelu:

Model Minimalny limit tokenów
Gemini 3.8 Flash 4096
Gemini 3.6 Flash 4096
Gemini 3.1 Pro (wersja testowa) 4096
Gemini 2.5 Flash 2048
Gemini 2.5 Pro 2048

Aby zwiększyć szansę na trafienie w pamięci podręcznej:

  • Spróbuj umieścić na początku prompta duże i popularne treści.
  • Wysyłaj żądania z podobnym prefiksem w krótkim czasie.

Liczbę tokenów, które zostały trafieniami w pamięci podręcznej, możesz sprawdzić w polu usage.total_cached_tokens obiektu odpowiedzi (Python i JavaScript).