In einem typischen KI-Workflow werden dieselben Eingabetokens möglicherweise immer wieder an ein Modell übergeben. Die Gemini API bietet implizites Caching, um Leistung und Kosten zu optimieren.
Implizites Caching
Implizites Caching ist standardmäßig für alle Gemini 2.5-Modelle und neueren Modelle aktiviert. Sie wird sowohl für zustandsorientierte (mit previous_interaction_id) als auch für zustandslose Unterhaltungsmodi unterstützt.
Wir geben Kosteneinsparungen automatisch weiter, wenn Ihre Anfrage auf Caches trifft. Sie müssen nichts weiter tun, um diese Funktion zu aktivieren. Die Mindestanzahl an Eingabetokens für das Zwischenspeichern von Kontext ist in der folgenden Tabelle für jedes Modell aufgeführt:
Modell
Mindest-Tokenlimit
Gemini 3.8 Flash
4.096
Gemini 3.6 Flash
4.096
Gemini 3.5 Flash
4.096
Gemini 3.1 Pro (Vorabversion)
4.096
Gemini 2.5 Flash
2.048
Gemini 2.5 Pro
2.048
So erhöhen Sie die Wahrscheinlichkeit eines impliziten Cache-Treffers:
Große und gängige Inhalte am Anfang des Prompts platzieren
Versuchen Sie, Anfragen mit ähnlichem Präfix innerhalb kurzer Zeit zu senden.
Die Anzahl der Tokens, die Cache-Treffer waren, finden Sie im Feld usage.total_cached_tokens des Antwortobjekts (Python und JavaScript).
[[["Leicht verständlich","easyToUnderstand","thumb-up"],["Mein Problem wurde gelöst","solvedMyProblem","thumb-up"],["Sonstiges","otherUp","thumb-up"]],[["Benötigte Informationen nicht gefunden","missingTheInformationINeed","thumb-down"],["Zu umständlich/zu viele Schritte","tooComplicatedTooManySteps","thumb-down"],["Nicht mehr aktuell","outOfDate","thumb-down"],["Problem mit der Übersetzung","translationIssue","thumb-down"],["Problem mit Beispielen/Code","samplesCodeIssue","thumb-down"],["Sonstiges","otherDown","thumb-down"]],["Zuletzt aktualisiert: 2026-10-09 (UTC)."],[],[]]