Mise en cache du contexte

Dans un workflow d'IA typique, vous pouvez transmettre les mêmes jetons d'entrée à un modèle à plusieurs reprises. L'API Gemini propose une mise en cache implicite pour optimiser les performances et les coûts.

Mise en cache implicite

La mise en cache implicite est activée par défaut pour tous les modèles Gemini 2.5 et ultérieurs. Il est compatible avec les modes de conversation avec état (à l'aide de previous_interaction_id) et sans état. Nous répercutons automatiquement les économies de coûts si votre requête atteint les caches. Aucune action n'est requise de votre part pour l'activer. Le nombre minimal de jetons d'entrée pour la mise en cache du contexte est indiqué dans le tableau suivant pour chaque modèle :

Modèle Limite minimale de jetons
Gemini 3.8 Flash 4 096
Gemini 3.6 Flash 4 096
Gemini 3.5 Flash 4 096
Preview Gemini 3.1 Pro 4 096
Gemini 2.5 Flash 2 048
Gemini 2.5 Pro 2 048

Pour augmenter les chances d'un succès de cache implicite :

  • Essayez de placer les contenus volumineux et courants au début de votre requête.
  • Envoyer des requêtes avec un préfixe similaire en peu de temps

Vous pouvez voir le nombre de jetons qui ont été des succès de cache dans le champ usage.total_cached_tokens de l'objet de réponse (Python et JavaScript).