L'API Gemini propose différents mécanismes d'optimisation pour vous aider à équilibrer la vitesse, le coût et la fiabilité en fonction des besoins spécifiques de vos charges de travail. Que vous créiez des robots conversationnels en temps réel ou que vous exécutiez des pipelines de traitement de données hors connexion lourds, le choix du bon paradigme peut réduire considérablement les coûts ou améliorer les performances.
| Fonctionnalité | Standard | Flex | Priorité | Lot | Mise en cache |
|---|---|---|---|---|---|
| Tarifs | Plein tarif | 50% de remise | 75% à 100% de plus que la limite standard | 50% de remise | Remise de 90% + stockage des jetons au prorata |
| Latence | Secondes à minutes | Minutes (objectif de 1 à 15 min) | Secondes | Jusqu'à 24 heures | Délai d'émission du premier jeton plus rapide |
| Fiabilité | Élevée / Assez élevée | Optimisation limitée (désactivable) | Élevée (non amovible) | Élevée (pour le débit) | N/A |
| Interface | Synchrone | Synchrone | Synchrone | Asynchrone | État enregistré |
| Cas d'utilisation idéal | Workflows généraux des applications | Chaînes séquentielles non urgentes | Applications de production visibles par l'utilisateur | Ensembles de données massifs, évaluations hors connexion | Requêtes récurrentes sur le même fichier |
Niveaux de service d'inférence (synchrone)
Vous pouvez passer d'un trafic synchrone optimisé pour la fiabilité à un trafic synchrone optimisé pour les coûts en transmettant le paramètre service_tier dans vos appels de génération standards.
Inférence standard (par défaut)
Le niveau standard est l'option par défaut pour la génération de contenu séquentiel. Il offre des temps de réponse normaux, sans frais supplémentaires ni longues files d'attente.
- Fiabilité : niveau de gravité standard
- Prix : tarifs standards.
- Recommandé pour : la plupart des applications interactives du quotidien.
Inférence prioritaire (optimisée pour la latence)
Le traitement prioritaire achemine vos demandes vers des files d'attente de calcul de haute criticité. Ce trafic n'est absolument pas délestable (il n'est jamais interrompu par d'autres niveaux) et offre la fiabilité la plus élevée. Si vous dépassez les limites de priorité dynamique, le système rétrogradera la demande vers un traitement standard au lieu d'échouer avec une erreur.
- Fiabilité : criticité la plus élevée
- Prix : 75% à 100% au-dessus des tarifs standards.
- Idéal pour : les chatbots de service client, la détection de fraudes en temps réel et les copilotes essentiels pour l'entreprise.
Inférence Flex (optimisée pour les coûts)
L'inférence flexible offre une remise de 50% par rapport aux tarifs standards en utilisant la capacité de calcul opportuniste hors pointe. Les requêtes sont traitées de manière synchrone, ce qui signifie que vous n'avez pas besoin de réécrire le code pour gérer les objets de lot. Comme il s'agit d'un trafic "sheddable", les requêtes peuvent être préemptées si le système connaît des pics de trafic standards.
- Fiabilité : non garantie, criticité pouvant être abandonnée
- Prix : 50% du prix standard (facturé par jeton).
- Idéal pour : les workflows agentiques en plusieurs étapes où l'appel N+1 dépend de la sortie de l'appel N, les mises à jour CRM en arrière-plan et les évaluations hors connexion.
API Batch (traitement par lot, asynchrone)
L'API Batch est conçue pour traiter de grands volumes de requêtes de manière asynchrone à 50% du coût standard. Vous pouvez envoyer des requêtes sous forme de dictionnaires intégrés ou à l'aide d'un fichier d'entrée JSONL (jusqu'à 2 Go). Il traite les demandes à l'aide de files d'attente de débit en arrière-plan avec un délai de traitement cible de 24 heures.
- Fiabilité : peut être interrompu, mais avec des tentatives automatiques et un système de mise en file d'attente pendant 24 heures
- Prix : 50% du prix standard.
- Idéal pour : le prétraitement d'ensembles de données volumineux, l'exécution de suites de tests de régression périodiques et la génération d'images ou d'embeddings à grand volume.
Cache de contexte (économies sur les entrées)
La cache de contexte est utilisée lorsqu'un contexte initial important est référencé à plusieurs reprises par des requêtes plus courtes.
- Mise en cache implicite : activée automatiquement sur les modèles Gemini 2.5 et ultérieurs. Le système répercute les économies de coûts si votre demande touche des caches existants en fonction des préfixes de requête courants.
- Mise en cache explicite : vous pouvez créer manuellement un objet de cache avec une valeur TTL (Time-To-Live) spécifique. Une fois créés, vous pouvez faire référence aux jetons mis en cache pour les requêtes ultérieures afin d'éviter de transmettre plusieurs fois la même charge utile de corpus.
- Prix : facturé en fonction du nombre de jetons mis en cache et de la durée de stockage (TTL).
- Idéal pour : les chatbots avec des instructions système détaillées, l'analyse répétitive de fichiers vidéo longs ou les requêtes sur des ensembles de documents volumineux.
Réduire les coûts d'entrée vidéo grâce au traitement agentique
Pour les contenus vidéo longs, le traitement agentique peut réduire les coûts des jetons d'entrée jusqu'à 88% tout en améliorant la qualité des réponses. Au lieu d'extraire chaque frame à 1 FPS (traitement statique), le modèle recherche dynamiquement dans la vidéo, en chargeant la transcription et/ou les frames et/ou l'audio pertinents pour votre requête. Pour les extraits courts (moins de cinq minutes) où la latence est essentielle, le traitement statique peut fournir un délai avant le premier jeton (TTFT) plus rapide, car le mode agentique entraîne des allers-retours de raisonnement et d'outil internes avant le début de la génération.
Pour utiliser le traitement agentique avec Gemini 3.8 Flash, 3.6 Flash ou 3.5 Flash Lite, définissez processing: "agentic" (API Interactions) ou media_processing: "AGENTIC" (API GenerateContent) sur votre entrée vidéo. Si le modèle ne prend pas en charge le traitement agentique, il renvoie une erreur.
Consultez Compréhension agentique des vidéos pour obtenir des exemples de code.