Gemini API – Optimierung und Inferenz

Die Gemini API bietet eine Vielzahl von Optimierungsmechanismen, mit denen Sie Geschwindigkeit, Kosten und Zuverlässigkeit an die Anforderungen Ihrer jeweiligen Arbeitslast anpassen können. Ob Sie Konversationsbots in Echtzeit entwickeln oder umfangreiche Offline-Pipelines zur Datenverarbeitung ausführen – die Wahl des richtigen Paradigmas kann die Kosten erheblich senken oder die Leistung steigern.

Funktion Standard Flex Priorität Batch Caching
Preise Standardpreis 50% Rabatt 75% bis 100% mehr als der Standard 50% Rabatt 90% Rabatt + anteilige Speicherung von Tokens
Latenz Sekunden bis Minuten Minuten (Ziel: 1–15 Minuten) Sekunden Bis zu 24 Stunden Schnellere Zeit bis zum ersten Token
Zuverlässigkeit Hoch / Mittel bis hoch Best-Effort-Ansatz (reduzierbar) Hoch (nicht löschbar) Hoch (für Durchsatz) –
Schnittstelle Synchron Synchron Synchron Asynchron Gespeicherter Zustand
Idealer Anwendungsfall Allgemeine Anwendungs-Workflows Nicht dringende sequenzielle Ketten Production, für Nutzer sichtbare Apps Riesige Datasets, Offline-Bewertungen Wiederkehrende Abfragen derselben Datei

Inferenzdienststufen (synchron)

Sie können zwischen zuverlässigkeits- und kostenoptimiertem synchronen Traffic wechseln, indem Sie den Parameter service_tier in Ihren Standardgenerierungsaufrufen übergeben.

Standardinferenz (Standardeinstellung)

Die Standardstufe ist die Standardoption für die sequenzielle Inhaltserstellung. Sie erhalten normale Reaktionszeiten ohne zusätzliche Gebühren oder lange Wartezeiten.

  • Zuverlässigkeit:Standardkritikalität
  • Preis:Standardpreise.
  • Am besten geeignet für:die meisten interaktiven Anwendungen für den täglichen Gebrauch.

Prioritätsinferenz (für Latenz optimiert)

Bei der Verarbeitung mit Priorität werden Ihre Anfragen an Rechenwarteschlangen mit hoher Kritikalität weitergeleitet. Dieser Traffic ist nicht reduzierbar (wird nie durch andere Stufen unterbrochen) und bietet die höchste Zuverlässigkeit. Wenn Sie die dynamischen Prioritätslimits überschreiten, wird die Anfrage vom System auf die Standardverarbeitung herabgestuft, anstatt dass ein Fehler auftritt.

  • Zuverlässigkeit:höchste Kritikalität
  • Preis:75% bis 100% über den Standardpreisen.
  • Am besten geeignet für:Kunden-Chatbots, Betrugserkennung in Echtzeit und geschäftskritische Copiloten.

Flex-Inferenz (kostenoptimiert)

Flex Inference bietet einen Rabatt von 50% im Vergleich zu Standardpreisen, da opportunistische Compute-Kapazität außerhalb der Spitzenzeiten genutzt wird. Anfragen werden synchron verarbeitet. Sie müssen also keinen Code umschreiben, um Batch-Objekte zu verwalten. Da es sich um „sheddable“ Traffic handelt, können Anfragen unterbrochen werden, wenn das System standardmäßige Traffic-Spitzen aufweist.

  • Zuverlässigkeit:Nicht garantiert, unterbrechbare Kritikalität
  • Preis:50% des Standardpreises (Abrechnung pro Token).
  • Optimal für:Agentic Workflows mit mehreren Schritten, bei denen der Aufruf N+1 vom Ergebnis des Aufrufs N, von CRM-Updates im Hintergrund und von Offline-Bewertungen abhängt.

Batch API (Bulk, asynchron)

Die Batch API wurde für die asynchrone Verarbeitung großer Mengen von Anfragen zu 50% der Standardkosten entwickelt. Sie können Anfragen entweder als Inline-Dictionaries oder über eine JSONL-Eingabedatei (bis zu 2 GB) senden. Anfragen werden über Hintergrund-Durchsatzwarteschlangen mit einer angestrebten Bearbeitungszeit von 24 Stunden verarbeitet.

  • Zuverlässigkeit:Kann unterbrochen werden, aber mit automatischen Wiederholungsversuchen alle 24 Stunden und einem Warteschlangensystem
  • Preis:50% des Standardpreises.
  • Am besten geeignet für:Vorverarbeitung großer Datasets, Ausführung regelmäßiger Regressionstest-Suites und Generierung großer Mengen von Bildern oder Einbettungen.

Kontext-Caching (Einsparungen bei der Eingabe)

Kontext-Caching wird verwendet, wenn in kürzeren Anfragen wiederholt auf eine hohe anfängliche Kontextmenge verwiesen wird.

  • Implizites Caching:Automatisch für Gemini 2.5 und neuere Modelle aktiviert. Das System gibt Kosteneinsparungen weiter, wenn Ihre Anfrage auf vorhandene Caches mit gängigen Prompt-Präfixen trifft.
  • Explizites Caching:Sie können manuell ein Cache-Objekt mit einer bestimmten Gültigkeitsdauer (Time-To-Live, TTL) erstellen. Nach der Erstellung verweisen Sie bei nachfolgenden Anfragen auf die im Cache gespeicherten Tokens, um zu vermeiden, dass dieselbe Corpus-Nutzlast wiederholt übergeben wird.
  • Preis:Die Abrechnung erfolgt basierend auf der Anzahl der Cache-Tokens und der Speicherdauer (TTL).
  • Am besten geeignet für:Chatbots mit ausführlichen Systemanweisungen, wiederholte Analysen langer Videodateien oder Abfragen großer Dokumentgruppen.

Kosten für Videoeingabe mit Agent-basierter Verarbeitung senken

Bei langen Videoinhalten kann die agentische Verarbeitung die Kosten für Eingabetokens um bis zu 88% senken und gleichzeitig die Qualität der Antworten verbessern. Anstatt jeden Frame mit 1 FPS zu extrahieren (statische Verarbeitung), sucht das Modell dynamisch im Video und lädt Transkript, Frames und/oder Audio, die für Ihren Prompt relevant sind. Bei kurzen Clips (unter 5 Minuten), bei denen die Latenz entscheidend ist, kann die statische Verarbeitung eine schnellere TTFT (Time to First Token) bieten, da im Agentenmodus interne Begründungen und Tool-Roundtrips erfolgen, bevor die Generierung beginnt.

Wenn Sie die Verarbeitung mit Agenten mit Gemini 3.8 Flash, 3.6 Flash oder 3.5 Flash Lite verwenden möchten, legen Sie processing: "agentic" (Interactions API) oder media_processing: "AGENTIC" (GenerateContent API) für Ihre Videoeingabe fest. Wenn das Modell die Verarbeitung von Agenten nicht unterstützt, wird ein Fehler zurückgegeben.

Hier finden Sie Codebeispiele.