Neues bei Gemini 3.5 Flash

3.6 Flash und 3.5 Flash-Lite auf dieser Seite

Gemini 3.5 Flash ist allgemein verfügbar (GA), stabil und bereit für den skalierten Produktionseinsatz. Als unser intelligentestes Flash-Modell bietet es dauerhaft Spitzenleistung bei der agentischen Ausführung, der Programmierung und bei Aufgaben mit langer Ausführungszeit im großen Maßstab.

In diesem Leitfaden finden Sie eine Übersicht über Verbesserungen, API-Änderungen und Migrationsanleitungen für Gemini 3.5 Flash.

Neues Modell

Modell Modell-ID Beschreibung
Gemini 3.5 Flash gemini-3.5-flash Unser bisher intelligentestes Modell für dauerhafte Spitzenleistung bei agentischen und Coding-Aufgaben.

Gemini 3.5 Flash unterstützt das Kontextfenster mit 1 Million Tokens, maximal 65.000 Ausgabetokens, Thinking und dieselben Tools und Plattformfunktionen wie Gemini 3 Flash, einschließlich der Computernutzung (Vorabversion). Die vollständigen Spezifikationen finden Sie in der Modellübersicht. Informationen zu den Preisen finden Sie auf der Preisseite.

Kurzanleitung

In allen Beispielen in diesem Leitfaden wird die GenerateContent API verwendet. Die Interactions API wird ebenfalls unterstützt. Es gelten dieselben Konfigurationsoptionen und Empfehlungen.

Python

from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.5-flash",
    contents="Explain how parallel agentic execution works in three sentences.",
)
print(response.text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

async function main() {
  const response = await ai.models.generateContent({
    model: "gemini-3.5-flash",
    contents: "Explain how parallel agentic execution works in three sentences.",
  });
  console.log(response.text);
}

main();

REST

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{
    "contents": [{
      "parts": [{"text": "Explain how parallel agentic execution works in three sentences."}]
    }]
  }'

Das ist neu

  • Dauerhafte Spitzenleistung:Unser intelligentestes Flash-Modell, optimiert für agentische und Coding-Aufgaben im großen Maßstab.
  • Agentische Ausführung:Bereitstellung von Sub-Agents, Problemlösung und schnelle Agentenschleifen im großen Maßstab.
  • Programmierung:Iterative Coding-Zyklen, schnelle Erkundung und Prototyping zum Testen alternativer Pfade und dynamischen Erkunden von Lösungen.
  • Lange Ausführungszeit:Mehrstufige Workflows und Tool-Nutzung im großen Maßstab.
  • Beibehaltung der Gedankengänge:Das Modell behält die Zwischenschritte der Logik in Mehrfachdialogen automatisch bei. Es sind keine API-Änderungen erforderlich.
  • Neue Standardstufe für den Denkaufwand:Der Standardaufwand für das Thinking wurde von high in medium geändert. Weitere Informationen finden Sie unter Neue Standardstufe für den Denkaufwand.
  • Verbessertes low Thinking: low wurde für Code und agentische Aufgaben, die weniger Schritte erfordern, deutlich verbessert und bietet eine hohe Qualität bei geringerer Latenz und geringeren Kosten.
  • Allgemeine Verfügbarkeit:Stabiles Modell für den skalierten Produktionseinsatz.

Das richtige Flash-Modell auswählen

Gemini 3.5 Flash ist unser intelligentestes und leistungsfähigstes Flash-Modell. Für verschiedene Anwendungsfälle können jedoch unterschiedliche Kosten- und Latenzanforderungen gelten.

  • Gemini 3.1 Flash-Lite: Für kostengünstige Aufgaben mit hohem Volumen, die nicht die erweiterte logische Tiefe von 3.5 Flash erfordern, empfehlen wir die Verwendung von Gemini 3.1 Flash-Lite. Es ist ein stabiles, langfristiges Modell, das auf Effizienz optimiert ist. Weitere Informationen finden Sie im Entwicklerleitfaden für Flash-Lite.
  • Gemini 3 Flash (Vorabversion): Wir empfehlen zwar die Migration zu 3.5 Flash für eine stabile allgemeine Verfügbarkeit und verbesserte logische Schlussfolgerungen, aber Gemini 3 Flash (Vorabversion) bleibt für Entwickler verfügbar, die weiterhin mit dem Vorabmodell testen möchten.

Änderungen beim Verhalten

Neue Standardstufe für den Denkaufwand: medium

Der Standardaufwand für das Thinking ist jetzt medium und wurde von high in Gemini 3 Flash (Vorabversion) geändert. medium liefert sehr gute Ergebnisse für eine Vielzahl von Aufgaben und ist gleichzeitig schneller und kostengünstiger. Bei komplexen Problemen regt high das Modell an, tiefer zu denken.

Aufwand Anwendung
minimal Für Reaktionsgeschwindigkeit optimiert. Chatähnliche Anwendungsfälle, schnelle sachliche Antworten, einfachere Tool-Aufrufe.
low Code- und agentische Aufgaben, die eine geringere Latenz und weniger Schritte erfordern. Eignet sich auch gut für Analyse- und Schreibaufgaben, die etwas Nachdenken erfordern.
medium (Standard) Beste Qualität für die meisten Aufgaben. Empfohlen für komplexe Code- und agentische Anwendungsfälle.
high Maximiert die Fähigkeit des Modells, zu denken und Tools zu verwenden. Am besten geeignet für komplexe logische Schlussfolgerungen, schwierige mathematische Aufgaben und die schwierigsten Code- oder agentischen Aufgaben. Ermöglicht erweiterte Überlegungen und Funktionsaufrufe.

Wenn Sie die Standardeinstellung überschreiben möchten, legen Sie thinking_level in der Konfiguration fest:

Python

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.5-flash",
    contents="Prove that the square root of 2 is irrational.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

async function main() {
  const response = await ai.models.generateContent({
    model: "gemini-3.5-flash",
    contents: "Prove that the square root of 2 is irrational.",
    config: {
      thinkingConfig: {
        thinkingLevel: "HIGH",
      },
    },
  });
  console.log(response.text);
}

main();

REST

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{
    "contents": [{
      "parts": [{"text": "Prove that the square root of 2 is irrational."}]
    }],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "HIGH"
      }
    }
  }'

In der folgenden Tabelle ist aufgeführt, welche Denkaufwände pro Modell unterstützt werden:

Denkaufwand Gemini 3.5 Flash Gemini 3.1. Pro Gemini 3.1 Flash-Lite Gemini 3 Flash Beschreibung
minimal Unterstützt Nicht unterstützt Unterstützt (Standard) Unterstützt Entspricht der Einstellung „Kein Thinking“ für die meisten Abfragen. Hinweis: minimal garantiert nicht, dass das Thinking deaktiviert ist. Das Modell kann bei komplexen Aufgaben sehr wenig nachdenken.
low Unterstützt Unterstützt Unterstützt Unterstützt Minimiert Latenz und Kosten.
medium Unterstützt (Standard) Unterstützt Unterstützt Unterstützt Ausgewogenes Thinking für die meisten Aufgaben.
high Unterstützt (dynamisch) Unterstützt (Standard, dynamisch) Unterstützt (dynamisch) Unterstützt (Standard, dynamisch) Maximiert die Tiefe der logischen Schlussfolgerungen.

Fortführung der Logikschritte

Das Modell behält die Zwischenschritte der Logik in Mehrfachdialogen automatisch bei. Wenn der Kontext der logischen Schlussfolgerungen im Unterhaltungsverlauf vorhanden ist, wird er weitergegeben, was die Leistung bei komplexen mehrstufigen Aufgaben wie dem iterativen Debugging und der Code-Refaktorierung verbessert. Es sind keine API-Änderungen erforderlich:

  • Interactions API: Die Logikschritte werden bereits automatisch beibehalten. Keine Änderung des Verhaltens.
  • GenerateContent API: Ab Gemini 3.5 Flash verwendet das Modell den Kontext der logischen Schlussfolgerungen aus allen vorherigen Schritten, wenn im Unterhaltungsverlauf Gedankensignaturen vorhanden sind. Übergeben Sie dazu den vollständigen, unveränderten Unterhaltungsverlauf (einschließlich Gedankensignaturen) in contents. Die SDKs erledigen das automatisch.

Parameteraktualisierungen und Best Practices in Gemini 3.x

Die folgenden Punkte gelten für alle Gemini 3.x-Modelle, einschließlich Gemini 3.5 Flash.

  • temperature, top_p, top_k: Wir empfehlen dringend, die Standardwerte nicht zu ändern. Die logischen Schlussfolgerungen von Gemini 3 sind für die Standardeinstellungen optimiert.
  • Verwenden Sie thinking_level anstelle von thinking_budget.
  • Abgleich von Funktionsaufrufantworten: id, name und die Anzahl der Antworten müssen mit den vorherigen Aufrufen übereinstimmen.
  • Multimodale Funktionsantworten: Multimodale Inhalte müssen in die Funktionsantwort aufgenommen werden, nicht außerhalb.
  • Inline-Anweisungen in Funktionsantworten: An den Text der Funktion antwort anhängen, nicht als separate Teile.
  • Unnötige Tool-Aufrufe reduzieren: Verwenden Sie niedrigere Denkaufwände oder experimentieren Sie mit Systemanweisungen, um Tool-Aufrufe in agentischen Workflows zu reduzieren.

In den folgenden Abschnitten erfahren Sie, wie Sie Ihren Code aktualisieren.

Sampling-Parameter (nicht mehr empfohlen)

temperature, top_p und top_k werden für alle Gemini 3.x-Modelle nicht mehr empfohlen. Die logischen Schlussfolgerungen von Gemini 3 sind für die Standardeinstellungen optimiert. Entfernen Sie diese Parameter aus allen Anfragen.

# ⚠️ Remove these parameters (not recommended)
config = types.GenerateContentConfig(
    temperature=0.7,
    top_p=0.9,
    top_k=40
)

Um den Determinismus zu gewährleisten, empfehlen wir, eine Systemanweisung mit expliziten Regeln für Ihren spezifischen Anwendungsfall zu definieren.

thinking_budget (nicht mehr empfohlen)

Der numerische Parameter thinking_budget wird für alle Gemini 3.x-Modelle nicht mehr empfohlen. Verwenden Sie stattdessen die String-Enum thinking_level.

# ⚠️ Before (not recommended)
config = types.GenerateContentConfig(
    thinking_config=types.ThinkingConfig(thinking_budget=7500)
)

# ✅ After
config = types.GenerateContentConfig(
    thinking_config=types.ThinkingConfig(thinking_level="medium")
)

Verfügbare Werte: minimal, low, medium (Standard) und high.

Funktionsaufrufe: Strikter Abgleich von Antworten

Die Interactions API gibt bereits Fehler bei nicht übereinstimmenden Funktionsantworten zurück. Die GenerateContent API gibt noch keine Fehler zurück, aber bei nicht übereinstimmenden Antworten gibt das Modell in den meisten Fällen leere Antworten mit finish_reason: STOP zurück. Beachten Sie immer die folgenden Konventionen:

Anforderung Details
id einfügen Jede FunctionResponse muss die id aus dem entsprechenden FunctionCall enthalten.
name abgleichen Der name in der Antwort muss mit dem name im Aufruf übereinstimmen.
Anzahlen abgleichen Geben Sie für jeden empfangenen FunctionCall genau eine FunctionResponse zurück.

Python

# ✅ Include matching id and name in the function response
final_response = client.models.generate_content(
    model="gemini-3.5-flash",
    config=config,
    contents=[
        *previous_contents,
        response.candidates[0].content,
        types.Content(role="user", parts=[
            types.Part.from_function_response(
                name=tool_call.name,
                response={"result": result},
                id=tool_call.id,
            )
        ]),
    ],
)

JavaScript

// ✅ Include matching id and name in the function response
const functionResponsePart = {
  functionResponse: {
    name: toolCall.name,
    response: { result: result },
    id: toolCall.id,
  },
};

const finalResponse = await ai.models.generateContent({
  model: "gemini-3.5-flash",
  contents: [
    ...previousContents,
    { role: "model", parts: [{ functionCall: toolCall }] },
    { role: "user", parts: [functionResponsePart] },
  ],
  config: config,
});

REST

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{
    "contents": [
      {"role": "user", "parts": [{"text": "..."}]},
      {"role": "model", "parts": [{"functionCall": {"name": "my_function", "args": {...}}}]},
      {"role": "user", "parts": [{"functionResponse": {"name": "my_function", "id": "call_id", "response": {"result": "..."}}}]}
    ]
  }'

Multimodale Funktionsantworten

Wir stellen häufig fest, dass Kunden Bilder außerhalb der Funktionsantwort bereitstellen. Dies kann zu unerwartetem Modellverhalten (z.B. Thought Leakage) und zu Ausgaben von geringerer Qualität führen. Folgen Sie stattdessen der Empfehlung in der API-Dokumentation zu multimodalen Funktionsantworten und fügen Sie multimodale Inhalte in die Teile der Funktionsantwort ein, die Sie an das Modell senden. Das Modell kann diese multimodalen Inhalte im nächsten Schritt verarbeiten, um eine fundiertere Antwort zu geben.

Python

# ✅ Include multimodal content in the function response
final_response = client.models.generate_content(
    model="gemini-3.5-flash",
    config=config,
    contents=[
        *previous_contents,
        response.candidates[0].content,
        types.Content(role="user", parts=[
            types.Part.from_function_response(
                name=tool_call.name,
                response={
                    "result": "instrument.jpg",
                    "image": base64_image_data,
                },
                id=tool_call.id,
            )
        ]),
    ],
)

JavaScript

// ✅ Include multimodal content in the function response
const finalResponse = await ai.models.generateContent({
  model: "gemini-3.5-flash",
  contents: [
    ...previousContents,
    { role: "model", parts: [{ functionCall: toolCall }] },
    {
      role: "user",
      parts: [{
        functionResponse: {
          name: toolCall.name,
          id: toolCall.id,
          response: {
            result: "instrument.jpg",
            image: base64ImageData,
          },
        },
      }],
    },
  ],
  config: config,
});

Inline-Anweisungen in Funktionsantworten

Wir stellen häufig fest, dass Kunden zusätzliche Anweisungen zusammen mit Funktionsantworten als nachfolgende Parts bereitstellen. Dies kann zu unerwartetem Modellverhalten (z.B. Thought Leakage) und zu Ausgaben von geringerer Qualität führen. Hängen Sie stattdessen alle zusätzlichen Anweisungen mit zwei Zeilenumbrüchen getrennt an das Ende des Texts der Funktionsantwort an.

Python

# ✅ Append inline instructions to the end of the function response separated by two newlines
result_text = f"{json.dumps(result)}\n\n<your inline instructions>"

final_response = client.models.generate_content(
    model="gemini-3.5-flash",
    config=config,
    contents=[
        *previous_contents,
        response.candidates[0].content,
        types.Content(role="user", parts=[
            types.Part.from_function_response(
                name=tool_call.name,
                response={"result": result_text},
                id=tool_call.id,
            )
        ]),
    ],
)

JavaScript

// ✅ Append inline instructions to the end of the function response separated by two newlines
const resultText = `${JSON.stringify(result)}\n\n<your inline instructions>`;

const finalResponse = await ai.models.generateContent({
  model: "gemini-3.5-flash",
  contents: [
    ...previousContents,
    { role: "model", parts: [{ functionCall: toolCall }] },
    {
      role: "user",
      parts: [{
        functionResponse: {
          name: toolCall.name,
          id: toolCall.id,
          response: { result: resultText },
        },
      }],
    },
  ],
  config: config,
});

Unnötige Tool-Aufrufe reduzieren

Wenn Sie feststellen, dass zu viele Tool-Aufrufe erfolgen, können Sie mit zwei Techniken die Anzahl reduzieren:

  1. Reduzieren Sie zuerst den Denkaufwand (medium, low oder minimal). Höhere Denkaufwände regen das Modell an, mehr Tools zu verwenden, um Informationen zu suchen und zu überprüfen. Wenn Sie den Aufwand reduzieren, können Sie die Anzahl der Tool-Aufrufe verringern.

  2. Fügen Sie eine Systemanweisung hinzu:Wenn die übermäßige Nutzung nach dem Anpassen des Denkaufwands weiterhin besteht, können Sie einen Prompt verwenden, der die Tool-Nutzung einschränkt. Beispiel:

    You have a limited action budget of <n> tool calls. Use them efficiently.
    

Checkliste für die Migration

Von Gemini 3 Flash (Vorabversion) migrieren

  • Modellnamen aktualisieren: gemini-3-flash-previewgemini-3.5-flash
  • Preise prüfen. Gemini 3.5 Flash ist teurer als Gemini 3 Flash (Vorabversion). Wenn Ihr Anwendungsfall sehr kostensensibel ist, sollten Sie stattdessen zu Gemini 3.1 Flash-Lite migrieren. Weitere Informationen zu den Preisen erhalten Sie auf der Preisseite.
  • Entfernen Sie temperature, top_p und top_k aus der Konfiguration (nicht mehr empfohlen).
  • Ersetzen Sie thinking_budget durch thinking_level.
  • Fügen Sie allen FunctionResponse-Teilen id und den entsprechenden name hinzu.
  • Testen Sie Ihre Prompts. Der Standardaufwand wurde von high in medium geändert. Überprüfen Sie Qualität, Geschwindigkeit und Kosten.
  • Die Fortführung der Logikschritte ist jetzt standardmäßig aktiviert. Der Kontext der logischen Schlussfolgerungen wird über mehrere Schritte hinweg weitergegeben, was die Leistung verbessert, aber die Token-Nutzung erhöhen kann.
  • Reduzieren Sie unnötige Tool-Aufrufe: Reduzieren Sie zuerst den Denkaufwand (medium, low oder minimal). Fügen Sie eine Systemanweisung hinzu, um die Tool-Nutzung einzuschränken, wenn die übermäßige Nutzung weiterhin besteht.
  • Die Computernutzung wird unterstützt.

Von Gemini 2.5 migrieren

Alle oben genannten Punkte plus:

  • Prompts vereinfachen. Wenn Sie die Prompt-Technik „Chain of Thought“ verwendet haben, um logische Schlussfolgerungen zu erzwingen, versuchen Sie stattdessen thinking_level: "medium" oder "high" mit einfacheren Prompts.
  • Testen Sie PDF- und Media-Arbeitslasten. Wenn Sie sich auf ein bestimmtes Verhalten für die Analyse umfangreicher Dokumente verlassen haben, testen Sie die Einstellung media_resolution_high, um die Genauigkeit zu gewährleisten. Durch die Migration zu den Standardeinstellungen von Gemini 3 kann sich auch die Token-Nutzung für PDFs erhöhen, für Videos jedoch verringern. Wenn Anfragen das Kontextfenster überschreiten, reduzieren Sie explizit die media_resolution. Weitere Informationen finden Sie in der Dokumentation zur Media-Auflösung.
  • Kombinierte Tool-Nutzung nutzen. Google Suche, URL-Kontext, Codeausführung und benutzerdefinierte Funktionen können in derselben Anfrage verwendet werden.
  • Wenn Sie multimodale Funktionsantworten verwenden, verschieben Sie multimodale Inhalte in die Teile der Funktionsantwort, nicht daneben.
  • Wenn Sie Inline-Anweisungen mit Funktionsantworten verwenden, hängen Sie sie mit zwei Zeilenumbrüchen getrennt an den Text der Funktionsantwort an, nicht als separate Teile.
  • Die Bildsegmentierung wird in Gemini 3.x nicht unterstützt. Verwenden Sie für Segmentierungsarbeitslasten weiterhin Gemini 2.5 Flash mit deaktiviertem Thinking oder Gemini Robotics ER 2.
  • Entfernen Sie candidate_count aus der Konfiguration (wird in Gemini 3.x nicht unterstützt).

Funktionen der Gemini 3-Familie

Gemini 3.5 Flash übernimmt alle Funktionen der Gemini 3-Familie, einschließlich der Computernutzung. In Gemini 3 eingeführte Funktionen, die weiterhin verfügbar sind:

  • Thinking: Verschlüsselter Kontext der logischen Schlussfolgerungen, der über API-Aufrufe hinweg beibehalten wird. Automatisch in der Interactions API, implizit in GenerateContent.
  • Strukturierte Ausgaben mit Tools: Kombinieren Sie den JSON-Modus mit integrierten Tools (Suche, URL-Kontext, Codeausführung, Funktionsaufrufe).
  • Multimodale Funktionsantworten: Geben Sie Bilder, Audio und andere Medien in den Ergebnissen von Funktionsaufrufen zurück.
  • Code-Ausführung mit Bildern: Führen Sie Code aus, der Bilder verarbeitet und generiert.
  • Kombinierte Tool-Nutzung: Verwenden Sie integrierte Tools und benutzerdefinierte Funktionsaufrufe in derselben Anfrage.
  • Medienauflösung: Detaillierte Kontrolle über die Token-Zuweisung für Bild-, Video- und PDF-Eingaben. Gemini 3-Modelle unterstützen Auflösungseinstellungen pro Inhaltselement (low, medium, high, ultra_high) für Prompts mit unterschiedlicher Qualität.
  • Gedankensignaturen: Verschlüsselte Darstellungen der internen logischen Schlussfolgerungen des Modells. Erforderlich für Mehrfachdialog-Funktionsaufrufe, werden automatisch von den offiziellen SDKs verwaltet.

Best Practices für Prompts

Gemini 3.x-Modelle sind Modelle für logische Schlussfolgerungen, was sich auf die Art und Weise auswirkt, wie Sie Prompts erstellen sollten.

  • Präzise Anweisungen:Fassen Sie sich kurz. Gemini 3.x reagiert am besten auf direkte, klare Anweisungen. Ausführliche oder komplexe Prompt-Techniken, die für ältere Modelle entwickelt wurden, können dazu führen, dass das Modell zu viel analysiert.
  • Ausführlichkeit der Ausgabe:Standardmäßig ist Gemini 3.x weniger ausführlich und bevorzugt direkte, effiziente Antworten. Wenn für Ihren Anwendungsfall ein konversationeller Ton erforderlich ist, steuern Sie das Modell explizit in Ihrem Prompt (z. B. „Erkläre das als freundlicher, gesprächiger Assistent“).
  • Kontextverwaltung:Wenn Sie mit großen Datasets arbeiten (z. B. ganze Bücher, Codebasen oder lange Videos), platzieren Sie Ihre spezifischen Anweisungen oder Fragen am Ende des Prompts, nach dem Datenkontext. Verankern Sie die logischen Schlussfolgerungen des Modells, indem Sie Ihre Frage mit einer Formulierung wie „Basierend auf den vorherigen Informationen…“ beginnen.

Weitere Informationen zu Strategien für das Design von Prompts finden Sie im Leitfaden zum Prompt Engineering.

Beschränkungen

  • Die Bildsegmentierung wird in Gemini 3.x nicht unterstützt. Verwenden Sie für Segmentierungs arbeitslasten weiterhin Gemini 2.5 Flash mit deaktiviertem Thinking oder Gemini Robotics ER 2.

FAQ

  1. Was ist der Wissensstand von Gemini 3.5 Flash? Gemini 3.5 Flash hat einen Wissensstand von Januar 2025. Aktuellere Informationen finden Sie mit dem Tool zur Suche nach Grounding-Informationen.

  2. Was sind die Grenzwerte für das Kontextfenster? Gemini 3.5 Flash unterstützt ein Kontextfenster für Eingaben mit 1 Million Tokens und bis zu 65.000 Ausgabetokens.

  3. Funktioniert mein alter thinking_budget Code noch? Ja, thinking_budget wird aus Gründen der Abwärtskompatibilität weiterhin unterstützt. Wir empfehlen jedoch die Migration zu thinking_level, um eine besser vorhersagbare Leistung zu erzielen. Verwenden Sie nicht beide in derselben Anfrage.

  4. Unterstützt Gemini 3.5 Flash die Batch API? Ja. Weitere Informationen finden Sie im Leitfaden zur Batch API.

  5. Wird Kontext-Caching unterstützt? Ja, Kontext-Caching wird unterstützt.

  6. Welche Tools werden unterstützt? Gemini 3.5 Flash unterstützt die Google Suche, Fundierung mit Google Maps, die Dateisuche, die Code-Ausführung, den URL Context und Standard-Funktionsaufrufe, einschließlich der kombinierten Tool-Nutzung und der Computernutzung.

Nächste Schritte