Mit dem Parameter media_resolution wird gesteuert, wie die Gemini API Media-Eingaben wie Bilder, Videos, Audio und PDF-Dokumente verarbeitet. Dazu wird die maximale Anzahl von Tokens für Media-Eingaben festgelegt. So können Sie die Antwortqualität mit Latenz und Kosten in Einklang bringen. Bei visuellen und Dokument-Eingaben wird die Tokenzuweisung basierend auf der Auflösungseinstellung skaliert. Audioeingaben werden dagegen bei allen Auflösungsstufen mit einer festen Rate pro Sekunde tokenisiert. Informationen zu den verschiedenen Einstellungen, Standardwerten und wie sie mit Tokens zusammenhängen, finden Sie im Abschnitt Tokenanzahl.
Sie können die Media-Auflösung für einzelne Media-Objekte (Inhaltselemente) in Ihrer Anfrage konfigurieren (nur Gemini 3).
Auflösung von Medien pro Inhaltselement (nur Gemini 3)
Mit Gemini 3 können Sie die Media-Auflösung für einzelne Media-Objekte in Ihrer Anfrage festlegen und so die Token-Nutzung detailliert optimieren. Sie können Auflösungsstufen in einer einzelnen Anfrage kombinieren. So können Sie beispielsweise für ein komplexes Diagramm eine hohe Auflösung und für ein einfaches Kontextbild eine niedrige Auflösung verwenden.
Python
from google import genai
client = genai.Client()
myfile = client.files.upload(file="path/to/image.jpg")
interaction = client.interactions.create(
model="gemini-3.8-flash",
input=[
{"type": "text", "text": "Describe this image:"},
{
"type": "image",
"uri": myfile.uri,
"mime_type": myfile.mime_type,
"resolution": "high"
}
]
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
async function main() {
const myfile = await ai.files.upload({
file: "path/to/image.jpg",
config: { mime_type: "image/jpeg" },
});
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: [
{ type: "text", text: "Describe this image:" },
{
type: "image",
uri: myfile.uri,
mime_type: myfile.mimeType,
resolution: "high"
}
],
});
console.log(interaction.output_text);
}
await main();
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.Content;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.ImageContent;
import com.google.genai.gaos.models.interactions.ImageContentMimeType;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.TextContent;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
import java.util.Arrays;
import java.util.List;
Client client = new Client();
Content textContent = TextContent.builder().text("Describe the details in this high-resolution image.").build();
Content imageContent =
ImageContent.builder()
.uri("gs://cloud-samples-data/generative-ai/image/scones.jpg")
.mimeType(ImageContentMimeType.IMAGE_JPEG)
.build();
List<Content> contents = Arrays.asList(textContent, imageContent);
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-3.8-flash"))
.input(InteractionsInput.ofContent(contents))
.build();
Interaction interaction =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(interaction.outputText().orElse(""));
REST
# First upload the file using the Files API, then use the URI:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.8-flash",
"input": [
{"type": "text", "text": "Describe this image:"},
{
"type": "image",
"uri": "YOUR_FILE_URI",
"mime_type": "image/jpeg",
"resolution": "high"
}
]
}'
Verfügbare Auflösungswerte
Die Gemini API definiert die folgenden Stufen für die Media-Auflösung:
unspecified: Die Standardeinstellung. Die Anzahl der Tokens für diese Stufe variiert erheblich zwischen Gemini 3 und früheren Gemini-Modellen.low: Geringere Anzahl von Tokens, was zu einer schnelleren Verarbeitung und niedrigeren Kosten führt, aber weniger Details liefert.medium: Ein ausgewogenes Verhältnis zwischen Detailgrad, Kosten und Latenz.high: Höhere Anzahl von Tokens, die dem Modell mehr Details zur Verfügung stellen, was jedoch zu einer höheren Latenz und höheren Kosten führt.ultra_high(nur pro Inhaltselement): Höchste Anzahl an Tokens, die für bestimmte Anwendungsfälle wie die Computernutzung erforderlich ist.
high bietet für die meisten Anwendungsfälle die optimale Leistung.
Die genaue Anzahl der Tokens, die für jede dieser Ebenen generiert werden, hängt sowohl vom Medientyp (Bild, Video, Audio, PDF) als auch von der Modellversion ab.
Tokenanzahl
In den folgenden Tabellen sind die ungefähren Tokenzahlen für jeden media_resolution-Wert und Medientyp pro Modellfamilie zusammengefasst.
Gemini 3-Modelle
| MediaResolution | Bild | Video | Audio | |
|---|---|---|---|---|
unspecified (Standard) |
1.120 | 70 | 25 (pro Sekunde) | 560 |
low |
280 | 70 | 25 (pro Sekunde) | 280 + nativer Text |
medium |
560 | 70 | 25 (pro Sekunde) | 560 + nativer Text |
high |
1.120 | 280 | 25 (pro Sekunde) | 1120 + nativer Text |
ultra_high |
2240 | – | – | – |
Die richtige Auflösung auswählen
- Standard (
unspecified): Beginnen Sie mit der Standardeinstellung. Es ist für die meisten gängigen Anwendungsfälle auf ein gutes Gleichgewicht zwischen Qualität, Latenz und Kosten abgestimmt. low:Für Szenarien, in denen Kosten und Latenz im Vordergrund stehen und detaillierte Informationen weniger wichtig sind.medium/high:Erhöhen Sie die Auflösung, wenn die Aufgabe das Erfassen komplexer Details in den Media erfordert. Das ist oft für komplexe visuelle Analysen, das Lesen von Diagrammen oder das Erfassen von dichten Dokumenten erforderlich.ultra_high: Nur für die Einstellung pro Inhaltselement verfügbar. Empfohlen für bestimmte Anwendungsfälle wie die Verwendung auf einem Computer oder wenn Tests eine deutliche Verbesserung gegenüberhighzeigen.- Steuerung pro Inhaltselement (Gemini 3): Optimiert die Tokennutzung. Verwenden Sie beispielsweise in einem Prompt mit mehreren Bildern
highfür ein komplexes Diagramm undlowodermediumfür einfachere Kontextbilder.
Empfohlene Einstellungen
In den folgenden Listen sind die empfohlenen Einstellungen für die Media-Auflösung für jeden unterstützten Medientyp aufgeführt.
| Medientyp | Empfohlene Einstellung | Maximale Anzahl der Tokens | Usage Guidance |
|---|---|---|---|
| Bilder | high |
1.120 | Für die meisten Bildanalyseaufgaben empfohlen, um maximale Qualität zu gewährleisten. |
| PDFs | medium |
560 | Optimal für das Verständnis von Dokumenten; die Qualität erreicht in der Regel bei medium ein Sättigungsniveau. Eine Erhöhung auf high führt bei Standarddokumenten selten zu besseren OCR-Ergebnissen. |
| Video (Allgemein) | low oder medium |
70 (pro Frame) | Hinweis:Bei Video werden die Einstellungen für low und medium identisch behandelt (70 Tokens), um die Kontextnutzung zu optimieren. Das ist für die meisten Aufgaben zur Aktionserkennung und ‑beschreibung ausreichend. |
| Video (textlastig) | high |
280 (pro Frame) | Nur erforderlich, wenn der Anwendungsfall das Lesen von dichtem Text (OCR) oder kleinen Details in Videoframes umfasst. |
| Audio | unspecified (Standard) |
25 (pro Sekunde) | Audio wird mit einer festen Rate von 25 Tokens pro Sekunde für alle unterstützten Auflösungseinstellungen (unspecified, low, medium und high) tokenisiert. |
Testen und bewerten Sie immer die Auswirkungen verschiedener Auflösungseinstellungen auf Ihre Anwendung, um das beste Verhältnis zwischen Qualität, Latenz und Kosten zu finden.
Beziehung zu Videoverarbeitungsmodi
Mit den media_resolution- und Verarbeitungsparametern werden verschiedene Aspekte der Videoeingabe gesteuert:
- Mit
media_resolutionwird die Auflösung jedes Frames gesteuert (Anzahl der Tokens pro Frame). - Mit den Steuerelementen
processing/media_processingwird festgelegt, welche Inhalte aus dem Video in den Kontext geladen werden.
Du kannst beides für denselben Videoeingang festlegen. Sie können beispielsweise die Verarbeitung durch KI-Agenten mit niedriger Media-Auflösung verwenden, um die Gesamtzahl der Tokens für ein langes Video zu minimieren.
Weitere Informationen zu den Videoverarbeitungsmodi finden Sie im Leitfaden Agentic Video Understanding.
Zusammenfassung der Versionskompatibilität
- Das Festlegen von
resolutionfür einzelne Inhalte ist nur bei Gemini 3-Modellen möglich.
Nächste Schritte
- Weitere Informationen zu den multimodalen Funktionen der Gemini API finden Sie in den Anleitungen zu Bildverständnis, Videoverständnis, Audioverständnis und Dokumentverständnis.