Gemini Robotics ER

Gemini Robotics ER-Modelle (Embodied Reasoning) sind Vision-Language-Modelle (VLMs), mit denen Roboter die physische Welt wahrnehmen und mit ihr interagieren können. Sie interpretieren visuelle Daten, führen räumliche und zeitliche Schlussfolgerungen durch, planen mehrstufige Aufgaben und orchestrieren Roboter und Tools.

Modelle

Das Gemini Robotics ER2-Modell ist das neueste Modell von Gemini Robotics. Es ist unser aktualisiertes Logikmodell, das es Robotern ermöglicht, ihre Umgebung genau zu erfassen. Es ist auf Funktionen für verkörpertes Denken spezialisiert, z. B. die Orchestrierung von Robotern durch Agenten (z. B. mit VLAs), das Verständnis von Robotervideos, einschließlich des Fortschritts und der Erkennung von Erfolgen, das Lesen von Instrumenten, das Zeigen und das räumliche Denken.

Das Gemini Robotics ER2-Modell führt zwei Modellendpunkte ein:

  • gemini-robotics-er-2-preview: Das Standardmodell für erweiterte Reichweite 2. Basiert auf Gemini 3.5 Flash und bietet verbessertes räumliches Denken, das Auffinden von Videomomenten, die Klassifizierung des Videofortschritts, die Orchestrierung mehrerer Roboter und die Nutzung von Tools in mehreren Schritten.
  • gemini-robotics-er-2-streaming-preview: Optimiert für Echtzeit-Streaming über die Live API. Verwenden Sie dieses Modell für Roboter-Agents mit niedriger Latenz, die kontinuierliche Audio- und Videoeingaben verarbeiten.

Wenn Sie Gemini Robotics ER 1.6 verwenden, aktualisieren Sie auf Gemini Robotics ER 2, indem Sie in Ihren API-Aufrufen model="gemini-robotics-er-1.6-preview" durch model="gemini-robotics-er-2-preview" oder model="gemini-robotics-er-2-streaming-preview" ersetzen. Das Modell Gemini Robotics ER 1.6 wird Ende August eingestellt.

Gemini Robotics ER 2 in Google AI Studio ausprobieren

Robotikfunktionen

Gemini Robotics ER unterstützt eine Reihe von Funktionen für verkörpertes Denken. Wählen Sie eine Funktion aus, um mehr zu erfahren:

Funktion Beschreibung Leitfaden
Räumliches Denken Auf Objekte zeigen, sie in Videos verfolgen, mit Begrenzungsrahmen erkennen und Trajektorien planen. Räumliches Denken
Agentic Vision Code-Ausführung nutzen, um andere Funktionen mithilfe von Bildbearbeitungstools zu optimieren Agentic Vision
Aufgabenorchestrierung Kombinieren Sie räumliches Denken mit benutzerdefinierten Roboter-APIs, um Aufgaben mit langer Zeitspanne zu erledigen. Aufgaben-Orchestrierung
Streaming (nur Gemini Robotics ER 2-Streamingendpunkt) Bidirektionales Streaming für Echtzeit-Roboter-Agents mit Funktionsaufrufen mit niedriger Latenz. Streaming für Robotik
Videofortschritt (nur Gemini Robotics ER 2) Momentsuche und Fortschrittsklassifizierung aus kontinuierlichen Videofeeds. Video-Understanding

Erste Schritte

Im folgenden Beispiel werden Objekte in einem Bild gesucht und ihre normalisierten 2D-Koordinaten und Labels zurückgegeben. Sie können diese Ausgabe direkt an eine Robotics API oder ein VLA-Modell übergeben, um Roboteraktionen zu generieren.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

REST

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

Die Ausgabe ist ein JSON-Array mit Objekten, die jeweils ein point (normalisierte [y, x]-Koordinaten) und ein label zur Identifizierung des Objekts enthalten.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

Das folgende Bild zeigt ein Beispiel dafür, wie diese Punkte dargestellt werden können:

Beispiel für die Anzeige der Punkte von Objekten in einem Bild

Funktionsweise

Gemini Robotics ER verarbeitet Bild-, Video- oder Audioeingaben mit Prompts in natürlicher Sprache. Es werden Objekte identifiziert, der Szenenkontext und räumliche Beziehungen werden analysiert und strukturierte Ausgaben wie Koordinaten oder Begrenzungsrahmen werden zurückgegeben.

Gemini Robotics ER ist auch agentisch: Es zerlegt komplexe Aufgaben in Teilaufgaben und führt sie aus, indem es Ihre Roboterfunktionen aufruft oder generierten Code ausführt. Beispiel: „Lege den Apfel in die Schüssel“ wird zu einer Folge von Schritten zum Suchen, Greifen und Platzieren.

Weitere Informationen dazu, wie Gemini Tool-Aufrufe ausführt, finden Sie unter Funktionsaufrufe.

Sicherheit

Gemini Robotics ER wurde zwar mit Blick auf die Sicherheit entwickelt, es liegt jedoch in Ihrer Verantwortung, für eine sichere Umgebung rund um den Roboter zu sorgen. Modelle für generative KI können Fehler machen und physische Roboter können Schäden verursachen. Weitere Informationen finden Sie auf der Google DeepMind-Seite zur Robotersicherheit.

Best Practices

  1. Verwenden Sie eine einfache, natürliche Sprache. Beschreiben Sie, was der Roboter tun soll, so, als würden Sie mit einer Person sprechen. Wenn ein Begriff nicht funktioniert, versuchen Sie es mit einem gängigen Synonym.

  2. Visuelle Eingabe optimieren Schneiden Sie kleine oder unklare Objekte zu oder zoomen Sie sie heran, bevor Sie das Bild senden. Die Beleuchtung und ein geringer Farbkontrast können sich auf die Erkennung auswirken.

  3. Teilen Sie komplexe Aufgaben in Schritte auf. Senden Sie jeden Schritt als separaten Prompt, damit das Modell fokussiert bleibt und die Genauigkeit verbessert wird.

  4. Führen Sie die Abfrage mehrmals aus und bilden Sie den Durchschnitt der Ergebnisse für Aufgaben, die eine hohe Präzision erfordern. Dieser Konsensansatz reduziert die Varianz bei räumlichen Ausgaben.

Beschränkungen

Beachten Sie beim Entwickeln mit Gemini Robotics ER die folgenden Einschränkungen:

  • Einschränkungen für API-Schlüssel:Die Gemini API akzeptiert keine Anfragen von uneingeschränkten API-Schlüsseln und gibt einen 403 Forbidden-Fehler zurück. Sichern Sie Ihren API-Schlüssel, indem Sie in AI Studio Einschränkungen hinzufügen. Weitere Informationen finden Sie unter Uneingeschränkte API-Schlüssel sichern.
  • Latenz im Vergleich zur Leistung:Komplexe Anfragen, Eingaben mit hoher Auflösung oder ein hohes Maß an Denkleistung können zu längeren Verarbeitungszeiten führen. Verwenden Sie für die Denkebene „Mittel“, um ein gutes Gleichgewicht zwischen Latenz und Leistung zu erzielen.
  • Halluzinationen:Wie alle Large Language Models können Gemini Robotics ER-Modelle gelegentlich „halluzinieren“ oder falsche Informationen liefern, insbesondere bei mehrdeutigen Prompts oder Out-of-Distribution-Eingaben.
  • Abhängigkeit von der Promptqualität:Die Qualität der Ausgabe hängt von der Klarheit des Eingabe-Prompts ab. Verwenden Sie spezifische, gut strukturierte Prompts.
  • Rechenkosten:Die Ausführung des Modells, insbesondere mit Videoeingaben oder hohem thinking_budget, verbraucht Rechenressourcen und verursacht Kosten. Weitere Informationen finden Sie auf der Seite Thinking.
  • Eingabetypen:In den folgenden Abschnitten finden Sie Details zu den Einschränkungen für die einzelnen Modi.

Datenschutzhinweise

Sie bestätigen, dass die in diesem Dokument genannten Modelle (die „Robotikmodelle“) Video- und Audiodaten verwenden, um Ihre Hardware gemäß Ihren Anweisungen zu betreiben und zu bewegen. Sie dürfen die Robotikmodelle daher so betreiben, dass Daten von identifizierbaren Personen, z. B. Sprach-, Bild- und Ähnlichkeitsdaten („personenbezogene Daten“), von den Robotikmodellen erhoben werden. Wenn Sie die Robotikmodelle so betreiben, dass personenbezogene Daten erhoben werden, stimmen Sie zu, dass Sie keine identifizierbaren Personen mit den Robotikmodellen interagieren lassen oder sich in der Umgebung der Robotikmodelle aufhalten lassen, es sei denn, diese identifizierbaren Personen wurden ausreichend darüber informiert und haben zugestimmt, dass ihre personenbezogenen Daten an Google weitergegeben und von Google verwendet werden dürfen, wie in den zusätzlichen Nutzungsbedingungen für Gemini API unter https://ai.google.dev/gemini-api/terms (den „Nutzungsbedingungen“) beschrieben, einschließlich gemäß dem Abschnitt „Wie Google Ihre Daten verwendet“. Sie sorgen dafür, dass diese Mitteilung die Erhebung und Nutzung personenbezogener Daten gemäß den Nutzungsbedingungen erlaubt, und unternehmen wirtschaftlich angemessene Anstrengungen, um die Erhebung und Weitergabe personenbezogener Daten zu minimieren, indem Sie Techniken wie das Unkenntlichmachen von Gesichtern verwenden und die Robotikmodelle nach Möglichkeit in Bereichen betreiben, in denen sich keine identifizierbaren Personen aufhalten.

Preise

Detaillierte Informationen zu Preisen und verfügbaren Regionen finden Sie auf der Seite Preise.

Modellendpunkte

Gemini Robotics ER 2 (Vorabversion)

Attribut Beschreibung
Modellcode gemini-robotics-er-2-preview
Unterstützte Datentypen

Eingaben

Text, Bilder, Video, Audio

Ausgabe

Text

Token-Limits[*]

Eingabetokenlimit

131.072

Tokenausgabelimit

65.536

Funktionen

Audiogenerierung

Nicht unterstützt

Caching

Unterstützt

Code-Ausführung

Unterstützt

Computernutzung

Unterstützt

Dateisuche

Unterstützt

Funktionsaufrufe

Unterstützt

Fundierung mit Google Maps

Unterstützt

Bildgenerierung

Nicht unterstützt

Live API

Nicht unterstützt

Suchfundierung

Unterstützt

Strukturierte Ausgaben

Unterstützt

Antwort wird generiert

Unterstützt

URL-Kontext

Unterstützt

Nutzungsoptionen

Batch API

Unterstützt

Flex-Inferenz

Nicht unterstützt

Prioritätsinferenz

Nicht unterstützt

-Versionen
Weitere Informationen finden Sie unter Muster für Modellversionen.
  • Vorschau für: gemini-robotics-er-2-preview
Letzte Aktualisierung Juli 2026
Modellkarte Modellkarte

Gemini Robotics ER 2 – Streaming-Vorabversion

Attribut Beschreibung
Modellcode gemini-robotics-er-2-streaming-preview
Unterstützte Datentypen

Eingaben

Text, Bilder, Video, Audio

Ausgabe

Text

Token-Limits[*]

Eingabetokenlimit

131.072

Tokenausgabelimit

65.536

Funktionen

Audiogenerierung

Nicht unterstützt

Caching

Nicht unterstützt

Code-Ausführung

Nicht unterstützt

Computernutzung

Nicht unterstützt

Dateisuche

Nicht unterstützt

Funktionsaufrufe

Unterstützt

Fundierung mit Google Maps

Nicht unterstützt

Bildgenerierung

Nicht unterstützt

Live API

Unterstützt

Suchfundierung

Unterstützt

Strukturierte Ausgaben

Nicht unterstützt

Antwort wird generiert

Unterstützt

URL-Kontext

Nicht unterstützt

Nutzungsoptionen

Batch API

Nicht unterstützt

Flex-Inferenz

Nicht unterstützt

Prioritätsinferenz

Nicht unterstützt

-Versionen
Weitere Informationen finden Sie unter Muster für Modellversionen.
  • Vorschau für: gemini-robotics-er-2-streaming-preview
Letzte Aktualisierung Juli 2026
Modellkarte Modellkarte

Gemini Robotics ER 1.6 (Vorabversion)

Attribut Beschreibung
Modellcode gemini-robotics-er-1.6-preview
Unterstützte Datentypen

Eingaben

Text, Bilder, Video, Audio

Ausgabe

Text

Token-Limits[*]

Eingabetokenlimit

131.072

Tokenausgabelimit

65.536

Funktionen

Audiogenerierung

Nicht unterstützt

Caching

Unterstützt

Code-Ausführung

Unterstützt

Computernutzung

Unterstützt

Dateisuche

Unterstützt

Funktionsaufrufe

Unterstützt

Fundierung mit Google Maps

Unterstützt

Bildgenerierung

Nicht unterstützt

Live API

Nicht unterstützt

Suchfundierung

Unterstützt

Strukturierte Ausgaben

Unterstützt

Antwort wird generiert

Unterstützt

URL-Kontext

Unterstützt

Nutzungsoptionen

Batch API

Unterstützt

Flex-Inferenz

Nicht unterstützt

Prioritätsinferenz

Nicht unterstützt

-Versionen
Weitere Informationen finden Sie unter Muster für Modellversionen.
  • Vorschau für: gemini-robotics-er-1.6-preview
Letzte Aktualisierung Dezember 2025
Wissensstichtag Januar 2025

Nächste Schritte