Gemini Robotics ER

Los modelos de Gemini Robotics ER (razonamiento incorporado) son modelos de lenguaje de visión (VLM) que permiten a los robots percibir el mundo físico e interactuar con él. Interpretan datos visuales, realizan razonamiento espacial y temporal, planifican tareas de varios pasos y organizan robots y herramientas.

Modelos

El modelo Gemini Robotics ER 2 es el más reciente de Gemini Robotics. Es nuestro modelo de razonamiento actualizado que permite a los robots comprender su entorno con precisión. Se especializa en capacidades de razonamiento incorporado, como la orquestación de agentes de robots (p.ej., con VLA), la comprensión de videos de robots, incluida la comprensión del progreso y la detección de éxito, la lectura de instrumentos, el señalamiento y el razonamiento espacial.

El modelo Gemini Robotics ER 2 presenta dos extremos de modelos:

  • gemini-robotics-er-2-preview: Es el modelo estándar de ER 2. Se basa en Gemini 3.5 Flash con razonamiento espacial mejorado, búsqueda de momentos en videos, clasificación del progreso de los videos, coordinación de varios robots y uso de herramientas en varios pasos.
  • gemini-robotics-er-2-streaming-preview: Se optimizó para la transmisión en tiempo real a través de la API de Live. Usa este modelo para agentes robóticos de baja latencia que procesan entrada continua de audio y video.

Si usas Gemini Robotics ER 1.6, actualiza a Gemini Robotics ER 2 reemplazando model="gemini-robotics-er-1.6-preview" por model="gemini-robotics-er-2-preview" o model="gemini-robotics-er-2-streaming-preview" en tus llamadas a la API. Ten en cuenta que el modelo Gemini Robotics ER 1.6 se cerrará a fines de agosto.

Prueba Gemini Robotics ER 2 en Google AI Studio

Capacidades de robótica

Gemini Robotics ER admite una variedad de capacidades de razonamiento incorporado. Selecciona una capacidad para obtener más información:

Función Descripción Guía
Razonamiento espacial Señalar objetos, hacer un seguimiento de ellos en videos, detectarlos con cuadros de límite y planificar trayectorias Razonamiento espacial
Visión de agentes Usar la ejecución de código para mejorar otras capacidades aprovechando las herramientas de manipulación de imágenes Visión de agente
Organización de tareas Combina el razonamiento espacial con las APIs de robots personalizadas para completar tareas de largo alcance. Organización de tareas
Transmisión (solo extremo de transmisión de Gemini Robotics ER 2) Transmisión bidireccional para agentes robóticos en tiempo real con llamadas a funciones de baja latencia. Transmisión para robótica
Progreso del video (solo en Gemini Robotics ER 2) Búsqueda de momentos y clasificación del progreso a partir de transmisiones de video continuas. Comprensión de videos

Cómo comenzar

En el siguiente ejemplo, se buscan objetos en una imagen y se muestran sus etiquetas y coordenadas 2D normalizadas. Puedes pasar este resultado directamente a una API de robótica o a un modelo de VLA para generar acciones del robot.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

REST

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

El resultado será un array JSON que contiene objetos, cada uno con un point (coordenadas [y, x] normalizadas) y un label que identifica el objeto.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

En la siguiente imagen, se muestra un ejemplo de cómo se pueden mostrar estos puntos:

Un ejemplo que muestra los puntos de los objetos en una imagen

Cómo funciona

La ER de Gemini Robotics toma entradas de imagen, video o audio con instrucciones en lenguaje natural. Identifica objetos, razona sobre el contexto de la escena y las relaciones espaciales, y devuelve resultados estructurados, como coordenadas o cuadros delimitadores.

El ER de Gemini Robotics también es agentic: divide las tareas complejas en subtareas y las ejecuta llamando a las funciones de tu robot o ejecutando el código generado. Por ejemplo, "pon la manzana en el tazón" se convierte en una secuencia de pasos de ubicar, agarrar y colocar.

Consulta Llamada a funciones para obtener detalles sobre cómo Gemini ejecuta las llamadas a herramientas.

Seguridad

Si bien el ER de Gemini Robotics se creó pensando en la seguridad, es tu responsabilidad mantener un entorno seguro alrededor del robot. Los modelos de IA generativa pueden cometer errores, y los robots físicos pueden causar daños. Para obtener más información, visita la página de seguridad de robótica de Google DeepMind.

Prácticas recomendadas

  1. Usa un lenguaje natural y sencillo. Describe lo que quieres que haga el robot como si se lo dijeras a una persona. Si un término no funciona, prueba con un sinónimo común.

  2. Optimiza la entrada visual. Recorta o acerca los objetos pequeños o poco claros antes de enviar la imagen. La iluminación y el bajo contraste de color pueden afectar la detección.

  3. Divide las tareas complejas en pasos. Envía cada paso como una instrucción separada para mantener el enfoque del modelo y mejorar la precisión.

  4. Realiza consultas varias veces y calcula el promedio de los resultados para tareas de alta precisión. Este enfoque de consenso reduce la varianza en los resultados espaciales.

Limitaciones

Ten en cuenta las siguientes limitaciones cuando desarrolles con Gemini Robotics ER:

  • Restricciones de la clave de API: La API de Gemini no acepta solicitudes de claves de API sin restricciones y devuelve un error 403 Forbidden. Protege tu clave de API agregando restricciones en AI Studio. Consulta Protege las claves de API sin restricciones para obtener más detalles.
  • Latencia vs. rendimiento: Las consultas complejas, las entradas de alta resolución o los niveles de pensamiento altos pueden aumentar los tiempos de procesamiento. Para el nivel de pensamiento, usa medio para lograr un buen equilibrio entre la latencia y el rendimiento.
  • Alucinaciones: Al igual que todos los modelos de lenguaje grandes, los modelos de ER de Gemini Robotics pueden "alucinar" ocasionalmente o proporcionar información incorrecta, en especial para las instrucciones ambiguas o las entradas fuera de la distribución.
  • Dependencia de la calidad de la instrucción: La calidad del resultado depende de la claridad de la instrucción de entrada. Usa instrucciones específicas y bien estructuradas.
  • Costo de procesamiento: Ejecutar el modelo, en especial con entradas de video o un valor de thinking_budget alto, consume recursos de procesamiento y genera costos. Consulta la página Thinking para obtener más detalles.
  • Tipos de entrada: Consulta los siguientes temas para obtener detalles sobre las limitaciones de cada modo.

Aviso de privacidad

Reconoces que los modelos a los que se hace referencia en este documento (los "Modelos de Robótica") aprovechan los datos de audio y video para operar y mover tu hardware de acuerdo con tus instrucciones. Por lo tanto, es posible que opere los Modelos Robóticos de manera tal que estos recopilen datos de personas identificables, como datos de voz, imágenes y similitud ("Datos Personales"). Si decides operar los Modelos Robóticos de una manera que recopile Datos Personales, aceptas que no permitirás que ninguna persona identificable interactúe con los Modelos Robóticos ni esté presente en el área que los rodea, a menos que y hasta que se les haya notificado de manera suficiente y hayan dado su consentimiento para que Google pueda proporcionar y usar sus Datos Personales según se describe en las Condiciones del Servicio Adicionales de la API de Gemini que se encuentran en https://ai.google.dev/gemini-api/terms (las "Condiciones"), incluso de acuerdo con la sección titulada "Cómo usa Google tus datos". Te asegurarás de que dicho aviso permita la recopilación y el uso de Datos Personales según se describe en las Condiciones, y realizarás esfuerzos comercialmente razonables para minimizar la recopilación y distribución de Datos Personales con técnicas como el desenfoque de rostros y el funcionamiento de los Modelos de Robótica en áreas que no contengan personas identificables en la medida en que sea posible.

Precios

Para obtener información detallada sobre los precios y las regiones disponibles, consulta la página de precios.

Extremos de modelos

Versión preliminar de Gemini Robotics ER 2

Propiedad Descripción
Código del modelo gemini-robotics-er-2-preview
Tipos de datos admitidos

Entradas

Texto, imágenes, video y audio

Resultado

Texto

Límites de tokens[*]

Límite de tokens de entrada

131,072

Límite de tokens de salida

65,536

Funciones

Generación de audio

No compatible

Almacenamiento en caché

Admitido

Ejecución de código

Admitido

Uso de la computadora

Admitido

Búsqueda de archivos

Admitido

Llamada a función

Admitido

Fundamentación con Google Maps

Admitido

Generación de imágenes

No compatible

API de Live

No compatible

Fundamentación con la Búsqueda

Admitido

Resultados estructurados

Admitido

Pensamiento

Admitido

Contexto de la URL

Admitido

Opciones de consumo

API de Batch

Admitido

Inferencia flexible

No compatible

Inferencia de prioridad

No compatible

Versiones de
Lee los patrones de versiones del modelo para obtener más detalles.
  • Vista previa: gemini-robotics-er-2-preview
Última actualización Julio de 2026
Ficha del modelo de Ficha del modelo

Versión preliminar de transmisión de Gemini Robotics ER 2

Propiedad Descripción
Código del modelo gemini-robotics-er-2-streaming-preview
Tipos de datos admitidos

Entradas

Texto, imágenes, video y audio

Resultado

Texto

Límites de tokens[*]

Límite de tokens de entrada

131,072

Límite de tokens de salida

65,536

Funciones

Generación de audio

No compatible

Almacenamiento en caché

No compatible

Ejecución de código

No compatible

Uso de la computadora

No compatible

Búsqueda de archivos

No compatible

Llamada a función

Admitido

Fundamentación con Google Maps

No compatible

Generación de imágenes

No compatible

API de Live

Admitido

Fundamentación con la Búsqueda

Admitido

Resultados estructurados

No compatible

Pensamiento

Admitido

Contexto de la URL

No compatible

Opciones de consumo

API de Batch

No compatible

Inferencia flexible

No compatible

Inferencia de prioridad

No compatible

Versiones de
Lee los patrones de versiones del modelo para obtener más detalles.
  • Vista previa: gemini-robotics-er-2-streaming-preview
Última actualización Julio de 2026
Ficha del modelo de Ficha del modelo

Versión preliminar de Gemini Robotics ER 1.6

Propiedad Descripción
Código del modelo gemini-robotics-er-1.6-preview
Tipos de datos admitidos

Entradas

Texto, imágenes, video y audio

Resultado

Texto

Límites de tokens[*]

Límite de tokens de entrada

131,072

Límite de tokens de salida

65,536

Funciones

Generación de audio

No compatible

Almacenamiento en caché

Admitido

Ejecución de código

Admitido

Uso de la computadora

Admitido

Búsqueda de archivos

Admitido

Llamada a función

Admitido

Fundamentación con Google Maps

Admitido

Generación de imágenes

No compatible

API de Live

No compatible

Fundamentación con la Búsqueda

Admitido

Resultados estructurados

Admitido

Pensamiento

Admitido

Contexto de la URL

Admitido

Opciones de consumo

API de Batch

Admitido

Inferencia flexible

No compatible

Inferencia de prioridad

No compatible

Versiones de
Lee los patrones de versiones del modelo para obtener más detalles.
  • Vista previa: gemini-robotics-er-1.6-preview
Última actualización Diciembre de 2025
Fecha límite de conocimiento Enero de 2025

¿Qué sigue?