Los modelos de Gemini Robotics ER (razonamiento incorporado) son modelos de lenguaje de visión (VLM) que permiten a los robots percibir el mundo físico e interactuar con él. Interpretan datos visuales, realizan razonamiento espacial y temporal, planifican tareas de varios pasos y organizan robots y herramientas.
Modelos
El modelo Gemini Robotics ER 2 es el más reciente de Gemini Robotics. Es nuestro modelo de razonamiento actualizado que permite a los robots comprender su entorno con precisión. Se especializa en capacidades de razonamiento incorporado, como la orquestación de agentes de robots (p.ej., con VLA), la comprensión de videos de robots, incluida la comprensión del progreso y la detección de éxito, la lectura de instrumentos, el señalamiento y el razonamiento espacial.
El modelo Gemini Robotics ER 2 presenta dos extremos de modelos:
gemini-robotics-er-2-preview: Es el modelo estándar de ER 2. Se basa en Gemini 3.5 Flash con razonamiento espacial mejorado, búsqueda de momentos en videos, clasificación del progreso de los videos, coordinación de varios robots y uso de herramientas en varios pasos.gemini-robotics-er-2-streaming-preview: Se optimizó para la transmisión en tiempo real a través de la API de Live. Usa este modelo para agentes robóticos de baja latencia que procesan entrada continua de audio y video.
Si usas Gemini Robotics ER 1.6, actualiza a Gemini Robotics ER 2 reemplazando model="gemini-robotics-er-1.6-preview" por model="gemini-robotics-er-2-preview" o model="gemini-robotics-er-2-streaming-preview" en tus llamadas a la API. Ten en cuenta que el modelo Gemini Robotics ER 1.6 se cerrará a fines de agosto.
Prueba Gemini Robotics ER 2 en Google AI Studio
Capacidades de robótica
Gemini Robotics ER admite una variedad de capacidades de razonamiento incorporado. Selecciona una capacidad para obtener más información:
| Función | Descripción | Guía |
|---|---|---|
| Razonamiento espacial | Señalar objetos, hacer un seguimiento de ellos en videos, detectarlos con cuadros de límite y planificar trayectorias | Razonamiento espacial |
| Visión de agentes | Usar la ejecución de código para mejorar otras capacidades aprovechando las herramientas de manipulación de imágenes | Visión de agente |
| Organización de tareas | Combina el razonamiento espacial con las APIs de robots personalizadas para completar tareas de largo alcance. | Organización de tareas |
| Transmisión (solo extremo de transmisión de Gemini Robotics ER 2) | Transmisión bidireccional para agentes robóticos en tiempo real con llamadas a funciones de baja latencia. | Transmisión para robótica |
| Progreso del video (solo en Gemini Robotics ER 2) | Búsqueda de momentos y clasificación del progreso a partir de transmisiones de video continuas. | Comprensión de videos |
Cómo comenzar
En el siguiente ejemplo, se buscan objetos en una imagen y se muestran sus etiquetas y coordenadas 2D normalizadas. Puedes pasar este resultado directamente a una API de robótica o a un modelo de VLA para generar acciones del robot.
Python
from google import genai
from google.genai import types
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
response = client.models.generate_content(
model="gemini-robotics-er-2-preview",
contents=[
types.Part.from_uri(
file_uri=uploaded_file.uri,
mime_type=uploaded_file.mime_type
),
PROMPT
],
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high")
),
)
print(response.text)
REST
# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"inlineData": {
"mimeType": "image/png",
"data": "'"${IMAGE_BASE64}"'"
}
},
{
"text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "high"
}
}
}'
El resultado será un array JSON que contiene objetos, cada uno con un point (coordenadas [y, x] normalizadas) y un label que identifica el objeto.
JSON
[
{"point": [376, 508], "label": "small banana"},
{"point": [287, 609], "label": "larger banana"},
{"point": [223, 303], "label": "pink starfruit"},
{"point": [435, 172], "label": "paper bag"},
{"point": [270, 786], "label": "green plastic bowl"},
{"point": [488, 775], "label": "metal measuring cup"},
{"point": [673, 580], "label": "dark blue bowl"},
{"point": [471, 353], "label": "light blue bowl"},
{"point": [492, 497], "label": "bread"},
{"point": [525, 429], "label": "lime"}
]
En la siguiente imagen, se muestra un ejemplo de cómo se pueden mostrar estos puntos:
Cómo funciona
La ER de Gemini Robotics toma entradas de imagen, video o audio con instrucciones en lenguaje natural. Identifica objetos, razona sobre el contexto de la escena y las relaciones espaciales, y devuelve resultados estructurados, como coordenadas o cuadros delimitadores.
El ER de Gemini Robotics también es agentic: divide las tareas complejas en subtareas y las ejecuta llamando a las funciones de tu robot o ejecutando el código generado. Por ejemplo, "pon la manzana en el tazón" se convierte en una secuencia de pasos de ubicar, agarrar y colocar.
Consulta Llamada a funciones para obtener detalles sobre cómo Gemini ejecuta las llamadas a herramientas.
Seguridad
Si bien el ER de Gemini Robotics se creó pensando en la seguridad, es tu responsabilidad mantener un entorno seguro alrededor del robot. Los modelos de IA generativa pueden cometer errores, y los robots físicos pueden causar daños. Para obtener más información, visita la página de seguridad de robótica de Google DeepMind.
Prácticas recomendadas
Usa un lenguaje natural y sencillo. Describe lo que quieres que haga el robot como si se lo dijeras a una persona. Si un término no funciona, prueba con un sinónimo común.
Optimiza la entrada visual. Recorta o acerca los objetos pequeños o poco claros antes de enviar la imagen. La iluminación y el bajo contraste de color pueden afectar la detección.
Divide las tareas complejas en pasos. Envía cada paso como una instrucción separada para mantener el enfoque del modelo y mejorar la precisión.
Realiza consultas varias veces y calcula el promedio de los resultados para tareas de alta precisión. Este enfoque de consenso reduce la varianza en los resultados espaciales.
Limitaciones
Ten en cuenta las siguientes limitaciones cuando desarrolles con Gemini Robotics ER:
- Restricciones de la clave de API: La API de Gemini no acepta solicitudes de claves de API sin restricciones y devuelve un error
403 Forbidden. Protege tu clave de API agregando restricciones en AI Studio. Consulta Protege las claves de API sin restricciones para obtener más detalles. - Latencia vs. rendimiento: Las consultas complejas, las entradas de alta resolución o los niveles de pensamiento altos pueden aumentar los tiempos de procesamiento. Para el nivel de pensamiento, usa medio para lograr un buen equilibrio entre la latencia y el rendimiento.
- Alucinaciones: Al igual que todos los modelos de lenguaje grandes, los modelos de ER de Gemini Robotics pueden "alucinar" ocasionalmente o proporcionar información incorrecta, en especial para las instrucciones ambiguas o las entradas fuera de la distribución.
- Dependencia de la calidad de la instrucción: La calidad del resultado depende de la claridad de la instrucción de entrada. Usa instrucciones específicas y bien estructuradas.
- Costo de procesamiento: Ejecutar el modelo, en especial con entradas de video o un valor de
thinking_budgetalto, consume recursos de procesamiento y genera costos. Consulta la página Thinking para obtener más detalles. - Tipos de entrada: Consulta los siguientes temas para obtener detalles sobre las limitaciones de cada modo.
Aviso de privacidad
Reconoces que los modelos a los que se hace referencia en este documento (los "Modelos de Robótica") aprovechan los datos de audio y video para operar y mover tu hardware de acuerdo con tus instrucciones. Por lo tanto, es posible que opere los Modelos Robóticos de manera tal que estos recopilen datos de personas identificables, como datos de voz, imágenes y similitud ("Datos Personales"). Si decides operar los Modelos Robóticos de una manera que recopile Datos Personales, aceptas que no permitirás que ninguna persona identificable interactúe con los Modelos Robóticos ni esté presente en el área que los rodea, a menos que y hasta que se les haya notificado de manera suficiente y hayan dado su consentimiento para que Google pueda proporcionar y usar sus Datos Personales según se describe en las Condiciones del Servicio Adicionales de la API de Gemini que se encuentran en https://ai.google.dev/gemini-api/terms (las "Condiciones"), incluso de acuerdo con la sección titulada "Cómo usa Google tus datos". Te asegurarás de que dicho aviso permita la recopilación y el uso de Datos Personales según se describe en las Condiciones, y realizarás esfuerzos comercialmente razonables para minimizar la recopilación y distribución de Datos Personales con técnicas como el desenfoque de rostros y el funcionamiento de los Modelos de Robótica en áreas que no contengan personas identificables en la medida en que sea posible.
Precios
Para obtener información detallada sobre los precios y las regiones disponibles, consulta la página de precios.
Extremos de modelos
Versión preliminar de Gemini Robotics ER 2
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-robotics-er-2-preview |
| Tipos de datos admitidos |
Entradas Texto, imágenes, video y audio Resultado Texto |
| Límites de tokens[*] |
Límite de tokens de entrada 131,072 Límite de tokens de salida 65,536 |
| Funciones | No compatible Admitido Admitido Admitido Admitido Admitido Fundamentación con Google Maps Admitido No compatible No compatible Fundamentación con la Búsqueda Admitido Admitido Admitido Admitido |
| Opciones de consumo |
Admitido No compatible No compatible |
| Versiones de |
|
| Última actualización | Julio de 2026 |
| Ficha del modelo de | Ficha del modelo |
Versión preliminar de transmisión de Gemini Robotics ER 2
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-robotics-er-2-streaming-preview |
| Tipos de datos admitidos |
Entradas Texto, imágenes, video y audio Resultado Texto |
| Límites de tokens[*] |
Límite de tokens de entrada 131,072 Límite de tokens de salida 65,536 |
| Funciones | No compatible No compatible No compatible No compatible No compatible Admitido Fundamentación con Google Maps No compatible No compatible Admitido Fundamentación con la Búsqueda Admitido No compatible Admitido No compatible |
| Opciones de consumo |
No compatible No compatible No compatible |
| Versiones de |
|
| Última actualización | Julio de 2026 |
| Ficha del modelo de | Ficha del modelo |
Versión preliminar de Gemini Robotics ER 1.6
| Propiedad | Descripción |
|---|---|
| Código del modelo | gemini-robotics-er-1.6-preview |
| Tipos de datos admitidos |
Entradas Texto, imágenes, video y audio Resultado Texto |
| Límites de tokens[*] |
Límite de tokens de entrada 131,072 Límite de tokens de salida 65,536 |
| Funciones | No compatible Admitido Admitido Admitido Admitido Admitido Fundamentación con Google Maps Admitido No compatible No compatible Fundamentación con la Búsqueda Admitido Admitido Admitido Admitido |
| Opciones de consumo |
Admitido No compatible No compatible |
| Versiones de |
|
| Última actualización | Diciembre de 2025 |
| Fecha límite de conocimiento | Enero de 2025 |
¿Qué sigue?
- Razonamiento espacial: Señalar, rastrear, cuadros de límite y trayectorias.
- Capacidades de agente: Ejecución de código, lectura de instrumentos y anotación de imágenes
- Orquestación de tareas: Tareas a largo plazo con APIs de robots personalizadas.
- Robótica con transmisión: Transmisión bidireccional en tiempo real (solo Gemini Robotics ER 2).
- Comprensión de video: Búsqueda de momentos y clasificación del progreso (solo para Gemini Robotics ER 2).
- Seguridad de la robótica de Google DeepMind: Investigación sobre la seguridad detrás de la familia de modelos.