Модели ER (воплощенное рассуждение) от Gemini Robotics — это модели визуально-языкового восприятия (VLM), которые позволяют роботам воспринимать физический мир и взаимодействовать с ним. Они интерпретируют визуальные данные, выполняют пространственно-временное рассуждение, планируют многоэтапные задачи и координируют работу роботов и инструментов.
Модели
Модель Gemini Robotics ER 2 — это новейшая модель в линейке Gemini Robotics. Это наша обновленная модель логического мышления, позволяющая роботам точно понимать окружающую среду. Она специализируется на воплощенных возможностях логического мышления, таких как агентное управление роботами (например, с использованием VLA), понимание роботом видео, включая понимание прогресса и обнаружение успеха, считывание показаний приборов, указание направления и пространственное мышление.
Модель Gemini Robotics ER 2 включает две конечные точки модели:
-
gemini-robotics-er-2-preview: Стандартная модель ER 2. Создана на основе Gemini 3.5 Flash и включает улучшенное пространственное мышление, поиск моментов в видео, классификацию хода видео, управление несколькими роботами и использование инструментов в несколько этапов. -
gemini-robotics-er-2-streaming-preview: Оптимизировано для потоковой передачи в реальном времени через Live API . Используйте эту модель для роботов-агентов с низкой задержкой, обрабатывающих непрерывный аудио- и видеовход.
Если вы используете Gemini Robotics ER 1.6, обновите его до Gemini Robotics ER 2, заменив model="gemini-robotics-er-1.6-preview" на model="gemini-robotics-er-2-preview" или model="gemini-robotics-er-2-streaming-preview" в ваших вызовах API. Обратите внимание, что модель Gemini Robotics ER 1.6 будет отключена в конце августа .
Попробуйте Gemini Robotics ER 2 в Google AI Studio.
Возможности робототехники
Система Gemini Robotics ER поддерживает широкий спектр возможностей воплощенного мышления. Выберите интересующую вас возможность, чтобы узнать больше:
| Возможности | Описание | Гид |
|---|---|---|
| Пространственное мышление | Указывайте на объекты, отслеживайте их на видео, определяйте их с помощью ограничивающих рамок, планируйте траектории. | Пространственное мышление |
| Агентное видение | Используйте выполнение кода для расширения других возможностей, задействуя инструменты для обработки изображений. | Агентное видение |
| Организация задач | Сочетайте пространственное мышление с пользовательскими API для роботов, чтобы выполнять задачи в долгосрочной перспективе. | Организация задач |
| Потоковая передача (только для конечной точки потоковой передачи Gemini Robotics ER 2) | Двунаправленная потоковая передача данных для роботов-агентов в реальном времени с вызовом функций с низкой задержкой. | Стриминг для робототехники |
| Видео о ходе работ (только для робототехники Gemini Robotics ER 2) | Выявление ключевых моментов и классификация хода выполнения задачи на основе непрерывных видеопотоков. | Понимание видео |
Начиная
В следующем примере происходит поиск объектов на изображении и возвращаются их нормализованные 2D-координаты и метки. Вы можете передать эти данные непосредственно в API робототехники или в модель VLA для генерации действий робота.
Python
from google import genai
from google.genai import types
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
response = client.models.generate_content(
model="gemini-robotics-er-2-preview",
contents=[
types.Part.from_uri(
file_uri=uploaded_file.uri,
mime_type=uploaded_file.mime_type
),
PROMPT
],
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high")
),
)
print(response.text)
ОТДЫХ
# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"inlineData": {
"mimeType": "image/png",
"data": "'"${IMAGE_BASE64}"'"
}
},
{
"text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "high"
}
}
}'
В результате будет получен JSON-массив, содержащий объекты, каждый из которых имеет point (нормализованные координаты [y, x] ) и label , идентифицирующую объект.
JSON
[
{"point": [376, 508], "label": "small banana"},
{"point": [287, 609], "label": "larger banana"},
{"point": [223, 303], "label": "pink starfruit"},
{"point": [435, 172], "label": "paper bag"},
{"point": [270, 786], "label": "green plastic bowl"},
{"point": [488, 775], "label": "metal measuring cup"},
{"point": [673, 580], "label": "dark blue bowl"},
{"point": [471, 353], "label": "light blue bowl"},
{"point": [492, 497], "label": "bread"},
{"point": [525, 429], "label": "lime"}
]
На следующем изображении представлен пример того, как можно отобразить эти точки:

Как это работает
Робот Gemini Robotics ER принимает на вход изображения, видео или аудио с подсказками на естественном языке. Он идентифицирует объекты, анализирует контекст сцены и пространственные отношения, а затем возвращает структурированный результат, такой как координаты или ограничивающие рамки.
Gemini Robotics ER также является агентным роботом: он разбивает сложные задачи на подзадачи и выполняет их, вызывая функции вашего робота или запуская сгенерированный код. Например, задача «положить яблоко в миску» превращается в последовательность шагов: найти, захватить и поместить.
Подробности о том, как Gemini выполняет вызовы инструментов, см. в разделе «Вызов функций» .
Безопасность
Хотя робот Gemini Robotics ER был разработан с учетом требований безопасности, вы несете ответственность за поддержание безопасной среды вокруг робота. Модели генеративного ИИ могут совершать ошибки, а физические роботы могут причинить ущерб. Чтобы узнать больше, посетите страницу Google DeepMind по безопасности робототехники .
Передовые методы
Используйте простой, естественный язык. Опишите, что вы хотите, чтобы робот делал, так же, как вы бы описали это человеку. Если какой-то термин не подходит, попробуйте использовать распространенный синоним.
Оптимизируйте визуальный ввод. Перед отправкой изображения обрежьте или увеличьте масштаб мелких или нечетких объектов. Освещение и низкий цветовой контраст могут повлиять на распознавание.
Разбейте сложные задачи на этапы. Отправляйте каждый этап в виде отдельного запроса, чтобы модель оставалась сфокусированной и повышала точность.
Для задач с высокой точностью следует выполнять многократные запросы и усреднять результаты. Такой подход, основанный на достижении консенсуса, снижает вариативность пространственных результатов.
Ограничения
При разработке с использованием Gemini Robotics ER следует учитывать следующие ограничения:
- Ограничения по ключу API: API Gemini не принимает запросы от ключей API без ограничений и возвращает ошибку
403 Forbidden. Защитите свой ключ API, добавив ограничения в AI Studio . Подробнее см. раздел «Защита ключей API без ограничений» . - Задержка против производительности: сложные запросы, высокоточные входные данные или высокий уровень сложности могут привести к увеличению времени обработки. Для среднего уровня сложности используйте средний уровень, чтобы найти оптимальный баланс между задержкой и производительностью.
- Галлюцинации: Как и все большие языковые модели, модели ER от Gemini Robotics могут иногда «галлюцинировать» или предоставлять неверную информацию, особенно при неоднозначных запросах или входных данных, выходящих за рамки распределения.
- Зависимость от качества подсказки: качество выходных данных зависит от ясности входной подсказки. Используйте конкретные, хорошо структурированные подсказки.
- Вычислительные затраты: Запуск модели, особенно с видеовходами или высоким
thinking_budget, потребляет вычислительные ресурсы и влечет за собой затраты. Подробнее см. на странице «Вычисления» . - Типы ввода: Подробную информацию об ограничениях для каждого режима см. в следующих разделах.
Уведомление о конфиденциальности
Вы подтверждаете, что модели, упомянутые в этом документе («Роботизированные модели»), используют видео- и аудиоданные для управления и перемещения вашего оборудования в соответствии с вашими инструкциями. Таким образом, вы можете использовать Роботизированные модели таким образом, чтобы Роботизированные модели собирали данные от идентифицируемых лиц, такие как голос, изображения и данные об их внешности («Персональные данные»). Если вы решите использовать Роботизированные модели таким образом, чтобы собирались Персональные данные, вы соглашаетесь не разрешать каким-либо идентифицируемым лицам взаимодействовать с Роботизированными моделями или находиться в зоне их действия, если и до тех пор, пока такие идентифицируемые лица не будут надлежащим образом уведомлены и не дадут согласие на то, что их Персональные данные могут быть предоставлены и использованы Google в соответствии с Дополнительными условиями обслуживания Gemini API, размещенными по адресу https://ai.google.dev/gemini-api/terms («Условия»), в том числе в соответствии с разделом «Как Google использует ваши данные». Вы обязуетесь обеспечить, чтобы такое уведомление разрешало сбор и использование персональных данных в соответствии с Условиями, и будете прилагать коммерчески обоснованные усилия для минимизации сбора и распространения персональных данных, используя такие методы, как размытие лица и управление роботизированными моделями в зонах, не содержащих идентифицируемых лиц, в той мере, в какой это практически возможно.
Цены
Подробную информацию о ценах и доступных регионах см. на странице с ценами .
Конечные точки модели
Предварительный обзор Gemini Robotics ER 2
| Свойство | Описание |
|---|---|
| Код модели | gemini-robotics-er-2-preview |
| Поддерживаемые типы данных | Входные данные Текст, изображения, видео, аудио Выход Текст |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 131,072 лимит выходных токенов 65,536 |
| Возможности | Не поддерживается Поддерживается Поддерживается Поддерживается Поддерживается Поддерживается Определить местоположение с помощью Google Maps Поддерживается Не поддерживается Не поддерживается Поддерживается Структурированные выходные данные Поддерживается Поддерживается Поддерживается |
| Варианты потребления | Поддерживается Не поддерживается Не поддерживается |
| версии |
|
| Последнее обновление | Июль 2026 г. |
| Модель карты | Модель карты |
Предварительный показ трансляции Gemini Robotics ER 2
| Свойство | Описание |
|---|---|
| Код модели | gemini-robotics-er-2-streaming-preview |
| Поддерживаемые типы данных | Входные данные Текст, изображения, видео, аудио Выход Текст |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 131,072 лимит выходных токенов 65,536 |
| Возможности | Не поддерживается Не поддерживается Не поддерживается Не поддерживается Не поддерживается Поддерживается Определить местоположение с помощью Google Maps Не поддерживается Не поддерживается Поддерживается Поддерживается Структурированные выходные данные Не поддерживается Поддерживается Не поддерживается |
| Варианты потребления | Не поддерживается Не поддерживается Не поддерживается |
| версии |
|
| Последнее обновление | Июль 2026 г. |
| Модель карты | Модель карты |
Gemini Robotics ER 1.6 Preview
| Свойство | Описание |
|---|---|
| Код модели | gemini-robotics-er-1.6-preview |
| Поддерживаемые типы данных | Входные данные Текст, изображения, видео, аудио Выход Текст |
| Ограничения на количество токенов [*] | Ограничение на количество введенных токенов 131,072 лимит выходных токенов 65,536 |
| Возможности | Не поддерживается Поддерживается Поддерживается Поддерживается Поддерживается Поддерживается Определить местоположение с помощью Google Maps Поддерживается Не поддерживается Не поддерживается Поддерживается Структурированные выходные данные Поддерживается Поддерживается Поддерживается |
| Варианты потребления | Поддерживается Не поддерживается Не поддерживается |
| версии |
|
| Последнее обновление | Декабрь 2025 г. |
| Порог знаний | Январь 2025 г. |
Что дальше?
- Пространственное мышление — указание, отслеживание, ограничивающие рамки, траектории.
- Возможности агента : выполнение кода, считывание показаний приборов, аннотирование изображений.
- Оркестрация задач — выполнение долгосрочных задач с использованием пользовательских API для роботов.
- Робототехника с потоковой передачей данных — двусторонняя потоковая передача в реальном времени (только для Gemini Robotics ER 2).
- Анализ видеоматериалов — выявление ключевых моментов и классификация хода выполнения (только для Gemini Robotics ER 2).
- Безопасность робототехники Google DeepMind — исследования в области безопасности, лежащие в основе семейства моделей.