Gemini Robotics ER

Модели ER (воплощенное рассуждение) от Gemini Robotics — это модели визуально-языкового восприятия (VLM), которые позволяют роботам воспринимать физический мир и взаимодействовать с ним. Они интерпретируют визуальные данные, выполняют пространственно-временное рассуждение, планируют многоэтапные задачи и координируют работу роботов и инструментов.

Модели

Модель Gemini Robotics ER 2 — это новейшая модель в линейке Gemini Robotics. Это наша обновленная модель логического мышления, позволяющая роботам точно понимать окружающую среду. Она специализируется на воплощенных возможностях логического мышления, таких как агентное управление роботами (например, с использованием VLA), понимание роботом видео, включая понимание прогресса и обнаружение успеха, считывание показаний приборов, указание направления и пространственное мышление.

Модель Gemini Robotics ER 2 включает две конечные точки модели:

  • gemini-robotics-er-2-preview : Стандартная модель ER 2. Создана на основе Gemini 3.5 Flash и включает улучшенное пространственное мышление, поиск моментов в видео, классификацию хода видео, управление несколькими роботами и использование инструментов в несколько этапов.
  • gemini-robotics-er-2-streaming-preview : Оптимизировано для потоковой передачи в реальном времени через Live API . Используйте эту модель для роботов-агентов с низкой задержкой, обрабатывающих непрерывный аудио- и видеовход.

Если вы используете Gemini Robotics ER 1.6, обновите его до Gemini Robotics ER 2, заменив model="gemini-robotics-er-1.6-preview" на model="gemini-robotics-er-2-preview" или model="gemini-robotics-er-2-streaming-preview" в ваших вызовах API. Обратите внимание, что модель Gemini Robotics ER 1.6 будет отключена в конце августа .

Попробуйте Gemini Robotics ER 2 в Google AI Studio.

Возможности робототехники

Система Gemini Robotics ER поддерживает широкий спектр возможностей воплощенного мышления. Выберите интересующую вас возможность, чтобы узнать больше:

Возможности Описание Гид
Пространственное мышление Указывайте на объекты, отслеживайте их на видео, определяйте их с помощью ограничивающих рамок, планируйте траектории. Пространственное мышление
Агентное видение Используйте выполнение кода для расширения других возможностей, задействуя инструменты для обработки изображений. Агентное видение
Организация задач Сочетайте пространственное мышление с пользовательскими API для роботов, чтобы выполнять задачи в долгосрочной перспективе. Организация задач
Потоковая передача (только для конечной точки потоковой передачи Gemini Robotics ER 2) Двунаправленная потоковая передача данных для роботов-агентов в реальном времени с вызовом функций с низкой задержкой. Стриминг для робототехники
Видео о ходе работ (только для робототехники Gemini Robotics ER 2) Выявление ключевых моментов и классификация хода выполнения задачи на основе непрерывных видеопотоков. Понимание видео

Начиная

В следующем примере происходит поиск объектов на изображении и возвращаются их нормализованные 2D-координаты и метки. Вы можете передать эти данные непосредственно в API робототехники или в модель VLA для генерации действий робота.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

ОТДЫХ

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

В результате будет получен JSON-массив, содержащий объекты, каждый из которых имеет point (нормализованные координаты [y, x] ) и label , идентифицирующую объект.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

На следующем изображении представлен пример того, как можно отобразить эти точки:

Пример, отображающий точки объектов на изображении.

Как это работает

Робот Gemini Robotics ER принимает на вход изображения, видео или аудио с подсказками на естественном языке. Он идентифицирует объекты, анализирует контекст сцены и пространственные отношения, а затем возвращает структурированный результат, такой как координаты или ограничивающие рамки.

Gemini Robotics ER также является агентным роботом: он разбивает сложные задачи на подзадачи и выполняет их, вызывая функции вашего робота или запуская сгенерированный код. Например, задача «положить яблоко в миску» превращается в последовательность шагов: найти, захватить и поместить.

Подробности о том, как Gemini выполняет вызовы инструментов, см. в разделе «Вызов функций» .

Безопасность

Хотя робот Gemini Robotics ER был разработан с учетом требований безопасности, вы несете ответственность за поддержание безопасной среды вокруг робота. Модели генеративного ИИ могут совершать ошибки, а физические роботы могут причинить ущерб. Чтобы узнать больше, посетите страницу Google DeepMind по безопасности робототехники .

Передовые методы

  1. Используйте простой, естественный язык. Опишите, что вы хотите, чтобы робот делал, так же, как вы бы описали это человеку. Если какой-то термин не подходит, попробуйте использовать распространенный синоним.

  2. Оптимизируйте визуальный ввод. Перед отправкой изображения обрежьте или увеличьте масштаб мелких или нечетких объектов. Освещение и низкий цветовой контраст могут повлиять на распознавание.

  3. Разбейте сложные задачи на этапы. Отправляйте каждый этап в виде отдельного запроса, чтобы модель оставалась сфокусированной и повышала точность.

  4. Для задач с высокой точностью следует выполнять многократные запросы и усреднять результаты. Такой подход, основанный на достижении консенсуса, снижает вариативность пространственных результатов.

Ограничения

При разработке с использованием Gemini Robotics ER следует учитывать следующие ограничения:

  • Ограничения по ключу API: API Gemini не принимает запросы от ключей API без ограничений и возвращает ошибку 403 Forbidden . Защитите свой ключ API, добавив ограничения в AI Studio . Подробнее см. раздел «Защита ключей API без ограничений» .
  • Задержка против производительности: сложные запросы, высокоточные входные данные или высокий уровень сложности могут привести к увеличению времени обработки. Для среднего уровня сложности используйте средний уровень, чтобы найти оптимальный баланс между задержкой и производительностью.
  • Галлюцинации: Как и все большие языковые модели, модели ER от Gemini Robotics могут иногда «галлюцинировать» или предоставлять неверную информацию, особенно при неоднозначных запросах или входных данных, выходящих за рамки распределения.
  • Зависимость от качества подсказки: качество выходных данных зависит от ясности входной подсказки. Используйте конкретные, хорошо структурированные подсказки.
  • Вычислительные затраты: Запуск модели, особенно с видеовходами или высоким thinking_budget , потребляет вычислительные ресурсы и влечет за собой затраты. Подробнее см. на странице «Вычисления» .
  • Типы ввода: Подробную информацию об ограничениях для каждого режима см. в следующих разделах.

Уведомление о конфиденциальности

Вы подтверждаете, что модели, упомянутые в этом документе («Роботизированные модели»), используют видео- и аудиоданные для управления и перемещения вашего оборудования в соответствии с вашими инструкциями. Таким образом, вы можете использовать Роботизированные модели таким образом, чтобы Роботизированные модели собирали данные от идентифицируемых лиц, такие как голос, изображения и данные об их внешности («Персональные данные»). Если вы решите использовать Роботизированные модели таким образом, чтобы собирались Персональные данные, вы соглашаетесь не разрешать каким-либо идентифицируемым лицам взаимодействовать с Роботизированными моделями или находиться в зоне их действия, если и до тех пор, пока такие идентифицируемые лица не будут надлежащим образом уведомлены и не дадут согласие на то, что их Персональные данные могут быть предоставлены и использованы Google в соответствии с Дополнительными условиями обслуживания Gemini API, размещенными по адресу https://ai.google.dev/gemini-api/terms («Условия»), в том числе в соответствии с разделом «Как Google использует ваши данные». Вы обязуетесь обеспечить, чтобы такое уведомление разрешало сбор и использование персональных данных в соответствии с Условиями, и будете прилагать коммерчески обоснованные усилия для минимизации сбора и распространения персональных данных, используя такие методы, как размытие лица и управление роботизированными моделями в зонах, не содержащих идентифицируемых лиц, в той мере, в какой это практически возможно.

Цены

Подробную информацию о ценах и доступных регионах см. на странице с ценами .

Конечные точки модели

Предварительный обзор Gemini Robotics ER 2

Свойство Описание
Код модели gemini-robotics-er-2-preview
Поддерживаемые типы данных

Входные данные

Текст, изображения, видео, аудио

Выход

Текст

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

131,072

лимит выходных токенов

65,536

Возможности

Генерация аудио

Не поддерживается

Кэширование

Поддерживается

Выполнение кода

Поддерживается

Использование компьютера

Поддерживается

Поиск файлов

Поддерживается

Вызов функции

Поддерживается

Определить местоположение с помощью Google Maps

Поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Поддерживается

Структурированные выходные данные

Поддерживается

Мышление

Поддерживается

контекст URL

Поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Не поддерживается

Приоритетный вывод

Не поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • Предварительный просмотр: gemini-robotics-er-2-preview
Последнее обновление Июль 2026 г.
Модель карты Модель карты

Предварительный показ трансляции Gemini Robotics ER 2

Свойство Описание
Код модели gemini-robotics-er-2-streaming-preview
Поддерживаемые типы данных

Входные данные

Текст, изображения, видео, аудио

Выход

Текст

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

131,072

лимит выходных токенов

65,536

Возможности

Генерация аудио

Не поддерживается

Кэширование

Не поддерживается

Выполнение кода

Не поддерживается

Использование компьютера

Не поддерживается

Поиск файлов

Не поддерживается

Вызов функции

Поддерживается

Определить местоположение с помощью Google Maps

Не поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Поддерживается

Поиск заземления

Поддерживается

Структурированные выходные данные

Не поддерживается

Мышление

Поддерживается

контекст URL

Не поддерживается

Варианты потребления

Пакетный API

Не поддерживается

Гибкий вывод

Не поддерживается

Приоритетный вывод

Не поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • Предварительный просмотр: gemini-robotics-er-2-streaming-preview
Последнее обновление Июль 2026 г.
Модель карты Модель карты

Gemini Robotics ER 1.6 Preview

Свойство Описание
Код модели gemini-robotics-er-1.6-preview
Поддерживаемые типы данных

Входные данные

Текст, изображения, видео, аудио

Выход

Текст

Ограничения на количество токенов [*]

Ограничение на количество введенных токенов

131,072

лимит выходных токенов

65,536

Возможности

Генерация аудио

Не поддерживается

Кэширование

Поддерживается

Выполнение кода

Поддерживается

Использование компьютера

Поддерживается

Поиск файлов

Поддерживается

Вызов функции

Поддерживается

Определить местоположение с помощью Google Maps

Поддерживается

генерация изображений

Не поддерживается

API в реальном времени

Не поддерживается

Поиск заземления

Поддерживается

Структурированные выходные данные

Поддерживается

Мышление

Поддерживается

контекст URL

Поддерживается

Варианты потребления

Пакетный API

Поддерживается

Гибкий вывод

Не поддерживается

Приоритетный вывод

Не поддерживается

версии
Для получения более подробной информации ознакомьтесь с шаблонами версий модели .
  • Предварительный просмотр: gemini-robotics-er-1.6-preview
Последнее обновление Декабрь 2025 г.
Порог знаний Январь 2025 г.

Что дальше?