بخش اورژانس رباتیک جمینی

مدل‌های ER (استدلال تجسمی) Gemini Robotics، مدل‌های زبان بینایی (VLM) هستند که به ربات‌ها اجازه می‌دهند دنیای فیزیکی را درک کرده و با آن تعامل داشته باشند. آن‌ها داده‌های بصری را تفسیر می‌کنند، استدلال مکانی و زمانی انجام می‌دهند، وظایف چند مرحله‌ای را برنامه‌ریزی می‌کنند و ربات‌ها و ابزارها را هماهنگ می‌کنند.

مدل‌ها

مدل Gemini Robotics ER 2 جدیدترین مدل در Gemini Robotics است. این مدل استدلال به‌روز شده ما است که ربات‌ها را قادر می‌سازد محیط خود را دقیقاً درک کنند. این مدل در قابلیت‌های استدلال تجسمی، مانند هماهنگی عامل ربات‌ها (مثلاً با استفاده از VLAها)، درک ویدیوی ربات از جمله درک پیشرفت و تشخیص موفقیت، خواندن ابزار، اشاره و استدلال فضایی تخصص دارد.

مدل Gemini Robotics ER 2 دو نقطه پایانی مدل را معرفی می‌کند:

  • gemini-robotics-er-2-preview : مدل استاندارد ER 2. بر اساس Gemini 3.5 Flash ساخته شده و استدلال فضایی، یافتن لحظات ویدیویی، طبقه‌بندی پیشرفت ویدیو، هماهنگی چند ربات و استفاده از ابزار چند مرحله‌ای بهبود یافته است.
  • gemini-robotics-er-2-streaming-preview : برای جریان‌سازی بلادرنگ از طریق Live API بهینه‌سازی شده است. از این مدل برای ربات‌های عامل با تأخیر کم که ورودی‌های صوتی و تصویری مداوم را پردازش می‌کنند، استفاده کنید.

اگر از Gemini Robotics ER 1.6 استفاده می‌کنید، با جایگزینی model="gemini-robotics-er-1.6-preview" با model="gemini-robotics-er-2-preview" یا model="gemini-robotics-er-2-streaming-preview" در فراخوانی‌های API خود، به Gemini Robotics ER 2 ارتقا دهید. توجه داشته باشید که مدل Gemini Robotics ER 1.6 در پایان ماه آگوست غیرفعال خواهد شد.

Gemini Robotics ER 2 را در استودیوی هوش مصنوعی گوگل امتحان کنید

قابلیت‌های رباتیک

ربات Gemini Robotics ER از طیف وسیعی از قابلیت‌های استدلال تجسمی پشتیبانی می‌کند. برای کسب اطلاعات بیشتر، یکی از قابلیت‌ها را انتخاب کنید:

قابلیت توضیحات راهنما
استدلال فضایی به اشیاء اشاره کنید، آنها را در ویدیو ردیابی کنید، با جعبه‌های محدودکننده تشخیص دهید، مسیرها را برنامه‌ریزی کنید. استدلال فضایی
دیدگاه عامل‌گرایانه با استفاده از ابزارهای دستکاری تصویر، از اجرای کد برای بهبود سایر قابلیت‌ها استفاده کنید. دیدگاه عامل‌گرایانه
هماهنگ‌سازی وظایف استدلال فضایی را با API های ربات سفارشی ترکیب کنید تا وظایف بلندمدت را انجام دهید. هماهنگ‌سازی وظایف
پخش جریانی (فقط نقطه پایانی پخش جریانی Gemini Robotics ER 2) جریان دو طرفه برای عامل‌های ربات بلادرنگ با فراخوانی تابع با تأخیر کم پخش زنده برای رباتیک
پیشرفت ویدیویی (فقط Gemini Robotics ER 2) یافتن لحظه و طبقه‌بندی پیشرفت از فیدهای ویدیویی پیوسته درک ویدیو

شروع به کار

مثال زیر اشیاء را در یک تصویر پیدا می‌کند و مختصات دوبعدی و برچسب‌های نرمال‌شده‌ی آنها را برمی‌گرداند. می‌توانید این خروجی را مستقیماً به یک API رباتیک یا یک مدل VLA ارسال کنید تا اقدامات ربات تولید شود.

پایتون

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

استراحت

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

خروجی یک آرایه JSON حاوی اشیاء خواهد بود که هر کدام دارای یک point (مختصات نرمال شده [y, x] ) و یک label شناسایی کننده شیء هستند.

جی‌سون

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

تصویر زیر نمونه‌ای از نحوه نمایش این نقاط است:

مثالی که نقاط اشیاء را در یک تصویر نمایش می‌دهد

چگونه کار می‌کند؟

Gemini Robotics ER ورودی تصویر، ویدئو یا صدا را با زبان طبیعی دریافت می‌کند. اشیاء را شناسایی می‌کند، دلایلی در مورد زمینه صحنه و روابط مکانی ارائه می‌دهد و خروجی ساختاریافته‌ای مانند مختصات یا جعبه‌های محصورکننده را برمی‌گرداند.

Gemini Robotics ER همچنین عامل‌گرا است: وظایف پیچیده را به زیروظایف تقسیم می‌کند و آنها را با فراخوانی توابع ربات شما یا اجرای کد تولید شده اجرا می‌کند. به عنوان مثال، "سیب را در کاسه بگذار" به دنباله‌ای از مراحل مکان‌یابی، گرفتن و قرار دادن تبدیل می‌شود.

برای جزئیات بیشتر در مورد نحوه اجرای فراخوانی‌های ابزار در Gemini، به بخش فراخوانی تابع مراجعه کنید.

ایمنی

اگرچه ربات Gemini Robotics ER با در نظر گرفتن ایمنی ساخته شده است، اما مسئولیت حفظ محیط امن در اطراف ربات بر عهده شماست. مدل‌های هوش مصنوعی مولد می‌توانند اشتباه کنند و ربات‌های فیزیکی می‌توانند باعث آسیب شوند. برای کسب اطلاعات بیشتر، به صفحه ایمنی رباتیک Google DeepMind مراجعه کنید.

بهترین شیوه‌ها

  1. از زبان ساده و طبیعی استفاده کنید. کاری را که می‌خواهید ربات انجام دهد، همانطور که برای یک انسان انجام می‌دهید، توصیف کنید. اگر یک اصطلاح کارساز نبود، یک مترادف رایج را امتحان کنید.

  2. ورودی بصری را بهینه کنید. قبل از ارسال تصویر، اشیاء کوچک یا نامشخص را برش دهید یا بزرگنمایی کنید. روشنایی و کنتراست رنگ پایین می‌تواند بر تشخیص تأثیر بگذارد.

  3. وظایف پیچیده را به مراحل مختلف تقسیم کنید. هر مرحله را به عنوان یک دستورالعمل جداگانه ارسال کنید تا مدل متمرکز بماند و دقت بهبود یابد.

  4. چندین بار پرس و جو کنید و برای وظایف با دقت بالا، میانگین نتایج را بگیرید. این رویکرد اجماع، واریانس در خروجی‌های مکانی را کاهش می‌دهد.

محدودیت‌ها

هنگام توسعه با Gemini Robotics ER، محدودیت‌های زیر را در نظر بگیرید:

  • محدودیت‌های کلید API: رابط برنامه‌نویسی Gemini درخواست‌های دریافتی از کلیدهای API بدون محدودیت را نمی‌پذیرد و خطای 403 Forbidden را برمی‌گرداند. با اضافه کردن محدودیت‌هایی در AI Studio ، کلید API خود را ایمن کنید. برای جزئیات بیشتر به Secure unlimited API keys مراجعه کنید.
  • تأخیر در مقابل عملکرد: پرس‌وجوهای پیچیده، ورودی‌های با وضوح بالا یا سطوح بالای تفکر می‌توانند منجر به افزایش زمان پردازش شوند. برای سطح تفکر از سطح متوسط ​​استفاده کنید تا تعادل خوبی بین تأخیر و عملکرد برقرار شود.
  • توهمات: مانند تمام مدل‌های زبانی بزرگ، مدل‌های ER Gemini Robotics می‌توانند گاهی اوقات "توهم" داشته باشند یا اطلاعات نادرستی ارائه دهند، به خصوص برای دستورات مبهم یا ورودی‌های خارج از توزیع.
  • وابستگی به کیفیت دستور: کیفیت خروجی به وضوح دستور ورودی بستگی دارد. از دستورهای خاص و ساختارمند استفاده کنید.
  • هزینه محاسباتی: اجرای مدل، به خصوص با ورودی‌های ویدیویی یا thinking_budget بالا، منابع محاسباتی را مصرف می‌کند و هزینه‌هایی را به همراه دارد. برای جزئیات بیشتر به صفحه Thinking مراجعه کنید.
  • انواع ورودی: برای جزئیات بیشتر در مورد محدودیت‌های هر حالت، به مباحث زیر مراجعه کنید.

اطلاعیه حریم خصوصی

شما تصدیق می‌کنید که مدل‌های ارجاع‌شده در این سند ("مدل‌های رباتیک") از داده‌های ویدیویی و صوتی برای کار و جابجایی سخت‌افزار شما مطابق با دستورالعمل‌های شما استفاده می‌کنند. بنابراین، شما می‌توانید مدل‌های رباتیک را به گونه‌ای اداره کنید که داده‌های افراد قابل شناسایی، مانند صدا، تصویر و داده‌های شباهت ("داده‌های شخصی")، توسط مدل‌های رباتیک جمع‌آوری شود. اگر تصمیم بگیرید که مدل‌های رباتیک را به روشی که داده‌های شخصی را جمع‌آوری می‌کند، اداره کنید، موافقت می‌کنید که به هیچ فرد قابل شناسایی اجازه تعامل یا حضور در منطقه اطراف مدل‌های رباتیک را نخواهید داد، مگر اینکه و تا زمانی که این افراد قابل شناسایی به اندازه کافی از این واقعیت که داده‌های شخصی آنها ممکن است توسط گوگل ارائه و استفاده شود، همانطور که در شرایط خدمات اضافی Gemini API که در https://ai.google.dev/gemini-api/terms ("شرایط") آمده است، از جمله مطابق با بخش "نحوه استفاده گوگل از داده‌های شما" ذکر شده است، مطلع شده و رضایت خود را اعلام کرده باشند. شما تضمین خواهید کرد که چنین اطلاعیه‌ای، جمع‌آوری و استفاده از داده‌های شخصی را طبق مفاد مندرج در شرایط، مجاز می‌داند و با استفاده از تکنیک‌هایی مانند محو کردن چهره و اجرای مدل‌های رباتیک در مناطقی که افراد قابل شناسایی در آنها حضور ندارند، تا حد امکان، تلاش‌های تجاری معقولی را برای به حداقل رساندن جمع‌آوری و توزیع داده‌های شخصی به کار خواهید گرفت.

قیمت‌گذاری

برای اطلاعات دقیق در مورد قیمت گذاری و مناطق موجود، به صفحه قیمت گذاری مراجعه کنید.

نقاط پایانی مدل

پیش‌نمایش ربات Gemini Robotics ER 2

ملک توضیحات
کد مدل gemini-robotics-er-2-preview
انواع داده پشتیبانی شده را

ورودی‌ها

متن، تصویر، ویدئو، صدا

خروجی

متن

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۱۳۱,۰۷۲

محدودیت توکن خروجی

۶۵,۵۳۶

قابلیت‌های

تولید صدا

پشتیبانی نمی‌شود

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی شده

استفاده از کامپیوتر

پشتیبانی شده

جستجوی فایل

پشتیبانی شده

فراخوانی تابع

پشتیبانی شده

اتصال به زمین با نقشه‌های گوگل

پشتیبانی شده

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی شده

خروجی‌های ساختاریافته

پشتیبانی شده

تفکر

پشتیبانی شده

زمینه URL

پشتیبانی شده

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی نمی‌شود

استنتاج اولویت

پشتیبانی نمی‌شود

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • پیش‌نمایش: پیش‌نمایش gemini-robotics-er-2-preview
آخرین به‌روزرسانی ژوئیه ۲۰۲۶
کارت مدل کارت مدل

پیش‌نمایش پخش زنده Gemini Robotics ER 2

ملک توضیحات
کد مدل gemini-robotics-er-2-streaming-preview
انواع داده پشتیبانی شده را

ورودی‌ها

متن، تصویر، ویدئو، صدا

خروجی

متن

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۱۳۱,۰۷۲

محدودیت توکن خروجی

۶۵,۵۳۶

قابلیت‌های

تولید صدا

پشتیبانی نمی‌شود

ذخیره سازی

پشتیبانی نمی‌شود

اجرای کد

پشتیبانی نمی‌شود

استفاده از کامپیوتر

پشتیبانی نمی‌شود

جستجوی فایل

پشتیبانی نمی‌شود

فراخوانی تابع

پشتیبانی شده

اتصال به زمین با نقشه‌های گوگل

پشتیبانی نمی‌شود

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی شده

جستجوی اتصال به زمین

پشتیبانی شده

خروجی‌های ساختاریافته

پشتیبانی نمی‌شود

تفکر

پشتیبانی شده

زمینه URL

پشتیبانی نمی‌شود

گزینه‌های مصرف

API دسته‌ای

پشتیبانی نمی‌شود

استنتاج انعطاف‌پذیر

پشتیبانی نمی‌شود

استنتاج اولویت

پشتیبانی نمی‌شود

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • پیش‌نمایش: gemini-robotics-er-2-streaming-preview
آخرین به‌روزرسانی ژوئیه ۲۰۲۶
کارت مدل کارت مدل

پیش‌نمایش Gemini Robotics ER 1.6

ملک توضیحات
کد مدل gemini-robotics-er-1.6-preview
انواع داده پشتیبانی شده را

ورودی‌ها

متن، تصویر، ویدئو، صدا

خروجی

متن

محدودیت‌های توکن [*]

محدودیت توکن ورودی

۱۳۱,۰۷۲

محدودیت توکن خروجی

۶۵,۵۳۶

قابلیت‌های

تولید صدا

پشتیبانی نمی‌شود

ذخیره سازی

پشتیبانی شده

اجرای کد

پشتیبانی شده

استفاده از کامپیوتر

پشتیبانی شده

جستجوی فایل

پشتیبانی شده

فراخوانی تابع

پشتیبانی شده

اتصال به زمین با نقشه‌های گوگل

پشتیبانی شده

تولید تصویر

پشتیبانی نمی‌شود

API زنده

پشتیبانی نمی‌شود

جستجوی اتصال به زمین

پشتیبانی شده

خروجی‌های ساختاریافته

پشتیبانی شده

تفکر

پشتیبانی شده

زمینه URL

پشتیبانی شده

گزینه‌های مصرف

API دسته‌ای

پشتیبانی شده

استنتاج انعطاف‌پذیر

پشتیبانی نمی‌شود

استنتاج اولویت

پشتیبانی نمی‌شود

نسخه
برای جزئیات بیشتر ، الگوهای نسخه مدل را مطالعه کنید.
  • پیش‌نمایش: پیش‌نمایش gemini-robotics-er-1.6-preview
آخرین به‌روزرسانی دسامبر ۲۰۲۵
حد آستانه دانش ژانویه ۲۰۲۵

قدم بعدی چیست؟