Gemini Robotics ER

نماذج Gemini Robotics ER (الاستدلال المجسّد) هي نماذج للرؤية واللغة (VLM) تتيح للروبوتات إدراك العالم المادي والتفاعل معه. وهي تفسّر البيانات المرئية، وتجري عمليات استدلال مكانية وزمانية، وتخطّط لمهام متعدّدة الخطوات، وتنسّق بين الروبوتات والأدوات.

النماذج

‫Gemini Robotics ER 2 هو أحدث طراز في Gemini Robotics. وهو نموذج محدّث للاستدلال يتيح للروبوتات فهم البيئات المحيطة بها بدقة. وهي متخصّصة في إمكانات الاستدلال المجسّد، مثل التنسيق بين برامج الروبوت (مثل استخدام المساعدين الافتراضيين المرئيين) وفهم فيديوهات الروبوت، بما في ذلك فهم التقدم المحرز ورصد النجاح وقراءة الأدوات والإشارة والاستدلال المكاني.

يقدّم نموذج Gemini Robotics ER 2 نقطتَي نهاية للنموذج:

  • gemini-robotics-er-2-preview: نموذج ER 2 العادي يستند إلى Gemini 3.5 Flash مع تحسينات على الاستدلال المكاني، والعثور على لحظات في الفيديو، وتصنيف تقدّم الفيديو، وتنسيق عمل الروبوتات المتعددة، واستخدام الأدوات المتعددة الخطوات.
  • gemini-robotics-er-2-streaming-preview: تم تحسينها للبث المباشر في الوقت الفعلي من خلال Live API. استخدِم هذا النموذج لبرامج الروبوت التي تتطلّب زمن استجابة منخفضًا وتعالج بيانات الصوت والفيديو المتواصلة.

إذا كنت تستخدم Gemini Robotics ER 1.6، يمكنك الترقية إلى Gemini Robotics ER 2 من خلال استبدال model="gemini-robotics-er-1.6-preview" بـ model="gemini-robotics-er-2-preview" أو model="gemini-robotics-er-2-streaming-preview" في طلبات البيانات من واجهة برمجة التطبيقات. يُرجى العِلم أنّه سيتم إيقاف نموذج Gemini Robotics ER 1.6 في نهاية أغسطس.

تجربة الإصدار الثاني من Gemini Robotics في Google AI Studio

إمكانات الروبوتات

يتيح Gemini Robotics ER مجموعة من إمكانات الاستدلال المجسَّد. اختَر إحدى الإمكانيات لمعرفة المزيد من المعلومات:

إمكانية الوصف الدليل
الاستدلال المكاني توجيه الكاميرا إلى الأجسام وتتبُّعها في الفيديو ورصدها باستخدام مربّعات حدودية وتخطيط مساراتها الاستدلال المكاني
الرؤية المستنِدة إلى الذكاء الاصطناعي الوكيل استخدِم ميزة "تنفيذ الرموز البرمجية" لتحسين الإمكانات الأخرى من خلال الاستفادة من أدوات معالجة الصور. الرؤية المستندة إلى الذكاء الاصطناعي الوكيل
تنظيم المهام يمكنك الجمع بين الاستدلال المكاني وواجهات برمجة التطبيقات المخصّصة للروبوتات لإكمال مهام طويلة الأمد. تنظيم المهام
البث (نقطة نهاية البث في Gemini Robotics ER 2 فقط) البث الثنائي الاتجاه لوكلاء الروبوت في الوقت الفعلي مع إمكانية استدعاء الدوال بوقت استجابة منخفض البث للروبوتات
تقدّم الفيديو (في الإصدار الثاني من Gemini Robotics فقط) العثور على اللحظات وتصنيف مستوى التقدّم من خلاصات الفيديو المتواصل. فهم الفيديوهات

الخطوات الأولى

يعثر المثال التالي على عناصر في صورة ويعرض إحداثياتها الثنائية الأبعاد العادية وتصنيفاتها. يمكنك تمرير هذا الناتج مباشرةً إلى واجهة برمجة تطبيقات خاصة بالروبوتات أو إلى نموذج VLA لإنشاء إجراءات الروبوت.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

REST

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

سيكون الناتج مصفوفة JSON تحتوي على عناصر، كل منها يتضمّن point (إحداثيات [y, x] عادية) وlabel يحدّد العنصر.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

في ما يلي مثال على كيفية عرض هذه النقاط:

مثال يعرض نقاط العناصر في صورة

آلية العمل

تتلقّى Gemini Robotics ER الصور أو الفيديوهات أو الملفات الصوتية من خلال طلبات مكتوبة باللغة الطبيعية. تحدّد هذه الخدمة العناصر، وتستنتج سياق المشهد والعلاقات المكانية، وتعرض نتائج منظَّمة، مثل الإحداثيات أو مربّعات الإحاطة.

تتّسم Gemini Robotics ER أيضًا بالقدرة على تنفيذ المهام بشكل مستقل، إذ تقسم المهام المعقّدة إلى مهام فرعية وتنفّذها من خلال استدعاء وظائف الروبوت أو تشغيل الرمز البرمجي الذي تم إنشاؤه. على سبيل المثال، تتحوّل الجملة "ضَع التفاحة في الوعاء" إلى سلسلة من الخطوات التي تتضمّن تحديد الموقع والإمساك والتوضيع.

يمكنك الاطّلاع على استدعاء الدوال للحصول على تفاصيل حول طريقة تنفيذ Gemini لطلبات استخدام الأدوات.

الأمان

على الرغم من أنّ Gemini Robotics ER مصمَّم مع مراعاة السلامة، تقع على عاتقك مسؤولية الحفاظ على بيئة آمنة حول الروبوت. قد ترتكب نماذج الذكاء الاصطناعي التوليدي أخطاءً، وقد تتسبّب الروبوتات المادية في إلحاق الضرر. لمزيد من المعلومات، يُرجى الانتقال إلى صفحة أمان الروبوتات في Google DeepMind.

أفضل الممارسات

  1. استخدِم اللغة الطبيعية. قدِّم وصفًا للروبوت بشأن ما تريد منه تنفيذه، تمامًا كما تفعل مع شخص آخر. إذا لم تنجح عبارة بحث، جرِّب استخدام مرادف شائع.

  2. تحسين الإدخال المرئي اقطع أو كبِّر العناصر الصغيرة أو غير الواضحة قبل إرسال الصورة. يمكن أن تؤثر الإضاءة والتباين المنخفض في الألوان في عملية الرصد.

  3. قسِّم المهام المعقّدة إلى خطوات. أرسِل كل خطوة كطلب منفصل للحفاظ على تركيز النموذج وتحسين الدقة.

  4. إرسال طلبات بحث متعددة والحصول على متوسط النتائج للمهام التي تتطلّب دقة عالية يقلّل نهج التوافق هذا التباين في النتائج المكانية.

القيود

يجب مراعاة القيود التالية عند التطوير باستخدام Gemini Robotics ER:

  • القيود المفروضة على مفتاح واجهة برمجة التطبيقات: لا تقبل Gemini API الطلبات الواردة من مفاتيح واجهة برمجة التطبيقات غير الخاضعة لقيود، وتعرض الخطأ 403 Forbidden. يمكنك حماية مفتاح واجهة برمجة التطبيقات من خلال إضافة قيود في AI Studio. لمزيد من التفاصيل، يمكنك الاطّلاع على تأمين مفاتيح واجهة برمجة التطبيقات غير المحظورة.
  • وقت الاستجابة مقابل الأداء: يمكن أن تؤدي الطلبات المعقّدة أو المدخلات العالية الدقة أو مستويات التفكير العالية إلى زيادة أوقات المعالجة. بالنسبة إلى مستوى التفكير استخدِم "متوسط" لتحقيق توازن جيد بين وقت الاستجابة والأداء.
  • الهلوسات: مثل جميع النماذج اللغوية الكبيرة، يمكن أن "تهلوس" نماذج Gemini Robotics ER في بعض الأحيان أو تقدّم معلومات غير صحيحة، خاصةً في ما يتعلّق بالطلبات الغامضة أو المدخلات غير المتوقّعة.
  • الاعتماد على جودة الطلب: تعتمد جودة النتائج على وضوح الطلب الذي يتم إدخاله. استخدِم طلبات محدّدة ومنظَّمة بشكل جيد.
  • التكلفة الحسابية: يؤدي تشغيل النموذج، خاصةً مع إدخال فيديوهات أو thinking_budget مرتفع، إلى استهلاك موارد حسابية وتكبّد تكاليف. يمكنك الاطّلاع على صفحة التفكير لمزيد من التفاصيل.
  • أنواع الإدخال: اطّلِع على المواضيع التالية لمعرفة تفاصيل حول القيود المفروضة على كل وضع.

إشعار الخصوصية

أنت تقرّ بأنّ النماذج المشار إليها في هذا المستند ("نماذج الروبوتات") تستخدم بيانات الفيديو والصوت لتشغيل الأجهزة وتحريكها وفقًا لتعليماتك. وبالتالي، يمكنك تشغيل &quot;نماذج الروبوتات&quot; بطريقة تؤدي إلى جمع بيانات من أشخاص يمكن التعرّف عليهم، مثل بيانات الصوت والصور والتشابه (&quot;البيانات الشخصية&quot;). إذا اخترت تشغيل "نماذج الروبوتات" بطريقة تجمع "البيانات الشخصية"، أنت توافق على عدم السماح لأي أشخاص يمكن التعرّف عليهم بالتفاعل مع "نماذج الروبوتات" أو التواجد في المنطقة المحيطة بها، إلا بعد إبلاغ هؤلاء الأشخاص بشكل كافٍ وموافقتهم على إمكانية تقديم بياناتهم الشخصية إلى Google واستخدامها من قِبلها على النحو الموضّح في "بنود الخدمة الإضافية لخدمة Gemini API" المتوفّرة على الرابط https://ai.google.dev/gemini-api/terms (المشار إليها باسم "البنود")، بما في ذلك وفقًا للقسم بعنوان "طريقة استخدام Google لبياناتك". ستضمن أنّ هذا الإشعار يسمح بجمع البيانات الشخصية واستخدامها على النحو الموضّح في &quot;البنود&quot;، وستبذل جهودًا معقولة تجاريًا للحدّ من جمع البيانات الشخصية وتوزيعها باستخدام تقنيات مثل تمويه الوجوه وتشغيل &quot;نماذج الروبوتات&quot; في مناطق لا تحتوي على أشخاص يمكن التعرّف عليهم إلى الحدّ الذي يمكن تنفيذه عمليًا.

الأسعار

للحصول على معلومات تفصيلية حول الأسعار والمناطق المتاحة، يُرجى الرجوع إلى صفحة الأسعار.

نقاط نهاية النماذج

‫Gemini Robotics ER 2 Preview

الموقع الوصف
رمز النموذج gemini-robotics-er-2-preview
أنواع البيانات المتوافقة

المدخلات

النصوص والصور والفيديوهات والمحتوى الصوتي

الناتج

نص

حدود الرموز المميزة[*]

الحدّ الأقصى لعدد الرموز المميزة التي يمكن إدخالها

131,072

الحدّ الأقصى لعدد الرموز المميزة الناتجة

65,536

الإمكانات

إنشاء الصوت

غير متاح

التخزين المؤقت

متاح

تنفيذ الرموز البرمجية

متاح

استخدام الكمبيوتر

متاح

البحث عن الملفات

متاح

استدعاء الدوال

متاح

استخدام "خرائط Google" كمصدر

متاح

إنشاء الصور

غير متاح

Live API

غير متاح

تحديد المصادر في "بحث Google"

متاح

المُخرجات المنظَّمة

متاح

التفكير

متاح

سياق عنوان URL

متاح

خيارات الاستهلاك

Batch API

متاح

الاستدلال المرن

غير متاح

استنتاج الأولوية

غير متاح

الإصدارات
يمكنك الاطّلاع على أنماط إصدارات النماذج لمزيد من التفاصيل.
  • معاينة: gemini-robotics-er-2-preview
آخر تعديل يوليو 2026
بطاقة النموذج بطاقة النموذج

Gemini Robotics ER 2 Streaming Preview

الموقع الوصف
رمز النموذج gemini-robotics-er-2-streaming-preview
أنواع البيانات المتوافقة

المدخلات

النصوص والصور والفيديوهات والمحتوى الصوتي

الناتج

نص

حدود الرموز المميزة[*]

الحدّ الأقصى لعدد الرموز المميزة التي يمكن إدخالها

131,072

الحدّ الأقصى لعدد الرموز المميزة الناتجة

65,536

الإمكانات

إنشاء الصوت

غير متاح

التخزين المؤقت

غير متاح

تنفيذ الرموز البرمجية

غير متاح

استخدام الكمبيوتر

غير متاح

البحث عن الملفات

غير متاح

استدعاء الدوال

متاح

استخدام "خرائط Google" كمصدر

غير متاح

إنشاء الصور

غير متاح

Live API

متاح

تحديد المصادر في "بحث Google"

متاح

المُخرجات المنظَّمة

غير متاح

التفكير

متاح

سياق عنوان URL

غير متاح

خيارات الاستهلاك

Batch API

غير متاح

الاستدلال المرن

غير متاح

استنتاج الأولوية

غير متاح

الإصدارات
يمكنك الاطّلاع على أنماط إصدارات النماذج لمزيد من التفاصيل.
  • معاينة: gemini-robotics-er-2-streaming-preview
آخر تعديل يوليو 2026
بطاقة النموذج بطاقة النموذج

معاينة Gemini Robotics ER 1.6

الموقع الوصف
رمز النموذج gemini-robotics-er-1.6-preview
أنواع البيانات المتوافقة

المدخلات

النصوص والصور والفيديوهات والمحتوى الصوتي

الناتج

نص

حدود الرموز المميزة[*]

الحدّ الأقصى لعدد الرموز المميزة التي يمكن إدخالها

131,072

الحدّ الأقصى لعدد الرموز المميزة الناتجة

65,536

الإمكانات

إنشاء الصوت

غير متاح

التخزين المؤقت

متاح

تنفيذ الرموز البرمجية

متاح

استخدام الكمبيوتر

متاح

البحث عن الملفات

متاح

استدعاء الدوال

متاح

استخدام "خرائط Google" كمصدر

متاح

إنشاء الصور

غير متاح

Live API

غير متاح

تحديد المصادر في "بحث Google"

متاح

المُخرجات المنظَّمة

متاح

التفكير

متاح

سياق عنوان URL

متاح

خيارات الاستهلاك

Batch API

متاح

الاستدلال المرن

غير متاح

استنتاج الأولوية

غير متاح

الإصدارات
يمكنك الاطّلاع على أنماط إصدارات النماذج لمزيد من التفاصيل.
  • معاينة: gemini-robotics-er-1.6-preview
آخر تعديل ديسمبر 2025
تاريخ آخر تحديث للبيانات يناير 2025

الخطوات التالية