Gemini Robotics ER

מודלים של Gemini Robotics ER (embodied reasoning) הם מודלים של ראייה ושפה (VLM) שמאפשרים לרובוטים לתפוס את העולם הפיזי ולקיים איתו אינטראקציה. הם מפרשים נתונים חזותיים, מבצעים ניתוח מרחבי וזמני, מתכננים משימות מרובות שלבים ומתזמנים רובוטים וכלים.

מודלים

מודל Gemini Robotics ER 2 הוא המודל העדכני ביותר ב-Gemini Robotics. זהו מודל חשיבה רציונלית העדכני שלנו, שמאפשר לרובוטים להבין את הסביבה שלהם בצורה מדויקת. הוא מתמחה ביכולות של נימוק מגולם, כמו תזמור של רובוטים על ידי סוכנים (למשל, באמצעות VLAs), הבנת סרטוני רובוטים כולל הבנת התקדמות וזיהוי הצלחה, קריאת מכשירים, הצבעה ונימוק מרחבי.

מודל Gemini Robotics ER 2 כולל שתי נקודות קצה של מודלים:

  • gemini-robotics-er-2-preview: מודל ER 2 רגיל. הוא מבוסס על Gemini 3.5 Flash וכולל שיפורים ביכולות הבאות: ניתוח מרחבי, איתור רגעים בסרטונים, סיווג של התקדמות בסרטונים, תיאום בין כמה רובוטים ושימוש בכלי רב-שלבי.
  • gemini-robotics-er-2-streaming-preview: מותאם לסטרימינג בזמן אמת באמצעות Live API. אפשר להשתמש במודל הזה לסוכני רובוט עם זמן אחזור נמוך, שמבצעים עיבוד של קלט אודיו ווידאו רציף.

אם אתם משתמשים ב-Gemini Robotics ER 1.6, אתם יכולים לשדרג ל-Gemini Robotics ER 2 על ידי החלפת model="gemini-robotics-er-1.6-preview" ב- model="gemini-robotics-er-2-preview" או ב- model="gemini-robotics-er-2-streaming-preview" בקריאות ה-API. חשוב לדעת: מודל Gemini Robotics ER 1.6 ייסגר בסוף אוגוסט.

התנסות ב-Gemini Robotics ER 2 ב-Google AI Studio

יכולות רובוטיקה

‫Gemini Robotics ER תומך במגוון יכולות של הסקת מסקנות מגוף. כדי לקבל מידע נוסף, בוחרים יכולת:

יכולת תיאור הדרכות
חשיבה מרחבית הפנייה לאובייקטים, מעקב אחריהם בסרטון, זיהוי באמצעות תיבות תוחמות, תכנון מסלולים. היגיון מרחבי
ראייה באמצעות סוכנים שימוש בהרצת קוד כדי לשפר יכולות אחרות באמצעות כלים לעריכת תמונות. Agentic vision
תזמור משימות שילוב של חשיבה מרחבית עם ממשקי API מותאמים אישית של רובוטים כדי להשלים משימות ארוכות טווח. תזמור משימות
הזרמה (רק בנקודת הקצה של Gemini Robotics ER 2 Streaming) סטרימינג דו-כיווני לסוכני רובוטים בזמן אמת עם קריאות לפונקציות בזמן אחזור נמוך. סטרימינג לרובוטיקה
התקדמות הסרטון (Gemini Robotics ER 2 בלבד) חיפוש רגעים וסיווג התקדמות מפידים רציפים של סרטונים. הבנת סרטונים

תחילת העבודה

בדוגמה הבאה מוצגים אובייקטים בתמונה ומוחזרות התוויות והקואורדינטות הדו-ממדיות המנורמלות שלהם. אפשר להעביר את הפלט הזה ישירות ל-API של רובוטיקה או למודל VLA כדי ליצור פעולות של רובוט.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

REST

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

הפלט יהיה מערך JSON שמכיל אובייקטים, שלכל אחד מהם יש point (קואורדינטות [y, x] מנורמלות) ו-label שמזהה את האובייקט.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

בתמונה הבאה אפשר לראות דוגמה לאופן שבו הנקודות האלה יכולות להופיע:

דוגמה שמציגה את הנקודות של אובייקטים בתמונה

איך זה עובד

‫Gemini Robotics ER מקבל קלט של תמונות, סרטונים או אודיו עם הנחיות בשפה טבעית. היא מזהה אובייקטים, מנתחת את ההקשר של הסצנה ואת היחסים המרחביים, ומחזירה פלט מובנה כמו קואורדינטות או תיבות תוחמות.

‫Gemini Robotics ER הוא גם סוכן: הוא מפרק משימות מורכבות למשימות משנה ומבצע אותן על ידי הפעלת פונקציות הרובוט או הפעלת קוד שנוצר. לדוגמה, המשפט "תשים את התפוח בקערה" הופך לרצף של שלבים: איתור, אחיזה והנחה.

במאמר בקשה להפעלת פונקציה מוסבר איך Gemini מבצע קריאות לכלים.

בטיחות

‫Gemini Robotics ER נבנה תוך התחשבות בבטיחות, אבל האחריות לשמירה על סביבה בטוחה סביב הרובוט היא שלכם. מודלים של AI גנרטיבי עלולים לטעות, ורובוטים פיזיים עלולים לגרום נזק. מידע נוסף זמין בדף בנושא בטיחות רובוטים של Google DeepMind.

שיטות מומלצות

  1. השתמשו בשפה פשוטה וטבעית. מתארים מה רוצים שהרובוט יעשה, כמו שמסבירים לאדם אחר. אם מונח מסוים לא עובד, נסו להשתמש במילה נרדפת נפוצה.

  2. אופטימיזציה של קלט חזותי. לפני ששולחים את התמונה, כדאי לחתוך או לשנות את מרחק התצוגה של אובייקטים קטנים או לא ברורים. תאורה וניגודיות צבעים נמוכה יכולים להשפיע על הזיהוי.

  3. כדאי לפצל משימות מורכבות לשלבים. כדי לשמור על המיקוד של המודל ולשפר את הדיוק, שולחים כל שלב כהנחיה נפרדת.

  4. כדי לבצע משימות שדורשות דיוק גבוה, כדאי להריץ את השאילתה כמה פעמים ולחשב את ממוצע התוצאות. גישת הקונצנזוס הזו מצמצמת את השונות בתוצאות המרחביות.

מגבלות

כשמפתחים באמצעות Gemini Robotics ER, חשוב לקחת בחשבון את המגבלות הבאות:

  • הגבלות על מפתחות API: Gemini API לא מקבל בקשות ממפתחות API ללא הגבלות ומחזיר שגיאה 403 Forbidden. כדי לאבטח את מפתח ה-API, מוסיפים הגבלות ב-AI Studio. פרטים נוספים זמינים במאמר בנושא אבטחת מפתחות API ללא הגבלות.
  • זמן אחזור לעומת ביצועים: שאילתות מורכבות, קלט ברזולוציה גבוהה או רמות חשיבה גבוהות יכולים להוביל לזמני עיבוד ארוכים יותר. לרמת החשיבה, כדאי להשתמש בערך 'בינוני' כדי ליצור איזון טוב בין זמן האחזור לביצועים.
  • הזיות: כמו כל המודלים הגדולים של שפה, מודלים של Gemini Robotics ER יכולים מדי פעם "להזות" או לספק מידע שגוי, במיוחד בהנחיות מעורפלות או בקלט שהוא מחוץ להתפלגות.
  • תלות באיכות ההנחיה: איכות הפלט תלויה בבהירות של ההנחיה. חשוב להשתמש בהנחיות ספציפיות ומובנות היטב.
  • עלות החישוב: הפעלת המודל, במיוחד עם נתוני וידאו או עם thinking_budget גבוה, צורכת משאבי מחשוב וגוררת עלויות. פרטים נוספים מופיעים בדף חשיבה.
  • סוגי קלט: בקישורים הבאים מפורטות המגבלות של כל מצב.

הודעת פרטיות

אתם מאשרים שהמודלים שמצוינים במסמך הזה ('מודלים של רובוטיקה') משתמשים בנתוני וידאו ואודיו כדי לפעול ולהזיז את החומרה בהתאם להוראות שלכם. לכן, יכול להיות שתפעילו את המודלים של הרובוטיקה כך שהם יאספו נתונים מאנשים שאפשר לזהות, כמו נתוני קול, תמונות ונתונים שקשורים לדמות שלהם ('מידע אישי'). אם תבחרו להפעיל את מודלי הרובוטיקה באופן שיאסוף מידע אישי, אתם מסכימים שלא תאפשרו לאנשים שניתן לזהות אותם ליצור אינטראקציה עם מודלי הרובוטיקה או להיות נוכחים באזור שמסביב להם, אלא אם כן הודעתם לאנשים שניתן לזהות אותם מראש שהמידע האישי שלהם עשוי להימסר ל-Google ולשמש אותה כפי שמפורט בתנאים והגבלות הנוספים לשירות של Gemini API שזמינים בכתובת https://ai.google.dev/gemini-api/terms (התנאים), כולל בהתאם לקטע שכותרתו 'איך Google משתמשת בנתונים שלך'. תדאגו שההודעה תאפשר איסוף ושימוש במידע אישי כפי שמפורט בתנאים, ותפעלו באופן סביר מבחינה מסחרית כדי לצמצם את האיסוף וההפצה של מידע אישי באמצעות טכניקות כמו טשטוש פנים והפעלת מודלים רובוטיים באזורים שלא מכילים אנשים שניתן לזהות, במידת האפשר.

תמחור

מידע מפורט על התמחור והאזורים הזמינים מופיע בדף תמחור.

נקודות קצה של מודלים

‫Gemini Robotics ER 2 Preview

נכס תיאור
קוד מודל gemini-robotics-er-2-preview
סוגי נתונים נתמכים

קלטים

טקסט, תמונות, סרטונים, אודיו

פלט

טקסט

מגבלות על טוקנים[*]

מגבלת טוקנים של קלט

131,072

Output token limit

65,536

יכולות

יצירת אודיו

לא נתמך

שמירת נתונים במטמון

נתמך

הרצת קוד

נתמך

שימוש במחשב

נתמך

חיפוש קבצים

נתמך

בקשה להפעלת פונקציה

נתמך

עיגון בעזרת מפות Google

נתמך

יצירת תמונות

לא נתמך

Live API

לא נתמך

חיפוש עם עיגון בנתונים

נתמך

פלטים מובנים

נתמך

חשיבה

נתמך

הקשר של כתובת ה-URL

נתמך

אפשרויות צריכה

Batch API

נתמך

הסקת מסקנות ב-Flex

לא נתמך

הסקת עדיפות

לא נתמך

גרסאות
פרטים נוספים זמינים במאמר בנושא תבניות של גרסאות מודל.
  • תצוגה מקדימה: gemini-robotics-er-2-preview
העדכון האחרון יולי 2026
כרטיס מודל כרטיס מודל

‫Gemini Robotics ER 2 Streaming Preview

נכס תיאור
קוד מודל gemini-robotics-er-2-streaming-preview
סוגי נתונים נתמכים

קלטים

טקסט, תמונות, סרטונים, אודיו

פלט

טקסט

מגבלות על טוקנים[*]

מגבלת טוקנים של קלט

131,072

Output token limit

65,536

יכולות

יצירת אודיו

לא נתמך

שמירת נתונים במטמון

לא נתמך

הרצת קוד

לא נתמך

שימוש במחשב

לא נתמך

חיפוש קבצים

לא נתמך

בקשה להפעלת פונקציה

נתמך

עיגון בעזרת מפות Google

לא נתמך

יצירת תמונות

לא נתמך

Live API

נתמך

חיפוש עם עיגון בנתונים

נתמך

פלטים מובנים

לא נתמך

חשיבה

נתמך

הקשר של כתובת ה-URL

לא נתמך

אפשרויות צריכה

Batch API

לא נתמך

הסקת מסקנות ב-Flex

לא נתמך

הסקת עדיפות

לא נתמך

גרסאות
פרטים נוספים זמינים במאמר בנושא תבניות של גרסאות מודל.
  • תצוגה מקדימה: gemini-robotics-er-2-streaming-preview
העדכון האחרון יולי 2026
כרטיס מודל כרטיס מודל

‫Gemini Robotics ER 1.6 Preview

נכס תיאור
קוד מודל gemini-robotics-er-1.6-preview
סוגי נתונים נתמכים

קלטים

טקסט, תמונות, סרטונים, אודיו

פלט

טקסט

מגבלות על טוקנים[*]

מגבלת טוקנים של קלט

131,072

Output token limit

65,536

יכולות

יצירת אודיו

לא נתמך

שמירת נתונים במטמון

נתמך

הרצת קוד

נתמך

שימוש במחשב

נתמך

חיפוש קבצים

נתמך

בקשה להפעלת פונקציה

נתמך

עיגון בעזרת מפות Google

נתמך

יצירת תמונות

לא נתמך

Live API

לא נתמך

חיפוש עם עיגון בנתונים

נתמך

פלטים מובנים

נתמך

חשיבה

נתמך

הקשר של כתובת ה-URL

נתמך

אפשרויות צריכה

Batch API

נתמך

הסקת מסקנות ב-Flex

לא נתמך

הסקת עדיפות

לא נתמך

גרסאות
פרטים נוספים זמינים במאמר בנושא תבניות של גרסאות מודל.
  • תצוגה מקדימה: gemini-robotics-er-1.6-preview
העדכון האחרון דצמבר 2025
תאריך סף הידע ינואר 2025

המאמרים הבאים