ER e Robotics Gemini

Modelet ER (arsyetimi i mishëruar) të Gemini Robotics janë modele të gjuhës së vizionit (VLM) që i lejojnë robotët të perceptojnë dhe të bashkëveprojnë me botën fizike. Ata interpretojnë të dhënat vizuale, kryejnë arsyetim hapësinor dhe kohor, planifikojnë detyra me shumë hapa dhe orkestrojnë robotë dhe mjete.

Modele

Modeli Gemini Robotics ER 2 është modeli më i fundit në Gemini Robotics. Është modeli ynë i përditësuar i arsyetimit që u mundëson robotëve të kuptojnë me saktësi mjedisin e tyre. Ai specializohet në aftësitë e arsyetimit të mishëruar, siç është orkestrimi agjentik i robotëve (p.sh. duke përdorur VLA), kuptimi i videos së robotit duke përfshirë kuptimin e progresit dhe zbulimin e suksesit, leximin e instrumenteve, drejtimin dhe arsyetimin hapësinor.

Modeli Gemini Robotics ER 2 prezanton dy pika fundore të modelit:

  • gemini-robotics-er-2-preview : Modeli standard ER 2. Ndërtohet mbi Gemini 3.5 Flash me arsyetim hapësinor të përmirësuar, gjetje të momenteve video, klasifikim të progresit të videos, orkestrim me shumë robotë dhe përdorim mjetesh me shumë hapa.
  • gemini-robotics-er-2-streaming-preview : Optimizuar për transmetim në kohë reale nëpërmjet Live API . Përdorni këtë model për agjentë robotikë me vonesë të ulët që përpunojnë të dhëna të vazhdueshme audio dhe video.

Nëse po përdorni Gemini Robotics ER 1.6, përditësojeni në Gemini Robotics ER 2 duke zëvendësuar model="gemini-robotics-er-1.6-preview" me model="gemini-robotics-er-2-preview" ose model="gemini-robotics-er-2-streaming-preview" në thirrjet tuaja API. Vini re se modeli Gemini Robotics ER 1.6 do të mbyllet në fund të gushtit .

Provoni Gemini Robotics ER 2 në Google AI Studio

Aftësitë e robotikës

Gemini Robotics ER mbështet një gamë të gjerë aftësish arsyetimi të mishëruara. Zgjidhni një aftësi për të mësuar më shumë:

Aftësia Përshkrimi Udhëzues
Arsyetimi hapësinor Trego objekte, gjurmoji ato në video, zbuloji me anë të kutive kufizuese, planifiko trajektore. Arsyetimi hapësinor
Vizioni agjentik Përdorni ekzekutimin e kodit për të përmirësuar aftësi të tjera duke shfrytëzuar mjetet e manipulimit të imazheve. Vizioni agjentik
Orkestrimi i detyrave Kombinoni arsyetimin hapësinor me API-të e robotëve të personalizuar për të përfunduar detyra me horizont të gjatë. Orkestrimi i detyrave
Transmetim (vetëm pika fundore e transmetimit Gemini Robotics ER 2) Transmetim bidirektiv për agjentë robotë në kohë reale me thirrje të funksioneve me latencë të ulët. Transmetim për robotikë
Progresi i videos (vetëm Gemini Robotics ER 2) Gjetja e momenteve dhe klasifikimi i progresit nga transmetimet e vazhdueshme të videos. Kuptimi i videos

Fillimi

Shembulli i mëposhtëm gjen objektet në një imazh dhe kthen koordinatat dhe etiketat e tyre të normalizuara 2D. Mund ta kaloni këtë rezultat direkt në një API robotike ose një model VLA për të gjeneruar veprime të robotit.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

PUSHTIM

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

Rezultati do të jetë një varg JSON që përmban objekte, secila me një point (koordinatat e normalizuara [y, x] ) dhe një label që identifikon objektin.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

Imazhi i mëposhtëm është një shembull se si mund të shfaqen këto pika:

Një shembull që shfaq pikat e objekteve në një imazh

Si funksionon

Gemini Robotics ER merr të dhëna hyrëse imazhi, videoje ose audioje me udhëzime në gjuhën natyrore. Ai identifikon objektet, arsyet rreth kontekstit të skenës dhe marrëdhëniet hapësinore, dhe kthen të dhëna të strukturuara si koordinata ose kuti kufizuese.

Gemini Robotics ER është gjithashtu agjentik: ai i ndan detyrat komplekse në nën-detyra dhe i ekzekuton ato duke thirrur funksionet e robotit tuaj ose duke ekzekutuar kodin e gjeneruar. Për shembull, "vendos mollën në tas" bëhet një sekuencë hapash për të gjetur, kapur dhe vendosur.

Shihni Thirrja e Funksionit për detaje se si Gemini ekzekuton thirrjet e mjeteve.

Siguria

Ndërsa Gemini Robotics ER u ndërtua duke pasur parasysh sigurinë, është përgjegjësia juaj të ruani një mjedis të sigurt rreth robotit. Modelet gjeneruese të IA-së mund të bëjnë gabime dhe robotët fizikë mund të shkaktojnë dëme. Për të mësuar më shumë, vizitoni faqen e sigurisë së robotikës në Google DeepMind .

Praktikat më të mira

  1. Përdorni gjuhë të thjeshtë dhe natyrale. Përshkruani se çfarë doni që roboti të bëjë ashtu siç do të bënit me një person. Nëse një term nuk funksionon, provoni një sinonim të zakonshëm.

  2. Optimizoni të dhënat vizuale. Pritini ose zmadhoni objektet e vogla ose të paqarta përpara se të dërgoni imazhin. Ndriçimi dhe kontrasti i ulët i ngjyrave mund të ndikojnë në zbulimin.

  3. Ndani detyrat komplekse në hapa. Dërgoni çdo hap si një kërkesë të veçantë për ta mbajtur modelin të fokusuar dhe për të përmirësuar saktësinë.

  4. Kryeni pyetje të shumëfishta dhe nxirrni rezultate mesatare për detyra me precizion të lartë. Kjo qasje konsensusi zvogëlon variancën në rezultatet hapësinore.

Kufizime

Merrni parasysh kufizimet e mëposhtme kur zhvilloni me Gemini Robotics ER:

  • Kufizimet e çelësit API: API Gemini nuk pranon kërkesa nga çelësat API të pakufizuar dhe kthen një gabim 403 Forbidden . Siguroni çelësin tuaj API duke shtuar kufizime në AI Studio . Shihni Siguroni çelësat API të pakufizuar për detaje.
  • Vonesa kundrejt performancës: Pyetjet komplekse, të dhënat hyrëse me rezolucion të lartë ose nivelet e larta të të menduarit mund të çojnë në kohë më të gjata përpunimi. Për nivelin e të menduarit, përdorni nivelin mesatar për një ekuilibër të mirë midis latencës dhe performancës.
  • Halucinacione: Ashtu si të gjitha modelet e mëdha gjuhësore, modelet Gemini Robotics ER mund të "halucinojnë" herë pas here ose të japin informacion të pasaktë, veçanërisht për kërkesa të paqarta ose të dhëna jashtë shpërndarjes.
  • Varësia nga cilësia e mesazhit të dhënë: Cilësia e rezultatit varet nga qartësia e mesazhit të dhënë në hyrje. Përdorni mesazhe specifike dhe të strukturuara mirë.
  • Kostoja llogaritëse: Ekzekutimi i modelit, veçanërisht me hyrje video ose thinking_budget të lartë, konsumon burime llogaritëse dhe shkakton kosto. Shihni faqen e të menduarit për më shumë detaje.
  • Llojet e të dhënave hyrëse: Shihni temat e mëposhtme për detaje mbi kufizimet për secilin modalitet.

Njoftim për Privatësinë

Ju pranoni që modelet e referuara në këtë dokument ("Modelet e Robotikës") shfrytëzojnë të dhënat video dhe audio për të operuar dhe lëvizur harduerin tuaj në përputhje me udhëzimet tuaja. Prandaj, ju mund të operoni Modelet e Robotikës në mënyrë që të dhënat nga persona të identifikueshëm, siç janë zëri, imazhet dhe të dhënat e ngjashmërisë ("Të Dhënat Personale"), të mblidhen nga Modelet e Robotikës. Nëse zgjidhni të operoni Modelet e Robotikës në një mënyrë që mbledh të Dhëna Personale, ju pranoni se nuk do të lejoni asnjë person të identifikueshëm të bashkëveprojë me, ose të jetë i pranishëm në zonën përreth, Modeleve të Robotikës, përveç nëse dhe derisa personat e tillë të identifikueshëm të jenë njoftuar mjaftueshëm dhe të kenë dhënë pëlqimin për faktin se të Dhënat e tyre Personale mund t'i ofrohen dhe të përdoren nga Google, siç përshkruhet në Kushtet Shtesë të Shërbimit të Gemini API që gjenden në https://ai.google.dev/gemini-api/terms ("Kushtet"), duke përfshirë edhe në përputhje me seksionin e titulluar "Si i Përdor Google të Dhënat Tuaja". Ju do të siguroheni që një njoftim i tillë lejon mbledhjen dhe përdorimin e të Dhënave Personale siç përcaktohet në Kushte, dhe do të bëni përpjekje të arsyeshme komerciale për të minimizuar mbledhjen dhe shpërndarjen e të Dhënave Personale duke përdorur teknika të tilla si mjegullimi i fytyrës dhe operimi i Modeleve Robotike në zona që nuk përmbajnë persona të identifikueshëm në masën e praktikueshme.

Çmimet

Për informacion të detajuar mbi çmimet dhe rajonet e disponueshme, referojuni faqes së çmimeve .

Pikat fundore të modelit

Pamje paraprake e Gemini Robotics ER 2

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-2-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Mbështetur

Përdorimi i kompjuterit

Mbështetur

Kërkim skedarësh

Mbështetur

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Mbështetur

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Mbështetur

Të menduarit

Mbështetur

Konteksti i URL-së

Mbështetur

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-2-preview
Përditësimi më i fundit Korrik 2026
Modeli i kartës Kartë modeli

Pamje paraprake e transmetimit të Gemini Robotics ER 2

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-2-streaming-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Nuk mbështetet

Ekzekutimi i kodit

Nuk mbështetet

Përdorimi i kompjuterit

Nuk mbështetet

Kërkim skedarësh

Nuk mbështetet

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Nuk mbështetet

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Mbështetur

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Nuk mbështetet

Të menduarit

Mbështetur

Konteksti i URL-së

Nuk mbështetet

Opsionet e konsumit të

API-ja e grupeve

Nuk mbështetet

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-2-streaming-preview
Përditësimi më i fundit Korrik 2026
Modeli i kartës Kartë modeli

Pamje paraprake e Gemini Robotics ER 1.6

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-1.6-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Mbështetur

Përdorimi i kompjuterit

Mbështetur

Kërkim skedarësh

Mbështetur

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Mbështetur

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Mbështetur

Të menduarit

Mbështetur

Konteksti i URL-së

Mbështetur

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-1.6-preview
Përditësimi më i fundit Dhjetor 2025
i njohurive Janar 2025

Çfarë vjen më pas

,

Modelet ER (arsyetimi i mishëruar) të Gemini Robotics janë modele të gjuhës së vizionit (VLM) që i lejojnë robotët të perceptojnë dhe të bashkëveprojnë me botën fizike. Ata interpretojnë të dhënat vizuale, kryejnë arsyetim hapësinor dhe kohor, planifikojnë detyra me shumë hapa dhe orkestrojnë robotë dhe mjete.

Modele

Modeli Gemini Robotics ER 2 është modeli më i fundit në Gemini Robotics. Është modeli ynë i përditësuar i arsyetimit që u mundëson robotëve të kuptojnë me saktësi mjedisin e tyre. Ai specializohet në aftësitë e arsyetimit të mishëruar, siç është orkestrimi agjentik i robotëve (p.sh. duke përdorur VLA), kuptimi i videos së robotit duke përfshirë kuptimin e progresit dhe zbulimin e suksesit, leximin e instrumenteve, drejtimin dhe arsyetimin hapësinor.

Modeli Gemini Robotics ER 2 prezanton dy pika fundore të modelit:

  • gemini-robotics-er-2-preview : Modeli standard ER 2. Ndërtohet mbi Gemini 3.5 Flash me arsyetim hapësinor të përmirësuar, gjetje të momenteve video, klasifikim të progresit të videos, orkestrim me shumë robotë dhe përdorim mjetesh me shumë hapa.
  • gemini-robotics-er-2-streaming-preview : Optimizuar për transmetim në kohë reale nëpërmjet Live API . Përdorni këtë model për agjentë robotikë me vonesë të ulët që përpunojnë të dhëna të vazhdueshme audio dhe video.

Nëse po përdorni Gemini Robotics ER 1.6, përditësojeni në Gemini Robotics ER 2 duke zëvendësuar model="gemini-robotics-er-1.6-preview" me model="gemini-robotics-er-2-preview" ose model="gemini-robotics-er-2-streaming-preview" në thirrjet tuaja API. Vini re se modeli Gemini Robotics ER 1.6 do të mbyllet në fund të gushtit .

Provoni Gemini Robotics ER 2 në Google AI Studio

Aftësitë e robotikës

Gemini Robotics ER mbështet një gamë të gjerë aftësish arsyetimi të mishëruara. Zgjidhni një aftësi për të mësuar më shumë:

Aftësia Përshkrimi Udhëzues
Arsyetimi hapësinor Trego objekte, gjurmoji ato në video, zbuloji me anë të kutive kufizuese, planifiko trajektore. Arsyetimi hapësinor
Vizioni agjentik Përdorni ekzekutimin e kodit për të përmirësuar aftësi të tjera duke shfrytëzuar mjetet e manipulimit të imazheve. Vizioni agjentik
Orkestrimi i detyrave Kombinoni arsyetimin hapësinor me API-të e robotëve të personalizuar për të përfunduar detyra me horizont të gjatë. Orkestrimi i detyrave
Transmetim (vetëm pika fundore e transmetimit Gemini Robotics ER 2) Transmetim bidirektiv për agjentë robotë në kohë reale me thirrje të funksioneve me latencë të ulët. Transmetim për robotikë
Progresi i videos (vetëm Gemini Robotics ER 2) Gjetja e momenteve dhe klasifikimi i progresit nga transmetimet e vazhdueshme të videos. Kuptimi i videos

Fillimi

Shembulli i mëposhtëm gjen objektet në një imazh dhe kthen koordinatat dhe etiketat e tyre të normalizuara 2D. Mund ta kaloni këtë rezultat direkt në një API robotike ose një model VLA për të gjeneruar veprime të robotit.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

PUSHTIM

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

Rezultati do të jetë një varg JSON që përmban objekte, secila me një point (koordinatat e normalizuara [y, x] ) dhe një label që identifikon objektin.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

Imazhi i mëposhtëm është një shembull se si mund të shfaqen këto pika:

Një shembull që shfaq pikat e objekteve në një imazh

Si funksionon

Gemini Robotics ER merr të dhëna hyrëse imazhi, videoje ose audioje me udhëzime në gjuhën natyrore. Ai identifikon objektet, arsyet rreth kontekstit të skenës dhe marrëdhëniet hapësinore, dhe kthen të dhëna të strukturuara si koordinata ose kuti kufizuese.

Gemini Robotics ER është gjithashtu agjentik: ai i ndan detyrat komplekse në nën-detyra dhe i ekzekuton ato duke thirrur funksionet e robotit tuaj ose duke ekzekutuar kodin e gjeneruar. Për shembull, "vendos mollën në tas" bëhet një sekuencë hapash për të gjetur, kapur dhe vendosur.

Shihni Thirrja e Funksionit për detaje se si Gemini ekzekuton thirrjet e mjeteve.

Siguria

Ndërsa Gemini Robotics ER u ndërtua duke pasur parasysh sigurinë, është përgjegjësia juaj të ruani një mjedis të sigurt rreth robotit. Modelet gjeneruese të IA-së mund të bëjnë gabime dhe robotët fizikë mund të shkaktojnë dëme. Për të mësuar më shumë, vizitoni faqen e sigurisë së robotikës në Google DeepMind .

Praktikat më të mira

  1. Përdorni gjuhë të thjeshtë dhe natyrale. Përshkruani se çfarë doni që roboti të bëjë ashtu siç do të bënit me një person. Nëse një term nuk funksionon, provoni një sinonim të zakonshëm.

  2. Optimizoni të dhënat vizuale. Pritini ose zmadhoni objektet e vogla ose të paqarta përpara se të dërgoni imazhin. Ndriçimi dhe kontrasti i ulët i ngjyrave mund të ndikojnë në zbulimin.

  3. Ndani detyrat komplekse në hapa. Dërgoni çdo hap si një kërkesë të veçantë për ta mbajtur modelin të fokusuar dhe për të përmirësuar saktësinë.

  4. Kryeni pyetje të shumëfishta dhe nxirrni rezultate mesatare për detyra me precizion të lartë. Kjo qasje konsensusi zvogëlon variancën në rezultatet hapësinore.

Kufizime

Merrni parasysh kufizimet e mëposhtme kur zhvilloni me Gemini Robotics ER:

  • Kufizimet e çelësit API: API Gemini nuk pranon kërkesa nga çelësat API të pakufizuar dhe kthen një gabim 403 Forbidden . Siguroni çelësin tuaj API duke shtuar kufizime në AI Studio . Shihni Siguroni çelësat API të pakufizuar për detaje.
  • Vonesa kundrejt performancës: Pyetjet komplekse, të dhënat hyrëse me rezolucion të lartë ose nivelet e larta të të menduarit mund të çojnë në kohë më të gjata përpunimi. Për nivelin e të menduarit, përdorni nivelin mesatar për një ekuilibër të mirë midis latencës dhe performancës.
  • Halucinacione: Ashtu si të gjitha modelet e mëdha gjuhësore, modelet Gemini Robotics ER mund të "halucinojnë" herë pas here ose të japin informacion të pasaktë, veçanërisht për kërkesa të paqarta ose të dhëna jashtë shpërndarjes.
  • Varësia nga cilësia e mesazhit të dhënë: Cilësia e rezultatit varet nga qartësia e mesazhit të dhënë në hyrje. Përdorni mesazhe specifike dhe të strukturuara mirë.
  • Kostoja llogaritëse: Ekzekutimi i modelit, veçanërisht me hyrje video ose thinking_budget të lartë, konsumon burime llogaritëse dhe shkakton kosto. Shihni faqen e të menduarit për më shumë detaje.
  • Llojet e të dhënave hyrëse: Shihni temat e mëposhtme për detaje mbi kufizimet për secilin modalitet.

Njoftim për Privatësinë

Ju pranoni që modelet e referuara në këtë dokument ("Modelet e Robotikës") shfrytëzojnë të dhënat video dhe audio për të operuar dhe lëvizur harduerin tuaj në përputhje me udhëzimet tuaja. Prandaj, ju mund të operoni Modelet e Robotikës në mënyrë që të dhënat nga persona të identifikueshëm, siç janë zëri, imazhet dhe të dhënat e ngjashmërisë ("Të Dhënat Personale"), të mblidhen nga Modelet e Robotikës. Nëse zgjidhni të operoni Modelet e Robotikës në një mënyrë që mbledh të Dhëna Personale, ju pranoni se nuk do të lejoni asnjë person të identifikueshëm të bashkëveprojë me, ose të jetë i pranishëm në zonën përreth, Modeleve të Robotikës, përveç nëse dhe derisa personat e tillë të identifikueshëm të jenë njoftuar mjaftueshëm dhe të kenë dhënë pëlqimin për faktin se të Dhënat e tyre Personale mund t'i ofrohen dhe të përdoren nga Google, siç përshkruhet në Kushtet Shtesë të Shërbimit të Gemini API që gjenden në https://ai.google.dev/gemini-api/terms ("Kushtet"), duke përfshirë edhe në përputhje me seksionin e titulluar "Si i Përdor Google të Dhënat Tuaja". Ju do të siguroheni që një njoftim i tillë lejon mbledhjen dhe përdorimin e të Dhënave Personale siç përcaktohet në Kushte, dhe do të bëni përpjekje të arsyeshme komerciale për të minimizuar mbledhjen dhe shpërndarjen e të Dhënave Personale duke përdorur teknika të tilla si mjegullimi i fytyrës dhe operimi i Modeleve Robotike në zona që nuk përmbajnë persona të identifikueshëm në masën e praktikueshme.

Çmimet

Për informacion të detajuar mbi çmimet dhe rajonet e disponueshme, referojuni faqes së çmimeve .

Pikat fundore të modelit

Pamje paraprake e Gemini Robotics ER 2

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-2-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Mbështetur

Përdorimi i kompjuterit

Mbështetur

Kërkim skedarësh

Mbështetur

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Mbështetur

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Mbështetur

Të menduarit

Mbështetur

Konteksti i URL-së

Mbështetur

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-2-preview
Përditësimi më i fundit Korrik 2026
Modeli i kartës Kartë modeli

Pamje paraprake e transmetimit të Gemini Robotics ER 2

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-2-streaming-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Nuk mbështetet

Ekzekutimi i kodit

Nuk mbështetet

Përdorimi i kompjuterit

Nuk mbështetet

Kërkim skedarësh

Nuk mbështetet

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Nuk mbështetet

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Mbështetur

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Nuk mbështetet

Të menduarit

Mbështetur

Konteksti i URL-së

Nuk mbështetet

Opsionet e konsumit të

API-ja e grupeve

Nuk mbështetet

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-2-streaming-preview
Përditësimi më i fundit Korrik 2026
Modeli i kartës Kartë modeli

Pamje paraprake e Gemini Robotics ER 1.6

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-1.6-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Mbështetur

Përdorimi i kompjuterit

Mbështetur

Kërkim skedarësh

Mbështetur

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Mbështetur

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Mbështetur

Të menduarit

Mbështetur

Konteksti i URL-së

Mbështetur

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-1.6-preview
Përditësimi më i fundit Dhjetor 2025
i njohurive Janar 2025

Çfarë vjen më pas

,

Modelet ER (arsyetimi i mishëruar) të Gemini Robotics janë modele të gjuhës së vizionit (VLM) që i lejojnë robotët të perceptojnë dhe të bashkëveprojnë me botën fizike. Ata interpretojnë të dhënat vizuale, kryejnë arsyetim hapësinor dhe kohor, planifikojnë detyra me shumë hapa dhe orkestrojnë robotë dhe mjete.

Modele

Modeli Gemini Robotics ER 2 është modeli më i fundit në Gemini Robotics. Është modeli ynë i përditësuar i arsyetimit që u mundëson robotëve të kuptojnë me saktësi mjedisin e tyre. Ai specializohet në aftësitë e arsyetimit të mishëruar, siç është orkestrimi agjentik i robotëve (p.sh. duke përdorur VLA), kuptimi i videos së robotit duke përfshirë kuptimin e progresit dhe zbulimin e suksesit, leximin e instrumenteve, drejtimin dhe arsyetimin hapësinor.

Modeli Gemini Robotics ER 2 prezanton dy pika fundore të modelit:

  • gemini-robotics-er-2-preview : Modeli standard ER 2. Ndërtohet mbi Gemini 3.5 Flash me arsyetim hapësinor të përmirësuar, gjetje të momenteve video, klasifikim të progresit të videos, orkestrim me shumë robotë dhe përdorim mjetesh me shumë hapa.
  • gemini-robotics-er-2-streaming-preview : Optimizuar për transmetim në kohë reale nëpërmjet Live API . Përdorni këtë model për agjentë robotikë me vonesë të ulët që përpunojnë të dhëna të vazhdueshme audio dhe video.

Nëse po përdorni Gemini Robotics ER 1.6, përditësojeni në Gemini Robotics ER 2 duke zëvendësuar model="gemini-robotics-er-1.6-preview" me model="gemini-robotics-er-2-preview" ose model="gemini-robotics-er-2-streaming-preview" në thirrjet tuaja API. Vini re se modeli Gemini Robotics ER 1.6 do të mbyllet në fund të gushtit .

Provoni Gemini Robotics ER 2 në Google AI Studio

Aftësitë e robotikës

Gemini Robotics ER mbështet një gamë të gjerë aftësish arsyetimi të mishëruara. Zgjidhni një aftësi për të mësuar më shumë:

Aftësia Përshkrimi Udhëzues
Arsyetimi hapësinor Trego objekte, gjurmoji ato në video, zbuloji me anë të kutive kufizuese, planifiko trajektore. Arsyetimi hapësinor
Vizioni agjentik Përdorni ekzekutimin e kodit për të përmirësuar aftësi të tjera duke shfrytëzuar mjetet e manipulimit të imazheve. Vizioni agjentik
Orkestrimi i detyrave Kombinoni arsyetimin hapësinor me API-të e robotëve të personalizuar për të përfunduar detyra me horizont të gjatë. Orkestrimi i detyrave
Transmetim (vetëm pika fundore e transmetimit Gemini Robotics ER 2) Transmetim bidirektiv për agjentë robotë në kohë reale me thirrje të funksioneve me latencë të ulët. Transmetim për robotikë
Progresi i videos (vetëm Gemini Robotics ER 2) Gjetja e momenteve dhe klasifikimi i progresit nga transmetimet e vazhdueshme të videos. Kuptimi i videos

Fillimi

Shembulli i mëposhtëm gjen objektet në një imazh dhe kthen koordinatat dhe etiketat e tyre të normalizuara 2D. Mund ta kaloni këtë rezultat direkt në një API robotike ose një model VLA për të gjeneruar veprime të robotit.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

PUSHTIM

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

Rezultati do të jetë një varg JSON që përmban objekte, secila me një point (koordinatat e normalizuara [y, x] ) dhe një label që identifikon objektin.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

Imazhi i mëposhtëm është një shembull se si mund të shfaqen këto pika:

Një shembull që shfaq pikat e objekteve në një imazh

Si funksionon

Gemini Robotics ER merr të dhëna hyrëse imazhi, videoje ose audioje me udhëzime në gjuhën natyrore. Ai identifikon objektet, arsyet rreth kontekstit të skenës dhe marrëdhëniet hapësinore, dhe kthen të dhëna të strukturuara si koordinata ose kuti kufizuese.

Gemini Robotics ER është gjithashtu agjentik: ai i ndan detyrat komplekse në nën-detyra dhe i ekzekuton ato duke thirrur funksionet e robotit tuaj ose duke ekzekutuar kodin e gjeneruar. Për shembull, "vendos mollën në tas" bëhet një sekuencë hapash për të gjetur, kapur dhe vendosur.

Shihni Thirrja e Funksionit për detaje se si Gemini ekzekuton thirrjet e mjeteve.

Siguria

Ndërsa Gemini Robotics ER u ndërtua duke pasur parasysh sigurinë, është përgjegjësia juaj të ruani një mjedis të sigurt rreth robotit. Modelet gjeneruese të IA-së mund të bëjnë gabime dhe robotët fizikë mund të shkaktojnë dëme. Për të mësuar më shumë, vizitoni faqen e sigurisë së robotikës në Google DeepMind .

Praktikat më të mira

  1. Përdorni gjuhë të thjeshtë dhe natyrale. Përshkruani se çfarë doni që roboti të bëjë ashtu siç do të bënit me një person. Nëse një term nuk funksionon, provoni një sinonim të zakonshëm.

  2. Optimizoni të dhënat vizuale. Pritini ose zmadhoni objektet e vogla ose të paqarta përpara se të dërgoni imazhin. Ndriçimi dhe kontrasti i ulët i ngjyrave mund të ndikojnë në zbulimin.

  3. Ndani detyrat komplekse në hapa. Dërgoni çdo hap si një kërkesë të veçantë për ta mbajtur modelin të fokusuar dhe për të përmirësuar saktësinë.

  4. Kryeni pyetje të shumëfishta dhe nxirrni rezultate mesatare për detyra me precizion të lartë. Kjo qasje konsensusi zvogëlon variancën në rezultatet hapësinore.

Kufizime

Merrni parasysh kufizimet e mëposhtme kur zhvilloni me Gemini Robotics ER:

  • Kufizimet e çelësit API: API Gemini nuk pranon kërkesa nga çelësat API të pakufizuar dhe kthen një gabim 403 Forbidden . Siguroni çelësin tuaj API duke shtuar kufizime në AI Studio . Shihni Siguroni çelësat API të pakufizuar për detaje.
  • Vonesa kundrejt performancës: Pyetjet komplekse, të dhënat hyrëse me rezolucion të lartë ose nivelet e larta të të menduarit mund të çojnë në kohë më të gjata përpunimi. Për nivelin e të menduarit, përdorni nivelin mesatar për një ekuilibër të mirë midis latencës dhe performancës.
  • Halucinacione: Ashtu si të gjitha modelet e mëdha gjuhësore, modelet Gemini Robotics ER mund të "halucinojnë" herë pas here ose të japin informacion të pasaktë, veçanërisht për kërkesa të paqarta ose të dhëna jashtë shpërndarjes.
  • Varësia nga cilësia e mesazhit të dhënë: Cilësia e rezultatit varet nga qartësia e mesazhit të dhënë në hyrje. Përdorni mesazhe specifike dhe të strukturuara mirë.
  • Kostoja llogaritëse: Ekzekutimi i modelit, veçanërisht me hyrje video ose thinking_budget të lartë, konsumon burime llogaritëse dhe shkakton kosto. Shihni faqen e të menduarit për më shumë detaje.
  • Llojet e të dhënave hyrëse: Shihni temat e mëposhtme për detaje mbi kufizimet për secilin modalitet.

Njoftim për Privatësinë

Ju pranoni që modelet e referuara në këtë dokument ("Modelet e Robotikës") shfrytëzojnë të dhënat video dhe audio për të operuar dhe lëvizur harduerin tuaj në përputhje me udhëzimet tuaja. Prandaj, ju mund të operoni Modelet e Robotikës në mënyrë që të dhënat nga persona të identifikueshëm, siç janë zëri, imazhet dhe të dhënat e ngjashmërisë ("Të Dhënat Personale"), të mblidhen nga Modelet e Robotikës. Nëse zgjidhni të operoni Modelet e Robotikës në një mënyrë që mbledh të Dhëna Personale, ju pranoni se nuk do të lejoni asnjë person të identifikueshëm të bashkëveprojë me, ose të jetë i pranishëm në zonën përreth, Modeleve të Robotikës, përveç nëse dhe derisa personat e tillë të identifikueshëm të jenë njoftuar mjaftueshëm dhe të kenë dhënë pëlqimin për faktin se të Dhënat e tyre Personale mund t'i ofrohen dhe të përdoren nga Google, siç përshkruhet në Kushtet Shtesë të Shërbimit të Gemini API që gjenden në https://ai.google.dev/gemini-api/terms ("Kushtet"), duke përfshirë edhe në përputhje me seksionin e titulluar "Si i Përdor Google të Dhënat Tuaja". Ju do të siguroheni që një njoftim i tillë lejon mbledhjen dhe përdorimin e të Dhënave Personale siç përcaktohet në Kushte, dhe do të bëni përpjekje të arsyeshme komerciale për të minimizuar mbledhjen dhe shpërndarjen e të Dhënave Personale duke përdorur teknika të tilla si mjegullimi i fytyrës dhe operimi i Modeleve Robotike në zona që nuk përmbajnë persona të identifikueshëm në masën e praktikueshme.

Çmimet

Për informacion të detajuar mbi çmimet dhe rajonet e disponueshme, referojuni faqes së çmimeve .

Pikat fundore të modelit

Pamje paraprake e Gemini Robotics ER 2

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-2-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Mbështetur

Përdorimi i kompjuterit

Mbështetur

Kërkim skedarësh

Mbështetur

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Mbështetur

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Mbështetur

Të menduarit

Mbështetur

Konteksti i URL-së

Mbështetur

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-2-preview
Përditësimi më i fundit Korrik 2026
Modeli i kartës Kartë modeli

Pamje paraprake e transmetimit të Gemini Robotics ER 2

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-2-streaming-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Nuk mbështetet

Ekzekutimi i kodit

Nuk mbështetet

Përdorimi i kompjuterit

Nuk mbështetet

Kërkim skedarësh

Nuk mbështetet

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Nuk mbështetet

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Mbështetur

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Nuk mbështetet

Të menduarit

Mbështetur

Konteksti i URL-së

Nuk mbështetet

Opsionet e konsumit të

API-ja e grupeve

Nuk mbështetet

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-2-streaming-preview
Përditësimi më i fundit Korrik 2026
Modeli i kartës Kartë modeli

Pamje paraprake e Gemini Robotics ER 1.6

Pronë Përshkrimi
Kodi i modelit të gemini-robotics-er-1.6-preview
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst, imazhe, video, audio

Prodhimi

Tekst

Limitet token-it [*]

Limiti i tokenit të hyrjes

131,072

Limiti i tokenit të daljes

65,536

Aftësitë e

Gjenerimi i audios

Nuk mbështetet

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Mbështetur

Përdorimi i kompjuterit

Mbështetur

Kërkim skedarësh

Mbështetur

Thirrja e funksionit

Mbështetur

Tokëzimi me Google Maps

Mbështetur

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Mbështetur

Rezultatet e strukturuara

Mbështetur

Të menduarit

Mbështetur

Konteksti i URL-së

Mbështetur

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Nuk mbështetet

Përfundimi i përparësisë

Nuk mbështetet

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • Parapamje: gemini-robotics-er-1.6-preview
Përditësimi më i fundit Dhjetor 2025
i njohurive Janar 2025

Çfarë vjen më pas

,

Modelet ER (arsyetimi i mishëruar) të Gemini Robotics janë modele të gjuhës së vizionit (VLM) që i lejojnë robotët të perceptojnë dhe të bashkëveprojnë me botën fizike. Ata interpretojnë të dhënat vizuale, kryejnë arsyetim hapësinor dhe kohor, planifikojnë detyra me shumë hapa dhe orkestrojnë robotë dhe mjete.

Modele

Modeli Gemini Robotics ER 2 është modeli më i fundit në Gemini Robotics. Është modeli ynë i përditësuar i arsyetimit që u mundëson robotëve të kuptojnë me saktësi mjedisin e tyre. Ai specializohet në aftësitë e arsyetimit të mishëruar, siç është orkestrimi agjentik i robotëve (p.sh. duke përdorur VLA), kuptimi i videos së robotit duke përfshirë kuptimin e progresit dhe zbulimin e suksesit, leximin e instrumenteve, drejtimin dhe arsyetimin hapësinor.

Modeli Gemini Robotics ER 2 prezanton dy pika fundore të modelit:

  • gemini-robotics-er-2-preview : Modeli standard ER 2. Ndërtohet mbi Gemini 3.5 Flash me arsyetim hapësinor të përmirësuar, gjetje të momenteve video, klasifikim të progresit të videos, orkestrim me shumë robotë dhe përdorim mjetesh me shumë hapa.
  • gemini-robotics-er-2-streaming-preview : Optimizuar për transmetim në kohë reale nëpërmjet Live API . Përdorni këtë model për agjentë robotikë me vonesë të ulët që përpunojnë të dhëna të vazhdueshme audio dhe video.

Nëse po përdorni Gemini Robotics ER 1.6, përditësojeni në Gemini Robotics ER 2 duke zëvendësuar model="gemini-robotics-er-1.6-preview" me model="gemini-robotics-er-2-preview" ose model="gemini-robotics-er-2-streaming-preview" në thirrjet tuaja API. Vini re se modeli Gemini Robotics ER 1.6 do të mbyllet në fund të gushtit .

Provoni Gemini Robotics ER 2 në Google AI Studio

Aftësitë e robotikës

Gemini Robotics ER mbështet një gamë të gjerë aftësish arsyetimi të mishëruara. Zgjidhni një aftësi për të mësuar më shumë:

Aftësia Përshkrimi Udhëzues
Arsyetimi hapësinor Trego objekte, gjurmoji ato në video, zbuloji me anë të kutive kufizuese, planifiko trajektore. Arsyetimi hapësinor
Vizioni agjentik Përdorni ekzekutimin e kodit për të përmirësuar aftësi të tjera duke shfrytëzuar mjetet e manipulimit të imazheve. Vizioni agjentik
Orkestrimi i detyrave Kombinoni arsyetimin hapësinor me API-të e robotëve të personalizuar për të përfunduar detyra me horizont të gjatë. Orkestrimi i detyrave
Transmetim (vetëm pika fundore e transmetimit Gemini Robotics ER 2) Transmetim bidirektiv për agjentë robotë në kohë reale me thirrje të funksioneve me latencë të ulët. Transmetim për robotikë
Progresi i videos (vetëm Gemini Robotics ER 2) Gjetja e momenteve dhe klasifikimi i progresit nga transmetimet e vazhdueshme të videos. Kuptimi i videos

Fillimi

The following example finds objects in an image and returns their normalized 2D coordinates and labels. You can pass this output directly to a robotics API or a VLA model to generate robot actions.

Python

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

PUSHTIM

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

The output will be a JSON array containing objects, each with a point (normalized [y, x] coordinates) and a label identifying the object.

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

The following image is an example of how these points can be displayed:

An example that displays the points of objects in an image

Si funksionon

Gemini Robotics ER takes image, video, or audio input with natural language prompts. It identifies objects, reasons about scene context and spatial relationships, and returns structured output like coordinates or bounding boxes.

Gemini Robotics ER is also agentic: it breaks complex tasks into sub-tasks and executes them by calling your robot functions or running generated code. For example, "put the apple in the bowl" becomes a sequence of locate, grasp, and place steps.

See Function calling for details on how Gemini executes tool calls.

Siguria

While Gemini Robotics ER was built with safety in mind, it is your responsibility to maintain a safe environment around the robot. Generative AI models can make mistakes, and physical robots can cause damage. To learn more, visit the Google DeepMind robotics safety page .

Praktikat më të mira

  1. Use plain, natural language. Describe what you want the robot to do as you would to a person. If a term isn't working, try a common synonym.

  2. Optimize visual input. Crop or zoom into small or unclear objects before sending the image. Lighting and low color contrast can affect detection.

  3. Break complex tasks into steps. Send each step as a separate prompt to keep the model focused and improve accuracy.

  4. Query multiple times and average results for high-precision tasks. This consensus approach reduces variance on spatial outputs.

Limitations

Consider the following limitations when developing with Gemini Robotics ER:

  • API key restrictions: The Gemini API does not accept requests from unrestricted API keys and returns a 403 Forbidden error. Secure your API key by adding restrictions in AI Studio . See Secure unrestricted API keys for details.
  • Latency vs performance: Complex queries, high-resolution inputs or high thinking levels can lead to increased processing times. For thinking level use medium for a good balance between latency and performance.
  • Hallucinations: Like all large language models, Gemini Robotics ER models can occasionally "hallucinate" or provide incorrect information, especially for ambiguous prompts or out-of-distribution inputs.
  • Dependence on prompt quality: Output quality depends on the clarity of the input prompt. Use specific, well-structured prompts.
  • Computational cost: Running the model, especially with video inputs or high thinking_budget , consumes computational resources and incurs costs. See the Thinking page for more details.
  • Input types: See the following topics for details on limitations for each mode.

Njoftim për Privatësinë

You acknowledge that the models referenced in this document (the "Robotics Models") leverage video and audio data in order to operate and move your hardware in accordance with your instructions. You therefore may operate the Robotics Models such that data from identifiable persons, such as voice, imagery, and likeness data ("Personal Data"), will be collected by the Robotics Models. If you elect to operate the Robotics Models in a manner that collects Personal Data, you agree that you will not permit any identifiable persons to interact with, or be present in the area surrounding, the Robotics Models, unless and until such identifiable persons have been sufficiently notified of and consented to the fact that their Personal Data may be provided to and used by Google as outlined in the Gemini API Additional Terms of Service found at https://ai.google.dev/gemini-api/terms (the "Terms"), including in accordance with the section entitled "How Google Uses Your Data". You will ensure that such notice permits the collection and use of Personal Data as outlined in the Terms, and you will use commercially reasonable efforts to minimize the collection and distribution of Personal Data by using techniques such as face blurring and operating the Robotics Models in areas not containing identifiable persons to the extent practicable.

Çmimet

For detailed information on pricing and available regions, refer to the pricing page.

Model endpoints

Gemini Robotics ER 2 Preview

Pronë Përshkrimi
Model code gemini-robotics-er-2-preview
Supported data types

Inputs

Text, images, video, audio

Prodhimi

Tekst

Token limits [*]

Input token limit

131,072

Output token limit

65,536

Capabilities

Audio generation

Not supported

Caching

Supported

Code execution

Supported

Computer use

Supported

File search

Supported

Function calling

Supported

Tokëzimi me Google Maps

Supported

Gjenerimi i imazhit

Not supported

Live API

Not supported

Search grounding

Supported

Structured outputs

Supported

Të menduarit

Supported

URL context

Supported

Consumption options

Batch API

Supported

Flex inference

Not supported

Priority inference

Not supported

Versions
Read the model version patterns for more details.
  • Preview: gemini-robotics-er-2-preview
Latest update Korrik 2026
Model card Model card

Gemini Robotics ER 2 Streaming Preview

Pronë Përshkrimi
Model code gemini-robotics-er-2-streaming-preview
Supported data types

Inputs

Text, images, video, audio

Prodhimi

Tekst

Token limits [*]

Input token limit

131,072

Output token limit

65,536

Capabilities

Audio generation

Not supported

Caching

Not supported

Code execution

Not supported

Computer use

Not supported

File search

Not supported

Function calling

Supported

Tokëzimi me Google Maps

Not supported

Gjenerimi i imazhit

Not supported

Live API

Supported

Search grounding

Supported

Structured outputs

Not supported

Të menduarit

Supported

URL context

Not supported

Consumption options

Batch API

Not supported

Flex inference

Not supported

Priority inference

Not supported

Versions
Read the model version patterns for more details.
  • Preview: gemini-robotics-er-2-streaming-preview
Latest update Korrik 2026
Model card Model card

Gemini Robotics ER 1.6 Preview

Pronë Përshkrimi
Model code gemini-robotics-er-1.6-preview
Supported data types

Inputs

Text, images, video, audio

Prodhimi

Tekst

Token limits [*]

Input token limit

131,072

Output token limit

65,536

Capabilities

Audio generation

Not supported

Caching

Supported

Code execution

Supported

Computer use

Supported

File search

Supported

Function calling

Supported

Tokëzimi me Google Maps

Supported

Gjenerimi i imazhit

Not supported

Live API

Not supported

Search grounding

Supported

Structured outputs

Supported

Të menduarit

Supported

URL context

Supported

Consumption options

Batch API

Supported

Flex inference

Not supported

Priority inference

Not supported

Versions
Read the model version patterns for more details.
  • Preview: gemini-robotics-er-1.6-preview
Latest update Dhjetor 2025
Knowledge cutoff January 2025

What's next