Model Gemini Robotics ER (penalaran berwujud) adalah model bahasa visual (VLM) yang memungkinkan robot memahami dan berinteraksi dengan dunia fisik. Mereka menafsirkan data visual, melakukan penalaran spasial dan temporal, merencanakan tugas multi-langkah, serta mengatur robot dan alat.
Model
Model Gemini Robotics ER 2 adalah model terbaru di Gemini Robotics. Model penalaran yang diperbarui ini memungkinkan robot memahami lingkungan mereka dengan tepat. Model ini dikhususkan untuk kemampuan penalaran berwujud, seperti orkestrasi agen robot (misalnya, menggunakan VLA), pemahaman video robot termasuk pemahaman progres dan deteksi keberhasilan, pembacaan instrumen, penunjuk, dan penalaran spasial.
Model Gemini Robotics ER 2 memperkenalkan dua endpoint model:
gemini-robotics-er-2-preview: Model ER 2 standar. Dibuat berdasarkan Gemini 3.5 Flash dengan penalaran spasial yang ditingkatkan, penemuan momen video, klasifikasi progres video, orkestrasi multi-robot, dan penggunaan alat multi-langkah.gemini-robotics-er-2-streaming-preview: Dioptimalkan untuk streaming real-time melalui Live API. Gunakan model ini untuk agen robot latensi rendah yang memproses input audio dan video berkelanjutan.
Jika Anda menggunakan Gemini Robotics ER 1.6, upgrade ke Gemini Robotics ER 2 dengan mengganti
model="gemini-robotics-er-1.6-preview" dengan
model="gemini-robotics-er-2-preview" atau
model="gemini-robotics-er-2-streaming-preview" dalam panggilan API Anda. Perhatikan bahwa model Gemini Robotics ER 1.6 akan dinonaktifkan pada akhir Agustus.
Mencoba Gemini Robotics ER 2 di Google AI Studio
Kemampuan robotika
Gemini Robotics ER mendukung berbagai kemampuan penalaran berwujud. Pilih kemampuan untuk mempelajari lebih lanjut:
| Kemampuan | Deskripsi | Panduan |
|---|---|---|
| Penalaran spasial | Arahkan ke objek, lacak dalam video, deteksi dengan kotak pembatas, rencanakan lintasan. | Penalaran spasial |
| Visi agentic | Gunakan eksekusi kode untuk meningkatkan kemampuan lain dengan memanfaatkan alat manipulasi gambar. | Visi agentik |
| Orkestrasi tugas | Menggabungkan penalaran spasial dengan API robot kustom untuk menyelesaikan tugas dengan cakupan waktu yang panjang. | Orkestrasi tugas |
| Streaming (khusus endpoint Streaming Gemini Robotics ER 2) | Streaming dua arah untuk agen robot real-time dengan panggilan fungsi berlatensi rendah. | Streaming untuk robotika |
| Progres video (khusus Gemini Robotics ER 2) | Penemuan momen dan klasifikasi progres dari feed video berkelanjutan. | Pemahaman video |
Memulai
Contoh berikut menemukan objek dalam gambar dan menampilkan koordinat 2D dan labelnya yang dinormalisasi. Anda dapat meneruskan output ini langsung ke robotics API atau model VLA untuk menghasilkan tindakan robot.
Python
from google import genai
from google.genai import types
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
response = client.models.generate_content(
model="gemini-robotics-er-2-preview",
contents=[
types.Part.from_uri(
file_uri=uploaded_file.uri,
mime_type=uploaded_file.mime_type
),
PROMPT
],
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high")
),
)
print(response.text)
REST
# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"inlineData": {
"mimeType": "image/png",
"data": "'"${IMAGE_BASE64}"'"
}
},
{
"text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "high"
}
}
}'
Outputnya akan berupa array JSON yang berisi objek, yang masing-masing memiliki point
(koordinat [y, x] yang dinormalisasi) dan label yang mengidentifikasi objek.
JSON
[
{"point": [376, 508], "label": "small banana"},
{"point": [287, 609], "label": "larger banana"},
{"point": [223, 303], "label": "pink starfruit"},
{"point": [435, 172], "label": "paper bag"},
{"point": [270, 786], "label": "green plastic bowl"},
{"point": [488, 775], "label": "metal measuring cup"},
{"point": [673, 580], "label": "dark blue bowl"},
{"point": [471, 353], "label": "light blue bowl"},
{"point": [492, 497], "label": "bread"},
{"point": [525, 429], "label": "lime"}
]
Gambar berikut adalah contoh cara titik-titik ini dapat ditampilkan:
Cara kerjanya
Gemini Robotics ER menerima input gambar, video, atau audio dengan perintah bahasa alami. Model ini mengidentifikasi objek, memahami konteks adegan dan hubungan spasial, serta menampilkan output terstruktur seperti koordinat atau kotak pembatas.
Gemini Robotics ER juga bersifat agentik: Gemini memecah tugas yang kompleks menjadi sub-tugas dan mengeksekusinya dengan memanggil fungsi robot Anda atau menjalankan kode yang dihasilkan. Misalnya, "taruh apel di mangkuk" menjadi urutan langkah-langkah menemukan, menggenggam, dan menempatkan.
Lihat Panggilan fungsi untuk mengetahui detail tentang cara Gemini mengeksekusi panggilan alat.
Keamanan
Meskipun Gemini Robotics ER dibuat dengan mempertimbangkan keselamatan, Anda bertanggung jawab untuk menjaga lingkungan yang aman di sekitar robot. Model AI generatif dapat membuat kesalahan, dan robot fisik dapat menyebabkan kerusakan. Untuk mempelajari lebih lanjut, buka halaman keamanan robotik Google DeepMind.
Praktik terbaik
Gunakan bahasa yang sederhana dan alami. Jelaskan tindakan yang Anda inginkan dari robot seperti yang Anda lakukan kepada orang lain. Jika suatu istilah tidak berfungsi, coba sinonim umum.
Mengoptimalkan input visual. Pangkas atau perbesar objek kecil atau tidak jelas sebelum mengirim gambar. Pencahayaan dan kontras warna yang rendah dapat memengaruhi deteksi.
Membagi tugas kompleks menjadi beberapa langkah. Kirim setiap langkah sebagai perintah terpisah untuk mempertahankan fokus model dan meningkatkan akurasi.
Lakukan kueri beberapa kali dan hitung rata-rata hasilnya untuk tugas dengan presisi tinggi. Pendekatan konsensus ini mengurangi varians pada output spasial.
Batasan
Pertimbangkan batasan berikut saat mengembangkan dengan Gemini Robotics ER:
- Pembatasan kunci API: Gemini API tidak menerima permintaan dari kunci API yang tidak dibatasi dan menampilkan error
403 Forbidden. Amankan kunci API Anda dengan menambahkan pembatasan di AI Studio. Lihat Mengamankan kunci API yang tidak dibatasi untuk mengetahui detailnya. - Latensi vs. performa: Kueri yang kompleks, input beresolusi tinggi, atau tingkat pemikiran yang tinggi dapat menyebabkan peningkatan waktu pemrosesan. Untuk level pemikiran, gunakan sedang untuk keseimbangan yang baik antara latensi dan performa.
- Halusinasi: Seperti semua model bahasa besar, model Gemini Robotics ER terkadang dapat "berhalusinasi" atau memberikan informasi yang salah, terutama untuk perintah yang ambigu atau input di luar distribusi.
- Ketergantungan pada kualitas perintah: Kualitas output bergantung pada kejelasan perintah input. Gunakan perintah yang spesifik dan terstruktur dengan baik.
- Biaya komputasi: Menjalankan model, terutama dengan input video atau
thinking_budgettinggi, akan menggunakan resource komputasi dan menimbulkan biaya. Lihat halaman Pemikiran untuk mengetahui detail selengkapnya. - Jenis input: Lihat topik berikut untuk mengetahui detail batasan untuk setiap mode.
Pemberitahuan Privasi
Anda memahami bahwa model yang dirujuk dalam dokumen ini ("Model Robotik") memanfaatkan data video dan audio untuk mengoperasikan dan menggerakkan hardware Anda sesuai dengan petunjuk Anda. Oleh karena itu, Anda dapat mengoperasikan Model Robotik sehingga data dari orang yang dapat diidentifikasi, seperti data suara, gambar, dan kemiripan ("Data Pribadi"), akan dikumpulkan oleh Model Robotik. Jika Anda memilih untuk mengoperasikan Model Robotik dengan cara yang mengumpulkan Data Pribadi, Anda setuju bahwa Anda tidak akan mengizinkan orang yang dapat diidentifikasi untuk berinteraksi dengan, atau berada di area sekitar, Model Robotik, kecuali dan hingga orang yang dapat diidentifikasi tersebut telah diberi tahu dan menyetujui secara memadai bahwa Data Pribadi mereka dapat diberikan kepada dan digunakan oleh Google sebagaimana diuraikan dalam Persyaratan Layanan Tambahan Gemini API yang dapat ditemukan di https://ai.google.dev/gemini-api/terms (selanjutnya disebut "Persyaratan"), termasuk sesuai dengan bagian yang berjudul "Cara Google Menggunakan Data Anda". Anda akan memastikan bahwa pemberitahuan tersebut mengizinkan pengumpulan dan penggunaan Data Pribadi sebagaimana diuraikan dalam Persyaratan, dan Anda akan menggunakan upaya yang wajar secara komersial untuk meminimalkan pengumpulan dan distribusi Data Pribadi dengan menggunakan teknik seperti mengaburkan wajah dan mengoperasikan Model Robotik di area yang tidak berisi orang yang dapat diidentifikasi sejauh yang dapat dilakukan.
Harga
Untuk mengetahui informasi mendetail tentang harga dan wilayah yang tersedia, lihat halaman harga.
Endpoint model
Pratinjau Gemini Robotics ER 2
| Properti | Deskripsi |
|---|---|
| Kode model | gemini-robotics-er-2-preview |
| Jenis data yang didukung |
Input Teks, gambar, video, audio Output Teks |
| Batas token[*] |
Batas token input 131.072 Batas token output 65.536 |
| Kemampuan | Tidak didukung Didukung Didukung Didukung Didukung Didukung Melakukan grounding dengan Google Maps Didukung Tidak didukung Tidak didukung Didukung Didukung Didukung Didukung |
| Opsi pemakaian |
Didukung Tidak didukung Tidak didukung |
| Versi |
|
| Pembaruan terbaru | Juli 2026 |
| Kartu model | Kartu model |
Pratinjau Streaming Gemini Robotics ER 2
| Properti | Deskripsi |
|---|---|
| Kode model | gemini-robotics-er-2-streaming-preview |
| Jenis data yang didukung |
Input Teks, gambar, video, audio Output Teks |
| Batas token[*] |
Batas token input 131.072 Batas token output 65.536 |
| Kemampuan | Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Didukung Melakukan grounding dengan Google Maps Tidak didukung Tidak didukung Didukung Didukung Tidak didukung Didukung Tidak didukung |
| Opsi pemakaian |
Tidak didukung Tidak didukung Tidak didukung |
| Versi |
|
| Pembaruan terbaru | Juli 2026 |
| Kartu model | Kartu model |
Pratinjau Gemini Robotics ER 1.6
| Properti | Deskripsi |
|---|---|
| Kode model | gemini-robotics-er-1.6-preview |
| Jenis data yang didukung |
Input Teks, gambar, video, audio Output Teks |
| Batas token[*] |
Batas token input 131.072 Batas token output 65.536 |
| Kemampuan | Tidak didukung Didukung Didukung Didukung Didukung Didukung Melakukan grounding dengan Google Maps Didukung Tidak didukung Tidak didukung Didukung Didukung Didukung Didukung |
| Opsi pemakaian |
Didukung Tidak didukung Tidak didukung |
| Versi |
|
| Pembaruan terbaru | Desember 2025 |
| Batas informasi | Januari 2025 |
Langkah berikutnya
- Penalaran spasial — penunjuk, pelacakan, kotak pembatas, lintasan.
- Kemampuan seperti agen — eksekusi kode, pembacaan instrumen, anotasi gambar.
- Orkestrasi tugas — tugas dengan cakupan panjang menggunakan API robot kustom.
- Robotika dengan streaming — streaming dua arah real-time (khusus Gemini Robotics ER 2).
- Pemahaman video — penemuan momen dan klasifikasi progres (khusus Gemini Robotics ER 2).
- Keamanan robotika Google DeepMind — riset keamanan di balik rangkaian model.