Gemini Robotics ER (embodied reasoning) modelleri, robotların fiziksel dünyayı algılamasına ve bu dünyayla etkileşime girmesine olanak tanıyan görme-dil modelleridir (VLMs). Görsel verileri yorumlar, mekansal ve zamansal akıl yürütme yapar, çok adımlı görevleri planlar, robotları ve araçları yönetir.
Modeller
Gemini Robotics ER 2 modeli, Gemini Robotics'in en yeni modelidir. Bu, robotların çevrelerini tam olarak anlamalarını sağlayan güncellenmiş akıl yürütme modelimizdir. Robotların ajan tabanlı düzenlemesi (ör. VLA'ları kullanma), ilerleme anlayışı ve başarı tespiti dahil olmak üzere robot videosunu anlama, enstrüman okuma, işaret etme ve uzamsal akıl yürütme gibi somut akıl yürütme yetenekleri konusunda uzmanlaşmıştır.
Gemini Robotics ER 2 modeli iki model uç noktası sunar:
gemini-robotics-er-2-preview: Standart ER 2 modeli. Geliştirilmiş mekansal akıl yürütme, video anı bulma, video ilerleme sınıflandırması, çoklu robot düzenleme ve çok adımlı araç kullanımı ile Gemini 3.5 Flash'ı temel alır.gemini-robotics-er-2-streaming-preview: Live API aracılığıyla gerçek zamanlı yayın için optimize edilmiştir. Sürekli ses ve görüntü girişini işleyen düşük gecikmeli robot aracıları için bu modeli kullanın.
Gemini Robotics ER 1.6 kullanıyorsanız API çağrılarınızda model="gemini-robotics-er-1.6-preview" yerine model="gemini-robotics-er-2-preview" veya model="gemini-robotics-er-2-streaming-preview" kullanarak Gemini Robotics ER 2'ye yükseltin. Gemini Robotics ER 1.6 modelinin Ağustos ayının sonunda kapatılacağını unutmayın.
Google AI Studio'da Gemini Robotics ER 2'yi deneyin
Robotik özellikleri
Gemini Robotics ER, bir dizi somut akıl yürütme özelliğini destekler. Daha fazla bilgi edinmek için bir özellik seçin:
| Kapasite | Açıklama | Kılavuz |
|---|---|---|
| Mekansal akıl yürütme | Nesneleri işaretleme, videoda izleme, sınırlayıcı kutularla algılama, yörünge planlama | Uzamsal akıl yürütme |
| Ajan tabanlı vizyon | Resim işleme araçlarından yararlanarak diğer özellikleri geliştirmek için kod yürütmeyi kullanın. | Temsilci tabanlı vizyon |
| Görev düzenleme | Uzun vadeli görevleri tamamlamak için uzamsal akıl yürütmeyi özel robot API'leriyle birleştirin. | Görev düzenleme |
| Akış (yalnızca Gemini Robotics ER 2 Akış uç noktası) | Düşük gecikmeli işlev çağrısıyla anlık robot temsilciler için çift yönlü akış. | Robotik için akış |
| Video ilerleme (yalnızca Gemini Robotics ER 2) | Sürekli video feed'lerinden anları bulma ve ilerleme sınıflandırması. | Video anlama (Video understanding) |
Başlarken
Aşağıdaki örnekte, bir resimdeki nesneler bulunur ve bunların normalleştirilmiş 2D koordinatları ile etiketleri döndürülür. Bu çıkışı doğrudan bir robotik API'ye veya VLA modeline aktararak robot işlemleri oluşturabilirsiniz.
Python
from google import genai
from google.genai import types
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
response = client.models.generate_content(
model="gemini-robotics-er-2-preview",
contents=[
types.Part.from_uri(
file_uri=uploaded_file.uri,
mime_type=uploaded_file.mime_type
),
PROMPT
],
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high")
),
)
print(response.text)
REST
# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"inlineData": {
"mimeType": "image/png",
"data": "'"${IMAGE_BASE64}"'"
}
},
{
"text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "high"
}
}
}'
Çıktı, her biri point (normalleştirilmiş [y, x] koordinatları) ve nesneyi tanımlayan bir label içeren nesnelerden oluşan bir JSON dizisi olacaktır.
JSON
[
{"point": [376, 508], "label": "small banana"},
{"point": [287, 609], "label": "larger banana"},
{"point": [223, 303], "label": "pink starfruit"},
{"point": [435, 172], "label": "paper bag"},
{"point": [270, 786], "label": "green plastic bowl"},
{"point": [488, 775], "label": "metal measuring cup"},
{"point": [673, 580], "label": "dark blue bowl"},
{"point": [471, 353], "label": "light blue bowl"},
{"point": [492, 497], "label": "bread"},
{"point": [525, 429], "label": "lime"}
]
Aşağıdaki resimde, bu noktaların nasıl gösterilebileceğine dair bir örnek verilmiştir:
İşleyiş şekli
Gemini Robotics ER, doğal dil istemleriyle resim, video veya ses girişlerini kabul eder. Nesneleri tanımlar, sahne bağlamı ve mekansal ilişkiler hakkında akıl yürütür ve koordinatlar veya sınırlayıcı kutular gibi yapılandırılmış çıkışlar döndürür.
Gemini Robotics ER de temsilci tabanlıdır: Karmaşık görevleri alt görevlere ayırır ve robot işlevlerinizi çağırarak veya oluşturulan kodu çalıştırarak bunları yerine getirir. Örneğin, "elmaları kaseye koy" ifadesi, bulma, kavrama ve yerleştirme adımlarından oluşan bir diziye dönüşür.
Gemini'ın araç çağrılarını nasıl yürüttüğü hakkında ayrıntılı bilgi için İşlev çağrısı bölümüne bakın.
Güvenlik
Gemini Robotics ER, güvenlik göz önünde bulundurularak üretilmiş olsa da robotun etrafında güvenli bir ortam sağlamak sizin sorumluluğunuzdadır. Üretken yapay zeka modelleri hata yapabilir ve fiziksel robotlar hasara neden olabilir. Daha fazla bilgi edinmek için Google DeepMind robotik güvenlik sayfasını ziyaret edin.
En iyi uygulamalar
Sade ve doğal dil kullanın. Robottan yapmasını istediğiniz şeyi bir kişiye anlatır gibi açıklayın. Bir terim çalışmıyorsa yaygın bir eş anlamlıyı deneyin.
Görsel girişi optimize edin. Resmi göndermeden önce küçük veya net olmayan nesneleri kırpın ya da yakınlaştırın. Işık ve düşük renk kontrastı algılamayı etkileyebilir.
Karmaşık görevleri adımlara ayırın. Modelin odaklanmasını sağlamak ve doğruluğu artırmak için her adımı ayrı bir istem olarak gönderin.
Yüksek hassasiyetli görevler için birden çok kez sorgulama yapın ve sonuçların ortalamasını alın. Bu fikir birliği yaklaşımı, mekansal çıktılardaki varyansı azaltır.
Sınırlamalar
Gemini Robotics ER ile geliştirme yaparken aşağıdaki sınırlamaları göz önünde bulundurun:
- API anahtarı kısıtlamaları: Gemini API, kısıtlanmamış API anahtarlarından gelen istekleri kabul etmez ve
403 Forbiddenhatasını döndürür. AI Studio'da kısıtlamalar ekleyerek API anahtarınızı güvenli hale getirin. Ayrıntılar için Sınırsız API anahtarlarını güvenli hale getirme konusuna bakın. - Gecikme süresi ve performans: Karmaşık sorgular, yüksek çözünürlüklü girişler veya yüksek düşünce seviyeleri, işlem sürelerinin artmasına neden olabilir. Düşünme seviyesi için gecikme ve performans arasında iyi bir denge sağlamak üzere orta seviyeyi kullanın.
- Halüsinasyonlar: Tüm büyük dil modelleri gibi Gemini Robotics ER modelleri de zaman zaman "halüsinasyon" görebilir veya yanlış bilgi verebilir. Bu durum özellikle belirsiz istemlerde ya da dağıtım dışı girişlerde görülür.
- İstem kalitesine bağlılık: Çıkış kalitesi, giriş isteminin netliğine bağlıdır. Net ve iyi yapılandırılmış istemler kullanın.
- Hesaplama maliyeti: Özellikle video girişleriyle veya yüksek
thinking_budgetile modelin çalıştırılması, hesaplama kaynaklarını tüketir ve maliyetlere neden olur. Daha fazla bilgi için Düşünme sayfasına bakın. - Giriş türleri: Her moddaki sınırlamalarla ilgili ayrıntılar için aşağıdaki konulara bakın.
Gizlilik Uyarısı
Bu belgede referans verilen modellerin ("Robotik Modeller"), donanımınızı talimatlarınıza uygun şekilde çalıştırmak ve hareket ettirmek için video ve ses verilerinden yararlandığını kabul edersiniz. Bu nedenle, Robotik Modelleri, tanımlanabilir kişilerden elde edilen veriler (ör. ses, görüntü ve benzerlik verileri ("Kişisel Veriler")) Robotik Modeller tarafından toplanacak şekilde çalıştırabilirsiniz. Robotik Modelleri Kişisel Veri toplayacak şekilde çalıştırmayı seçerseniz, bu tür tanımlanabilir kişilerin, Kişisel Verilerinin https://ai.google.dev/gemini-api/terms adresinde bulunan Gemini API Ek Hizmet Şartları'nda ("Şartlar") belirtildiği şekilde Google'a sağlanabileceği ve Google tarafından kullanılabileceği konusunda yeterince bilgilendirilip onay vermediği sürece Robotik Modellerle etkileşime girmesine veya Robotik Modellerin bulunduğu alanda bulunmasına izin vermeyeceğinizi kabul edersiniz. Bu durum, "Google Verilerinizi Nasıl Kullanır?" başlıklı bölüm uyarınca da geçerlidir. Bu tür bir bildirimin, Şartlar'da belirtildiği şekilde Kişisel Verilerin toplanmasına ve kullanılmasına izin vermesini sağlayacak ve yüz bulanıklaştırma gibi teknikler kullanarak ve Robotik Modelleri, tanımlanabilir kişilerin bulunmadığı alanlarda çalıştırarak Kişisel Verilerin toplanmasını ve dağıtılmasını mümkün olduğunca en aza indirmek için ticari olarak makul çabayı göstereceksiniz.
Fiyatlandırma
Fiyatlandırma ve kullanılabilir bölgeler hakkında ayrıntılı bilgi için fiyatlandırma sayfasına bakın.
Model uç noktaları
Gemini Robotics ER 2 Önizlemesi
| Mülk | Açıklama |
|---|---|
| Model kodu | gemini-robotics-er-2-preview |
| Desteklenen veri türleri |
Girişler Metin, resim, video, ses Çıkış Metin |
| Jeton sınırları[*] |
Giriş jetonu sınırı 131.072 Çıkış jetonu sınırı 65.536 |
| Özellikler | Desteklenmiyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Google Haritalar ile Temellendirme Destekleniyor Desteklenmiyor Desteklenmiyor Destekleniyor Destekleniyor Düşünme (Thinking) Destekleniyor Destekleniyor |
| Tüketim seçenekleri |
Destekleniyor Desteklenmiyor Desteklenmiyor |
| Sürümler |
|
| Son güncelleme | Temmuz 2026 |
| Model kartı | Model kartı |
Gemini Robotics ER 2 Streaming Preview
| Mülk | Açıklama |
|---|---|
| Model kodu | gemini-robotics-er-2-streaming-preview |
| Desteklenen veri türleri |
Girişler Metin, resim, video, ses Çıkış Metin |
| Jeton sınırları[*] |
Giriş jetonu sınırı 131.072 Çıkış jetonu sınırı 65.536 |
| Özellikler | Desteklenmiyor Desteklenmiyor Desteklenmiyor Desteklenmiyor Desteklenmiyor Destekleniyor Google Haritalar ile Temellendirme Desteklenmiyor Desteklenmiyor Destekleniyor Destekleniyor Desteklenmiyor Düşünme (Thinking) Destekleniyor Desteklenmiyor |
| Tüketim seçenekleri |
Desteklenmiyor Desteklenmiyor Desteklenmiyor |
| Sürümler |
|
| Son güncelleme | Temmuz 2026 |
| Model kartı | Model kartı |
Gemini Robotics ER 1.6 Önizlemesi
| Mülk | Açıklama |
|---|---|
| Model kodu | gemini-robotics-er-1.6-preview |
| Desteklenen veri türleri |
Girişler Metin, resim, video, ses Çıkış Metin |
| Jeton sınırları[*] |
Giriş jetonu sınırı 131.072 Çıkış jetonu sınırı 65.536 |
| Özellikler | Desteklenmiyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Destekleniyor Google Haritalar ile Temellendirme Destekleniyor Desteklenmiyor Desteklenmiyor Destekleniyor Destekleniyor Düşünme (Thinking) Destekleniyor Destekleniyor |
| Tüketim seçenekleri |
Destekleniyor Desteklenmiyor Desteklenmiyor |
| Sürümler |
|
| Son güncelleme | Aralık 2025 |
| Son güncel bilgi tarihi | Ocak 2025 |
Sırada ne var?
- Uzamsal akıl yürütme: işaretleme, izleme, sınırlayıcı kutular, yörüngeler.
- Ajan tabanlı yetenekler: Kod yürütme, enstrüman okuma, görüntü açıklama.
- Görev düzenleme: Özel robot API'leri içeren uzun vadeli görevler.
- Yayın özellikli robotik: Gerçek zamanlı çift yönlü yayın (yalnızca Gemini Robotics ER 2).
- Video anlama: Anları bulma ve ilerleme sınıflandırması (yalnızca Gemini Robotics ER 2).
- Google DeepMind robotik güvenlik: Model ailesinin arkasındaki güvenlik araştırması.