জেমিনি রোবোটিক্স ইআর

জেমিনি রোবোটিক্স ইআর (এমবডিড রিজনিং) মডেলগুলো হলো ভিশন-ল্যাঙ্গুয়েজ মডেল (ভিএলএম), যা রোবটকে ভৌত জগৎকে উপলব্ধি করতে এবং তার সাথে মিথস্ক্রিয়া করতে সক্ষম করে। এগুলো দৃশ্যমান তথ্য বিশ্লেষণ করে, স্থানিক ও কালিক যুক্তি সম্পাদন করে, বহু-ধাপের কাজের পরিকল্পনা করে এবং রোবট ও সরঞ্জামসমূহকে সমন্বয় সাধন করে।

মডেল

জেমিনি রোবোটিক্স ER 2 মডেলটি হলো জেমিনি রোবোটিক্সের সর্বাধুনিক মডেল। এটি আমাদের একটি উন্নত রিজনিং মডেল যা রোবটকে তার পরিবেশ নির্ভুলভাবে বুঝতে সক্ষম করে। এটি বিশেষত এমবডিড রিজনিং ক্ষমতায় পারদর্শী, যেমন—রোবটের এজেন্টিক অর্কেস্ট্রেশন (উদাহরণস্বরূপ ভিএলএ ব্যবহার করে), অগ্রগতি বোঝা ও সাফল্য শনাক্তকরণ সহ রোবটের ভিডিও বোঝা, যন্ত্র পাঠ, নির্দেশ করা এবং স্থানিক যুক্তি।

জেমিনি রোবোটিক্স ইআর ২ মডেলে দুটি মডেল এন্ডপয়েন্ট চালু করা হয়েছে:

  • gemini-robotics-er-2-preview : এটি স্ট্যান্ডার্ড ER 2 মডেল। এটি Gemini 3.5 Flash-এর উপর ভিত্তি করে তৈরি এবং এতে উন্নত স্পেশিয়াল রিজনিং, ভিডিও মোমেন্ট ফাইন্ডিং, ভিডিও প্রোগ্রেস ক্লাসিফিকেশন, মাল্টি-রোবট অর্কেস্ট্রেশন এবং মাল্টি-স্টেপ টুল ব্যবহারের মতো বৈশিষ্ট্য রয়েছে।
  • gemini-robotics-er-2-streaming-preview : লাইভ এপিআই (Live API) এর মাধ্যমে রিয়েল-টাইম স্ট্রিমিংয়ের জন্য অপ্টিমাইজ করা হয়েছে। কম-লেটেন্সি সম্পন্ন রোবট এজেন্টদের জন্য এই মডেলটি ব্যবহার করুন, যারা অবিচ্ছিন্ন অডিও এবং ভিডিও ইনপুট প্রসেস করে।

আপনি যদি Gemini Robotics ER 1.6 ব্যবহার করে থাকেন, তাহলে আপনার API কলগুলিতে model="gemini-robotics-er-1.6-preview" এর পরিবর্তে model="gemini-robotics-er-2-preview" অথবা model="gemini-robotics-er-2-streaming-preview" করে Gemini Robotics ER 2-তে আপগ্রেড করুন। উল্লেখ্য যে, Gemini Robotics ER 1.6 মডেলটি আগস্ট মাসের শেষে বন্ধ করে দেওয়া হবে।

গুগল এআই স্টুডিওতে জেমিনি রোবোটিক্স ইআর ২ ব্যবহার করে দেখুন।

রোবোটিক্স ক্ষমতা

জেমিনি রোবোটিক্স ইআর বিভিন্ন ধরনের মূর্ত যুক্তিমূলক ক্ষমতা সমর্থন করে। আরও জানতে একটি ক্ষমতা নির্বাচন করুন:

সক্ষমতা বর্ণনা গাইড
স্থানিক যুক্তি বস্তু নির্দেশ করুন, ভিডিওতে সেগুলোর গতিপথ অনুসরণ করুন, বাউন্ডিং বক্সের সাহায্যে শনাক্ত করুন, গতিপথ পরিকল্পনা করুন। স্থানিক যুক্তি
সক্রিয় দৃষ্টি ইমেজ ম্যানিপুলেশন টুল ব্যবহার করে কোড এক্সিকিউশনের মাধ্যমে অন্যান্য সক্ষমতা বৃদ্ধি করুন। সক্রিয় দৃষ্টি
টাস্ক অর্কেস্ট্রেশন দীর্ঘমেয়াদী কাজ সম্পন্ন করতে স্থানিক যুক্তির সাথে কাস্টম রোবট এপিআই-এর সমন্বয় করুন। টাস্ক অর্কেস্ট্রেশন
স্ট্রিমিং (শুধুমাত্র জেমিনি রোবোটিক্স ইআর ২ স্ট্রিমিং এন্ডপয়েন্টের জন্য) রিয়েল-টাইম রোবট এজেন্টদের জন্য স্বল্প-বিলম্বের ফাংশন কলিং সহ দ্বিমুখী স্ট্রিমিং। রোবোটিক্সের জন্য স্ট্রিমিং
ভিডিওর অগ্রগতি (শুধুমাত্র জেমিনি রোবোটিক্স ইআর ২ এর জন্য) ধারাবাহিক ভিডিও ফিড থেকে মুহূর্ত শনাক্তকরণ এবং অগ্রগতির শ্রেণিবিন্যাস। ভিডিও বোঝা

শুরু করা হচ্ছে

নিম্নলিখিত উদাহরণটি একটি ছবিতে বস্তু খুঁজে বের করে এবং তাদের নর্মালাইজড ২ডি স্থানাঙ্ক ও লেবেল ফেরত দেয়। রোবটের কার্যকলাপ তৈরি করার জন্য আপনি এই আউটপুটটি সরাসরি একটি রোবোটিক্স এপিআই বা একটি ভিএলএ মডেলে পাঠাতে পারেন।

পাইথন

from google import genai
from google.genai import types

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

response = client.models.generate_content(
    model="gemini-robotics-er-2-preview",
    contents=[
        types.Part.from_uri(
            file_uri=uploaded_file.uri,
            mime_type=uploaded_file.mime_type
        ),
        PROMPT
    ],
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high")
    ),
)

print(response.text)

বিশ্রাম

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "inlineData": {
              "mimeType": "image/png",
              "data": "'"${IMAGE_BASE64}"'"
            }
          },
          {
            "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "high"
      }
    }
  }'

আউটপুটটি একটি JSON অ্যারে হবে, যার মধ্যে অবজেক্ট থাকবে। প্রতিটি অবজেক্টে একটি point (স্বাভাবিককৃত [y, x] স্থানাঙ্ক) এবং অবজেক্টটিকে শনাক্তকারী একটি label থাকবে।

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

নিচের ছবিটি এই পয়েন্টগুলো কীভাবে প্রদর্শন করা যেতে পারে তার একটি উদাহরণ:

একটি উদাহরণ যা একটি ছবির বস্তুগুলোর বিন্দুগুলো প্রদর্শন করে।

এটি কীভাবে কাজ করে

জেমিনি রোবোটিক্স ইআর স্বাভাবিক ভাষার নির্দেশনার মাধ্যমে ছবি, ভিডিও বা অডিও ইনপুট গ্রহণ করে। এটি বস্তু শনাক্ত করে, দৃশ্যের প্রেক্ষাপট ও স্থানিক সম্পর্ক নিয়ে যুক্তি দেয় এবং স্থানাঙ্ক বা বাউন্ডিং বক্সের মতো কাঠামোগত আউটপুট প্রদান করে।

জেমিনি রোবোটিক্স ইআর সক্রিয় ভূমিকাও পালন করে: এটি জটিল কাজগুলোকে ছোট ছোট উপ-কাজে বিভক্ত করে এবং আপনার রোবট ফাংশন কল করে বা জেনারেটেড কোড চালিয়ে সেগুলো সম্পাদন করে। উদাহরণস্বরূপ, "আপেলটি বাটিতে রাখো" কাজটি খুঁজে বের করা, ধরা এবং নির্দিষ্ট স্থানে রাখার একটি ধারাবাহিক ধাপে পরিণত হয়।

জেমিনি কীভাবে টুল কল সম্পাদন করে, সে সম্পর্কে বিস্তারিত জানতে ফাংশন কলিং দেখুন।

নিরাপত্তা

যদিও জেমিনি রোবোটিক্স ইআর নিরাপত্তার কথা মাথায় রেখে তৈরি করা হয়েছে, রোবটটির চারপাশে একটি নিরাপদ পরিবেশ বজায় রাখা আপনার দায়িত্ব। জেনারেটিভ এআই মডেল ভুল করতে পারে এবং বাস্তব রোবট ক্ষতি করতে পারে। আরও জানতে, গুগল ডিপমাইন্ড রোবোটিক্স সেফটি পেজটি দেখুন।

সর্বোত্তম অনুশীলন

  1. সহজ ও স্বাভাবিক ভাষা ব্যবহার করুন। আপনি রোবটটিকে দিয়ে কী করাতে চান, তা একজন মানুষের কাছে যেভাবে বলেন, সেভাবেই বর্ণনা করুন। কোনো শব্দ কাজ না করলে, তার একটি প্রচলিত প্রতিশব্দ ব্যবহার করে দেখুন।

  2. দৃশ্যমান ইনপুট অপ্টিমাইজ করুন। ছবি পাঠানোর আগে ছোট বা অস্পষ্ট বস্তু ক্রপ করুন বা জুম করুন। আলো এবং কম রঙের বৈসাদৃশ্য সনাক্তকরণকে প্রভাবিত করতে পারে।

  3. জটিল কাজগুলোকে ছোট ছোট ধাপে ভাগ করুন। মডেলকে মনোযোগী রাখতে এবং নির্ভুলতা বাড়াতে প্রতিটি ধাপকে আলাদা নির্দেশ হিসেবে পাঠান।

  4. উচ্চ-নির্ভুলতার কাজগুলোর জন্য একাধিকবার কোয়েরি করুন এবং ফলাফলগুলোর গড় নিন। এই ঐক্যমত্য পদ্ধতিটি স্থানিক আউটপুটের তারতম্য হ্রাস করে।

সীমাবদ্ধতা

Gemini Robotics ER ব্যবহার করে উন্নয়ন করার সময় নিম্নলিখিত সীমাবদ্ধতাগুলো বিবেচনা করুন:

  • এপিআই কী-এর সীমাবদ্ধতা: জেমিনি এপিআই সীমাবদ্ধতাহীন এপিআই কী থেকে অনুরোধ গ্রহণ করে না এবং একটি 403 Forbidden ত্রুটি ফেরত দেয়। এআই স্টুডিও- তে সীমাবদ্ধতা যোগ করে আপনার এপিআই কী সুরক্ষিত করুন। বিস্তারিত জানতে ‘সীমাবদ্ধতাহীন এপিআই কী সুরক্ষিত করুন’ দেখুন।
  • লেটেন্সি বনাম পারফরম্যান্স: জটিল কোয়েরি, উচ্চ-রেজোলিউশনের ইনপুট বা উচ্চ চিন্তার স্তর প্রসেসিং টাইম বাড়িয়ে দিতে পারে। লেটেন্সি ও পারফরম্যান্সের মধ্যে একটি ভালো ভারসাম্যের জন্য চিন্তার স্তরের ক্ষেত্রে 'মিডিয়াম' ব্যবহার করুন।
  • বিভ্রম: অন্যান্য সকল বৃহৎ ভাষা মডেলের মতো, জেমিনি রোবোটিক্স ইআর মডেলগুলোও মাঝে মাঝে "বিভ্রম" করতে পারে বা ভুল তথ্য প্রদান করতে পারে, বিশেষ করে দ্ব্যর্থক নির্দেশ বা বিতরণের বাইরের ইনপুটের ক্ষেত্রে।
  • প্রম্পটের মানের উপর নির্ভরতা: আউটপুটের মান ইনপুট প্রম্পটের স্পষ্টতার উপর নির্ভর করে। সুনির্দিষ্ট ও সুগঠিত প্রম্পট ব্যবহার করুন।
  • গণনাগত খরচ: মডেলটি চালানো, বিশেষ করে ভিডিও ইনপুট বা উচ্চ thinking_budget সহ, গণনাগত সম্পদ ব্যবহার করে এবং খরচ বহন করে। আরও বিস্তারিত জানার জন্য থিঙ্কিং পৃষ্ঠাটি দেখুন।
  • ইনপুট প্রকারভেদ: প্রতিটি মোডের সীমাবদ্ধতা সম্পর্কে বিস্তারিত জানতে নিম্নলিখিত বিষয়গুলো দেখুন।

গোপনীয়তা বিজ্ঞপ্তি

আপনি স্বীকার করছেন যে এই নথিতে উল্লেখিত মডেলগুলি ("রোবোটিক্স মডেল") আপনার নির্দেশাবলী অনুসারে আপনার হার্ডওয়্যার পরিচালনা এবং সরানোর জন্য ভিডিও এবং অডিও ডেটা ব্যবহার করে। অতএব, আপনি রোবোটিক্স মডেলগুলি এমনভাবে পরিচালনা করতে পারেন যাতে শনাক্তযোগ্য ব্যক্তিদের ডেটা, যেমন কণ্ঠস্বর, চিত্র এবং সাদৃশ্য ডেটা ("ব্যক্তিগত ডেটা"), রোবোটিক্স মডেলগুলি দ্বারা সংগ্রহ করা হবে। আপনি যদি এমনভাবে রোবোটিক্স মডেলগুলি পরিচালনা করার সিদ্ধান্ত নেন যা ব্যক্তিগত ডেটা সংগ্রহ করে, তাহলে আপনি সম্মত হচ্ছেন যে আপনি কোনও শনাক্তযোগ্য ব্যক্তিকে রোবোটিক্স মডেলগুলির সাথে যোগাযোগ করতে বা তার আশেপাশের এলাকায় উপস্থিত থাকতে দেবেন না, যতক্ষণ না এবং যদি না সেই শনাক্তযোগ্য ব্যক্তিদের পর্যাপ্তভাবে অবহিত করা হয় এবং তারা এই বিষয়ে সম্মতি দেয় যে তাদের ব্যক্তিগত ডেটা https://ai.google.dev/gemini-api/terms- এ পাওয়া Gemini API অতিরিক্ত পরিষেবার শর্তাবলীতে ("শর্তাবলী") বর্ণিত "Google কীভাবে আপনার ডেটা ব্যবহার করে" শিরোনামের বিভাগ সহ, Google-কে প্রদান করা হতে পারে এবং Google দ্বারা ব্যবহৃত হতে পারে। আপনি নিশ্চিত করবেন যে এই ধরনের বিজ্ঞপ্তি শর্তাবলীতে বর্ণিত ব্যক্তিগত তথ্য সংগ্রহ এবং ব্যবহারের অনুমতি দেয়, এবং আপনি বাণিজ্যিকভাবে যুক্তিসঙ্গত প্রচেষ্টা ব্যবহার করে ব্যক্তিগত তথ্য সংগ্রহ ও বিতরণ হ্রাস করবেন, যার জন্য আপনি মুখ ঝাপসা করার মতো কৌশল ব্যবহার করবেন এবং যতদূর সম্ভব শনাক্তযোগ্য ব্যক্তি নেই এমন এলাকায় রোবোটিক মডেলগুলো পরিচালনা করবেন।

মূল্য নির্ধারণ

মূল্য এবং উপলব্ধ অঞ্চল সম্পর্কে বিস্তারিত তথ্যের জন্য, মূল্য তালিকাটি দেখুন।

মডেল এন্ডপয়েন্ট

জেমিনি রোবোটিক্স ইআর ২ প্রিভিউ

সম্পত্তি বর্ণনা
মডেল কোড gemini-robotics-er-2-preview
সমর্থিত ডেটা প্রকারগুলি

ইনপুট

লেখা, ছবি, ভিডিও, অডিও

আউটপুট

পাঠ্য

টোকেন সীমা [*]

ইনপুট টোকেন সীমা

১৩১,০৭২

আউটপুট টোকেন সীমা

৬৫,৫৩৬

সক্ষমতা

অডিও জেনারেশন

সমর্থিত নয়

ক্যাশিং

সমর্থিত

কোড এক্সিকিউশন

সমর্থিত

কম্পিউটার ব্যবহার

সমর্থিত

ফাইল অনুসন্ধান

সমর্থিত

ফাংশন কলিং

সমর্থিত

গুগল ম্যাপস দিয়ে গ্রাউন্ডিং

সমর্থিত

চিত্র তৈরি

সমর্থিত নয়

লাইভ এপিআই

সমর্থিত নয়

অনুসন্ধান গ্রাউন্ডিং

সমর্থিত

কাঠামোগত আউটপুট

সমর্থিত

চিন্তা

সমর্থিত

URL প্রসঙ্গ

সমর্থিত

ব্যবহারের বিকল্পগুলি

ব্যাচ এপিআই

সমর্থিত

ফ্লেক্স ইনফারেন্স

সমর্থিত নয়

অগ্রাধিকার অনুমান

সমর্থিত নয়

সংস্করণ
আরও বিস্তারিত জানতে মডেল ভার্সন প্যাটার্নগুলো পড়ুন।
  • প্রিভিউ: gemini-robotics-er-2-preview
সর্বশেষ আপডেট জুলাই ২০২৬
মডেল কার্ড মডেল কার্ড

জেমিনি রোবোটিক্স ইআর ২ স্ট্রিমিং প্রিভিউ

সম্পত্তি বর্ণনা
মডেল কোড gemini-robotics-er-2-streaming-preview
সমর্থিত ডেটা প্রকারগুলি

ইনপুট

লেখা, ছবি, ভিডিও, অডিও

আউটপুট

পাঠ্য

টোকেন সীমা [*]

ইনপুট টোকেন সীমা

১৩১,০৭২

আউটপুট টোকেন সীমা

৬৫,৫৩৬

সক্ষমতা

অডিও জেনারেশন

সমর্থিত নয়

ক্যাশিং

সমর্থিত নয়

কোড এক্সিকিউশন

সমর্থিত নয়

কম্পিউটার ব্যবহার

সমর্থিত নয়

ফাইল অনুসন্ধান

সমর্থিত নয়

ফাংশন কলিং

সমর্থিত

গুগল ম্যাপস দিয়ে গ্রাউন্ডিং

সমর্থিত নয়

চিত্র তৈরি

সমর্থিত নয়

লাইভ এপিআই

সমর্থিত

অনুসন্ধান গ্রাউন্ডিং

সমর্থিত

কাঠামোগত আউটপুট

সমর্থিত নয়

চিন্তা

সমর্থিত

URL প্রসঙ্গ

সমর্থিত নয়

ব্যবহারের বিকল্পগুলি

ব্যাচ এপিআই

সমর্থিত নয়

ফ্লেক্স ইনফারেন্স

সমর্থিত নয়

অগ্রাধিকার অনুমান

সমর্থিত নয়

সংস্করণ
আরও বিস্তারিত জানতে মডেল ভার্সন প্যাটার্নগুলো পড়ুন।
  • প্রিভিউ: gemini-robotics-er-2-streaming-preview
সর্বশেষ আপডেট জুলাই ২০২৬
মডেল কার্ড মডেল কার্ড

জেমিনি রোবোটিক্স ইআর ১.৬ প্রিভিউ

সম্পত্তি বর্ণনা
মডেল কোড gemini-robotics-er-1.6-preview
সমর্থিত ডেটা প্রকারগুলি

ইনপুট

লেখা, ছবি, ভিডিও, অডিও

আউটপুট

পাঠ্য

টোকেন সীমা [*]

ইনপুট টোকেন সীমা

১৩১,০৭২

আউটপুট টোকেন সীমা

৬৫,৫৩৬

সক্ষমতা

অডিও জেনারেশন

সমর্থিত নয়

ক্যাশিং

সমর্থিত

কোড এক্সিকিউশন

সমর্থিত

কম্পিউটার ব্যবহার

সমর্থিত

ফাইল অনুসন্ধান

সমর্থিত

ফাংশন কলিং

সমর্থিত

গুগল ম্যাপস দিয়ে গ্রাউন্ডিং

সমর্থিত

চিত্র তৈরি

সমর্থিত নয়

লাইভ এপিআই

সমর্থিত নয়

অনুসন্ধান গ্রাউন্ডিং

সমর্থিত

কাঠামোগত আউটপুট

সমর্থিত

চিন্তা

সমর্থিত

URL প্রসঙ্গ

সমর্থিত

ব্যবহারের বিকল্পগুলি

ব্যাচ এপিআই

সমর্থিত

ফ্লেক্স ইনফারেন্স

সমর্থিত নয়

অগ্রাধিকার অনুমান

সমর্থিত নয়

সংস্করণ
আরও বিস্তারিত জানতে মডেল ভার্সন প্যাটার্নগুলো পড়ুন।
  • প্রিভিউ: gemini-robotics-er-1.6-preview
সর্বশেষ আপডেট ডিসেম্বর ২০২৫
জ্ঞানের কাটঅফ জানুয়ারি ২০২৫

এরপর কী?