Gemini Robotics ER

Gemini Robotics ER (embodied reasoning) মডেল হল ভিশন-ল্যাঙ্গুয়েজ মডেল (VLMs) যা রোবটকে বাস্তব জগৎ সম্পর্কে জানতে ও তার সাথে ইন্টার‍্যাক্ট করতে দেয়। এগুলি ভিজ্যুয়াল ডেটা ব্যাখ্যা করে, স্পেশিয়াল ও টেম্পোরাল রিজনিং পারফর্ম করে, একাধিক ধাপের টাস্ক প্ল্যান করে এবং রোবট ও টুল অপারেট করে।

মডেল

Gemini Robotics ER 2 মডেল হল Gemini Robotics-এর লেটেস্ট মডেল। এটি আমাদের আপডেট করা রিজনিং মডেল যা রোবটকে তার পরিবেশ সঠিকভাবে বুঝতে সাহায্য করে। এটি এমবডিড রিজনিং ক্ষমতায় পারদর্শী, যেমন রোবটের এজেন্টিক অর্কেস্ট্রেশন (যেমন, VLA ব্যবহার করা), রোবট ভিডিও বোঝা যার মধ্যে প্রগ্রেস বোঝা ও সাফল্য শনাক্ত করা, ইনস্ট্রুমেন্ট রিডিং, পয়েন্ট করা ও স্পেশিয়াল রিজনিং পড়ে।

Gemini Robotics ER 2 মডেলে দুটি মডেল এন্ডপয়েন্ট আছে:

  • gemini-robotics-er-2-preview: স্ট্যান্ডার্ড ER 2 মডেল। উন্নত স্পেশিয়াল রিজনিং, ভিডিও মোমেন্ট ফাইন্ডিং, ভিডিও প্রগ্রেস ক্লাসিফিকেশন, মাল্টি-রোবট অর্কেস্ট্রেশন এবং মাল্টি-স্টেপ টুল ব্যবহারের সুবিধা সহ Gemini 3.5 Flash-এর উপর ভিত্তি করে তৈরি করা হয়েছে।
  • gemini-robotics-er-2-streaming-preview: Live API ব্যবহার করে রিয়েল-টাইম স্ট্রিমিংয়ের জন্য অপ্টিমাইজ করা হয়েছে। অবিরাম অডিও ও ভিডিও ইনপুট প্রসেস করে এমন লো-লেটেন্সি রোবট এজেন্টের জন্য এই মডেল ব্যবহার করুন।

Gemini Robotics ER 1.6 ভার্সনটি ৩১ আগস্ট, ২০২৬-এ বন্ধ করে দেওয়া হয়েছে। আপনি এখনও Gemini Robotics ER 1.6 ব্যবহার করলে, আপনার API কলে model="gemini-robotics-er-1.6-preview"-এর পরিবর্তে model="gemini-robotics-er-2-preview" বা model="gemini-robotics-er-2-streaming-preview" ব্যবহার করে Gemini Robotics ER 2-এ আপগ্রেড করুন।

Google AI Studio-তে Gemini Robotics ER 2 ব্যবহার করে দেখুন

রোবোটিক্স সংক্রান্ত ক্ষমতা

Gemini Robotics ER-এ বিভিন্ন ধরনের এমবডিমেন্ট রিজনিং ক্ষমতা কাজ করে। আরও জানতে কোনও একটি ক্ষমতা বেছে নিন:

ক্ষমতা বিবরণ গাইড
স্পেশিয়াল রিজনিং অবজেক্টের দিকে পয়েন্ট করা, ভিডিওতে সেগুলি ট্র্যাক করা, বাউন্ডিং বক্সের মাধ্যমে শনাক্ত করা, ট্রাজেক্টরি প্ল্যান করা। স্থানিক যুক্তি
এজেন্টিক ভিশন ছবি ম্যানিপুলেশন টুলের সুবিধা নিয়ে অন্যান্য ক্ষমতা বাড়াতে কোড এক্সিকিউশন ব্যবহার করুন। এজেন্টিক ভিশন
টাস্ক অর্কেস্ট্রেশন দীর্ঘ-মেয়াদী টাস্ক সম্পূর্ণ করতে কাস্টম রোবট API-এর সাথে স্পেশিয়াল রিজনিং একত্রিত করুন। টাস্ক অর্কেস্ট্রেশন
স্ট্রিমিং (শুধুমাত্র Gemini Robotics ER 2 স্ট্রিমিং এন্ডপয়েন্ট) কম লেটেন্সি ফাংশন কলিং সহ রিয়েল-টাইম রোবট এজেন্টের জন্য দ্বিমুখী স্ট্রিমিং। রোবোটিক্সের জন্য স্ট্রিমিং
ভিডিও প্রোগ্রেস (শুধুমাত্র Gemini Robotics ER 2) অবিচ্ছিন্ন ভিডিও ফিড থেকে মুহূর্ত খুঁজে পাওয়া ও প্রগ্রেসের শ্রেণিবিভাগ। ভিডিও বোঝা

শুরু করার আগে

Gemini Developer API-এর মাধ্যমে Gemini Robotics ER মডেল উপলভ্য। শুরু করতে, Google AI Studio অথবা Google Cloud console থেকে একটি Gemini API কী তৈরি করুন এবং আপনার এনভায়রনমেন্ট সেট-আপ করুন।

কীয়ের ধরন, নিরাপত্তা এবং Python, JavaScript ও অন্যান্য ভাষায় কীভাবে আপনার কী কনফিগার করবেন সেই সম্পর্কে আরও জানতে, Gemini API কী ব্যবহার করা লিঙ্ক দেখুন।

শুরু করা

নিচের উদাহরণটি কোনও ছবিতে অবজেক্ট খুঁজে বের করে এবং সেটির স্বাভাবিক করা 2D কোঅর্ডিনেট ও লেবেল রিটার্ন করে। রোবট অ্যাকশন জেনারেট করতে, আপনি এই আউটপুট সরাসরি কোনও রোবটিক্স API বা VLA মডেলে পাস করতে পারবেন।

Python

from google import genai

PROMPT = """
          Point to no more than 10 items in the image. The label returned
          should be an identifying name for the object detected.
          The answer should follow the json format: [{"point": <point>,
          "label": <label1>}, ...]. The points are in [y, x] format
          normalized to 0-1000.
        """
client = genai.Client()

uploaded_file = client.files.upload(file="my-image.png")

image_response = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": PROMPT}
    ],
    generation_config={"thinking_level": "high"},
)

print(image_response.output_text)

জাভাস্ক্রিপ্ট

import { GoogleGenAI } from "@google/genai";

const PROMPT = `
  Point to no more than 10 items in the image. The label returned
  should be an identifying name for the object detected.
  The answer should follow the json format: [{"point": <point>,
  "label": <label1>}, ...]. The points are in [y, x] format
  normalized to 0-1000.
`;
const client = new GoogleGenAI();

const uploadedFile = await client.files.upload({ file: "my-image.png" });

const imageResponse = await client.interactions.create({
  model: "gemini-robotics-er-2-preview",
  input: [
    {
      type: "image",
      uri: uploadedFile.uri,
      mime_type: uploadedFile.mimeType,
    },
    { type: "text", text: PROMPT },
  ],
  generation_config: { thinking_level: "high" },
});

console.log(imageResponse.output_text);

Java

import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.Content;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.GenerationConfig;
import com.google.genai.gaos.models.interactions.ImageContent;
import com.google.genai.gaos.models.interactions.ImageContentMimeType;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.TextContent;
import com.google.genai.gaos.models.interactions.ThinkingLevel;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
import com.google.genai.types.File;
import com.google.genai.types.UploadFileConfig;
import java.util.List;

Client client = new Client();

String prompt =
    "Point to no more than 10 items in the image. The label returned "
        + "should be an identifying name for the object detected. "
        + "The answer should follow the json format: [{\"point\": <point>, "
        + "\"label\": <label1>}, ...]. The points are in [y, x] format "
        + "normalized to 0-1000.";

File uploadedFile =
    client.files.upload(
        new java.io.File("my-image.png"),
        UploadFileConfig.builder().mimeType("image/png").build());

Content imageContent =
    ImageContent.builder()
        .uri(uploadedFile.uri().orElse(""))
        .mimeType(ImageContentMimeType.of(uploadedFile.mimeType().orElse("image/png")))
        .build();
Content textContent = TextContent.builder().text(prompt).build();

CreateModelInteraction params =
    CreateModelInteraction.builder()
        .model(Model.of("gemini-robotics-er-2-preview"))
        .input(InteractionsInput.ofContent(List.of(imageContent, textContent)))
        .generationConfig(
            GenerationConfig.builder().thinkingLevel(ThinkingLevel.HIGH).build())
        .build();

Interaction imageResponse =
    client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();

System.out.println(imageResponse.outputText().orElse(""));

খুলুন

package main

import (
    "context"
    "fmt"
    "log"

    "google.golang.org/genai"
    "google.golang.org/genai/interactions/models/interactions"
    "google.golang.org/genai/interactions/models/operations"
)

func main() {
    ctx := context.Background()
    client, err := genai.NewClient(ctx, nil)
    if err != nil {
        log.Fatal(err)
    }

    prompt := `Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.`

    uploadedFile, err := client.Files.UploadFromPath(ctx, "my-image.png", &genai.UploadFileConfig{
        MIMEType: "image/png",
    })
    if err != nil {
        log.Fatal(err)
    }

    res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
        Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
            Model: interactions.Model("gemini-robotics-er-2-preview"),
            Input: interactions.NewInteractionsInput([]interactions.Content{
                interactions.NewContent(interactions.ImageContent{
                    URI:      genai.Ptr(uploadedFile.URI),
                    MimeType: genai.Ptr(interactions.ImageMimeTypeImagePng),
                }),
                interactions.NewContent(interactions.TextContent{
                    Text: prompt,
                }),
            }),
            GenerationConfig: &interactions.GenerationConfig{
                ThinkingLevel: interactions.ThinkingLevelHigh.ToPointer(),
            },
        }),
    })
    if err != nil {
        log.Fatal(err)
    }
    if res.Interaction.OutputText != nil {
        fmt.Println(*res.Interaction.OutputText)
    }
}

REST

# First, ensure you have the image file locally.
# Encode the image to base64
IMAGE_BASE64=$(base64 -w 0 my-image.png)

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-robotics-er-2-preview",
    "input": {
      "parts": [
        {
          "inlineData": {
            "mimeType": "image/png",
            "data": "'"${IMAGE_BASE64}"'"
          }
        },
        {
          "text": "Point to no more than 10 items in the image. The label returned should be an identifying name for the object detected. The answer should follow the json format: [{\"point\": [y, x], \"label\": <label1>}, ...]. The points are in [y, x] format normalized to 0-1000."
        }
      ]
    },
    "generation_config": {
      "thinking_config": {
        "thinking_level": "high"
      }
    }
  }'

আউটপুট হল অবজেক্ট সহ একটি JSON অ্যারে, যার প্রত্যেকটিতে একটি point (স্বাভাবিক [y, x] কোঅর্ডিনেট) এবং একটি label অবজেক্টকে শনাক্ত করে।

JSON

[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"},
  {"point": [223, 303], "label": "pink starfruit"},
  {"point": [435, 172], "label": "paper bag"},
  {"point": [270, 786], "label": "green plastic bowl"},
  {"point": [488, 775], "label": "metal measuring cup"},
  {"point": [673, 580], "label": "dark blue bowl"},
  {"point": [471, 353], "label": "light blue bowl"},
  {"point": [492, 497], "label": "bread"},
  {"point": [525, 429], "label": "lime"}
]

এইসব পয়েন্ট কীভাবে দেখানো যেতে পারে তার একটি উদাহরণ নিচে দেওয়া হল:

ছবির অবজেক্টের পয়েন্ট দেখানোর একটি উদাহরণ

এটি কীভাবে কাজ করে

Gemini Robotics ER, প্রাকৃতিক ভাষা প্রম্পটের মাধ্যমে ছবি, ভিডিও বা অডিও ইনপুট নেয়। এটি অবজেক্ট শনাক্ত করে, দৃশ্য প্রসঙ্গ ও স্থানিক সম্পর্ক সম্পর্কে যুক্তি দেয় এবং কোঅর্ডিনেট বা বাউন্ডিং বক্সের মতো স্ট্রাকচার্ড আউটপুট দেয়।

Gemini Robotics ER-ও এজেন্টিক: এটি জটিল টাস্ককে সাব-টাস্কে ভেঙে দেয় এবং আপনার রোবট ফাংশন কল করে বা জেনারেট করা কোড রান করে সেগুলি এক্সিকিউট করে। যেমন, "বাটিতে আপেলটি রাখো" বাক্যটি খুঁজে নেওয়া, ধরা এবং রাখার মতো ধাপের একটি ক্রম হয়ে যায়।

Gemini কীভাবে টুল কল এক্সিকিউট করে সেই বিষয়ে বিস্তারিত জানতে ফাংশন কলিং দেখুন।

নিরাপত্তা

Gemini Robotics ER-কে নিরাপত্তার কথা মাথায় রেখে তৈরি করা হলেও, রোবটের আশেপাশে নিরাপদ পরিবেশ বজায় রাখার দায়িত্ব আপনার। জেনারেটিভ AI মডেল ভুল করতে পারে এবং ফিজিক্যাল রোবট ক্ষতি করতে পারে। আরও জানতে, Gemini Robotics-এর নিরাপত্তা পৃষ্ঠা দেখুন।

পেশাদার পদ্ধতি

  1. সহজ, স্বাভাবিক ভাষা ব্যবহার করুন। আপনি কোনও ব্যক্তিকে যেভাবে নির্দেশ দিতেন, ঠিক সেইভাবে রোবটকে কী করতে চান তার বিবরণ দিন। কোনও শব্দ কাজ না করলে, সেটির সাধারণ সমার্থক শব্দ ব্যবহার করে দেখুন।

  2. ভিজ্যুয়াল ইনপুট অপ্টিমাইজ করা। ছবি পাঠানোর আগে ছোট বা অস্পষ্ট অবজেক্ট ক্রপ বা জুম ইন করে নিন। আলো ও কম কালার কনট্রাস্ট শনাক্তকরণকে প্রভাবিত করতে পারে।

  3. জটিল টাস্ককে ধাপে ধাপে ভাগ করুন। মডেলকে ফোকাসড রাখতে এবং নির্ভুলতা উন্নত করতে প্রতিটি ধাপ আলাদা আলাদা প্রম্পট হিসেবে পাঠান।

  4. হাই-প্রিসিশন টাস্কের জন্য একাধিকবার কোয়েরি করুন এবং ফলাফলের গড় মান নিন। এই সম্মতিমূলক পদ্ধতি স্পেশিয়াল আউটপুটের ভ্যারিয়েন্স কমায়।

সীমাবদ্ধতা

Gemini Robotics ER-এর মাধ্যমে ডেভেলপ করার সময় নিম্নলিখিত সীমাবদ্ধতাগুলি বিবেচনা করুন:

  • API key সংক্রান্ত বিধিনিষেধ: Gemini API, বিধিনিষেধ নেই এমন API key থেকে আসা অনুরোধ গ্রহণ করে না এবং 403 Forbidden সমস্যা দেখায়। AI Studio-তে বিধিনিষেধ যোগ করে আপনার API কী সুরক্ষিত করুন। আরও বিবরণের জন্য নিরাপদ আনরেস্ট্রিক্টেড API কী দেখুন।
  • লেটেন্সি বনাম পারফর্ম্যান্স: জটিল কোয়েরি, হাই-রেজোলিউশন ইনপুট বা হাই থিংকিং লেভেল প্রসেসিং টাইম বাড়িয়ে দিতে পারে। থিঙ্কিং লেভেলের জন্য লেটেন্সি ও পারফর্ম্যান্সের মধ্যে ভালো ব্যালেন্স পেতে মিডিয়াম ব্যবহার করুন।
  • হ্যালুসিনেশন: সব লার্জ ল্যাঙ্গুয়েজ মডেলের মতো, Gemini Robotics ER মডেল মাঝে মাঝে "হ্যালুসিনেশন" বা ভুল তথ্য দিতে পারে, বিশেষ করে অস্পষ্ট প্রম্পট বা ডিস্ট্রিবিউশনের বাইরে থাকা ইনপুটের ক্ষেত্রে।
  • প্রম্পটের কোয়ালিটির উপর নির্ভরতা: ইনপুট প্রম্পটের স্পষ্টতার উপর আউটপুটের কোয়ালিটি নির্ভর করে। নির্দিষ্ট, ভালোভাবে স্ট্রাকচার করা প্রম্পট ব্যবহার করুন।
  • কম্পিউটেশনাল খরচ: মডেল রান করানো, বিশেষ করে ভিডিও ইনপুট বা হাই thinking_budget কোয়ালিটির ক্ষেত্রে, কম্পিউটেশনাল রিসোর্স ব্যবহার করে এবং খরচ হয়। আরও বিবরণের জন্য চিন্তাভাবনা পৃষ্ঠা দেখুন।
  • ইনপুট ধরন: প্রতিটি মোডের সীমাবদ্ধতা সম্পর্কে বিস্তারিত জানতে নিম্নলিখিত বিষয়গুলি দেখুন।

গোপনীয়তা বিজ্ঞপ্তি

আপনি স্বীকার করছেন যে এই ডকুমেন্টে উল্লেখ করা মডেলগুলি ("রোবোটিক্স মডেল") আপনার নির্দেশাবলী অনুযায়ী আপনার হার্ডওয়্যার অপারেট ও সরানোর জন্য ভিডিও ও অডিও ডেটা ব্যবহার করে। তাই, আপনি Robotics Models এমনভাবে অপারেট করতে পারেন যে Robotics Models শনাক্তযোগ্য ব্যক্তির ডেটা সংগ্রহ করবে, যেমন ভয়েস, ছবি এবং সাদৃশ্য ডেটা ("ব্যক্তিগত ডেটা")। আপনি যদি এমনভাবে রোবোটিক্স মডেল অপারেট করার সিদ্ধান্ত নেন যা ব্যক্তিগত ডেটা সংগ্রহ করে, তাহলে আপনি সম্মত হন যে আপনি কোনও শনাক্তযোগ্য ব্যক্তিকে রোবোটিক্স মডেলের সাথে ইন্টার‍্যাক্ট করতে বা এর আশেপাশে উপস্থিত থাকতে দেবেন না, যতক্ষণ না পর্যন্ত সেই শনাক্তযোগ্য ব্যক্তিকে Gemini API-এর অতিরিক্ত পরিষেবার শর্তাবলীতে বর্ণিত https://ai.google.dev/gemini-api/terms লিঙ্কে (যা "শর্তাবলী" নামে পরিচিত) পাওয়া তথ্য অনুযায়ী Google-এর কাছে তার ব্যক্তিগত ডেটা প্রদান করা হতে পারে এবং সেটি ব্যবহার করা হতে পারে এই বিষয়ে পর্যাপ্ত বিজ্ঞপ্তি দেওয়া হয়েছে এবং তিনি সম্মতি দিয়েছেন। এর মধ্যে "Google কীভাবে আপনার ডেটা ব্যবহার করে" শীর্ষক বিভাগ অনুযায়ী ব্যবহার করাও অন্তর্ভুক্ত। আপনি নিশ্চিত করবেন যে এই ধরনের বিজ্ঞপ্তি শর্তাবলীতে বর্ণিত ব্যক্তিগত ডেটা সংগ্রহ ও ব্যবহার করার অনুমতি দেয়, এবং আপনি ব্যক্তিগত ডেটা সংগ্রহ ও বিতরণ কমানোর জন্য কমার্শিয়ালি যুক্তিসঙ্গত প্রচেষ্টা করবেন। এর জন্য আপনি মুখ অস্পষ্ট করা এবং শনাক্তযোগ্য ব্যক্তি নেই এমন এলাকায় রোবোটিক্স মডেল পরিচালনা করার মতো টেকনিক ব্যবহার করবেন।

দাম

দাম ও উপলভ্য অঞ্চল সম্পর্কে বিস্তারিত তথ্য পেতে, দাম পৃষ্ঠা দেখুন।

মডেল এন্ডপয়েন্ট

Gemini Robotics ER 2 প্রিভিউ

প্রপার্টি বিবরণ
মডেল কোড gemini-robotics-er-2-preview
ডেটার ধরন

ইনপুট

টেক্সট, ছবি, ভিডিও, অডিও

আউটপুট

টেক্সট

টোকেন সীমা[*]

ইনপুট টোকেনের সীমা

১৩১,০৭২

আউটপুট টোকেনের সীমা

৬৫,৫৩৬

কেপেবিলিটি

অডিও জেনারেশন

কাজ করে না

ক্যাশিং

কাজ করে

কোড এক্সিকিউশন

কাজ করে

কম্পিউটার ব্যবহার

কাজ করে

ফাইল সার্চ

কাজ করে

ফাংশন কলিং

কাজ করে

Google Maps-এর মাধ্যমে গ্রাউন্ডিং

কাজ করে

ইমেজ জেনারেশন

কাজ করে না

Live API

কাজ করে না

সার্চ গ্রাউন্ডিং

কাজ করে

স্ট্রাকচার্ড আউটপুট

কাজ করে

ভাবছি

কাজ করে

URL প্রসঙ্গ

কাজ করে

ব্যবহারের বিকল্প

Batch API

কাজ করে

Flex ইনফারেন্স

কাজ করে না

অগ্রাধিকার সংক্রান্ত অনুমান

কাজ করে না

ভার্সন
আরও বিবরণের জন্য মডেল ভার্সন প্যাটার্ন পড়ুন।
  • প্রিভিউ: gemini-robotics-er-2-preview
লেটেস্ট আপডেট জুলাই ২০২৬
মডেল কার্ড মডেল কার্ড

Gemini Robotics ER 2 স্ট্রিমিং প্রিভিউ

প্রপার্টি বিবরণ
মডেল কোড gemini-robotics-er-2-streaming-preview
ডেটার ধরন

ইনপুট

টেক্সট, ছবি, ভিডিও, অডিও

আউটপুট

টেক্সট

টোকেন সীমা[*]

ইনপুট টোকেনের সীমা

১৩১,০৭২

আউটপুট টোকেনের সীমা

৬৫,৫৩৬

কেপেবিলিটি

অডিও জেনারেশন

কাজ করে না

ক্যাশিং

কাজ করে না

কোড এক্সিকিউশন

কাজ করে না

কম্পিউটার ব্যবহার

কাজ করে না

ফাইল সার্চ

কাজ করে না

ফাংশন কলিং

কাজ করে

Google Maps-এর মাধ্যমে গ্রাউন্ডিং

কাজ করে না

ইমেজ জেনারেশন

কাজ করে না

Live API

কাজ করে

সার্চ গ্রাউন্ডিং

কাজ করে

স্ট্রাকচার্ড আউটপুট

কাজ করে না

ভাবছি

কাজ করে

URL প্রসঙ্গ

কাজ করে না

ব্যবহারের বিকল্প

Batch API

কাজ করে না

Flex ইনফারেন্স

কাজ করে না

অগ্রাধিকার সংক্রান্ত অনুমান

কাজ করে না

ভার্সন
আরও বিবরণের জন্য মডেল ভার্সন প্যাটার্ন পড়ুন।
  • প্রিভিউ: gemini-robotics-er-2-streaming-preview
লেটেস্ট আপডেট জুলাই ২০২৬
মডেল কার্ড মডেল কার্ড

Gemini Robotics ER 1.6 প্রিভিউ

প্রপার্টি বিবরণ
মডেল কোড gemini-robotics-er-1.6-preview
ডেটার ধরন

ইনপুট

টেক্সট, ছবি, ভিডিও, অডিও

আউটপুট

টেক্সট

টোকেন সীমা[*]

ইনপুট টোকেনের সীমা

১৩১,০৭২

আউটপুট টোকেনের সীমা

৬৫,৫৩৬

কেপেবিলিটি

অডিও জেনারেশন

কাজ করে না

ক্যাশিং

কাজ করে

কোড এক্সিকিউশন

কাজ করে

কম্পিউটার ব্যবহার

কাজ করে

ফাইল সার্চ

কাজ করে

ফাংশন কলিং

কাজ করে

Google Maps-এর মাধ্যমে গ্রাউন্ডিং

কাজ করে

ইমেজ জেনারেশন

কাজ করে না

Live API

কাজ করে না

সার্চ গ্রাউন্ডিং

কাজ করে

স্ট্রাকচার্ড আউটপুট

কাজ করে

ভাবছি

কাজ করে

URL প্রসঙ্গ

কাজ করে

ব্যবহারের বিকল্প

Batch API

কাজ করে

Flex ইনফারেন্স

কাজ করে না

অগ্রাধিকার সংক্রান্ত অনুমান

কাজ করে না

ভার্সন
আরও বিবরণের জন্য মডেল ভার্সন প্যাটার্ন পড়ুন।
  • প্রিভিউ: gemini-robotics-er-1.6-preview
লেটেস্ট আপডেট ডিসেম্বর ২০২৫
নলেজ কাটঅফ জানুয়ারি ২০২৫

এর পরে কী করতে হবে