ভিডিও বোঝার

জেমিনি রোবোটিক্স ইআর ২ দুটি সক্ষমতা ব্যবহার করে অবিচ্ছিন্ন ভিডিও ফিড থেকে কাজের অগ্রগতি ট্র্যাক করতে পারে:

  • মুহূর্ত শনাক্তকরণ: কোনো গুরুত্বপূর্ণ ঘটনা ঘটার সুনির্দিষ্ট সময় শনাক্ত করে।
  • অগ্রগতি শ্রেণিবিন্যাস: প্রতিটি ভিডিওকে পাঁচটি সমাপ্তি স্তরের (০–২০%, ২০–৪০%, ৪০–৬০%, ৬০–৮০%, ৮০–১০০%) যেকোনো একটিতে অন্তর্ভুক্ত করে।

মুহূর্ত সন্ধান

মোমেন্ট ফাইন্ডিং ভিডিওর সেই নির্দিষ্ট ফ্রেমটি শনাক্ত করে যেখানে একটি গুরুত্বপূর্ণ ঘটনা ঘটে — যেমন, যখন একটি কাপ ভরে যায় বা একটি গিঁট বাঁধা হয়। রোবটগুলো এটি ব্যবহার করে সাফল্য যাচাই করতে, ধাপগুলো ক্রমানুসারে সাজাতে এবং সংশোধনের ব্যবস্থা নিতে।

নিম্নলিখিত উদাহরণ নির্দেশটি মডেলকে একটি ভিডিওতে প্রদত্ত কোনো কাজের সমাপ্তির মুহূর্ত শনাক্ত করতে বলে:

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="task_video.mp4")

prompt = """
At what timestamp (in seconds) does the task reach successful completion?
Return a JSON object: {"completion_time_seconds": <float>}.
If the task is not completed, return {"completion_time_seconds": null}.
"""

interaction = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "video",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": prompt}
    ],
)

print(interaction.output_text)

নিচে একটি মুহূর্ত-সন্ধান ভিডিওর কয়েকটি উদাহরণ ফ্রেম দেখানো হলো, যেখানে মডেলটি কাজটি সম্পন্ন হওয়ার টাইমস্ট্যাম্প শনাক্ত করছে:

টাইমস্ট্যাম্প ওভারলে সহ মুহূর্তটি খুঁজে বের করার আউটপুট দেখানো উদাহরণ ভিডিও ফ্রেম।

অগ্রগতি শ্রেণিবিন্যাস

অগ্রগতি শ্রেণিবিন্যাস একটি ভিডিওকে পাঁচটি সমাপ্তি স্তরের যেকোনো একটিতে স্থান দেয়: ০–২০%, ২০–৪০%, ৪০–৬০%, ৬০–৮০%, অথবা ৮০–১০০%। এটি রোবটকে রিয়েল-টাইম পরিস্থিতিগত সচেতনতা দেয়, যার ফলে তারা সম্পূর্ণ ওয়ার্কফ্লো পুনরায় শুরু না করেই তাদের কার্যক্রম সামঞ্জস্য করতে বা ব্যর্থ ধাপগুলো পুনরায় চেষ্টা করতে পারে।

নিম্নলিখিত উদাহরণ নির্দেশটি মডেলকে একটি ভিডিও থেকে বর্তমান অগ্রগতির স্তর শ্রেণীবদ্ধ করতে বলে:

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="task_video.mp4")

prompt = """
Watch this video and classify the task progress level at the final frame.
Return a JSON object with the progress bracket:
{"progress_level": "0-20" | "20-40" | "40-60" | "60-80" | "80-100"}.
"""

interaction = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "video",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": prompt}
    ],
)

print(interaction.output_text)

নিচে একটি অগ্রগতি শ্রেণীকরণ ভিডিওর উদাহরণ ফ্রেম দেখানো হলো, যেখানে মডেলটি একটি অগ্রগতি ব্র্যাকেট নির্ধারণ করছে:

অগ্রগতি বন্ধনী লেবেল সহ অগ্রগতি শ্রেণিবিন্যাস আউটপুট দেখানো উদাহরণ ভিডিও ফ্রেম।

উদাহরণ

একাধিক ধাপের টাস্ক ট্র্যাকিং সহ সম্পূর্ণ কার্যকর উদাহরণের জন্য, রোবোটিক্স কুকবুকটি দেখুন।

এরপর কী?