वीडियो की बारीक़ी से पहचान करना

Gemini Robotics ER 2, दो सुविधाओं का इस्तेमाल करके, लगातार वीडियो फ़ीड से टास्क की प्रोग्रेस को ट्रैक कर सकता है:

  • मोमेंट फ़ाइंडिंग: इससे सटीक टाइमस्टैंप की पहचान की जाती है, जहां कोई मुख्य इवेंट होता है.
  • प्रोग्रेस क्लासिफ़िकेशन: इससे हर वीडियो को पांच कंप्लीशन ब्रैकेट में से किसी एक में असाइन किया जाता है. ये ब्रैकेट 0–20%, 20–40%, 40–60%, 60–80%, और 80–100% हैं.

मोमेंट फ़ाइंडिंग

मोमेंट फ़ाइंडिंग से, वीडियो के उस सटीक फ़्रेम की पहचान की जाती है जहां कोई अहम इवेंट होता है. उदाहरण के लिए, जब कोई कप भर जाता है या कोई गांठ बांधी जाती है. रोबोट इसका इस्तेमाल, सफलता की पुष्टि करने, चरणों को क्रम से लगाने, और गड़बड़ियों को ठीक करने के लिए करते हैं.

यहां दिए गए उदाहरण में, प्रॉम्प्ट मॉडल से किसी वीडियो में दिए गए टास्क के पूरा होने के मोमेंट की पहचान करने के लिए कहता है:

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="task_video.mp4")

prompt = """
At what timestamp (in seconds) does the task reach successful completion?
Return a JSON object: {"completion_time_seconds": <float>}.
If the task is not completed, return {"completion_time_seconds": null}.
"""

interaction = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "video",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": prompt}
    ],
)

print(interaction.output_text)

यहां मोमेंट फ़ाइंडिंग वाले वीडियो के उदाहरण के तौर पर फ़्रेम दिखाए गए हैं. इनमें मॉडल, टास्क के पूरा होने का टाइमस्टैंप दिखाता है:

टाइमस्टैंप ओवरले के साथ, वीडियो फ़्रेम में किसी खास पल को ढूंढने का आउटपुट दिखाने वाले वीडियो फ़्रेम का उदाहरण

प्रोग्रेस क्लासिफ़िकेशन

प्रोग्रेस क्लासिफ़िकेशन से, किसी वीडियो को पांच कंप्लीशन ब्रैकेट में से किसी एक में असाइन किया जाता है. ये ब्रैकेट 0–20%, 20–40%, 40–60%, 60–80%, या 80–100% हैं. इससे रोबोट को रीयल-टाइम में स्थिति की जानकारी मिलती है. इसलिए, वे पूरे वर्कफ़्लो को रीस्टार्ट किए बिना, कार्रवाइयों को अडजस्ट कर सकते हैं या फ़ेल हुए चरणों को फिर से आज़मा सकते हैं.

यहां दिए गए उदाहरण में, प्रॉम्प्ट मॉडल से किसी वीडियो में मौजूदा प्रोग्रेस लेवल को क्लासिफ़ाई करने के लिए कहता है:

from google import genai

client = genai.Client()

uploaded_file = client.files.upload(file="task_video.mp4")

prompt = """
Watch this video and classify the task progress level at the final frame.
Return a JSON object with the progress bracket:
{"progress_level": "0-20" | "20-40" | "40-60" | "60-80" | "80-100"}.
"""

interaction = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "video",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": prompt}
    ],
)

print(interaction.output_text)

यहां प्रोग्रेस क्लासिफ़िकेशन वाले वीडियो के उदाहरण के तौर पर फ़्रेम दिखाए गए हैं. इनमें मॉडल, प्रोग्रेस ब्रैकेट असाइन करता है:

प्रोग्रेस ब्रैकेट के लेबल के साथ, प्रोग्रेस क्लासिफ़िकेशन का आउटपुट दिखाने वाले वीडियो फ़्रेम का उदाहरण

उदाहरण

मल्टी-स्टेप टास्क ट्रैकिंग की सुविधा वाले, पूरी तरह से काम करने वाले उदाहरण देखने के लिए, Robotics cookbook देखें.

आगे क्या करना है