Gemini 3.5 Flash में नया क्या है

3.6 Flash और 3.5 Flash-Lite के बारे में जानकारी देने वाला यह पेज

Gemini 3.5 Flash, सामान्य तौर पर उपलब्ध (जीए) है. यह स्टेबल है और इसका इस्तेमाल बड़े पैमाने पर प्रोडक्शन के लिए किया जा सकता है. यह हमारा सबसे ऐडवांस Flash मॉडल है. यह एजेंटिक एक्ज़ीक्यूशन, कोडिंग, और लंबे समय तक चलने वाले मुश्किल टास्क को बड़े पैमाने पर पूरा करने में बेहतरीन परफ़ॉर्मेंस देता है.

इस गाइड में, Gemini 3.5 Flash में किए गए सुधारों, एपीआई में हुए बदलावों, और माइग्रेशन के बारे में जानकारी दी गई है.

नया मॉडल

मॉडल मॉडल आईडी ब्यौरा
Gemini 3.5 Flash gemini-3.5-flash यह हमारा सबसे ऐडवांस मॉडल है. यह एजेंटिक और कोडिंग से जुड़े मुश्किल टास्क को बड़े पैमाने पर पूरा करने में बेहतरीन परफ़ॉर्मेंस देता है.

Gemini 3.5 Flash, 10 लाख टोकन वाली कॉन्टेक्स्ट विंडो, ज़्यादा से ज़्यादा 65 हज़ार आउटपुट टोकन, थिंकिंग, और Gemini 3 Flash के जैसे ही टूल और प्लैटफ़ॉर्म की सुविधाओं के साथ काम करता है, इसमें कंप्यूटर इस्तेमाल करने की सुविधा (प्रीव्यू) भी शामिल है.

पूरी जानकारी के लिए, मॉडल की खास जानकारी देखें. कीमत की जानकारी के लिए, कीमत तय करने से जुड़ा पेज देखें.

क्विकस्टार्ट

इस गाइड में दिए गए सभी उदाहरणों में, Interactions API का इस्तेमाल किया गया है. GenerateContent API भी काम करता है. इस पर भी वही कॉन्फ़िगरेशन के विकल्प और सुझाव लागू होते हैं.

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.5-flash",
    input="Explain how parallel agentic execution works in three sentences."
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

async function main() {
  const interaction = await client.interactions.create({
    model: "gemini-3.5-flash",
    input: "Explain how parallel agentic execution works in three sentences.",
  });
  console.log(interaction.output_text);
}

main();

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.5-flash",
    "input": "Explain how parallel agentic execution works in three sentences."
  }'

नया क्या है

  • बेहतरीन परफ़ॉर्मेंस: यह हमारा सबसे ऐडवांस Flash मॉडल है. इसे एजेंटिक और कोडिंग से जुड़े मुश्किल टास्क को बड़े पैमाने पर पूरा करने के लिए ऑप्टिमाइज़ किया गया है.
  • एजेंटिक एक्ज़ीक्यूशन: सब-एजेंट डिप्लॉयमेंट, समस्या हल करना, और बड़े पैमाने पर तेज़ी से एजेंटिक लूप बनाना.
  • कोडिंग: कोडिंग के बार-बार होने वाले साइकल, तेज़ी से एक्सप्लोरेशन, और प्रोटोटाइपिंग की मदद से, अलग-अलग पाथ की जांच करना और डाइनैमिक तरीके से समाधान खोजना.
  • लंबे समय तक चलने वाले मुश्किल टास्क: मल्टी-स्टेप वर्कफ़्लो और बड़े पैमाने पर टूल का इस्तेमाल करना.
  • विचार को बनाए रखना: मॉडल, कई राउंड वाली बातचीत के दौरान, बीच-बीच में की गई रीज़निंग को अपने-आप बनाए रखता है. एपीआई में कोई बदलाव करने की ज़रूरत नहीं है.
  • मेहनत के नए डिफ़ॉल्ट लेवल: थिंकिंग के लिए, डिफ़ॉल्ट रूप से लगने वाली मेहनत का लेवल high से बदलकर medium कर दिया गया है. ज़्यादा जानकारी के लिए, मेहनत का नया डिफ़ॉल्ट लेवल देखें.
  • low थिंकिंग को बेहतर बनाना: low थिंकिंग को अब कोड और एजेंटिक टास्क के लिए बेहतर बनाया गया है. इन टास्क को पूरा करने में कम समय लगता है और कम चरणों की ज़रूरत होती है. साथ ही, यह कम लागत में अच्छी क्वालिटी के नतीजे देता है.
  • जीए रिलीज़: बड़े पैमाने पर प्रोडक्शन के लिए, स्टेबल मॉडल.

सही Flash मॉडल चुनना

Gemini 3.5 Flash, हमारा सबसे ऐडवांस और बेहतरीन Flash मॉडल है. हालांकि, अलग-अलग इस्तेमाल के उदाहरणों के लिए, लागत और समय की अलग-अलग ज़रूरतें हो सकती हैं.

  • Gemini 3.1 Flash-Lite: कम लागत में, ज़्यादा वॉल्यूम वाले टास्क के लिए, हम Gemini 3.1 Flash-Lite का इस्तेमाल करने का सुझाव देते हैं. इन टास्क को पूरा करने के लिए, 3.5 Flash की तरह ऐडवांस रीज़निंग की ज़रूरत नहीं होती. यह एक स्टेबल और लंबे समय तक चलने वाला मॉडल है. इसे बेहतर परफ़ॉर्मेंस के लिए ऑप्टिमाइज़ किया गया है. ज़्यादा जानकारी के लिए, Flash-Lite की डेवलपर गाइड देखें.
  • Gemini 3 Flash (प्रीव्यू): हम आपको जीए की स्टेबिलिटी और बेहतर रीज़निंग के लिए, 3.5 Flash पर माइग्रेट करने का सुझाव देते हैं. हालांकि, Gemini 3 Flash (प्रीव्यू) उन डेवलपर के लिए उपलब्ध रहेगा जो प्रीव्यू मॉडल के साथ टेस्टिंग जारी रखना चाहते हैं.

व्यवहार में हुए बदलाव

मेहनत का नया डिफ़ॉल्ट लेवल: medium

थिंकिंग के लिए, डिफ़ॉल्ट रूप से लगने वाली मेहनत का लेवल अब medium है. इसे Gemini 3 Flash (प्रीव्यू) में high से बदलकर medium कर दिया गया है. medium लेवल पर, अलग-अलग तरह के टास्क के लिए बहुत अच्छे नतीजे मिलते हैं. साथ ही, यह तेज़ी से और कम लागत में काम करता है. मुश्किल समस्याओं के लिए, high लेवल पर मॉडल ज़्यादा गहराई से सोच-विचार करता है.

मेहनत का लेवल कब इस्तेमाल करें
minimal जवाब देने की स्पीड के लिए ऑप्टिमाइज़ किया गया है. चैट जैसे इस्तेमाल के उदाहरण, सटीक जानकारी वाले तुरंत जवाब, आसान टूल कॉल.
low कोड और एजेंटिक टास्क के लिए, जिनमें कम समय लगता है और कम चरणों की ज़रूरत होती है. यह विश्लेषण और लिखने से जुड़े उन टास्क के लिए भी अच्छा काम करता है जिनमें कुछ सोच-विचार की ज़रूरत होती है.
medium (डिफ़ॉल्ट) ज़्यादातर टास्क के लिए, सबसे अच्छी क्वालिटी. मुश्किल कोड और एजेंटिक इस्तेमाल के उदाहरणों के लिए सुझाव दिया जाता है.
high मॉडल की सोचने और टूल इस्तेमाल करने की क्षमता को बढ़ाता है. मुश्किल रीज़निंग, मुश्किल गणित के सवालों, और सबसे मुश्किल कोड या एजेंट टास्क के लिए सबसे सही. ज़्यादा सोच-विचार करने और फ़ंक्शन कॉल की अनुमति देता है.

डिफ़ॉल्ट सेटिंग को बदलने के लिए, अपने कॉन्फ़िगरेशन में thinking_level सेट करें:

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.5-flash",
    input="Prove that the square root of 2 is irrational.",
    generation_config={"thinking_level": "high"},
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

async function main() {
  const interaction = await client.interactions.create({
    model: "gemini-3.5-flash",
    input: "Prove that the square root of 2 is irrational.",
    generationConfig: { thinkingLevel: "high" },
  });
  console.log(interaction.output_text);
}

main();

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.5-flash",
    "input": "Prove that the square root of 2 is irrational.",
    "generation_config": {"thinking_level": "high"}
  }'

यहां दी गई टेबल में, हर मॉडल के लिए काम करने वाले थिंकिंग लेवल दिखाए गए हैं:

थिंकिंग लेवल Gemini 3.5 Flash Gemini 3.1 Pro Gemini 3.1 Flash-Lite Gemini 3 Flash ब्यौरा
minimal काम करता है काम नहीं करता है काम करता है (डिफ़ॉल्ट) काम करता है ज़्यादातर क्वेरी के लिए, "नो थिंकिंग" सेटिंग से मेल खाता है. ध्यान दें, minimal लेवल पर यह ज़रूरी नहीं है कि थिंकिंग बंद हो. मॉडल, मुश्किल टास्क के लिए बहुत कम रीज़निंग कर सकता है.
low काम करता है काम करता है काम करता है काम करता है समय और लागत को कम करता है.
medium काम करता है (डिफ़ॉल्ट) काम करता है काम करता है काम करता है ज़्यादातर टास्क के लिए, बैलेंस थिंकिंग.
high काम करता है (डाइनैमिक) काम करता है (डिफ़ॉल्ट, डाइनैमिक) काम करता है (डाइनैमिक) काम करता है (डिफ़ॉल्ट, डाइनैमिक) रीज़निंग की गहराई को बढ़ाता है.

विचार को बनाए रखना

मॉडल, कई राउंड वाली बातचीत के दौरान, बीच-बीच में की गई रीज़निंग को अपने-आप बनाए रखता है. बातचीत के इतिहास में मौजूद होने पर, गहराई से विश्लेषण कॉन्टेक्स्ट आगे बढ़ता है. इससे, मुश्किल मल्टी-स्टेप टास्क की परफ़ॉर्मेंस बेहतर होती है. जैसे, बार-बार डीबग करना और कोड रीफ़ैक्टर करना. एपीआई में कोई बदलाव करने की ज़रूरत नहीं है:

  • Interactions API: इसमें, विचार अपने-आप सेव हो जाते हैं. व्यवहार में कोई बदलाव नहीं हुआ है.
  • GenerateContent API: Gemini 3.5 Flash से, मॉडल, बातचीत के इतिहास में थॉट सिग्नेचर मौजूद होने पर, पिछले सभी राउंड के रीज़निंग कॉन्टेक्स्ट का इस्तेमाल करता है. इसे चालू करने के लिए, `contents` में बातचीत का पूरा, बिना बदलाव वाला इतिहास (जिसमें थॉट सिग्नेचर भी शामिल हैं) पास करेंcontents. एसडीके, इसे अपने-आप मैनेज करते हैं.

Gemini 3.x में पैरामीटर के अपडेट और सबसे सही तरीके

ये बातें, Gemini 3.5 Flash के साथ-साथ Gemini 3.x के सभी मॉडल पर लागू होती हैं.

  • temperature, top_p, top_k: हमारा सुझाव है कि इनकी डिफ़ॉल्ट वैल्यू में बदलाव न करें. Gemini 3 की रीज़निंग की क्षमताओं को डिफ़ॉल्ट सेटिंग के लिए ऑप्टिमाइज़ किया गया है.
  • thinking_budget के बजाय, thinking_level का इस्तेमाल करें.
  • फ़ंक्शन कॉलिंग के जवाबों को मैच करना: id, name, और जवाबों की संख्या पहले किए गए कॉल से मैच होनी चाहिए.
  • मल्टीमोडल फ़ंक्शन के जवाब: मल्टीमोडल कॉन्टेंट को फ़ंक्शन के जवाब में शामिल करें, न कि उसके बाहर.
  • फ़ंक्शन के जवाबों में इनलाइन निर्देश: इन्हें फ़ंक्शन के जवाब के टेक्स्ट में जोड़ें, न कि अलग-अलग हिस्सों के तौर पर.
  • टूल कॉल की संख्या कम करना: एजेंटिक वर्कफ़्लो में टूल कॉल की संख्या कम करने के लिए, थिंकिंग के कम लेवल का इस्तेमाल करें या सिस्टम के निर्देशों के साथ एक्सपेरिमेंट करें.

अपना कोड अपडेट करने का तरीका जानने के लिए, नीचे दिए गए सेक्शन देखें.

सैंपलिंग पैरामीटर (अब इनका इस्तेमाल करने का सुझाव नहीं दिया जाता)

temperature, top_p, और top_k पैरामीटर का इस्तेमाल अब Gemini 3.x के सभी मॉडल के लिए करने का सुझाव नहीं दिया जाता. Gemini 3 की रीज़निंग की क्षमताओं को डिफ़ॉल्ट सेटिंग के लिए ऑप्टिमाइज़ किया गया है. सभी अनुरोधों से इन पैरामीटर को हटाएं.

# ⚠️ Remove these parameters (not recommended)
generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40,
}

डिटरमिनिज़म पक्का करने के लिए, हमारा सुझाव है कि आप अपने इस्तेमाल के उदाहरण के लिए, साफ़ तौर पर नियमों के साथ सिस्टम का निर्देश तय करें.

thinking_budget (अब इसका इस्तेमाल करने का सुझाव नहीं दिया जाता)

रॉ न्यूमेरिक thinking_budget पैरामीटर का इस्तेमाल अब Gemini 3.x के सभी मॉडल के लिए करने का सुझाव नहीं दिया जाता. इसके बजाय, thinking_level स्ट्रिंग एनम का इस्तेमाल करें.

# ⚠️ Before (not recommended)
generation_config = {
    "thinking": {"thinking_budget": 7500},
}

# ✅ After
generation_config = {
    "thinking": {"thinking_level": "medium"},
}

उपलब्ध वैल्यू: minimal, low, medium (डिफ़ॉल्ट), और high.

फ़ंक्शन कॉलिंग: जवाबों को सख्ती से मैच करना

Interactions API, फ़ंक्शन के जवाब मैच न होने पर पहले से ही गड़बड़ी दिखाता है. GenerateContent API, फ़िलहाल गड़बड़ी नहीं दिखाता. हालांकि, जवाब मैच न होने पर, मॉडल ज़्यादातर मामलों में finish_reason: STOP के साथ खाली जवाब देता है. हमेशा इन कन्वर्ज़न का पालन करें:

आवश्यकता विवरण
id शामिल करें हर FunctionResponse में, उससे जुड़े FunctionCall का id शामिल होना चाहिए
name मैच करें जवाब में मौजूद name, कॉल में मौजूद name से मैच होना चाहिए
संख्याएं मैच करें हर FunctionCall के लिए, ठीक एक FunctionResponse लौटाएं

Python

# ✅ Include matching call_id and name in the function_result
final_interaction = client.interactions.create(
    model="gemini-3.5-flash",
    previous_interaction_id=interaction.id,
    tools=[my_tool],
    input=[{
        "type": "function_result",
        "name": fc_step.name,
        "call_id": fc_step.id,
        "result": [{"type": "text", "text": json.dumps(result)}],
    }],
)

JavaScript

// ✅ Include matching call_id and name in the function_result
const finalInteraction = await client.interactions.create({
  model: "gemini-3.5-flash",
  previousInteractionId: interaction.id,
  tools: [myTool],
  input: [{
    type: "function_result",
    name: fcStep.name,
    call_id: fcStep.id,
    result: [{ type: "text", text: JSON.stringify(result) }],
  }],
});

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.5-flash",
    "previous_interaction_id": "<INTERACTION_ID>",
    "tools": [...],
    "input": [{
      "type": "function_result",
      "name": "my_function",
      "call_id": "<CALL_ID>",
      "result": [{"type": "text", "text": "..."}]
    }]
  }'

मल्टीमोडल फ़ंक्शन के जवाब

हम अक्सर देखते हैं कि क्लाइंट, फ़ंक्शन के जवाब के बाहर इमेज उपलब्ध कराते हैं. इससे मॉडल का व्यवहार उम्मीद के मुताबिक नहीं होता. जैसे, थॉट लीकेज और आउटपुट की क्वालिटी कम हो सकती है. इसके बजाय, मल्टीमोडल फ़ंक्शन के जवाबों के लिए, एपीआई के दस्तावेज़ों में दिए गए सुझाव का पालन करें. साथ ही, मॉडल को भेजे जाने वाले फ़ंक्शन के जवाब के हिस्सों में मल्टीमोडल कॉन्टेंट शामिल करें. मॉडल, ज़्यादा सटीक जवाब देने के लिए, अगले राउंड में इस मल्टीमोडल कॉन्टेंट को प्रोसेस कर सकता है.

Python

# ✅ Include multimodal content in the function response
final_interaction = client.interactions.create(
    model="gemini-3.5-flash",
    previous_interaction_id=interaction.id,
    input=[
        {
            "type": "function_result",
            "name": tool_call.name,
            "call_id": tool_call.id,
            "result": [
                {"type": "text", "text": "instrument.jpg"},
                {
                    "type": "image",
                    "mime_type": "image/jpeg",
                    "data": base64_image_data,
                },
            ],
        }
    ],
)

JavaScript

// ✅ Include multimodal content in the function response
const finalInteraction = await client.interactions.create({
  model: "gemini-3.5-flash",
  previousInteractionId: interaction.id,
  input: [{
    type: "function_result",
    name: toolCall.name,
    call_id: toolCall.id,
    result: [
      { type: "text", text: "instrument.jpg" },
      {
        type: "image",
        mime_type: "image/jpeg",
        data: base64ImageData,
      },
    ],
  }],
});

फ़ंक्शन के जवाबों में इनलाइन निर्देश

हम अक्सर देखते हैं कि क्लाइंट, फ़ंक्शन के जवाबों के साथ-साथ, बाद के Parts के तौर पर अतिरिक्त निर्देश देते हैं. इससे मॉडल का व्यवहार उम्मीद के मुताबिक नहीं होता. जैसे, थॉट लीकेज और आउटपुट की क्वालिटी कम हो सकती है. इसके बजाय, किसी भी अतिरिक्त निर्देश को फ़ंक्शन के जवाब के टेक्स्ट के आखिर में, दो नई लाइनों से अलग करके जोड़ें.

Python

# ✅ Append inline instructions to the end of the function response separated by two newlines
result_text = f"{json.dumps(result)}\n\n<your inline instructions>"

final_interaction = client.interactions.create(
    model="gemini-3.5-flash",
    previous_interaction_id=interaction.id,
    tools=[my_tool],
    input=[{
        "type": "function_result",
        "name": fc_step.name,
        "call_id": fc_step.id,
        "result": [{"type": "text", "text": result_text}],
    }],
)

JavaScript

// ✅ Append inline instructions to the end of the function response separated by two newlines
const resultText = `${JSON.stringify(result)}\n\n<your inline instructions>`;

const finalInteraction = await client.interactions.create({
  model: "gemini-3.5-flash",
  previousInteractionId: interaction.id,
  tools: [myTool],
  input: [{
    type: "function_result",
    name: fcStep.name,
    call_id: fcStep.id,
    result: [{ type: "text", text: resultText }],
  }],
});

टूल कॉल की संख्या कम करना

अगर आपको टूल कॉल का ज़्यादा इस्तेमाल दिखता है, तो इन्हें कम करने के लिए दो तकनीकों का इस्तेमाल किया जा सकता है:

  1. थिंकिंग का लेवल कम करके शुरू करें (medium, low, या minimal): थिंकिंग के ज़्यादा लेवल पर, मॉडल, एक्सप्लोर करने और पुष्टि करने के लिए ज़्यादा टूल का इस्तेमाल करता है. इसलिए, लेवल कम करने से टूल कॉल की संख्या कम हो सकती है.

  2. सिस्टम का निर्देश जोड़ें: अगर थिंकिंग का लेवल अडजस्ट करने के बाद भी, टूल कॉल का ज़्यादा इस्तेमाल जारी रहता है, तो ऐसा प्रॉम्प्ट इस्तेमाल करें जिससे टूल के इस्तेमाल पर पाबंदी लगाई जा सके. उदाहरण के लिए:

    You have a limited action budget of <n> tool calls. Use them efficiently.
    

माइग्रेशन के लिए चेकलिस्ट

हमारा सुझाव है कि आप google-genai SDK टूल को v2.0.0 या उसके बाद के वर्शन पर अपडेट करें. इस वर्शन में, Interactions API में नुकसान पहुंचा सकने वाले बदलाव किए गए हैं. ज़्यादा जानकारी के लिए, नुकसान पहुंचा सकने वाले बदलावों के लिए माइग्रेशन गाइड देखें.

Gemini 3 Flash (प्रीव्यू) से माइग्रेट करना

  • मॉडल का नाम अपडेट करें: gemini-3-flash-previewgemini-3.5-flash
  • कीमत की समीक्षा करें. Gemini 3.5 Flash, Gemini 3 Flash (प्रीव्यू) से ज़्यादा महंगा है. अगर आपके इस्तेमाल के उदाहरण में लागत बहुत मायने रखती है, तो इसके बजाय Gemini 3.1 Flash-Lite पर माइग्रेट करने पर विचार करें. ज़्यादा जानकारी के लिए, कीमत तय करने से जुड़ा पेज देखें.
  • अपने कॉन्फ़िगरेशन से temperature, top_p, top_k को हटाएं. अब इनका इस्तेमाल करने का सुझाव नहीं दिया जाता.
  • thinking_budget की जगह, thinking_level का इस्तेमाल करें.
  • FunctionResponse के सभी हिस्सों में, id और उससे मैच करने वाला name जोड़ें.
  • अपने प्रॉम्प्ट की जांच करें. मेहनत का डिफ़ॉल्ट लेवल high से बदलकर medium कर दिया गया है. इसलिए, क्वालिटी, स्पीड, और लागत की पुष्टि करें.
  • विचार को बनाए रखने की सुविधा अब डिफ़ॉल्ट रूप से चालू है. रीज़निंग कॉन्टेक्स्ट, राउंड के हिसाब से आगे बढ़ता है. इससे परफ़ॉर्मेंस बेहतर होती है, लेकिन टोकन का इस्तेमाल बढ़ सकता है.
  • टूल कॉल की संख्या कम करें: थिंकिंग का लेवल कम करके शुरू करें (medium, low, या minimal). अगर टूल कॉल का ज़्यादा इस्तेमाल जारी रहता है, तो टूल के इस्तेमाल पर पाबंदी लगाने के लिए, सिस्टम का निर्देश जोड़ें.
  • कंप्यूटर इस्तेमाल करने की सुविधा उपलब्ध है.

Gemini 2.5 से माइग्रेट करना

ऊपर दी गई सभी बातें, साथ ही:

  • प्रॉम्प्ट को आसान बनाएं. अगर आपने रीज़निंग को मजबूर करने के लिए, चेन-ऑफ़-थॉट प्रॉम्प्ट इंजीनियरिंग का इस्तेमाल किया है, तो इसके बजाय आसान प्रॉम्प्ट के साथ thinking_level: "medium" या "high" का इस्तेमाल करें.
  • पीडीएफ़ और मीडिया वर्कलोड की जांच करें. अगर आपने घने दस्तावेज़ को पार्स करने के लिए, किसी खास व्यवहार पर भरोसा किया है, तो सटीक जानकारी पाने के लिए, media_resolution_high सेटिंग की जांच करें. Gemini 3 के डिफ़ॉल्ट पर माइग्रेट करने से, पीडीएफ़ के लिए टोकन का इस्तेमाल बढ़ सकता है. हालांकि, वीडियो के लिए यह कम हो सकता है. अगर अनुरोध, कॉन्टेक्स्ट विंडो से ज़्यादा हैं, तो साफ़ तौर पर media_resolution को कम करें. ज़्यादा जानकारी के लिए, मीडिया रिज़ॉल्यूशन के दस्तावेज़ देखें.
  • एक साथ कई टूल का इस्तेमाल करें. एक ही अनुरोध में, Google Search, यूआरएल कॉन्टेक्स्ट, कोड एक्ज़ीक्यूशन, और कस्टम फ़ंक्शन का इस्तेमाल किया जा सकता है.
  • मल्टीमोडल फ़ंक्शन के जवाबों का इस्तेमाल करते समय, मल्टीमोडल कॉन्टेंट को फ़ंक्शन के जवाब के हिस्सों में शामिल करें, न कि उनके साथ.
  • फ़ंक्शन के जवाबों के साथ इनलाइन निर्देशों का इस्तेमाल करते समय, उन्हें फ़ंक्शन के जवाब के टेक्स्ट में, दो नई लाइनों से अलग करके जोड़ें, न कि अलग-अलग हिस्सों के तौर पर.
  • Gemini 3.x में, इमेज सेगमेंटेशन की सुविधा उपलब्ध नहीं है. सेगमेंटेशन वर्कलोड के लिए, Gemini 2.5 Flash का इस्तेमाल, थिंकिंग बंद करके जारी रखें.
  • अपने कॉन्फ़िगरेशन से candidate_count को हटाएं (Gemini 3.x में मौजूद नहीं है)

Gemini 3 फ़ैमिली की सुविधाएं

Gemini 3.5 Flash में, Gemini 3 फ़ैमिली की सभी क्षमताएं शामिल हैं. इनमें कंप्यूटर इस्तेमाल करने की सुविधा भी शामिल है. Gemini 3 में जोड़ी गई वे सुविधाएं जो आगे भी उपलब्ध रहेंगी:

  • थिंकिंग: एपीआई कॉल के दौरान, एन्क्रिप्टेड रीज़निंग कॉन्टेक्स्ट सेव रहता है. Interactions API में अपने-आप; GenerateContent में इंप्लिसिट.
  • टूल के साथ स्ट्रक्चर्ड आउटपुट: JSON मोड को इन-बिल्ट सुविधाओं (Search, यूआरएल कॉन्टेक्स्ट, कोड एक्ज़ीक्यूशन, फ़ंक्शन कॉलिंग) के साथ मिलाएं.
  • मल्टीमोडल फ़ंक्शन के जवाब: फ़ंक्शन कॉल के नतीजों में इमेज, ऑडियो, और अन्य मीडिया लौटाएं.
  • इमेज के साथ कोड एक्ज़ीक्यूशन: इमेज को प्रोसेस और जनरेट करने वाले कोड को एक्ज़ीक्यूट करें.
  • एक साथ कई टूल का इस्तेमाल: एक ही अनुरोध में, इन-बिल्ट टूल और कस्टम फ़ंक्शन कॉलिंग का इस्तेमाल करें.
  • मीडिया रिज़ॉल्यूशन: इमेज, वीडियो, और पीडीएफ़ इनपुट के लिए, टोकन के बंटवारे पर सटीक कंट्रोल. Gemini 3 मॉडल, मिक्स-फ़िडेलिटी प्रॉम्प्ट के लिए, हर कॉन्टेंट आइटम के हिसाब से रिज़ॉल्यूशन सेटिंग (low, medium, high, ultra_high) के साथ काम करते हैं.
  • थॉट सिग्नेचर: मॉडल की इंटरनल रीज़निंग के एन्क्रिप्टेड रिप्रज़ेंटेशन. स्टेटलेस मोड में, सिलसिलेवार बातचीत वाली फ़ंक्शन कॉलिंग के लिए ज़रूरी है. इसे Interactions API और आधिकारिक एसडीके अपने-आप मैनेज करते हैं.

प्रॉम्प्ट लिखने के सबसे सही तरीके

Gemini 3.x मॉडल, रीज़निंग मॉडल हैं. इसलिए, आपको प्रॉम्प्ट लिखने के तरीके में बदलाव करना होगा.

  • सटीक निर्देश: संक्षिप्त निर्देश दें. Gemini 3.x, सीधे और साफ़ तौर पर दिए गए निर्देशों के लिए सबसे अच्छा जवाब देता है. पुराने मॉडल के लिए डिज़ाइन की गई, ज़्यादा जानकारी वाले या मुश्किल प्रॉम्प्ट इंजीनियरिंग की तकनीकों की वजह से, मॉडल ज़्यादा विश्लेषण कर सकता है.
  • आउटपुट की वर्बोसिटी: डिफ़ॉल्ट रूप से, Gemini 3 और 3.1 कम वर्बोस होते हैं और सीधे, सटीक जवाब देते हैं. अगर आपके इस्तेमाल के उदाहरण के लिए, बातचीत के लहजे की ज़रूरत है, तो अपने प्रॉम्प्ट में मॉडल को साफ़ तौर पर निर्देश दें. उदाहरण के लिए, "इसे एक मददगार और बातूनी असिस्टेंट के तौर पर समझाएं".
  • कॉन्टेक्स्ट मैनेजमेंट: बड़े डेटासेट (जैसे, पूरी किताबें, कोडबेस या लंबे वीडियो) के साथ काम करते समय, अपने खास निर्देश या सवाल, डेटा कॉन्टेक्स्ट के बाद, प्रॉम्प्ट के आखिर में रखें. अपने सवाल की शुरुआत, "पिछली जानकारी के आधार पर..." जैसे वाक्यांश से करके, मॉडल की रीज़निंग को ऐंकर करें.

प्रॉम्प्ट डिज़ाइन की रणनीतियों के बारे में ज़्यादा जानने के लिए, प्रॉम्प्ट इंजीनियरिंग गाइड देखें.

सीमाएं

  • Gemini 3.x में, इमेज सेगमेंटेशन की सुविधा उपलब्ध नहीं है. सेगमेंटेशन वर्कलोड के लिए, Gemini 2.5 Flash का इस्तेमाल, थिंकिंग बंद करके जारी रखें.

अक्सर पूछे जाने वाले सवाल

  1. Gemini 3.5 Flash के लिए, नॉलेज कटऑफ़ क्या है? Gemini 3.5 Flash के लिए, नॉलेज कटऑफ़ जनवरी 2025 है. हाल ही की जानकारी के लिए, Search Grounding टूल का इस्तेमाल करें.

  2. कॉन्टेक्स्ट विंडो की सीमाएं क्या हैं? Gemini 3.5 Flash, 10 लाख टोकन वाली इनपुट कॉन्टेक्स्ट विंडो और ज़्यादा से ज़्यादा 65 हज़ार आउटपुट टोकन के साथ काम करता है.

  3. क्या मेरा पुराना thinking_budget कोड अब भी काम करेगा? हां, thinking_budget अब भी बैकवर्ड कंपैटिबिलिटी के लिए काम करता है. हालांकि, ज़्यादा सटीक परफ़ॉर्मेंस के लिए, हमारा सुझाव है कि आप thinking_level पर माइग्रेट करें. एक ही अनुरोध में, दोनों का इस्तेमाल न करें.

  4. क्या Gemini 3.5 Flash, बैच एपीआई के साथ काम करता है? हां. ज़्यादा जानकारी के लिए, बैच एपीआई की गाइड देखें.

  5. क्या कॉन्टेक्स्ट कैशिंग की सुविधा उपलब्ध है? हां, कॉन्टेक्स्ट कैशिंग की सुविधा उपलब्ध है.

  6. कौनसे टूल काम करते हैं? Gemini 3.5 Flash, Google Search, Google Maps के साथ Grounding, फ़ाइल खोज, कोड एक्ज़ीक्यूशन, यूआरएल कॉन्टेक्स्ट, और स्टैंडर्ड फ़ंक्शन कॉलिंग के साथ काम करता है. इसमें एक साथ कई टूल का इस्तेमाल और कंप्यूटर इस्तेमाल करने की सुविधा भी शामिल है.

अगले चरण