3.6 Flash और 3.5 Flash-Lite के बारे में जानकारी देने वाला यह पेज
Gemini 3.5 Flash, सामान्य तौर पर उपलब्ध (जीए) है. यह स्टेबल है और इसका इस्तेमाल बड़े पैमाने पर प्रोडक्शन के लिए किया जा सकता है. यह हमारा सबसे ऐडवांस Flash मॉडल है. यह एजेंटिक एक्ज़ीक्यूशन, कोडिंग, और लंबे समय तक चलने वाले मुश्किल टास्क को बड़े पैमाने पर पूरा करने में बेहतरीन परफ़ॉर्मेंस देता है.
इस गाइड में, Gemini 3.5 Flash में किए गए सुधारों, एपीआई में हुए बदलावों, और माइग्रेशन के बारे में जानकारी दी गई है.
नया मॉडल
| मॉडल | मॉडल आईडी | ब्यौरा |
|---|---|---|
| Gemini 3.5 Flash | gemini-3.5-flash |
यह हमारा सबसे ऐडवांस मॉडल है. यह एजेंटिक और कोडिंग से जुड़े मुश्किल टास्क को बड़े पैमाने पर पूरा करने में बेहतरीन परफ़ॉर्मेंस देता है. |
Gemini 3.5 Flash, 10 लाख टोकन वाली कॉन्टेक्स्ट विंडो, ज़्यादा से ज़्यादा 65 हज़ार आउटपुट टोकन, थिंकिंग, और Gemini 3 Flash के जैसे ही टूल और प्लैटफ़ॉर्म की सुविधाओं के साथ काम करता है, इसमें कंप्यूटर इस्तेमाल करने की सुविधा (प्रीव्यू) भी शामिल है.
पूरी जानकारी के लिए, मॉडल की खास जानकारी देखें. कीमत की जानकारी के लिए, कीमत तय करने से जुड़ा पेज देखें.
क्विकस्टार्ट
इस गाइड में दिए गए सभी उदाहरणों में, Interactions API का इस्तेमाल किया गया है. GenerateContent API भी काम करता है. इस पर भी वही कॉन्फ़िगरेशन के विकल्प और सुझाव लागू होते हैं.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.5-flash",
input="Explain how parallel agentic execution works in three sentences."
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
async function main() {
const interaction = await client.interactions.create({
model: "gemini-3.5-flash",
input: "Explain how parallel agentic execution works in three sentences.",
});
console.log(interaction.output_text);
}
main();
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.5-flash",
"input": "Explain how parallel agentic execution works in three sentences."
}'
नया क्या है
- बेहतरीन परफ़ॉर्मेंस: यह हमारा सबसे ऐडवांस Flash मॉडल है. इसे एजेंटिक और कोडिंग से जुड़े मुश्किल टास्क को बड़े पैमाने पर पूरा करने के लिए ऑप्टिमाइज़ किया गया है.
- एजेंटिक एक्ज़ीक्यूशन: सब-एजेंट डिप्लॉयमेंट, समस्या हल करना, और बड़े पैमाने पर तेज़ी से एजेंटिक लूप बनाना.
- कोडिंग: कोडिंग के बार-बार होने वाले साइकल, तेज़ी से एक्सप्लोरेशन, और प्रोटोटाइपिंग की मदद से, अलग-अलग पाथ की जांच करना और डाइनैमिक तरीके से समाधान खोजना.
- लंबे समय तक चलने वाले मुश्किल टास्क: मल्टी-स्टेप वर्कफ़्लो और बड़े पैमाने पर टूल का इस्तेमाल करना.
- विचार को बनाए रखना: मॉडल, कई राउंड वाली बातचीत के दौरान, बीच-बीच में की गई रीज़निंग को अपने-आप बनाए रखता है. एपीआई में कोई बदलाव करने की ज़रूरत नहीं है.
- मेहनत के नए डिफ़ॉल्ट लेवल: थिंकिंग के लिए, डिफ़ॉल्ट रूप से लगने वाली मेहनत का लेवल
highसे बदलकरmediumकर दिया गया है. ज़्यादा जानकारी के लिए, मेहनत का नया डिफ़ॉल्ट लेवल देखें. lowथिंकिंग को बेहतर बनाना:lowथिंकिंग को अब कोड और एजेंटिक टास्क के लिए बेहतर बनाया गया है. इन टास्क को पूरा करने में कम समय लगता है और कम चरणों की ज़रूरत होती है. साथ ही, यह कम लागत में अच्छी क्वालिटी के नतीजे देता है.- जीए रिलीज़: बड़े पैमाने पर प्रोडक्शन के लिए, स्टेबल मॉडल.
सही Flash मॉडल चुनना
Gemini 3.5 Flash, हमारा सबसे ऐडवांस और बेहतरीन Flash मॉडल है. हालांकि, अलग-अलग इस्तेमाल के उदाहरणों के लिए, लागत और समय की अलग-अलग ज़रूरतें हो सकती हैं.
- Gemini 3.1 Flash-Lite: कम लागत में, ज़्यादा वॉल्यूम वाले टास्क के लिए, हम Gemini 3.1 Flash-Lite का इस्तेमाल करने का सुझाव देते हैं. इन टास्क को पूरा करने के लिए, 3.5 Flash की तरह ऐडवांस रीज़निंग की ज़रूरत नहीं होती. यह एक स्टेबल और लंबे समय तक चलने वाला मॉडल है. इसे बेहतर परफ़ॉर्मेंस के लिए ऑप्टिमाइज़ किया गया है. ज़्यादा जानकारी के लिए, Flash-Lite की डेवलपर गाइड देखें.
- Gemini 3 Flash (प्रीव्यू): हम आपको जीए की स्टेबिलिटी और बेहतर रीज़निंग के लिए, 3.5 Flash पर माइग्रेट करने का सुझाव देते हैं. हालांकि, Gemini 3 Flash (प्रीव्यू) उन डेवलपर के लिए उपलब्ध रहेगा जो प्रीव्यू मॉडल के साथ टेस्टिंग जारी रखना चाहते हैं.
व्यवहार में हुए बदलाव
मेहनत का नया डिफ़ॉल्ट लेवल: medium
थिंकिंग के लिए, डिफ़ॉल्ट रूप से लगने वाली मेहनत का लेवल अब medium है. इसे Gemini 3
Flash (प्रीव्यू) में high से बदलकर medium कर दिया गया है. medium लेवल पर, अलग-अलग तरह के टास्क के लिए बहुत अच्छे नतीजे मिलते हैं. साथ ही, यह तेज़ी से और कम लागत में काम करता है. मुश्किल समस्याओं के लिए, high लेवल पर मॉडल ज़्यादा गहराई से सोच-विचार करता है.
| मेहनत का लेवल | कब इस्तेमाल करें |
|---|---|
minimal |
जवाब देने की स्पीड के लिए ऑप्टिमाइज़ किया गया है. चैट जैसे इस्तेमाल के उदाहरण, सटीक जानकारी वाले तुरंत जवाब, आसान टूल कॉल. |
low |
कोड और एजेंटिक टास्क के लिए, जिनमें कम समय लगता है और कम चरणों की ज़रूरत होती है. यह विश्लेषण और लिखने से जुड़े उन टास्क के लिए भी अच्छा काम करता है जिनमें कुछ सोच-विचार की ज़रूरत होती है. |
medium (डिफ़ॉल्ट) |
ज़्यादातर टास्क के लिए, सबसे अच्छी क्वालिटी. मुश्किल कोड और एजेंटिक इस्तेमाल के उदाहरणों के लिए सुझाव दिया जाता है. |
high |
मॉडल की सोचने और टूल इस्तेमाल करने की क्षमता को बढ़ाता है. मुश्किल रीज़निंग, मुश्किल गणित के सवालों, और सबसे मुश्किल कोड या एजेंट टास्क के लिए सबसे सही. ज़्यादा सोच-विचार करने और फ़ंक्शन कॉल की अनुमति देता है. |
डिफ़ॉल्ट सेटिंग को बदलने के लिए, अपने कॉन्फ़िगरेशन में thinking_level सेट करें:
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.5-flash",
input="Prove that the square root of 2 is irrational.",
generation_config={"thinking_level": "high"},
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
async function main() {
const interaction = await client.interactions.create({
model: "gemini-3.5-flash",
input: "Prove that the square root of 2 is irrational.",
generationConfig: { thinkingLevel: "high" },
});
console.log(interaction.output_text);
}
main();
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.5-flash",
"input": "Prove that the square root of 2 is irrational.",
"generation_config": {"thinking_level": "high"}
}'
यहां दी गई टेबल में, हर मॉडल के लिए काम करने वाले थिंकिंग लेवल दिखाए गए हैं:
| थिंकिंग लेवल | Gemini 3.5 Flash | Gemini 3.1 Pro | Gemini 3.1 Flash-Lite | Gemini 3 Flash | ब्यौरा |
|---|---|---|---|---|---|
minimal |
काम करता है | काम नहीं करता है | काम करता है (डिफ़ॉल्ट) | काम करता है | ज़्यादातर क्वेरी के लिए, "नो थिंकिंग" सेटिंग से मेल खाता है. ध्यान दें, minimal लेवल पर यह ज़रूरी नहीं है कि थिंकिंग बंद हो. मॉडल, मुश्किल टास्क के लिए बहुत कम रीज़निंग कर सकता है. |
low |
काम करता है | काम करता है | काम करता है | काम करता है | समय और लागत को कम करता है. |
medium |
काम करता है (डिफ़ॉल्ट) | काम करता है | काम करता है | काम करता है | ज़्यादातर टास्क के लिए, बैलेंस थिंकिंग. |
high |
काम करता है (डाइनैमिक) | काम करता है (डिफ़ॉल्ट, डाइनैमिक) | काम करता है (डाइनैमिक) | काम करता है (डिफ़ॉल्ट, डाइनैमिक) | रीज़निंग की गहराई को बढ़ाता है. |
विचार को बनाए रखना
मॉडल, कई राउंड वाली बातचीत के दौरान, बीच-बीच में की गई रीज़निंग को अपने-आप बनाए रखता है. बातचीत के इतिहास में मौजूद होने पर, गहराई से विश्लेषण कॉन्टेक्स्ट आगे बढ़ता है. इससे, मुश्किल मल्टी-स्टेप टास्क की परफ़ॉर्मेंस बेहतर होती है. जैसे, बार-बार डीबग करना और कोड रीफ़ैक्टर करना. एपीआई में कोई बदलाव करने की ज़रूरत नहीं है:
- Interactions API: इसमें, विचार अपने-आप सेव हो जाते हैं. व्यवहार में कोई बदलाव नहीं हुआ है.
- GenerateContent API: Gemini 3.5 Flash से, मॉडल, बातचीत के इतिहास में थॉट सिग्नेचर मौजूद होने पर, पिछले सभी राउंड के रीज़निंग कॉन्टेक्स्ट का इस्तेमाल करता है. इसे चालू करने के लिए, `contents` में बातचीत का पूरा,
बिना बदलाव वाला इतिहास (जिसमें
थॉट सिग्नेचर भी शामिल हैं) पास करें
contents. एसडीके, इसे अपने-आप मैनेज करते हैं.
Gemini 3.x में पैरामीटर के अपडेट और सबसे सही तरीके
ये बातें, Gemini 3.5 Flash के साथ-साथ Gemini 3.x के सभी मॉडल पर लागू होती हैं.
temperature,top_p,top_k: हमारा सुझाव है कि इनकी डिफ़ॉल्ट वैल्यू में बदलाव न करें. Gemini 3 की रीज़निंग की क्षमताओं को डिफ़ॉल्ट सेटिंग के लिए ऑप्टिमाइज़ किया गया है.thinking_budgetके बजाय,thinking_levelका इस्तेमाल करें.- फ़ंक्शन कॉलिंग के जवाबों को मैच करना:
id,name, और जवाबों की संख्या पहले किए गए कॉल से मैच होनी चाहिए. - मल्टीमोडल फ़ंक्शन के जवाब: मल्टीमोडल कॉन्टेंट को फ़ंक्शन के जवाब में शामिल करें, न कि उसके बाहर.
- फ़ंक्शन के जवाबों में इनलाइन निर्देश: इन्हें फ़ंक्शन के जवाब के टेक्स्ट में जोड़ें, न कि अलग-अलग हिस्सों के तौर पर.
- टूल कॉल की संख्या कम करना: एजेंटिक वर्कफ़्लो में टूल कॉल की संख्या कम करने के लिए, थिंकिंग के कम लेवल का इस्तेमाल करें या सिस्टम के निर्देशों के साथ एक्सपेरिमेंट करें.
अपना कोड अपडेट करने का तरीका जानने के लिए, नीचे दिए गए सेक्शन देखें.
सैंपलिंग पैरामीटर (अब इनका इस्तेमाल करने का सुझाव नहीं दिया जाता)
temperature, top_p, और top_k पैरामीटर का इस्तेमाल अब Gemini 3.x के सभी मॉडल के लिए करने का सुझाव नहीं दिया जाता. Gemini 3 की रीज़निंग की क्षमताओं को डिफ़ॉल्ट सेटिंग के लिए ऑप्टिमाइज़ किया गया है. सभी अनुरोधों से इन पैरामीटर को हटाएं.
# ⚠️ Remove these parameters (not recommended)
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
डिटरमिनिज़म पक्का करने के लिए, हमारा सुझाव है कि आप अपने इस्तेमाल के उदाहरण के लिए, साफ़ तौर पर नियमों के साथ सिस्टम का निर्देश तय करें.
thinking_budget (अब इसका इस्तेमाल करने का सुझाव नहीं दिया जाता)
रॉ न्यूमेरिक thinking_budget पैरामीटर का इस्तेमाल अब Gemini 3.x के सभी मॉडल के लिए करने का सुझाव नहीं दिया जाता. इसके बजाय, thinking_level स्ट्रिंग एनम का इस्तेमाल करें.
# ⚠️ Before (not recommended)
generation_config = {
"thinking": {"thinking_budget": 7500},
}
# ✅ After
generation_config = {
"thinking": {"thinking_level": "medium"},
}
उपलब्ध वैल्यू: minimal, low, medium (डिफ़ॉल्ट), और high.
फ़ंक्शन कॉलिंग: जवाबों को सख्ती से मैच करना
Interactions API, फ़ंक्शन के जवाब मैच न होने पर पहले से ही गड़बड़ी दिखाता है. GenerateContent API, फ़िलहाल गड़बड़ी नहीं दिखाता. हालांकि, जवाब मैच न होने पर, मॉडल ज़्यादातर मामलों में finish_reason: STOP के साथ खाली जवाब देता है. हमेशा इन कन्वर्ज़न का पालन करें:
| आवश्यकता | विवरण |
|---|---|
id शामिल करें |
हर FunctionResponse में, उससे जुड़े FunctionCall का id शामिल होना चाहिए |
name मैच करें |
जवाब में मौजूद name, कॉल में मौजूद name से मैच होना चाहिए |
| संख्याएं मैच करें | हर FunctionCall के लिए, ठीक एक FunctionResponse लौटाएं |
Python
# ✅ Include matching call_id and name in the function_result
final_interaction = client.interactions.create(
model="gemini-3.5-flash",
previous_interaction_id=interaction.id,
tools=[my_tool],
input=[{
"type": "function_result",
"name": fc_step.name,
"call_id": fc_step.id,
"result": [{"type": "text", "text": json.dumps(result)}],
}],
)
JavaScript
// ✅ Include matching call_id and name in the function_result
const finalInteraction = await client.interactions.create({
model: "gemini-3.5-flash",
previousInteractionId: interaction.id,
tools: [myTool],
input: [{
type: "function_result",
name: fcStep.name,
call_id: fcStep.id,
result: [{ type: "text", text: JSON.stringify(result) }],
}],
});
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.5-flash",
"previous_interaction_id": "<INTERACTION_ID>",
"tools": [...],
"input": [{
"type": "function_result",
"name": "my_function",
"call_id": "<CALL_ID>",
"result": [{"type": "text", "text": "..."}]
}]
}'
मल्टीमोडल फ़ंक्शन के जवाब
हम अक्सर देखते हैं कि क्लाइंट, फ़ंक्शन के जवाब के बाहर इमेज उपलब्ध कराते हैं. इससे मॉडल का व्यवहार उम्मीद के मुताबिक नहीं होता. जैसे, थॉट लीकेज और आउटपुट की क्वालिटी कम हो सकती है. इसके बजाय, मल्टीमोडल फ़ंक्शन के जवाबों के लिए, एपीआई के दस्तावेज़ों में दिए गए सुझाव का पालन करें. साथ ही, मॉडल को भेजे जाने वाले फ़ंक्शन के जवाब के हिस्सों में मल्टीमोडल कॉन्टेंट शामिल करें. मॉडल, ज़्यादा सटीक जवाब देने के लिए, अगले राउंड में इस मल्टीमोडल कॉन्टेंट को प्रोसेस कर सकता है.
Python
# ✅ Include multimodal content in the function response
final_interaction = client.interactions.create(
model="gemini-3.5-flash",
previous_interaction_id=interaction.id,
input=[
{
"type": "function_result",
"name": tool_call.name,
"call_id": tool_call.id,
"result": [
{"type": "text", "text": "instrument.jpg"},
{
"type": "image",
"mime_type": "image/jpeg",
"data": base64_image_data,
},
],
}
],
)
JavaScript
// ✅ Include multimodal content in the function response
const finalInteraction = await client.interactions.create({
model: "gemini-3.5-flash",
previousInteractionId: interaction.id,
input: [{
type: "function_result",
name: toolCall.name,
call_id: toolCall.id,
result: [
{ type: "text", text: "instrument.jpg" },
{
type: "image",
mime_type: "image/jpeg",
data: base64ImageData,
},
],
}],
});
फ़ंक्शन के जवाबों में इनलाइन निर्देश
हम अक्सर देखते हैं कि क्लाइंट, फ़ंक्शन के जवाबों के साथ-साथ, बाद के Parts के तौर पर अतिरिक्त निर्देश देते हैं. इससे मॉडल का व्यवहार उम्मीद के मुताबिक नहीं होता. जैसे, थॉट लीकेज और आउटपुट की क्वालिटी कम हो सकती है. इसके बजाय, किसी भी अतिरिक्त निर्देश को फ़ंक्शन के जवाब के टेक्स्ट के आखिर में, दो नई लाइनों से अलग करके जोड़ें.
Python
# ✅ Append inline instructions to the end of the function response separated by two newlines
result_text = f"{json.dumps(result)}\n\n<your inline instructions>"
final_interaction = client.interactions.create(
model="gemini-3.5-flash",
previous_interaction_id=interaction.id,
tools=[my_tool],
input=[{
"type": "function_result",
"name": fc_step.name,
"call_id": fc_step.id,
"result": [{"type": "text", "text": result_text}],
}],
)
JavaScript
// ✅ Append inline instructions to the end of the function response separated by two newlines
const resultText = `${JSON.stringify(result)}\n\n<your inline instructions>`;
const finalInteraction = await client.interactions.create({
model: "gemini-3.5-flash",
previousInteractionId: interaction.id,
tools: [myTool],
input: [{
type: "function_result",
name: fcStep.name,
call_id: fcStep.id,
result: [{ type: "text", text: resultText }],
}],
});
टूल कॉल की संख्या कम करना
अगर आपको टूल कॉल का ज़्यादा इस्तेमाल दिखता है, तो इन्हें कम करने के लिए दो तकनीकों का इस्तेमाल किया जा सकता है:
थिंकिंग का लेवल कम करके शुरू करें (
medium,low, याminimal): थिंकिंग के ज़्यादा लेवल पर, मॉडल, एक्सप्लोर करने और पुष्टि करने के लिए ज़्यादा टूल का इस्तेमाल करता है. इसलिए, लेवल कम करने से टूल कॉल की संख्या कम हो सकती है.सिस्टम का निर्देश जोड़ें: अगर थिंकिंग का लेवल अडजस्ट करने के बाद भी, टूल कॉल का ज़्यादा इस्तेमाल जारी रहता है, तो ऐसा प्रॉम्प्ट इस्तेमाल करें जिससे टूल के इस्तेमाल पर पाबंदी लगाई जा सके. उदाहरण के लिए:
You have a limited action budget of <n> tool calls. Use them efficiently.
माइग्रेशन के लिए चेकलिस्ट
हमारा सुझाव है कि आप google-genai SDK टूल को v2.0.0 या उसके बाद के वर्शन पर अपडेट करें. इस वर्शन में, Interactions API में नुकसान पहुंचा सकने वाले बदलाव किए गए हैं. ज़्यादा जानकारी के लिए,
नुकसान पहुंचा सकने वाले बदलावों के लिए माइग्रेशन गाइड देखें.
Gemini 3 Flash (प्रीव्यू) से माइग्रेट करना
- मॉडल का नाम अपडेट करें:
gemini-3-flash-preview→gemini-3.5-flash - कीमत की समीक्षा करें. Gemini 3.5 Flash, Gemini 3 Flash (प्रीव्यू) से ज़्यादा महंगा है. अगर आपके इस्तेमाल के उदाहरण में लागत बहुत मायने रखती है, तो इसके बजाय Gemini 3.1 Flash-Lite पर माइग्रेट करने पर विचार करें. ज़्यादा जानकारी के लिए, कीमत तय करने से जुड़ा पेज देखें.
- अपने कॉन्फ़िगरेशन से
temperature,top_p,top_kको हटाएं. अब इनका इस्तेमाल करने का सुझाव नहीं दिया जाता. thinking_budgetकी जगह,thinking_levelका इस्तेमाल करें.FunctionResponseके सभी हिस्सों में,idऔर उससे मैच करने वालाnameजोड़ें.- अपने प्रॉम्प्ट की जांच करें. मेहनत का डिफ़ॉल्ट लेवल
highसे बदलकरmediumकर दिया गया है. इसलिए, क्वालिटी, स्पीड, और लागत की पुष्टि करें. - विचार को बनाए रखने की सुविधा अब डिफ़ॉल्ट रूप से चालू है. रीज़निंग कॉन्टेक्स्ट, राउंड के हिसाब से आगे बढ़ता है. इससे परफ़ॉर्मेंस बेहतर होती है, लेकिन टोकन का इस्तेमाल बढ़ सकता है.
- टूल कॉल की संख्या कम करें: थिंकिंग का लेवल कम करके शुरू करें (
medium,low, याminimal). अगर टूल कॉल का ज़्यादा इस्तेमाल जारी रहता है, तो टूल के इस्तेमाल पर पाबंदी लगाने के लिए, सिस्टम का निर्देश जोड़ें. - कंप्यूटर इस्तेमाल करने की सुविधा उपलब्ध है.
Gemini 2.5 से माइग्रेट करना
ऊपर दी गई सभी बातें, साथ ही:
- प्रॉम्प्ट को आसान बनाएं. अगर आपने रीज़निंग को मजबूर करने के लिए, चेन-ऑफ़-थॉट प्रॉम्प्ट इंजीनियरिंग का इस्तेमाल किया है, तो इसके बजाय आसान प्रॉम्प्ट के साथ
thinking_level: "medium"या"high"का इस्तेमाल करें. - पीडीएफ़ और मीडिया वर्कलोड की जांच करें. अगर आपने घने दस्तावेज़ को पार्स करने के लिए, किसी खास व्यवहार पर भरोसा किया है, तो सटीक जानकारी पाने के लिए,
media_resolution_highसेटिंग की जांच करें. Gemini 3 के डिफ़ॉल्ट पर माइग्रेट करने से, पीडीएफ़ के लिए टोकन का इस्तेमाल बढ़ सकता है. हालांकि, वीडियो के लिए यह कम हो सकता है. अगर अनुरोध, कॉन्टेक्स्ट विंडो से ज़्यादा हैं, तो साफ़ तौर परmedia_resolutionको कम करें. ज़्यादा जानकारी के लिए, मीडिया रिज़ॉल्यूशन के दस्तावेज़ देखें. - एक साथ कई टूल का इस्तेमाल करें. एक ही अनुरोध में, Google Search, यूआरएल कॉन्टेक्स्ट, कोड एक्ज़ीक्यूशन, और कस्टम फ़ंक्शन का इस्तेमाल किया जा सकता है.
- मल्टीमोडल फ़ंक्शन के जवाबों का इस्तेमाल करते समय, मल्टीमोडल कॉन्टेंट को फ़ंक्शन के जवाब के हिस्सों में शामिल करें, न कि उनके साथ.
- फ़ंक्शन के जवाबों के साथ इनलाइन निर्देशों का इस्तेमाल करते समय, उन्हें फ़ंक्शन के जवाब के टेक्स्ट में, दो नई लाइनों से अलग करके जोड़ें, न कि अलग-अलग हिस्सों के तौर पर.
- Gemini 3.x में, इमेज सेगमेंटेशन की सुविधा उपलब्ध नहीं है. सेगमेंटेशन वर्कलोड के लिए, Gemini 2.5 Flash का इस्तेमाल, थिंकिंग बंद करके जारी रखें.
- अपने कॉन्फ़िगरेशन से
candidate_countको हटाएं (Gemini 3.x में मौजूद नहीं है)
Gemini 3 फ़ैमिली की सुविधाएं
Gemini 3.5 Flash में, Gemini 3 फ़ैमिली की सभी क्षमताएं शामिल हैं. इनमें कंप्यूटर इस्तेमाल करने की सुविधा भी शामिल है. Gemini 3 में जोड़ी गई वे सुविधाएं जो आगे भी उपलब्ध रहेंगी:
- थिंकिंग: एपीआई कॉल के दौरान, एन्क्रिप्टेड रीज़निंग कॉन्टेक्स्ट सेव रहता है. Interactions API में अपने-आप; GenerateContent में इंप्लिसिट.
- टूल के साथ स्ट्रक्चर्ड आउटपुट: JSON मोड को इन-बिल्ट सुविधाओं (Search, यूआरएल कॉन्टेक्स्ट, कोड एक्ज़ीक्यूशन, फ़ंक्शन कॉलिंग) के साथ मिलाएं.
- मल्टीमोडल फ़ंक्शन के जवाब: फ़ंक्शन कॉल के नतीजों में इमेज, ऑडियो, और अन्य मीडिया लौटाएं.
- इमेज के साथ कोड एक्ज़ीक्यूशन: इमेज को प्रोसेस और जनरेट करने वाले कोड को एक्ज़ीक्यूट करें.
- एक साथ कई टूल का इस्तेमाल: एक ही अनुरोध में, इन-बिल्ट टूल और कस्टम फ़ंक्शन कॉलिंग का इस्तेमाल करें.
- मीडिया रिज़ॉल्यूशन:
इमेज, वीडियो, और पीडीएफ़ इनपुट के लिए, टोकन के बंटवारे पर सटीक कंट्रोल.
Gemini 3 मॉडल, मिक्स-फ़िडेलिटी प्रॉम्प्ट के लिए, हर कॉन्टेंट आइटम के हिसाब से रिज़ॉल्यूशन सेटिंग (
low,medium,high,ultra_high) के साथ काम करते हैं. - थॉट सिग्नेचर: मॉडल की इंटरनल रीज़निंग के एन्क्रिप्टेड रिप्रज़ेंटेशन. स्टेटलेस मोड में, सिलसिलेवार बातचीत वाली फ़ंक्शन कॉलिंग के लिए ज़रूरी है. इसे Interactions API और आधिकारिक एसडीके अपने-आप मैनेज करते हैं.
प्रॉम्प्ट लिखने के सबसे सही तरीके
Gemini 3.x मॉडल, रीज़निंग मॉडल हैं. इसलिए, आपको प्रॉम्प्ट लिखने के तरीके में बदलाव करना होगा.
- सटीक निर्देश: संक्षिप्त निर्देश दें. Gemini 3.x, सीधे और साफ़ तौर पर दिए गए निर्देशों के लिए सबसे अच्छा जवाब देता है. पुराने मॉडल के लिए डिज़ाइन की गई, ज़्यादा जानकारी वाले या मुश्किल प्रॉम्प्ट इंजीनियरिंग की तकनीकों की वजह से, मॉडल ज़्यादा विश्लेषण कर सकता है.
- आउटपुट की वर्बोसिटी: डिफ़ॉल्ट रूप से, Gemini 3 और 3.1 कम वर्बोस होते हैं और सीधे, सटीक जवाब देते हैं. अगर आपके इस्तेमाल के उदाहरण के लिए, बातचीत के लहजे की ज़रूरत है, तो अपने प्रॉम्प्ट में मॉडल को साफ़ तौर पर निर्देश दें. उदाहरण के लिए, "इसे एक मददगार और बातूनी असिस्टेंट के तौर पर समझाएं".
- कॉन्टेक्स्ट मैनेजमेंट: बड़े डेटासेट (जैसे, पूरी किताबें, कोडबेस या लंबे वीडियो) के साथ काम करते समय, अपने खास निर्देश या सवाल, डेटा कॉन्टेक्स्ट के बाद, प्रॉम्प्ट के आखिर में रखें. अपने सवाल की शुरुआत, "पिछली जानकारी के आधार पर..." जैसे वाक्यांश से करके, मॉडल की रीज़निंग को ऐंकर करें.
प्रॉम्प्ट डिज़ाइन की रणनीतियों के बारे में ज़्यादा जानने के लिए, प्रॉम्प्ट इंजीनियरिंग गाइड देखें.
सीमाएं
- Gemini 3.x में, इमेज सेगमेंटेशन की सुविधा उपलब्ध नहीं है. सेगमेंटेशन वर्कलोड के लिए, Gemini 2.5 Flash का इस्तेमाल, थिंकिंग बंद करके जारी रखें.
अक्सर पूछे जाने वाले सवाल
Gemini 3.5 Flash के लिए, नॉलेज कटऑफ़ क्या है? Gemini 3.5 Flash के लिए, नॉलेज कटऑफ़ जनवरी 2025 है. हाल ही की जानकारी के लिए, Search Grounding टूल का इस्तेमाल करें.
कॉन्टेक्स्ट विंडो की सीमाएं क्या हैं? Gemini 3.5 Flash, 10 लाख टोकन वाली इनपुट कॉन्टेक्स्ट विंडो और ज़्यादा से ज़्यादा 65 हज़ार आउटपुट टोकन के साथ काम करता है.
क्या मेरा पुराना
thinking_budgetकोड अब भी काम करेगा? हां,thinking_budgetअब भी बैकवर्ड कंपैटिबिलिटी के लिए काम करता है. हालांकि, ज़्यादा सटीक परफ़ॉर्मेंस के लिए, हमारा सुझाव है कि आपthinking_levelपर माइग्रेट करें. एक ही अनुरोध में, दोनों का इस्तेमाल न करें.क्या Gemini 3.5 Flash, बैच एपीआई के साथ काम करता है? हां. ज़्यादा जानकारी के लिए, बैच एपीआई की गाइड देखें.
क्या कॉन्टेक्स्ट कैशिंग की सुविधा उपलब्ध है? हां, कॉन्टेक्स्ट कैशिंग की सुविधा उपलब्ध है.
कौनसे टूल काम करते हैं? Gemini 3.5 Flash, Google Search, Google Maps के साथ Grounding, फ़ाइल खोज, कोड एक्ज़ीक्यूशन, यूआरएल कॉन्टेक्स्ट, और स्टैंडर्ड फ़ंक्शन कॉलिंग के साथ काम करता है. इसमें एक साथ कई टूल का इस्तेमाल और कंप्यूटर इस्तेमाल करने की सुविधा भी शामिल है.
अगले चरण
- प्रॉम्प्ट डिज़ाइन की रणनीतियों के बारे में ज़्यादा जानने के लिए, प्रॉम्प्ट इंजीनियरिंग गाइड देखें.
- Gemini 3 कुकबुक का इस्तेमाल शुरू करें
- Gemini API के ऑप्टिमाइज़ेशन और इन्फ़रेंस के बारे में जानें