সাধারণ AI ওয়ার্কফ্লোতে, আপনি কোনও মডেলে একই ইনপুট টোকেন বারবার পাস করতে পারেন। Gemini API দুটি আলাদা ক্যাশিং মেকানিজম অফার করে:
- ইমপ্লিসিট ক্যাশিং (Gemini 2.5 ও এর পরের যেকোনও মডেলে অটোমেটিক চালু হয়ে যায়, খরচ বাঁচানোর গ্যারান্টি দেয় না)
- এক্সপ্লিসিট ক্যাশিং (বেশিরভাগ মডেলে ম্যানুয়ালি চালু করা যায়, খরচ কমানোর গ্যারান্টি)
আপনি যেখানে খরচ বাঁচানোর গ্যারান্টি চান, কিন্তু তার জন্য ডেভেলপারকে কিছু অতিরিক্ত কাজ করতে হবে, সেইসব ক্ষেত্রে এক্সপ্লিসিট ক্যাশিং কাজে লাগে।
ইমপ্লিসিট ক্যাশিং
Gemini 2.5 ও এর পরের সব মডেলের জন্য ডিফল্ট হিসেবে ইমপ্লিসিট ক্যাশিং চালু করা থাকে। আপনার অনুরোধ ক্যাশে হিট করলে, আমরা অটোমেটিক খরচ বাঁচানোর সুবিধা পাস-অন করি। এটি চালু করার জন্য আপনাকে কিছু করতে হবে না। প্রতিটি মডেলের জন্য কনটেক্সট ক্যাশিংয়ের ন্যূনতম ইনপুট টোকেন সংখ্যা নিম্নলিখিত সারণীতে তালিকাভুক্ত করা হয়েছে:
| মডেল | ন্যূনতম টোকেন সীমা |
|---|---|
| Gemini 3.8 Flash | ৪,০৯৬ |
| Gemini 3.6 Flash | ৪,০৯৬ |
| Gemini 3.1 Pro প্রিভিউ | ৪,০৯৬ |
| Gemini 2.5 Flash | ২,০৪৮ |
| Gemini 2.5 Pro | ২,০৪৮ |
ইমপ্লিসিট ক্যাশে হিট হওয়ার সম্ভাবনা বাড়াতে:
- প্রম্পটের শুরুতে বড় ও সাধারণ কন্টেন্ট যোগ করার চেষ্টা করুন
- অল্প সময়ের মধ্যে একই ধরনের প্রিফিক্স সহ অনুরোধ পাঠানোর চেষ্টা করা
আপনি টোকেনের সংখ্যা দেখতে পাবেন যা উত্তর অবজেক্টের
usage_metadata ফিল্ডে ক্যাশে হিট ছিল।
এক্সপ্লিসিট ক্যাশিং
-এর অধীনে এন্ডপয়েন্ট ও SDK মেথড উপলভ্যGemini API-এর এক্সপ্লিসিট ক্যাশিং ফিচার ব্যবহার করে, আপনি কোনও কন্টেন্ট মডেলকে একবার পাস করতে, ইনপুট টোকেন ক্যাশে করতে এবং তারপর পরবর্তী অনুরোধের জন্য ক্যাশে করা টোকেন রেফার করতে পারবেন। নির্দিষ্ট ভলিউমে, ক্যাশে করা টোকেন ব্যবহার করা একই কর্পাস টোকেন বারবার পাস করার চেয়ে কম খরচের।
আপনি টোকেনের একটি সেট ক্যাশে করলে, টোকেন অটোমেটিক মুছে যাওয়ার আগে ক্যাশে কতক্ষণ থাকবে তা বেছে নিতে পারবেন। এই ক্যাশিংয়ের সময়সীমাকে টাইম টু লাইভ (TTL) বলা হয়। সেট করা না থাকলে, TTL ডিফল্ট হিসেবে ১ ঘণ্টা থাকে। ইনপুট টোকেনের সাইজ এবং কতক্ষণ টোকেন ধরে রাখতে চান তার উপর ক্যাশিংয়ের খরচ নির্ভর করে।
এই বিভাগে ধরে নেওয়া হয়েছে যে আপনি Gemini SDK ইনস্টল করেছেন (অথবা curl ইনস্টল করেছেন) এবং আপনি একটি API কী কনফিগার করেছেন, যেমনটি শুরু করার গাইড-এ দেখানো হয়েছে।
ক্যাশে ব্যবহার করে কন্টেন্ট তৈরি করা
Python
নিচের উদাহরণে দেখানো হয়েছে যে কীভাবে ক্যাশে করা সিস্টেম নির্দেশাবলী ও ভিডিও ফাইল ব্যবহার করে কন্টেন্ট তৈরি করতে হয়।
ভিডিও
import os
import pathlib
import requests
import time
from google import genai
from google.genai import types
client = genai.Client()
# Download a test video file and save it locally
url = 'https://storage.googleapis.com/generativeai-downloads/data/SherlockJr._10min.mp4'
path_to_video_file = pathlib.Path('SherlockJr._10min.mp4')
if not path_to_video_file.exists():
path_to_video_file.write_bytes(requests.get(url).content)
# Upload the video using the Files API
video_file = client.files.upload(file=path_to_video_file)
# Wait for the file to finish processing
while video_file.state.name == 'PROCESSING':
time.sleep(2.5)
video_file = client.files.get(name=video_file.name)
print(f'Video processing complete: {video_file.uri}')
model='models/gemini-3.8-flash'
# Create a cache with a 5 minute TTL (300 seconds)
cache = client.caches.create(
model=model,
config=types.CreateCachedContentConfig(
display_name='sherlock jr movie', # used to identify the cache
system_instruction=(
'You are an expert video analyzer, and your job is to answer '
'the user\'s query based on the video file you have access to.'
),
contents=[video_file],
ttl="300s",
)
)
response = client.models.generate_content(
model = model,
contents= (
'Introduce different characters in the movie by describing '
'their personality, looks, and names. Also list the timestamps '
'they were introduced for the first time.'),
config=types.GenerateContentConfig(cached_content=cache.name)
)
print(response.usage_metadata)
print(response.text)
from google import genai
from google.genai import types
import io
import httpx
client = genai.Client()
long_context_pdf_path = "https://sma.nasa.gov/SignificantIncidents/assets/a11_missionreport.pdf"
# Retrieve and upload the PDF using the File API
doc_io = io.BytesIO(httpx.get(long_context_pdf_path).content)
document = client.files.upload(
file=doc_io,
config=dict(mime_type='application/pdf')
)
model_name = "gemini-3.8-flash"
system_instruction = "You are an expert analyzing transcripts."
# Create a cached content object
cache = client.caches.create(
model=model_name,
config=types.CreateCachedContentConfig(
system_instruction=system_instruction,
contents=[document],
)
)
print(f'{cache=}')
response = client.models.generate_content(
model=model_name,
contents="Please summarize this transcript",
config=types.GenerateContentConfig(
cached_content=cache.name
))
print(f'{response.usage_metadata=}')
print('\n\n', response.text)
জাভাস্ক্রিপ্ট
নিচের উদাহরণে দেখানো হয়েছে কীভাবে ক্যাশেড সিস্টেম নির্দেশাবলী ও টেক্সট ফাইল ব্যবহার করে কন্টেন্ট জেনারেট করতে হয়।
import {
GoogleGenAI,
createUserContent,
createPartFromUri,
} from "@google/genai";
const ai = new GoogleGenAI({ apiKey: "GEMINI_API_KEY" });
async function main() {
const doc = await ai.files.upload({
file: "path/to/file.txt",
config: { mimeType: "text/plain" },
});
console.log("Uploaded file name:", doc.name);
const modelName = "gemini-3.8-flash";
const cache = await ai.caches.create({
model: modelName,
config: {
contents: createUserContent(createPartFromUri(doc.uri, doc.mimeType)),
systemInstruction: "You are an expert analyzing transcripts.",
},
});
console.log("Cache created:", cache);
const response = await ai.models.generateContent({
model: modelName,
contents: "Please summarize this transcript",
config: { cachedContent: cache.name },
});
console.log("Response text:", response.text);
}
await main();
খুলুন
ক্যাশে ব্যবহার করে কীভাবে কন্টেন্ট তৈরি করতে হয় তা নিম্নলিখিত উদাহরণ থেকে দেখুন।
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, &genai.ClientConfig{
APIKey: "GOOGLE_API_KEY",
Backend: genai.BackendGeminiAPI,
})
if err != nil {
log.Fatal(err)
}
modelName := "gemini-3.8-flash"
document, err := client.Files.UploadFromPath(
ctx,
"media/a11.txt",
&genai.UploadFileConfig{
MIMEType: "text/plain",
},
)
if err != nil {
log.Fatal(err)
}
parts := []*genai.Part{
genai.NewPartFromURI(document.URI, document.MIMEType),
}
contents := []*genai.Content{
genai.NewContentFromParts(parts, genai.RoleUser),
}
cache, err := client.Caches.Create(ctx, modelName, &genai.CreateCachedContentConfig{
Contents: contents,
SystemInstruction: genai.NewContentFromText(
"You are an expert analyzing transcripts.", genai.RoleUser,
),
})
if err != nil {
log.Fatal(err)
}
fmt.Println("Cache created:")
fmt.Println(cache)
// Use the cache for generating content.
response, err := client.Models.GenerateContent(
ctx,
modelName,
genai.Text("Please summarize this transcript"),
&genai.GenerateContentConfig{
CachedContent: cache.Name,
},
)
if err != nil {
log.Fatal(err)
}
printResponse(response) // helper for printing response parts
}
REST
নিচের উদাহরণে দেখানো হয়েছে যে কীভাবে ক্যাশে তৈরি করতে হয় এবং তারপর কন্টেন্ট জেনারেট করার জন্য সেটি ব্যবহার করতে হয়।
ভিডিও
wget https://storage.googleapis.com/generativeai-downloads/data/a11.txt
echo '{
"model": "models/gemini-3.8-flash",
"contents":[
{
"parts":[
{
"inline_data": {
"mime_type":"text/plain",
"data": "'$(base64 $B64FLAGS a11.txt)'"
}
}
],
"role": "user"
}
],
"systemInstruction": {
"parts": [
{
"text": "You are an expert at analyzing transcripts."
}
]
},
"ttl": "300s"
}' > request.json
curl -X POST "https://generativelanguage.googleapis.com/v1beta/cachedContents?key=$GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d @request.json \
> cache.json
CACHE_NAME=$(cat cache.json | grep '"name":' | cut -d '"' -f 4 | head -n 1)
curl -X POST "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent?key=$GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"contents": [
{
"parts":[{
"text": "Please summarize this transcript"
}],
"role": "user"
},
],
"cachedContent": "'$CACHE_NAME'"
}'
DOC_URL="https://sma.nasa.gov/SignificantIncidents/assets/a11_missionreport.pdf"
DISPLAY_NAME="A11_Mission_Report"
SYSTEM_INSTRUCTION="You are an expert at analyzing transcripts."
PROMPT="Please summarize this transcript"
MODEL="models/gemini-3.8-flash"
TTL="300s"
# Download the PDF
wget -O "${DISPLAY_NAME}.pdf" "${DOC_URL}"
MIME_TYPE=$(file -b --mime-type "${DISPLAY_NAME}.pdf")
NUM_BYTES=$(wc -c < "${DISPLAY_NAME}.pdf")
echo "MIME_TYPE: ${MIME_TYPE}"
echo "NUM_BYTES: ${NUM_BYTES}"
tmp_header_file=upload-header.tmp
# Initial resumable request defining metadata.
# The upload url is in the response headers dump them to a file.
curl "${BASE_URL}/upload/v1beta/files?key=${GOOGLE_API_KEY}" \
-D upload-header.tmp \
-H "X-Goog-Upload-Protocol: resumable" \
-H "X-Goog-Upload-Command: start" \
-H "X-Goog-Upload-Header-Content-Length: ${NUM_BYTES}" \
-H "X-Goog-Upload-Header-Content-Type: ${MIME_TYPE}" \
-H "Content-Type: application/json" \
-d "{'file': {'display_name': '${DISPLAY_NAME}'}}" 2> /dev/null
upload_url=$(grep -i "x-goog-upload-url: " "${tmp_header_file}" | cut -d" " -f2 | tr -d "\r")
rm "${tmp_header_file}"
# Upload the actual bytes.
curl "${upload_url}" \
-H "Content-Length: ${NUM_BYTES}" \
-H "X-Goog-Upload-Offset: 0" \
-H "X-Goog-Upload-Command: upload, finalize" \
--data-binary "@${DISPLAY_NAME}.pdf" 2> /dev/null > file_info.json
file_uri=$(jq ".file.uri" file_info.json)
echo "file_uri: ${file_uri}"
# Clean up the downloaded PDF
rm "${DISPLAY_NAME}.pdf"
# Create the cached content request
echo '{
"model": "'$MODEL'",
"contents":[
{
"parts":[
{"file_data": {"mime_type": "'$MIME_TYPE'", "file_uri": '$file_uri'}}
],
"role": "user"
}
],
"system_instruction": {
"parts": [
{
"text": "'$SYSTEM_INSTRUCTION'"
}
],
"role": "system"
},
"ttl": "'$TTL'"
}' > request.json
# Send the cached content request
curl -X POST "${BASE_URL}/v1beta/cachedContents?key=$GOOGLE_API_KEY" \
-H 'Content-Type: application/json' \
-d @request.json \
> cache.json
CACHE_NAME=$(cat cache.json | grep '"name":' | cut -d '"' -f 4 | head -n 1)
echo "CACHE_NAME: ${CACHE_NAME}"
# Send the generateContent request using the cached content
curl -X POST "${BASE_URL}/${MODEL}:generateContent?key=$GOOGLE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"contents": [
{
"parts":[{
"text": "'$PROMPT'"
}],
"role": "user"
}
],
"cachedContent": "'$CACHE_NAME'"
}' > response.json
cat response.json
echo jq ".candidates[].content.parts[].text" response.json
ক্যাশের তালিকা তৈরি করা
ক্যাশে করা কন্টেন্ট ফিরিয়ে আনা বা দেখা সম্ভব নয়, তবে আপনি ক্যাশে মেটাডেটা (name, model, display_name, usage_metadata,
create_time, update_time এবং expire_time) ফিরিয়ে আনতে পারবেন।
Python
আপলোড করা সব ক্যাশের মেটাডেটা তালিকাভুক্ত করতে, CachedContent.list() ব্যবহার করুন:
for cache in client.caches.list():
print(cache)
একটি ক্যাশে অবজেক্টের মেটাডেটা পেতে, আপনি সেটির নাম জানলে, get ব্যবহার করুন:
client.caches.get(name=name)
জাভাস্ক্রিপ্ট
আপলোড করা সব ক্যাশের মেটাডেটা তালিকাভুক্ত করতে, GoogleGenAI.caches.list() ব্যবহার করুন:
console.log("My caches:");
const pager = await ai.caches.list({ config: { pageSize: 10 } });
let page = pager.page;
while (true) {
for (const c of page) {
console.log(" ", c.name);
}
if (!pager.hasNextPage()) break;
page = await pager.nextPage();
}
খুলুন
নিচের উদাহরণে সব ক্যাশে তালিকাভুক্ত করা হয়েছে।
caches, err := client.Caches.All(ctx)
if err != nil {
log.Fatal(err)
}
fmt.Println("Listing all caches:")
for _, item := range caches {
fmt.Println(" ", item.Name)
}
নিচের উদাহরণে ২ সাইজের পৃষ্ঠা ব্যবহার করে ক্যাশে তালিকাভুক্ত করা হয়েছে।
page, err := client.Caches.List(ctx, &genai.ListCachedContentsConfig{PageSize: 2})
if err != nil {
log.Fatal(err)
}
pageIndex := 1
for {
fmt.Printf("Listing caches (page %d):\n", pageIndex)
for _, item := range page.Items {
fmt.Println(" ", item.Name)
}
if page.NextPageToken == "" {
break
}
page, err = page.Next(ctx)
if err == genai.ErrPageDone {
break
} else if err != nil {
return err
}
pageIndex++
}
REST
curl "https://generativelanguage.googleapis.com/v1beta/cachedContents?key=$GEMINI_API_KEY"
ক্যাশে আপডেট করা
আপনি কোনও ক্যাশের জন্য নতুন ttl বা expire_time সেট করতে পারবেন। ক্যাশে সম্পর্কে অন্য কিছু পরিবর্তন করা
যায় না।
Python
নিচের উদাহরণে দেখানো হয়েছে যে কীভাবে
client.caches.update() ব্যবহার করে কোনও ক্যাশের ttl আপডেট করতে হয়।
from google import genai
from google.genai import types
client.caches.update(
name = cache.name,
config = types.UpdateCachedContentConfig(
ttl='300s'
)
)
মেয়াদ শেষ হওয়ার সময় সেট করতে, এটি datetime অবজেক্ট
বা ISO-ফর্ম্যাট করা তারিখ ও সময়ের স্ট্রিং (dt.isoformat(), যেমন
2025-01-27T16:02:36.473528+00:00) গ্রহণ করবে। আপনার সময়ে অবশ্যই টাইম জোন থাকতে হবে
(datetime.utcnow() টাইম জোন অ্যাটাচ করে না,
datetime.now(datetime.timezone.utc) টাইম জোন অ্যাটাচ করে)।
from google import genai
from google.genai import types
import datetime
# You must use a time zone-aware time.
in10min = datetime.datetime.now(datetime.timezone.utc) + datetime.timedelta(minutes=10)
client.caches.update(
name = cache.name,
config = types.UpdateCachedContentConfig(
expire_time=in10min
)
)
জাভাস্ক্রিপ্ট
নিচের উদাহরণে দেখানো হয়েছে যে কীভাবে
GoogleGenAI.caches.update() ব্যবহার করে কোনও ক্যাশের ttl আপডেট করতে হয়।
const ttl = `${2 * 3600}s`; // 2 hours in seconds
const updatedCache = await ai.caches.update({
name: cache.name,
config: { ttl },
});
console.log("After update (TTL):", updatedCache);
খুলুন
নিচের উদাহরণ থেকে কীভাবে ক্যাশের TTL আপডেট করতে হয় তা জানুন।
// Update the TTL (2 hours).
cache, err = client.Caches.Update(ctx, cache.Name, &genai.UpdateCachedContentConfig{
TTL: 7200 * time.Second,
})
if err != nil {
log.Fatal(err)
}
fmt.Println("After update:")
fmt.Println(cache)
REST
নিচের উদাহরণ থেকে কীভাবে ক্যাশের ttl আপডেট করতে হয় তা জানুন।
curl -X PATCH "https://generativelanguage.googleapis.com/v1beta/$CACHE_NAME?key=$GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"ttl": "600s"}'
ক্যাশে মোছা
ক্যাশিং পরিষেবা, ক্যাশে থেকে ম্যানুয়ালি কন্টেন্ট সরানোর জন্য একটি মুছে দেওয়ার অপারেশন প্রদান করে। নিচের উদাহরণ থেকে কীভাবে ক্যাশে মোছা যায় তা জানুন:
Python
client.caches.delete(cache.name)
জাভাস্ক্রিপ্ট
await ai.caches.delete({ name: cache.name });
খুলুন
_, err = client.Caches.Delete(ctx, cache.Name, &genai.DeleteCachedContentConfig{})
if err != nil {
log.Fatal(err)
}
fmt.Println("Cache deleted:", cache.Name)
REST
curl -X DELETE "https://generativelanguage.googleapis.com/v1beta/$CACHE_NAME?key=$GEMINI_API_KEY"
OpenAI লাইব্রেরি ব্যবহার করে এক্সপ্লিসিট ক্যাশিং
আপনি OpenAI লাইব্রেরি ব্যবহার করলে, আপনি
extra_body-এ cached_content প্রপার্টি ব্যবহার করে
এক্সপ্লিসিট ক্যাশিং চালু করতে পারবেন।
এক্সপ্লিসিট ক্যাশিং কখন ব্যবহার করতে হয়
যেসব ক্ষেত্রে ছোট ছোট অনুরোধের মাধ্যমে উল্লেখযোগ্য প্রাথমিক প্রসঙ্গ বারবার রেফারেন্স করা হয়, সেইসব ক্ষেত্রে প্রসঙ্গ ক্যাশে করা বিশেষভাবে উপযুক্ত। এই ধরনের ব্যবহারের ক্ষেত্রে কন্টেক্সট ক্যাশিং ব্যবহার করার কথা বিবেচনা করুন:
- বিস্তারিত সিস্টেম নির্দেশাবলী সহ চ্যাটবট
- দীর্ঘ ভিডিও ফাইলের পুনরাবৃত্তিমূলক বিশ্লেষণ
- বড় ডকুমেন্ট সেটের বিরুদ্ধে বারংবার কোয়েরি করা
- ঘন ঘন কোড রিপোজিটরি বিশ্লেষণ বা বাগ ফিক্সিং
এক্সপ্লিসিট ক্যাশিং কীভাবে খরচ কমায়
কনটেক্সট ক্যাশিং হল একটি পেমেন্ট ফিচার যা খরচ কমানোর জন্য ডিজাইন করা হয়েছে। বিলিং নিম্নলিখিত বিষয়গুলির উপর ভিত্তি করে করা হয়:
- ক্যাশে টোকেনের সংখ্যা: ইনপুট টোকেনের সংখ্যা ক্যাশে করা হয়েছে, পরবর্তী প্রম্পটে অন্তর্ভুক্ত করা হলে কমে যাওয়া রেটে বিল করা হয়।
- স্টোরেজের সময়সীমা: ক্যাশে করা টোকেন কতক্ষণ স্টোর করা হয় (TTL), ক্যাশে করা টোকেনের সংখ্যার TTL সময়সীমার উপর ভিত্তি করে বিল করা হয়। TTL-এর কোনও ন্যূনতম বা সর্বাধিক সীমা নেই।
- অন্যান্য বিষয়: অন্যান্য চার্জ প্রযোজ্য, যেমন নন-ক্যাশ ইনপুট টোকেন ও আউটপুট টোকেনের জন্য।
আপ-টু-ডেট দামের বিবরণ পেতে, Gemini API-এর দাম পৃষ্ঠা দেখুন। টোকেন কীভাবে গণনা করতে হয় তা জানতে, টোকেন গাইড দেখুন।
বিবেচনা করার মতো আরও বিষয়
কনটেক্সট ক্যাশিং ব্যবহার করার সময় নিম্নলিখিত বিষয়গুলি মাথায় রাখুন:
- কনটেক্সট ক্যাশিংয়ের জন্য ন্যূনতম ইনপুট টোকেনের সংখ্যা মডেল অনুযায়ী আলাদা হয়। সর্বাধিক মান প্রদত্ত মডেলের সর্বাধিক মানের সমান। (টোকেন গণনা সম্পর্কে আরও জানতে, টোকেন গাইড দেখুন)।
- মডেলটি ক্যাশে করা টোকেন এবং সাধারণ ইনপুট টোকেনের মধ্যে কোনও পার্থক্য করে না। ক্যাশে করা কন্টেন্ট হল প্রম্পটের প্রিফিক্স।
- কনটেক্সট ক্যাশিংয়ের ক্ষেত্রে কোনও বিশেষ রেট বা ব্যবহারের সীমা নেই;
GenerateContent-এর জন্য স্ট্যান্ডার্ড রেট সীমা প্রযোজ্য হয় এবং টোকেন সীমার মধ্যে ক্যাশে করা টোকেন অন্তর্ভুক্ত থাকে। - ক্যাশে করা টোকেনের সংখ্যা ক্যাশে পরিষেবার
create, get ও list অপারেশন থেকে
usage_metadata-এ এবং ক্যাশে ব্যবহার করার সময়GenerateContent-এ রিটার্ন করা হয়।