بهینه‌سازی و استنباط Gemini API

«میانای برنامه‌سازی کاربردی Gemini» سازوکارهای بهینه‌سازی متنوعی ارائه می‌دهد تا به شما کمک کند براساس نیازهای خاص حجم کاری‌تان، بین سرعت، هزینه، و قابلیت اطمینان تعادل برقرار کنید. چه درحال ساختن روبات‌های مکالمه‌ای هم‌زمان باشید یا درحال اجرای خطوط لوله سنگین پردازش داده آفلاین، انتخاب الگوی مناسب می‌تواند هزینه‌ها را به‌طور قابل‌توجهی کاهش دهد یا عملکرد را بهبود بخشد.

ویژگی استاندارد به‌رخ کشیدن اولویت دسته در حال ذخیره در حافظه نهان
قیمت‌گذاری قیمت کامل ‫٪۵۰ تخفیف ‫٪۷۵ تا ٪۱۰۰ بیشتر از استاندارد ‫٪۵۰ تخفیف ‫٪۹۰ تخفیف + فضای ذخیره‌سازی کد سرشکن‌شده
تأخیر ثانیه به دقیقه دقیقه (هدف ۱ تا ۱۵ دقیقه) ثانیه حداکثر ۲۴ ساعت زمان تا اولین داده‌واحد سریع‌تر
قابلیت اطمینان زیاد / متوسط روبه‌بالا نهایت تلاش (قابل‌حذف) زیاد (غیرقابل ریزش) بالا (برای توان گذرداد) موجود نیست
میانای هم‌زمان هم‌زمان هم‌زمان غیرهمگام وضعیت ذخیره‌شده
بهترین کاربرد گردش‌های کار برنامه عمومی زنجیره‌های متوالی غیرفوری برنامه‌های تولید، سمت کاربر مجموعه‌داده‌های عظیم، ارزیابی‌های آفلاین پُرسمان‌های تکرارشونده روی فایل یکسان

رده‌های خدمات استنباط (هم‌زمان)

با ارسال پارامتر service_tier در تماس‌های تولید استانداردتان، می‌توانید بین ترافیک هم‌زمان بهینه‌شده برای قابلیت اطمینان و ترافیک هم‌زمان بهینه‌شده برای هزینه جابه‌جا شوید.

استنتاج استاندارد (پیش‌فرض)

سطح استاندارد گزینه پیش‌فرض برای تولید محتوای ترتیبی است. این ویژگی بدون نیاز به پرداخت هزینه اضافی یا قرار گرفتن در صف طولانی، زمان پاسخ‌دهی عادی را ارائه می‌دهد.

  • قابلیت اطمینان: بحرانی بودن استاندارد
  • قیمت: قیمت استاندارد.
  • بهترین برای: تعاملی‌ترین برنامه‌های روزمره.

استنباط اولویت‌دار (بهینه‌سازی‌شده برای تأخیر)

پردازش اولویت‌دار درخواست‌هایتان را به صف‌های محاسباتی با اهمیت بالا هدایت می‌کند. این ترافیک کاملاً غیرقابل‌انصراف است (هرگز توسط سطوح دیگر پیش‌گیری نمی‌شود) و بالاترین قابلیت اطمینان را ارائه می‌دهد. اگر از محدوده‌های «اولویت پویا» فراتر بروید، سیستم به‌جای اینکه درخواست را با خطا رد کند، آن را به پردازش «استاندارد» تنزل می‌دهد.

  • قابلیت اطمینان: بالاترین سطح اهمیت
  • قیمت: ۷۵٪ تا ۱۰۰٪ بالاتر از نرخ‌های استاندارد.
  • بهترین برای: روبات‌های گپ مشتری، تشخیص کلاهبرداری هم‌زمان، و خلبان‌های کمکی حیاتی برای کسب‌وکار.

استنتاج انعطاف‌پذیر (بهینه‌سازی‌شده برای هزینه)

استنباط انعطاف‌پذیر بااستفاده از ظرفیت محاسباتی فرصت‌طلبانه و خارج از اوج، در مقایسه با نرخ‌های استاندارد، ‎٪۵۰ تخفیف ارائه می‌دهد. درخواست‌ها به‌صورت هم‌زمان پردازش می‌شوند، یعنی برای مدیریت کردن دسته‌های هدف نیازی به بازنویسی کد ندارید. ازآنجایی‌که ترافیک «قابل‌صرف‌نظر کردن» است، اگر سیستم با جهش‌های ترافیک استاندارد مواجه شود، ممکن است درخواست‌ها لغو شوند.

  • قابلیت اطمینان: غیرتضمینی، قابلیت حذف بحرانی
  • قیمت: ۵۰٪ از «قیمت‌گذاری استاندارد» (صورت‌حساب براساس داده‌واحد).
  • بهترین گزینه برای: گردش کارهای عامل‌گرای چندمرحله‌ای که در آن فراخوانی N+1 به برونداد فراخوانی N، به‌روزرسانی‌های پس‌زمینه‌ای CRM، و ارزیابی‌های آفلاین بستگی دارد.

Batch API (فله‌ای، ناهمزمان)

میانای برنامه‌سازی کاربردی دسته‌ای برای پردازش حجم زیادی از درخواست‌ها به‌صورت ناهم‌زمان با ۵۰٪ هزینه استاندارد طراحی شده است. می‌توانید درخواست‌ها را هم به‌صورت فرهنگ لغت درون‌خطی یا بااستفاده از فایل ورودی JSONL (حداکثر ۲ گیگابایت) ارسال کنید. این سیستم درخواست‌ها را بااستفاده از صف‌های گذردهی پس‌زمینه با زمان گردش هدف ۲۴ ساعت پردازش می‌کند.

  • قابلیت اطمینان: قابل‌حذف اما با تلاش‌های مجدد خودکارسازی‌شده ۲۴ ساعته و سیستم صف‌بندی
  • قیمت: ۵۰٪ قیمت استاندارد.
  • بهترین گزینه برای: پیش‌پردازش مجموعه‌های داده عظیم، اجرای مجموعه‌های آزمایشی رگرسیون دوره‌ای، و تولید تصاویر یا جاسازی‌های با حجم بالا.

ذخیره کردن بافت در حافظه نهان (صرفه‌جویی در ورودی)

وقتی درخواست‌های کوتاه‌تر به‌طور مکرر به بافت اولیه قابل‌توجهی ارجاع می‌دهند، از ذخیره بافت استفاده می‌شود.

  • ذخیره‌سازی نهان ضمنی: به‌طور خودکار در Gemini 2.5 و مدل‌های جدیدتر فعال می‌شود. اگر درخواستتان براساس پیشوندهای پیام‌واره مشترک به حافظه‌های نهان موجود برخورد کند، سیستم صرفه‌جویی در هزینه را منتقل می‌کند.
  • ذخیره‌سازی صریح: می‌توانید به‌صورت دستی یک شیء حافظه نهان با یک زمان زنده (TTL) خاص ایجاد کنید. پس‌از ایجاد، برای درخواست‌های بعدی به نشان‌های ذخیره‌شده در حافظه نهان ارجاع می‌دهید تا از ارسال مکرر همان بار بدنه جلوگیری کنید.
  • قیمت: براساس تعداد نشان‌های حافظه نهان و مدت زمان ذخیره‌سازی (TTL) صورت‌حساب می‌شود.
  • بهترین گزینه برای: روبات‌های گپ با دستورالعمل‌های سیستم گسترده، تجزیه‌وتحلیل تکراری فایل‌های ویدیویی طولانی، یا پُرسمان‌های مربوط به مجموعه‌های بزرگ سند.

با پردازش کارگزاری، هزینه‌های ورودی ویدیو را کاهش دهید

برای محتوای ویدیویی طولانی، پردازش عامل‌محور می‌تواند هزینه‌های داده‌واحد ورودی را تا ۸۸٪ کاهش دهد و درعین‌حال کیفیت پاسخ را بهبود بخشد. به‌جای استخراج هر فریم با سرعت ۱ فریم در ثانیه (پردازش ایستا)، مدل به‌صورت پویا در ویدیو جستجو می‌کند و ترانویسی و/یا فریم‌ها و/یا صدای مربوط به پیام‌واره شما را بار می‌کند. برای کلیپ‌های کوتاه (زیر ۵ دقیقه) که در آن‌ها تأخیر بسیار مهم است، پردازش ایستا ممکن است «زمان تا اولین نشان» (TTFT) سریع‌تری ارائه دهد، زیرا حالت عامل قبل‌از شروع تولید، استدلال داخلی و رفت‌وبرگشت ابزار را دربرمی‌گیرد.

برای استفاده از پردازش عامل‌گرا با Gemini 3.8 Flash،‏ 3.6 Flash، یا 3.5 Flash Lite، processing: "agentic" (میانای برنامه‌سازی کاربردی تعاملات) یا media_processing: "AGENTIC" (میانای برنامه‌سازی کاربردی GenerateContent) را روی ورودی ویدیوتان تنظیم کنید. اگر مدل از پردازش عامل پشتیبانی نکند، خطا برمی‌گرداند.

برای نمونه‌های کد، درک ویدیویی عامل را ببینید.