Gemini API 提供多種最佳化機制,可協助您根據特定工作負載需求,在速度、成本和可靠性之間取得平衡。無論是建構即時對話機器人,還是執行大量離線資料處理管道,選擇合適的範例都能大幅降低成本或提升效能。
| 功能 | 標準 | Flex | 優先順序 | 批次 | 快取 |
|---|---|---|---|---|---|
| 定價 | 原價 | 50% 折扣 | 比標準多 75% 到 100% | 50% 折扣 | 90% 折扣 + 按比例計算的權杖儲存空間 |
| 延遲 | 秒數轉換為分鐘數 | 分鐘 (目標為 1 至 15 分鐘) | 秒 | 長達 24 小時 | 縮短第一個詞元生成時間 |
| 穩定性 | 高 / 中高 | 盡可能取得容量 (可捨棄) | 高 (不會脫落) | 高 (處理量) | 不適用 |
| 介面 | 同步 | 同步 | 同步 | 非同步 | 已儲存狀態 |
| 最佳用途 | 一般應用程式工作流程 | 非緊急的連續鏈結 | 正式版、面向使用者的應用程式 | 大型資料集、離線評估 | 對相同檔案重複查詢 |
推論服務層級 (同步)
您可以在標準產生呼叫中傳遞 service_tier 參數,在以可靠性為重和以成本為重的同步流量之間切換。
標準推論 (預設)
標準層級是連續生成內容的預設選項。 可提供正常的回應時間,不會收取額外費用或出現大量排隊情形。
- 穩定性:標準重要性
- 價格:標準價格。
- 適用情境:最適合日常互動式應用程式。
優先推論 (延遲最佳化)
優先處理會將要求傳送至高重要性的運算佇列。這類流量絕對不會遭到捨棄 (絕不會遭到其他層級搶占),而且可靠性最高。如果超過動態優先順序限制,系統會將要求降級為標準處理程序,而不是傳回錯誤。
- 可靠性:最高嚴重程度
- 價格:高於標準費率 75% 至 100%。
- 最適合:客戶聊天機器人、即時詐欺偵測,以及業務關鍵的副駕駛。
Flex 推論 (成本效益最佳)
Flex 推論會利用離峰時段的運算容量,因此與標準費率相比,可享有 50% 的折扣。要求會同步處理,因此您不必重新編寫程式碼來管理批次物件。由於這是「可捨棄」的流量,如果系統發生標準流量尖峰,要求可能會遭到搶占。
- 可靠性:無保證,可捨棄的重大性
- 價格:標準價格的 50% (按權杖計費)。
- 最適合:多步驟 Agentic Workflows,其中呼叫 N+1 取決於呼叫 N 的輸出內容、背景 CRM 更新,以及離線評估。
Batch API (大量、非同步)
Batch API 的設計宗旨是處理大量要求,且採用非同步方式,費用僅為標準費用的 50%。您可以內嵌字典的形式提交要求,也可以使用 JSONL 輸入檔案 (最多 2 GB)。這項服務會使用背景輸送量佇列處理要求,目標處理時間為 24 小時。
- 可靠性:可捨棄,但有 24 小時自動重試和佇列系統
- 價格:標準價格的 50%。
- 最適合:預先處理大型資料集、執行週期性迴歸測試套件,以及大量產生圖片或嵌入內容。
脈絡快取 (節省輸入詞元)
如果較短的要求會重複參照大量初始脈絡,系統就會使用「脈絡快取」功能。
- 隱式快取:Gemini 2.5 以上模型會自動啟用這項功能。 如果要求命中現有快取 (根據常見的提示前置字元),系統會將節省的費用轉移給您。
- 明確快取:您可以手動建立具有特定存留時間 (TTL) 的快取物件。建立後,您可以在後續要求中參照快取權杖,避免重複傳遞相同的語料庫酬載。
- 價格:根據快取權杖數量和儲存時間 (TTL) 計費。
- 最適合:具有大量系統指令的聊天機器人、重複分析長篇影片檔案,或查詢大型文件集。
透過代理式處理降低影片輸入成本
對於長篇影片內容,代理式處理可減少高達 88% 的輸入權杖成本,同時提升回覆品質。模型不會以每秒 1 個影格的速度擷取所有影格 (靜態處理),而是動態搜尋影片,載入與提示相關的轉錄稿和/或影格和/或音訊。如果是延遲至關重要的短片 (5 分鐘以下),靜態處理模式可能會提供更快的「第一個權杖生成時間」(TTFT),因為代理模式會產生內部推論和工具來回,然後才開始生成。
如要使用 Gemini 3.8 Flash、3.6 Flash 或 3.5 Flash Lite 進行代理處理,請在影片輸入內容中設定 processing: "agentic" (Interactions API) 或 media_processing: "AGENTIC" (GenerateContent API)。如果模型不支援代理程式處理,就會傳回錯誤。
如需程式碼範例,請參閱「代理式影片解讀」。