Gemini API 最佳化和推論

Gemini API 提供多種最佳化機制,可協助您根據特定工作負載需求,在速度、成本和可靠性之間取得平衡。無論是建構即時對話機器人,還是執行大量離線資料處理管道,選擇合適的範例都能大幅降低成本或提升效能。

功能 標準 Flex 優先順序 批次 快取
定價 原價 50% 折扣 比標準多 75% 到 100% 50% 折扣 90% 折扣 + 按比例計算的權杖儲存空間
延遲 秒數轉換為分鐘數 分鐘 (目標為 1 至 15 分鐘) 秒 長達 24 小時 縮短第一個詞元生成時間
穩定性 高 / 中高 盡可能取得容量 (可捨棄) 高 (不會脫落) 高 (處理量) 不適用
介面 同步 同步 同步 非同步 已儲存狀態
最佳用途 一般應用程式工作流程 非緊急的連續鏈結 正式版、面向使用者的應用程式 大型資料集、離線評估 對相同檔案重複查詢

推論服務層級 (同步)

您可以在標準產生呼叫中傳遞 service_tier 參數,在以可靠性為重和以成本為重的同步流量之間切換。

標準推論 (預設)

標準層級是連續生成內容的預設選項。 可提供正常的回應時間,不會收取額外費用或出現大量排隊情形。

  • 穩定性:標準重要性
  • 價格:標準價格。
  • 適用情境:最適合日常互動式應用程式。

優先推論 (延遲最佳化)

優先處理會將要求傳送至高重要性的運算佇列。這類流量絕對不會遭到捨棄 (絕不會遭到其他層級搶占),而且可靠性最高。如果超過動態優先順序限制,系統會將要求降級為標準處理程序,而不是傳回錯誤。

  • 可靠性:最高嚴重程度
  • 價格:高於標準費率 75% 至 100%。
  • 最適合:客戶聊天機器人、即時詐欺偵測,以及業務關鍵的副駕駛。

Flex 推論 (成本效益最佳)

Flex 推論會利用離峰時段的運算容量,因此與標準費率相比,可享有 50% 的折扣。要求會同步處理,因此您不必重新編寫程式碼來管理批次物件。由於這是「可捨棄」的流量,如果系統發生標準流量尖峰,要求可能會遭到搶占。

  • 可靠性:無保證,可捨棄的重大性
  • 價格:標準價格的 50% (按權杖計費)。
  • 最適合:多步驟 Agentic Workflows,其中呼叫 N+1 取決於呼叫 N 的輸出內容、背景 CRM 更新,以及離線評估。

Batch API (大量、非同步)

Batch API 的設計宗旨是處理大量要求,且採用非同步方式,費用僅為標準費用的 50%。您可以內嵌字典的形式提交要求,也可以使用 JSONL 輸入檔案 (最多 2 GB)。這項服務會使用背景輸送量佇列處理要求,目標處理時間為 24 小時。

  • 可靠性:可捨棄,但有 24 小時自動重試和佇列系統
  • 價格:標準價格的 50%。
  • 最適合:預先處理大型資料集、執行週期性迴歸測試套件,以及大量產生圖片或嵌入內容。

脈絡快取 (節省輸入詞元)

如果較短的要求會重複參照大量初始脈絡,系統就會使用「脈絡快取」功能。

  • 隱式快取:Gemini 2.5 以上模型會自動啟用這項功能。 如果要求命中現有快取 (根據常見的提示前置字元),系統會將節省的費用轉移給您。
  • 明確快取:您可以手動建立具有特定存留時間 (TTL) 的快取物件。建立後,您可以在後續要求中參照快取權杖,避免重複傳遞相同的語料庫酬載。
  • 價格:根據快取權杖數量和儲存時間 (TTL) 計費。
  • 最適合:具有大量系統指令的聊天機器人、重複分析長篇影片檔案,或查詢大型文件集。

透過代理式處理降低影片輸入成本

對於長篇影片內容,代理式處理可減少高達 88% 的輸入權杖成本,同時提升回覆品質。模型不會以每秒 1 個影格的速度擷取所有影格 (靜態處理),而是動態搜尋影片,載入與提示相關的轉錄稿和/或影格和/或音訊。如果是延遲至關重要的短片 (5 分鐘以下),靜態處理模式可能會提供更快的「第一個權杖生成時間」(TTFT),因為代理模式會產生內部推論和工具來回,然後才開始生成。

如要使用 Gemini 3.8 Flash、3.6 Flash 或 3.5 Flash Lite 進行代理處理,請在影片輸入內容中設定 processing: "agentic" (Interactions API) 或 media_processing: "AGENTIC" (GenerateContent API)。如果模型不支援代理程式處理,就會傳回錯誤。

如需程式碼範例,請參閱「代理式影片解讀」。