Gemini API 提供多种优化机制,可帮助您根据具体的工作负载需求平衡速度、成本和可靠性。无论您是构建实时对话机器人,还是运行繁重的离线数据处理流水线,选择合适的范式都可以显著降低成本或提升性能。
| 功能 | 标准 | Flex | 优先级 | 批量 | 缓存 |
|---|---|---|---|---|---|
| 价格 | 全价 | 5 折优惠 | 比标准版多 75% 到 100% | 5 折优惠 | 90% 的折扣 + 按比例计算的 token 存储费用 |
| 延迟时间 | 秒到分钟 | 分钟数(目标为 1-15 分钟) | 秒 | 最长 24 小时 | 首 token 延迟更短 |
| 可靠性 | 高 / 中高 | 尽力而为(可舍弃) | 高(不可脱落) | 高(针对吞吐量) | 不适用 |
| 接口 | 同步 | 同步 | 同步 | 异步 | 保存的状态 |
| 最佳使用场景 | 常规应用工作流程 | 非紧急的顺序链 | 正式版面向用户的应用 | 海量数据集、离线评估 | 针对同一文件的重复查询 |
推理服务层级(同步)
您可以在标准生成调用中传递 service_tier 参数,从而在可靠性优化和成本优化的同步流量之间切换。
标准推理(默认)
标准层级是顺序生成内容的默认选项。 它可提供正常的响应时间,无需额外付费或排长队。
- 可靠性:标准严重程度
- 价格:标准价格。
- 最适合:大多数日常互动式应用。
优先推理(延迟时间优化型)
优先处理会将您的请求路由到高严重性计算队列。此类流量严格来说不可舍弃(永远不会被其他层级抢占),并且可靠性最高。如果您超出动态优先级限制,系统会将请求降级为标准处理,而不是因错误而失败。
- 可靠性:最高严重程度
- 价格:比标准费率高 75% 至 100%。
- 最适合:客户聊天机器人、实时欺诈检测和业务关键型 Copilot。
Flex 推理(费用优化)
Flex 推理利用机会性非高峰算力容量,与标准费率相比可节省 50% 的费用。请求会同步处理,这意味着您无需重写代码来管理批处理对象。由于它是“可舍弃”的流量,因此如果系统遇到标准流量高峰,请求可能会被抢占。
- 可靠性:无保证,可舍弃的关键性
- 价格:标准价格的 50%(按令牌数结算)。
- 最适合:多步骤 Agentic Workflows(其中调用 N+1 依赖于调用 N 的输出)、后台 CRM 更新和离线评估。
Batch API(批量、异步)
Batch API 旨在以标准费用 50% 的价格异步处理大量请求。您可以以内嵌字典的形式提交请求,也可以使用 JSONL 输入文件(最大 2 GB)。它使用后台吞吐量队列处理请求,目标周转时间为 24 小时。
- 可靠性:可舍弃,但具有 24 小时自动重试和排队系统
- 价格:标准价格的 50%。
- 最适合用于:预处理海量数据集、运行周期性回归测试套件,以及生成大量图片或嵌入内容。
上下文缓存(节省输入)
当较短的请求重复引用大量初始上下文时,可以使用上下文缓存。
- 隐式缓存:在 Gemini 2.5 及更新型号上自动启用。 如果您的请求基于常见提示前缀命中现有缓存,系统会传递节省的费用。
- 显式缓存:您可以手动创建具有特定存留时间 (TTL) 的缓存对象。创建后,您可以在后续请求中引用缓存的令牌,以避免重复传递相同的语料库载荷。
- 价格:根据缓存词元数量和存储时长 (TTL) 计费。
- 最适合:有大量系统指令的聊天机器人、对较长的视频文件进行的重复分析,或针对大型文档集的查询。
通过 agentic 处理降低视频输入成本
对于长视频内容,智能体处理可以将输入令牌费用最多降低 88%,同时提高回答质量。模型不会以 1 FPS 的速率提取每一帧(静态处理),而是动态搜索视频,加载与提示相关的转写内容和/或帧和/或音频。对于延迟至关重要的短视频片段(时长不到 5 分钟),静态处理可能会提供更快的首 token 延迟时间 (TTFT),因为代理模式在开始生成之前会进行内部推理和工具往返。
如需将智能体处理与 Gemini 3.8 Flash、3.6 Flash 或 3.5 Flash Lite 搭配使用,请在视频输入中设置 processing: "agentic" (Interactions API) 或 media_processing: "AGENTIC" (GenerateContent API)。如果模型不支持代理处理,则会返回错误。
如需查看代码示例,请参阅智能体视频理解。