Gemini 3.6 Flash 和 3.5 Flash-Lite 的新功能

最新型号 其他型号

Gemini 3.6 Flash (gemini-3.6-flash) 和 Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) 已正式发布 (GA),可用于生产环境。

  • Gemini 3.6 Flash:在复杂的智能体任务和多模态任务中表现更出色,同时减少了 token 使用量,价格也比 3.5 Flash 更低。
  • Gemini 3.5 Flash-Lite:3.5 系列中速度最快、成本最低的模型。 在高吞吐量执行方面优于之前的 Flash-Lite 各代。

本指南介绍了每个模型中的新功能、哪些 API 变更会影响您的代码,以及如何迁移。

Gemini 3.6 Flash

  1. 安装技能:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. 应用技能:

    /gemini-interactions-api migrate my app to Gemini 3.6 Flash

Gemini 3.5 Flash-Lite

  1. 安装技能:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. 应用技能:

    /gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite

新模型

模型 模型 ID 默认思考等级 价格 说明
Gemini 3.6 Flash gemini-3.6-flash medium $1.50/百万输入 token,$7.50/百万输出 token 在速度和智能之间取得平衡,可用于智能体任务和多模态任务。
Gemini 3.5 Flash-Lite gemini-3.5-flash-lite minimal $0.30/百万输入 token,$2.50/百万输出 token 速度最快、成本最低的 3.5 模型,可实现高吞吐量执行。

这两种模型均支持 100 万个 token 的上下文窗口、最多 64,000 个输出 token、思考功能以及全套解决方案,包括使用电脑。

如需查看完整规格,请参阅相应型号的页面:

如需了解详细价格信息,请参阅价格页面。

快速入门

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Write a three.js script that renders an interactive 3D robot."
)

print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

async function main() {
  const interaction = await ai.interactions.create({
    model: "gemini-3.6-flash",
    input: "Write a three.js script that renders an interactive 3D robot.",
  });
  console.log(interaction.outputText);
}

main();

REST

curl "https://generativelanguage.googleapis.com/v1beta/interactions"       -H "x-goog-api-key: $GEMINI_API_KEY"       -H 'Content-Type: application/json'       -X POST       -d '{
    "model": "gemini-3.6-flash",
    "input": "Write a three.js script that renders an interactive 3D robot."
  }'

Gemini 3.6 Flash 的新功能

  • 减少了 token 和对话轮数:与 Gemini 3.5 相比,完成多步工作流程所需的推理步骤、对话轮数和工具调用次数更少。它还可以减少执行循环螺旋式上升。
  • 改进了代码生成功能:可生成更高质量、可用于生产用途的代码,减少了不必要的修改和调试循环。
  • 更好地遵循指令:减少诊断任务期间不必要的文件更改。
  • 强大的多模态和空间推理能力:在图表解读、视觉蓝图转换和多元素网页布局生成方面表现更出色。
  • 预先进行程序化检查:与 Gemini 3.5 Flash 相比,更倾向于在进行更改之前运行诊断代码脚本。这有助于提高复杂任务的准确性,但可能会在日常前端工作中增加额外的探索性步骤。
  • “计算机使用”支持:作为内置工具支持,用于实现智能体式界面自动化。
  • 界面样式偏好:更擅长创建功能性代码,但人类评估者更喜欢早期模型提供的图文并茂和样式。您可以通过提供明确的设计指南来缓解此问题。
  • 默认思考程度(中等):使用与 Gemini 3.5 Flash 相同的medium默认思考程度。
  • 降价:降低了输出 token 费用(每百万个 token 为 7.50 美元,而 3.5 Flash 为每百万个 token 9.00 美元)。输入 token 仍为 1.50 美元/100 万个。

Gemini 3.5 Flash-Lite 新功能

  • 缩短了任务执行延迟时间:在 3.5 系列中,吞吐量最高,可用于处理大量数据解析和文档提取任务。
  • 增强的推理和多模态性能:从 Gemini 2.5 Flash 迁移的理想选择,在 HLE(18.0% 对比 11.0%)等推理任务和 CharXIV(74.5% 对比 63.7%)等多模态基准测试中取得了更高的分数。
  • 子智能体编排和工具可靠性:提高了代码执行、搜索和 MCP 工作流的工具执行可靠性。提高自主规划和复杂子代理任务的思考水平。
  • 提升文档理解能力:提高文档解析和结构化数据提取的准确性。根据文档的复杂程度,尝试使用最低和最高思维水平。
  • 交互式 Web 编码和表格数据处理:通过使用轻量级代码执行进行规划,在前端 JavaScript 和表格数据处理方面表现出色。
  • 聊天机器人和角色持久性:与 Gemini 3.1 Flash-Lite 相比,在多轮对话中能更好地遵循指令,并保持角色一致性。
  • “计算机使用”支持:作为内置工具支持,用于实现智能体式界面自动化。

选择合适的 Flash 或 Flash-Lite 模型

使用此表格为工作负载选择合适的模型和迁移路径。

这两种模型都需要移除已弃用的抽样参数(temperature、top_p、top_k)和预填充的模型对话轮次。如需了解详情,请参阅 API 变更。

模型 主要使用场景 建议的迁移目标
Gemini 3.6 Flash
gemini-3.6-flash
代码生成、空间/多模态推理、多步骤智能体工作流 Gemini 3.5 Flash、Gemini 3 Flash(预览版)或 Gemini 3.1 Pro
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
自主子代理执行、海量数据分析和文档提取、结构化 JSON 解析 Gemini 3.1 Flash-Lite 或 Gemini 2.5 Flash

Antigravity 智能体支持

Gemini 3.6 Flash 在 Gemini 托管式智能体中引入了对 Antigravity 智能体的支持。

如需查看当前代码示例和最新的默认代理配置,请参阅 Antigravity 代理指南和 Gemini 3.8 Flash 指南。

API 变更和参数更新

从 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 开始,以下 API 变更适用于这些模型以及未来发布的所有 Gemini 模型。

  • 采样形参废弃:temperature、top_p 和 top_k 已废弃。该 API 会忽略这些参数,并在未来的模型生成中返回错误。
  • 预填模型轮次验证:不再支持预填模型轮次。如果请求中的最后一个非空对话轮次是 model 轮次,则 API 会返回 400 错误。

以下各部分详细介绍了每项 API 变更并提供了相应的代码示例。

1. 弃用抽样参数(temperature、top_p、top_k)

temperature、top_p 和 top_k 已被弃用并会被忽略。在未来的模型世代中,提供这些参数会返回 HTTP 400 错误。从所有请求中移除这些参数。

# ⚠️ Remove these parameters (deprecated)
generation_config = {
     "temperature": 0.7,
     "top_p": 0.9,
     "top_k": 40,
}

为了提高确定性,请针对您的特定用例定义具有明确规则的系统指令。

2. 预填充模型轮次验证

不允许 API 请求以非空模型角色回合结束,并且会返回 HTTP 400 错误。

⚠️ 避免

在旧版 generateContent 或原始 REST 载荷中,现在不允许以模型角色回合结束:

/* ❌ DO NOT: End payload contents with a 'model' role turn */
{
  "contents": [
    {"role": "user", "parts": [{"text": "Translate 'Hello world' to Spanish."}]},
    {"role": "model", "parts": [{"text": "Translation:"}]}  /* ❌ Returns error */
  ]
}

在 Interactions API 中,模型轮次不会手动预填充。如果您的应用之前预填充了模型轮次以抑制序言或强制执行 JSON 格式设置,请改用 system_instruction 或结构化输出。

# ✅ RECOMMENDED: Use system_instruction in the Interactions API to specify output format
interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Translate 'Hello world' to Spanish.",
    system_instruction="Output only the translation without introductory text.",
)

迁移核对清单

Gemini 3.6 Flash

  1. 安装技能:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. 应用技能:

    /gemini-interactions-api migrate my app to Gemini 3.6 Flash

Gemini 3.5 Flash-Lite

  1. 安装技能:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. 应用技能:

    /gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite

迁移到 gemini-3.6-flash

  • 更新模型 ID:将目标模型字符串更改为 gemini-3.6-flash。
  • 应用参数更新:移除已弃用的抽样参数(temperature、top_p、top_k)、candidate_count(在 Gemini 3 及更高版本中不受支持)和预填充的模型对话轮次,详情请参阅 API 变更和参数更新。
  • 配置思考等级:将 thinking_budget 替换为 thinking_level("medium" 或 "high")。
  • 审核函数调用:
    • 将多模态资源放置在响应载荷中。
    • 使用 \n\n 格式设置内嵌说明。
    • 如果您看到与工具前文本相关的 Malformed_Function_Call 错误,请参阅工具前文本要求问题解决方法。
  • Gemini 3.x 基准要求:如需了解 SDK 更新和思考签名保留,请参阅 Gemini 3.5 迁移核对清单。

迁移到 gemini-3.5-flash-lite

  • 更新模型 ID:将目标模型字符串更改为 gemini-3.5-flash-lite。
  • 配置思考力度:
    • 对于大批量提取、路由或分类:将 thinking_level 保留为 "minimal"(默认值),以实现最大吞吐量。
    • 对于具有工具调用、代码执行或多步推理的自主子代理:将 thinking_level 设置为 "medium" 或 "high",以防止工具过早终止。
  • 移除已弃用的参数并验证函数调用:应用与 3.6 Flash 相同的规则。
  • Gemini 3.x 基准要求:请参阅 Gemini 3.5 迁移核对清单。

后续步骤