Tính năng mới trong Gemini 3.6 Flash và 3.5 Flash-Lite

Mô hình mới nhất Các mô hình khác

Gemini 3.6 Flash (gemini-3.6-flash) và Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) đã được phát hành rộng rãi (GA) và sẵn sàng để sử dụng trong quá trình sản xuất.

  • Gemini 3.6 Flash: Hiệu suất mạnh mẽ hơn đối với các tác vụ phức tạp dựa trên tác nhân và đa phương thức, đồng thời giảm mức sử dụng mã thông báo với mức giá thấp hơn so với 3.5 Flash.
  • Gemini 3.5 Flash-Lite: Mô hình nhanh nhất và có chi phí thấp nhất trong dòng 3.5. Vượt trội hơn các thế hệ Flash-Lite trước đây về khả năng thực thi thông lượng cao.

Hướng dẫn này giải thích những điểm mới trong từng mô hình, những thay đổi về API ảnh hưởng đến mã của bạn và cách di chuyển.

Gemini 3.6 Flash

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.6 Flash

Gemini 3.5 Flash-Lite

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite

Mô hình mới

Mô hình Mã kiểu máy Cấp độ tư duy mặc định Giá Mô tả
Gemini 3.6 Flash gemini-3.6-flash medium 1,5 USD/1 triệu token đầu vào và 7,5 USD/1 triệu token đầu ra Cân bằng giữa tốc độ và trí thông minh cho các tác vụ dựa trên tác nhân và đa phương thức.
Gemini 3.5 Flash-Lite gemini-3.5-flash-lite minimal 0,3 USD/1 triệu token đầu vào và 2,5 USD/1 triệu token đầu ra Mô hình 3.5 nhanh nhất và có chi phí thấp nhất để thực thi với thông lượng cao.

Cả hai mô hình đều hỗ trợ cửa sổ ngữ cảnh 1 triệu token, tối đa 64.000 token đầu ra, khả năng tư duy và đủ bộ công cụ tích hợp, bao gồm cả Sử dụng máy tính.

Để biết thông số kỹ thuật đầy đủ, hãy xem các trang về mô hình:

Để biết thông tin chi tiết về giá, hãy xem trang định giá.

Bắt đầu nhanh

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Write a three.js script that renders an interactive 3D robot."
)

print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

async function main() {
  const interaction = await ai.interactions.create({
    model: "gemini-3.6-flash",
    input: "Write a three.js script that renders an interactive 3D robot.",
  });
  console.log(interaction.outputText);
}

main();

REST

curl "https://generativelanguage.googleapis.com/v1beta/interactions"       -H "x-goog-api-key: $GEMINI_API_KEY"       -H 'Content-Type: application/json'       -X POST       -d '{
    "model": "gemini-3.6-flash",
    "input": "Write a three.js script that renders an interactive 3D robot."
  }'

Tính năng mới trong Gemini 3.6 Flash

  • Giảm số lượng mã thông báo và lượt tương tác: Hoàn thành quy trình làm việc nhiều bước với ít bước suy luận, lượt tương tác và lệnh gọi công cụ hơn so với Gemini 3.5. Điều này cũng giúp giảm tình trạng vòng lặp thực thi tăng tốc.
  • Cải thiện khả năng tạo mã: Tạo ra mã chất lượng cao, sẵn sàng cho quá trình sản xuất với ít nội dung chỉnh sửa không mong muốn và ít vòng gỡ lỗi hơn.
  • Tuân thủ chỉ dẫn tốt hơn: Giảm các thay đổi không mong muốn đối với tệp trong quá trình thực hiện các tác vụ chẩn đoán.
  • Khả năng suy luận đa phương thức và không gian mạnh mẽ: Cải thiện hiệu quả trong việc diễn giải biểu đồ, chuyển đổi bản thiết kế trực quan và tạo bố cục web có nhiều phần tử.
  • Kiểm tra lập trình trước: Thường xuyên chạy các tập lệnh mã chẩn đoán trước khi thực hiện các thay đổi hơn Gemini 3.5 Flash. Điều này giúp cải thiện độ chính xác cho các tác vụ phức tạp, nhưng có thể thêm các bước khám phá bổ sung cho công việc thường xuyên ở giao diện người dùng.
  • Hỗ trợ sử dụng máy tính: Được hỗ trợ dưới dạng một công cụ tích hợp để tự động hoá giao diện người dùng dựa trên tác nhân.
  • Lựa chọn ưu tiên về kiểu giao diện người dùng: Tạo mã chức năng tốt hơn, mặc dù các mô hình trước đó được người đánh giá là con người ưu tiên hơn về bố cục trực quan và kiểu dáng. Bạn có thể giảm thiểu vấn đề này bằng cách cung cấp các nguyên tắc thiết kế rõ ràng.
  • Nỗ lực tư duy mặc định (trung bình): Sử dụng cùng mediummức tư duy mặc định như Gemini 3.5 Flash.
  • Giảm giá: Giảm chi phí token đầu ra (7,5 USD/1 triệu token so với 9 USD/1 triệu token cho 3.5 Flash). Số token đầu vào vẫn ở mức 1,5 USD/1 triệu.

Tính năng mới trong Gemini 3.5 Flash-Lite

  • Giảm độ trễ khi thực thi tác vụ: Thông lượng cao nhất trong dòng 3.5 để phân tích cú pháp dữ liệu với số lượng lớn và trích xuất tài liệu.
  • Khả năng suy luận và hiệu suất đa phương thức được cải thiện: Lộ trình di chuyển hiệu quả từ Gemini 2.5 Flash, với điểm số cao hơn trong các nhiệm vụ suy luận như HLE (18% so với 11%) và các điểm chuẩn đa phương thức như CharXIV (74,5% so với 63,7%).
  • Điều phối tác nhân phụ và độ tin cậy của công cụ: Cải thiện độ tin cậy khi thực thi công cụ cho quy trình thực thi mã, tìm kiếm và MCP. Tăng mức độ tư duy cho việc lập kế hoạch tự động và các nhiệm vụ phức tạp của tác nhân phụ.
  • Cải thiện khả năng hiểu tài liệu: Cải thiện độ chính xác khi phân tích cú pháp tài liệu và trích xuất dữ liệu có cấu trúc. Hãy thử nghiệm cả mức độ tư duy tối thiểu và cao, tuỳ thuộc vào độ phức tạp của tài liệu.
  • Lập trình web tương tác và xử lý dữ liệu dạng bảng: Thực hiện hiệu quả trên JavaScript giao diện người dùng và xử lý dữ liệu dạng bảng bằng cách lập kế hoạch sử dụng hoạt động thực thi mã đơn giản.
  • Chatbot và tính nhất quán của nhân vật: Khả năng tuân theo chỉ dẫn nhiều lượt và tính nhất quán của nhân vật tốt hơn so với Gemini 3.1 Flash-Lite.
  • Hỗ trợ sử dụng máy tính: Được hỗ trợ dưới dạng một công cụ tích hợp để tự động hoá giao diện người dùng dựa trên tác nhân.

Chọn mô hình Flash hoặc Flash Lite phù hợp

Hãy sử dụng bảng này để chọn mô hình và phương pháp di chuyển phù hợp cho khối lượng công việc của bạn.

Cả hai mô hình đều yêu cầu xoá các tham số lấy mẫu không dùng nữa (temperature, top_p, top_k) và các lượt tương tác được điền sẵn của mô hình. Hãy xem bài viết Các thay đổi về API để biết thông tin chi tiết.

Mô hình Các trường hợp sử dụng chính Mục tiêu di chuyển được đề xuất
Gemini 3.6 Flash
gemini-3.6-flash
Tạo mã, suy luận không gian/đa phương thức, quy trình làm việc nhiều bước dựa trên tác nhân Gemini 3.5 Flash, Gemini 3 Flash (Bản xem trước) hoặc Gemini 3.1 Pro
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
Thực thi tác nhân phụ tự động, phân tích dữ liệu và trích xuất tài liệu với khối lượng lớn, phân tích cú pháp JSON có cấu trúc Gemini 3.1 Flash-Lite hoặc Gemini 2.5 Flash

Hỗ trợ tác nhân Antigravity

Gemini 3.6 Flash đã hỗ trợ tác nhân Antigravity trong Các tác nhân được quản lý của Gemini.

Để xem các mã mẫu hiện tại và cấu hình mặc định mới nhất của tác nhân, hãy xem hướng dẫn về tác nhân Antigravity và hướng dẫn về Gemini 3.8 Flash.

Các thay đổi về API và nội dung cập nhật về tham số

Bắt đầu từ Gemini 3.6 Flash và Gemini 3.5 Flash-Lite, những thay đổi sau đây về API sẽ áp dụng cho các mô hình này và tất cả các bản phát hành mô hình Gemini trong tương lai.

  • Không dùng tham số lấy mẫu nữa: temperature, top_p và top_k không còn được dùng nữa. API sẽ bỏ qua các tham số này và trả về lỗi trong các thế hệ mô hình sau này.
  • Xác thực lượt phản hồi điền sẵn của mô hình: Chúng tôi không còn hỗ trợ tính năng điền sẵn lượt phản hồi của mô hình nữa. Nếu lượt không trống cuối cùng trong yêu cầu là lượt model, thì API sẽ trả về lỗi 400.

Các phần sau đây cung cấp nội dung giải thích chi tiết và các mẫu mã cho từng thay đổi về API.

1. Ngừng sử dụng tham số lấy mẫu (temperature, top_p, top_k)

temperature, top_p và top_k đã ngừng hoạt động và bị bỏ qua. Trong các thế hệ mô hình trong tương lai, việc cung cấp các tham số này sẽ trả về lỗi HTTP 400. Xoá các thông số này khỏi tất cả yêu cầu.

# ⚠️ Remove these parameters (deprecated)
generation_config = {
     "temperature": 0.7,
     "top_p": 0.9,
     "top_k": 40,
}

Để cải thiện tính xác định, hãy xác định một chỉ dẫn hệ thống có các quy tắc rõ ràng cho trường hợp sử dụng cụ thể của bạn.

2. Xác thực lượt phản hồi điền sẵn của mô hình

Các yêu cầu API kết thúc bằng một lượt phản hồi của mô hình không trống sẽ không được phép và trả về Lỗi HTTP 400.

⚠️ Tránh

Trong generateContent cũ hoặc tải trọng REST thô, việc kết thúc bằng một lượt vai trò mô hình hiện không được phép:

/* ❌ DO NOT: End payload contents with a 'model' role turn */
{
  "contents": [
    {"role": "user", "parts": [{"text": "Translate 'Hello world' to Spanish."}]},
    {"role": "model", "parts": [{"text": "Translation:"}]}  /* ❌ Returns error */
  ]
}

Trong Interactions API, lượt tương tác của mô hình không được điền sẵn theo cách thủ công. Nếu trước đây ứng dụng của bạn đã điền sẵn một lượt tương tác mô hình để ngăn chặn phần mở đầu hoặc buộc định dạng JSON, hãy sử dụng system_instruction hoặc Đầu ra có cấu trúc.

# ✅ RECOMMENDED: Use system_instruction in the Interactions API to specify output format
interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Translate 'Hello world' to Spanish.",
    system_instruction="Output only the translation without introductory text.",
)

Danh sách kiểm tra cho quy trình di chuyển

Gemini 3.6 Flash

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.6 Flash

Gemini 3.5 Flash-Lite

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite

Di chuyển sang gemini-3.6-flash

  • Cập nhật mã nhận dạng mô hình: Thay đổi chuỗi mô hình mục tiêu thành gemini-3.6-flash.
  • Áp dụng các nội dung cập nhật về tham số: Xoá các tham số lấy mẫu không dùng nữa (temperature, top_p, top_k), candidate_count (không được hỗ trợ trong Gemini 3 trở lên) và các lượt phản hồi được điền sẵn của mô hình như được nêu chi tiết trong phần Các thay đổi về API và nội dung cập nhật về tham số.
  • Định cấu hình cấp độ tư duy: Thay thế thinking_budget bằng thinking_level ("medium" hoặc "high").
  • Kiểm tra lệnh gọi hàm:
  • Các yêu cầu cơ bản đối với Gemini 3.x: Để biết thông tin về việc cập nhật SDK và duy trì chữ ký tư duy, hãy xem Danh sách kiểm tra việc di chuyển Gemini 3.5.

Di chuyển sang gemini-3.5-flash-lite

  • Cập nhật mã nhận dạng mô hình: Thay đổi chuỗi mô hình mục tiêu thành gemini-3.5-flash-lite.
  • Định cấu hình mức độ nỗ lực tư duy:
    • Để trích xuất, định tuyến hoặc phân loại khối lượng lớn: hãy để thinking_level ở "minimal" (mặc định) để có thông lượng tối đa.
    • Đối với các trợ lý ảo tự động có lệnh gọi công cụ, thực thi mã hoặc suy luận đa bước: đặt thinking_level thành "medium" hoặc "high" để ngăn chặn việc chấm dứt công cụ quá sớm.
  • Xoá các tham số không dùng nữa và xác thực lệnh gọi hàm: Áp dụng các quy tắc tương tự như Flash 3.6.
  • Các yêu cầu cơ bản đối với Gemini 3.x: Tham khảo Danh sách kiểm tra việc di chuyển sang Gemini 3.5.

Các bước tiếp theo