Sử dụng các mô hình Gemini mới nhất

Trang này 3.5 Flash

Gemini 3.6 Flash (gemini-3.6-flash) và Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) đã được phát hành rộng rãi (GA) và sẵn sàng để sử dụng trong quá trình sản xuất.

  • Gemini 3.6 Flash: Hiệu suất mạnh mẽ hơn đối với các tác vụ phức tạp, đa phương thức và có tác nhân, đồng thời giảm mức sử dụng mã thông báo với mức giá thấp hơn so với 3.5 Flash.
  • Gemini 3.5 Flash-Lite: Mô hình nhanh nhất và có chi phí thấp nhất trong dòng 3.5. Vượt trội hơn các thế hệ Flash-Lite trước đây về khả năng thực thi thông lượng cao.

Hướng dẫn này giải thích những điểm mới trong từng mô hình, những thay đổi về API ảnh hưởng đến mã của bạn và cách di chuyển.

Gemini 3.6 Flash

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-api-dev --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.6 Flash

Gemini 3.5 Flash-Lite

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-api-dev --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite

Mẫu mới

Mô hình Mã kiểu máy Cấp độ tư duy mặc định Giá Mô tả
Gemini 3.6 Flash gemini-3.6-flash medium 1,5 USD/1 triệu mã thông báo đầu vào và 7,5 USD/1 triệu mã thông báo đầu ra Cân bằng giữa tốc độ và trí thông minh cho các tác vụ đa phương thức và dựa trên tác nhân.
Gemini 3.5 Flash-Lite gemini-3.5-flash-lite minimal 0,3 USD/1 triệu mã thông báo đầu vào và 2,5 USD/1 triệu mã thông báo đầu ra Mô hình 3.5 nhanh nhất và có chi phí thấp nhất để thực thi thông lượng cao.

Cả hai mô hình đều hỗ trợ cửa sổ ngữ cảnh 1 triệu token, tối đa 64.000 token đầu ra, khả năng tư duy và đủ bộ công cụ tích hợp, bao gồm cả Sử dụng máy tính.

Để biết thông số kỹ thuật đầy đủ, hãy xem các trang về mô hình:

Để biết thông tin chi tiết về giá, hãy xem trang giá.

Bắt đầu nhanh

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Write a three.js script that renders an interactive 3D robot."
)

print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

async function main() {
  const interaction = await ai.interactions.create({
    model: "gemini-3.6-flash",
    input: "Write a three.js script that renders an interactive 3D robot.",
  });
  console.log(interaction.outputText);
}

main();

REST

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{
    "model": "gemini-3.6-flash",
    "input": {
      "parts": [{"text": "Write a three.js script that renders an interactive 3D robot."}]
    }
  }'

Tính năng mới trong Gemini 3.6 Flash

  • Giảm số lượng mã thông báo và lượt tương tác: Hoàn thành quy trình công việc gồm nhiều bước với ít bước suy luận, lượt tương tác đàm thoại và lệnh gọi công cụ hơn so với Gemini 3.5. Điều này cũng giúp giảm tình trạng vòng lặp thực thi tăng tốc.
  • Cải thiện khả năng tạo mã: Tạo ra mã chất lượng cao sẵn sàng cho sản xuất với ít nội dung chỉnh sửa không mong muốn và ít vòng gỡ lỗi hơn.
  • Tuân theo chỉ dẫn tốt hơn: Giảm các thay đổi không mong muốn đối với tệp trong quá trình thực hiện các tác vụ chẩn đoán.
  • Khả năng suy luận đa phương thức và không gian mạnh mẽ: Cải thiện hiệu quả trong việc diễn giải biểu đồ, chuyển đổi bản thiết kế trực quan và tạo bố cục web có nhiều phần tử.
  • Kiểm tra lập trình trước: Thường xuyên chạy các tập lệnh mã chẩn đoán trước khi thực hiện thay đổi hơn Gemini 3.5 Flash. Điều này giúp cải thiện độ chính xác cho các tác vụ phức tạp, nhưng có thể thêm các bước khám phá bổ sung cho công việc đơn giản ở giao diện người dùng.
  • Hỗ trợ sử dụng máy tính: Được hỗ trợ dưới dạng công cụ gốc để tự động hoá giao diện người dùng dựa trên tác nhân.
  • Lựa chọn ưu tiên về kiểu giao diện người dùng: Tạo mã chức năng tốt hơn, mặc dù nhân viên đánh giá là con người thích các mô hình trước đó hơn về bố cục trực quan và định kiểu. Bạn có thể giảm thiểu tình trạng này bằng cách cung cấp các nguyên tắc thiết kế rõ ràng.
  • Mức độ tư duy mặc định (trung bình): Sử dụng cùng mediummức độ tư duy mặc định như Gemini 3.5 Flash.
  • Giảm giá: Giảm chi phí token đầu ra (7,5 USD/1 triệu token so với 9 USD/1 triệu token cho 3.5 Flash). Mã thông báo đầu vào vẫn ở mức 1,5 USD/1 triệu mã thông báo.

Tính năng mới trong Gemini 3.5 Flash-Lite

  • Giảm độ trễ khi thực thi tác vụ: Thông lượng cao nhất trong dòng 3.5 để phân tích cú pháp dữ liệu và trích xuất tài liệu với số lượng lớn.
  • Khả năng suy luận và hiệu suất đa phương thức nâng cao: Lộ trình di chuyển hiệu quả từ Gemini 2.5 Flash, với điểm số cao hơn trong các nhiệm vụ suy luận như HLE (18% so với 11%) và các điểm chuẩn đa phương thức như CharXIV (74,5% so với 63,7%).
  • Điều phối tác nhân phụ và độ tin cậy của công cụ: Cải thiện độ tin cậy khi thực thi công cụ cho quy trình thực thi mã, tìm kiếm và MCP. Tăng mức độ tư duy cho việc lập kế hoạch tự động và các tác vụ phức tạp của tác nhân phụ.
  • Cải thiện khả năng hiểu tài liệu: Cải thiện độ chính xác khi phân tích cú pháp tài liệu và trích xuất dữ liệu có cấu trúc. Thử nghiệm với cả mức độ tư duy tối thiểu và cao, tuỳ thuộc vào độ phức tạp của tài liệu.
  • Xử lý dữ liệu dạng bảng và viết mã web tương tác: Thực hiện tốt việc xử lý dữ liệu dạng bảng và JavaScript trên giao diện người dùng bằng cách lập kế hoạch thông qua việc thực thi mã đơn giản.
  • Chatbot và tính nhất quán của nhân vật: Khả năng tuân theo chỉ dẫn nhiều lượt và tính nhất quán của nhân vật tốt hơn so với Gemini 3.1 Flash-Lite.
  • Hỗ trợ sử dụng máy tính: Được hỗ trợ dưới dạng công cụ gốc để tự động hoá giao diện người dùng dựa trên tác nhân.

Chọn mô hình Flash hoặc Flash-Lite phù hợp

Hãy sử dụng bảng này để chọn mô hình và lộ trình di chuyển phù hợp cho các tải công việc của bạn.

Cả hai mô hình đều yêu cầu xoá các tham số lấy mẫu không dùng nữa (temperature, top_p, top_k) và các lượt phản hồi được điền sẵn của mô hình. Hãy xem bài viết Các thay đổi về API để biết thông tin chi tiết.

Mô hình Các trường hợp sử dụng chính Mục tiêu di chuyển được đề xuất
Gemini 3.6 Flash
gemini-3.6-flash
Tạo mã, suy luận không gian/đa phương thức, quy trình làm việc nhiều bước dựa trên tác nhân Gemini 3.5 Flash, Gemini 3 Flash (Bản dùng thử) hoặc Gemini 3.1 Pro
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
Thực thi tác nhân phụ tự động, phân tích dữ liệu và trích xuất tài liệu với số lượng lớn, phân tích cú pháp JSON có cấu trúc Gemini 3.1 Flash-Lite hoặc Gemini 2.5 Flash

Đã cập nhật tác nhân Antigravity

Nhờ hiệu suất được cải thiện, Gemini 3.6 Flash hiện là mô hình mặc định mới hỗ trợ tác nhân Antigravity trong Gemini Managed Agents. Bạn có thể thay đổi thông tin này bằng cách đặt một trường mới trên API.

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    agent="antigravity-preview-05-2026",
    input="Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
    environment="remote",
)

print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const interaction = await client.interactions.create({
    agent: "antigravity-preview-05-2026",
    input: "Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
    environment: "remote",
}, { timeout: 300000 });

console.log(interaction.output_text);

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
    "agent": "antigravity-preview-05-2026",
    "input": "Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
    "environment": "remote"
}'

Các thay đổi về API và nội dung cập nhật về tham số

Bắt đầu từ Gemini 3.6 Flash và Gemini 3.5 Flash-Lite, những thay đổi sau đây về API sẽ áp dụng cho các mô hình này và tất cả các bản phát hành mô hình Gemini trong tương lai.

  • Không dùng tham số lấy mẫu nữa: temperature, top_ptop_k không còn được dùng nữa. API này sẽ bỏ qua các tham số này và trả về lỗi trong các thế hệ mô hình sau này.
  • Xác thực lượt phản hồi của mô hình được điền sẵn: Chúng tôi không còn hỗ trợ tính năng điền sẵn lượt phản hồi của mô hình nữa. Nếu lượt không trống cuối cùng trong yêu cầu là lượt model, thì API sẽ trả về lỗi 400.

Dưới đây là nội dung giải thích chi tiết và các mẫu mã cho từng thay đổi về API.

1. Ngừng sử dụng tham số lấy mẫu (temperature, top_p, top_k)

temperature, top_ptop_k đã ngừng hoạt động và bị bỏ qua. Trong các thế hệ mô hình sau này, việc cung cấp các tham số này sẽ trả về lỗi HTTP 400. Xoá các thông số này khỏi tất cả yêu cầu.

# ⚠️ Remove these parameters (deprecated)
generation_config = {
     "temperature": 0.7,
     "top_p": 0.9,
     "top_k": 40,
}

Để cải thiện tính xác định, hãy xác định một chỉ dẫn hệ thống có các quy tắc rõ ràng cho trường hợp sử dụng cụ thể của bạn.

2. Xác thực lượt phản hồi của mô hình được điền sẵn

Các yêu cầu API kết thúc bằng một lượt phản hồi có vai trò mô hình không trống sẽ không được phép và trả về Lỗi HTTP 400.

⚠️ Tránh

Trong tải trọng REST thô hoặc generateContent cũ, việc kết thúc bằng một lượt vai trò mô hình hiện không được phép:

/* ❌ DO NOT: End payload contents with a 'model' role turn */
{
  "contents": [
    {"role": "user", "parts": [{"text": "Translate 'Hello world' to Spanish."}]},
    {"role": "model", "parts": [{"text": "Translation:"}]}  /* ❌ Returns error */
  ]
}

Trong Interactions API, các lượt tương tác của mô hình không được điền sẵn theo cách thủ công. Nếu trước đây ứng dụng của bạn đã điền sẵn một lượt tương tác mô hình để ngăn chặn phần mở đầu hoặc buộc định dạng JSON, hãy sử dụng system_instruction hoặc Đầu ra có cấu trúc.

# ✅ RECOMMENDED: Use system_instruction in the Interactions API to specify output format
interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Translate 'Hello world' to Spanish.",
    system_instruction="Output only the translation without introductory text.",
)

Danh sách kiểm tra cho quá trình di chuyển

Gemini 3.6 Flash

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-api-dev --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.6 Flash

Gemini 3.5 Flash-Lite

  1. Cài đặt kỹ năng:

    npx skills add google-gemini/gemini-skills --skill gemini-api-dev --global
  2. Áp dụng kỹ năng:

    /gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite

Di chuyển sang gemini-3.6-flash

  • Cập nhật mã nhận dạng mô hình: Thay đổi chuỗi mô hình mục tiêu thành gemini-3.6-flash.
  • Xoá các thông số lấy mẫu không dùng nữa:
    • Xoá temperature, top_ptop_k khỏi cấu hình tạo.
    • Thay thế thinking_budget bằng enum chuỗi thinking_level được đặt thành "medium" hoặc "high".
    • Xoá candidate_count (không được hỗ trợ trong Gemini 3.x).
  • Thực thi các quy tắc xác thực lượt chơi:
    • Chuẩn hoá các cuộc trò chuyện nhiều lượt trên previous_interaction_id phía máy chủ.
    • Xoá các lượt được điền sẵn.
  • Kiểm tra lệnh gọi hàm:
    • Đặt các thành phần đa phương thức vào tải trọng phản hồi.
    • Định dạng hướng dẫn nội tuyến bằng cách sử dụng \n\n.
    • Nếu bạn thấy lỗi Malformed_Function_Call liên quan đến văn bản trước công cụ, hãy xem phần Giải pháp thay thế cho các yêu cầu về văn bản trước công cụ.
    • Chỉ khi sử dụng API generateContent: Đảm bảo tất cả các đối tượng FunctionResponse đều có call_idname.
  • Các yêu cầu cơ bản đối với Gemini 3.x: Để biết thông tin về việc cập nhật SDK và duy trì chữ ký tư duy, hãy xem Danh sách kiểm tra việc di chuyển Gemini 3.5.

Di chuyển sang gemini-3.5-flash-lite

  • Cập nhật mã nhận dạng mô hình: Thay đổi chuỗi mô hình mục tiêu thành gemini-3.5-flash-lite.
  • Định cấu hình mức độ nỗ lực tư duy:
    • Để trích xuất, định tuyến hoặc phân loại khối lượng lớn: hãy để thinking_level"minimal" (mặc định) để có thông lượng tối đa.
    • Đối với các trợ lý ảo tự trị có lệnh gọi công cụ, thực thi mã hoặc suy luận đa bước: hãy đặt thinking_level thành "medium" hoặc "high" để ngăn chặn việc chấm dứt công cụ quá sớm.
  • Xoá các tham số không dùng nữa và xác thực việc gọi hàm: Áp dụng các quy tắc tương tự như 3.6 Flash.
  • Các yêu cầu cơ bản đối với Gemini 3.x: Tham khảo Danh sách kiểm tra việc di chuyển Gemini 3.5.

Các bước tiếp theo