Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) là mô hình chuyển văn bản sang lời nói hiệu suất cao, nhanh chóng và tiết kiệm chi phí của Google, được xây dựng để thay thế gemini-3.1-flash-tts-preview cho các khối lượng công việc sản xuất có thông lượng cao.

Tổng quan và các chức năng

TTS Gemini 3.8 Flash-Lite kết hợp độ trễ thấp với giọng nói tự nhiên, giàu biểu cảm:

  • Hiệu quả thông lượng cao: Được tối ưu hoá cho việc sản xuất hàng loạt, các tầng tác nhân giọng nói đàm thoại, tính năng đọc to và khả năng tạo lời nói hằng ngày của một người nói bằng các ngôn ngữ chính.
  • Khả năng tương thích với lược đồ thả và kéo: Chia sẻ chính xác lược đồ API và định dạng câu lệnh có cấu trúc giống như gemini-3.8-flash-tts, cho phép bạn chuyển đổi mô hình chỉ bằng một thay đổi tham số.
  • Hỗ trợ đầy đủ hệ sinh thái giọng nói: Hỗ trợ giọng nói được tạo sẵn, Thư viện giọng nói mở rộng (GET /v1beta/voices), các nhân vật Thiết kế giọng nói tuỳ chỉnh và Sao chép giọng nói (theo mặc định, giọng nói được lưu trữ liên tục, cộng với các khoá không trạng thái không bắt buộc). Bạn cũng có thể thiết kế và sao chép giọng nói một cách tương tác trong Google AI Studio.

Hãy tham khảo hướng dẫn về tính năng Chuyển văn bản sang lời nói để biết thông tin đầy đủ về các tính năng, các phương pháp hay nhất để đưa ra câu lệnh và ví dụ về mã.

Trường hợp nên sử dụng mô hình TTS nào

Cả hai mô hình TTS Gemini 3.8 đều dùng chung một lược đồ API và cấu trúc câu lệnh. Chọn mô hình phù hợp với khối lượng công việc của bạn:

Tính năng / tải công việc Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Sức mạnh chính Thông lượng cao, độ trễ thấp và hiệu quả về chi phí Độ trung thực tối đa về giọng nói, sắc thái diễn xuất và phạm vi giọng địa phương
Các trường hợp sử dụng phù hợp nhất Sản xuất với số lượng lớn, nhiều lớp tác nhân thoại theo thời gian thực, tính năng đọc to, nhân bản giọng nói, tạo giọng nói của một người hằng ngày Sách nói, giọng đọc chuyên nghiệp, đoạn hội thoại phức tạp của nhiều người, diễn xuất có nhiều đoạn thoại, phát âm khó, phương ngữ
Ngôn ngữ được hỗ trợ 101 ngôn ngữ 130 ngôn ngữ
Được đề xuất thay thế cho gemini-3.1-flash-tts-preview Cấp mẫu quảng cáo hàng đầu mới

Hướng dẫn di chuyển

Nếu bạn đang nâng cấp từ gemini-3.1-flash-tts-preview lên gemini-3.8-flash-lite-tts, hãy cập nhật các yêu cầu của bạn đối với giản đồ TTS Gemini 3.8:

  1. Di chuyển chỉ dẫn theo từng lượt vào speech_metadata: TTS Gemini 3.8 coi văn bản đầu vào hoàn toàn là bản chép lời nguyên văn. Các chỉ dẫn bằng văn bản nội tuyến như "Say cheerfully: Hello!" hoặc "Speaker 1: Hello!" có thể được đọc to. Di chuyển chỉ dẫn phân phối liên tục (style) và nhãn người nói (speaker) vào siêu dữ liệu có cấu trúc:
    • Interactions API: Đính kèm chú thích bằng "type": "speech_metadata", "speaker""style" vào từng khối nội dung văn bản.
    • GenerateContent API: Đính kèm "speech_metadata": {"speaker": "...", "style": "..."} vào mỗi part.
  2. Chỉ sử dụng thẻ nội tuyến dấu ngoặc nhọn cho các sự kiện thoại tại một thời điểm: Giữ các đoạn ngắt giọng và đoạn tạm dừng không phải lời nói trong bản chép lời bằng dấu ngoặc nhọn (chẳng hạn như <laugh>, <sigh>, <cough>, <breath> hoặc <short pause>). Đặt các kiểu truyền đạt như thì thầm trong speech_metadata.style.
  3. Chỉ định speaker ở mỗi lượt trong yêu cầu có nhiều người nói: Mỗi lượt trong yêu cầu có nhiều người nói phải bao gồm rõ ràng speaker bên trong speech_metadata khớp với một trong những người nói đã định cấu hình.
  4. Thiết kế nhân vật ngay từ đầu bằng tính năng Thiết kế giọng nói: Thay thế các khối Hồ sơ âm thanh / Ghi chú của đạo diễn cũ bằng giọng nói tuỳ chỉnh được tạo trong Thiết kế giọng nói, sau đó truyền mã nhận dạng voice_... đó qua các yêu cầu TTS của bạn với chuỗi style tối thiểu hoặc trống.
  5. Tính đến đầu ra WAV (audio/wav) mặc định cho các yêu cầu đơn phương: Không giống như các mô hình TTS gemini-3.1-flash-tts-preview trở về trước (trả về PCM thô không có tiêu đề audio/l16 theo mặc định), Gemini 3.8 TTS trả về âm thanh WAV (audio/wav / AUDIO_WAV) có tiêu đề RIFF tiêu chuẩn theo mặc định cho các yêu cầu đơn phương.
    • Nếu trước đây mã của bạn đã bao bọc các byte PCM thô trong một tiêu đề WAV (ví dụ: sử dụng mô-đun wave của Python hoặc ffmpeg), hãy xoá trình bao bọc tiêu đề theo cách thủ công và ghi trực tiếp các byte được trả về vào tệp .wav.
    • Nếu quy trình của bạn yêu cầu âm thanh PCM thô không có tiêu đề, mu-law hoặc A-law, hãy đặt rõ ràng response_format thành "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") hoặc "audio/alaw" ("AUDIO_ALAW"). Hãy xem Các định dạng đầu ra âm thanh.

gemini-3.8-flash-lite-tts

Thuộc tính Mô tả
Mã kiểu máy gemini-3.8-flash-lite-tts
Các loại dữ liệu được hỗ trợ

Thông tin đầu vào

Văn bản

Đầu ra

Âm thanh

Giới hạn mã thông báo[*]

Giới hạn mã thông báo đầu vào

8.192

Giới hạn số token đầu ra

16.384

Chức năng

Tạo âm thanh

Được hỗ trợ

Lưu vào bộ nhớ đệm

Được hỗ trợ

Thực thi mã

Không được hỗ trợ

Tìm kiếm tệp

Không được hỗ trợ

Gọi hàm

Không được hỗ trợ

Neo bám vào Google Maps

Không được hỗ trợ

Tạo hình ảnh

Không được hỗ trợ

Live API

Không được hỗ trợ

Tìm trong phần liên kết thực tế

Không được hỗ trợ

Đầu ra có cấu trúc

Không được hỗ trợ

Tư duy

Không được hỗ trợ

Bối cảnh URL

Không được hỗ trợ

Các lựa chọn thưởng thức nội dung

Batch API

Được hỗ trợ

Suy luận linh hoạt

Được hỗ trợ

Suy luận mức độ ưu tiên

Được hỗ trợ

Phiên bản
Đọc các mẫu phiên bản mô hình để biết thêm thông tin chi tiết.
  • gemini-3.8-flash-lite-tts
Bản cập nhật mới nhất Tháng 7 năm 2026

Ngôn ngữ được hỗ trợ

gemini-3.8-flash-lite-tts tự động phát hiện ngôn ngữ nhập và hỗ trợ 101 ngôn ngữ:

Ngôn ngữ Ngôn ngữ Ngôn ngữ
Tiếng Aceh (Chữ Ả Rập) Tiếng Gruzia Tiếng Malta
Tiếng Hà Lan ở Nam Phi Tiếng Đức Tiếng Manipur
Tiếng Akan Tiếng Hy Lạp Tiếng Marathi
Tiếng Amhara Tiếng Gujarat Tiếng Minangkabau (chữ Ả Rập)
Tiếng Armenia Tiếng Creole ở Haiti Tiếng Mizo
Tiếng Assam Tiếng Mông Cổ Khalkha Tiếng Nepal (ngôn ngữ riêng lẻ)
Tiếng Awadhi Tiếng Hausa Tiếng Fulfulde ở Nigeria
Chữ Bali Tiếng Do Thái Tiếng Azerbaijan miền Bắc
Tiếng Bangla Tiếng Hindi Tiếng Bắc Sotho
Banjar (chữ Latinh) Tiếng Hungary Tiếng Uzbek ở miền Bắc
Tiếng Basque Tiếng Iceland Tiếng Bokmål ở Na Uy
Tiếng Belarus Tiếng Iloko Tiếng Na Uy Nynorsk
Tiếng Bhojpuri Tiếng Indonesia Tiếng Nyanja
Tiếng Bosnia Tiếng Ba Tư của người Iran Tiếng Odia (ngôn ngữ riêng lẻ)
Chữ Bugin Tiếng Ý Tiếng Ba Tư (Afghanistan)
Tiếng Bungary Tiếng Nhật Tiếng Ba Lan
Tiếng Quảng Đông Tiếng Java Tiếng Bồ Đào Nha
Tiếng Catalan Tiếng Kamba Tiếng Punjab
Tiếng Cebuano Tiếng Kannada Tiếng Rumani
Tiếng Trung Kurd Tiếng Kashmiri (Chữ Ả Rập) Tiếng Nga
Tiếng Chhattisgarhi Kashmiri (chữ Deva) Tiếng Santali
Tiếng Trung (chữ Hán) Tiếng Kazakh Tiếng Serbia
Tiếng Trung (chữ Hán phồn thể) Tiếng Khmer Tiếng Sinhala
Tiếng Croatia Tiếng Kikuyu Tiếng Slovak
Tiếng Séc Tiếng Kinyarwanda Tiếng Azerbaijan miền Nam
Tiếng Đan Mạch Tiếng Kongo Tiếng Pashto miền Nam
Tiếng Hà Lan Tiếng Hàn Tiếng Tây Ban Nha
Tiếng Ả Rập Tiếng Kyrgyz Tiếng Ả Rập chuẩn (chữ Ả Rập)
Tiếng Anh Tiếng Lào Tiếng Ả Rập chuẩn (chữ Latinh)
Tiếng Estonia Tiếng Lingala Tiếng Latvia tiêu chuẩn
Tiếng Philippines Tiếng Macedonia Tiếng Mã Lai chuẩn
Tiếng Pháp Tiếng Magahi Tiếng Tamil
Tiếng Galicia Tiếng Maithili Tiếng Telugu
Tiếng Ganda Tiếng Malayalam