Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) là mô hình chuyển văn bản sang lời nói hiệu suất cao, nhanh chóng và tiết kiệm chi phí của Google, được xây dựng để thay thế gemini-3.1-flash-tts-preview cho các khối lượng công việc sản xuất có thông lượng cao.
Tổng quan và các chức năng
TTS Gemini 3.8 Flash-Lite kết hợp độ trễ thấp với giọng nói tự nhiên, giàu biểu cảm:
- Hiệu quả thông lượng cao: Được tối ưu hoá cho việc sản xuất hàng loạt, các tầng tác nhân giọng nói đàm thoại, tính năng đọc to và khả năng tạo lời nói hằng ngày của một người nói bằng các ngôn ngữ chính.
- Khả năng tương thích với lược đồ thả và kéo: Chia sẻ chính xác lược đồ API và định dạng câu lệnh có cấu trúc giống như
gemini-3.8-flash-tts, cho phép bạn chuyển đổi mô hình chỉ bằng một thay đổi tham số. - Hỗ trợ đầy đủ hệ sinh thái giọng nói: Hỗ trợ giọng nói được tạo sẵn, Thư viện giọng nói mở rộng (
GET /v1beta/voices), các nhân vật Thiết kế giọng nói tuỳ chỉnh và Sao chép giọng nói (theo mặc định, giọng nói được lưu trữ liên tục, cộng với các khoá không trạng thái không bắt buộc). Bạn cũng có thể thiết kế và sao chép giọng nói một cách tương tác trong Google AI Studio.
Hãy tham khảo hướng dẫn về tính năng Chuyển văn bản sang lời nói để biết thông tin đầy đủ về các tính năng, các phương pháp hay nhất để đưa ra lời nhắc và ví dụ về mã.
Trường hợp nên sử dụng mô hình TTS nào
Cả hai mô hình TTS Gemini 3.8 đều dùng chung một lược đồ API và cấu trúc câu lệnh. Chọn mô hình phù hợp với khối lượng công việc của bạn:
| Tính năng / tải công việc | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Điểm mạnh chính | Thông lượng cao, độ trễ thấp và hiệu quả về chi phí | Độ trung thực tối đa về giọng nói, sắc thái diễn xuất và phạm vi giọng địa phương |
| Các trường hợp sử dụng phù hợp nhất | Sản xuất với số lượng lớn, nhiều lớp tác nhân thoại theo thời gian thực, tính năng đọc to, nhân bản giọng nói, tạo giọng nói của một người hằng ngày | Sách nói, giọng đọc chuyên nghiệp, đoạn hội thoại phức tạp có nhiều người nói, diễn xuất có nhiều đoạn thoại bật hơi, phát âm khó, phương ngữ |
| Ngôn ngữ được hỗ trợ | 101 ngôn ngữ | 130 ngôn ngữ |
| Được đề xuất thay thế cho | gemini-3.1-flash-tts-preview |
Cấp mẫu quảng cáo hàng đầu mới |
Hướng dẫn di chuyển
Nếu bạn đang nâng cấp từ gemini-3.1-flash-tts-preview lên gemini-3.8-flash-lite-tts, hãy cập nhật các yêu cầu của bạn đối với giản đồ TTS Gemini 3.8:
- Di chuyển chỉ dẫn theo từng lượt vào
speech_metadata: TTS Gemini 3.8 coi văn bản đầu vào hoàn toàn là bản chép lời nguyên văn. Các chỉ dẫn bằng văn bản nội tuyến như"Say cheerfully: Hello!"hoặc"Speaker 1: Hello!"có thể được đọc to. Di chuyển chỉ dẫn phân phối liên tục (style) và nhãn người nói (speaker) vào siêu dữ liệu có cấu trúc:- Interactions API: Đính kèm chú thích bằng
"type": "speech_metadata","speaker"và"style"vào từng khối nội dung văn bản. - GenerateContent API: Đính kèm
"speech_metadata": {"speaker": "...", "style": "..."}vào mỗipart.
- Interactions API: Đính kèm chú thích bằng
- Chỉ sử dụng thẻ nội tuyến dấu ngoặc nhọn cho các sự kiện thoại tại một thời điểm: Giữ các đoạn ngắt giọng và đoạn tạm dừng không phải lời nói trong bản chép lời bằng dấu ngoặc nhọn (chẳng hạn như
<laugh>,<sigh>,<cough>,<breath>hoặc<short pause>). Đặt các kiểu truyền đạt như thì thầm trongspeech_metadata.style. - Chỉ định
speakerở mỗi lượt trong yêu cầu có nhiều người nói: Mỗi lượt trong yêu cầu có nhiều người nói phải bao gồm rõ ràngspeakerbên trongspeech_metadatakhớp với một trong những người nói đã định cấu hình. - Thiết kế nhân vật ngay từ đầu bằng tính năng Thiết kế giọng nói: Thay thế các khối Hồ sơ âm thanh / Ghi chú của đạo diễn cũ bằng giọng nói tuỳ chỉnh được tạo trong Thiết kế giọng nói, sau đó truyền mã nhận dạng
voice_...đó qua các yêu cầu TTS của bạn với chuỗistyletối thiểu hoặc trống. - Tính đến đầu ra WAV (
audio/wav) mặc định cho các yêu cầu đơn phương: Không giống như các mô hình TTSgemini-3.1-flash-tts-previewtrở về trước (trả về PCM thô không có tiêu đềaudio/l16theo mặc định), Gemini 3.8 TTS trả về âm thanh WAV (audio/wav/AUDIO_WAV) có tiêu đề RIFF tiêu chuẩn theo mặc định cho các yêu cầu đơn phương.- Nếu trước đây mã của bạn đã bao bọc các byte PCM thô trong một tiêu đề WAV (ví dụ: sử dụng mô-đun
wavecủa Python hoặcffmpeg), hãy xoá trình bao bọc tiêu đề theo cách thủ công và ghi trực tiếp các byte được trả về vào tệp.wav. - Nếu quy trình của bạn yêu cầu âm thanh PCM thô không có tiêu đề, mu-law hoặc A-law, hãy đặt rõ ràng
response_formatthành"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") hoặc"audio/alaw"("AUDIO_ALAW"). Hãy xem Các định dạng đầu ra âm thanh.
- Nếu trước đây mã của bạn đã bao bọc các byte PCM thô trong một tiêu đề WAV (ví dụ: sử dụng mô-đun
gemini-3.8-flash-lite-tts
| Thuộc tính | Mô tả |
|---|---|
| Mã kiểu máy | gemini-3.8-flash-lite-tts |
| Các loại dữ liệu được hỗ trợ |
Thông tin đầu vào Văn bản Đầu ra Âm thanh |
| Giới hạn mã thông báo[*] |
Giới hạn mã thông báo đầu vào 8.192 Giới hạn số token đầu ra 16.384 (Giới hạn phân phát của Gemini API) |
| Chức năng | Được hỗ trợ Được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Tìm trong phần liên kết thực tế Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ |
| Các lựa chọn thưởng thức nội dung |
Được hỗ trợ Được hỗ trợ Được hỗ trợ |
| Phiên bản |
|
| Bản cập nhật mới nhất | Tháng 9 năm 2026 |
Ngôn ngữ được hỗ trợ
gemini-3.8-flash-lite-tts tự động phát hiện ngôn ngữ nhập và hỗ trợ hơn 100 ngôn ngữ:
| Ngôn ngữ | Ngôn ngữ | Ngôn ngữ |
|---|---|---|
| Tiếng Aceh (Chữ Ả Rập) | Tiếng Đức | Tiếng Manipur |
| Tiếng Hà Lan ở Nam Phi | Tiếng Hy Lạp | Tiếng Marathi |
| Tiếng Akan | Tiếng Gujarat | Tiếng Minangkabau (chữ Ả Rập) |
| Tiếng Amhara | Tiếng Creole ở Haiti | Tiếng Mizo |
| Tiếng Armenia | Tiếng Mông Cổ Khalkha | Tiếng Nepal (ngôn ngữ riêng lẻ) |
| Tiếng Assam | Tiếng Hausa | Tiếng Fulfulde ở Nigeria |
| Tiếng Awadhi | Tiếng Do Thái | Tiếng Azerbaijan miền Bắc |
| Chữ Bali | Tiếng Hindi | Tiếng Bắc Sotho |
| Tiếng Bangla | Tiếng Hungary | Tiếng Uzbek ở miền Bắc |
| Banjar (chữ Latinh) | Tiếng Iceland | Tiếng Bokmål ở Na Uy |
| Tiếng Basque | Tiếng Iloko | Tiếng Na Uy Nynorsk |
| Tiếng Belarus | Tiếng Indonesia | Tiếng Nyanja |
| Tiếng Bhojpuri | Tiếng Ba Tư của người Iran | Tiếng Odia (ngôn ngữ riêng lẻ) |
| Tiếng Bosnia | Tiếng Ý | Tiếng Ba Tư (Afghanistan) |
| Chữ Bugin | Tiếng Nhật | Tiếng Ba Lan |
| Tiếng Bungary | Tiếng Java | Tiếng Bồ Đào Nha |
| Tiếng Quảng Đông | Tiếng Kamba | Tiếng Punjab |
| Tiếng Catalan | Tiếng Kannada | Tiếng Rumani |
| Tiếng Cebuano | Tiếng Kashmiri (Chữ Ả Rập) | Tiếng Nga |
| Tiếng Trung Kurd | Kashmiri (chữ Deva) | Tiếng Santali |
| Tiếng Chhattisgarhi | Tiếng Kazakh | Tiếng Serbia |
| Tiếng Trung (chữ Hán) | Tiếng Khmer | Tiếng Sinhala |
| Tiếng Trung (chữ Hán phồn thể) | Tiếng Kikuyu | Tiếng Slovak |
| Tiếng Croatia | Tiếng Kinyarwanda | Tiếng Azerbaijan miền Nam |
| Tiếng Séc | Tiếng Kongo | Tiếng Pashto miền Nam |
| Tiếng Đan Mạch | Tiếng Hàn | Tiếng Tây Ban Nha |
| Tiếng Hà Lan | Tiếng Kyrgyz | Tiếng Ả Rập chuẩn (chữ Ả Rập) |
| Tiếng Ả Rập | Tiếng Lào | Tiếng Ả Rập chuẩn (chữ Latinh) |
| Tiếng Anh | Tiếng Lingala | Tiếng Latvia tiêu chuẩn |
| Tiếng Estonia | Tiếng Macedonia | Tiếng Mã Lai chuẩn |
| Tiếng Philippines | Tiếng Magahi | Tiếng Tamil |
| Tiếng Pháp | Tiếng Maithili | Tiếng Telugu |
| Tiếng Galicia | Tiếng Malayalam | Tiếng Thổ Nhĩ Kỳ |
| Tiếng Ganda | Tiếng Malta | Tiếng Việt |
| Tiếng Gruzia | — | — |