Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) là mô hình chuyển văn bản sang lời nói hiệu suất cao, nhanh chóng và tiết kiệm chi phí của Google, được xây dựng để thay thế gemini-3.1-flash-tts-preview cho các khối lượng công việc sản xuất có thông lượng cao.
Tổng quan và các chức năng
TTS Gemini 3.8 Flash-Lite kết hợp độ trễ thấp với giọng nói tự nhiên, giàu biểu cảm:
- Hiệu quả thông lượng cao: Được tối ưu hoá cho việc sản xuất hàng loạt, các tầng tác nhân giọng nói đàm thoại, tính năng đọc to và khả năng tạo lời nói hằng ngày của một người nói bằng các ngôn ngữ chính.
- Khả năng tương thích với lược đồ thả và kéo: Chia sẻ chính xác lược đồ API và định dạng câu lệnh có cấu trúc giống như
gemini-3.8-flash-tts, cho phép bạn chuyển đổi mô hình chỉ bằng một thay đổi tham số. - Hỗ trợ đầy đủ hệ sinh thái giọng nói: Hỗ trợ giọng nói được tạo sẵn, Thư viện giọng nói mở rộng (
GET /v1beta/voices), các nhân vật Thiết kế giọng nói tuỳ chỉnh và Sao chép giọng nói (theo mặc định, giọng nói được lưu trữ liên tục, cộng với các khoá không trạng thái không bắt buộc). Bạn cũng có thể thiết kế và sao chép giọng nói một cách tương tác trong Google AI Studio.
Hãy tham khảo hướng dẫn về tính năng Chuyển văn bản sang lời nói để biết thông tin đầy đủ về các tính năng, các phương pháp hay nhất để đưa ra câu lệnh và ví dụ về mã.
Trường hợp nên sử dụng mô hình TTS nào
Cả hai mô hình TTS Gemini 3.8 đều dùng chung một lược đồ API và cấu trúc câu lệnh. Chọn mô hình phù hợp với khối lượng công việc của bạn:
| Tính năng / tải công việc | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Sức mạnh chính | Thông lượng cao, độ trễ thấp và hiệu quả về chi phí | Độ trung thực tối đa về giọng nói, sắc thái diễn xuất và phạm vi giọng địa phương |
| Các trường hợp sử dụng phù hợp nhất | Sản xuất với số lượng lớn, nhiều lớp tác nhân thoại theo thời gian thực, tính năng đọc to, nhân bản giọng nói, tạo giọng nói của một người hằng ngày | Sách nói, giọng đọc chuyên nghiệp, đoạn hội thoại phức tạp của nhiều người, diễn xuất có nhiều đoạn thoại, phát âm khó, phương ngữ |
| Ngôn ngữ được hỗ trợ | 101 ngôn ngữ | 130 ngôn ngữ |
| Được đề xuất thay thế cho | gemini-3.1-flash-tts-preview |
Cấp mẫu quảng cáo hàng đầu mới |
Hướng dẫn di chuyển
Nếu bạn đang nâng cấp từ gemini-3.1-flash-tts-preview lên gemini-3.8-flash-lite-tts, hãy cập nhật các yêu cầu của bạn đối với giản đồ TTS Gemini 3.8:
- Di chuyển chỉ dẫn theo từng lượt vào
speech_metadata: TTS Gemini 3.8 coi văn bản đầu vào hoàn toàn là bản chép lời nguyên văn. Các chỉ dẫn bằng văn bản nội tuyến như"Say cheerfully: Hello!"hoặc"Speaker 1: Hello!"có thể được đọc to. Di chuyển chỉ dẫn phân phối liên tục (style) và nhãn người nói (speaker) vào siêu dữ liệu có cấu trúc:- Interactions API: Đính kèm chú thích bằng
"type": "speech_metadata","speaker"và"style"vào từng khối nội dung văn bản. - GenerateContent API: Đính kèm
"speech_metadata": {"speaker": "...", "style": "..."}vào mỗipart.
- Interactions API: Đính kèm chú thích bằng
- Chỉ sử dụng thẻ nội tuyến dấu ngoặc nhọn cho các sự kiện thoại tại một thời điểm: Giữ các đoạn ngắt giọng và đoạn tạm dừng không phải lời nói trong bản chép lời bằng dấu ngoặc nhọn (chẳng hạn như
<laugh>,<sigh>,<cough>,<breath>hoặc<short pause>). Đặt các kiểu truyền đạt như thì thầm trongspeech_metadata.style. - Chỉ định
speakerở mỗi lượt trong yêu cầu có nhiều người nói: Mỗi lượt trong yêu cầu có nhiều người nói phải bao gồm rõ ràngspeakerbên trongspeech_metadatakhớp với một trong những người nói đã định cấu hình. - Thiết kế nhân vật ngay từ đầu bằng tính năng Thiết kế giọng nói: Thay thế các khối Hồ sơ âm thanh / Ghi chú của đạo diễn cũ bằng giọng nói tuỳ chỉnh được tạo trong Thiết kế giọng nói, sau đó truyền mã nhận dạng
voice_...đó qua các yêu cầu TTS của bạn với chuỗistyletối thiểu hoặc trống. - Tính đến đầu ra WAV (
audio/wav) mặc định cho các yêu cầu đơn phương: Không giống như các mô hình TTSgemini-3.1-flash-tts-previewtrở về trước (trả về PCM thô không có tiêu đềaudio/l16theo mặc định), Gemini 3.8 TTS trả về âm thanh WAV (audio/wav/AUDIO_WAV) có tiêu đề RIFF tiêu chuẩn theo mặc định cho các yêu cầu đơn phương.- Nếu trước đây mã của bạn đã bao bọc các byte PCM thô trong một tiêu đề WAV (ví dụ: sử dụng mô-đun
wavecủa Python hoặcffmpeg), hãy xoá trình bao bọc tiêu đề theo cách thủ công và ghi trực tiếp các byte được trả về vào tệp.wav. - Nếu quy trình của bạn yêu cầu âm thanh PCM thô không có tiêu đề, mu-law hoặc A-law, hãy đặt rõ ràng
response_formatthành"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") hoặc"audio/alaw"("AUDIO_ALAW"). Hãy xem Các định dạng đầu ra âm thanh.
- Nếu trước đây mã của bạn đã bao bọc các byte PCM thô trong một tiêu đề WAV (ví dụ: sử dụng mô-đun
gemini-3.8-flash-lite-tts
| Thuộc tính | Mô tả |
|---|---|
| Mã kiểu máy | gemini-3.8-flash-lite-tts |
| Các loại dữ liệu được hỗ trợ |
Thông tin đầu vào Văn bản Đầu ra Âm thanh |
| Giới hạn mã thông báo[*] |
Giới hạn mã thông báo đầu vào 8.192 Giới hạn số token đầu ra 16.384 |
| Chức năng | Được hỗ trợ Được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Tìm trong phần liên kết thực tế Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ Không được hỗ trợ |
| Các lựa chọn thưởng thức nội dung |
Được hỗ trợ Được hỗ trợ Được hỗ trợ |
| Phiên bản |
|
| Bản cập nhật mới nhất | Tháng 7 năm 2026 |
Ngôn ngữ được hỗ trợ
gemini-3.8-flash-lite-tts tự động phát hiện ngôn ngữ nhập và hỗ trợ 101 ngôn ngữ:
| Ngôn ngữ | Ngôn ngữ | Ngôn ngữ |
|---|---|---|
| Tiếng Aceh (Chữ Ả Rập) | Tiếng Gruzia | Tiếng Malta |
| Tiếng Hà Lan ở Nam Phi | Tiếng Đức | Tiếng Manipur |
| Tiếng Akan | Tiếng Hy Lạp | Tiếng Marathi |
| Tiếng Amhara | Tiếng Gujarat | Tiếng Minangkabau (chữ Ả Rập) |
| Tiếng Armenia | Tiếng Creole ở Haiti | Tiếng Mizo |
| Tiếng Assam | Tiếng Mông Cổ Khalkha | Tiếng Nepal (ngôn ngữ riêng lẻ) |
| Tiếng Awadhi | Tiếng Hausa | Tiếng Fulfulde ở Nigeria |
| Chữ Bali | Tiếng Do Thái | Tiếng Azerbaijan miền Bắc |
| Tiếng Bangla | Tiếng Hindi | Tiếng Bắc Sotho |
| Banjar (chữ Latinh) | Tiếng Hungary | Tiếng Uzbek ở miền Bắc |
| Tiếng Basque | Tiếng Iceland | Tiếng Bokmål ở Na Uy |
| Tiếng Belarus | Tiếng Iloko | Tiếng Na Uy Nynorsk |
| Tiếng Bhojpuri | Tiếng Indonesia | Tiếng Nyanja |
| Tiếng Bosnia | Tiếng Ba Tư của người Iran | Tiếng Odia (ngôn ngữ riêng lẻ) |
| Chữ Bugin | Tiếng Ý | Tiếng Ba Tư (Afghanistan) |
| Tiếng Bungary | Tiếng Nhật | Tiếng Ba Lan |
| Tiếng Quảng Đông | Tiếng Java | Tiếng Bồ Đào Nha |
| Tiếng Catalan | Tiếng Kamba | Tiếng Punjab |
| Tiếng Cebuano | Tiếng Kannada | Tiếng Rumani |
| Tiếng Trung Kurd | Tiếng Kashmiri (Chữ Ả Rập) | Tiếng Nga |
| Tiếng Chhattisgarhi | Kashmiri (chữ Deva) | Tiếng Santali |
| Tiếng Trung (chữ Hán) | Tiếng Kazakh | Tiếng Serbia |
| Tiếng Trung (chữ Hán phồn thể) | Tiếng Khmer | Tiếng Sinhala |
| Tiếng Croatia | Tiếng Kikuyu | Tiếng Slovak |
| Tiếng Séc | Tiếng Kinyarwanda | Tiếng Azerbaijan miền Nam |
| Tiếng Đan Mạch | Tiếng Kongo | Tiếng Pashto miền Nam |
| Tiếng Hà Lan | Tiếng Hàn | Tiếng Tây Ban Nha |
| Tiếng Ả Rập | Tiếng Kyrgyz | Tiếng Ả Rập chuẩn (chữ Ả Rập) |
| Tiếng Anh | Tiếng Lào | Tiếng Ả Rập chuẩn (chữ Latinh) |
| Tiếng Estonia | Tiếng Lingala | Tiếng Latvia tiêu chuẩn |
| Tiếng Philippines | Tiếng Macedonia | Tiếng Mã Lai chuẩn |
| Tiếng Pháp | Tiếng Magahi | Tiếng Tamil |
| Tiếng Galicia | Tiếng Maithili | Tiếng Telugu |
| Tiếng Ganda | Tiếng Malayalam | — |