Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) là mô hình chuyển văn bản sang lời nói sáng tạo hàng đầu của Google, được thiết kế để mang đến giọng nói chân thực như trong phòng thu, khả năng diễn đạt biểu cảm, giọng địa phương chân thực và độ ổn định cao khi thực hiện nhiều lượt tương tác dài.

Tổng quan và các chức năng

Công nghệ TTS Gemini 3.8 Flash đặt ra một tiêu chuẩn mới cho việc tạo âm thanh giàu biểu cảm:

  • Độ trung thực cao về âm thanh và sắc thái diễn xuất: Truyền tải nhiều cảm xúc, nhịp điệu tự nhiên và tuân thủ chính xác các chỉ dẫn ở cấp độ lượt lời style và các sự kiện thoại nội tuyến (<laugh>, <sigh>, <short pause>).
  • Tính ổn định của nhiều lượt tương tác dài: Duy trì giọng nói, âm sắc, âm lượng và âm thanh phòng nhất quán trong các đoạn hội thoại dài và lời tường thuật kéo dài nhiều phút mà không bị lệch giọng.
  • Chất giọng và cách phát âm bản địa chân thực: Hỗ trợ chất giọng bản địa và phương ngữ của các nhóm thiểu số.
  • Hỗ trợ đầy đủ hệ sinh thái giọng nói: Hoạt động liền mạch với các giọng nói được tạo sẵn, Thư viện giọng nói mở rộng (GET /v1beta/voices), các nhân vật Thiết kế giọng nói tuỳ chỉnh và tính năng Sao chép giọng nói (theo mặc định, các giọng nói được lưu trữ liên tục, cộng với các khoá không trạng thái không bắt buộc). Bạn cũng có thể thiết kế và sao chép giọng nói một cách tương tác trong Google AI Studio.

Hãy tham khảo hướng dẫn về tính năng Chuyển văn bản sang lời nói để biết thông tin đầy đủ về các tính năng, các phương pháp hay nhất để đưa ra lời nhắc và ví dụ về mã.

Trường hợp nên sử dụng mô hình TTS nào

Cả hai mô hình TTS Gemini 3.8 đều dùng chung một lược đồ API và cấu trúc câu lệnh. Chọn mô hình phù hợp với khối lượng công việc của bạn:

Tính năng / tải công việc Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Điểm mạnh chính Độ trung thực tối đa về giọng nói, sắc thái diễn xuất và phạm vi giọng địa phương Thông lượng cao, độ trễ thấp và hiệu quả về chi phí
Các trường hợp sử dụng phù hợp nhất Sách nói, giọng đọc chuyên nghiệp, đoạn hội thoại phức tạp có nhiều người nói, diễn xuất có nhiều đoạn thoại bật hơi, phát âm khó, phương ngữ Sản xuất với số lượng lớn, nhiều lớp tác nhân thoại theo thời gian thực, tính năng đọc to, nhân bản giọng nói, tạo giọng nói của một người hằng ngày
Ngôn ngữ được hỗ trợ 130 ngôn ngữ 101 ngôn ngữ
Được đề xuất thay thế cho Cấp mẫu quảng cáo hàng đầu mới gemini-3.1-flash-tts-preview

Hướng dẫn di chuyển

Nếu bạn đang di chuyển từ gemini-3.1-flash-tts-preview hoặc các mô hình TTS Gemini cũ hơn, hãy cập nhật các yêu cầu của bạn đối với giản đồ TTS Gemini 3.8:

  1. Di chuyển chỉ dẫn theo từng lượt vào speech_metadata: TTS Gemini 3.8 coi văn bản đầu vào hoàn toàn là bản chép lời nguyên văn. Các chỉ dẫn bằng văn bản nội tuyến như "Say cheerfully: Hello!" hoặc "Speaker 1: Hello!" có thể được đọc to. Di chuyển chỉ dẫn phân phối liên tục (style) và nhãn người nói (speaker) vào siêu dữ liệu có cấu trúc:
    • Interactions API: Đính kèm chú thích bằng "type": "speech_metadata", "speaker" và "style" vào từng khối nội dung văn bản.
    • GenerateContent API: Đính kèm "speech_metadata": {"speaker": "...", "style": "..."} vào mỗi part.
  2. Chỉ sử dụng thẻ nội tuyến dấu ngoặc nhọn cho các sự kiện thoại tại một thời điểm: Giữ các đoạn ngắt giọng và đoạn tạm dừng không phải lời nói trong bản chép lời bằng dấu ngoặc nhọn (chẳng hạn như <laugh>, <sigh>, <cough>, <breath> hoặc <short pause>). Đặt các kiểu truyền đạt như thì thầm trong speech_metadata.style.
  3. Chỉ định speaker ở mỗi lượt trong yêu cầu có nhiều người nói: Mỗi lượt trong yêu cầu có nhiều người nói phải bao gồm rõ ràng speaker bên trong speech_metadata khớp với một trong những người nói đã định cấu hình.
  4. Thiết kế nhân vật ngay từ đầu bằng tính năng Thiết kế giọng nói: Thay thế các khối Hồ sơ âm thanh / Ghi chú của đạo diễn cũ bằng giọng nói tuỳ chỉnh được tạo trong Thiết kế giọng nói, sau đó truyền mã nhận dạng voice_... đó qua các yêu cầu TTS của bạn với chuỗi style tối thiểu hoặc trống.
  5. Tính đến đầu ra WAV (audio/wav) mặc định cho các yêu cầu đơn phương: Không giống như các mô hình TTS gemini-3.1-flash-tts-preview trở về trước (trả về PCM thô không có tiêu đề audio/l16 theo mặc định), Gemini 3.8 TTS trả về âm thanh WAV (audio/wav / AUDIO_WAV) có tiêu đề RIFF tiêu chuẩn theo mặc định cho các yêu cầu đơn phương.
    • Nếu trước đây mã của bạn đã bao bọc các byte PCM thô trong một tiêu đề WAV (ví dụ: sử dụng mô-đun wave của Python hoặc ffmpeg), hãy xoá trình bao bọc tiêu đề theo cách thủ công và ghi trực tiếp các byte được trả về vào tệp .wav.
    • Nếu quy trình của bạn yêu cầu âm thanh PCM thô không có tiêu đề, mu-law hoặc A-law, hãy đặt rõ ràng response_format thành "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") hoặc "audio/alaw" ("AUDIO_ALAW"). Hãy xem Các định dạng đầu ra âm thanh.

gemini-3.8-flash-tts

Thuộc tính Mô tả
Mã kiểu máy gemini-3.8-flash-tts
Các loại dữ liệu được hỗ trợ

Thông tin đầu vào

Văn bản

Đầu ra

Âm thanh

Giới hạn mã thông báo[*]

Giới hạn mã thông báo đầu vào

8.192

Giới hạn số token đầu ra

16.384 (Giới hạn phân phát của Gemini API)

Chức năng

Tạo âm thanh

Được hỗ trợ

Lưu vào bộ nhớ đệm

Được hỗ trợ

Thực thi mã

Không được hỗ trợ

Tìm kiếm tệp

Không được hỗ trợ

Gọi hàm

Không được hỗ trợ

Neo bám vào Google Maps

Không được hỗ trợ

Tạo hình ảnh

Không được hỗ trợ

Live API

Không được hỗ trợ

Tìm trong phần liên kết thực tế

Không được hỗ trợ

Đầu ra có cấu trúc

Không được hỗ trợ

Tư duy

Không được hỗ trợ

Bối cảnh URL

Không được hỗ trợ

Các lựa chọn thưởng thức nội dung

Batch API

Được hỗ trợ

Suy luận linh hoạt

Được hỗ trợ

Suy luận mức độ ưu tiên

Được hỗ trợ

Phiên bản
Đọc các mẫu phiên bản mô hình để biết thêm thông tin chi tiết.
  • gemini-3.8-flash-tts
Bản cập nhật mới nhất Tháng 9 năm 2026

Ngôn ngữ được hỗ trợ

gemini-3.8-flash-tts tự động phát hiện ngôn ngữ nhập và hỗ trợ 130 ngôn ngữ:

Ngôn ngữ Ngôn ngữ Ngôn ngữ
Tiếng Aceh (Chữ Ả Rập) Tiếng Hy Lạp Tiếng Nepal (ngôn ngữ riêng lẻ)
Tiếng Hà Lan ở Nam Phi Tiếng Guarani Tiếng Fulfulde ở Nigeria
Tiếng Akan Tiếng Gujarat Tiếng Azerbaijan miền Bắc
Tiếng Amhara Tiếng Creole ở Haiti Tiếng Bắc Sotho
Tiếng Armenia Tiếng Mông Cổ Khalkha Tiếng Uzbek ở miền Bắc
Tiếng Assam Tiếng Hausa Tiếng Bokmål ở Na Uy
Tiếng Awadhi Tiếng Do Thái Tiếng Na Uy Nynorsk
Chữ Bali Tiếng Hindi Tiếng Nyanja
Tiếng Bangla Tiếng Hungary Tiếng Occitan
Banjar (chữ Ả Rập) Tiếng Iceland Tiếng Odia (ngôn ngữ riêng lẻ)
Banjar (chữ Latinh) Tiếng Igbo Tiếng Pangasinan
Tiếng Bashkir Tiếng Iloko Tiếng Ba Tư (Afghanistan)
Tiếng Basque Tiếng Indonesia Tiếng Ba Lan
Tiếng Belarus Tiếng Ba Tư của người Iran Tiếng Bồ Đào Nha
Tiếng Bemba Tiếng Ý Tiếng Punjab
Tiếng Bhojpuri Tiếng Nhật Tiếng Rumani
Tiếng Bosnia Tiếng Java Tiếng Nga
Chữ Bugin Tiếng Kabyle Tiếng Santali
Tiếng Bungary Tiếng Kamba Tiếng Serbia
Tiếng Miến Điện Tiếng Kannada Tiếng Sindh
Tiếng Quảng Đông Tiếng Kashmiri (Chữ Ả Rập) Tiếng Sinhala
Tiếng Catalan Kashmiri (chữ Deva) Tiếng Slovak
Tiếng Cebuano Tiếng Kazakh Tiếng Slovenia
Tiếng Trung Kurd Tiếng Khmer Tiếng Somali
Tiếng Chhattisgarhi Tiếng Kikuyu Tiếng Azerbaijan miền Nam
Tiếng Trung (chữ Hán) Tiếng Kinyarwanda Tiếng Pashto miền Nam
Tiếng Trung (chữ Hán phồn thể) Tiếng Kongo Tiếng Nam Sotho
Tiếng Tatar Krym Tiếng Hàn Tiếng Tây Ban Nha
Tiếng Croatia Tiếng Kyrgyz Tiếng Ả Rập chuẩn (chữ Ả Rập)
Tiếng Séc Tiếng Lào Tiếng Ả Rập chuẩn (chữ Latinh)
Tiếng Đan Mạch Tiếng Latgale Tiếng Latvia tiêu chuẩn
Tiếng Hà Lan Tiếng Lingala Tiếng Mã Lai chuẩn
Dyula Tiếng Lithuania Tiếng Swahili (ngôn ngữ riêng lẻ)
Tiếng Dzongkha Tiếng Luxembourg Tiếng Swati
Tiếng Ả Rập Tiếng Macedonia Tiếng Thuỵ Điển
Tiếng Anh Tiếng Magahi Tiếng Tajik
Tiếng Estonia Tiếng Maithili Tiếng Tamil
Tiếng Philippines Tiếng Malayalam Tiếng Telugu
Tiếng Phần Lan Tiếng Malta Tiếng Thái
Tiếng Pháp Tiếng Manipur Tiếng Tigrinya
Tiếng Galicia Tiếng Marathi Tiếng Albania ở vùng Tosk
Tiếng Ganda Tiếng Minangkabau (chữ Ả Rập) Tiếng Duy Ngô Nhĩ
Tiếng Gruzia Tiếng Minangkabau (chữ Latinh) —
Tiếng Đức Tiếng Mizo —