Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) adalah model text-to-speech kreatif unggulan Google, yang dirancang untuk menghasilkan kualitas suara setara studio, akting yang ekspresif, aksen regional yang autentik, dan stabilitas multi-turn bentuk panjang yang sangat andal.
Ringkasan dan kemampuan
Gemini 3.8 Flash TTS menetapkan tolok ukur baru untuk pembuatan audio ekspresif:
- Fidelitas akustik dan nuansa akting yang tinggi: Menghasilkan rentang emosi yang kaya, irama alami, dan kepatuhan yang tepat terhadap petunjuk tingkat giliran bicara
styledan peristiwa vokal inline (<laugh>,<sigh>,<short pause>). - Stabilitas multi-giliran panjang: Mempertahankan identitas suara, timbre, volume, dan nada ruang akustik yang konsisten di seluruh dialog yang panjang dan narasi multi-menit tanpa pergeseran suara.
- Aksen dan pengucapan regional yang autentik: Mendukung aksen regional dan dialek minoritas.
- Dukungan ekosistem suara penuh: Berfungsi lancar dengan suara bawaan, persona Desain suara kustom, dan Replikasi suara (suara yang disimpan secara persisten secara default, ditambah kunci stateless opsional) dari Extended Voice Library (
GET /v1beta/voices). Anda juga dapat mendesain dan mereplikasi suara secara interaktif di Google AI Studio.
Buka panduan Text-to-speech untuk mengetahui cakupan lengkap fitur, praktik terbaik perintah, dan contoh kode.
Kapan harus menggunakan model TTS yang mana
Kedua model TTS Gemini 3.8 memiliki skema API dan struktur perintah yang sama. Pilih model yang sesuai dengan beban kerja Anda:
| Fitur / workload | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Kekuatan utama | Fidelitas suara maksimum, nuansa akting, dan cakupan dialek | Throughput tinggi, latensi rendah, dan efisiensi biaya |
| Kasus penggunaan terbaik | Buku audio, narasi studio, dialog multi-pembicara yang kompleks, akting dengan ledakan vokal yang berat, pengucapan yang sulit, dialek regional | Produksi volume tinggi, rangkaian agen suara real-time, fitur baca lisan, replikasi suara, pembuatan suara tunggal sehari-hari |
| Bahasa yang didukung | 130 bahasa | 101 bahasa |
| Pengganti yang direkomendasikan untuk | Tingkatan materi iklan unggulan baru | gemini-3.1-flash-tts-preview |
Panduan migrasi
Jika Anda melakukan migrasi dari model Gemini TTS gemini-3.1-flash-tts-preview atau yang lebih lama, perbarui permintaan Anda untuk skema Gemini 3.8 TTS:
- Memindahkan petunjuk tingkat belokan ke
speech_metadata: Gemini 3.8 TTS memperlakukan teks input secara ketat sebagai transkrip kata demi kata. Petunjuk teks inline seperti"Say cheerfully: Hello!"atau"Speaker 1: Hello!"dapat dibacakan. Memindahkan petunjuk pengiriman berkelanjutan (style) dan label pembicara (speaker) ke dalam metadata terstruktur:- Interactions API: Lampirkan anotasi dengan
"type": "speech_metadata","speaker", dan"style"ke setiap blok konten teks. - GenerateContent API: Lampirkan
"speech_metadata": {"speaker": "...", "style": "..."}ke setiappart.
- Interactions API: Lampirkan anotasi dengan
- Gunakan tag inline tanda kurung sudut hanya untuk peristiwa vokal pada satu titik waktu: Pertahankan
vokalisasi non-ucapan dan jeda sesaat secara inline dalam transkrip menggunakan
tanda kurung sudut (seperti
<laugh>,<sigh>,<cough>,<breath>, atau<short pause>). Masukkan gaya penyampaian seperti berbisik dalamspeech_metadata.style. - Tentukan
speakerdi setiap giliran dalam permintaan multi-pembicara: Setiap giliran dalam permintaan multi-pembicara harus secara eksplisit menyertakanspeakerdi dalamspeech_metadatayang cocok dengan salah satu pembicara yang dikonfigurasi. - Desain persona di awal dengan Desain suara: Ganti blok Catatan Audio / Sutradara lama yang panjang dengan suara kustom yang dibuat di Desain suara, lalu bawa ID
voice_...tersebut melalui permintaan TTS Anda dengan stringstyleminimal atau kosong. - Memperhitungkan output WAV (
audio/wav) default pada permintaan unary: Tidak seperti model TTSgemini-3.1-flash-tts-previewdan yang lebih lama (yang menampilkan PCM mentah tanpa headeraudio/l16secara default), Gemini 3.8 TTS menampilkan audio WAV (audio/wav/AUDIO_WAV) dengan header RIFF standar secara default untuk permintaan unary.- Jika kode Anda sebelumnya membungkus byte PCM mentah dalam header WAV (misalnya, menggunakan modul
wavePython atauffmpeg), hapus pembungkus header manual dan tulis byte yang ditampilkan langsung ke file.wav. - Jika pipeline Anda memerlukan audio PCM mentah tanpa header, mu-law, atau A-law,
tetapkan
response_format.mime_typesecara eksplisit ke"audio/l16","audio/mulaw", atau"audio/alaw"(misalnya,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}di Interactions API, atauAUDIO_L16,AUDIO_MULAW, atauAUDIO_ALAWdigenerateContent). Lihat Format output audio.
- Jika kode Anda sebelumnya membungkus byte PCM mentah dalam header WAV (misalnya, menggunakan modul
gemini-3.8-flash-tts
| Properti | Deskripsi |
|---|---|
| Kode model | gemini-3.8-flash-tts |
| Jenis data yang didukung |
Input Teks Output Audio |
| Batas token[*] |
Batas token input 8.192 Batas token output 16.384 (batas penayangan Gemini API) |
| Kemampuan | Didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung |
| Opsi pemakaian |
Didukung Didukung Didukung |
| Versi |
|
| Pembaruan terbaru | September 2026 |
Bahasa yang didukung
gemini-3.8-flash-tts mendeteksi bahasa input secara otomatis dan mendukung
lebih dari 130 bahasa:
| Language | Language | Language |
|---|---|---|
| Aceh (skrip Arab) | Yunani | Nepali (bahasa individu) |
| Afrika | Guarani | Fulfulde Nigeria |
| Akan | Gujarat | Azerbaijan Utara |
| Amharik | Kreol Haiti | Sotho Utara |
| Armenia | Halh Mongolia | Uzbek Utara |
| Assam | Hausa | Bokmål Norwegia |
| Awadhi | Ibrani | Nynorsk Norwegia |
| Bali | Hindi | Nyanja |
| Bangla | Hungaria | Occitan |
| Banjar (skrip Arab) | Islandia | Odia (bahasa individu) |
| Banjar (Skrip Latn) | Igbo | Pangasinan |
| Bashkir | Iloko | Persia (Afganistan) |
| Basque | Indonesia | Polandia |
| Belarusian | Persia Iran | Portugis |
| Bemba | Italia | Punjabi |
| Bhojpuri | Jepang | Rumania |
| Bosnia | Jawa | Rusia |
| Bugis | Kabyle | Santali |
| Bulgaria | Kamba | Serbia |
| Burma | Kannada | Sindhi |
| Kanton | Kashmir (skrip Arab) | Sinhala |
| Katalan | Kashmir (skrip Deva) | Slovakia |
| Cebuano | Kazak | Slovenia |
| Kurdi Tengah | Khmer | Somali |
| Chhattisgarhi | Kikuyu | Azerbaijan Selatan |
| China (skrip Hans) | Kinyarwanda | Pashto Selatan |
| China (skrip Hant) | Kongo | Sotho Selatan |
| Crimean Tatar | Korea | Spanyol |
| Kroasia | Kirgiz | Bahasa Arab Standar (skrip Arab) |
| Ceko | Laos | Arab Standar (skrip Latn) |
| Denmark | Latgalia | Latvia Standar |
| Belanda | Lingala | Melayu Standar |
| Dyula | Lituania | Swahili (bahasa individu) |
| Dzongkha | Luksemburg | Swati |
| Arab Mesir | Makedonia | Swedia |
| Inggris | Magahi | Tajik |
| Estonia | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finlandia | Malta | Thai |
| Prancis | Manipuri | Tigrinya |
| Galisia | Marathi | Tosk Albania |
| Ganda | Minangkabau (skrip Arab) | Turki |
| Georgia | Minangkabau (skrip Latn) | Uyghur |
| Jerman | Mizo | Vietnam |