Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) adalah model text-to-speech kreatif unggulan Google, yang dirancang untuk menghasilkan kualitas suara setara studio, akting yang ekspresif, aksen regional yang autentik, dan stabilitas multi-turn bentuk panjang yang sangat andal.
Ringkasan dan kemampuan
Gemini 3.8 Flash TTS menetapkan tolok ukur baru untuk pembuatan audio ekspresif:
- Fidelitas akustik tinggi dan nuansa akting: Menghasilkan rentang emosi yang kaya, irama alami, dan kepatuhan yang tepat terhadap petunjuk tingkat giliran
styledan peristiwa vokal inline (<laugh>,<sigh>,<short pause>). - Stabilitas multi-giliran panjang: Mempertahankan identitas suara, timbre, volume, dan nada ruang akustik yang konsisten di seluruh dialog yang panjang dan narasi multi-menit tanpa pergeseran suara.
- Aksen dan pengucapan regional yang autentik: Mendukung aksen regional, dialek minoritas, dan penggantian Alfabet Fonetik Internasional (IPA) inline.
- Dukungan ekosistem suara penuh: Berfungsi lancar dengan suara bawaan, Extended Voice Library (
GET /v1beta/voices), persona Desain suara kustom, dan Replikasi suara (suara yang disimpan secara persisten secara default, ditambah kunci stateless opsional). Anda juga dapat mendesain dan mereplikasi suara secara interaktif di Google AI Studio.
Buka panduan Text-to-speech untuk mengetahui cakupan lengkap fitur, praktik terbaik perintah, dan contoh kode.
Kapan harus menggunakan model TTS yang mana
Kedua model TTS Gemini 3.8 memiliki skema API dan struktur perintah yang sama. Pilih model yang sesuai dengan beban kerja Anda:
| Fitur / workload | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Kekuatan utama | Fidelitas suara maksimum, nuansa akting, dan cakupan dialek | Throughput tinggi, latensi rendah, dan efisiensi biaya |
| Kasus penggunaan terbaik | Buku audio, narasi studio, dialog multi-pembicara yang kompleks, akting dengan ledakan vokal yang berat, pengucapan yang sulit, dialek regional | Produksi volume tinggi, rangkaian agen suara real-time, fitur baca lisan, replikasi suara, pembuatan suara satu pembicara sehari-hari |
| Bahasa yang didukung | 130 bahasa | 101 bahasa |
| Pengganti yang direkomendasikan untuk | Tingkatan materi iklan unggulan baru | gemini-3.1-flash-tts-preview |
Panduan migrasi
Jika Anda melakukan migrasi dari model Gemini TTS gemini-3.1-flash-tts-preview atau yang lebih lama, perbarui permintaan Anda untuk skema Gemini 3.8 TTS:
- Memindahkan petunjuk tingkat belokan ke
speech_metadata: Gemini 3.8 TTS memperlakukan teks input secara ketat sebagai transkrip kata demi kata. Petunjuk teks inline seperti"Say cheerfully: Hello!"atau"Speaker 1: Hello!"dapat diucapkan. Memindahkan petunjuk pengiriman berkelanjutan (style) dan label pembicara (speaker) ke dalam metadata terstruktur:- Interactions API: Lampirkan anotasi dengan
"type": "speech_metadata","speaker", dan"style"ke setiap blok konten teks. - GenerateContent API: Lampirkan
"speech_metadata": {"speaker": "...", "style": "..."}ke setiappart.
- Interactions API: Lampirkan anotasi dengan
- Gunakan tag inline tanda kurung sudut hanya untuk peristiwa vokal pada satu titik waktu: Pertahankan
vokalisasi dan jeda non-ucapan sesaat dalam transkrip menggunakan
tanda kurung sudut (seperti
<laugh>,<sigh>,<cough>,<breath>, atau<short pause>). Masukkan gaya penyampaian seperti berbisik dalamspeech_metadata.style. - Tentukan
speakerdi setiap giliran dalam permintaan multi-pembicara: Setiap giliran dalam permintaan multi-pembicara harus secara eksplisit menyertakanspeakerdi dalamspeech_metadatayang cocok dengan salah satu pembicara yang dikonfigurasi. - Desain persona di awal dengan Desain suara: Ganti blok Audio
Profile / Director's Notes lama yang panjang dengan suara kustom yang dibuat di
Desain suara, lalu bawa ID
voice_...tersebut melalui permintaan TTS Anda dengan stringstyleyang minimal atau kosong. - Memperhitungkan output WAV (
audio/wav) default pada permintaan unary: Tidak seperti model TTSgemini-3.1-flash-tts-previewdan yang lebih lama (yang menampilkan PCM mentah tanpa headeraudio/l16secara default), Gemini 3.8 TTS menampilkan audio WAV (audio/wav/AUDIO_WAV) dengan header RIFF standar secara default untuk permintaan unary.- Jika kode Anda sebelumnya membungkus byte PCM mentah dalam header WAV (misalnya, menggunakan modul
wavePython atauffmpeg), hapus pembungkus header manual dan tulis byte yang ditampilkan langsung ke file.wav. - Jika pipeline Anda memerlukan audio PCM mentah tanpa header, mu-law, atau A-law,
tetapkan
response_formatsecara eksplisit ke"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW"), atau"audio/alaw"("AUDIO_ALAW"). Lihat Format output audio.
- Jika kode Anda sebelumnya membungkus byte PCM mentah dalam header WAV (misalnya, menggunakan modul
gemini-3.8-flash-tts
| Properti | Deskripsi |
|---|---|
| Kode model | gemini-3.8-flash-tts |
| Jenis data yang didukung |
Input Teks Output Audio |
| Batas token[*] |
Batas token input 8.192 Batas token output 16.384 |
| Kemampuan | Didukung Didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung Tidak didukung |
| Opsi pemakaian |
Didukung Didukung Didukung |
| Versi |
|
| Pembaruan terbaru | Juli 2026 |
Bahasa yang didukung
gemini-3.8-flash-tts mendeteksi bahasa input secara otomatis dan mendukung
130 bahasa:
| Language | Language | Language |
|---|---|---|
| Aceh (skrip Arab) | Yunani | Nepali (bahasa individu) |
| Afrika | Guarani | Fulfulde Nigeria |
| Akan | Gujarat | Azerbaijan Utara |
| Amharik | Kreol Haiti | Sotho Utara |
| Armenia | Halh Mongolia | Uzbek Utara |
| Assam | Hausa | Bokmål Norwegia |
| Awadhi | Ibrani | Nynorsk Norwegia |
| Bali | Hindi | Nyanja |
| Bangla | Hungaria | Occitan |
| Banjar (skrip Arab) | Islandia | Odia (bahasa individu) |
| Banjar (skrip Latn) | Igbo | Pangasinan |
| Bashkir | Iloko | Persia (Afganistan) |
| Basque | Indonesia | Polandia |
| Belarusia | Persia Iran | Portugis |
| Bemba | Italia | Punjabi |
| Bhojpuri | Jepang | Rumania |
| Bosnia | Jawa | Rusia |
| Bugis | Kabyle | Santali |
| Bulgaria | Kamba | Serbia |
| Burma | Kannada | Sindhi |
| Kanton | Kashmir (skrip Arab) | Sinhala |
| Katalan | Kashmir (skrip Deva) | Slovakia |
| Cebuano | Kazak | Slovenia |
| Kurdi Tengah | Khmer | Somali |
| Chhattisgarhi | Kikuyu | Azerbaijan Selatan |
| China (skrip Hans) | Kinyarwanda | Pashto Selatan |
| China (skrip Hant) | Kongo | Sotho Selatan |
| Crimean Tatar | Korea | Spanyol |
| Kroasia | Kirgiz | Arab Standar (skrip Arab) |
| Ceko | Laos | Arab Standar (skrip Latn) |
| Denmark | Latgalia | Latvia Standar |
| Belanda | Lingala | Melayu Standar |
| Dyula | Lituania | Swahili (bahasa individu) |
| Dzongkha | Luksemburg | Swati |
| Arab Mesir | Makedonia | Swedia |
| Inggris | Magahi | Tajik |
| Estonia | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finlandia | Malta | Thai |
| Prancis | Manipuri | Tigrinya |
| Galisia | Marathi | Tosk Albania |
| Ganda | Minangkabau (skrip Arab) | Uyghur |
| Georgia | Minangkabau (skrip Latn) | — |
| Jerman | Mizo | — |