Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) adalah model text-to-speech kreatif unggulan Google, yang dirancang untuk menghasilkan kualitas suara setara studio, akting yang ekspresif, aksen regional yang autentik, dan stabilitas multi-turn bentuk panjang yang sangat andal.

Ringkasan dan kemampuan

Gemini 3.8 Flash TTS menetapkan tolok ukur baru untuk pembuatan audio ekspresif:

  • Fidelitas akustik dan nuansa akting yang tinggi: Menghasilkan rentang emosi yang kaya, irama alami, dan kepatuhan yang tepat terhadap petunjuk tingkat giliran bicara style dan peristiwa vokal inline (<laugh>, <sigh>, <short pause>).
  • Stabilitas multi-giliran panjang: Mempertahankan identitas suara, timbre, volume, dan nada ruang akustik yang konsisten di seluruh dialog yang panjang dan narasi multi-menit tanpa pergeseran suara.
  • Aksen dan pengucapan regional yang autentik: Mendukung aksen regional dan dialek minoritas.
  • Dukungan ekosistem suara penuh: Berfungsi lancar dengan suara bawaan, persona Desain suara kustom, dan Replikasi suara (suara yang disimpan secara persisten secara default, ditambah kunci stateless opsional) dari Extended Voice Library (GET /v1beta/voices). Anda juga dapat mendesain dan mereplikasi suara secara interaktif di Google AI Studio.

Buka panduan Text-to-speech untuk mengetahui cakupan lengkap fitur, praktik terbaik perintah, dan contoh kode.

Kapan harus menggunakan model TTS yang mana

Kedua model TTS Gemini 3.8 memiliki skema API dan struktur perintah yang sama. Pilih model yang sesuai dengan beban kerja Anda:

Fitur / workload Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Kekuatan utama Fidelitas suara maksimum, nuansa akting, dan cakupan dialek Throughput tinggi, latensi rendah, dan efisiensi biaya
Kasus penggunaan terbaik Buku audio, narasi studio, dialog multi-pembicara yang kompleks, akting dengan ledakan vokal yang berat, pengucapan yang sulit, dialek regional Produksi volume tinggi, rangkaian agen suara real-time, fitur baca lisan, replikasi suara, pembuatan suara tunggal sehari-hari
Bahasa yang didukung 130 bahasa 101 bahasa
Pengganti yang direkomendasikan untuk Tingkatan materi iklan unggulan baru gemini-3.1-flash-tts-preview

Panduan migrasi

Jika Anda melakukan migrasi dari model Gemini TTS gemini-3.1-flash-tts-preview atau yang lebih lama, perbarui permintaan Anda untuk skema Gemini 3.8 TTS:

  1. Memindahkan petunjuk tingkat belokan ke speech_metadata: Gemini 3.8 TTS memperlakukan teks input secara ketat sebagai transkrip kata demi kata. Petunjuk teks inline seperti "Say cheerfully: Hello!" atau "Speaker 1: Hello!" dapat dibacakan. Memindahkan petunjuk pengiriman berkelanjutan (style) dan label pembicara (speaker) ke dalam metadata terstruktur:
    • Interactions API: Lampirkan anotasi dengan "type": "speech_metadata", "speaker", dan "style" ke setiap blok konten teks.
    • GenerateContent API: Lampirkan "speech_metadata": {"speaker": "...", "style": "..."} ke setiap part.
  2. Gunakan tag inline tanda kurung sudut hanya untuk peristiwa vokal pada satu titik waktu: Pertahankan vokalisasi non-ucapan dan jeda sesaat secara inline dalam transkrip menggunakan tanda kurung sudut (seperti <laugh>, <sigh>, <cough>, <breath>, atau <short pause>). Masukkan gaya penyampaian seperti berbisik dalam speech_metadata.style.
  3. Tentukan speaker di setiap giliran dalam permintaan multi-pembicara: Setiap giliran dalam permintaan multi-pembicara harus secara eksplisit menyertakan speaker di dalam speech_metadata yang cocok dengan salah satu pembicara yang dikonfigurasi.
  4. Desain persona di awal dengan Desain suara: Ganti blok Catatan Audio / Sutradara lama yang panjang dengan suara kustom yang dibuat di Desain suara, lalu bawa ID voice_... tersebut melalui permintaan TTS Anda dengan string style minimal atau kosong.
  5. Memperhitungkan output WAV (audio/wav) default pada permintaan unary: Tidak seperti model TTS gemini-3.1-flash-tts-preview dan yang lebih lama (yang menampilkan PCM mentah tanpa header audio/l16 secara default), Gemini 3.8 TTS menampilkan audio WAV (audio/wav / AUDIO_WAV) dengan header RIFF standar secara default untuk permintaan unary.
    • Jika kode Anda sebelumnya membungkus byte PCM mentah dalam header WAV (misalnya, menggunakan modul wave Python atau ffmpeg), hapus pembungkus header manual dan tulis byte yang ditampilkan langsung ke file .wav.
    • Jika pipeline Anda memerlukan audio PCM mentah tanpa header, mu-law, atau A-law, tetapkan response_format.mime_type secara eksplisit ke "audio/l16", "audio/mulaw", atau "audio/alaw" (misalnya, {"response_format": {"type": "audio", "mime_type": "audio/l16"}} di Interactions API, atau AUDIO_L16, AUDIO_MULAW, atau AUDIO_ALAW di generateContent). Lihat Format output audio.

gemini-3.8-flash-tts

Properti Deskripsi
Kode model gemini-3.8-flash-tts
Jenis data yang didukung

Input

Teks

Output

Audio

Batas token[*]

Batas token input

8.192

Batas token output

16.384 (batas penayangan Gemini API)

Kemampuan

Pembuatan audio

Didukung

Caching

Tidak didukung

Eksekusi kode

Tidak didukung

Penelusuran file

Tidak didukung

Pemanggilan fungsi

Tidak didukung

Grounding with Google Maps

Tidak didukung

Pembuatan gambar

Tidak didukung

Live API

Tidak didukung

Grounding penelusuran

Tidak didukung

Output terstruktur

Tidak didukung

Penalaran

Tidak didukung

Konteks URL

Tidak didukung

Opsi pemakaian

Batch API

Didukung

Inferensi fleksibel

Didukung

Inferensi prioritas

Didukung

Versi
Baca pola versi model untuk mengetahui detail selengkapnya.
  • gemini-3.8-flash-tts
Pembaruan terbaru September 2026

Bahasa yang didukung

gemini-3.8-flash-tts mendeteksi bahasa input secara otomatis dan mendukung lebih dari 130 bahasa:

Language Language Language
Aceh (skrip Arab) Yunani Nepali (bahasa individu)
Afrika Guarani Fulfulde Nigeria
Akan Gujarat Azerbaijan Utara
Amharik Kreol Haiti Sotho Utara
Armenia Halh Mongolia Uzbek Utara
Assam Hausa Bokmål Norwegia
Awadhi Ibrani Nynorsk Norwegia
Bali Hindi Nyanja
Bangla Hungaria Occitan
Banjar (skrip Arab) Islandia Odia (bahasa individu)
Banjar (Skrip Latn) Igbo Pangasinan
Bashkir Iloko Persia (Afganistan)
Basque Indonesia Polandia
Belarusian Persia Iran Portugis
Bemba Italia Punjabi
Bhojpuri Jepang Rumania
Bosnia Jawa Rusia
Bugis Kabyle Santali
Bulgaria Kamba Serbia
Burma Kannada Sindhi
Kanton Kashmir (skrip Arab) Sinhala
Katalan Kashmir (skrip Deva) Slovakia
Cebuano Kazak Slovenia
Kurdi Tengah Khmer Somali
Chhattisgarhi Kikuyu Azerbaijan Selatan
China (skrip Hans) Kinyarwanda Pashto Selatan
China (skrip Hant) Kongo Sotho Selatan
Crimean Tatar Korea Spanyol
Kroasia Kirgiz Bahasa Arab Standar (skrip Arab)
Ceko Laos Arab Standar (skrip Latn)
Denmark Latgalia Latvia Standar
Belanda Lingala Melayu Standar
Dyula Lituania Swahili (bahasa individu)
Dzongkha Luksemburg Swati
Arab Mesir Makedonia Swedia
Inggris Magahi Tajik
Estonia Maithili Tamil
Filipino Malayalam Telugu
Finlandia Malta Thai
Prancis Manipuri Tigrinya
Galisia Marathi Tosk Albania
Ganda Minangkabau (skrip Arab) Turki
Georgia Minangkabau (skrip Latn) Uyghur
Jerman Mizo Vietnam