Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) adalah model text-to-speech kreatif unggulan Google, yang dirancang untuk menghasilkan kualitas suara setara studio, akting yang ekspresif, aksen regional yang autentik, dan stabilitas multi-turn bentuk panjang yang sangat andal.

Ringkasan dan kemampuan

Gemini 3.8 Flash TTS menetapkan tolok ukur baru untuk pembuatan audio ekspresif:

  • Fidelitas akustik tinggi dan nuansa akting: Menghasilkan rentang emosi yang kaya, irama alami, dan kepatuhan yang tepat terhadap petunjuk tingkat giliran style dan peristiwa vokal inline (<laugh>, <sigh>, <short pause>).
  • Stabilitas multi-giliran panjang: Mempertahankan identitas suara, timbre, volume, dan nada ruang akustik yang konsisten di seluruh dialog yang panjang dan narasi multi-menit tanpa pergeseran suara.
  • Aksen dan pengucapan regional yang autentik: Mendukung aksen regional, dialek minoritas, dan penggantian Alfabet Fonetik Internasional (IPA) inline.
  • Dukungan ekosistem suara penuh: Berfungsi lancar dengan suara bawaan, Extended Voice Library (GET /v1beta/voices), persona Desain suara kustom, dan Replikasi suara (suara yang disimpan secara persisten secara default, ditambah kunci stateless opsional). Anda juga dapat mendesain dan mereplikasi suara secara interaktif di Google AI Studio.

Buka panduan Text-to-speech untuk mengetahui cakupan lengkap fitur, praktik terbaik perintah, dan contoh kode.

Kapan harus menggunakan model TTS yang mana

Kedua model TTS Gemini 3.8 memiliki skema API dan struktur perintah yang sama. Pilih model yang sesuai dengan beban kerja Anda:

Fitur / workload Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Kekuatan utama Fidelitas suara maksimum, nuansa akting, dan cakupan dialek Throughput tinggi, latensi rendah, dan efisiensi biaya
Kasus penggunaan terbaik Buku audio, narasi studio, dialog multi-pembicara yang kompleks, akting dengan ledakan vokal yang berat, pengucapan yang sulit, dialek regional Produksi volume tinggi, rangkaian agen suara real-time, fitur baca lisan, replikasi suara, pembuatan suara satu pembicara sehari-hari
Bahasa yang didukung 130 bahasa 101 bahasa
Pengganti yang direkomendasikan untuk Tingkatan materi iklan unggulan baru gemini-3.1-flash-tts-preview

Panduan migrasi

Jika Anda melakukan migrasi dari model Gemini TTS gemini-3.1-flash-tts-preview atau yang lebih lama, perbarui permintaan Anda untuk skema Gemini 3.8 TTS:

  1. Memindahkan petunjuk tingkat belokan ke speech_metadata: Gemini 3.8 TTS memperlakukan teks input secara ketat sebagai transkrip kata demi kata. Petunjuk teks inline seperti "Say cheerfully: Hello!" atau "Speaker 1: Hello!" dapat diucapkan. Memindahkan petunjuk pengiriman berkelanjutan (style) dan label pembicara (speaker) ke dalam metadata terstruktur:
    • Interactions API: Lampirkan anotasi dengan "type": "speech_metadata", "speaker", dan "style" ke setiap blok konten teks.
    • GenerateContent API: Lampirkan "speech_metadata": {"speaker": "...", "style": "..."} ke setiap part.
  2. Gunakan tag inline tanda kurung sudut hanya untuk peristiwa vokal pada satu titik waktu: Pertahankan vokalisasi dan jeda non-ucapan sesaat dalam transkrip menggunakan tanda kurung sudut (seperti <laugh>, <sigh>, <cough>, <breath>, atau <short pause>). Masukkan gaya penyampaian seperti berbisik dalam speech_metadata.style.
  3. Tentukan speaker di setiap giliran dalam permintaan multi-pembicara: Setiap giliran dalam permintaan multi-pembicara harus secara eksplisit menyertakan speaker di dalam speech_metadata yang cocok dengan salah satu pembicara yang dikonfigurasi.
  4. Desain persona di awal dengan Desain suara: Ganti blok Audio Profile / Director's Notes lama yang panjang dengan suara kustom yang dibuat di Desain suara, lalu bawa ID voice_... tersebut melalui permintaan TTS Anda dengan string style yang minimal atau kosong.
  5. Memperhitungkan output WAV (audio/wav) default pada permintaan unary: Tidak seperti model TTS gemini-3.1-flash-tts-preview dan yang lebih lama (yang menampilkan PCM mentah tanpa header audio/l16 secara default), Gemini 3.8 TTS menampilkan audio WAV (audio/wav / AUDIO_WAV) dengan header RIFF standar secara default untuk permintaan unary.
    • Jika kode Anda sebelumnya membungkus byte PCM mentah dalam header WAV (misalnya, menggunakan modul wave Python atau ffmpeg), hapus pembungkus header manual dan tulis byte yang ditampilkan langsung ke file .wav.
    • Jika pipeline Anda memerlukan audio PCM mentah tanpa header, mu-law, atau A-law, tetapkan response_format secara eksplisit ke "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW"), atau "audio/alaw" ("AUDIO_ALAW"). Lihat Format output audio.

gemini-3.8-flash-tts

Properti Deskripsi
Kode model gemini-3.8-flash-tts
Jenis data yang didukung

Input

Teks

Output

Audio

Batas token[*]

Batas token input

8.192

Batas token output

16.384

Kemampuan

Pembuatan audio

Didukung

Caching

Didukung

Eksekusi kode

Tidak didukung

Penelusuran file

Tidak didukung

Pemanggilan fungsi

Tidak didukung

Grounding dengan Google Maps

Tidak didukung

Pembuatan gambar

Tidak didukung

Live API

Tidak didukung

Grounding penelusuran

Tidak didukung

Output terstruktur

Tidak didukung

Penalaran

Tidak didukung

Konteks URL

Tidak didukung

Opsi pemakaian

Batch API

Didukung

Inferensi fleksibel

Didukung

Inferensi prioritas

Didukung

Versi
Baca pola versi model untuk mengetahui detail selengkapnya.
  • gemini-3.8-flash-tts
Pembaruan terbaru Juli 2026

Bahasa yang didukung

gemini-3.8-flash-tts mendeteksi bahasa input secara otomatis dan mendukung 130 bahasa:

Language Language Language
Aceh (skrip Arab) Yunani Nepali (bahasa individu)
Afrika Guarani Fulfulde Nigeria
Akan Gujarat Azerbaijan Utara
Amharik Kreol Haiti Sotho Utara
Armenia Halh Mongolia Uzbek Utara
Assam Hausa Bokmål Norwegia
Awadhi Ibrani Nynorsk Norwegia
Bali Hindi Nyanja
Bangla Hungaria Occitan
Banjar (skrip Arab) Islandia Odia (bahasa individu)
Banjar (skrip Latn) Igbo Pangasinan
Bashkir Iloko Persia (Afganistan)
Basque Indonesia Polandia
Belarusia Persia Iran Portugis
Bemba Italia Punjabi
Bhojpuri Jepang Rumania
Bosnia Jawa Rusia
Bugis Kabyle Santali
Bulgaria Kamba Serbia
Burma Kannada Sindhi
Kanton Kashmir (skrip Arab) Sinhala
Katalan Kashmir (skrip Deva) Slovakia
Cebuano Kazak Slovenia
Kurdi Tengah Khmer Somali
Chhattisgarhi Kikuyu Azerbaijan Selatan
China (skrip Hans) Kinyarwanda Pashto Selatan
China (skrip Hant) Kongo Sotho Selatan
Crimean Tatar Korea Spanyol
Kroasia Kirgiz Arab Standar (skrip Arab)
Ceko Laos Arab Standar (skrip Latn)
Denmark Latgalia Latvia Standar
Belanda Lingala Melayu Standar
Dyula Lituania Swahili (bahasa individu)
Dzongkha Luksemburg Swati
Arab Mesir Makedonia Swedia
Inggris Magahi Tajik
Estonia Maithili Tamil
Filipino Malayalam Telugu
Finlandia Malta Thai
Prancis Manipuri Tigrinya
Galisia Marathi Tosk Albania
Ganda Minangkabau (skrip Arab) Uyghur
Georgia Minangkabau (skrip Latn) —
Jerman Mizo —