Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) è il modello di sintesi vocale creativo di punta di Google, progettato per una fedeltà vocale di qualità professionale, un'espressività recitativa, accenti regionali autentici e una stabilità solida per conversazioni lunghe e multi-turno.

Panoramica e funzionalità

Gemini 3.8 Flash TTS stabilisce un nuovo punto di riferimento per la generazione di audio espressivo:

  • Elevata fedeltà acustica e sfumature di recitazione:offre una ricca gamma emotiva, una cadenza naturale e un'aderenza precisa alle indicazioni di svolta stylee agli eventi vocali in linea (<laugh>, <sigh>, <short pause>).
  • Stabilità multi-turn di lunga durata:mantiene l'identità della voce, il timbro, il volume e il tono acustico della stanza in modo coerente in dialoghi estesi e narrazioni di più minuti senza variazioni della voce.
  • Accenti e pronuncia regionali autentici:supporta accenti regionali, dialetti minoritari e override dell'alfabeto fonetico internazionale (IPA) in linea.
  • Supporto completo dell'ecosistema vocale:funziona perfettamente con le voci predefinite, la raccolta vocale estesa (GET /v1beta/voices), le personalità di progettazione vocale personalizzate e la replica vocale (voci archiviate persistenti per impostazione predefinita, più chiavi stateless opzionali). Puoi anche progettare e replicare le voci in modo interattivo in Google AI Studio.

Visita la guida Text-to-Speech per una copertura completa di funzionalità, best practice per i prompt ed esempi di codice.

Quando utilizzare un modello TTS

Entrambi i modelli Gemini 3.8 TTS condividono lo stesso schema dell'API e la stessa struttura dei prompt. Scegli il modello più adatto al tuo workload:

Funzionalità / workload Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Punto di forza principale Massima fedeltà della voce, sfumature della recitazione e copertura dei dialetti Throughput elevato, bassa latenza ed efficienza in termini di costi
Best use cases Audiolibri, narrazione in studio, dialoghi complessi con più voci, recitazione con forti esplosioni vocali, pronuncia difficile, dialetti regionali Produzione di volumi elevati, cascate di agenti vocali in tempo reale, funzionalità di lettura ad alta voce, replica vocale, generazione quotidiana di una sola persona
Lingue supportate 130 lingue 101 lingue
Sostituzione consigliata per Nuovo livello di creatività principale gemini-3.1-flash-tts-preview

Guida alla migrazione

Se esegui la migrazione da modelli Gemini TTS gemini-3.1-flash-tts-preview o precedenti, aggiorna le richieste per lo schema Gemini 3.8 TTS:

  1. Sposta le indicazioni a livello di svolta in speech_metadata: Gemini 3.8 TTS tratta il testo di input rigorosamente come una trascrizione letterale. Le indicazioni di testo in linea come "Say cheerfully: Hello!" o "Speaker 1: Hello!" possono essere lette ad alta voce. Sposta le istruzioni per la distribuzione sostenuta (style) e le etichette di chi parla (speaker) nei metadati strutturati:
    • API Interactions:associa un'annotazione con "type": "speech_metadata", "speaker" e "style" a ogni blocco di contenuti di testo.
    • API GenerateContent:aggiungi "speech_metadata": {"speaker": "...", "style": "..."} a ogni part.
  2. Utilizza i tag in linea tra parentesi angolari solo per gli eventi vocali puntuali:mantieni le vocalizzazioni e le pause momentanee non verbali in linea nella trascrizione utilizzando le parentesi angolari (ad esempio <laugh>, <sigh>, <cough>, <breath> o <short pause>). Inserisci gli stili di pronuncia come il sussurro tra speech_metadata.style.
  3. Specifica speaker a ogni turno nelle richieste multilingue:ogni turno in una richiesta multilingue deve includere esplicitamente speaker all'interno di speech_metadata corrispondente a uno degli oratori configurati.
  4. Progetta le voci in anticipo con la progettazione vocale:sostituisci i lunghi blocchi legacy di profilo audio / note del regista con una voce personalizzata creata in progettazione vocale, quindi riporta l'ID voice_... nelle richieste di sintesi vocale con stringhe style minime o vuote.
  5. Tieni conto dell'output WAV (audio/wav) predefinito nelle richieste unarie: a differenza di gemini-3.1-flash-tts-preview e dei modelli TTS precedenti (che restituivano PCM non elaborato senza intestazione audio/l16 per impostazione predefinita), Gemini 3.8 TTS restituisce audio WAV (audio/wav / AUDIO_WAV) con un'intestazione RIFF standard per impostazione predefinita per le richieste unarie.
    • Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo wave di Python o ffmpeg), rimuovi il wrapper dell'intestazione manuale e scrivi i byte restituiti direttamente in un file .wav.
    • Se la pipeline richiede audio PCM, mu-law o A-law non elaborato senza intestazione, imposta esplicitamente response_format su "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") o "audio/alaw" ("AUDIO_ALAW"). Consulta Formati di uscita audio.

gemini-3.8-flash-tts

Proprietà Descrizione
Codice modello gemini-3.8-flash-tts
Tipi di dati supportati

Input

Testo

Output

Audio

Limiti dei token[*]

Limite di token di input

8192

Limite di token di output

16.384

Funzionalità

Generazione di audio

Supportato

Memorizzazione nella cache

Supportato

Esecuzione di codice

Non supportato

Ricerca file

Non supportato

Chiamata di funzione

Non supportato

Grounding con Google Maps

Non supportato

Generazione di immagini

Non supportato

API Live

Non supportato

Fondatezza della Ricerca

Non supportato

Output strutturati

Non supportato

Pensiero

Non supportato

Contesto URL

Non supportato

Opzioni di consumo

API batch

Supportato

Inferenza Flex

Supportato

Inferenza della priorità

Supportato

Versioni
Leggi i pattern delle versioni del modello per maggiori dettagli.
  • gemini-3.8-flash-tts
Ultimo aggiornamento Luglio 2026

Lingue supportate

gemini-3.8-flash-tts rileva automaticamente la lingua di input e supporta 130 lingue:

Lingua Lingua Lingua
Accinese (alfabeto arabo) Greek Nepalese (lingua individuale)
Afrikaans Guarani Fulfulde nigeriano
Akan Gujarati Azerbaigian settentrionale
Amarico Creolo haitiano Sotho del nord
Armeno Halh mongolo Uzbeko settentrionale
Assamese Hausa Norvegese bokmål
Awadhi Ebraico Norvegese (Nynorsk)
Balinese Hindi Nyanja
Bengalese Ungherese Occitano
Banjar (caratteri arabi) Islandese Odia (lingua individuale)
Banjar (alfabeto latino) Igbo Pangasinan
Bashkir Ilocano Persiano (Afghanistan)
Basco Indonesiano Polacco
Bielorusso Persiano iraniano Portoghese
Bemba Italiano Punjabi
Bhojpuri Giapponese Rumeno
Bosniaco Giavanese Russo
Buginese Kabyle Santali
Bulgaro Kamba Serbo
Birmano Kannada Sindhi
Cantonese Kashmiri (scrittura araba) Singalese
Catalano Kashmiri (Deva script) Slovacco
Cebuano Kazako Sloveno
Curdo centrale Khmer Somalo
Chhattisgarhi Kikuyu Azerbaigiano meridionale
Cinese (caratteri Hans) Kinyarwanda Pashto meridionale
Cinese (caratteri Hant) Kongo Sotho del sud
Tataro di Crimea Coreano Spagnolo
Croato Kirgizo Arabo standard (caratteri arabi)
Ceco Lao Arabo standard (alfabeto latino)
Danese Letgallo Lettone standard
Olandese Lingala Malese standard
Diula Lituano Swahili (singola lingua)
Dzongkha Lussemburghese Swati
Arabo (Egitto) Macedone Svedese
Inglese Magahi Tagico
Estone Maithili Tamil
Filippino Malayalam Telugu
Finlandese Maltese Thailandese
Francese Manipuri Tigrinya
Galiziano Marathi Albanese tosk
ganda Minangkabau (scrittura araba) Uiguro
Georgiano Minangkabau (latino)
Tedesco Mizo