Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) è il modello di sintesi vocale creativo di punta di Google, progettato per una fedeltà vocale di qualità professionale, un'espressività recitativa, accenti regionali autentici e una stabilità solida per conversazioni lunghe e multi-turno.
Panoramica e funzionalità
Gemini 3.8 Flash TTS stabilisce un nuovo punto di riferimento per la generazione di audio espressivo:
- Elevata fedeltà acustica e sfumature di recitazione:offre una ricca gamma emotiva, una cadenza naturale e un'aderenza precisa alle indicazioni di svolta
stylee agli eventi vocali in linea (<laugh>,<sigh>,<short pause>). - Stabilità multi-turn di lunga durata:mantiene l'identità della voce, il timbro, il volume e il tono acustico della stanza in modo coerente in dialoghi estesi e narrazioni di più minuti senza variazioni della voce.
- Accenti e pronuncia regionali autentici:supporta accenti regionali, dialetti minoritari e override dell'alfabeto fonetico internazionale (IPA) in linea.
- Supporto completo dell'ecosistema vocale:funziona perfettamente con le voci predefinite, la raccolta vocale estesa (
GET /v1beta/voices), le personalità di progettazione vocale personalizzate e la replica vocale (voci archiviate persistenti per impostazione predefinita, più chiavi stateless opzionali). Puoi anche progettare e replicare le voci in modo interattivo in Google AI Studio.
Visita la guida Text-to-Speech per una copertura completa di funzionalità, best practice per i prompt ed esempi di codice.
Quando utilizzare un modello TTS
Entrambi i modelli Gemini 3.8 TTS condividono lo stesso schema dell'API e la stessa struttura dei prompt. Scegli il modello più adatto al tuo workload:
| Funzionalità / workload | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Punto di forza principale | Massima fedeltà della voce, sfumature della recitazione e copertura dei dialetti | Throughput elevato, bassa latenza ed efficienza in termini di costi |
| Best use cases | Audiolibri, narrazione in studio, dialoghi complessi con più voci, recitazione con forti esplosioni vocali, pronuncia difficile, dialetti regionali | Produzione di volumi elevati, cascate di agenti vocali in tempo reale, funzionalità di lettura ad alta voce, replica vocale, generazione quotidiana di una sola persona |
| Lingue supportate | 130 lingue | 101 lingue |
| Sostituzione consigliata per | Nuovo livello di creatività principale | gemini-3.1-flash-tts-preview |
Guida alla migrazione
Se esegui la migrazione da modelli Gemini TTS gemini-3.1-flash-tts-preview o precedenti, aggiorna le richieste per lo schema Gemini 3.8 TTS:
- Sposta le indicazioni a livello di svolta in
speech_metadata: Gemini 3.8 TTS tratta il testo di input rigorosamente come una trascrizione letterale. Le indicazioni di testo in linea come"Say cheerfully: Hello!"o"Speaker 1: Hello!"possono essere lette ad alta voce. Sposta le istruzioni per la distribuzione sostenuta (style) e le etichette di chi parla (speaker) nei metadati strutturati:- API Interactions:associa un'annotazione con
"type": "speech_metadata","speaker"e"style"a ogni blocco di contenuti di testo. - API GenerateContent:aggiungi
"speech_metadata": {"speaker": "...", "style": "..."}a ognipart.
- API Interactions:associa un'annotazione con
- Utilizza i tag in linea tra parentesi angolari solo per gli eventi vocali puntuali:mantieni
le vocalizzazioni e le pause momentanee non verbali in linea nella trascrizione utilizzando
le parentesi angolari (ad esempio
<laugh>,<sigh>,<cough>,<breath>o<short pause>). Inserisci gli stili di pronuncia come il sussurro traspeech_metadata.style. - Specifica
speakera ogni turno nelle richieste multilingue:ogni turno in una richiesta multilingue deve includere esplicitamentespeakerall'interno dispeech_metadatacorrispondente a uno degli oratori configurati. - Progetta le voci in anticipo con la progettazione vocale:sostituisci i lunghi blocchi legacy di profilo audio / note del regista con una voce personalizzata creata in progettazione vocale, quindi riporta l'ID
voice_...nelle richieste di sintesi vocale con stringhestyleminime o vuote. - Tieni conto dell'output WAV (
audio/wav) predefinito nelle richieste unarie: a differenza digemini-3.1-flash-tts-previewe dei modelli TTS precedenti (che restituivano PCM non elaborato senza intestazioneaudio/l16per impostazione predefinita), Gemini 3.8 TTS restituisce audio WAV (audio/wav/AUDIO_WAV) con un'intestazione RIFF standard per impostazione predefinita per le richieste unarie.- Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo
wavedi Python offmpeg), rimuovi il wrapper dell'intestazione manuale e scrivi i byte restituiti direttamente in un file.wav. - Se la pipeline richiede audio PCM, mu-law o A-law non elaborato senza intestazione,
imposta esplicitamente
response_formatsu"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") o"audio/alaw"("AUDIO_ALAW"). Consulta Formati di uscita audio.
- Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo
gemini-3.8-flash-tts
| Proprietà | Descrizione |
|---|---|
| Codice modello | gemini-3.8-flash-tts |
| Tipi di dati supportati |
Input Testo Output Audio |
| Limiti dei token[*] |
Limite di token di input 8192 Limite di token di output 16.384 |
| Funzionalità | Supportato Supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato |
| Opzioni di consumo |
Supportato Supportato Supportato |
| Versioni |
|
| Ultimo aggiornamento | Luglio 2026 |
Lingue supportate
gemini-3.8-flash-tts rileva automaticamente la lingua di input e supporta
130 lingue:
| Lingua | Lingua | Lingua |
|---|---|---|
| Accinese (alfabeto arabo) | Greek | Nepalese (lingua individuale) |
| Afrikaans | Guarani | Fulfulde nigeriano |
| Akan | Gujarati | Azerbaigian settentrionale |
| Amarico | Creolo haitiano | Sotho del nord |
| Armeno | Halh mongolo | Uzbeko settentrionale |
| Assamese | Hausa | Norvegese bokmål |
| Awadhi | Ebraico | Norvegese (Nynorsk) |
| Balinese | Hindi | Nyanja |
| Bengalese | Ungherese | Occitano |
| Banjar (caratteri arabi) | Islandese | Odia (lingua individuale) |
| Banjar (alfabeto latino) | Igbo | Pangasinan |
| Bashkir | Ilocano | Persiano (Afghanistan) |
| Basco | Indonesiano | Polacco |
| Bielorusso | Persiano iraniano | Portoghese |
| Bemba | Italiano | Punjabi |
| Bhojpuri | Giapponese | Rumeno |
| Bosniaco | Giavanese | Russo |
| Buginese | Kabyle | Santali |
| Bulgaro | Kamba | Serbo |
| Birmano | Kannada | Sindhi |
| Cantonese | Kashmiri (scrittura araba) | Singalese |
| Catalano | Kashmiri (Deva script) | Slovacco |
| Cebuano | Kazako | Sloveno |
| Curdo centrale | Khmer | Somalo |
| Chhattisgarhi | Kikuyu | Azerbaigiano meridionale |
| Cinese (caratteri Hans) | Kinyarwanda | Pashto meridionale |
| Cinese (caratteri Hant) | Kongo | Sotho del sud |
| Tataro di Crimea | Coreano | Spagnolo |
| Croato | Kirgizo | Arabo standard (caratteri arabi) |
| Ceco | Lao | Arabo standard (alfabeto latino) |
| Danese | Letgallo | Lettone standard |
| Olandese | Lingala | Malese standard |
| Diula | Lituano | Swahili (singola lingua) |
| Dzongkha | Lussemburghese | Swati |
| Arabo (Egitto) | Macedone | Svedese |
| Inglese | Magahi | Tagico |
| Estone | Maithili | Tamil |
| Filippino | Malayalam | Telugu |
| Finlandese | Maltese | Thailandese |
| Francese | Manipuri | Tigrinya |
| Galiziano | Marathi | Albanese tosk |
| ganda | Minangkabau (scrittura araba) | Uiguro |
| Georgiano | Minangkabau (latino) | — |
| Tedesco | Mizo | — |