Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) è il modello di sintesi vocale creativo di punta di Google, progettato per una fedeltà vocale di qualità professionale, recitazione espressiva, accenti regionali autentici e stabilità solida per conversazioni lunghe e multi-turno.

Panoramica e funzionalità

Gemini 3.8 Flash TTS stabilisce un nuovo punto di riferimento per la generazione di audio espressivo:

  • Elevata fedeltà acustica e sfumature di recitazione:offre una ricca gamma emotiva, una cadenza naturale e un'aderenza precisa alle indicazioni di svolta stylee agli eventi vocali in linea (<laugh>, <sigh>, <short pause>).
  • Stabilità multi-turn a lungo formato: mantiene l'identità della voce, il timbro, il volume e il tono acustico della stanza in dialoghi estesi e narrazioni di più minuti senza variazioni della voce.
  • Accenti e pronuncia regionali autentici:supporta accenti regionali e dialetti minoritari.
  • Supporto completo dell'ecosistema vocale:funziona perfettamente con le voci predefinite, la raccolta vocale estesa (GET /v1beta/voices), le personalità di progettazione vocale personalizzate e la replica vocale (voci archiviate in archiviazione permanente per impostazione predefinita, più chiavi stateless opzionali). Puoi anche progettare e replicare le voci in modo interattivo in Google AI Studio.

Visita la guida Text-to-Speech per una copertura completa di funzionalità, best practice per i prompt ed esempi di codice.

Quando utilizzare un modello TTS

Entrambi i modelli Gemini 3.8 TTS condividono lo stesso schema dell'API e la stessa struttura dei prompt. Scegli il modello più adatto al tuo workload:

Funzionalità / workload Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Punto di forza principale Massima fedeltà della voce, sfumature della recitazione e copertura dei dialetti Throughput elevato, bassa latenza ed efficienza in termini di costi
Migliori casi d'uso Audiolibri, narrazione in studio, dialoghi complessi con più voci, recitazione con molti vocalizzi, pronuncia difficile, dialetti regionali Produzione di volumi elevati, cascate di agenti vocali in tempo reale, funzionalità di lettura ad alta voce, replica vocale, generazione quotidiana di un singolo oratore
Lingue supportate 130 lingue 101 lingue
Sostituzione consigliata per Nuovo livello di creatività di punta gemini-3.1-flash-tts-preview

Guida alla migrazione

Se esegui la migrazione da gemini-3.1-flash-tts-preview o da modelli Gemini TTS precedenti, aggiorna le richieste per lo schema Gemini 3.8 TTS:

  1. Sposta le indicazioni stradali passo passo in speech_metadata: Gemini 3.8 TTS tratta il testo di input rigorosamente come una trascrizione letterale. Le indicazioni di testo in linea come "Say cheerfully: Hello!" o "Speaker 1: Hello!" possono essere lette ad alta voce. Sposta le istruzioni per la distribuzione sostenuta (style) e le etichette di chi parla (speaker) nei metadati strutturati:
    • API Interactions:associa un'annotazione con "type": "speech_metadata", "speaker" e "style" a ogni blocco di contenuti di testo.
    • API GenerateContent:allega "speech_metadata": {"speaker": "...", "style": "..."} a ogni part.
  2. Utilizza i tag in linea tra parentesi angolari solo per gli eventi vocali puntuali:mantieni le vocalizzazioni e le pause momentanee non verbali in linea nella trascrizione utilizzando le parentesi angolari (ad esempio <laugh>, <sigh>, <cough>, <breath> o <short pause>). Inserisci gli stili di pronuncia come il sussurro tra speech_metadata.style.
  3. Specifica speaker a ogni turno nelle richieste con più oratori: ogni turno in una richiesta con più oratori deve includere esplicitamente speaker all'interno di speech_metadata corrispondente a uno degli oratori configurati.
  4. Progetta le personalità in anticipo con la progettazione vocale:sostituisci i lunghi blocchi legacy di profili audio / note del regista con una voce personalizzata creata in progettazione vocale, quindi trasferisci l'ID voice_... tramite le richieste di sintesi vocale con stringhe style minime o vuote.
  5. Tieni conto dell'output WAV (audio/wav) predefinito nelle richieste unarie:a differenza di gemini-3.1-flash-tts-preview e dei modelli TTS precedenti (che restituivano PCM non elaborato senza intestazione audio/l16 per impostazione predefinita), Gemini 3.8 TTS restituisce audio WAV (audio/wav / AUDIO_WAV) con un'intestazione RIFF standard per impostazione predefinita per le richieste unarie.
    • Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo wave di Python o ffmpeg), rimuovi il wrapper dell'intestazione manuale e scrivi i byte restituiti direttamente in un file .wav.
    • Se la pipeline richiede audio PCM non elaborato, mu-law o A-law senza intestazione, imposta esplicitamente response_format.mime_type su "audio/l16", "audio/mulaw" o "audio/alaw" (ad esempio, {"response_format": {"type": "audio", "mime_type": "audio/l16"}} nell'API Interactions o AUDIO_L16, AUDIO_MULAW o AUDIO_ALAW in generateContent). Consulta Formati di uscita audio.

gemini-3.8-flash-tts

Proprietà Descrizione
Codice modello gemini-3.8-flash-tts
Tipi di dati supportati

Input

Testo

Output

Audio

Limiti dei token[*]

Limite di token di input

8192

Limite di token di output

16.384 (limite di pubblicazione dell'API Gemini)

Funzionalità

Generazione di audio

Supportato

Memorizzazione nella cache

Non supportato

Esecuzione di codice

Non supportato

Ricerca file

Non supportato

Chiamata di funzione

Non supportato

Grounding con Google Maps

Non supportato

Generazione di immagini

Non supportato

API Live

Non supportato

Fondatezza della Ricerca

Non supportato

Output strutturati

Non supportato

Pensiero

Non supportato

Contesto URL

Non supportato

Opzioni di consumo

API batch

Supportato

Inferenza Flex

Supportato

Inferenza della priorità

Supportato

Versioni
Per ulteriori dettagli, leggi i pattern delle versioni del modello.
  • gemini-3.8-flash-tts
Ultimo aggiornamento Settembre 2026

Lingue supportate

gemini-3.8-flash-tts rileva automaticamente la lingua di input e supporta oltre 130 lingue:

Lingua Lingua Lingua
Accinese (caratteri arabi) Greek Nepalese (lingua individuale)
Afrikaans Guarani Fulfulde nigeriano
Akan Gujarati Azerbaigian settentrionale
Amarico Creolo haitiano Sotho del nord
Armeno Halh mongolo Uzbeco settentrionale
Assamese Hausa Norvegese bokmål
Awadhi Ebraico Norvegese (Nynorsk)
Balinese Hindi Nyanja
Bengalese Ungherese Occitano
Banjar (caratteri arabi) Islandese Odia (lingua individuale)
Banjar (script Latn) Igbo Pangasinan
Bashkir Ilocano Persiano (Afghanistan)
Basco Indonesiano Polacco
Bielorusso Persiano iraniano Portoghese
Bemba Italiano Punjabi
Bhojpuri Giapponese Rumeno
Bosniaco Giavanese Russo
Buginese Cabilo Santali
Bulgaro Kamba Serbo
Birmano Kannada Sindhi
Cantonese Kashmiri (caratteri arabi) Singalese
Catalano Kashmiri (Deva script) Slovacco
Cebuano Kazako Sloveno
Curdo centrale Khmer Somalo
Chhattisgarhi Kikuyu Azerbaigian meridionale
Cinese (caratteri Han) Kinyarwanda Pashto meridionale
Cinese (script Hant) Kongo Sotho del sud
Tataro di Crimea Coreano Spagnolo
Croato Kirgizo Arabo standard (caratteri arabi)
Ceco Lao Arabo standard (script Latn)
Danese Letgallo Lettone standard
Olandese Lingala Malese standard
Diula Lituano Swahili (lingua individuale)
Dzongkha Lussemburghese Swati
Arabo (Egitto) Macedone Svedese
Inglese Magahi Tagico
Estone Maithili Tamil
Filippino Malayalam Telugu
Finlandese Maltese Thailandese
Francese Manipuri Tigrinya
Galiziano Marathi Albanese tosk
ganda Minangkabau (scrittura araba) Turco
Georgiano Minangkabau (script Latn) Uiguro
Tedesco Mizo Vietnamita