Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) è il modello di sintesi vocale di Google veloce ed economico, progettato per sostituire gemini-3.1-flash-tts-preview per carichi di lavoro di produzione ad alto rendimento.

Panoramica e funzionalità

Gemini 3.8 Flash-Lite TTS combina bassa latenza e voce espressiva e naturale:

  • Efficienza con velocità effettiva elevata:ottimizzazione per la produzione di massa, per le cascate di agenti vocali conversazionali, per le funzionalità di lettura ad alta voce e per la generazione di parlato con un solo speaker in tutte le principali lingue.
  • Compatibilità dello schema drop-in:condivide lo stesso schema dell'API e lo stesso formato di prompting strutturato di gemini-3.8-flash-tts, consentendoti di cambiare modello con una sola modifica del parametro.
  • Supporto completo dell'ecosistema vocale:supporta voci predefinite, la Extended Voice Library (GET /v1beta/voices), le personalità di progettazione vocale personalizzate e la replica vocale (voci archiviate in modo permanente per impostazione predefinita, più chiavi stateless opzionali). Puoi anche progettare e replicare le voci in modo interattivo in Google AI Studio.

Visita la guida Text-to-Speech per una copertura completa di funzionalità, best practice per i prompt ed esempi di codice.

Quando utilizzare un modello TTS

Entrambi i modelli Gemini 3.8 TTS condividono lo stesso schema dell'API e la stessa struttura dei prompt. Scegli il modello più adatto al tuo workload:

Funzionalità / workload Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Punto di forza principale Throughput elevato, bassa latenza ed efficienza in termini di costi Massima fedeltà della voce, sfumature della recitazione e copertura dei dialetti
Best use cases Produzione di volumi elevati, cascate di agenti vocali in tempo reale, funzionalità di lettura ad alta voce, replica vocale, generazione quotidiana di una sola persona Audiolibri, narrazione in studio, dialoghi complessi con più voci, recitazione con forti esplosioni vocali, pronuncia difficile, dialetti regionali
Lingue supportate 101 lingue 130 lingue
Sostituzione consigliata per gemini-3.1-flash-tts-preview Nuovo livello di creatività principale

Guida alla migrazione

Se esegui l'upgrade da gemini-3.1-flash-tts-preview a gemini-3.8-flash-lite-tts, aggiorna le richieste per lo schema Gemini 3.8 TTS:

  1. Sposta le indicazioni a livello di svolta in speech_metadata: Gemini 3.8 TTS tratta il testo di input rigorosamente come una trascrizione letterale. Le indicazioni di testo in linea come "Say cheerfully: Hello!" o "Speaker 1: Hello!" possono essere lette ad alta voce. Sposta le istruzioni per la distribuzione sostenuta (style) e le etichette di chi parla (speaker) nei metadati strutturati:
    • API Interactions:associa un'annotazione con "type": "speech_metadata", "speaker" e "style" a ogni blocco di contenuti di testo.
    • API GenerateContent:aggiungi "speech_metadata": {"speaker": "...", "style": "..."} a ogni part.
  2. Utilizza i tag in linea tra parentesi angolari solo per gli eventi vocali puntuali:mantieni le vocalizzazioni e le pause momentanee non verbali in linea nella trascrizione utilizzando le parentesi angolari (ad esempio <laugh>, <sigh>, <cough>, <breath> o <short pause>). Inserisci gli stili di pronuncia come il sussurro tra speech_metadata.style.
  3. Specifica speaker a ogni turno nelle richieste multilingue:ogni turno in una richiesta multilingue deve includere esplicitamente speaker all'interno di speech_metadata corrispondente a uno degli oratori configurati.
  4. Progetta le voci in anticipo con la progettazione vocale:sostituisci i lunghi blocchi legacy di profilo audio / note del regista con una voce personalizzata creata in progettazione vocale, quindi riporta l'ID voice_... nelle richieste di sintesi vocale con stringhe style minime o vuote.
  5. Tieni conto dell'output WAV (audio/wav) predefinito nelle richieste unarie: a differenza di gemini-3.1-flash-tts-preview e dei modelli TTS precedenti (che restituivano PCM non elaborato senza intestazione audio/l16 per impostazione predefinita), Gemini 3.8 TTS restituisce audio WAV (audio/wav / AUDIO_WAV) con un'intestazione RIFF standard per impostazione predefinita per le richieste unarie.
    • Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo wave di Python o ffmpeg), rimuovi il wrapper dell'intestazione manuale e scrivi i byte restituiti direttamente in un file .wav.
    • Se la pipeline richiede audio PCM, mu-law o A-law non elaborato senza intestazione, imposta esplicitamente response_format su "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") o "audio/alaw" ("AUDIO_ALAW"). Consulta Formati di uscita audio.

gemini-3.8-flash-lite-tts

Proprietà Descrizione
Codice modello gemini-3.8-flash-lite-tts
Tipi di dati supportati

Input

Testo

Output

Audio

Limiti dei token[*]

Limite di token di input

8192

Limite di token di output

16.384 (limite di pubblicazione dell'API Gemini)

Funzionalità

Generazione di audio

Supportato

Memorizzazione nella cache

Supportato

Esecuzione di codice

Non supportato

Ricerca file

Non supportato

Chiamata di funzione

Non supportato

Grounding con Google Maps

Non supportato

Generazione di immagini

Non supportato

API Live

Non supportato

Fondatezza della Ricerca

Non supportato

Output strutturati

Non supportato

Pensiero

Non supportato

Contesto URL

Non supportato

Opzioni di consumo

API batch

Supportato

Inferenza Flex

Supportato

Inferenza della priorità

Supportato

Versioni
Leggi i pattern delle versioni del modello per maggiori dettagli.
  • gemini-3.8-flash-lite-tts
Ultimo aggiornamento Settembre 2026

Lingue supportate

gemini-3.8-flash-lite-tts rileva automaticamente la lingua di input e supporta oltre 100 lingue:

Lingua Lingua Lingua
Accinese (alfabeto arabo) Tedesco Manipuri
Afrikaans Greek Marathi
Akan Gujarati Minangkabau (scrittura araba)
Amarico Creolo haitiano Mizo
Armeno Halh mongolo Nepalese (lingua individuale)
Assamese Hausa Fulfulde nigeriano
Awadhi Ebraico Azerbaigian settentrionale
Balinese Hindi Sotho del nord
Bengalese Ungherese Uzbeko settentrionale
Banjar (alfabeto latino) Islandese Norvegese bokmål
Basco Ilocano Norvegese (Nynorsk)
Bielorusso Indonesiano Nyanja
Bhojpuri Persiano iraniano Odia (lingua individuale)
Bosniaco Italiano Persiano (Afghanistan)
Buginese Giapponese Polacco
Bulgaro Giavanese Portoghese
Cantonese Kamba Punjabi
Catalano Kannada Rumeno
Cebuano Kashmiri (scrittura araba) Russo
Curdo centrale Kashmiri (Deva script) Santali
Chhattisgarhi Kazako Serbo
Cinese (caratteri Hans) Khmer Singalese
Cinese (caratteri Hant) Kikuyu Slovacco
Croato Kinyarwanda Azerbaigiano meridionale
Ceco Kongo Pashto meridionale
Danese Coreano Spagnolo
Olandese Kirgizo Arabo standard (caratteri arabi)
Arabo (Egitto) Lao Arabo standard (alfabeto latino)
Inglese Lingala Lettone standard
Estone Macedone Malese standard
Filippino Magahi Tamil
Francese Maithili Telugu
Galiziano Malayalam Turco
ganda Maltese Vietnamita
Georgiano — —