Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) è il modello di sintesi vocale di Google veloce ed economico, progettato per sostituire gemini-3.1-flash-tts-preview per carichi di lavoro di produzione ad alto rendimento.
Panoramica e funzionalità
Gemini 3.8 Flash-Lite TTS combina bassa latenza e voce espressiva e naturale:
- Efficienza con velocità effettiva elevata:ottimizzazione per la produzione di massa, per le cascate di agenti vocali conversazionali, per le funzionalità di lettura ad alta voce e per la generazione di parlato con un solo speaker in tutte le principali lingue.
- Compatibilità dello schema drop-in:condivide lo stesso schema dell'API e lo stesso formato di prompting strutturato di
gemini-3.8-flash-tts, consentendoti di cambiare modello con una sola modifica del parametro. - Supporto completo dell'ecosistema vocale:supporta voci predefinite, la Extended Voice Library (
GET /v1beta/voices), le personalità di progettazione vocale personalizzate e la replica vocale (voci archiviate in modo permanente per impostazione predefinita, più chiavi stateless opzionali). Puoi anche progettare e replicare le voci in modo interattivo in Google AI Studio.
Visita la guida Text-to-Speech per una copertura completa di funzionalità, best practice per i prompt ed esempi di codice.
Quando utilizzare un modello TTS
Entrambi i modelli Gemini 3.8 TTS condividono lo stesso schema dell'API e la stessa struttura dei prompt. Scegli il modello più adatto al tuo workload:
| Funzionalità / workload | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Punto di forza principale | Throughput elevato, bassa latenza ed efficienza in termini di costi | Massima fedeltà della voce, sfumature della recitazione e copertura dei dialetti |
| Best use cases | Produzione di volumi elevati, cascate di agenti vocali in tempo reale, funzionalità di lettura ad alta voce, replica vocale, generazione quotidiana di una sola persona | Audiolibri, narrazione in studio, dialoghi complessi con più voci, recitazione con forti esplosioni vocali, pronuncia difficile, dialetti regionali |
| Lingue supportate | 101 lingue | 130 lingue |
| Sostituzione consigliata per | gemini-3.1-flash-tts-preview |
Nuovo livello di creatività principale |
Guida alla migrazione
Se esegui l'upgrade da gemini-3.1-flash-tts-preview a
gemini-3.8-flash-lite-tts, aggiorna le richieste per lo schema Gemini 3.8 TTS:
- Sposta le indicazioni a livello di svolta in
speech_metadata: Gemini 3.8 TTS tratta il testo di input rigorosamente come una trascrizione letterale. Le indicazioni stradali di testo in linea come"Say cheerfully: Hello!"o"Speaker 1: Hello!"possono essere lette ad alta voce. Sposta le istruzioni per la distribuzione sostenuta (style) e le etichette di chi parla (speaker) nei metadati strutturati:- API Interactions:associa un'annotazione con
"type": "speech_metadata","speaker"e"style"a ogni blocco di contenuti di testo. - API GenerateContent:aggiungi
"speech_metadata": {"speaker": "...", "style": "..."}a ognipart.
- API Interactions:associa un'annotazione con
- Utilizza i tag in linea tra parentesi angolari solo per gli eventi vocali puntuali:mantieni
le vocalizzazioni e le pause momentanee non verbali in linea nella trascrizione utilizzando
le parentesi angolari (ad esempio
<laugh>,<sigh>,<cough>,<breath>o<short pause>). Inserisci gli stili di pronuncia come il sussurro traspeech_metadata.style. - Specifica
speakera ogni turno nelle richieste multilingue:ogni turno in una richiesta multilingue deve includere esplicitamentespeakerall'interno dispeech_metadatacorrispondente a uno degli oratori configurati. - Progetta le voci in anticipo con la progettazione vocale:sostituisci i lunghi blocchi legacy di profilo audio / note del regista con una voce personalizzata creata in progettazione vocale, quindi riporta l'ID
voice_...nelle richieste di sintesi vocale con stringhestyleminime o vuote. - Tieni conto dell'output WAV (
audio/wav) predefinito nelle richieste unarie: a differenza dei modelli TTSgemini-3.1-flash-tts-previewe precedenti (che restituivano PCM non elaborato senza intestazioneaudio/l16per impostazione predefinita), Gemini 3.8 TTS restituisce audio WAV (audio/wav/AUDIO_WAV) con un'intestazione RIFF standard per impostazione predefinita per le richieste unarie.- Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo
wavedi Python offmpeg), rimuovi il wrapper dell'intestazione manuale e scrivi i byte restituiti direttamente in un file.wav. - Se la pipeline richiede audio PCM, mu-law o A-law non elaborato senza intestazione,
imposta esplicitamente
response_formatsu"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") o"audio/alaw"("AUDIO_ALAW"). Consulta Formati di uscita audio.
- Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo
gemini-3.8-flash-lite-tts
| Proprietà | Descrizione |
|---|---|
| Codice modello | gemini-3.8-flash-lite-tts |
| Tipi di dati supportati |
Input Testo Output Audio |
| Limiti dei token[*] |
Limite di token di input 8192 Limite di token di output 16.384 |
| Funzionalità | Supportato Supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato Non supportato |
| Opzioni di consumo |
Supportato Supportato Supportato |
| Versioni |
|
| Ultimo aggiornamento | Luglio 2026 |
Lingue supportate
gemini-3.8-flash-lite-tts rileva automaticamente la lingua di input e
supporta 101 lingue:
| Lingua | Lingua | Lingua |
|---|---|---|
| Accinese (alfabeto arabo) | Georgiano | Maltese |
| Afrikaans | Tedesco | Manipuri |
| Akan | Greek | Marathi |
| Amarico | Gujarati | Minangkabau (scrittura araba) |
| Armeno | Creolo haitiano | Mizo |
| Assamese | Halh mongolo | Nepalese (lingua individuale) |
| Awadhi | Hausa | Fulfulde nigeriano |
| Balinese | Ebraico | Azerbaigian settentrionale |
| Bengalese | Hindi | Sotho del nord |
| Banjar (alfabeto latino) | Ungherese | Uzbeko settentrionale |
| Basco | Islandese | Norvegese bokmål |
| Bielorusso | Ilocano | Norvegese (Nynorsk) |
| Bhojpuri | Indonesiano | Nyanja |
| Bosniaco | Persiano iraniano | Odia (lingua individuale) |
| Buginese | Italiano | Persiano (Afghanistan) |
| Bulgaro | Giapponese | Polacco |
| Cantonese | Giavanese | Portoghese |
| Catalano | Kamba | Punjabi |
| Cebuano | Kannada | Rumeno |
| Curdo centrale | Kashmiri (scrittura araba) | Russo |
| Chhattisgarhi | Kashmiri (Deva script) | Santali |
| Cinese (caratteri Hans) | Kazako | Serbo |
| Cinese (caratteri Hant) | Khmer | Singalese |
| Croato | Kikuyu | Slovacco |
| Ceco | Kinyarwanda | Azerbaigiano meridionale |
| Danese | Kongo | Pashto meridionale |
| Olandese | Coreano | Spagnolo |
| Arabo (Egitto) | Kirgizo | Arabo standard (caratteri arabi) |
| Inglese | Lao | Arabo standard (alfabeto latino) |
| Estone | Lingala | Lettone standard |
| Filippino | Macedone | Malese standard |
| Francese | Magahi | Tamil |
| Galiziano | Maithili | Telugu |
| ganda | Malayalam | — |