Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) è il modello di sintesi vocale di Google veloce ed economico, progettato per sostituire gemini-3.1-flash-tts-preview per carichi di lavoro di produzione ad alto rendimento.

Panoramica e funzionalità

Gemini 3.8 Flash-Lite TTS combina bassa latenza e voce espressiva e naturale:

  • Efficienza con velocità effettiva elevata:ottimizzazione per la produzione di massa, per le cascate di agenti vocali conversazionali, per le funzionalità di lettura ad alta voce e per la generazione di parlato con un solo speaker in tutte le principali lingue.
  • Compatibilità dello schema drop-in:condivide lo stesso schema dell'API e lo stesso formato di prompting strutturato di gemini-3.8-flash-tts, consentendoti di cambiare modello con una sola modifica del parametro.
  • Supporto completo dell'ecosistema vocale:supporta voci predefinite, la Extended Voice Library (GET /v1beta/voices), le personalità di progettazione vocale personalizzate e la replica vocale (voci archiviate in modo permanente per impostazione predefinita, più chiavi stateless opzionali). Puoi anche progettare e replicare le voci in modo interattivo in Google AI Studio.

Visita la guida Text-to-Speech per una copertura completa di funzionalità, best practice per i prompt ed esempi di codice.

Quando utilizzare un modello TTS

Entrambi i modelli Gemini 3.8 TTS condividono lo stesso schema dell'API e la stessa struttura dei prompt. Scegli il modello più adatto al tuo workload:

Funzionalità / workload Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Punto di forza principale Throughput elevato, bassa latenza ed efficienza in termini di costi Massima fedeltà della voce, sfumature della recitazione e copertura dei dialetti
Best use cases Produzione di volumi elevati, cascate di agenti vocali in tempo reale, funzionalità di lettura ad alta voce, replica vocale, generazione quotidiana di una sola persona Audiolibri, narrazione in studio, dialoghi complessi con più voci, recitazione con forti esplosioni vocali, pronuncia difficile, dialetti regionali
Lingue supportate 101 lingue 130 lingue
Sostituzione consigliata per gemini-3.1-flash-tts-preview Nuovo livello di creatività principale

Guida alla migrazione

Se esegui l'upgrade da gemini-3.1-flash-tts-preview a gemini-3.8-flash-lite-tts, aggiorna le richieste per lo schema Gemini 3.8 TTS:

  1. Sposta le indicazioni a livello di svolta in speech_metadata: Gemini 3.8 TTS tratta il testo di input rigorosamente come una trascrizione letterale. Le indicazioni stradali di testo in linea come "Say cheerfully: Hello!" o "Speaker 1: Hello!" possono essere lette ad alta voce. Sposta le istruzioni per la distribuzione sostenuta (style) e le etichette di chi parla (speaker) nei metadati strutturati:
    • API Interactions:associa un'annotazione con "type": "speech_metadata", "speaker" e "style" a ogni blocco di contenuti di testo.
    • API GenerateContent:aggiungi "speech_metadata": {"speaker": "...", "style": "..."} a ogni part.
  2. Utilizza i tag in linea tra parentesi angolari solo per gli eventi vocali puntuali:mantieni le vocalizzazioni e le pause momentanee non verbali in linea nella trascrizione utilizzando le parentesi angolari (ad esempio <laugh>, <sigh>, <cough>, <breath> o <short pause>). Inserisci gli stili di pronuncia come il sussurro tra speech_metadata.style.
  3. Specifica speaker a ogni turno nelle richieste multilingue:ogni turno in una richiesta multilingue deve includere esplicitamente speaker all'interno di speech_metadata corrispondente a uno degli oratori configurati.
  4. Progetta le voci in anticipo con la progettazione vocale:sostituisci i lunghi blocchi legacy di profilo audio / note del regista con una voce personalizzata creata in progettazione vocale, quindi riporta l'ID voice_... nelle richieste di sintesi vocale con stringhe style minime o vuote.
  5. Tieni conto dell'output WAV (audio/wav) predefinito nelle richieste unarie: a differenza dei modelli TTS gemini-3.1-flash-tts-preview e precedenti (che restituivano PCM non elaborato senza intestazione audio/l16 per impostazione predefinita), Gemini 3.8 TTS restituisce audio WAV (audio/wav / AUDIO_WAV) con un'intestazione RIFF standard per impostazione predefinita per le richieste unarie.
    • Se in precedenza il codice racchiudeva i byte PCM non elaborati in un'intestazione WAV (ad esempio, utilizzando il modulo wave di Python o ffmpeg), rimuovi il wrapper dell'intestazione manuale e scrivi i byte restituiti direttamente in un file .wav.
    • Se la pipeline richiede audio PCM, mu-law o A-law non elaborato senza intestazione, imposta esplicitamente response_format su "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") o "audio/alaw" ("AUDIO_ALAW"). Consulta Formati di uscita audio.

gemini-3.8-flash-lite-tts

Proprietà Descrizione
Codice modello gemini-3.8-flash-lite-tts
Tipi di dati supportati

Input

Testo

Output

Audio

Limiti dei token[*]

Limite di token di input

8192

Limite di token di output

16.384

Funzionalità

Generazione di audio

Supportato

Memorizzazione nella cache

Supportato

Esecuzione di codice

Non supportato

Ricerca file

Non supportato

Chiamata di funzione

Non supportato

Grounding con Google Maps

Non supportato

Generazione di immagini

Non supportato

API Live

Non supportato

Fondatezza della Ricerca

Non supportato

Output strutturati

Non supportato

Pensiero

Non supportato

Contesto URL

Non supportato

Opzioni di consumo

API batch

Supportato

Inferenza Flex

Supportato

Inferenza della priorità

Supportato

Versioni
Per ulteriori dettagli, leggi i pattern delle versioni del modello.
  • gemini-3.8-flash-lite-tts
Ultimo aggiornamento Luglio 2026

Lingue supportate

gemini-3.8-flash-lite-tts rileva automaticamente la lingua di input e supporta 101 lingue:

Lingua Lingua Lingua
Accinese (alfabeto arabo) Georgiano Maltese
Afrikaans Tedesco Manipuri
Akan Greek Marathi
Amarico Gujarati Minangkabau (scrittura araba)
Armeno Creolo haitiano Mizo
Assamese Halh mongolo Nepalese (lingua individuale)
Awadhi Hausa Fulfulde nigeriano
Balinese Ebraico Azerbaigian settentrionale
Bengalese Hindi Sotho del nord
Banjar (alfabeto latino) Ungherese Uzbeko settentrionale
Basco Islandese Norvegese bokmål
Bielorusso Ilocano Norvegese (Nynorsk)
Bhojpuri Indonesiano Nyanja
Bosniaco Persiano iraniano Odia (lingua individuale)
Buginese Italiano Persiano (Afghanistan)
Bulgaro Giapponese Polacco
Cantonese Giavanese Portoghese
Catalano Kamba Punjabi
Cebuano Kannada Rumeno
Curdo centrale Kashmiri (scrittura araba) Russo
Chhattisgarhi Kashmiri (Deva script) Santali
Cinese (caratteri Hans) Kazako Serbo
Cinese (caratteri Hant) Khmer Singalese
Croato Kikuyu Slovacco
Ceco Kinyarwanda Azerbaigiano meridionale
Danese Kongo Pashto meridionale
Olandese Coreano Spagnolo
Arabo (Egitto) Kirgizo Arabo standard (caratteri arabi)
Inglese Lao Arabo standard (alfabeto latino)
Estone Lingala Lettone standard
Filippino Macedone Malese standard
Francese Magahi Tamil
Galiziano Maithili Telugu
ganda Malayalam