Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) est le modèle de synthèse vocale rapide et économique de Google, conçu pour remplacer gemini-3.1-flash-tts-preview pour les charges de travail de production à haut débit.

Présentation et fonctionnalités

Gemini 3.8 Flash-Lite TTS combine une faible latence avec une voix expressive et naturelle :

  • Efficacité à haut débit : optimisé pour la production en masse, les cascades d'agents vocaux conversationnels, les fonctionnalités de lecture à voix haute et la génération vocale quotidienne à une seule voix dans les principales langues.
  • Compatibilité du schéma drop-in : partage le même schéma d'API et le même format d'incitation structurée que gemini-3.8-flash-tts, ce qui vous permet de changer de modèle en modifiant un seul paramètre.
  • Prise en charge complète de l'écosystème vocal : prend en charge les voix prédéfinies, la bibliothèque vocale étendue (GET /v1beta/voices), les personas de conception vocale personnalisés et la réplication vocale (voix stockées de manière persistante par défaut, avec des clés sans état en option). Vous pouvez également concevoir et répliquer des voix de manière interactive dans Google AI Studio.

Consultez le guide Text-to-Speech pour obtenir une couverture complète des fonctionnalités, des bonnes pratiques concernant les requêtes et des exemples de code.

Quand utiliser quel modèle TTS ?

Les deux modèles Gemini 3.8 TTS partagent le même schéma d'API et la même structure d'invite. Choisissez le modèle qui correspond à votre charge de travail :

Fonctionnalité / Charge de travail Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Force principale Haut débit, faible latence et rentabilité Fidélité vocale, nuances de jeu d'acteur et couverture des dialectes maximales
Meilleurs cas d'utilisation Production à grand volume, cascades d'agents vocaux en temps réel, fonctionnalités de lecture à voix haute, réplication de voix, génération quotidienne à une seule voix Livres audio, narration en studio, dialogues complexes à plusieurs voix, jeu d'acteur avec des éclats de voix importants, prononciation difficile, dialectes régionaux
Langues dans lesquelles le service est disponible 101 langues 130 langues
Remplacement recommandé pour gemini-3.1-flash-tts-preview Nouveau niveau de création phare

Guide de migration

Si vous passez de gemini-3.1-flash-tts-preview à gemini-3.8-flash-lite-tts, mettez à jour vos requêtes pour le schéma Gemini 3.8 TTS :

  1. Déplacez les instructions au niveau des tours dans speech_metadata : Gemini 3.8 TTS traite le texte saisi strictement comme une transcription mot pour mot. Les instructions textuelles intégrées, comme "Say cheerfully: Hello!" ou "Speaker 1: Hello!", peuvent être lues à voix haute. Déplacez les instructions de diffusion continue (style) et les identifiants des intervenants (speaker) dans les métadonnées structurées :
    • API Interactions : associez une annotation avec "type": "speech_metadata", "speaker" et "style" à chaque bloc de contenu textuel.
    • API GenerateContent : associez "speech_metadata": {"speaker": "...", "style": "..."} à chaque part.
  2. N'utilisez les tags intégrés entre crochets que pour les événements vocaux ponctuels : conservez les vocalisations et les pauses momentanées non liées à la parole dans la transcription à l'aide de crochets (par exemple, <laugh>, <sigh>, <cough>, <breath> ou <short pause>). Placez les styles de diction tels que les chuchotements dans speech_metadata.style.
  3. Spécifiez speaker à chaque tour dans les requêtes à plusieurs locuteurs : chaque tour d'une requête à plusieurs locuteurs doit inclure explicitement speaker dans speech_metadata correspondant à l'un des locuteurs configurés.
  4. Concevez des personas en amont avec la conception vocale : remplacez les longs blocs d'anciens profils audio / notes du réalisateur par une voix personnalisée créée dans Conception vocale, puis transmettez cet ID voice_... dans vos requêtes de synthèse vocale avec des chaînes style minimales ou vides.
  5. Tenir compte de la sortie WAV par défaut (audio/wav) pour les requêtes unaires : contrairement aux modèles TTS gemini-3.1-flash-tts-preview et antérieurs (qui renvoyaient par défaut un PCM brut audio/l16 sans en-tête), Gemini 3.8 TTS renvoie par défaut un fichier audio WAV (audio/wav / AUDIO_WAV) avec un en-tête RIFF standard pour les requêtes unaires.
    • Si votre code encapsulait auparavant des octets PCM bruts dans un en-tête WAV (par exemple, à l'aide du module wave ou de ffmpeg de Python), supprimez l'encapsulation manuelle de l'en-tête et écrivez les octets renvoyés directement dans un fichier .wav.
    • Si votre pipeline nécessite un fichier audio PCM, mu-law ou A-law brut sans en-tête, définissez explicitement response_format sur "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") ou "audio/alaw" ("AUDIO_ALAW"). Consultez Formats de sortie audio.

gemini-3.8-flash-lite-tts

Propriété Description
Code du modèle gemini-3.8-flash-lite-tts
Types de données acceptés pour

Entrées

Texte

Résultat

Audio

Limites de jetons[*]

Limite de jetons d'entrée

8 192

Limite de jetons de sortie

16 384 (limite de diffusion de l'API Gemini)

 Fonctionnalités

Génération d'audio

Compatible

Mise en cache

Compatible

Exécution de code

Not supported

Recherche de fichiers

Not supported

Appel de fonction

Not supported

Ancrage avec Google Maps

Not supported

Génération d'images

Not supported

API Live

Not supported

Ancrage de recherche

Not supported

Sorties structurées

Not supported

Réflexion

Not supported

Contexte de l'URL

Not supported

 Options de consommation

API Batch

Compatible

Inférence Flex

Compatible

Inférence prioritaire

Compatible

Versions
Pour en savoir plus, consultez les schémas de version de modèle.
  • gemini-3.8-flash-lite-tts
Dernière mise à jour Septembre 2026

Langues disponibles

gemini-3.8-flash-lite-tts détecte automatiquement la langue d'entrée et est compatible avec plus de 100 langues :

Langue Langue Langue
Aceh (écriture arabe) Allemand Manipuri
Afrikaans Grec Marathi
Akan Gujarati Minangkabau (écriture arabe)
Amharique Créole haïtien Mizo
Arménien Mongol khalkha Népalais (langue individuelle)
Assamais Haoussa Peul du Nigeria
Awadhi Hébreu Azerbaïdjanais du Nord
Balinais Hindi Sotho du Nord
Bengali Hongrois Ouzbek du Nord
Banjar (alphabet latin) Islandais Norvégien bokmål
Basque Ilocano Nynorsk (norvégien)
Biélorusse Indonésien Chichewa
Bhodjpouri Persan iranien Odia (langue individuelle)
Bosniaque Italien Perse (Afghanistan)
Bouguis Japonais Polonais
Bulgare Javanais Portugais
Cantonais Kamba Panjabi
Catalan Kannada Roumain
Cebuano Cachemiri (écriture arabe) Russe
Sorani Cachemiri (Devanagari) Santali
Chhattisgarhi Kazakh Serbe
Chinois (script Hans) Khmer Cingalais
Chinois (script Hant) Kikuyu Slovaque
Croate Kinyarwanda Azéri
Tchèque Kongo Pachto du Sud
Danois Coréen Espagnol
Néerlandais Kirghiz Arabe standard (écriture arabe)
Arabe (Égypte) Laotien Arabe standard (alphabet latin)
Anglais Lingala Letton standard
Estonien Macédonien Malais standard
Tagalog Magahi Tamoul
Français Maithili Telugu
Galicien Malayalam Turc
Ganda Maltais Vietnamien
Géorgien — —