Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) est le modèle de synthèse vocale de Google, rapide et économique, conçu pour remplacer gemini-3.1-flash-tts-preview pour les charges de travail de production à haut débit.
Présentation et fonctionnalités
Gemini 3.8 Flash-Lite TTS combine une faible latence avec une voix expressive et naturelle :
- Efficacité à haut débit : optimisé pour la production en masse, les cascades d'agents vocaux conversationnels, les fonctionnalités de lecture à voix haute et la génération vocale quotidienne à une seule voix dans les principales langues.
- Compatibilité du schéma de l'API prêt à l'emploi : partage le même schéma de l'API et le même format d'incitation structurée que
gemini-3.8-flash-tts, ce qui vous permet de changer de modèle en modifiant un seul paramètre. - Compatibilité complète avec l'écosystème vocal : compatible avec les voix prédéfinies, la bibliothèque vocale étendue (
GET /v1beta/voices), les personas de conception vocale personnalisés et la réplication vocale (voix stockées de manière persistante par défaut, avec des clés sans état en option). Vous pouvez également concevoir et répliquer des voix de manière interactive dans Google AI Studio.
Consultez le guide Text-to-Speech pour obtenir une couverture complète des fonctionnalités, des bonnes pratiques concernant les requêtes et des exemples de code.
Quand utiliser quel modèle TTS ?
Les deux modèles Gemini 3.8 TTS partagent le même schéma de l'API et la même structure d'invite. Choisissez le modèle qui correspond à votre charge de travail :
| Fonctionnalité / Charge de travail | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Force principale | Haut débit, faible latence et rentabilité | Fidélité vocale, nuances de jeu d'acteur et couverture des dialectes maximales |
| Meilleurs cas d'utilisation | Production à volume élevé, cascades d'agents vocaux en temps réel, fonctionnalités de lecture à voix haute, réplication de voix, génération quotidienne à une seule voix | Livres audio, narration en studio, dialogues complexes à plusieurs voix, jeu d'acteur avec des éclats de voix intenses, prononciation difficile, dialectes régionaux |
| Langues dans lesquelles le service est disponible | 101 langues | 130 langues |
| Remplacement recommandé pour | gemini-3.1-flash-tts-preview |
Nouveau niveau de création phare |
Guide de migration
Si vous passez de gemini-3.1-flash-tts-preview à gemini-3.8-flash-lite-tts, mettez à jour vos requêtes pour le schéma Gemini 3.8 TTS :
- Déplacez les instructions au niveau des tours de parole dans
speech_metadata: Gemini 3.8 TTS traite le texte saisi strictement comme une transcription mot à mot. Les instructions textuelles intégrées telles que"Say cheerfully: Hello!"ou"Speaker 1: Hello!"peuvent être lues à voix haute. Déplacez les instructions de diffusion continue (style) et les libellés des locuteurs (speaker) dans les métadonnées structurées :- API Interactions : associez une annotation avec
"type": "speech_metadata","speaker"et"style"à chaque bloc de contenu textuel. - API GenerateContent : ajoutez
"speech_metadata": {"speaker": "...", "style": "..."}à chaquepart.
- API Interactions : associez une annotation avec
- N'utilisez les tags intégrés entre crochets que pour les événements vocaux ponctuels : conservez les vocalises et les pauses momentanées non verbales dans la transcription à l'aide de crochets (par exemple,
<laugh>,<sigh>,<cough>,<breath>ou<short pause>). Placez les styles de diction tels que les chuchotements dansspeech_metadata.style. - Spécifiez
speakerà chaque tour de parole dans les requêtes à plusieurs locuteurs : chaque tour de parole d'une requête à plusieurs locuteurs doit inclure explicitementspeakerdansspeech_metadatacorrespondant à l'un des locuteurs configurés. - Concevez des personas à l'avance avec la conception vocale : remplacez les longs blocs de notes de l'ancien profil audio / du réalisateur par une voix personnalisée créée dans Conception vocale, puis transmettez cet ID
voice_...dans vos requêtes TTS avec des chaînesstyleminimales ou vides. - Tenir compte de la sortie WAV par défaut (
audio/wav) pour les requêtes unaires : contrairement aux modèles TTSgemini-3.1-flash-tts-previewet antérieurs (qui renvoyaient par défaut un PCM brutaudio/l16sans en-tête), Gemini 3.8 TTS renvoie par défaut un fichier audio WAV (audio/wav/AUDIO_WAV) avec un en-tête RIFF standard pour les requêtes unaires.- Si votre code encapsulait auparavant des octets PCM bruts dans un en-tête WAV (par exemple, à l'aide du module
waveou deffmpegde Python), supprimez l'encapsulation manuelle de l'en-tête et écrivez les octets renvoyés directement dans un fichier.wav. - Si votre pipeline nécessite un fichier audio PCM brut sans en-tête, mu-law ou A-law, définissez explicitement
response_format.mime_typesur"audio/l16","audio/mulaw"ou"audio/alaw"(par exemple,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}dans l'API Interactions, ouAUDIO_L16,AUDIO_MULAWouAUDIO_ALAWdansgenerateContent). Consultez Formats de sortie audio.
- Si votre code encapsulait auparavant des octets PCM bruts dans un en-tête WAV (par exemple, à l'aide du module
gemini-3.8-flash-lite-tts
| Propriété | Description |
|---|---|
| Code du modèle | gemini-3.8-flash-lite-tts |
| Types de données acceptés pour |
Entrées Texte Résultat Audio |
| Limites de jetons[*] |
Limite de jetons d'entrée 8 192 Limite de jetons de sortie 16 384 (limite de diffusion de l'API Gemini) |
| Fonctionnalités | Compatible Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported |
| Options de consommation |
Compatible Compatible Compatible |
| Versions |
|
| Dernière mise à jour | Septembre 2026 |
Langues disponibles
gemini-3.8-flash-lite-tts détecte automatiquement la langue d'entrée et est compatible avec plus de 100 langues :
| Langue | Langue | Langue |
|---|---|---|
| Aceh (écriture arabe) | Allemand | Manipuri |
| Afrikaans | Grec | Marathi |
| Akan | Gujarati | Minangkabau (écriture arabe) |
| Amharique | Créole haïtien | Mizo |
| Arménien | Mongol khalkha | Népalais (langue individuelle) |
| Assamais | Haoussa | Peul du Nigeria |
| Awadhi | Hébreu | Azéri du Nord |
| Balinais | Hindi | Sotho du Nord |
| Bengali | Hongrois | Ouzbek du Nord |
| Banjar (alphabet latin) | Islandais | Norvégien bokmål |
| Basque | Ilocano | Nynorsk (norvégien) |
| Belarusian | Indonésien | Chichewa |
| Bhodjpouri | Persan iranien | Odia (langue individuelle) |
| Bosniaque | Italien | Perse (Afghanistan) |
| Bouguis | Japonais | Polonais |
| Bulgare | Javanais | Portugais |
| Cantonais | Kamba | Panjabi |
| Catalan | Kannada | Roumain |
| Cebuano | Cachemiri (écriture arabe) | Russe |
| Sorani | Cachemiri (Devanagari) | Santali |
| Chhattisgarhi | Kazakh | Serbe |
| Chinois (script Hans) | Khmer | Cingalais |
| Chinois (script Hant) | Kikuyu | Slovaque |
| Croate | Kinyarwanda | Azéri |
| Tchèque | Kongo | Pachto du Sud |
| Danois | Coréen | Espagnol |
| Néerlandais | Kirghiz | Arabe standard (écriture arabe) |
| Arabe (Égypte) | Laotien | Arabe standard (alphabet latin) |
| Anglais | Lingala | Letton standard |
| Estonien | Macédonien | Malais standard |
| Tagalog | Magahi | Tamoul |
| Français | Maithili | Telugu |
| Galicien | Malayalam | Turc |
| Ganda | Maltais | Vietnamien |
| Géorgien | — | — |