Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) est le modèle de synthèse vocale créatif phare de Google. Il est conçu pour offrir une fidélité vocale de qualité studio, un jeu d'acteur expressif, des accents régionaux authentiques et une stabilité à toute épreuve pour les conversations longues et multitours.
Présentation et fonctionnalités
Gemini 3.8 Flash TTS établit une nouvelle référence en matière de génération audio expressive :
- Fidélité acoustique et nuances de jeu d'acteur élevées : offre une riche gamme d'émotions, une cadence naturelle et un respect précis des instructions
styleau niveau du tour et des événements vocaux intégrés (<laugh>,<sigh>,<short pause>). - Stabilité des conversations longues et multitours : l'identité vocale, le timbre, le volume et le ton acoustique de la pièce restent cohérents tout au long des dialogues prolongés et des narrations de plusieurs minutes, sans décalage de la voix.
- Prononciation et accents régionaux authentiques : prend en charge les accents régionaux, les dialectes minoritaires et les remplacements en ligne de l'alphabet phonétique international (API).
- Compatibilité complète avec l'écosystème vocal : fonctionne parfaitement avec les voix prédéfinies, la bibliothèque vocale étendue (
GET /v1beta/voices), les personas de conception vocale personnalisés et la réplication vocale (voix stockées de manière persistante par défaut, avec des clés sans état facultatives). Vous pouvez également concevoir et répliquer des voix de manière interactive dans Google AI Studio.
Consultez le guide Text-to-Speech pour obtenir une couverture complète des fonctionnalités, des bonnes pratiques concernant les requêtes et des exemples de code.
Quand utiliser quel modèle TTS ?
Les deux modèles Gemini 3.8 TTS partagent le même schéma d'API et la même structure d'invite. Choisissez le modèle qui correspond à votre charge de travail :
| Fonctionnalité / Charge de travail | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Force principale | Fidélité vocale, nuances de jeu d'acteur et couverture des dialectes maximales | Haut débit, faible latence et rentabilité |
| Meilleurs cas d'utilisation | Livres audio, narration en studio, dialogues complexes à plusieurs voix, jeu d'acteur avec des éclats de voix importants, prononciation difficile, dialectes régionaux | Production à grand volume, cascades d'agents vocaux en temps réel, fonctionnalités de lecture à voix haute, réplication de voix, génération quotidienne à une seule voix |
| Langues dans lesquelles le service est disponible | 130 langues | 101 langues |
| Remplacement recommandé pour | Nouveau niveau de création phare | gemini-3.1-flash-tts-preview |
Guide de migration
Si vous migrez depuis des modèles Gemini TTS gemini-3.1-flash-tts-preview ou antérieurs, mettez à jour vos requêtes pour le schéma Gemini 3.8 TTS :
- Déplacez les instructions au niveau des tours dans
speech_metadata: Gemini 3.8 TTS traite le texte saisi strictement comme une transcription mot pour mot. Les instructions textuelles intégrées, comme"Say cheerfully: Hello!"ou"Speaker 1: Hello!", peuvent être lues à voix haute. Déplacez les instructions de diffusion continue (style) et les identifiants des intervenants (speaker) dans les métadonnées structurées :- API Interactions : associez une annotation avec
"type": "speech_metadata","speaker"et"style"à chaque bloc de contenu textuel. - API GenerateContent : associez
"speech_metadata": {"speaker": "...", "style": "..."}à chaquepart.
- API Interactions : associez une annotation avec
- N'utilisez les tags intégrés entre crochets que pour les événements vocaux ponctuels : conservez les vocalisations et les pauses momentanées non liées à la parole dans la transcription à l'aide de crochets (par exemple,
<laugh>,<sigh>,<cough>,<breath>ou<short pause>). Placez les styles de diction tels que les chuchotements dansspeech_metadata.style. - Spécifiez
speakerà chaque tour dans les requêtes à plusieurs locuteurs : chaque tour d'une requête à plusieurs locuteurs doit inclure explicitementspeakerdansspeech_metadatacorrespondant à l'un des locuteurs configurés. - Concevez des personas en amont avec la conception vocale : remplacez les longs blocs d'anciens profils audio / notes du réalisateur par une voix personnalisée créée dans Conception vocale, puis transmettez cet ID
voice_...dans vos requêtes de synthèse vocale avec des chaînesstyleminimales ou vides. - Tenir compte de la sortie WAV par défaut (
audio/wav) pour les requêtes unaires : contrairement aux modèles TTSgemini-3.1-flash-tts-previewet antérieurs (qui renvoyaient par défaut un PCM brutaudio/l16sans en-tête), Gemini 3.8 TTS renvoie par défaut un fichier audio WAV (audio/wav/AUDIO_WAV) avec un en-tête RIFF standard pour les requêtes unaires.- Si votre code encapsulait auparavant des octets PCM bruts dans un en-tête WAV (par exemple, à l'aide du module
waveou deffmpegde Python), supprimez l'encapsulation manuelle de l'en-tête et écrivez les octets renvoyés directement dans un fichier.wav. - Si votre pipeline nécessite un fichier audio PCM, mu-law ou A-law brut sans en-tête, définissez explicitement
response_formatsur"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") ou"audio/alaw"("AUDIO_ALAW"). Consultez Formats de sortie audio.
- Si votre code encapsulait auparavant des octets PCM bruts dans un en-tête WAV (par exemple, à l'aide du module
gemini-3.8-flash-tts
| Propriété | Description |
|---|---|
| Code du modèle | gemini-3.8-flash-tts |
| Types de données acceptés pour |
Entrées Texte Résultat Audio |
| Limites de jetons[*] |
Limite de jetons d'entrée 8 192 Limite de jetons de sortie 16 384 |
| Fonctionnalités | Compatible Compatible Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported Not supported |
| Options de consommation |
Compatible Compatible Compatible |
| Versions |
|
| Dernière mise à jour | Juillet 2026 |
Langues disponibles
gemini-3.8-flash-tts détecte automatiquement la langue d'entrée et est compatible avec 130 langues :
| Langue | Langue | Langue |
|---|---|---|
| Aceh (écriture arabe) | Grec | Népalais (langue individuelle) |
| Afrikaans | Guarani | Peul du Nigeria |
| Akan | Gujarati | Azerbaïdjanais du Nord |
| Amharique | Créole haïtien | Sotho du Nord |
| Arménien | Mongol khalkha | Ouzbek du Nord |
| Assamais | Haoussa | Norvégien bokmål |
| Awadhi | Hébreu | Nynorsk (norvégien) |
| Balinais | Hindi | Chichewa |
| Bengali | Hongrois | Occitan |
| Banjar (écriture arabe) | Islandais | Odia (langue individuelle) |
| Banjar (alphabet latin) | Igbo | Pangasinan |
| Bachkir | Ilocano | Perse (Afghanistan) |
| Basque | Indonésien | Polonais |
| Biélorusse | Persan iranien | Portugais |
| Bemba | Italien | Panjabi |
| Bhodjpouri | Japonais | Roumain |
| Bosniaque | Javanais | Russe |
| Bouguis | Kabyle | Santali |
| Bulgare | Kamba | Serbe |
| Birman | Kannada | Sindhî |
| Cantonais | Cachemiri (écriture arabe) | Cingalais |
| Catalan | Cachemiri (Devanagari) | Slovaque |
| Cebuano | Kazakh | Slovène |
| Sorani | Khmer | Somali |
| Chhattisgarhi | Kikuyu | Azéri |
| Chinois (script Hans) | Kinyarwanda | Pachto du Sud |
| Chinois (script Hant) | Kongo | Sotho du Sud |
| Tatar de Crimée | Coréen | Espagnol |
| Croate | Kirghiz | Arabe standard (écriture arabe) |
| Tchèque | Laotien | Arabe standard (alphabet latin) |
| Danois | Latgalien | Letton standard |
| Néerlandais | Lingala | Malais standard |
| Dioula | Lituanien | Swahili (langue individuelle) |
| Dzongkha | Luxembourgeois | Swati |
| Arabe (Égypte) | Macédonien | Suédois |
| Anglais | Magahi | Tadjik |
| Estonien | Maithili | Tamoul |
| Tagalog | Malayalam | Telugu |
| Finnois | Maltais | Thaï |
| Français | Manipuri | Tigrinya |
| Galicien | Marathi | Tosque albanais |
| Ganda | Minangkabau (écriture arabe) | Ouïghour |
| Géorgien | Minangkabau (alphabet latin) | — |
| Allemand | Mizo | — |