Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) ist das Flaggschiff-Modell von Google für kreative Text-zu-Sprache. Es wurde für Sprachqualität auf Studioniveau, ausdrucksstarke Darstellungen, authentische regionale Akzente und eine solide Stabilität bei langen Unterhaltungen mit mehreren Zügen entwickelt.
Übersicht und Funktionen
Gemini 3.8 Flash TTS setzt neue Maßstäbe für die expressive Audio-Generierung:
- Hohe akustische Wiedergabetreue und schauspielerische Nuancen:Die Stimme bietet einen großen emotionalen Bereich, einen natürlichen Rhythmus und eine präzise Einhaltung der
style-Anweisungen auf Turn-Ebene und der Inline-Gesangsereignisse (<laugh>,<sigh>,<short pause>). - Stabilität bei langen Dialogen: Die Stimme behält über längere Dialoge und mehr als eine Minute lange Erzählungen hinweg eine gleichbleibende Identität, Klangfarbe, Lautstärke und akustische Raumwahrnehmung bei, ohne dass es zu Abweichungen kommt.
- Authentische regionale Akzente und Aussprache:Unterstützt regionale Akzente und Minderheitendialekte.
- Unterstützung des gesamten Sprach-Ökosystems:Funktioniert nahtlos mit integrierten Stimmen, der Extended Voice Library (
GET /v1beta/voices), benutzerdefinierten Voice Design-Personas und Voice Replication (standardmäßig nichtflüchtig gespeicherte Stimmen sowie optionale zustandslose Schlüssel). Sie können Stimmen auch interaktiv in Google AI Studio entwerfen und replizieren.
Im Leitfaden zu Text-to-Speech finden Sie eine vollständige Beschreibung der Funktionen, Best Practices für Prompts und Codebeispiele.
Wann welches TTS-Modell verwendet werden sollte
Beide Gemini 3.8-TTS-Modelle haben dasselbe API-Schema und dieselbe Prompting-Struktur. Wählen Sie das Modell aus, das zu Ihrer Arbeitslast passt:
| Funktion / Arbeitslast | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Primäre Stärke | Maximale Stimmwiedergabe, schauspielerische Nuancen und Dialektabdeckung | Hoher Durchsatz, niedrige Latenz und Kosteneffizienz |
| Ideale Anwendungsfälle | Hörbücher, Studio-Voiceover, komplexe Dialoge mit mehreren Sprechern, intensive Sprechpassagen, schwierige Aussprache, regionale Dialekte | Produktion in großem Umfang, Echtzeit-Sprachagenten-Kaskaden, Vorlesefunktionen, Sprachreplikation, Generierung mit einem einzelnen Sprecher |
| Unterstützte Sprachen | 130 Sprachen | 101 Sprachen |
| Empfohlener Ersatz für | Neue Flagship-Creative-Stufe | gemini-3.1-flash-tts-preview |
Migrationsanleitung
Wenn Sie von gemini-3.1-flash-tts-preview oder früheren Gemini TTS-Modellen migrieren, aktualisieren Sie Ihre Anfragen für das Gemini 3.8 TTS-Schema:
- Anweisungen auf Turn-Ebene in
speech_metadataverschieben:Gemini 3.8 TTS behandelt Eingabetext streng als wörtliches Transkript. Inline-Textanweisungen wie"Say cheerfully: Hello!"oder"Speaker 1: Hello!"können vorgelesen werden. Verschieben Sie die Anweisungen zur kontinuierlichen Bereitstellung (style) und die Sprecherlabels (speaker) in strukturierte Metadaten:- Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit
"type": "speech_metadata","speaker"und"style"an. - GenerateContent API:Hängen Sie
"speech_metadata": {"speaker": "...", "style": "..."}an jedespartan.
- Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit
- Winkelklammern nur für einmalige stimmliche Ereignisse verwenden:Kurze stimmliche Äußerungen und Pausen, die keine Sprache sind, mit Winkelklammern (z. B.
<laugh>,<sigh>,<cough>,<breath>oder<short pause>) in das Transkript einfügen. Sprechstile wie Flüstern inspeech_metadata.stylesetzen. speakerin jeder Äußerung in Anfragen mit mehreren Sprechern angeben:Jede Äußerung in einer Anfrage mit mehreren Sprechern mussspeakerexplizit inspeech_metadataenthalten, das mit einem der konfigurierten Sprecher übereinstimmt.- Design-Personas im Voraus mit Voice Design erstellen:Ersetzen Sie lange Audio-Profil-/Regieanmerkungsblöcke mit einer benutzerdefinierten Stimme, die in Voice Design erstellt wurde, und übertragen Sie dann die
voice_...-ID über Ihre TTS-Anfragen mit minimalen oder leerenstyle-Strings. - Standard-WAV-Ausgabe (
audio/wav) bei unären Anfragen berücksichtigen:Im Gegensatz zugemini-3.1-flash-tts-previewund früheren TTS-Modellen (die standardmäßig headerloses rohes PCMaudio/l16zurückgegeben haben) gibt Gemini 3.8 TTS standardmäßig WAV-Audio (audio/wav/AUDIO_WAV) mit einem Standard-RIFF-Header für unäre Anfragen zurück.- Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem
wave-Modul oderffmpegvon Python), entfernen Sie den manuellen Header-Wrapper und schreiben Sie die zurückgegebenen Bytes direkt in eine.wav-Datei. - Wenn für Ihre Pipeline Header-loses unkomprimiertes PCM-, Mu-Law- oder A-Law-Audio erforderlich ist, legen Sie
response_format.mime_typeexplizit auf"audio/l16","audio/mulaw"oder"audio/alaw"fest (z. B.{"response_format": {"type": "audio", "mime_type": "audio/l16"}}in der Interactions API oderAUDIO_L16,AUDIO_MULAWoderAUDIO_ALAWingenerateContent). Weitere Informationen finden Sie unter Audioausgabeformate.
- Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem
gemini-3.8-flash-tts
| Attribut | Beschreibung |
|---|---|
| Modellcode | gemini-3.8-flash-tts |
| Unterstützte Datentypen |
Eingaben Text Ausgabe Audio |
| Token-Limits[*] |
Eingabetokenlimit 8.192 Tokenausgabelimit 16.384 (Gemini API-Bereitstellungslimit) |
| Funktionen | Unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt |
| Nutzungsoptionen |
Unterstützt Unterstützt Unterstützt |
| Versionen |
|
| Letzte Aktualisierung | September 2026 |
Unterstützte Sprachen
gemini-3.8-flash-tts erkennt die Eingabesprache automatisch und unterstützt über 130 Sprachen:
| Sprache | Sprache | Sprache |
|---|---|---|
| Achinesisch (arabische Schrift) | Griechisch | Nepalesisch (einzelne Sprache) |
| Afrikaans | Guarani | Nigerianisches Fulfulde |
| Akan | Gujarati | Nordaserbaidschanisch |
| Amharisch | Haitianisch | Nord-Sotho |
| Armenisch | Halch-Mongolisch | Nordusbekisch |
| Assamesisch | Hausa | Norwegisch Bokmål |
| Awadhi | Hebräisch | Norwegisch (Nynorsk) |
| Balinesisch | Hindi | Chichewa |
| Bengalisch | Ungarisch | Okzitanisch |
| Banjaresisch (arabische Schrift) | Isländisch | Odia (einzelne Sprache) |
| Banjaresisch (lateinische Schrift) | Igbo | Pangasinensisch |
| Baschkirisch | Ilokano | Persisch (Afghanistan) |
| Baskisch | Indonesisch | Polnisch |
| Belarusian | Iranisches Persisch | Portugiesisch |
| Bemba | Italienisch | Punjabi |
| Bhojpuri | Japanisch | Rumänisch |
| Bosnisch | Javanisch | Russisch |
| Buginesisch | Kabylisch | Santali |
| Bulgarisch | Kikamba | Serbisch |
| Burmesisch | Kannada | Sindhi |
| Kantonesisch | Kashmiri (arabische Schrift) | Singhalesisch |
| Katalanisch | Kashmiri (Devanagari-Schrift) | Slowakisch |
| Cebuano | Kasachisch | Slowenisch |
| Sorani | Khmer | Somali |
| Chhattisgarhi | Kikuyu | Südaserbaidschanisch |
| Chinesisch (Hans-Schrift) | Kinyarwanda | Südliches Paschtu |
| Chinesisch (Hant-Schrift) | Kongo | Sesotho |
| Krimtatarisch | Koreanisch | Spanisch |
| Kroatisch | Kirgisisch | Standardarabisch (arabische Schrift) |
| Tschechien | Lao | Standardarabisch (lateinische Schrift) |
| Dänisch | Lettgallisch | Standard-Lettisch |
| Niederländisch | Lingala | Standard-Malaiisch |
| Dioula | Litauisch | Suaheli (einzelne Sprache) |
| Dzongkha | Luxemburgisch | Siswati |
| Arabisch (Ägypten) | Mazedonisch | Schwedisch |
| Englisch | Magahi | Tadschikisch |
| Estnisch | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finnisch | Maltesisch | Thailändisch |
| Französisch | Meitei | Tigrinya |
| Galizisch | Marathi | Toskisch |
| Ganda | Minangkabauisch (arabische Schrift) | Türkisch |
| Georgisch | Minangkabauisch (lateinische Schrift) | Uigurisch |
| Deutsch | Mizo | Vietnamesisch |