Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) ist das kreative Flaggschiff-Modell für Text-zu-Sprache von Google. Es wurde für Sprachwiedergabe in Studioqualität, ausdrucksstarke Darstellungen, authentische regionale Akzente und eine solide Stabilität bei langen Unterhaltungen mit mehreren Zügen entwickelt.
Übersicht und Funktionen
Gemini 3.8 Flash TTS setzt neue Maßstäbe für die expressive Audiogenerierung:
- Hohe akustische Wiedergabetreue und schauspielerische Nuancen:Die Stimme bietet einen großen emotionalen Bereich, einen natürlichen Rhythmus und eine präzise Einhaltung der
style-Anweisungen auf Turn-Ebene und der Inline-Gesangsereignisse (<laugh>,<sigh>,<short pause>). - Stabilität bei langen Mehrfachdialogen: Die Stimme behält über längere Dialoge und minutenlange Erzählungen hinweg eine gleichbleibende Identität, Klangfarbe, Lautstärke und akustische Raumtonart bei, ohne dass es zu Abweichungen kommt.
- Authentische regionale Akzente und Aussprache:Unterstützt regionale Akzente, Minderheitendialekte und Inline-Überschreibungen des Internationalen Phonetischen Alphabets (IPA).
- Unterstützung des gesamten Sprach-Ökosystems:Funktioniert nahtlos mit vordefinierten Stimmen, der Extended Voice Library (
GET /v1beta/voices), benutzerdefinierten Voice Design-Personas und Voice Replication (standardmäßig persistent gespeicherte Stimmen sowie optionale statuslose Schlüssel). Sie können Stimmen auch interaktiv in Google AI Studio entwerfen und replizieren.
Im Leitfaden zu Text-to-Speech finden Sie eine vollständige Beschreibung der Funktionen, Best Practices für Prompts und Codebeispiele.
Wann welches TTS-Modell verwendet werden sollte
Beide Gemini 3.8-TTS-Modelle haben dasselbe API-Schema und dieselbe Prompting-Struktur. Wählen Sie das Modell aus, das zu Ihrer Arbeitslast passt:
| Funktion / Arbeitslast | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Primäre Stärke | Maximale Stimmwiedergabe, schauspielerische Nuancen und Dialektabdeckung | Hoher Durchsatz, niedrige Latenz und Kosteneffizienz |
| Ideale Anwendungsfälle | Hörbücher, Studio-Voiceover, komplexe Dialoge mit mehreren Sprechern, intensive Sprechpassagen, schwierige Aussprache, regionale Dialekte | Produktion in großem Umfang, Echtzeit-Sprachagenten-Kaskaden, Vorlesefunktionen, Sprachreplikation, Generierung mit einem einzelnen Sprecher |
| Unterstützte Sprachen | 130 Sprachen | 101 Sprachen |
| Empfohlener Ersatz für | Neue Flagship-Creative-Stufe | gemini-3.1-flash-tts-preview |
Migrationsanleitung
Wenn Sie von gemini-3.1-flash-tts-preview oder früheren Gemini TTS-Modellen migrieren, aktualisieren Sie Ihre Anfragen für das Gemini 3.8 TTS-Schema:
- Anweisungen auf Turn-Ebene in
speech_metadataverschieben:Bei Gemini 3.8 TTS wird der eingegebene Text streng als wörtliches Transkript behandelt. Inline-Textanweisungen wie"Say cheerfully: Hello!"oder"Speaker 1: Hello!"können laut vorgelesen werden. Anweisungen für die fortlaufende Bereitstellung (style) und Sprecherlabels (speaker) in strukturierte Metadaten verschieben:- Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit
"type": "speech_metadata","speaker"und"style"an. - GenerateContent API:Hängen Sie
"speech_metadata": {"speaker": "...", "style": "..."}an jedespartan.
- Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit
- Winkelklammern nur für einmalige stimmliche Ereignisse verwenden:Kurze stimmliche Äußerungen und Pausen, die keine Sprache sind, mit Winkelklammern (z. B.
<laugh>,<sigh>,<cough>,<breath>oder<short pause>) in das Transkript einfügen. Sprechstile wie Flüstern inspeech_metadata.styleeinfügen. speakerin jeder Äußerung in Anfragen mit mehreren Sprechern angeben:Jede Äußerung in einer Anfrage mit mehreren Sprechern mussspeakerinnerhalb vonspeech_metadataenthalten, das mit einem der konfigurierten Sprecher übereinstimmt.- Design-Personas im Voraus mit Voice Design erstellen:Ersetzen Sie lange Audio-Profil-/Regieanmerkungsblöcke durch eine benutzerdefinierte Stimme, die in Voice Design erstellt wurde, und übertragen Sie dann die
voice_...-ID in Ihre TTS-Anfragen mit minimalen oder leerenstyle-Strings. - Standard-WAV-Ausgabe (
audio/wav) für unäre Anfragen berücksichtigen:Im Gegensatz zugemini-3.1-flash-tts-previewund früheren TTS-Modellen, die standardmäßig headerloses rohes PCMaudio/l16zurückgegeben haben, gibt Gemini 3.8 TTS standardmäßig WAV-Audio (audio/wav/AUDIO_WAV) mit einem Standard-RIFF-Header für unäre Anfragen zurück.- Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem
wave-Modul oderffmpegvon Python), entfernen Sie den manuellen Header-Wrapper und schreiben Sie die zurückgegebenen Bytes direkt in eine.wav-Datei. - Wenn für Ihre Pipeline headerloses rohes PCM-, Mu-Law- oder A-Law-Audio erforderlich ist, legen Sie
response_formatexplizit auf"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") oder"audio/alaw"("AUDIO_ALAW") fest. Weitere Informationen finden Sie unter Audioausgabeformate.
- Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem
gemini-3.8-flash-tts
| Attribut | Beschreibung |
|---|---|
| Modellcode | gemini-3.8-flash-tts |
| Unterstützte Datentypen |
Eingaben Text Ausgabe Audio |
| Token-Limits[*] |
Eingabetokenlimit 8.192 Tokenausgabelimit 16.384 |
| Funktionen | Unterstützt Unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt |
| Nutzungsoptionen |
Unterstützt Unterstützt Unterstützt |
| -Versionen |
|
| Letzte Aktualisierung | Juli 2026 |
Unterstützte Sprachen
gemini-3.8-flash-tts erkennt die Eingabesprache automatisch und unterstützt 130 Sprachen:
| Sprache | Sprache | Sprache |
|---|---|---|
| Achinesisch (arabische Schrift) | Griechisch | Nepalesisch (einzelne Sprache) |
| Afrikaans | Guarani | Nigerianisches Fulfulde |
| Akan | Gujarati | Nordaserbaidschanisch |
| Amharisch | Haitianisch | Nord-Sotho |
| Armenisch | Halch-Mongolisch | Nordusbekisch |
| Assamesisch | Hausa | Norwegisch Bokmål |
| Awadhi | Hebräisch | Norwegisch (Nynorsk) |
| Balinesisch | Hindi | Chichewa |
| Bengalisch | Ungarisch | Okzitanisch |
| Banjaresisch (arabische Schrift) | Isländisch | Odia (einzelne Sprache) |
| Banjaresisch (lateinische Schrift) | Igbo | Pangasinensisch |
| Baschkirisch | Ilokano | Persisch (Afghanistan) |
| Baskisch | Indonesisch | Polnisch |
| Belarussisch | Iranisches Persisch | Portugiesisch |
| Bemba | Italienisch | Punjabi |
| Bhojpuri | Japanisch | Rumänisch |
| Bosnisch | Javanisch | Russisch |
| Buginesisch | Kabylisch | Santali |
| Bulgarisch | Kikamba | Serbisch |
| Burmesisch | Kannada | Sindhi |
| Kantonesisch | Kashmiri (arabische Schrift) | Singhalesisch |
| Katalanisch | Kashmiri (Deva-Schrift) | Slowakisch |
| Cebuano | Kasachisch | Slowenisch |
| Sorani | Khmer | Somali |
| Chhattisgarhi | Kikuyu | Südaserbaidschanisch |
| Chinesisch (Hans-Schrift) | Kinyarwanda | Südliches Paschtu |
| Chinesisch (Hant-Schrift) | Kongo | Sesotho |
| Krimtatarisch | Koreanisch | Spanisch |
| Kroatisch | Kirgisisch | Standardarabisch (arabische Schrift) |
| Tschechien | Lao | Standardarabisch (lateinische Schrift) |
| Dänisch | Lettgallisch | Standard-Lettisch |
| Niederländisch | Lingala | Standard-Malaiisch |
| Dioula | Litauisch | Swahili (einzelne Sprache) |
| Dzongkha | Luxemburgisch | Siswati |
| Arabisch (Ägypten) | Makedonisch | Schwedisch |
| Englisch | Magahi | Tadschikisch |
| Estnisch | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finnisch | Maltesisch | Thailändisch |
| Französisch | Meitei | Tigrinya |
| Galizisch | Marathi | Toskisch |
| Ganda | Minangkabauisch (arabische Schrift) | Uigurisch |
| Georgisch | Minangkabauisch (lateinische Schrift) | – |
| Deutsch | Mizo | – |