Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) ist das kreative Flaggschiff-Modell für Text-zu-Sprache von Google. Es wurde für Sprachwiedergabe in Studioqualität, ausdrucksstarke Darstellungen, authentische regionale Akzente und eine solide Stabilität bei langen Unterhaltungen mit mehreren Zügen entwickelt.

Übersicht und Funktionen

Gemini 3.8 Flash TTS setzt neue Maßstäbe für die expressive Audiogenerierung:

  • Hohe akustische Wiedergabetreue und schauspielerische Nuancen:Die Stimme bietet einen großen emotionalen Bereich, einen natürlichen Rhythmus und eine präzise Einhaltung der style-Anweisungen auf Turn-Ebene und der Inline-Gesangsereignisse (<laugh>, <sigh>, <short pause>).
  • Stabilität bei langen Mehrfachdialogen: Die Stimme behält über längere Dialoge und minutenlange Erzählungen hinweg eine gleichbleibende Identität, Klangfarbe, Lautstärke und akustische Raumtonart bei, ohne dass es zu Abweichungen kommt.
  • Authentische regionale Akzente und Aussprache:Unterstützt regionale Akzente, Minderheitendialekte und Inline-Überschreibungen des Internationalen Phonetischen Alphabets (IPA).
  • Unterstützung des gesamten Sprach-Ökosystems:Funktioniert nahtlos mit vordefinierten Stimmen, der Extended Voice Library (GET /v1beta/voices), benutzerdefinierten Voice Design-Personas und Voice Replication (standardmäßig persistent gespeicherte Stimmen sowie optionale statuslose Schlüssel). Sie können Stimmen auch interaktiv in Google AI Studio entwerfen und replizieren.

Im Leitfaden zu Text-to-Speech finden Sie eine vollständige Beschreibung der Funktionen, Best Practices für Prompts und Codebeispiele.

Wann welches TTS-Modell verwendet werden sollte

Beide Gemini 3.8-TTS-Modelle haben dasselbe API-Schema und dieselbe Prompting-Struktur. Wählen Sie das Modell aus, das zu Ihrer Arbeitslast passt:

Funktion / Arbeitslast Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Primäre Stärke Maximale Stimmwiedergabe, schauspielerische Nuancen und Dialektabdeckung Hoher Durchsatz, niedrige Latenz und Kosteneffizienz
Ideale Anwendungsfälle Hörbücher, Studio-Voiceover, komplexe Dialoge mit mehreren Sprechern, intensive Sprechpassagen, schwierige Aussprache, regionale Dialekte Produktion in großem Umfang, Echtzeit-Sprachagenten-Kaskaden, Vorlesefunktionen, Sprachreplikation, Generierung mit einem einzelnen Sprecher
Unterstützte Sprachen 130 Sprachen 101 Sprachen
Empfohlener Ersatz für Neue Flagship-Creative-Stufe gemini-3.1-flash-tts-preview

Migrationsanleitung

Wenn Sie von gemini-3.1-flash-tts-preview oder früheren Gemini TTS-Modellen migrieren, aktualisieren Sie Ihre Anfragen für das Gemini 3.8 TTS-Schema:

  1. Anweisungen auf Turn-Ebene in speech_metadata verschieben:Bei Gemini 3.8 TTS wird der eingegebene Text streng als wörtliches Transkript behandelt. Inline-Textanweisungen wie "Say cheerfully: Hello!" oder "Speaker 1: Hello!" können laut vorgelesen werden. Anweisungen für die fortlaufende Bereitstellung (style) und Sprecherlabels (speaker) in strukturierte Metadaten verschieben:
    • Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit "type": "speech_metadata", "speaker" und "style" an.
    • GenerateContent API:Hängen Sie "speech_metadata": {"speaker": "...", "style": "..."} an jedes part an.
  2. Winkelklammern nur für einmalige stimmliche Ereignisse verwenden:Kurze stimmliche Äußerungen und Pausen, die keine Sprache sind, mit Winkelklammern (z. B. <laugh>, <sigh>, <cough>, <breath> oder <short pause>) in das Transkript einfügen. Sprechstile wie Flüstern in speech_metadata.style einfügen.
  3. speaker in jeder Äußerung in Anfragen mit mehreren Sprechern angeben:Jede Äußerung in einer Anfrage mit mehreren Sprechern muss speaker innerhalb von speech_metadata enthalten, das mit einem der konfigurierten Sprecher übereinstimmt.
  4. Design-Personas im Voraus mit Voice Design erstellen:Ersetzen Sie lange Audio-Profil-/Regieanmerkungsblöcke durch eine benutzerdefinierte Stimme, die in Voice Design erstellt wurde, und übertragen Sie dann die voice_...-ID in Ihre TTS-Anfragen mit minimalen oder leeren style-Strings.
  5. Standard-WAV-Ausgabe (audio/wav) für unäre Anfragen berücksichtigen:Im Gegensatz zu gemini-3.1-flash-tts-preview und früheren TTS-Modellen, die standardmäßig headerloses rohes PCM audio/l16 zurückgegeben haben, gibt Gemini 3.8 TTS standardmäßig WAV-Audio (audio/wav / AUDIO_WAV) mit einem Standard-RIFF-Header für unäre Anfragen zurück.
    • Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem wave-Modul oder ffmpeg von Python), entfernen Sie den manuellen Header-Wrapper und schreiben Sie die zurückgegebenen Bytes direkt in eine .wav-Datei.
    • Wenn für Ihre Pipeline headerloses rohes PCM-, Mu-Law- oder A-Law-Audio erforderlich ist, legen Sie response_format explizit auf "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") oder "audio/alaw" ("AUDIO_ALAW") fest. Weitere Informationen finden Sie unter Audioausgabeformate.

gemini-3.8-flash-tts

Attribut Beschreibung
Modellcode gemini-3.8-flash-tts
Unterstützte Datentypen

Eingaben

Text

Ausgabe

Audio

Token-Limits[*]

Eingabetokenlimit

8.192

Tokenausgabelimit

16.384

Funktionen

Audiogenerierung

Unterstützt

Caching

Unterstützt

Code-Ausführung

Nicht unterstützt

Dateisuche

Nicht unterstützt

Funktionsaufrufe

Nicht unterstützt

Fundierung mit Google Maps

Nicht unterstützt

Bildgenerierung

Nicht unterstützt

Live API

Nicht unterstützt

Suchfundierung

Nicht unterstützt

Strukturierte Ausgaben

Nicht unterstützt

Antwort wird generiert

Nicht unterstützt

URL-Kontext

Nicht unterstützt

Nutzungsoptionen

Batch API

Unterstützt

Flex-Inferenz

Unterstützt

Prioritätsinferenz

Unterstützt

-Versionen
Weitere Informationen finden Sie unter Muster für Modellversionen.
  • gemini-3.8-flash-tts
Letzte Aktualisierung Juli 2026

Unterstützte Sprachen

gemini-3.8-flash-tts erkennt die Eingabesprache automatisch und unterstützt 130 Sprachen:

Sprache Sprache Sprache
Achinesisch (arabische Schrift) Griechisch Nepalesisch (einzelne Sprache)
Afrikaans Guarani Nigerianisches Fulfulde
Akan Gujarati Nordaserbaidschanisch
Amharisch Haitianisch Nord-Sotho
Armenisch Halch-Mongolisch Nordusbekisch
Assamesisch Hausa Norwegisch Bokmål
Awadhi Hebräisch Norwegisch (Nynorsk)
Balinesisch Hindi Chichewa
Bengalisch Ungarisch Okzitanisch
Banjaresisch (arabische Schrift) Isländisch Odia (einzelne Sprache)
Banjaresisch (lateinische Schrift) Igbo Pangasinensisch
Baschkirisch Ilokano Persisch (Afghanistan)
Baskisch Indonesisch Polnisch
Belarussisch Iranisches Persisch Portugiesisch
Bemba Italienisch Punjabi
Bhojpuri Japanisch Rumänisch
Bosnisch Javanisch Russisch
Buginesisch Kabylisch Santali
Bulgarisch Kikamba Serbisch
Burmesisch Kannada Sindhi
Kantonesisch Kashmiri (arabische Schrift) Singhalesisch
Katalanisch Kashmiri (Deva-Schrift) Slowakisch
Cebuano Kasachisch Slowenisch
Sorani Khmer Somali
Chhattisgarhi Kikuyu Südaserbaidschanisch
Chinesisch (Hans-Schrift) Kinyarwanda Südliches Paschtu
Chinesisch (Hant-Schrift) Kongo Sesotho
Krimtatarisch Koreanisch Spanisch
Kroatisch Kirgisisch Standardarabisch (arabische Schrift)
Tschechien Lao Standardarabisch (lateinische Schrift)
Dänisch Lettgallisch Standard-Lettisch
Niederländisch Lingala Standard-Malaiisch
Dioula Litauisch Swahili (einzelne Sprache)
Dzongkha Luxemburgisch Siswati
Arabisch (Ägypten) Makedonisch Schwedisch
Englisch Magahi Tadschikisch
Estnisch Maithili Tamil
Filipino Malayalam Telugu
Finnisch Maltesisch Thailändisch
Französisch Meitei Tigrinya
Galizisch Marathi Toskisch
Ganda Minangkabauisch (arabische Schrift) Uigurisch
Georgisch Minangkabauisch (lateinische Schrift)
Deutsch Mizo