Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) ist das schnelle, kostengünstige Text-zu-Sprache-Modell von Google für den Alltag, das gemini-3.1-flash-tts-preview für Produktions-Workloads mit hohem Durchsatz ersetzen soll.
Übersicht und Funktionen
Gemini 3.8 Flash-Lite TTS kombiniert niedrige Latenz mit ausdrucksstarker, natürlicher Sprache:
- Effizienz bei hohem Durchsatz:Optimiert für die Massenproduktion, Konversations-Voice-Agent-Kaskaden, Vorlesefunktionen und die Sprachgenerierung mit einem einzelnen Sprecher in den wichtigsten Sprachen.
- Drop-in-Schema-Kompatibilität:Das API-Schema und das Format für strukturierte Prompts sind genau wie bei
gemini-3.8-flash-tts. So können Sie Modelle mit einer einzigen Parameteränderung wechseln. - Unterstützung des gesamten Voice-Ökosystems:Unterstützt vordefinierte Stimmen, die Extended Voice Library (
GET /v1beta/voices), benutzerdefinierte Voice Design-Personas und die Sprachreplikation (standardmäßig persistent gespeicherte Stimmen sowie optionale statuslose Schlüssel). Sie können Stimmen auch interaktiv in Google AI Studio entwerfen und replizieren.
Im Leitfaden zu Text-to-Speech finden Sie eine vollständige Beschreibung der Funktionen, Best Practices für Prompts und Codebeispiele.
Wann welches TTS-Modell verwendet werden sollte
Beide Gemini 3.8-TTS-Modelle haben dasselbe API-Schema und dieselbe Prompting-Struktur. Wählen Sie das Modell aus, das zu Ihrer Arbeitslast passt:
| Funktion / Arbeitslast | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Primäre Stärke | Hoher Durchsatz, niedrige Latenz und Kosteneffizienz | Maximale Stimmwiedergabe, schauspielerische Nuancen und Dialektabdeckung |
| Ideale Anwendungsfälle | Produktion in großem Umfang, Echtzeit-Sprachagenten-Kaskaden, Vorlesefunktionen, Sprachreplikation, Generierung mit einem einzelnen Sprecher | Hörbücher, Studio-Voiceover, komplexe Dialoge mit mehreren Sprechern, intensive Gesangseinlagen, schwierige Aussprache, regionale Dialekte |
| Unterstützte Sprachen | 101 Sprachen | 130 Sprachen |
| Empfohlener Ersatz für | gemini-3.1-flash-tts-preview |
Neue Flagship-Creative-Stufe |
Migrationsanleitung
Wenn Sie von gemini-3.1-flash-tts-preview auf gemini-3.8-flash-lite-tts upgraden, aktualisieren Sie Ihre Anfragen für das Gemini 3.8-TTS-Schema:
- Anweisungen auf Turn-Ebene in
speech_metadataverschieben:Bei Gemini 3.8 TTS wird der eingegebene Text streng als wörtliches Transkript behandelt. Inline-Textanweisungen wie"Say cheerfully: Hello!"oder"Speaker 1: Hello!"können laut vorgelesen werden. Anweisungen zur nachhaltigen Lieferung (style) und Sprecherlabels (speaker) in strukturierte Metadaten verschieben:- Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit
"type": "speech_metadata","speaker"und"style"an. - GenerateContent API:Hängen Sie
"speech_metadata": {"speaker": "...", "style": "..."}an jedespartan.
- Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit
- Winkelklammern nur für einmalige stimmliche Ereignisse verwenden:Kurze stimmliche Äußerungen und Pausen, die keine Sprache sind, mit Winkelklammern (z. B.
<laugh>,<sigh>,<cough>,<breath>oder<short pause>) in das Transkript einfügen. Sprechstile wie Flüstern inspeech_metadata.stylesetzen. speakerin jeder Äußerung in Anfragen mit mehreren Sprechern angeben:Jede Äußerung in einer Anfrage mit mehreren Sprechern mussspeakerinnerhalb vonspeech_metadataenthalten, das mit einem der konfigurierten Sprecher übereinstimmt.- Design-Personas im Voraus mit Voice Design erstellen:Ersetzen Sie lange Audio-Profil-/Regieanmerkungsblöcke durch eine benutzerdefinierte Stimme, die in Voice Design erstellt wurde, und übertragen Sie dann die
voice_...-ID in Ihre TTS-Anfragen mit minimalen oder leerenstyle-Strings. - Standard-WAV-Ausgabe (
audio/wav) bei unären Anfragen berücksichtigen:Im Gegensatz zugemini-3.1-flash-tts-previewund früheren TTS-Modellen, die standardmäßig headerloses rohes PCMaudio/l16zurückgegeben haben, gibt Gemini 3.8 TTS standardmäßig WAV-Audio (audio/wav/AUDIO_WAV) mit einem Standard-RIFF-Header für unäre Anfragen zurück.- Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem
wave-Modul oderffmpegvon Python), entfernen Sie den manuellen Header-Wrapper und schreiben Sie die zurückgegebenen Bytes direkt in eine.wav-Datei. - Wenn für Ihre Pipeline headerloses rohes PCM-, Mu-Law- oder A-Law-Audio erforderlich ist, legen Sie
response_formatexplizit auf"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") oder"audio/alaw"("AUDIO_ALAW") fest. Weitere Informationen finden Sie unter Audioausgabeformate.
- Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem
gemini-3.8-flash-lite-tts
| Attribut | Beschreibung |
|---|---|
| Modellcode | gemini-3.8-flash-lite-tts |
| Unterstützte Datentypen |
Eingaben Text Ausgabe Audio |
| Token-Limits[*] |
Eingabetokenlimit 8.192 Tokenausgabelimit 16.384 |
| Funktionen | Unterstützt Unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt Nicht unterstützt |
| Nutzungsoptionen |
Unterstützt Unterstützt Unterstützt |
| -Versionen |
|
| Letzte Aktualisierung | Juli 2026 |
Unterstützte Sprachen
gemini-3.8-flash-lite-tts erkennt die Eingabesprache automatisch und unterstützt 101 Sprachen:
| Sprache | Sprache | Sprache |
|---|---|---|
| Achinesisch (arabische Schrift) | Georgisch | Maltesisch |
| Afrikaans | Deutsch | Meitei |
| Akan | Griechisch | Marathi |
| Amharisch | Gujarati | Minangkabauisch (arabische Schrift) |
| Armenisch | Haitianisch | Mizo |
| Assamesisch | Halch-Mongolisch | Nepalesisch (einzelne Sprache) |
| Awadhi | Hausa | Nigerianisches Fulfulde |
| Balinesisch | Hebräisch | Nordaserbaidschanisch |
| Bengalisch | Hindi | Nord-Sotho |
| Banjaresisch (lateinische Schrift) | Ungarisch | Nordusbekisch |
| Baskisch | Isländisch | Norwegisch Bokmål |
| Belarussisch | Ilokano | Norwegisch (Nynorsk) |
| Bhojpuri | Indonesisch | Chichewa |
| Bosnisch | Iranisches Persisch | Odia (einzelne Sprache) |
| Buginesisch | Italienisch | Persisch (Afghanistan) |
| Bulgarisch | Japanisch | Polnisch |
| Kantonesisch | Javanisch | Portugiesisch |
| Katalanisch | Kikamba | Punjabi |
| Cebuano | Kannada | Rumänisch |
| Sorani | Kashmiri (arabische Schrift) | Russisch |
| Chhattisgarhi | Kashmiri (Deva-Schrift) | Santali |
| Chinesisch (Hans-Schrift) | Kasachisch | Serbisch |
| Chinesisch (Hant-Schrift) | Khmer | Singhalesisch |
| Kroatisch | Kikuyu | Slowakisch |
| Tschechien | Kinyarwanda | Südaserbaidschanisch |
| Dänisch | Kongo | Südliches Paschtu |
| Niederländisch | Koreanisch | Spanisch |
| Arabisch (Ägypten) | Kirgisisch | Standardarabisch (arabische Schrift) |
| Englisch | Lao | Standardarabisch (lateinische Schrift) |
| Estnisch | Lingala | Standard-Lettisch |
| Filipino | Makedonisch | Standard-Malaiisch |
| Französisch | Magahi | Tamil |
| Galizisch | Maithili | Telugu |
| Ganda | Malayalam | – |