Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) ist das schnelle, kostengünstige Text-zu-Sprache-Modell von Google für den Alltag, das gemini-3.1-flash-tts-preview für Produktions-Workloads mit hohem Durchsatz ersetzen soll.

Übersicht und Funktionen

Gemini 3.8 Flash-Lite TTS kombiniert niedrige Latenz mit ausdrucksstarker, natürlicher Sprache:

  • Effizienz bei hohem Durchsatz:Optimiert für die Massenproduktion, Konversations-Voice-Agent-Kaskaden, Vorlesefunktionen und die Sprachgenerierung mit einem einzelnen Sprecher in den wichtigsten Sprachen.
  • Drop-in-Schema-Kompatibilität:Das API-Schema und das Format für strukturierte Prompts sind genau wie bei gemini-3.8-flash-tts. So können Sie Modelle mit einer einzigen Parameteränderung wechseln.
  • Unterstützung des gesamten Voice-Ökosystems:Unterstützt vordefinierte Stimmen, die Extended Voice Library (GET /v1beta/voices), benutzerdefinierte Voice Design-Personas und die Sprachreplikation (standardmäßig persistent gespeicherte Stimmen sowie optionale statuslose Schlüssel). Sie können Stimmen auch interaktiv in Google AI Studio entwerfen und replizieren.

Im Leitfaden zu Text-to-Speech finden Sie eine vollständige Beschreibung der Funktionen, Best Practices für Prompts und Codebeispiele.

Wann welches TTS-Modell verwendet werden sollte

Beide Gemini 3.8-TTS-Modelle haben dasselbe API-Schema und dieselbe Prompting-Struktur. Wählen Sie das Modell aus, das zu Ihrer Arbeitslast passt:

Funktion / Arbeitslast Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Primäre Stärke Hoher Durchsatz, niedrige Latenz und Kosteneffizienz Maximale Stimmwiedergabe, schauspielerische Nuancen und Dialektabdeckung
Ideale Anwendungsfälle Produktion in großem Umfang, Echtzeit-Sprachagenten-Kaskaden, Vorlesefunktionen, Sprachreplikation, Generierung mit einem einzelnen Sprecher Hörbücher, Studio-Voiceover, komplexe Dialoge mit mehreren Sprechern, intensive Gesangseinlagen, schwierige Aussprache, regionale Dialekte
Unterstützte Sprachen 101 Sprachen 130 Sprachen
Empfohlener Ersatz für gemini-3.1-flash-tts-preview Neue Flagship-Creative-Stufe

Migrationsanleitung

Wenn Sie von gemini-3.1-flash-tts-preview auf gemini-3.8-flash-lite-tts upgraden, aktualisieren Sie Ihre Anfragen für das Gemini 3.8-TTS-Schema:

  1. Anweisungen auf Turn-Ebene in speech_metadata verschieben:Bei Gemini 3.8 TTS wird der eingegebene Text streng als wörtliches Transkript behandelt. Inline-Textanweisungen wie "Say cheerfully: Hello!" oder "Speaker 1: Hello!" können laut vorgelesen werden. Anweisungen zur nachhaltigen Lieferung (style) und Sprecherlabels (speaker) in strukturierte Metadaten verschieben:
    • Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit "type": "speech_metadata", "speaker" und "style" an.
    • GenerateContent API:Hängen Sie "speech_metadata": {"speaker": "...", "style": "..."} an jedes part an.
  2. Winkelklammern nur für einmalige stimmliche Ereignisse verwenden:Kurze stimmliche Äußerungen und Pausen, die keine Sprache sind, mit Winkelklammern (z. B. <laugh>, <sigh>, <cough>, <breath> oder <short pause>) in das Transkript einfügen. Sprechstile wie Flüstern in speech_metadata.style setzen.
  3. speaker in jeder Äußerung in Anfragen mit mehreren Sprechern angeben:Jede Äußerung in einer Anfrage mit mehreren Sprechern muss speaker innerhalb von speech_metadata enthalten, das mit einem der konfigurierten Sprecher übereinstimmt.
  4. Design-Personas im Voraus mit Voice Design erstellen:Ersetzen Sie lange Audio-Profil-/Regieanmerkungsblöcke durch eine benutzerdefinierte Stimme, die in Voice Design erstellt wurde, und übertragen Sie dann die voice_...-ID in Ihre TTS-Anfragen mit minimalen oder leeren style-Strings.
  5. Standard-WAV-Ausgabe (audio/wav) bei unären Anfragen berücksichtigen:Im Gegensatz zu gemini-3.1-flash-tts-preview und früheren TTS-Modellen, die standardmäßig headerloses rohes PCM audio/l16 zurückgegeben haben, gibt Gemini 3.8 TTS standardmäßig WAV-Audio (audio/wav / AUDIO_WAV) mit einem Standard-RIFF-Header für unäre Anfragen zurück.
    • Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem wave-Modul oder ffmpeg von Python), entfernen Sie den manuellen Header-Wrapper und schreiben Sie die zurückgegebenen Bytes direkt in eine .wav-Datei.
    • Wenn für Ihre Pipeline headerloses rohes PCM-, Mu-Law- oder A-Law-Audio erforderlich ist, legen Sie response_format explizit auf "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") oder "audio/alaw" ("AUDIO_ALAW") fest. Weitere Informationen finden Sie unter Audioausgabeformate.

gemini-3.8-flash-lite-tts

Attribut Beschreibung
Modellcode gemini-3.8-flash-lite-tts
Unterstützte Datentypen

Eingaben

Text

Ausgabe

Audio

Token-Limits[*]

Eingabetokenlimit

8.192

Tokenausgabelimit

16.384

Funktionen

Audiogenerierung

Unterstützt

Caching

Unterstützt

Code-Ausführung

Nicht unterstützt

Dateisuche

Nicht unterstützt

Funktionsaufrufe

Nicht unterstützt

Fundierung mit Google Maps

Nicht unterstützt

Bildgenerierung

Nicht unterstützt

Live API

Nicht unterstützt

Suchfundierung

Nicht unterstützt

Strukturierte Ausgaben

Nicht unterstützt

Antwort wird generiert

Nicht unterstützt

URL-Kontext

Nicht unterstützt

Nutzungsoptionen

Batch API

Unterstützt

Flex-Inferenz

Unterstützt

Prioritätsinferenz

Unterstützt

-Versionen
Weitere Informationen finden Sie unter Muster für Modellversionen.
  • gemini-3.8-flash-lite-tts
Letzte Aktualisierung Juli 2026

Unterstützte Sprachen

gemini-3.8-flash-lite-tts erkennt die Eingabesprache automatisch und unterstützt 101 Sprachen:

Sprache Sprache Sprache
Achinesisch (arabische Schrift) Georgisch Maltesisch
Afrikaans Deutsch Meitei
Akan Griechisch Marathi
Amharisch Gujarati Minangkabauisch (arabische Schrift)
Armenisch Haitianisch Mizo
Assamesisch Halch-Mongolisch Nepalesisch (einzelne Sprache)
Awadhi Hausa Nigerianisches Fulfulde
Balinesisch Hebräisch Nordaserbaidschanisch
Bengalisch Hindi Nord-Sotho
Banjaresisch (lateinische Schrift) Ungarisch Nordusbekisch
Baskisch Isländisch Norwegisch Bokmål
Belarussisch Ilokano Norwegisch (Nynorsk)
Bhojpuri Indonesisch Chichewa
Bosnisch Iranisches Persisch Odia (einzelne Sprache)
Buginesisch Italienisch Persisch (Afghanistan)
Bulgarisch Japanisch Polnisch
Kantonesisch Javanisch Portugiesisch
Katalanisch Kikamba Punjabi
Cebuano Kannada Rumänisch
Sorani Kashmiri (arabische Schrift) Russisch
Chhattisgarhi Kashmiri (Deva-Schrift) Santali
Chinesisch (Hans-Schrift) Kasachisch Serbisch
Chinesisch (Hant-Schrift) Khmer Singhalesisch
Kroatisch Kikuyu Slowakisch
Tschechien Kinyarwanda Südaserbaidschanisch
Dänisch Kongo Südliches Paschtu
Niederländisch Koreanisch Spanisch
Arabisch (Ägypten) Kirgisisch Standardarabisch (arabische Schrift)
Englisch Lao Standardarabisch (lateinische Schrift)
Estnisch Lingala Standard-Lettisch
Filipino Makedonisch Standard-Malaiisch
Französisch Magahi Tamil
Galizisch Maithili Telugu
Ganda Malayalam –