Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) ist das schnelle, kostengünstige Text-zu-Sprache-Modell von Google für den Alltag, das gemini-3.1-flash-tts-preview für Produktions-Workloads mit hohem Durchsatz ersetzen soll.

Übersicht und Funktionen

Gemini 3.8 Flash-Lite TTS kombiniert niedrige Latenz mit ausdrucksstarker, natürlicher Sprache:

  • Effizienz bei hohem Durchsatz:Optimiert für die Massenproduktion, Konversations-Voice-Agent-Kaskaden, Vorlesefunktionen und die Sprachgenerierung mit einem einzelnen Sprecher in den wichtigsten Sprachen.
  • Drop-in-Schema-Kompatibilität:Das API-Schema und das Format für strukturierte Prompts sind genau wie bei gemini-3.8-flash-tts. So können Sie Modelle mit einer einzigen Parameteränderung wechseln.
  • Unterstützung des gesamten Voice-Ökosystems:Unterstützt vordefinierte Stimmen, die Extended Voice Library (GET /v1beta/voices), benutzerdefinierte Voice Design-Personas und die Sprachreplikation (standardmäßig persistent gespeicherte Stimmen sowie optionale statuslose Schlüssel). Sie können Stimmen auch interaktiv in Google AI Studio entwerfen und replizieren.

Im Leitfaden zu Text-to-Speech finden Sie eine vollständige Beschreibung der Funktionen, Best Practices für Prompts und Codebeispiele.

Wann welches TTS-Modell verwendet werden sollte

Beide Gemini 3.8-TTS-Modelle haben dasselbe API-Schema und dieselbe Prompting-Struktur. Wählen Sie das Modell aus, das zu Ihrer Arbeitslast passt:

Funktion / Arbeitslast Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Primäre Stärke Hoher Durchsatz, niedrige Latenz und Kosteneffizienz Maximale Stimmwiedergabe, schauspielerische Nuancen und Dialektabdeckung
Ideale Anwendungsfälle Produktion in großem Umfang, Echtzeit-Sprachagenten-Kaskaden, Vorlesefunktionen, Sprachreplikation, Generierung mit einem einzelnen Sprecher Hörbücher, Studio-Voiceover, komplexe Dialoge mit mehreren Sprechern, intensive Gesangseinlagen, schwierige Aussprache, regionale Dialekte
Unterstützte Sprachen 101 Sprachen 130 Sprachen
Empfohlener Ersatz für gemini-3.1-flash-tts-preview Neue Flagship-Creative-Stufe

Migrationsanleitung

Wenn Sie von gemini-3.1-flash-tts-preview auf gemini-3.8-flash-lite-tts upgraden, aktualisieren Sie Ihre Anfragen für das Gemini 3.8-TTS-Schema:

  1. Anweisungen auf Turn-Ebene in speech_metadata verschieben:Bei Gemini 3.8 TTS wird der eingegebene Text streng als wörtliches Transkript behandelt. Inline-Textanweisungen wie "Say cheerfully: Hello!" oder "Speaker 1: Hello!" können laut vorgelesen werden. Anweisungen zur nachhaltigen Lieferung (style) und Sprecherlabels (speaker) in strukturierte Metadaten verschieben:
    • Interactions API:Hängen Sie jedem Textinhaltsblock eine Anmerkung mit "type": "speech_metadata", "speaker" und "style" an.
    • GenerateContent API:Hängen Sie "speech_metadata": {"speaker": "...", "style": "..."} an jedes part an.
  2. Winkelklammern nur für einmalige stimmliche Ereignisse verwenden:Kurze stimmliche Äußerungen und Pausen, die keine Sprache sind, mit Winkelklammern (z. B. <laugh>, <sigh>, <cough>, <breath> oder <short pause>) in das Transkript einfügen. Sprechstile wie Flüstern in speech_metadata.style setzen.
  3. speaker in jeder Äußerung in Anfragen mit mehreren Sprechern angeben:Jede Äußerung in einer Anfrage mit mehreren Sprechern muss speaker innerhalb von speech_metadata enthalten, das mit einem der konfigurierten Sprecher übereinstimmt.
  4. Design-Personas im Voraus mit Voice Design erstellen:Ersetzen Sie lange Audio-Profil-/Regieanmerkungsblöcke durch eine benutzerdefinierte Stimme, die in Voice Design erstellt wurde, und übertragen Sie dann die voice_...-ID in Ihre TTS-Anfragen mit minimalen oder leeren style-Strings.
  5. Standard-WAV-Ausgabe (audio/wav) bei unären Anfragen berücksichtigen:Im Gegensatz zu gemini-3.1-flash-tts-preview und früheren TTS-Modellen, die standardmäßig headerloses rohes PCM audio/l16 zurückgegeben haben, gibt Gemini 3.8 TTS standardmäßig WAV-Audio (audio/wav / AUDIO_WAV) mit einem Standard-RIFF-Header für unäre Anfragen zurück.
    • Wenn Ihr Code zuvor Roh-PCM-Bytes in einen WAV-Header eingeschlossen hat (z. B. mit dem wave-Modul oder ffmpeg von Python), entfernen Sie den manuellen Header-Wrapper und schreiben Sie die zurückgegebenen Bytes direkt in eine .wav-Datei.
    • Wenn für Ihre Pipeline headerloses rohes PCM-, Mu-Law- oder A-Law-Audio erforderlich ist, legen Sie response_format explizit auf "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") oder "audio/alaw" ("AUDIO_ALAW") fest. Weitere Informationen finden Sie unter Audioausgabeformate.

gemini-3.8-flash-lite-tts

Attribut Beschreibung
Modellcode gemini-3.8-flash-lite-tts
Unterstützte Datentypen

Eingaben

Text

Ausgabe

Audio

Token-Limits[*]

Eingabetokenlimit

8.192

Tokenausgabelimit

16.384 (Gemini API-Bereitstellungslimit)

Funktionen

Audiogenerierung

Unterstützt

Caching

Unterstützt

Code-Ausführung

Nicht unterstützt

Dateisuche

Nicht unterstützt

Funktionsaufrufe

Nicht unterstützt

Fundierung mit Google Maps

Nicht unterstützt

Bildgenerierung

Nicht unterstützt

Live API

Nicht unterstützt

Suchfundierung

Nicht unterstützt

Strukturierte Ausgaben

Nicht unterstützt

Antwort wird generiert

Nicht unterstützt

URL-Kontext

Nicht unterstützt

Nutzungsoptionen

Batch API

Unterstützt

Flex-Inferenz

Unterstützt

Prioritätsinferenz

Unterstützt

-Versionen
Weitere Informationen finden Sie unter Muster für Modellversionen.
  • gemini-3.8-flash-lite-tts
Letzte Aktualisierung September 2026

Unterstützte Sprachen

gemini-3.8-flash-lite-tts erkennt die Eingabesprache automatisch und unterstützt über 100 Sprachen:

Sprache Sprache Sprache
Achinesisch (arabische Schrift) Deutsch Meitei
Afrikaans Griechisch Marathi
Akan Gujarati Minangkabauisch (arabische Schrift)
Amharisch Haitianisch Mizo
Armenisch Halch-Mongolisch Nepalesisch (einzelne Sprache)
Assamesisch Hausa Nigerianisches Fulfulde
Awadhi Hebräisch Nordaserbaidschanisch
Balinesisch Hindi Nord-Sotho
Bengalisch Ungarisch Nordusbekisch
Banjaresisch (lateinische Schrift) Isländisch Norwegisch Bokmål
Baskisch Ilokano Norwegisch (Nynorsk)
Belarussisch Indonesisch Chichewa
Bhojpuri Iranisches Persisch Odia (einzelne Sprache)
Bosnisch Italienisch Persisch (Afghanistan)
Buginesisch Japanisch Polnisch
Bulgarisch Javanisch Portugiesisch
Kantonesisch Kikamba Punjabi
Katalanisch Kannada Rumänisch
Cebuano Kashmiri (arabische Schrift) Russisch
Sorani Kashmiri (Deva-Schrift) Santali
Chhattisgarhi Kasachisch Serbisch
Chinesisch (Hans-Schrift) Khmer Singhalesisch
Chinesisch (Hant-Schrift) Kikuyu Slowakisch
Kroatisch Kinyarwanda Südaserbaidschanisch
Tschechien Kongo Südliches Paschtu
Dänisch Koreanisch Spanisch
Niederländisch Kirgisisch Standardarabisch (arabische Schrift)
Arabisch (Ägypten) Lao Standardarabisch (lateinische Schrift)
Englisch Lingala Standard-Lettisch
Estnisch Makedonisch Standard-Malaiisch
Filipino Magahi Tamil
Französisch Maithili Telugu
Galizisch Malayalam Türkisch
Ganda Maltesisch Vietnamesisch
Georgisch – –