Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) to szybki i ekonomiczny model Google do zamiany tekstu na mowę, który został stworzony z myślą o zastąpieniu modelu gemini-3.1-flash-tts-preview w przypadku zbiorów zadań produkcyjnych o wysokiej przepustowości.

Omówienie i możliwości

Technologia Gemini 3.8 Flash-Lite TTS łączy krótki czas oczekiwania z wyrazistą, naturalną mową:

  • Wysoka wydajność: zoptymalizowany pod kątem produkcji masowej, kaskadowych agentów głosowych, funkcji czytania na głos i codziennego generowania mowy przez jednego głośnika w głównych językach.
  • Zgodność schematów typu drop-in: korzysta z tego samego schematu API i formatu promptów strukturalnych co gemini-3.8-flash-tts, co umożliwia przełączanie modeli za pomocą jednej zmiany parametru.
  • Pełna obsługa ekosystemu głosowego: obsługuje gotowe głosy, rozszerzoną bibliotekę głosów (GET /v1beta/voices), niestandardowe persony projektu głosu i replikację głosu (domyślnie pamięć trwała głosów oraz opcjonalne klucze bezstanowe). Możesz też projektować i interaktywnie odtwarzać głosy w Google AI Studio.

W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.

Kiedy używać którego modelu TTS

Oba modele Gemini 3.8 TTS mają ten sam schemat API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:

Funkcja / zbiór zadań Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Główna mocna strona Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów
Najlepsze zastosowania produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika. Audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, regionalne dialekty
Obsługiwane języki 101 języków 130 języków
Zalecany zamiennik gemini-3.1-flash-tts-preview Nowy poziom kreacji flagowych

Przewodnik po migracji

Jeśli przechodzisz z gemini-3.1-flash-tts-preview na gemini-3.8-flash-lite-tts, zaktualizuj prośby o schemat Gemini 3.8 TTS:

  1. Przenoszenie wskazówek dotyczących poszczególnych zakrętów do speech_metadata: funkcja zamiany tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak "Say cheerfully: Hello!" lub "Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety mówców (speaker) do metadanych strukturalnych:
    • Interfejs Interactions API: do każdego bloku tekstu dołączaj adnotację z wartościami "type": "speech_metadata", "speaker" i "style".
    • Interfejs GenerateContent API: dołącz "speech_metadata": {"speaker": "...", "style": "..."} do każdego part.
  2. Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy w transkrypcji umieszczaj w nawiasach ostrych (np. <laugh>, <sigh>, <cough>, <breath> lub <short pause>). Style wypowiedzi, takie jak szept, umieszczaj w nawiasach speech_metadata.style.
  3. Określ speaker w każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawierać speaker w speech_metadata, które odpowiada jednemu ze skonfigurowanych głośników.
  4. Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator voice_... w żądaniach zamiany tekstu na mowę z minimalną liczbą ciągów style lub bez nich.
  5. Uwzględnij domyślne wyjście WAV (audio/wav) w przypadku żądań binarnych: w przeciwieństwie do modeli TTS w wersji gemini-3.1-flash-tts-preview i starszych (które domyślnie zwracały surowe dane PCM bez nagłówka audio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav / AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań binarnych.
    • Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu wave w Pythonie lub ffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku .wav.
    • Jeśli Twój potok wymaga dźwięku PCM bez nagłówka, mu-law lub A-law, ustaw parametr response_format.mime_type na "audio/l16", "audio/mulaw" lub "audio/alaw" (np. {"response_format": {"type": "audio", "mime_type": "audio/l16"}} w interfejsie Interactions API lub AUDIO_L16, AUDIO_MULAW lub AUDIO_ALAW w generateContent). Więcej informacji znajdziesz w sekcji Formaty wyjściowe audio.

gemini-3.8-flash-lite-tts

Właściwość Opis
Kod modelu gemini-3.8-flash-lite-tts
Obsługiwane typy danych

Dane wejściowe

Tekst

Dane wyjściowe

Audio

Limity tokenów[*]

Limit tokenów wejściowych

8192

Limit tokenów wyjściowych

16 384 (limit Gemini API)

 Możliwości

Generowanie dźwięku

Obsługiwane

Zapisywanie w pamięci podręcznej

Nieobsługiwane

Wykonanie kodu

Nieobsługiwane

Wyszukiwanie plików

Nieobsługiwane

Wywoływanie funkcji

Nieobsługiwane

Powiązanie ze źródłami informacji przy użyciu Map Google

Nieobsługiwane

Generowanie obrazów

Nieobsługiwane

Live API

Nieobsługiwane

Szukaj groundingu

Nieobsługiwane

Uporządkowane dane wyjściowe

Nieobsługiwane

Myślenie

Nieobsługiwane

Kontekst adresu URL

Nieobsługiwane

 Opcje wykorzystania

Batch API

Obsługiwane

Wnioskowanie Flex

Obsługiwane

Wnioskowanie o priorytecie

Obsługiwane

Wersje
Więcej informacji znajdziesz w wzorcach wersji modelu.
  • gemini-3.8-flash-lite-tts
Ostatnia aktualizacja Wrzesień 2026 r.

Obsługiwane języki

gemini-3.8-flash-lite-tts automatycznie wykrywa język wejściowy i obsługuje ponad 100 języków:

Język Język Język
aceh (alfabet arabski), niemiecki manipuri,
afrikaans grecki marathi
akan gudżarati minangkabau (pismo arabskie),
amharski kreolski haitański mizo
ormiański mongolski chałchaski, nepalski (osobny język),
asamski hausa fulfulde nigeryjski,
awadhi hebrajski północnoazerski,
balijski hindi sotho północny
bengalski węgierski północnouzbecki,
banjar (alfabet łaciński) islandzki norweski bokmål
baskijski iloko norweski (Nynorsk)
białoruski indonezyjski njandża
bhodźpuri perski irański, Odia (pojedynczy język)
bośniacki włoski perski (Afganistan)
Bugiński japoński polski
bułgarski jawajski portugalski
kantoński kamba pendżabski
kataloński kannada rumuński
cebuański kaszmirski (alfabet arabski), rosyjski
centralny kurdyjski kaszmirski (pismo dewa) santali
ćhattisgarhi kazachski serbski
chiński (pismo han) khmerski syngaleski
chiński (pismo tradycyjne), kikuyu słowacki
chorwacki ruanda-rundi południowoazerbejdżański,
czeski kongo paszto południowy,
duński koreański hiszpański
niderlandzki kirgiski arabski standardowy (alfabet arabski),
arabski egipski laotański arabski standardowy (alfabet łaciński)
angielski lingala standardowy łotewski,
estoński macedoński malajski standardowy,
filipiński magahi tamilski
francuski maithili telugu
galicyjski malajalam turecki
luganda maltański wietnamski
gruziński – –