Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) to szybki i ekonomiczny model Google do zamiany tekstu na mowę, który został stworzony z myślą o zastąpieniu gemini-3.1-flash-tts-preview w przypadku zbiorów zadań produkcyjnych o wysokiej przepustowości.

Omówienie i możliwości

Technologia Gemini 3.8 Flash-Lite TTS łączy krótki czas oczekiwania z wyrazistą, naturalną mową:

  • Wysoka wydajność: zoptymalizowany pod kątem produkcji masowej, kaskadowych agentów głosowych, funkcji czytania na głos i codziennego generowania mowy przez jednego głośnika w głównych językach.
  • Zgodność schematu API typu drop-in: ma dokładnie ten sam schemat API i format podpowiedzi strukturalnych co gemini-3.8-flash-tts, co pozwala przełączać modele za pomocą jednej zmiany parametru.
  • Pełna obsługa ekosystemu głosowego: obsługuje gotowe głosy, rozszerzoną bibliotekę głosów (GET /v1beta/voices), niestandardowe persony projektu głosu i replikację głosu (domyślnie trwale przechowywane głosy oraz opcjonalne klucze bezstanowe). Możesz też projektować i replikować głosy interaktywnie w Google AI Studio.

W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.

Kiedy używać którego modelu TTS

Oba modele Gemini 3.8 TTS mają ten sam schemat interfejsu API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:

Funkcja / zbiór zadań Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Główna zaleta Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów
Najlepsze zastosowania produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika. Audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, dialekty regionalne
Obsługiwane języki 101 języków 130 języków
Zalecana zamiana gemini-3.1-flash-tts-preview Nowy poziom kreacji flagowych

Przewodnik po migracji

Jeśli przechodzisz z gemini-3.1-flash-tts-preview na gemini-3.8-flash-lite-tts, zaktualizuj prośby o schemat Gemini 3.8 TTS:

  1. Przeniesienie wskazówek na poziomie zwrotu do speech_metadata: zamiana tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak "Say cheerfully: Hello!" lub "Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety rozmówców (speaker) do uporządkowanych metadanych:
    • Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami "type": "speech_metadata", "speaker" i "style".
    • Interfejs GenerateContent API: dołącz "speech_metadata": {"speaker": "...", "style": "..."} do każdego part.
  2. Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy umieszczaj w transkrypcji w nawiasach ostrych (np. <laugh>, <sigh>, <cough>, <breath> lub <short pause>). Style wypowiedzi, takie jak szept, umieszczaj w tagach speech_metadata.style.
  3. Określ speaker w każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawierać speaker w speech_metadata, które odpowiada jednemu ze skonfigurowanych głośników.
  4. Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator voice_... w żądaniach TTS z minimalną liczbą ciągów style lub bez nich.
  5. Uwzględnij domyślne wyjście WAV (audio/wav) w przypadku żądań jednoargumentowych: w przeciwieństwie do modeli TTS w wersji gemini-3.1-flash-tts-preview i starszych (które domyślnie zwracały surowe dane PCM bez nagłówka audio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav / AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań jednoargumentowych.
    • Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu wave w Pythonie lub ffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku .wav.
    • Jeśli potok wymaga dźwięku w formacie surowego PCM bez nagłówka, mu-law lub A-law, ustaw parametr response_format na "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") lub "audio/alaw" ("AUDIO_ALAW"). Więcej informacji znajdziesz w sekcji Formaty wyjściowe audio.

gemini-3.8-flash-lite-tts

Właściwość Opis
Kod modelu gemini-3.8-flash-lite-tts
Obsługiwane typy danych

Dane wejściowe

Tekst

Dane wyjściowe

Audio

Limity tokenów[*]

Limit tokenów wejściowych

8192

Limit tokenów wyjściowych

16 384 (limit obsługi Gemini API)

 Możliwości

Generowanie dźwięku

Obsługiwane

Zapisywanie w pamięci podręcznej

Obsługiwane

Wykonanie kodu

Nieobsługiwane

Wyszukiwanie plików

Nieobsługiwane

Wywoływanie funkcji

Nieobsługiwane

Powiązanie ze źródłami informacji przy użyciu Map Google

Nieobsługiwane

Generowanie obrazów

Nieobsługiwane

Live API

Nieobsługiwane

Szukaj groundingu

Nieobsługiwane

Uporządkowane dane wyjściowe

Nieobsługiwane

Myślenie

Nieobsługiwane

Kontekst adresu URL

Nieobsługiwane

 Opcje wykorzystania

Batch API

Obsługiwane

Wnioskowanie Flex

Obsługiwane

Wnioskowanie o priorytecie

Obsługiwane

Wersje
Więcej informacji znajdziesz w wzorcach wersji modelu.
  • gemini-3.8-flash-lite-tts
Ostatnia aktualizacja Wrzesień 2026 r.

Obsługiwane języki

gemini-3.8-flash-lite-tts automatycznie wykrywa język wejściowy i obsługuje ponad 100 języków:

Język Język Język
aceh (alfabet arabski), niemiecki manipuri,
afrikaans grecki marathi,
akan gudżarati Minangkabau (pismo arabskie)
amharski kreolski haitański mizo
ormiański mongolski chałchaski, nepalski (język)
asamski, hausa ful nigeryjski
awadhi hebrajski północnoazerski,
balijski hindi sotho północny
bengalski, węgierski północny uzbecki,
banjar (alfabet łaciński) islandzki norweski bokmål
baskijski iloko norweski (Nynorsk)
Białoruski indonezyjski njandża
bhodźpuri perski irański, Odia (pojedynczy język)
bośniacki włoski perski (Afganistan)
Bugiński japoński polski
bułgarski jawajski portugalski
kantoński kamba pendżabski
kataloński kannada rumuński
cebuański kaszmirski (alfabet arabski) rosyjski
centralny kurdyjski kaszmirski (dewanagari) santali
ćhattisgarhi kazachski serbski
chiński (pismo han) khmerski syngaleski
chiński (pismo Hant), kikuyu słowacki
chorwacki ruanda-rundi południowoazerski,
czeski kongo paszto południowy,
duński koreański hiszpański
niderlandzki kirgiski arabski standardowy (alfabet arabski),
arabski egipski laotański arabski standardowy (alfabet łaciński),
angielski lingala standardowy łotewski,
estoński macedoński malajski standardowy,
filipiński magahi tamilski,
francuski maithili, telugu,
galicyjski malajalam turecki
luganda maltański wietnamski
gruziński – –