Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) to szybki i ekonomiczny model Google do zamiany tekstu na mowę, który został stworzony z myślą o zastąpieniu gemini-3.1-flash-tts-preview w przypadku zbiorów zadań produkcyjnych o wysokiej przepustowości.

Omówienie i możliwości

Technologia Gemini 3.8 Flash-Lite TTS łączy krótki czas oczekiwania z wyrazistą, naturalną mową:

  • Wysoka wydajność: zoptymalizowany pod kątem produkcji masowej, kaskadowych agentów głosowych, funkcji czytania na głos i codziennego generowania mowy przez jednego głośnika w głównych językach.
  • Zgodność schematu API typu drop-in: ma dokładnie ten sam schemat API i format podpowiedzi strukturalnych co gemini-3.8-flash-tts, co pozwala przełączać modele za pomocą jednej zmiany parametru.
  • Pełna obsługa ekosystemu głosowego: obsługuje gotowe głosy, rozszerzoną bibliotekę głosów (GET /v1beta/voices), niestandardowe persony projektu głosu i replikację głosu (domyślnie trwale przechowywane głosy oraz opcjonalne klucze bezstanowe). Możesz też projektować i replikować głosy interaktywnie w Google AI Studio.

W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.

Kiedy używać którego modelu TTS

Oba modele Gemini 3.8 TTS mają ten sam schemat interfejsu API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:

Funkcja / zbiór zadań Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
Główna zaleta Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów
Najlepsze zastosowania produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika. audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, dialekty regionalne;
Obsługiwane języki 101 języków 130 języków
Zalecana zamiana gemini-3.1-flash-tts-preview Nowy poziom kreacji flagowych

Przewodnik po migracji

Jeśli przechodzisz z gemini-3.1-flash-tts-preview na gemini-3.8-flash-lite-tts, zaktualizuj prośby o schemat Gemini 3.8 TTS:

  1. Przeniesienie wskazówek na poziomie zwrotu do speech_metadata: zamiana tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak "Say cheerfully: Hello!" lub "Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety rozmówców (speaker) do uporządkowanych metadanych:
    • Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami "type": "speech_metadata", "speaker""style".
    • Interfejs GenerateContent API: dołącz "speech_metadata": {"speaker": "...", "style": "..."} do każdego part.
  2. Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy umieszczaj w transkrypcji w nawiasach ostrych (np. <laugh>, <sigh>, <cough>, <breath> lub <short pause>). Style wypowiedzi, takie jak szept, umieszczaj w tagach speech_metadata.style.
  3. Określ speaker w każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawierać speakerspeech_metadata, które odpowiada jednemu ze skonfigurowanych głośników.
  4. Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator voice_... w żądaniach TTS z minimalną liczbą ciągów style lub bez nich.
  5. Uwzględnij domyślne wyjście WAV (audio/wav) w przypadku żądań jednoargumentowych: w przeciwieństwie do modeli TTS w wersji gemini-3.1-flash-tts-preview i starszych (które domyślnie zwracały surowe dane PCM bez nagłówka audio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav / AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań jednoargumentowych.
    • Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu wave w Pythonie lub ffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku .wav.
    • Jeśli potok wymaga dźwięku w formacie surowego PCM bez nagłówka, mu-law lub A-law, ustaw parametr response_format na "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") lub "audio/alaw" ("AUDIO_ALAW"). Więcej informacji znajdziesz w sekcji Formaty wyjściowe audio.

gemini-3.8-flash-lite-tts

Właściwość Opis
Kod modelu gemini-3.8-flash-lite-tts
Obsługiwane typy danych

Dane wejściowe

Tekst

Dane wyjściowe

Audio

Limity tokenów[*]

Limit tokenów wejściowych

8192

Limit tokenów wyjściowych

16 384

Uprawnienia

Generowanie dźwięku

Obsługiwane

Zapisywanie w pamięci podręcznej

Obsługiwane

Wykonanie kodu

Nieobsługiwane

Wyszukiwanie plików

Nieobsługiwane

Wywoływanie funkcji

Nieobsługiwane

Powiązanie ze źródłami informacji przy użyciu Map Google

Nieobsługiwane

Generowanie obrazów

Nieobsługiwane

Live API

Nieobsługiwane

Szukaj groundingu

Nieobsługiwane

Uporządkowane dane wyjściowe

Nieobsługiwane

Myślenie

Nieobsługiwane

Kontekst adresu URL

Nieobsługiwane

 Opcje wykorzystania

Batch API

Obsługiwane

Wnioskowanie Flex

Obsługiwane

Wnioskowanie o priorytecie

Obsługiwane

Wersje
Więcej informacji znajdziesz w wzorcach wersji modelu.
  • gemini-3.8-flash-lite-tts
Ostatnia aktualizacja Lipiec 2026 r.

Obsługiwane języki

gemini-3.8-flash-lite-tts automatycznie wykrywa język wejściowy i obsługuje 101 języków:

Język Język Język
aceh (alfabet arabski), gruziński maltański
afrikaans niemiecki manipuri,
akan grecki marathi,
amharski gudżarati Minangkabau (pismo arabskie)
ormiański kreolski haitański mizo
asamski, mongolski chałchaski, nepalski (język)
awadhi hausa ful nigeryjski
balijski hebrajski północnoazerski,
bengalski, hindi sotho północny
banjar (alfabet łaciński) węgierski północny uzbecki,
baskijski islandzki norweski bokmål
Białoruski iloko norweski (Nynorsk)
bhodźpuri indonezyjski njandża
bośniacki perski irański, Odia (pojedynczy język)
Bugiński włoski perski (Afganistan)
bułgarski japoński polski
kantoński jawajski portugalski
kataloński kamba pendżabski
cebuański kannada rumuński
centralny kurdyjski kaszmirski (alfabet arabski) rosyjski
ćhattisgarhi kaszmirski (dewanagari) santali
chiński (pismo han) kazachski serbski
chiński (pismo Hant), khmerski syngaleski
chorwacki kikuyu słowacki
czeski ruanda-rundi południowoazerski,
duński kongo paszto południowy,
niderlandzki koreański hiszpański
arabski egipski kirgiski arabski standardowy (alfabet arabski),
angielski laotański arabski standardowy (alfabet łaciński),
estoński lingala standardowy łotewski,
filipiński macedoński malajski standardowy,
francuski magahi tamilski,
galicyjski maithili, telugu,
luganda malajalam