Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) to szybki i ekonomiczny model Google do zamiany tekstu na mowę, który został stworzony z myślą o zastąpieniu modelu gemini-3.1-flash-tts-preview w przypadku zbiorów zadań produkcyjnych o wysokiej przepustowości.
Omówienie i możliwości
Technologia Gemini 3.8 Flash-Lite TTS łączy krótki czas oczekiwania z wyrazistą, naturalną mową:
- Wysoka wydajność: zoptymalizowany pod kątem produkcji masowej, kaskadowych agentów głosowych, funkcji czytania na głos i codziennego generowania mowy przez jednego głośnika w głównych językach.
- Zgodność schematów typu drop-in: korzysta z tego samego schematu API i formatu promptów strukturalnych co
gemini-3.8-flash-tts, co umożliwia przełączanie modeli za pomocą jednej zmiany parametru. - Pełna obsługa ekosystemu głosowego: obsługuje gotowe głosy, rozszerzoną bibliotekę głosów (
GET /v1beta/voices), niestandardowe persony projektu głosu i replikację głosu (domyślnie pamięć trwała głosów oraz opcjonalne klucze bezstanowe). Możesz też projektować i interaktywnie odtwarzać głosy w Google AI Studio.
W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.
Kiedy używać którego modelu TTS
Oba modele Gemini 3.8 TTS mają ten sam schemat API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:
| Funkcja / zbiór zadań | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Główna mocna strona | Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność | Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów |
| Najlepsze zastosowania | produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika. | Audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, regionalne dialekty |
| Obsługiwane języki | 101 języków | 130 języków |
| Zalecany zamiennik | gemini-3.1-flash-tts-preview |
Nowy poziom kreacji flagowych |
Przewodnik po migracji
Jeśli przechodzisz z gemini-3.1-flash-tts-preview na gemini-3.8-flash-lite-tts, zaktualizuj prośby o schemat Gemini 3.8 TTS:
- Przenoszenie wskazówek dotyczących poszczególnych zakrętów do
speech_metadata: funkcja zamiany tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak"Say cheerfully: Hello!"lub"Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety mówców (speaker) do metadanych strukturalnych:- Interfejs Interactions API: do każdego bloku tekstu dołączaj adnotację z wartościami
"type": "speech_metadata","speaker"i"style". - Interfejs GenerateContent API: dołącz
"speech_metadata": {"speaker": "...", "style": "..."}do każdegopart.
- Interfejs Interactions API: do każdego bloku tekstu dołączaj adnotację z wartościami
- Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy w transkrypcji umieszczaj w nawiasach ostrych (np.
<laugh>,<sigh>,<cough>,<breath>lub<short pause>). Style wypowiedzi, takie jak szept, umieszczaj w nawiasachspeech_metadata.style. - Określ
speakerw każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawieraćspeakerwspeech_metadata, które odpowiada jednemu ze skonfigurowanych głośników. - Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator
voice_...w żądaniach zamiany tekstu na mowę z minimalną liczbą ciągówstylelub bez nich. - Uwzględnij domyślne wyjście WAV (
audio/wav) w przypadku żądań binarnych: w przeciwieństwie do modeli TTS w wersjigemini-3.1-flash-tts-previewi starszych (które domyślnie zwracały surowe dane PCM bez nagłówkaaudio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav/AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań binarnych.- Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu
wavew Pythonie lubffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku.wav. - Jeśli Twój potok wymaga dźwięku PCM bez nagłówka, mu-law lub A-law, ustaw parametr
response_format.mime_typena"audio/l16","audio/mulaw"lub"audio/alaw"(np.{"response_format": {"type": "audio", "mime_type": "audio/l16"}}w interfejsie Interactions API lubAUDIO_L16,AUDIO_MULAWlubAUDIO_ALAWwgenerateContent). Więcej informacji znajdziesz w sekcji Formaty wyjściowe audio.
- Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu
gemini-3.8-flash-lite-tts
| Właściwość | Opis |
|---|---|
| Kod modelu | gemini-3.8-flash-lite-tts |
| Obsługiwane typy danych |
Dane wejściowe Tekst Dane wyjściowe Audio |
| Limity tokenów[*] |
Limit tokenów wejściowych 8192 Limit tokenów wyjściowych 16 384 (limit Gemini API) |
| Możliwości | Obsługiwane Zapisywanie w pamięci podręcznej Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Powiązanie ze źródłami informacji przy użyciu Map Google Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane |
| Opcje wykorzystania |
Obsługiwane Obsługiwane Obsługiwane |
| Wersje |
|
| Ostatnia aktualizacja | Wrzesień 2026 r. |
Obsługiwane języki
gemini-3.8-flash-lite-tts automatycznie wykrywa język wejściowy i obsługuje ponad 100 języków:
| Język | Język | Język |
|---|---|---|
| aceh (alfabet arabski), | niemiecki | manipuri, |
| afrikaans | grecki | marathi |
| akan | gudżarati | minangkabau (pismo arabskie), |
| amharski | kreolski haitański | mizo |
| ormiański | mongolski chałchaski, | nepalski (osobny język), |
| asamski | hausa | fulfulde nigeryjski, |
| awadhi | hebrajski | północnoazerski, |
| balijski | hindi | sotho północny |
| bengalski | węgierski | północnouzbecki, |
| banjar (alfabet łaciński) | islandzki | norweski bokmål |
| baskijski | iloko | norweski (Nynorsk) |
| białoruski | indonezyjski | njandża |
| bhodźpuri | perski irański, | Odia (pojedynczy język) |
| bośniacki | włoski | perski (Afganistan) |
| Bugiński | japoński | polski |
| bułgarski | jawajski | portugalski |
| kantoński | kamba | pendżabski |
| kataloński | kannada | rumuński |
| cebuański | kaszmirski (alfabet arabski), | rosyjski |
| centralny kurdyjski | kaszmirski (pismo dewa) | santali |
| ćhattisgarhi | kazachski | serbski |
| chiński (pismo han) | khmerski | syngaleski |
| chiński (pismo tradycyjne), | kikuyu | słowacki |
| chorwacki | ruanda-rundi | południowoazerbejdżański, |
| czeski | kongo | paszto południowy, |
| duński | koreański | hiszpański |
| niderlandzki | kirgiski | arabski standardowy (alfabet arabski), |
| arabski egipski | laotański | arabski standardowy (alfabet łaciński) |
| angielski | lingala | standardowy łotewski, |
| estoński | macedoński | malajski standardowy, |
| filipiński | magahi | tamilski |
| francuski | maithili | telugu |
| galicyjski | malajalam | turecki |
| luganda | maltański | wietnamski |
| gruziński | – | – |