Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) to szybki i ekonomiczny model Google do zamiany tekstu na mowę, który został stworzony z myślą o zastąpieniu gemini-3.1-flash-tts-preview w przypadku zbiorów zadań produkcyjnych o wysokiej przepustowości.
Omówienie i możliwości
Technologia Gemini 3.8 Flash-Lite TTS łączy krótki czas oczekiwania z wyrazistą, naturalną mową:
- Wysoka wydajność: zoptymalizowany pod kątem produkcji masowej, kaskadowych agentów głosowych, funkcji czytania na głos i codziennego generowania mowy przez jednego głośnika w głównych językach.
- Zgodność schematu API typu drop-in: ma dokładnie ten sam schemat API i format podpowiedzi strukturalnych co
gemini-3.8-flash-tts, co pozwala przełączać modele za pomocą jednej zmiany parametru. - Pełna obsługa ekosystemu głosowego: obsługuje gotowe głosy, rozszerzoną bibliotekę głosów (
GET /v1beta/voices), niestandardowe persony projektu głosu i replikację głosu (domyślnie trwale przechowywane głosy oraz opcjonalne klucze bezstanowe). Możesz też projektować i replikować głosy interaktywnie w Google AI Studio.
W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.
Kiedy używać którego modelu TTS
Oba modele Gemini 3.8 TTS mają ten sam schemat interfejsu API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:
| Funkcja / zbiór zadań | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| Główna zaleta | Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność | Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów |
| Najlepsze zastosowania | produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika. | audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, dialekty regionalne; |
| Obsługiwane języki | 101 języków | 130 języków |
| Zalecana zamiana | gemini-3.1-flash-tts-preview |
Nowy poziom kreacji flagowych |
Przewodnik po migracji
Jeśli przechodzisz z gemini-3.1-flash-tts-preview na gemini-3.8-flash-lite-tts, zaktualizuj prośby o schemat Gemini 3.8 TTS:
- Przeniesienie wskazówek na poziomie zwrotu do
speech_metadata: zamiana tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak"Say cheerfully: Hello!"lub"Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety rozmówców (speaker) do uporządkowanych metadanych:- Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami
"type": "speech_metadata","speaker"i"style". - Interfejs GenerateContent API: dołącz
"speech_metadata": {"speaker": "...", "style": "..."}do każdegopart.
- Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami
- Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy umieszczaj w transkrypcji w nawiasach ostrych (np.
<laugh>,<sigh>,<cough>,<breath>lub<short pause>). Style wypowiedzi, takie jak szept, umieszczaj w tagachspeech_metadata.style. - Określ
speakerw każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawieraćspeakerwspeech_metadata, które odpowiada jednemu ze skonfigurowanych głośników. - Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator
voice_...w żądaniach TTS z minimalną liczbą ciągówstylelub bez nich. - Uwzględnij domyślne wyjście WAV (
audio/wav) w przypadku żądań jednoargumentowych: w przeciwieństwie do modeli TTS w wersjigemini-3.1-flash-tts-previewi starszych (które domyślnie zwracały surowe dane PCM bez nagłówkaaudio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav/AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań jednoargumentowych.- Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu
wavew Pythonie lubffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku.wav. - Jeśli potok wymaga dźwięku w formacie surowego PCM bez nagłówka, mu-law lub A-law, ustaw parametr
response_formatna"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") lub"audio/alaw"("AUDIO_ALAW"). Więcej informacji znajdziesz w sekcji Formaty wyjściowe audio.
- Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu
gemini-3.8-flash-lite-tts
| Właściwość | Opis |
|---|---|
| Kod modelu | gemini-3.8-flash-lite-tts |
| Obsługiwane typy danych |
Dane wejściowe Tekst Dane wyjściowe Audio |
| Limity tokenów[*] |
Limit tokenów wejściowych 8192 Limit tokenów wyjściowych 16 384 |
| Uprawnienia | Obsługiwane Zapisywanie w pamięci podręcznej Obsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Powiązanie ze źródłami informacji przy użyciu Map Google Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane |
| Opcje wykorzystania |
Obsługiwane Obsługiwane Obsługiwane |
| Wersje |
|
| Ostatnia aktualizacja | Lipiec 2026 r. |
Obsługiwane języki
gemini-3.8-flash-lite-tts automatycznie wykrywa język wejściowy i obsługuje 101 języków:
| Język | Język | Język |
|---|---|---|
| aceh (alfabet arabski), | gruziński | maltański |
| afrikaans | niemiecki | manipuri, |
| akan | grecki | marathi, |
| amharski | gudżarati | Minangkabau (pismo arabskie) |
| ormiański | kreolski haitański | mizo |
| asamski, | mongolski chałchaski, | nepalski (język) |
| awadhi | hausa | ful nigeryjski |
| balijski | hebrajski | północnoazerski, |
| bengalski, | hindi | sotho północny |
| banjar (alfabet łaciński) | węgierski | północny uzbecki, |
| baskijski | islandzki | norweski bokmål |
| Białoruski | iloko | norweski (Nynorsk) |
| bhodźpuri | indonezyjski | njandża |
| bośniacki | perski irański, | Odia (pojedynczy język) |
| Bugiński | włoski | perski (Afganistan) |
| bułgarski | japoński | polski |
| kantoński | jawajski | portugalski |
| kataloński | kamba | pendżabski |
| cebuański | kannada | rumuński |
| centralny kurdyjski | kaszmirski (alfabet arabski) | rosyjski |
| ćhattisgarhi | kaszmirski (dewanagari) | santali |
| chiński (pismo han) | kazachski | serbski |
| chiński (pismo Hant), | khmerski | syngaleski |
| chorwacki | kikuyu | słowacki |
| czeski | ruanda-rundi | południowoazerski, |
| duński | kongo | paszto południowy, |
| niderlandzki | koreański | hiszpański |
| arabski egipski | kirgiski | arabski standardowy (alfabet arabski), |
| angielski | laotański | arabski standardowy (alfabet łaciński), |
| estoński | lingala | standardowy łotewski, |
| filipiński | macedoński | malajski standardowy, |
| francuski | magahi | tamilski, |
| galicyjski | maithili, | telugu, |
| luganda | malajalam | – |