Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) to flagowy model Google do zamiany tekstu na mowę, zaprojektowany z myślą o jakości dźwięku na poziomie studyjnym, ekspresyjnej interpretacji, autentycznych akcentach regionalnych i stabilności w przypadku długich, wieloetapowych interakcji.
Omówienie i możliwości
Technologia TTS Gemini 3.8 Flash wyznacza nowe standardy w zakresie ekspresywnego generowania dźwięku:
- Wysoka wierność akustyczna i niuanse aktorskie: zapewnia bogaty zakres emocjonalny, naturalną kadencję i precyzyjne przestrzeganie wskazówek dotyczących kolejnych wypowiedzi
styleoraz wtrąceń wokalnych (<laugh>,<sigh>,<short pause>). - Stabilność długich wypowiedzi: zachowuje spójną tożsamość głosu, barwę, głośność i akustykę pomieszczenia w długich dialogach i wielominutowych narracjach bez zmiany głosu.
- Autentyczne akcenty i wymowa regionalna: obsługuje akcenty regionalne, dialekty mniejszości i wstawki w międzynarodowym alfabecie fonetycznym (MAF).
- Pełna obsługa ekosystemu głosowego: bezproblemowa współpraca z gotowymi głosami, rozszerzoną biblioteką głosów (
GET /v1beta/voices), niestandardowymi profilami projektowania głosu i replikacją głosu (domyślnie trwałe przechowywanie głosów, a opcjonalnie klucze bezstanowe). Możesz też projektować i replikować głosy interaktywnie w Google AI Studio.
W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.
Kiedy używać którego modelu TTS
Oba modele Gemini 3.8 TTS mają ten sam schemat interfejsu API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:
| Funkcja / zbiór zadań | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| Główna zaleta | Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów | Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność |
| Najlepsze zastosowania | Audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, dialekty regionalne | produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika. |
| Obsługiwane języki | 130 języków | 101 języków |
| Zalecana zamiana | Nowy poziom kreacji flagowych | gemini-3.1-flash-tts-preview |
Przewodnik po migracji
Jeśli przeprowadzasz migrację z modeli Gemini TTS w wersji gemini-3.1-flash-tts-preview lub starszej, zaktualizuj żądania do schematu Gemini 3.8 TTS:
- Przeniesienie wskazówek na poziomie zwrotu do
speech_metadata: zamiana tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak"Say cheerfully: Hello!"lub"Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety rozmówców (speaker) do uporządkowanych metadanych:- Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami
"type": "speech_metadata","speaker"i"style". - Interfejs GenerateContent API: dołącz
"speech_metadata": {"speaker": "...", "style": "..."}do każdegopart.
- Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami
- Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy umieszczaj w transkrypcji w nawiasach ostrych (np.
<laugh>,<sigh>,<cough>,<breath>lub<short pause>). Style wypowiedzi, takie jak szept, umieszczaj w tagachspeech_metadata.style. - Określ
speakerw każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawieraćspeakerwspeech_metadata, które odpowiada jednemu ze skonfigurowanych głośników. - Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator
voice_...w żądaniach TTS z minimalną liczbą ciągówstylelub bez nich. - Uwzględnij domyślne wyjście WAV (
audio/wav) w przypadku żądań jednoargumentowych: w przeciwieństwie do modeli TTS w wersjigemini-3.1-flash-tts-previewi starszych (które domyślnie zwracały surowe dane PCM bez nagłówkaaudio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav/AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań jednoargumentowych.- Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu
wavew Pythonie lubffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku.wav. - Jeśli potok wymaga surowego dźwięku PCM bez nagłówka, mu-law lub A-law,
ustaw wyraźnie
response_formatna"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") lub"audio/alaw"("AUDIO_ALAW"). Zobacz Formaty wyjściowe audio.
- Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu
gemini-3.8-flash-tts
| Właściwość | Opis |
|---|---|
| Kod modelu | gemini-3.8-flash-tts |
| Obsługiwane typy danych |
Dane wejściowe Tekst Dane wyjściowe Audio |
| Limity tokenów[*] |
Limit tokenów wejściowych 8192 Limit tokenów wyjściowych 16 384 |
| Uprawnienia | Obsługiwane Zapisywanie w pamięci podręcznej Obsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Powiązanie ze źródłami informacji przy użyciu Map Google Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane Nieobsługiwane |
| Opcje wykorzystania |
Obsługiwane Obsługiwane Obsługiwane |
| Wersje |
|
| Ostatnia aktualizacja | Lipiec 2026 r. |
Obsługiwane języki
gemini-3.8-flash-tts automatycznie wykrywa język wprowadzania i obsługuje 130 języków:
| Język | Język | Język |
|---|---|---|
| aceh (alfabet arabski), | grecki | nepalski (język) |
| afrikaans | guarani | ful nigeryjski |
| akan | gudżarati | północnoazerski, |
| amharski | kreolski haitański | sotho północny |
| ormiański | mongolski chałchaski, | północny uzbecki, |
| asamski, | hausa | norweski bokmål |
| awadhi | hebrajski | norweski (Nynorsk) |
| balijski | hindi | njandża |
| bengalski, | węgierski | oksytański |
| banjar (alfabet arabski) | islandzki | Odia (pojedynczy język) |
| banjar (alfabet łaciński) | igbo | pangasinan |
| baszkirski | iloko | perski (Afganistan) |
| baskijski | indonezyjski | polski |
| Białoruski | perski irański, | portugalski |
| bemba | włoski | pendżabski |
| bhodźpuri | japoński | rumuński |
| bośniacki | jawajski | rosyjski |
| Bugiński | kabylski, | santali |
| bułgarski | kamba | serbski |
| birmański | kannada | sindhi |
| kantoński | kaszmirski (alfabet arabski) | syngaleski |
| kataloński | kaszmirski (dewanagari) | słowacki |
| cebuański | kazachski | słoweński |
| centralny kurdyjski | khmerski | somalijski |
| ćhattisgarhi | kikuyu | południowoazerski, |
| chiński (pismo han) | ruanda-rundi | paszto południowy, |
| chiński (pismo Hant), | kongo | sotho południowy |
| krymsko-tatarski | koreański | hiszpański |
| chorwacki | kirgiski | arabski standardowy (alfabet arabski), |
| czeski | laotański | arabski standardowy (alfabet łaciński), |
| duński | łatgalski | standardowy łotewski, |
| niderlandzki | lingala | malajski standardowy, |
| diula | litewski | suahili (język) |
| dzongkha | luksemburski | suazi |
| arabski egipski | macedoński | szwedzki |
| angielski | magahi | tadżycki |
| estoński | maithili, | tamilski, |
| filipiński | malajalam | telugu, |
| fiński | maltański | tajski |
| francuski | manipuri, | tigrinia |
| galicyjski | marathi, | albański (toskijski) |
| luganda | Minangkabau (pismo arabskie) | ujgurski |
| gruziński | minangkabau (alfabet łaciński) | – |
| niemiecki | mizo | – |