Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) to flagowy model Google do zamiany tekstu na mowę, zaprojektowany z myślą o jakości dźwięku na poziomie studyjnym, ekspresyjnej interpretacji, autentycznych akcentach regionalnych i stabilności w przypadku długich, wieloetapowych interakcji.

Omówienie i możliwości

Technologia TTS Gemini 3.8 Flash wyznacza nowe standardy w zakresie ekspresywnego generowania dźwięku:

  • Wysoka wierność akustyczna i niuanse aktorskie: zapewnia bogaty zakres emocjonalny, naturalną kadencję i precyzyjne przestrzeganie wskazówek dotyczących kolejności wypowiedzi style oraz wtrąceń wokalnych (<laugh>, <sigh>, <short pause>).
  • Stabilność długich wypowiedzi: zachowuje spójną tożsamość głosu, barwę, głośność i akustykę pomieszczenia w długich dialogach i wielominutowych narracjach bez zmiany głosu.
  • Autentyczne akcenty regionalne i wymowa: obsługuje akcenty regionalne i dialekty mniejszości.
  • Pełna obsługa ekosystemu głosowego: bezproblemowa współpraca z gotowymi głosami, rozszerzoną biblioteką głosów (GET /v1beta/voices), niestandardowymi profilami projektowania głosu i replikacją głosu (domyślnie głosy w pamięci trwałej oraz opcjonalne klucze bezstanowe). Możesz też projektować i interaktywnie odtwarzać głosy w Google AI Studio.

W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.

Kiedy używać którego modelu TTS

Oba modele Gemini 3.8 TTS mają ten sam schemat API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:

Funkcja / zbiór zadań Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Główna mocna strona Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność
Najlepsze zastosowania książki audio, narracja w studiu, złożone dialogi z udziałem wielu osób, intensywne partie wokalne, trudna wymowa, regionalne dialekty. produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika.
Obsługiwane języki 130 języków 101 języków
Zalecany zamiennik Nowy poziom kreacji flagowych gemini-3.1-flash-tts-preview

Przewodnik po migracji

Jeśli przeprowadzasz migrację z modeli Gemini TTS w wersji gemini-3.1-flash-tts-preview lub starszej, zaktualizuj żądania zgodnie ze schematem Gemini 3.8 TTS:

  1. Przenoszenie wskazówek dotyczących poszczególnych zakrętów do speech_metadata: funkcja zamiany tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak "Say cheerfully: Hello!" lub "Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety mówców (speaker) do metadanych strukturalnych:
    • Interfejs Interactions API: do każdego bloku tekstu dołączaj adnotację z wartościami "type": "speech_metadata", "speaker" i "style".
    • Interfejs GenerateContent API: dołącz "speech_metadata": {"speaker": "...", "style": "..."} do każdego part.
  2. Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy w transkrypcji umieszczaj w nawiasach ostrych (np. <laugh>, <sigh>, <cough>, <breath> lub <short pause>). Style wypowiedzi, takie jak szept, umieszczaj w nawiasach speech_metadata.style.
  3. Określ speaker w każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawierać speaker w speech_metadata, które odpowiada jednemu ze skonfigurowanych głośników.
  4. Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator voice_... w żądaniach syntezy mowy z minimalną liczbą ciągów style lub bez nich.
  5. Uwzględnij domyślne wyjście WAV (audio/wav) w przypadku żądań binarnych: w przeciwieństwie do modeli TTS w wersji gemini-3.1-flash-tts-preview i starszych (które domyślnie zwracały surowe dane PCM bez nagłówka audio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav / AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań binarnych.
    • Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu wave w Pythonie lub ffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku .wav.
    • Jeśli Twój potok wymaga dźwięku PCM bez nagłówka, mu-law lub A-law, ustaw parametr response_format.mime_type na "audio/l16", "audio/mulaw" lub "audio/alaw" (np. {"response_format": {"type": "audio", "mime_type": "audio/l16"}} w interfejsie Interactions API lub AUDIO_L16, AUDIO_MULAW lub AUDIO_ALAW w generateContent). Więcej informacji znajdziesz w sekcji Formaty wyjściowe audio.

gemini-3.8-flash-tts

Właściwość Opis
Kod modelu gemini-3.8-flash-tts
Obsługiwane typy danych

Dane wejściowe

Tekst

Dane wyjściowe

Audio

Limity tokenów[*]

Limit tokenów wejściowych

8192

Limit tokenów wyjściowych

16 384 (limit obsługi Gemini API)

 Możliwości

Generowanie dźwięku

Obsługiwane

Zapisywanie w pamięci podręcznej

Nieobsługiwane

Wykonanie kodu

Nieobsługiwane

Wyszukiwanie plików

Nieobsługiwane

Wywoływanie funkcji

Nieobsługiwane

Powiązanie ze źródłami informacji przy użyciu Map Google

Nieobsługiwane

Generowanie obrazów

Nieobsługiwane

Live API

Nieobsługiwane

Szukaj groundingu

Nieobsługiwane

Uporządkowane dane wyjściowe

Nieobsługiwane

Myślenie

Nieobsługiwane

Kontekst adresu URL

Nieobsługiwane

 Opcje wykorzystania

Batch API

Obsługiwane

Wnioskowanie Flex

Obsługiwane

Wnioskowanie o priorytecie

Obsługiwane

Wersje
Więcej informacji znajdziesz w wzorcach wersji modelu.
  • gemini-3.8-flash-tts
Ostatnia aktualizacja Wrzesień 2026 r.

Obsługiwane języki

gemini-3.8-flash-tts automatycznie wykrywa język wprowadzania i obsługuje ponad 130 języków:

Język Język Język
aceh (alfabet arabski), grecki nepalski (osobny język),
afrikaans guarani fulfulde nigeryjski,
akan gudżarati północnoazerski,
amharski kreolski haitański sotho północny
ormiański mongolski chałchaski, północnouzbecki,
asamski hausa norweski bokmål
awadhi hebrajski norweski (Nynorsk)
balijski hindi njandża
bengalski węgierski oksytański
banjar (alfabet arabski) islandzki Odia (pojedynczy język)
banjar (alfabet łaciński) igbo pangasinan
baszkirski iloko perski (Afganistan)
baskijski indonezyjski polski
białoruski perski irański, portugalski
bemba włoski pendżabski
bhodźpuri japoński rumuński
bośniacki jawajski rosyjski
Bugiński Kabyle santali
bułgarski kamba serbski
birmański kannada sindhi
kantoński kaszmirski (alfabet arabski), syngaleski
kataloński kaszmirski (pismo dewa) słowacki
cebuański kazachski słoweński
centralny kurdyjski khmerski somalijski
ćhattisgarhi kikuyu południowoazerski,
chiński (pismo han) ruanda-rundi paszto południowy,
chiński (pismo tradycyjne), kongo sotho południowy
krymsko-tatarski koreański hiszpański
chorwacki kirgiski arabski standardowy (alfabet arabski),
czeski laotański arabski standardowy (alfabet łaciński)
duński łatgalski standardowy łotewski,
niderlandzki lingala malajski standardowy,
diula litewski suahili (język)
dzongkha luksemburski suazi
arabski egipski macedoński szwedzki
angielski magahi tadżycki
estoński maithili tamilski
filipiński malajalam telugu
fiński maltański tajski
francuski manipuri, tigrinia
galicyjski marathi albański (toskijski)
luganda minangkabau (pismo arabskie), turecki
gruziński Minangkabau (alfabet łaciński) ujgurski
niemiecki mizo wietnamski