Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) to flagowy model Google do zamiany tekstu na mowę, zaprojektowany z myślą o jakości dźwięku na poziomie studyjnym, ekspresyjnej interpretacji, autentycznych akcentach regionalnych i stabilności w przypadku długich, wieloetapowych interakcji.

Omówienie i możliwości

Technologia TTS Gemini 3.8 Flash wyznacza nowe standardy w zakresie ekspresywnego generowania dźwięku:

  • Wysoka wierność akustyczna i niuanse aktorskie: zapewnia bogaty zakres emocjonalny, naturalną kadencję i precyzyjne przestrzeganie wskazówek dotyczących kolejnych wypowiedzi style oraz wtrąceń wokalnych (<laugh>, <sigh>, <short pause>).
  • Stabilność długich wypowiedzi: zachowuje spójną tożsamość głosu, barwę, głośność i akustykę pomieszczenia w długich dialogach i wielominutowych narracjach bez zmiany głosu.
  • Autentyczne akcenty i wymowa regionalna: obsługuje akcenty regionalne, dialekty mniejszości i wstawki w międzynarodowym alfabecie fonetycznym (MAF).
  • Pełna obsługa ekosystemu głosowego: bezproblemowa współpraca z gotowymi głosami, rozszerzoną biblioteką głosów (GET /v1beta/voices), niestandardowymi profilami projektowania głosureplikacją głosu (domyślnie trwałe przechowywanie głosów, a opcjonalnie klucze bezstanowe). Możesz też projektować i replikować głosy interaktywnie w Google AI Studio.

W przewodniku Text-to-speech znajdziesz pełne informacje o funkcjach, sprawdzone metody tworzenia promptów i przykłady kodu.

Kiedy używać którego modelu TTS

Oba modele Gemini 3.8 TTS mają ten sam schemat interfejsu API i strukturę promptów. Wybierz model, który pasuje do Twojego zbioru zadań:

Funkcja / zbiór zadań Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
Główna zaleta Maksymalna wierność głosu, niuanse w grze aktorskiej i różnorodność dialektów Wysoka przepustowość, krótkie czasy oczekiwania i opłacalność
Najlepsze zastosowania Audiobooki, lektor w studiu, złożone dialogi z udziałem wielu osób, intensywne występy wokalne, trudna wymowa, dialekty regionalne produkcja na dużą skalę, kaskady agentów głosowych działających w czasie rzeczywistym, funkcje odczytywania na głos, replikacja głosu, codzienne generowanie głosu pojedynczego głośnika.
Obsługiwane języki 130 języków 101 języków
Zalecana zamiana Nowy poziom kreacji flagowych gemini-3.1-flash-tts-preview

Przewodnik po migracji

Jeśli przeprowadzasz migrację z modeli Gemini TTS w wersji gemini-3.1-flash-tts-preview lub starszej, zaktualizuj żądania do schematu Gemini 3.8 TTS:

  1. Przeniesienie wskazówek na poziomie zwrotu do speech_metadata: zamiana tekstu na mowę w Gemini 3.8 traktuje tekst wejściowy jako dosłowny zapis. Wskazówki tekstowe w tekście, takie jak "Say cheerfully: Hello!" lub "Speaker 1: Hello!", mogą być odczytywane na głos. Przenieś instrukcje dotyczące ciągłego dostarczania (style) i etykiety rozmówców (speaker) do uporządkowanych metadanych:
    • Interfejs API interakcji: do każdego bloku tekstu dołączaj adnotację z wartościami "type": "speech_metadata", "speaker""style".
    • Interfejs GenerateContent API: dołącz "speech_metadata": {"speaker": "...", "style": "..."} do każdego part.
  2. Używaj tagów w nawiasach ostrych tylko w przypadku krótkotrwałych zdarzeń głosowych: krótkotrwałe wokalizacje inne niż mowa i pauzy umieszczaj w transkrypcji w nawiasach ostrych (np. <laugh>, <sigh>, <cough>, <breath> lub <short pause>). Style wypowiedzi, takie jak szept, umieszczaj w tagach speech_metadata.style.
  3. Określ speaker w każdej turze w przypadku żądań z udziałem wielu osób: każda tura w żądaniu z udziałem wielu osób musi zawierać speakerspeech_metadata, które odpowiada jednemu ze skonfigurowanych głośników.
  4. Projektowanie person z wyprzedzeniem za pomocą funkcji Projektowanie głosu: zastąp długie bloki starszych profili audio lub notatek reżysera niestandardowym głosem utworzonym w funkcji Projektowanie głosu, a następnie przesyłaj ten identyfikator voice_... w żądaniach TTS z minimalną liczbą ciągów style lub bez nich.
  5. Uwzględnij domyślne wyjście WAV (audio/wav) w przypadku żądań jednoargumentowych: w przeciwieństwie do modeli TTS w wersji gemini-3.1-flash-tts-preview i starszych (które domyślnie zwracały surowe dane PCM bez nagłówka audio/l16) model Gemini 3.8 TTS domyślnie zwraca dźwięk WAV (audio/wav / AUDIO_WAV) ze standardowym nagłówkiem RIFF w przypadku żądań jednoargumentowych.
    • Jeśli Twój kod wcześniej opakowywał surowe bajty PCM w nagłówek WAV (np. za pomocą modułu wave w Pythonie lub ffmpeg), usuń ręczny wrapper nagłówka i zapisz zwrócone bajty bezpośrednio w pliku .wav.
    • Jeśli potok wymaga surowego dźwięku PCM bez nagłówka, mu-law lub A-law, ustaw wyraźnie response_format na "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") lub "audio/alaw" ("AUDIO_ALAW"). Zobacz Formaty wyjściowe audio.

gemini-3.8-flash-tts

Właściwość Opis
Kod modelu gemini-3.8-flash-tts
Obsługiwane typy danych

Dane wejściowe

Tekst

Dane wyjściowe

Audio

Limity tokenów[*]

Limit tokenów wejściowych

8192

Limit tokenów wyjściowych

16 384

Uprawnienia

Generowanie dźwięku

Obsługiwane

Zapisywanie w pamięci podręcznej

Obsługiwane

Wykonanie kodu

Nieobsługiwane

Wyszukiwanie plików

Nieobsługiwane

Wywoływanie funkcji

Nieobsługiwane

Powiązanie ze źródłami informacji przy użyciu Map Google

Nieobsługiwane

Generowanie obrazów

Nieobsługiwane

Live API

Nieobsługiwane

Szukaj groundingu

Nieobsługiwane

Uporządkowane dane wyjściowe

Nieobsługiwane

Myślenie

Nieobsługiwane

Kontekst adresu URL

Nieobsługiwane

 Opcje wykorzystania

Batch API

Obsługiwane

Wnioskowanie Flex

Obsługiwane

Wnioskowanie o priorytecie

Obsługiwane

Wersje
Więcej informacji znajdziesz w artykule Wzorce wersji modelu.
  • gemini-3.8-flash-tts
Ostatnia aktualizacja Lipiec 2026 r.

Obsługiwane języki

gemini-3.8-flash-tts automatycznie wykrywa język wprowadzania i obsługuje 130 języków:

Język Język Język
aceh (alfabet arabski), grecki nepalski (język)
afrikaans guarani ful nigeryjski
akan gudżarati północnoazerski,
amharski kreolski haitański sotho północny
ormiański mongolski chałchaski, północny uzbecki,
asamski, hausa norweski bokmål
awadhi hebrajski norweski (Nynorsk)
balijski hindi njandża
bengalski, węgierski oksytański
banjar (alfabet arabski) islandzki Odia (pojedynczy język)
banjar (alfabet łaciński) igbo pangasinan
baszkirski iloko perski (Afganistan)
baskijski indonezyjski polski
Białoruski perski irański, portugalski
bemba włoski pendżabski
bhodźpuri japoński rumuński
bośniacki jawajski rosyjski
Bugiński kabylski, santali
bułgarski kamba serbski
birmański kannada sindhi
kantoński kaszmirski (alfabet arabski) syngaleski
kataloński kaszmirski (dewanagari) słowacki
cebuański kazachski słoweński
centralny kurdyjski khmerski somalijski
ćhattisgarhi kikuyu południowoazerski,
chiński (pismo han) ruanda-rundi paszto południowy,
chiński (pismo Hant), kongo sotho południowy
krymsko-tatarski koreański hiszpański
chorwacki kirgiski arabski standardowy (alfabet arabski),
czeski laotański arabski standardowy (alfabet łaciński),
duński łatgalski standardowy łotewski,
niderlandzki lingala malajski standardowy,
diula litewski suahili (język)
dzongkha luksemburski suazi
arabski egipski macedoński szwedzki
angielski magahi tadżycki
estoński maithili, tamilski,
filipiński malajalam telugu,
fiński maltański tajski
francuski manipuri, tigrinia
galicyjski marathi, albański (toskijski)
luganda Minangkabau (pismo arabskie) ujgurski
gruziński minangkabau (alfabet łaciński)
niemiecki mizo