TTS me Flash Gemini 3.8

Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) është modeli kryesor krijues i Google për konvertimin e tekstit në të folur, i projektuar për besnikëri zëri në nivel studioje, aktrim ekspresiv, thekse autentike rajonale dhe stabilitet të padiskutueshëm në format të gjatë me shumë kthesa.

Përmbledhje dhe aftësi

Gemini 3.8 Flash TTS vendos një standard të ri për gjenerimin e audios ekspresive:

  • Besnikëri e lartë akustike dhe nuanca aktrimi: Ofron gamë të pasur emocionale, kadencë natyrale dhe respektim të saktë të udhëzimeve të style në nivel kthese dhe ngjarjeve vokale të integruara ( <laugh> , <sigh> , <short pause> ).
  • Stabilitet me shumë kthesa në formë të gjatë: Ruan identitetin e zërit, timbrin, volumin dhe tonin akustik të dhomës konsistent në dialogët e zgjatur dhe rrëfimet shumëminutëshe pa devijim të zërit.
  • Thekse dhe shqiptim autentik rajonal: Mbështet thekse rajonale, dialekte minoritare dhe mbishkrime të alfabetit ndërkombëtar fonetik (IPA) brenda rreshtit.
  • Mbështetje e plotë e ekosistemit zanor: Funksionon pa probleme me zërat e parapërgatitur, Bibliotekën e Zërit të Zgjeruar ( GET /v1beta/voices ), personazhet e dizajnit të Zërit të personalizuar dhe replikimin e Zërit (zëra të ruajtur vazhdimisht si parazgjedhje, plus çelësa opsionalë pa gjendje). Gjithashtu mund të dizajnoni dhe replikoni zërat në mënyrë interaktive në Google AI Studio .

Vizitoni udhëzuesin e konvertimit të tekstit në të folur për një mbulim të plotë të veçorive, praktikave më të mira të nxitjes dhe shembujve të kodit.

Kur të përdoret cili model TTS

Të dy modelet Gemini 3.8 TTS ndajnë të njëjtën skemë API dhe strukturë nxitëse. Zgjidhni modelin që i përshtatet ngarkesës suaj të punës:

Karakteristika / ngarkesa e punës TTS me shkëndija Binjakët 3.8 ( gemini-3.8-flash-tts ) Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts )
Forca kryesore Besnikëri maksimale e zërit, nuanca aktrimi dhe mbulim dialekti Rendiment i lartë, vonesë e ulët dhe efikasitet i kostos
Rastet më të mira të përdorimit Libra audio, rrëfim në studio, dialog kompleks me shumë folës, aktrim i rëndë vokal, shqiptim i vështirë, dialekte rajonale Prodhim me volum të lartë, kaskada agjentësh zanorë në kohë reale, veçori leximi me zë të lartë, replikim zëri, gjenerim i përditshëm me një folës të vetëm
Gjuhët e mbështetura 130 gjuhë 101 gjuhë
Zëvendësim i rekomanduar për Niveli i ri krijues kryesor gemini-3.1-flash-tts-preview

Udhëzues për migrimin

Nëse po migroni nga gemini-3.1-flash-tts-preview ose modele më të hershme Gemini TTS, përditësoni kërkesat tuaja për skemën Gemini 3.8 TTS:

  1. Zhvendos udhëzimet e nivelit të radhës në speech_metadata : Gemini 3.8 TTS e trajton tekstin e futur në mënyrë strikte si një transkript fjalë për fjalë. Udhëzimet e tekstit të brendshëm si "Say cheerfully: Hello!" ose "Speaker 1: Hello!" mund të shqiptohen me zë të lartë. Zhvendos udhëzimet e dhënies së vazhdueshme ( style ) dhe etiketat e folësit ( speaker ) në meta të dhëna të strukturuara:
    • API-ja e Ndërveprimeve: Bashkëngjitni një shënim me "type": "speech_metadata" , "speaker" dhe "style" në secilin bllok të përmbajtjes së tekstit.
    • GenerateContent API: Bashkëngjit "speech_metadata": {"speaker": "...", "style": "..."} në secilën part .
  2. Përdorni etiketa me kllapa këndore vetëm për ngjarjet vokale në kohë: Mbani vokalizimet dhe pauzat e çastit jo-folëse në transkript duke përdorur kllapa këndore (si p.sh. <laugh> , <sigh> , <cough> , <breath> ose <short pause> ). Vendosni stile të të folurit si pëshpëritja në speech_metadata.style .
  3. Specifikoni speaker në çdo raund në kërkesat për shumë folës: Çdo raund në një kërkesë për shumë folës duhet të përfshijë në mënyrë të qartë speaker brenda speech_metadata që përputhet me një nga folësit e konfiguruar.
  4. Dizenjoni personazhe që në fillim me Dizajnin e Zërit: Zëvendësoni blloqet e gjata të Profilit Audio / Shënimeve të Regjisorit me një zë të personalizuar të krijuar në Dizajnin e Zërit , pastaj përcillni atë ID voice_... përmes kërkesave tuaja TTS me vargje style minimale ose boshe.
  5. Merrni parasysh daljen parazgjedhur WAV ( audio/wav ) në kërkesat unary: Ndryshe nga gemini-3.1-flash-tts-preview dhe modelet e mëparshme TTS (të cilat kthenin audio/l16 të papërpunuar PCM pa kokë si parazgjedhje), Gemini 3.8 TTS kthen audio WAV ( audio/wav / AUDIO_WAV ) me një kokë standarde RIFF si parazgjedhje për kërkesat unary.
    • Nëse kodi juaj më parë ka mbështjellë bajt PCM të papërpunuar në një kokë WAV (për shembull, duke përdorur modulin wave të Python ose ffmpeg ), hiqni mbështjellësin manual të kokës dhe shkruani bajtet e kthyera direkt në një skedar .wav .
    • Nëse tubacioni juaj kërkon PCM të papërpunuar pa kokë, mu-law ose audio A-law, vendosni në mënyrë të qartë response_format"audio/l16" ( "AUDIO_L16" ), "audio/mulaw" ( "AUDIO_MULAW" ) ose "audio/alaw" ( "AUDIO_ALAW" ). Shihni Formatet e daljes audio .

binjakët-3.8-flash-tts

Pronë Përshkrimi
Kodi i modelit të gemini-3.8-flash-tts
llojet e të dhënave të mbështetura

Të dhënat hyrëse

Tekst

Prodhimi

Audio

Limitet token-it [*]

Limiti i tokenit të hyrjes

8,192

Limiti i tokenit të daljes

16,384

Aftësitë e

Gjenerimi i audios

Mbështetur

Ruajtja në memorje

Mbështetur

Ekzekutimi i kodit

Nuk mbështetet

Kërkim skedarësh

Nuk mbështetet

Thirrja e funksionit

Nuk mbështetet

Tokëzimi me Google Maps

Nuk mbështetet

Gjenerimi i imazhit

Nuk mbështetet

API i drejtpërdrejtë

Nuk mbështetet

Kërkimi në tokë

Nuk mbështetet

Rezultatet e strukturuara

Nuk mbështetet

Të menduarit

Nuk mbështetet

Konteksti i URL-së

Nuk mbështetet

Opsionet e konsumit të

API-ja e grupeve

Mbështetur

Përfundim fleksibël

Mbështetur

Përfundimi i përparësisë

Mbështetur

Versione
Lexoni modelet e versionit të modelit për më shumë detaje.
  • gemini-3.8-flash-tts
Përditësimi më i fundit Korrik 2026

Gjuhët e mbështetura

gemini-3.8-flash-tts zbulon automatikisht gjuhën e hyrjes dhe mbështet 130 gjuhë :

Gjuha Gjuha Gjuha
Açenisht (shkrimi arab) grek Nepalisht (gjuhë individuale)
Afrikanisht Guarani Fulfulde nigeriane
Akan Guxharatisht Azerbajxhani i Veriut
Amarike Kreolishtja e Haitit Soto Veriore
armenisht Halh Mongolisht Uzbekistani Verior
Asamezisht Hausisht Bokmål norvegjez
Awadhi Hebraisht Nynorsk norvegjez
Balinez Hindisht Nyanja
Banglaisht hungareze Oksitanisht
Banjar (shkrim arab) Islandeze Odia (gjuhë individuale)
Banjar (shkrimi latin) Igbo Pangasinan
Bashkir Iloko Persisht (Afganistan)
bask Indonezisht polak
Bjellorusisht persisht iranian portugalisht
Bemba italiane Punjabi
Bhojpuri Japonez rumanisht
boshnjak Javanisht ruse
Buginezisht Kabile Santali
bullgar Kamba serbisht
birmanisht Kannada Sindhi
kantonezisht Kashmiri (shkrim arab) Sinhalisht
Katalanisht Kashmiri (shkrimi Deva) Sllovakisht
Cebuanisht Kazake sllovenisht
Kurdishtja Qendrore Khmer somalisht
Çatisgarhi Kikuyu Azerbajxhani Jugor
Kinezisht (shkrimi Hans) Kinyarwanda Pashto Jugore
Kinezisht (shkrimi Hant) Kongo Sotho Jugore
Tatarisht i Krimesë Koreane Spanjisht
Kroatisht kirgizisht Arabishtja standarde (shkrimi arab)
Çeke Lao Arabishtja standarde (shkrimi latin)
danez Latgalian Letonishtja standarde
holandez Lingala Malajishtja standarde
Dyula lituanisht Suahili (gjuhë individuale)
Dzongkha Luksemburgase Swati
Arabishtja egjiptiane maqedonase suedeze
Anglisht Magahi Taxhikisht
Estonisht Maithili Tamil
Filipinase Malajalamisht Teluguisht
finlandez maltezisht Tajlandeze
frëngjisht Manipuri Tigrinjane
galike Marathi Toskërisht
Ganda Minangkabau (shkrimi arab) Ujgur
gjeorgjian Minangkabau (shkrimi latin)
gjermanisht Mizo