Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) 是 Google 的旗艦創意文字轉語音模型,專為提供錄音室等級的語音保真度、生動的演繹、道地的地域口音,以及穩定的長篇多輪對話而設計。

總覽與功能

Gemini 3.8 Flash TTS 為生成生動的音訊樹立全新標竿:

  • 高音訊保真度和細膩的演繹:可呈現豐富的情緒、自然的語調,並精準遵循回合層級的style指示和內嵌語音事件 (<laugh><sigh><short pause>)。
  • 長時間多輪對話穩定性:在長時間對話和數分鐘的旁白中,維持一致的聲音特徵、音色、音量和聲學室調,不會出現聲音漂移。
  • 道地的區域口音和發音:支援區域口音、少數族群方言,以及內嵌的國際音標 (IPA) 覆寫。
  • 支援完整的語音生態系統:可與預先建構的語音、擴充語音庫 (GET /v1beta/voices)、自訂語音設計角色和語音複製 (預設為持續儲存語音,另提供選用的無狀態金鑰) 完美搭配運作。您也可以在 Google AI Studio 中,以互動方式設計及複製聲音。

如要全面瞭解功能、提示最佳做法和程式碼範例,請參閱 Text-to-Speech 指南。

各個 TTS 模型的使用時機

Gemini 3.8 TTS 模型共用相同的 API 架構和提示結構。選擇符合工作負載需求的模型:

功能 / 工作負載 Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
主要優點 盡可能提高語音保真度、演技細節和方言涵蓋範圍 高處理量、低延遲和具成本效益
最佳用途 有聲書、錄音室旁白、複雜的多人對話、大量爆發性演技、難以發音的字詞、地方方言 大量製作、即時語音代理串聯、朗讀功能、語音複製、日常單一說話者生成
支援的語言 130 種語言 101 種語言
建議更換為 全新旗艦廣告素材層級 gemini-3.1-flash-tts-preview

遷移指南

如要從 gemini-3.1-flash-tts-preview 或更早的 Gemini TTS 模型遷移,請更新 Gemini 3.8 TTS 架構的要求:

  1. 將回合層級的指示移至 speech_metadataGemini 3.8 TTS 會將輸入文字嚴格視為逐字稿。系統可能會朗讀行內文字方向,例如 "Say cheerfully: Hello!""Speaker 1: Hello!"。將持續傳送指示 (style) 和發言者標籤 (speaker) 移至結構化中繼資料:
    • 互動 API:使用 "type": "speech_metadata""speaker""style" 為每個文字內容區塊附加註解。
    • GenerateContent API:"speech_metadata": {"speaker": "...", "style": "..."} 附加至每個 part
  2. 只針對特定時間點的語音事件使用角括號內嵌標記:使用角括號 (例如 <laugh><sigh><cough><breath><short pause>),將短暫的非語音發聲和停頓內嵌在轉錄稿中。將耳語等傳達方式放在 speech_metadata.style 中。
  3. 在多位說話者要求中,為每個輪流發言指定 speaker多位說話者要求中的每個輪流發言,都必須在 speech_metadata 內明確包含 speaker,且與其中一位已設定的說話者相符。
  4. 預先使用 Voice Design 設計角色:使用在 Voice Design 中建立的自訂語音,取代舊版音訊設定檔 / 導演附註區塊,然後透過 TTS 要求傳送該 voice_... ID,並使用最少或空白的 style 字串。
  5. 單元要求預設會輸出 WAV (audio/wav):gemini-3.1-flash-tts-preview 和先前的 TTS 模型不同 (預設會傳回無標頭的原始 PCM audio/l16),Gemini 3.8 TTS 預設會為單元要求傳回含有標準 RIFF 標頭的 WAV 音訊 (audio/wav / AUDIO_WAV)。
    • 如果您的程式碼先前將原始 PCM 位元組包裝在 WAV 標頭中 (例如使用 Python 的 wave 模組或 ffmpeg),請移除手動標頭包裝函式,並將傳回的位元組直接寫入 .wav 檔案。
    • 如果管道需要無標頭的原始 PCM、mu-law 或 A-law 音訊,請將 response_format 明確設為 "audio/l16" ("AUDIO_L16")、"audio/mulaw" ("AUDIO_MULAW") 或 "audio/alaw" ("AUDIO_ALAW")。請參閱音訊輸出格式

gemini-3.8-flash-tts

屬性 說明
模型代碼 gemini-3.8-flash-tts
支援的資料類型

輸入裝置

文字

輸出內容

音訊

代幣限制[*]

輸入權杖限制

8,192

輸出詞元限制

16,384

功能

生成音訊

支援

快取

支援

執行程式碼

不支援

檔案搜尋

不支援

函式呼叫

不支援

利用 Google 地圖建立基準

不支援

圖像生成

不支援

Live API

不支援

以搜尋為基準

不支援

結構化輸出內容

不支援

思考

不支援

網址內容

不支援

計費方案

批次 API

支援

Flex 推論

支援

優先推論

支援

個版本
詳情請參閱模型版本模式
  • gemini-3.8-flash-tts
最新更新 2026 年 7 月

支援的語言

gemini-3.8-flash-tts 會自動偵測輸入語言,並支援 130 種語言

語言 語言 語言
亞齊文 (阿拉伯文字) 希臘文 尼泊爾文 (單一語言)
南非荷蘭文 瓜拉尼語 奈及利亞富爾富爾德文
阿肯文 古吉拉特文 北亞塞拜然文
阿姆哈拉文 海地克里奧爾文 北索托文
亞美尼亞文 喀爾喀蒙古文 北烏茲別克
阿薩姆文 豪薩文 挪威博克馬爾文
阿瓦德語 希伯來文 挪威文 (耐諾斯克)
峇里語 北印度文 尼揚賈文
孟加拉文 匈牙利文 歐西坦語
班查文 (阿拉伯文字) 冰島文 歐利亞文 (個別語言)
班查文 (拉丁文字) 伊博文 邦阿西楠語
巴什噶爾文 伊洛果語 波斯文 (阿富汗)
巴斯克文 印尼文 波蘭文
白俄羅斯文 伊朗波斯文 葡萄牙文
本巴語 義大利文 旁遮普文
博杰普爾文 日文 羅馬尼亞文
波士尼亞文 爪哇語 俄文
布吉斯文 卡比爾文 桑塔利文
保加利亞文 坎巴文 塞爾維亞文
緬甸文 卡納達文 信德文
粵語 喀什米爾文 (阿拉伯文字) 錫蘭文
加泰隆尼亞文 喀什米爾文 (天城文) 斯洛伐克文
宿霧文 哈薩克文 斯洛維尼亞文
中庫德文點字 高棉文 索馬里語
切蒂斯格爾文 基庫猶文 南亞塞拜然文
中文 (漢字) 盧旺達文 南普什圖語
中文 (繁體) 剛果文 席索托文
克里米亞韃靼語 韓文 西班牙文
克羅埃西亞文 吉爾吉斯文 標準阿拉伯文 (阿拉伯文字)
捷克文 寮文 標準阿拉伯文 (拉丁字母)
丹麥文 拉特加萊語 標準拉脫維亞文
荷蘭文 林格拉文 標準馬來文
迪烏拉語 立陶宛文 斯瓦希里文 (個別語言)
宗喀語 盧森堡文 史瓦濟語
阿拉伯文 (埃及) 馬其頓文 瑞典文
英文 摩揭陀文 塔吉克文
愛沙尼亞文 邁蒂利文 泰米爾文
菲律賓文 馬拉雅拉姆文 泰盧固文
芬蘭文 馬爾他文 泰文
法文 曼尼浦里文 蒂格里亞文
加里西亞文 馬拉地文 托斯克阿爾巴尼亞文
干達文 米南佳保文 (阿拉伯文字) 維吾爾文
喬治亞文 米南佳保文 (拉丁文字)
德文 米佐文