Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) 是 Google 的旗舰创意文字转语音模型,专为提供录音室级语音保真度、富有表现力的表演、地道的区域口音和可靠的长篇多轮对话稳定性而设计。

概览和功能

Gemini 3.8 Flash TTS 为富有表现力的音频生成树立了新标杆:

  • 高保真音效和表演细节:可呈现丰富的情感范围、自然的语调,并精确遵循回合级 style 指令以及内嵌的语音事件(<laugh><sigh><short pause>)。
  • 长对话多轮稳定性:在长时间的对话和长达数分钟的旁白中,保持一致的语音特征、音色、音量和声学室调,不会出现语音漂移。
  • 地道的区域口音和发音:支持区域口音、少数民族方言和内嵌的国际音标 (IPA) 替换。
  • 全面的语音生态系统支持:可与预构建的语音、扩展语音库 (GET /v1beta/voices)、自定义语音设计角色和语音复制(默认情况下为持久存储的语音,另有可选的无状态密钥)无缝协作。您还可以在 Google AI Studio 中以交互方式设计和复制声音。

如需全面了解功能、提示最佳实践和代码示例,请访问文字转语音指南。

何时使用哪种 TTS 模型

这两种 Gemini 3.8 TTS 模型共享相同的 API 架构和提示结构。选择适合您工作负载的型号:

功能 / 工作负载 Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
主要优势 最大限度地提高语音保真度、表演细微差别和方言覆盖率 高吞吐量、低延迟和高成本效益
最佳应用场景 有声读物、录音室旁白、复杂的多人对话、爆发式表演、发音困难、方言 大批量制作、实时语音代理级联、朗读功能、语音复刻、日常单扬声器生成
支持的语言 130 种语言 101 种语言
建议替换为 新的旗舰版广告素材层级 gemini-3.1-flash-tts-preview

迁移指南

如果您要从 gemini-3.1-flash-tts-preview 或更早版本的 Gemini TTS 模型迁移,请更新您的请求以使用 Gemini 3.8 TTS 架构:

  1. 将回合级指令移至 speech_metadata:Gemini 3.8 TTS 会将输入文本严格视为逐字转写内容。系统可能会朗读 "Say cheerfully: Hello!""Speaker 1: Hello!" 等内嵌文字方向。 将持续交付指令 (style) 和说话人标签 (speaker) 移至结构化元数据中:
    • Interactions API:为每个文本内容块附加带有 "type": "speech_metadata""speaker""style" 的注释。
    • GenerateContent API:将 "speech_metadata": {"speaker": "...", "style": "..."} 附加到每个 part
  2. 仅针对时间点上的发声事件使用尖括号内嵌标记:使用尖括号(例如 <laugh><sigh><cough><breath><short pause>)将短暂的非语音发声和停顿内嵌在转写内容中。将耳语等朗读风格放在 speech_metadata.style 中。
  3. 在多说话人请求的每个回合中指定 speaker:多说话人请求 的每个回合都必须在 speech_metadata 内明确包含 speaker,且 与配置的说话人之一相匹配。
  4. 使用语音设计预先设计角色:使用在 语音设计中创建的自定义语音替换冗长的旧版音频 配置文件 / 导演注释代码块,然后通过 TTS 请求传递该 voice_... ID,并使用最少的 字符串或空 style 字符串。
  5. 在一元请求中考虑默认 WAV (audio/wav) 输出:与 gemini-3.1-flash-tts-preview 及更早的 TTS 模型(默认返回无标头的原始 PCM audio/l16)不同,Gemini 3.8 TTS 默认针对一元请求返回带有标准 RIFF 标头的 WAV 音频 (audio/wav / AUDIO_WAV)。
    • 如果您的代码之前将原始 PCM 字节封装在 WAV 标头中(例如,使用 Python 的 wave 模块或 ffmpeg),请移除手动标头封装,并将返回的字节直接写入 .wav 文件。
    • 如果您的流水线需要无标头的原始 PCM、mu-law 或 A-law 音频,请将 response_format 明确设置为 "audio/l16" ("AUDIO_L16")、"audio/mulaw" ("AUDIO_MULAW") 或 "audio/alaw" ("AUDIO_ALAW")。请参阅音频输出格式

gemini-3.8-flash-tts

属性 说明
模型代码 gemini-3.8-flash-tts
支持的数据类型

输入源

文本

输出

音频

令牌限制[*]

输入 token 限制

8192

输出 token 限制

16384

功能

音频生成

支持

缓存

支持

代码执行

不受支持

文件搜索

不受支持

函数调用

不受支持

Grounding with Google Maps

不受支持

图片生成

不受支持

Live API

不受支持

搜索接地

不受支持

结构化输出

不受支持

思考

不受支持

网址上下文

不受支持

使用选项

Batch API

支持

Flex 推理

支持

优先级推断

支持

版本
如需了解详情,请参阅模型版本模式
  • gemini-3.8-flash-tts
最新更新 2026 年 7 月

支持的语言

gemini-3.8-flash-tts 可自动检测输入语言,并支持 130 种语言

语言 语言 语言
亚齐语(阿拉伯文字) 希腊语 尼泊尔语(单独的语言)
南非荷兰语 瓜拉尼人 尼日利亚富拉语
阿坎语 古吉拉特语 阿塞拜疆北部
阿姆哈拉语 海地克里奥尔语 北索托语
亚美尼亚语 喀尔喀蒙古语 乌兹别克北部
阿萨姆语 豪萨语 挪威博克马尔语
阿瓦德语 希伯来语 挪威语(尼诺斯克语)
巴厘语 印地语 尼昂加语
孟加拉语 匈牙利语 奥克斯坦语
班查语(阿拉伯文字) 冰岛语 奥里亚语(单个语言)
班查语(拉丁文字) 伊博语 邦阿西楠语
巴什基尔语 伊洛果语 波斯语(阿富汗)
巴斯克语 印度尼西亚语 波兰语
白俄罗斯语 伊朗波斯语 葡萄牙语
奔巴语 意大利语 旁遮普语
博杰普尔语 日语 罗马尼亚语
波斯尼亚语 爪哇语 俄语
布吉文 卡拜尔语 桑塔利语
保加利亚语 卡姆巴语 塞尔维亚语
缅甸语 卡纳达语 信德语
粤语 克什米尔语(阿拉伯文字) 僧伽罗语
加泰罗尼亚语 克什米尔语(梵文) 斯洛伐克语
宿务语 哈萨克语 斯洛文尼亚语
中部库尔德语 高棉语 索马里语
恰蒂斯加尔语 吉库尤语 南阿塞拜疆语
中文(汉字) 卢旺达语 南部普什图语
中文(繁体) 刚果语 南索托语
克里米亚鞑靼语 韩语 西班牙语
克罗地亚语 吉尔吉斯语 标准阿拉伯语(阿拉伯文字)
捷克 老挝语 标准阿拉伯语(拉丁文字)
丹麦语 拉特加莱语 标准拉脱维亚语
荷兰语 林加拉语 标准马来语
迪尤拉语 立陶宛语 斯瓦希里语(单个语言)
宗卡语 卢森堡语 斯瓦特语
阿拉伯语(埃及) 马其顿语 瑞典语
英语 摩揭陀语 塔吉克语
爱沙尼亚语 迈蒂利语 泰米尔语
菲律宾语 马拉雅拉姆语 泰卢固语
芬兰语 马耳他语 泰语
法语 曼尼普尔语 提格里尼亚语
加利西亚语 马拉地语 阿尔巴尼亚语托斯克方言
干达语 米南佳保语(阿拉伯文字) 维吾尔语
格鲁吉亚语 米南佳保语(拉丁文字)
德语 米佐语