Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) 是 Google 的旗舰创意文字转语音模型,专为提供录音室级语音保真度、富有表现力的表演、地道的区域口音和可靠的长篇多轮对话稳定性而设计。
概览和功能
Gemini 3.8 Flash TTS 为富有表现力的音频生成树立了新标杆:
- 高保真音效和表演细节:可呈现丰富的情感范围、自然的语调,并精确遵循回合级
style指令以及内嵌的语音事件(<laugh>、<sigh>、<short pause>)。 - 长对话多轮稳定性:在长时间的对话和长达数分钟的旁白中,保持一致的语音特征、音色、音量和声学室调,不会出现语音漂移。
- 地道的区域口音和发音:支持区域口音、少数民族方言和内嵌的国际音标 (IPA) 替换。
- 全面的语音生态系统支持:可与预构建的语音、扩展语音库 (
GET /v1beta/voices)、自定义语音设计角色和语音复制(默认情况下为持久存储的语音,另有可选的无状态密钥)无缝协作。您还可以在 Google AI Studio 中以交互方式设计和复制声音。
如需全面了解功能、提示最佳实践和代码示例,请访问文字转语音指南。
何时使用哪种 TTS 模型
这两种 Gemini 3.8 TTS 模型共享相同的 API 架构和提示结构。选择适合您工作负载的型号:
| 功能 / 工作负载 | Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
|---|---|---|
| 主要优势 | 最大限度地提高语音保真度、表演细微差别和方言覆盖率 | 高吞吐量、低延迟和高成本效益 |
| 最佳应用场景 | 有声读物、录音室旁白、复杂的多人对话、爆发式表演、发音困难、方言 | 大批量制作、实时语音代理级联、朗读功能、语音复刻、日常单扬声器生成 |
| 支持的语言 | 130 种语言 | 101 种语言 |
| 建议替换为 | 新的旗舰版广告素材层级 | gemini-3.1-flash-tts-preview |
迁移指南
如果您要从 gemini-3.1-flash-tts-preview 或更早版本的 Gemini TTS 模型迁移,请更新您的请求以使用 Gemini 3.8 TTS 架构:
- 将回合级指令移至
speech_metadata:Gemini 3.8 TTS 会将输入文本严格视为逐字转写内容。系统可能会朗读"Say cheerfully: Hello!"或"Speaker 1: Hello!"等内嵌文字方向。 将持续交付指令 (style) 和说话人标签 (speaker) 移至结构化元数据中:- Interactions API:为每个文本内容块附加带有
"type": "speech_metadata"、"speaker"和"style"的注释。 - GenerateContent API:将
"speech_metadata": {"speaker": "...", "style": "..."}附加到每个part。
- Interactions API:为每个文本内容块附加带有
- 仅针对时间点上的发声事件使用尖括号内嵌标记:使用尖括号(例如
<laugh>、<sigh>、<cough>、<breath>或<short pause>)将短暂的非语音发声和停顿内嵌在转写内容中。将耳语等朗读风格放在speech_metadata.style中。 - 在多说话人请求的每个回合中指定
speaker:多说话人请求 的每个回合都必须在speech_metadata内明确包含speaker,且 与配置的说话人之一相匹配。 - 使用语音设计预先设计角色:使用在
语音设计中创建的自定义语音替换冗长的旧版音频
配置文件 / 导演注释代码块,然后通过 TTS 请求传递该
voice_...ID,并使用最少的 字符串或空style字符串。 - 在一元请求中考虑默认 WAV (
audio/wav) 输出:与gemini-3.1-flash-tts-preview及更早的 TTS 模型(默认返回无标头的原始 PCMaudio/l16)不同,Gemini 3.8 TTS 默认针对一元请求返回带有标准 RIFF 标头的 WAV 音频 (audio/wav/AUDIO_WAV)。- 如果您的代码之前将原始 PCM 字节封装在 WAV 标头中(例如,使用 Python 的
wave模块或ffmpeg),请移除手动标头封装,并将返回的字节直接写入.wav文件。 - 如果您的流水线需要无标头的原始 PCM、mu-law 或 A-law 音频,请将
response_format明确设置为"audio/l16"("AUDIO_L16")、"audio/mulaw"("AUDIO_MULAW") 或"audio/alaw"("AUDIO_ALAW")。请参阅音频输出格式。
- 如果您的代码之前将原始 PCM 字节封装在 WAV 标头中(例如,使用 Python 的
gemini-3.8-flash-tts
| 属性 | 说明 |
|---|---|
| 模型代码 | gemini-3.8-flash-tts |
| 支持的数据类型 |
输入源 文本 输出 音频 |
| 令牌限制[*] |
输入 token 限制 8192 输出 token 限制 16384 |
| 功能 | 支持 支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 |
| 使用选项 |
支持 支持 支持 |
| 版本 |
|
| 最新更新 | 2026 年 7 月 |
支持的语言
gemini-3.8-flash-tts 可自动检测输入语言,并支持 130 种语言:
| 语言 | 语言 | 语言 |
|---|---|---|
| 亚齐语(阿拉伯文字) | 希腊语 | 尼泊尔语(单独的语言) |
| 南非荷兰语 | 瓜拉尼人 | 尼日利亚富拉语 |
| 阿坎语 | 古吉拉特语 | 阿塞拜疆北部 |
| 阿姆哈拉语 | 海地克里奥尔语 | 北索托语 |
| 亚美尼亚语 | 喀尔喀蒙古语 | 乌兹别克北部 |
| 阿萨姆语 | 豪萨语 | 挪威博克马尔语 |
| 阿瓦德语 | 希伯来语 | 挪威语(尼诺斯克语) |
| 巴厘语 | 印地语 | 尼昂加语 |
| 孟加拉语 | 匈牙利语 | 奥克斯坦语 |
| 班查语(阿拉伯文字) | 冰岛语 | 奥里亚语(单个语言) |
| 班查语(拉丁文字) | 伊博语 | 邦阿西楠语 |
| 巴什基尔语 | 伊洛果语 | 波斯语(阿富汗) |
| 巴斯克语 | 印度尼西亚语 | 波兰语 |
| 白俄罗斯语 | 伊朗波斯语 | 葡萄牙语 |
| 奔巴语 | 意大利语 | 旁遮普语 |
| 博杰普尔语 | 日语 | 罗马尼亚语 |
| 波斯尼亚语 | 爪哇语 | 俄语 |
| 布吉文 | 卡拜尔语 | 桑塔利语 |
| 保加利亚语 | 卡姆巴语 | 塞尔维亚语 |
| 缅甸语 | 卡纳达语 | 信德语 |
| 粤语 | 克什米尔语(阿拉伯文字) | 僧伽罗语 |
| 加泰罗尼亚语 | 克什米尔语(梵文) | 斯洛伐克语 |
| 宿务语 | 哈萨克语 | 斯洛文尼亚语 |
| 中部库尔德语 | 高棉语 | 索马里语 |
| 恰蒂斯加尔语 | 吉库尤语 | 南阿塞拜疆语 |
| 中文(汉字) | 卢旺达语 | 南部普什图语 |
| 中文(繁体) | 刚果语 | 南索托语 |
| 克里米亚鞑靼语 | 韩语 | 西班牙语 |
| 克罗地亚语 | 吉尔吉斯语 | 标准阿拉伯语(阿拉伯文字) |
| 捷克 | 老挝语 | 标准阿拉伯语(拉丁文字) |
| 丹麦语 | 拉特加莱语 | 标准拉脱维亚语 |
| 荷兰语 | 林加拉语 | 标准马来语 |
| 迪尤拉语 | 立陶宛语 | 斯瓦希里语(单个语言) |
| 宗卡语 | 卢森堡语 | 斯瓦特语 |
| 阿拉伯语(埃及) | 马其顿语 | 瑞典语 |
| 英语 | 摩揭陀语 | 塔吉克语 |
| 爱沙尼亚语 | 迈蒂利语 | 泰米尔语 |
| 菲律宾语 | 马拉雅拉姆语 | 泰卢固语 |
| 芬兰语 | 马耳他语 | 泰语 |
| 法语 | 曼尼普尔语 | 提格里尼亚语 |
| 加利西亚语 | 马拉地语 | 阿尔巴尼亚语托斯克方言 |
| 干达语 | 米南佳保语(阿拉伯文字) | 维吾尔语 |
| 格鲁吉亚语 | 米南佳保语(拉丁文字) | — |
| 德语 | 米佐语 | — |