Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) 是 Google 快速且经济实惠的主力文字转语音模型,旨在取代 gemini-3.1-flash-tts-preview,以处理高吞吐量的生产工作负载。
概览和功能
Gemini 3.8 Flash-Lite TTS 将低延迟与富有表现力的自然语音相结合:
- 高吞吐量效率:经过优化,可用于批量制作、对话式语音代理级联、朗读功能以及日常单扬声器语音生成(支持多种主要语言)。
- 即插即用的架构兼容性:与
gemini-3.8-flash-tts共享完全相同的 API 架构和结构化提示格式,只需更改一个参数即可切换模型。 - 全面的语音生态系统支持:支持预建语音、扩展语音库 (
GET /v1beta/voices)、自定义语音设计角色和语音复制(默认情况下为持久存储的语音,另有可选的无状态密钥)。您还可以在 Google AI Studio 中以交互方式设计和复制声音。
如需全面了解功能、提示最佳实践和代码示例,请访问 Text-to-speech 指南。
何时使用哪种 TTS 模型
这两种 Gemini 3.8 TTS 模型具有相同的 API schema 和提示结构。选择适合您工作负载的型号:
| 功能 / 工作负载 | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| 主要优势 | 高吞吐量、低延迟和高成本效益 | 最大限度地提高语音保真度、表演细微差别和方言覆盖率 |
| 最佳应用场景 | 大批量制作、实时语音代理级联、朗读功能、语音复刻、日常单扬声器生成 | 有声读物、录音室旁白、复杂的多发言人对话、爆发式表演、发音困难的词语、方言 |
| 支持的语言 | 101 种语言 | 130 种语言 |
| 建议替换为 | gemini-3.1-flash-tts-preview |
新的旗舰版广告素材层级 |
迁移指南
如果您要从 gemini-3.1-flash-tts-preview 升级到 gemini-3.8-flash-lite-tts,请更新 Gemini 3.8 TTS 架构的请求:
- 将回合级指令移至
speech_metadata:Gemini 3.8 TTS 会将输入文本严格视为逐字转写内容。系统可能会朗读"Say cheerfully: Hello!"或"Speaker 1: Hello!"等内嵌文字方向。 将持续交付指令 (style) 和说话人标签 (speaker) 移至结构化元数据中:- Interactions API:为每个文本内容块附加带有
"type": "speech_metadata"、"speaker"和"style"的注释。 - GenerateContent API:将
"speech_metadata": {"speaker": "...", "style": "..."}附加到每个part。
- Interactions API:为每个文本内容块附加带有
- 仅针对时间点上的发声事件使用尖括号内嵌标记:使用尖括号(例如
<laugh>、<sigh>、<cough>、<breath>或<short pause>)将短暂的非语音发声和停顿内嵌在转写内容中。将耳语等朗读风格放在speech_metadata.style中。 - 在多说话人请求的每个回合中指定
speaker:多说话人请求 的每个回合都必须在speech_metadata内明确包含speaker,且 与配置的说话人之一相匹配。 - 使用语音设计预先设计角色:使用在
语音设计中创建的自定义语音替换冗长的旧版音频
配置文件 / 导演注释块,然后通过 TTS 请求传递该
voice_...ID,同时使用最少的 字符串或不使用任何style字符串。 - 在一元请求中考虑默认 WAV (
audio/wav) 输出:与gemini-3.1-flash-tts-preview及更早的 TTS 模型(默认返回无标头的原始 PCMaudio/l16)不同,Gemini 3.8 TTS 默认针对一元请求返回带有标准 RIFF 标头的 WAV 音频 (audio/wav/AUDIO_WAV)。- 如果您的代码之前将原始 PCM 字节封装在 WAV 标头中(例如,使用 Python 的
wave模块或ffmpeg),请移除手动标头封装,并将返回的字节直接写入.wav文件。 - 如果流水线需要无标头的原始 PCM、mu-law 或 A-law 音频,请将
response_format明确设置为"audio/l16"("AUDIO_L16")、"audio/mulaw"("AUDIO_MULAW") 或"audio/alaw"("AUDIO_ALAW")。请参阅音频输出格式。
- 如果您的代码之前将原始 PCM 字节封装在 WAV 标头中(例如,使用 Python 的
gemini-3.8-flash-lite-tts
| 属性 | 说明 |
|---|---|
| 模型代码 | gemini-3.8-flash-lite-tts |
| 支持的数据类型 |
输入源 文本 输出 音频 |
| 令牌限制[*] |
输入 token 限制 8192 输出 token 限制 16384 |
| 功能 | 支持 支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 不受支持 |
| 使用选项 |
支持 支持 支持 |
| 版本 |
|
| 最新更新 | 2026 年 7 月 |
支持的语言
gemini-3.8-flash-lite-tts 可自动检测输入语言,并支持 101 种语言:
| 语言 | 语言 | 语言 |
|---|---|---|
| 亚齐语(阿拉伯文字) | 格鲁吉亚语 | 马耳他语 |
| 南非荷兰语 | 德语 | 曼尼普尔语 |
| 阿坎语 | 希腊语 | 马拉地语 |
| 阿姆哈拉语 | 古吉拉特语 | 米南佳保语(阿拉伯文字) |
| 亚美尼亚语 | 海地克里奥尔语 | 米佐语 |
| 阿萨姆语 | 喀尔喀蒙古语 | 尼泊尔语(单独的语言) |
| 阿瓦德语 | 豪萨语 | 尼日利亚富拉语 |
| 巴厘语 | 希伯来语 | 阿塞拜疆北部 |
| 孟加拉语 | 印地语 | 北索托语 |
| 班查语(拉丁文字) | 匈牙利语 | 乌兹别克北部 |
| 巴斯克语 | 冰岛语 | 挪威博克马尔语 |
| 白俄罗斯语 | 伊洛果语 | 挪威语(尼诺斯克语) |
| 博杰普尔语 | 印度尼西亚语 | 尼昂加语 |
| 波斯尼亚语 | 伊朗波斯语 | 奥里亚语(单个语言) |
| 布吉文 | 意大利语 | 波斯语(阿富汗) |
| 保加利亚语 | 日语 | 波兰语 |
| 粤语 | 爪哇语 | 葡萄牙语 |
| 加泰罗尼亚语 | 卡姆巴语 | 旁遮普语 |
| 宿务语 | 卡纳达语 | 罗马尼亚语 |
| 中部库尔德语 | 克什米尔语(阿拉伯文字) | 俄语 |
| 恰蒂斯加尔语 | 克什米尔语(梵文) | 桑塔利语 |
| 中文(汉字) | 哈萨克语 | 塞尔维亚语 |
| 中文(繁体) | 高棉语 | 僧伽罗语 |
| 克罗地亚语 | 吉库尤语 | 斯洛伐克语 |
| 捷克 | 卢旺达语 | 南阿塞拜疆语 |
| 丹麦语 | 刚果语 | 南部普什图语 |
| 荷兰语 | 韩语 | 西班牙语 |
| 阿拉伯语(埃及) | 吉尔吉斯语 | 标准阿拉伯语(阿拉伯文字) |
| 英语 | 老挝语 | 标准阿拉伯语(拉丁文字) |
| 爱沙尼亚语 | 林加拉语 | 标准拉脱维亚语 |
| 菲律宾语 | 马其顿语 | 标准马来语 |
| 法语 | 摩揭陀语 | 泰米尔语 |
| 加利西亚语 | 迈蒂利语 | 泰卢固语 |
| 干达语 | 马拉雅拉姆语 | — |