Gemini 3.8 Flash-Lite TTS

Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) 是 Google 快速且经济实惠的主力文字转语音模型,旨在取代 gemini-3.1-flash-tts-preview,以处理高吞吐量的生产工作负载。

概览和功能

Gemini 3.8 Flash-Lite TTS 将低延迟与富有表现力的自然语音相结合:

  • 高吞吐量效率:经过优化,可用于批量制作、对话式语音代理级联、朗读功能以及日常单扬声器语音生成(支持多种主要语言)。
  • 即插即用的架构兼容性:与 gemini-3.8-flash-tts 共享完全相同的 API 架构和结构化提示格式,只需更改一个参数即可切换模型。
  • 全面的语音生态系统支持:支持预建语音、扩展语音库 (GET /v1beta/voices)、自定义语音设计角色和语音复制(默认情况下为持久存储的语音,另有可选的无状态密钥)。您还可以在 Google AI Studio 中以交互方式设计和复制声音。

如需全面了解功能、提示最佳实践和代码示例,请访问 Text-to-speech 指南。

何时使用哪种 TTS 模型

这两种 Gemini 3.8 TTS 模型具有相同的 API schema 和提示结构。选择适合您工作负载的型号:

功能 / 工作负载 Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
主要优势 高吞吐量、低延迟和高成本效益 最大限度地提高语音保真度、表演细微差别和方言覆盖率
最佳应用场景 大批量制作、实时语音代理级联、朗读功能、语音复刻、日常单扬声器生成 有声读物、录音室旁白、复杂的多发言人对话、爆发式表演、发音困难的词语、方言
支持的语言 101 种语言 130 种语言
建议替换为 gemini-3.1-flash-tts-preview 新的旗舰版广告素材层级

迁移指南

如果您要从 gemini-3.1-flash-tts-preview 升级到 gemini-3.8-flash-lite-tts,请更新 Gemini 3.8 TTS 架构的请求:

  1. 将回合级指令移至 speech_metadata:Gemini 3.8 TTS 会将输入文本严格视为逐字转写内容。系统可能会朗读 "Say cheerfully: Hello!""Speaker 1: Hello!" 等内嵌文字方向。 将持续交付指令 (style) 和说话人标签 (speaker) 移至结构化元数据中:
    • Interactions API:为每个文本内容块附加带有 "type": "speech_metadata""speaker""style" 的注释。
    • GenerateContent API:将 "speech_metadata": {"speaker": "...", "style": "..."} 附加到每个 part
  2. 仅针对时间点上的发声事件使用尖括号内嵌标记:使用尖括号(例如 <laugh><sigh><cough><breath><short pause>)将短暂的非语音发声和停顿内嵌在转写内容中。将耳语等朗读风格放在 speech_metadata.style 中。
  3. 在多说话人请求的每个回合中指定 speaker:多说话人请求 的每个回合都必须在 speech_metadata 内明确包含 speaker,且 与配置的说话人之一相匹配。
  4. 使用语音设计预先设计角色:使用在 语音设计中创建的自定义语音替换冗长的旧版音频 配置文件 / 导演注释块,然后通过 TTS 请求传递该 voice_... ID,同时使用最少的 字符串或不使用任何 style 字符串。
  5. 在一元请求中考虑默认 WAV (audio/wav) 输出:与 gemini-3.1-flash-tts-preview 及更早的 TTS 模型(默认返回无标头的原始 PCM audio/l16)不同,Gemini 3.8 TTS 默认针对一元请求返回带有标准 RIFF 标头的 WAV 音频 (audio/wav / AUDIO_WAV)。
    • 如果您的代码之前将原始 PCM 字节封装在 WAV 标头中(例如,使用 Python 的 wave 模块或 ffmpeg),请移除手动标头封装,并将返回的字节直接写入 .wav 文件。
    • 如果流水线需要无标头的原始 PCM、mu-law 或 A-law 音频,请将 response_format 明确设置为 "audio/l16" ("AUDIO_L16")、"audio/mulaw" ("AUDIO_MULAW") 或 "audio/alaw" ("AUDIO_ALAW")。请参阅音频输出格式

gemini-3.8-flash-lite-tts

属性 说明
模型代码 gemini-3.8-flash-lite-tts
支持的数据类型

输入源

文本

输出

音频

令牌限制[*]

输入 token 限制

8192

输出 token 限制

16384

功能

音频生成

支持

缓存

支持

代码执行

不受支持

文件搜索

不受支持

函数调用

不受支持

Grounding with Google Maps

不受支持

图片生成

不受支持

Live API

不受支持

搜索接地

不受支持

结构化输出

不受支持

思考

不受支持

网址上下文

不受支持

使用选项

Batch API

支持

Flex 推理

支持

优先级推断

支持

版本
如需了解详情,请参阅模型版本模式
  • gemini-3.8-flash-lite-tts
最新更新 2026 年 7 月

支持的语言

gemini-3.8-flash-lite-tts 可自动检测输入语言,并支持 101 种语言

语言 语言 语言
亚齐语(阿拉伯文字) 格鲁吉亚语 马耳他语
南非荷兰语 德语 曼尼普尔语
阿坎语 希腊语 马拉地语
阿姆哈拉语 古吉拉特语 米南佳保语(阿拉伯文字)
亚美尼亚语 海地克里奥尔语 米佐语
阿萨姆语 喀尔喀蒙古语 尼泊尔语(单独的语言)
阿瓦德语 豪萨语 尼日利亚富拉语
巴厘语 希伯来语 阿塞拜疆北部
孟加拉语 印地语 北索托语
班查语(拉丁文字) 匈牙利语 乌兹别克北部
巴斯克语 冰岛语 挪威博克马尔语
白俄罗斯语 伊洛果语 挪威语(尼诺斯克语)
博杰普尔语 印度尼西亚语 尼昂加语
波斯尼亚语 伊朗波斯语 奥里亚语(单个语言)
布吉文 意大利语 波斯语(阿富汗)
保加利亚语 日语 波兰语
粤语 爪哇语 葡萄牙语
加泰罗尼亚语 卡姆巴语 旁遮普语
宿务语 卡纳达语 罗马尼亚语
中部库尔德语 克什米尔语(阿拉伯文字) 俄语
恰蒂斯加尔语 克什米尔语(梵文) 桑塔利语
中文(汉字) 哈萨克语 塞尔维亚语
中文(繁体) 高棉语 僧伽罗语
克罗地亚语 吉库尤语 斯洛伐克语
捷克 卢旺达语 南阿塞拜疆语
丹麦语 刚果语 南部普什图语
荷兰语 韩语 西班牙语
阿拉伯语(埃及) 吉尔吉斯语 标准阿拉伯语(阿拉伯文字)
英语 老挝语 标准阿拉伯语(拉丁文字)
爱沙尼亚语 林加拉语 标准拉脱维亚语
菲律宾语 马其顿语 标准马来语
法语 摩揭陀语 泰米尔语
加利西亚语 迈蒂利语 泰卢固语
干达语 马拉雅拉姆语