Voices API 可让您通过自然语言提示(语音设计)或参考音频和发言者同意录音(语音复制)来创建自定义语音,还可以列出、检索和管理用于 Text-to-Speech (TTS) 合成的自定义语音和预构建语音。
CreateVoice
根据自然语言提示 (`VOICE_TYPE_PROMPTED`) 或参考音频和同意音频录制内容 (`VOICE_TYPE_REPLICATED`) 创建自定义声音。
请求正文
请求正文中包含结构如下的数据:
可选。所创建的声音是否由 Google 持久保存和管理。 * 如果为 `true`,Google 会存储语音并返回 `Voice.id`(例如 `voice_abc123def456`),该 ID 可通过 `GetVoice`、`ListVoices` 和 `DeleteVoice` 进行管理,并在合成请求中通过 ID 进行引用。项目受有效存储语音配额上限的限制;超出配额会返回 `RESOURCE_EXHAUSTED`。 * 如果为 `false`(默认值),Google 不会存储语音,而是返回 `Voice.key`(例如 `voicekey_…`)以供客户端存储和合成。当 `store` 为 `false` 时,不会保留或返回 `voice` 上的可选发现元数据字段。 * 当 `voice.type` 为 `"prompted"` 时,必须为 `true`(否则会因 `INVALID_ARGUMENT` 而失败)。
必需。要创建的声音。 `voice.model` 是可选的;如果省略,服务会选择默认的语音创建模型。如果设置了“Voice”上的仅输出字段(“id”“key”“expire_time”“usage”),系统会忽略这些字段。
响应
如果成功,响应正文将包含结构如下的数据:
可选。地区口音描述符(例如“美式”“英式”)。
可选。最佳使用情境或网域(例如“对话”“有声读物”“新闻”)。
可选。对声音音色、个性和语气的描述性总结。
可选。用户为存储的语音提供的显示名称(<code>store = true</code>),或预建语音的目录名称。
仅限输出。自定义存储语音(`store = true`)或复制语音密钥(`store = false`)的过期时间戳。针对不会过期的预构建目录语音(“预构建”)取消设置。
可选。感知到的声音性别呈现(例如“女性”“男性”“中性”)。
仅限输出。语音的唯一标识符。 * 对于 Google 管理的自定义声音(`store = true`),这是一个带有前缀 `voice_` 的生成 ID(例如,`voice_abc123def456`)。在 `GetVoice` 和 `DeleteVoice` 中,将 `voices/{id}` 作为 `name` 传递;在语音合成期间,将 `{id}` 直接传递给 `SpeechConfig.voice_config.voice`(或 `SpeechConfig.voice`)。 * 对于预构建的目录语音(由 `ListVoices` 返回的 `"prebuilt"`),这是说话人名称(例如 `Puck` 或 `Charon`)。 * 如果在调用 `CreateVoice` 时将 `store` 设置为 `false`,则未设置。
仅限输出。客户端管理的语音复刻密钥(带有前缀“voicekey_”)。仅当“type”为“replicated”且“store”为“false”时,由“CreateVoice”返回。在语音合成期间,将此密钥传递给“SpeechConfig.voice_config.voice”(或“SpeechConfig.voice”)。
可选。主要 BCP-47 语言标记(例如“en-US”“fr-FR”)。
可选。用于设计或复制语音的模型。 如果 `CreateVoice` 中省略了此参数,则默认为最新支持的语音设计模型。在 `CreateVoice`、`GetVoice` 和 `ListVoices` 响应中针对自定义语音(“prompted”和“replicated”)返回;对于“prebuilt”语音,则未设置。创建的语音可以跨任何受支持的 TTS 合成模型进行合成。
可选。预期的人设或角色原型(例如“热情友好”“旁白”)。
音调 音调 (选填)
可选。语音音调分类。
可能的值
-
low调低音调。
-
medium中等音调的声音。
-
high调高音调。
提示 PromptedVoice (可选)
提示式语音生成的参数。 当 `type` 为 `"prompted"` 时,在 `CreateVoice` 中是必需的。在 `CreateVoice`、`GetVoice` 和 `ListVoices` 响应中针对提示的语音返回。
字段
必需。描述所需声音的自然语言提示,例如“一个中年邪恶巨魔的低沉洪亮的男声”。
可选。ISO 3166-1 alpha-2 或联合国 M.49 地理区域代码(例如“US”“GB”“001”)。
sample_audio AudioData (可选)
仅限输出。为提示的语音生成的音频样本(合成器提示音频)。 仅在 `CreateVoice` 和 `GetVoice` 响应中填充(当 `type` 为“prompted”时);在 `ListVoices` 响应中以及对于“replicated”或“prebuilt”语音,此字段处于未设置状态。
字段
必需。原始音频字节。
必需。音频数据的 IANA MIME 类型(例如 `audio/wav` 或 `audio/mpeg`)。
type VoiceType (可选)
必需。语音类型。在 `CreateVoice` 中,必须为 `"replicated"` 或 `"prompted"`。在 `ListVoices` 响应中,也可以为 `"prebuilt"`。
可能的值
-
replicated根据参考音频样本和发言者同意书录制内容复制的自定义语音。
-
prompted根据自然语言文本提示生成的自定义语音。
-
prebuiltGoogle 语音目录中的内置系统语音(例如 `Puck`、`Charon`)。在响应中返回;无法在 `CreateVoice` 中指定为类型。
用法 用法 (可选)
仅限输出。语音创建请求的令牌使用情况统计信息。 仅在 `CreateVoice` 的响应中填充(当 `type` 为 `"prompted"` 时);对于 `"replicated"` 以及 `GetVoice` 和 `ListVoices` 响应,则未设置。
字段
cached_tokens_by_modality array (ModalityTokens) (可选)
按模态划分的缓存 token 使用情况细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
grounding_tool_count 数组 (GroundingToolCount) (可选)
接地工具数量。
字段
接地工具数量。
与数量关联的接地工具类型。
可能的值:
-
google_search依托 Google 网页搜索和图片搜索进行接地,以及适用于企业的 Web 接地。
-
google_mapsGrounding with Google Maps
input_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的输入 token 使用情况细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
output_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的输出 token 用量细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
tool_use_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的工具使用情况令牌用量细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
提示的缓存部分(缓存内容)中的 token 数量。
提示(上下文)中的 token 数量。
所有生成的回答中的 token 总数。
思考模型的想法的 token 数量。
互动请求(提示 + 回答 + 其他内部 token)的总 token 数量。
工具使用提示中的 token 数量。
示例
示例响应
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
列出调用者拥有的自定义存储语音(按最新排序),然后列出 Google 语音目录中的预构建系统语音。
路径 / 查询参数
可选。按口音说明(例如“美式”“英式”)过滤。 不区分大小写的完全匹配。如果指定了多个值,则匹配具有任意指定口音的语音(OR)。
可选。按预期上下文或网域(例如“新闻、商业”)过滤。 不区分大小写的完全匹配。如果指定了多个值,则匹配具有任意指定上下文的语音(OR)。
可选。按性别表达过滤(例如“女性”“男性”“中性”)。 不区分大小写的完全匹配。如果指定了多个值,则匹配具有任意指定性别的声音 (OR)。
可选。按 BCP-47 语言代码(例如“en-US”)过滤。 不区分大小写的完全匹配。如果指定了多个值,则匹配具有任何指定语言代码的声音 (OR)。
可选。每页返回的最大声音数量。服务返回的值可能小于此值。如果未指定,则最多返回 50 个声音。最大值为 1000;大于 1000 的值会强制转换为 1000。
可选。从之前的 `ListVoices` 调用接收的页面令牌。提供此令牌可检索后续页面。 进行分页时,所有过滤查询参数(`language_code`、`region_code`、`accent`、`persona`、`context`、`gender`、`pitch`、`type` 和 `search`)都必须与返回此令牌的调用相匹配;否则,请求会因 `INVALID_ARGUMENT` 而失败。`page_size` 在不同页面之间可能会发生变化。
可选。按声音角色过滤(例如“温暖、友好”)。 不区分大小写的完全匹配。如果指定了多个值,则匹配具有任意指定角色特征的声音(OR)。
可选。按人声音调过滤。接受“低”“中”“高”或“PITCH_LOW”“PITCH_MEDIUM”“PITCH_HIGH”(不区分大小写)。如果指定了多个值,则匹配具有任何指定音高的声音(OR)。
可选。按 ISO 3166-1 alpha-2 或联合国 M.49 地区代码(例如“US”“001”)过滤。 不区分大小写的完全匹配。如果指定了多个值,则匹配具有任何指定区域代码(OR)的语音。
可选。自由文本子字符串搜索查询,不区分大小写地与 `display_name` 和 `description` 进行匹配。长度上限为 2048 字节。
可选。按语音类型过滤。接受“prebuilt”“replicated”“prompted”或“VOICE_TYPE_PREBUILT”“VOICE_TYPE_REPLICATED”“VOICE_TYPE_PROMPTED”(不区分大小写)。如果指定了多个值,则匹配具有任意指定类型的声音(OR)。
响应
如果成功,响应正文将包含结构如下的数据:
可作为 `page_token` 发送并用于检索下一页的令牌。 如果为空,则表示没有后续页面。
指定集合中的声音。
示例
示例响应
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
按资源名称获取自定义存储语音(`store = true`)。 无法通过 `GetVoice` 检索预构建目录语音 (`VOICE_TYPE_PREBUILT`);请改用 `ListVoices`。
路径 / 查询参数
必需。要检索的自定义存储语音的资源名称(例如,`voices/voice_abc123def456`)。
响应
如果成功,响应正文将包含结构如下的数据:
可选。地区口音描述符(例如“美式”“英式”)。
可选。最佳使用情境或网域(例如“对话”“有声读物”“新闻”)。
可选。对声音音色、个性和语气的描述性总结。
可选。用户为存储的语音提供的显示名称(<code>store = true</code>),或预建语音的目录名称。
仅限输出。自定义存储语音(`store = true`)或复制语音密钥(`store = false`)的过期时间戳。针对不会过期的预构建目录语音(“预构建”)取消设置。
可选。感知到的声音性别呈现(例如“女性”“男性”“中性”)。
仅限输出。语音的唯一标识符。 * 对于 Google 管理的自定义声音(`store = true`),这是一个带有前缀 `voice_` 的生成 ID(例如,`voice_abc123def456`)。在 `GetVoice` 和 `DeleteVoice` 中,将 `voices/{id}` 作为 `name` 传递;在语音合成期间,将 `{id}` 直接传递给 `SpeechConfig.voice_config.voice`(或 `SpeechConfig.voice`)。 * 对于预构建的目录语音(由 `ListVoices` 返回的 `"prebuilt"`),这是说话人名称(例如 `Puck` 或 `Charon`)。 * 如果在调用 `CreateVoice` 时将 `store` 设置为 `false`,则未设置。
仅限输出。客户端管理的语音复刻密钥(带有前缀“voicekey_”)。仅当“type”为“replicated”且“store”为“false”时,由“CreateVoice”返回。在语音合成期间,将此密钥传递给“SpeechConfig.voice_config.voice”(或“SpeechConfig.voice”)。
可选。主要 BCP-47 语言标记(例如“en-US”“fr-FR”)。
可选。用于设计或复制语音的模型。 如果 `CreateVoice` 中省略了此参数,则默认为最新支持的语音设计模型。在 `CreateVoice`、`GetVoice` 和 `ListVoices` 响应中针对自定义语音(“prompted”和“replicated”)返回;对于“prebuilt”语音,则未设置。创建的语音可以跨任何受支持的 TTS 合成模型进行合成。
可选。预期的人设或角色原型(例如“热情友好”“旁白”)。
音调 音调 (选填)
可选。语音音调分类。
可能的值
-
low调低音调。
-
medium中等音调的声音。
-
high调高音调。
提示 PromptedVoice (可选)
提示式语音生成的参数。 当 `type` 为 `"prompted"` 时,在 `CreateVoice` 中是必需的。在 `CreateVoice`、`GetVoice` 和 `ListVoices` 响应中针对提示的语音返回。
字段
必需。描述所需声音的自然语言提示,例如“一个中年邪恶巨魔的低沉洪亮的男声”。
可选。ISO 3166-1 alpha-2 或联合国 M.49 地理区域代码(例如“US”“GB”“001”)。
sample_audio AudioData (可选)
仅限输出。为提示的语音生成的音频样本(合成器提示音频)。 仅在 `CreateVoice` 和 `GetVoice` 响应中填充(当 `type` 为“prompted”时);在 `ListVoices` 响应中以及对于“replicated”或“prebuilt”语音,此字段处于未设置状态。
字段
必需。原始音频字节。
必需。音频数据的 IANA MIME 类型(例如 `audio/wav` 或 `audio/mpeg`)。
type VoiceType (可选)
必需。语音类型。在 `CreateVoice` 中,必须为 `"replicated"` 或 `"prompted"`。在 `ListVoices` 响应中,也可以为 `"prebuilt"`。
可能的值
-
replicated根据参考音频样本和发言者同意书录制内容复制的自定义语音。
-
prompted根据自然语言文本提示生成的自定义语音。
-
prebuiltGoogle 语音目录中的内置系统语音(例如 `Puck`、`Charon`)。在响应中返回;无法在 `CreateVoice` 中指定为类型。
用法 用法 (可选)
仅限输出。语音创建请求的令牌使用情况统计信息。 仅在 `CreateVoice` 的响应中填充(当 `type` 为 `"prompted"` 时);对于 `"replicated"` 以及 `GetVoice` 和 `ListVoices` 响应,则未设置。
字段
cached_tokens_by_modality array (ModalityTokens) (可选)
按模态划分的缓存 token 使用情况细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
grounding_tool_count 数组 (GroundingToolCount) (可选)
接地工具数量。
字段
接地工具数量。
与数量关联的接地工具类型。
可能的值:
-
google_search依托 Google 网页搜索和图片搜索进行接地,以及适用于企业的 Web 接地。
-
google_mapsGrounding with Google Maps
input_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的输入 token 使用情况细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
output_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的输出 token 用量细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
tool_use_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的工具使用情况令牌用量细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
提示的缓存部分(缓存内容)中的 token 数量。
提示(上下文)中的 token 数量。
所有生成的回答中的 token 总数。
思考模型的想法的 token 数量。
互动请求(提示 + 回答 + 其他内部 token)的总 token 数量。
工具使用提示中的 token 数量。
示例
示例响应
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
按资源名称删除自定义存储的声音(<code>store = true</code>)。 无法删除预构建的目录语音 (`VOICE_TYPE_PREBUILT`)。
路径 / 查询参数
必需。要删除的自定义存储语音的资源名称(例如,`voices/voice_abc123def456`)。
响应
如果成功,则响应为空。
示例
资源
语音
一种语音资源,表示自定义语音(通过 `CreateVoice` 创建)或预构建的系统语音(由 `ListVoices` 返回)。
字段
可选。地区口音描述符(例如“美式”“英式”)。
可选。最佳使用情境或网域(例如“对话”“有声读物”“新闻”)。
可选。对声音音色、个性和语气的描述性总结。
可选。用户为存储的语音提供的显示名称(<code>store = true</code>),或预建语音的目录名称。
仅限输出。自定义存储语音(`store = true`)或复制语音密钥(`store = false`)的过期时间戳。针对不会过期的预构建目录语音(“预构建”)取消设置。
可选。感知到的声音性别呈现(例如“女性”“男性”“中性”)。
仅限输出。语音的唯一标识符。 * 对于 Google 管理的自定义声音(`store = true`),这是一个带有前缀 `voice_` 的生成 ID(例如,`voice_abc123def456`)。在 `GetVoice` 和 `DeleteVoice` 中,将 `voices/{id}` 作为 `name` 传递;在语音合成期间,将 `{id}` 直接传递给 `SpeechConfig.voice_config.voice`(或 `SpeechConfig.voice`)。 * 对于预构建的目录语音(由 `ListVoices` 返回的 `"prebuilt"`),这是说话人名称(例如 `Puck` 或 `Charon`)。 * 如果在调用 `CreateVoice` 时将 `store` 设置为 `false`,则未设置。
仅限输出。客户端管理的语音复刻密钥(带有前缀“voicekey_”)。仅当“type”为“replicated”且“store”为“false”时,由“CreateVoice”返回。在语音合成期间,将此密钥传递给“SpeechConfig.voice_config.voice”(或“SpeechConfig.voice”)。
可选。主要 BCP-47 语言标记(例如“en-US”“fr-FR”)。
可选。用于设计或复制语音的模型。 如果 `CreateVoice` 中省略了此参数,则默认为最新支持的语音设计模型。在 `CreateVoice`、`GetVoice` 和 `ListVoices` 响应中针对自定义语音(“prompted”和“replicated”)返回;对于“prebuilt”语音,则未设置。创建的语音可以跨任何受支持的 TTS 合成模型进行合成。
可选。预期的人设或角色原型(例如“热情友好”“旁白”)。
音调 音调 (选填)
可选。语音音调分类。
可能的值
-
low调低音调。
-
medium中等音调的声音。
-
high调高音调。
提示 PromptedVoice (可选)
提示语音生成的参数。 当 `type` 为 `"prompted"` 时,在 `CreateVoice` 中是必需的。在 `CreateVoice`、`GetVoice` 和 `ListVoices` 响应中针对提示的语音返回。
字段
必需。描述所需声音的自然语言提示,例如“一个中年邪恶巨魔的低沉洪亮的男声”。
可选。ISO 3166-1 alpha-2 或联合国 M.49 地理区域代码(例如“US”“GB”“001”)。
sample_audio AudioData (可选)
仅限输出。为提示的语音生成的音频样本(合成器提示音频)。 仅在 `CreateVoice` 和 `GetVoice` 响应中填充(当 `type` 为“prompted”时);在 `ListVoices` 响应中以及对于“replicated”或“prebuilt”语音,此字段处于未设置状态。
字段
必需。原始音频字节。
必需。音频数据的 IANA MIME 类型(例如 `audio/wav` 或 `audio/mpeg`)。
type VoiceType (可选)
必需。语音类型。在 `CreateVoice` 中,必须为 `"replicated"` 或 `"prompted"`。在 `ListVoices` 响应中,也可以为 `"prebuilt"`。
可能的值
-
replicated根据参考音频样本和发言者同意书录制内容复制的自定义语音。
-
prompted根据自然语言文本提示生成的自定义语音。
-
prebuiltGoogle 语音目录中的内置系统语音(例如 `Puck`、`Charon`)。在响应中返回;无法在 `CreateVoice` 中指定为类型。
用法 用法 (可选)
仅限输出。语音创建请求的令牌使用情况统计信息。 仅在 `CreateVoice` 的响应中填充(当 `type` 为 `"prompted"` 时);对于 `"replicated"` 以及 `GetVoice` 和 `ListVoices` 响应,则未设置。
字段
cached_tokens_by_modality array (ModalityTokens) (可选)
按模态划分的缓存 token 使用情况细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
grounding_tool_count 数组 (GroundingToolCount) (可选)
接地工具数量。
字段
接地工具数量。
与数量关联的接地工具类型。
可能的值:
-
google_search依托 Google 网页搜索和图片搜索进行接地,以及适用于企业的 Web 接地。
-
google_mapsGrounding with Google Maps
input_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的输入 token 使用情况细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
output_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的输出 token 用量细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
tool_use_tokens_by_modality array (ModalityTokens) (optional)
按模态划分的工具使用情况令牌用量细分。
字段
modality ResponseModality (可选)
与 token 数量关联的模态。
可能的值
-
text表示模型应返回文本。
-
image表示模型应返回图片。
-
audio表示模型应返回音频。
-
video表示模型应返回视频。
-
document表示模型应返回文档。
模态的 token 数量。
提示的缓存部分(缓存内容)中的 token 数量。
提示(上下文)中的 token 数量。
所有生成的回答中的 token 总数。
思考模型的想法的 token 数量。
互动请求(提示 + 回答 + 其他内部 token)的总 token 数量。
工具使用提示中的 token 数量。