API Voices позволяет создавать пользовательские голоса на основе подсказок на естественном языке (Voice Design) или на основе эталонных аудиозаписей и записей согласия говорящего (Voice Replication), а также получать список, извлекать и управлять пользовательскими и готовыми голосами для синтеза речи (TTS).
CreateVoice
Создает пользовательский голос на основе подсказки на естественном языке («VOICE_TYPE_PROMPTED») или на основе эталонных и подтвержденных аудиозаписей («VOICE_TYPE_REPLICATED»).
Текст запроса
Тело запроса содержит данные следующей структуры:
Необязательный параметр. Определяет, сохраняется ли созданный голос и управляется ли он Google. * Если `true`, Google сохраняет голос и возвращает `Voice.id` (например, `voice_abc123def456`), которым можно управлять с помощью `GetVoice`, `ListVoices` и `DeleteVoice`, а также ссылаться на него по ID в запросах синтеза. Для проектов действует максимальная квота на количество активных сохраненных голосов; превышение квоты возвращает `RESOURCE_EXHAUSTED`. * Если `false` (по умолчанию), голос не сохраняется Google, и для хранения и синтеза на стороне клиента возвращается `Voice.key` (например, `voicekey_...`). Необязательные поля метаданных обнаружения для `voice` не сохраняются и не возвращаются, если `store` равно `false`. * Обязательно должно быть `true`, если `voice.type` запрашивается (в противном случае возникает ошибка `INVALID_ARGUMENT`).
Обязательно. Голос для создания. `voice.model` — необязательный параметр; если он опущен, сервис выбирает модель создания голоса по умолчанию. Поля, предназначенные только для вывода в `Voice` (`id`, `key`, `expire_time`, `usage`), игнорируются, если они заданы.
Ответ
В случае успеха тело ответа содержит данные следующей структуры:
Необязательно. Описание регионального акцента (например, «американский», «британский»).
Необязательно. Оптимальный контекст или область применения (например, «Разговорный», «Аудиокнига», «Новости»).
Необязательно. Краткое описание тембра голоса, характера и тембра.
Необязательно. Пользовательское отображаемое имя для сохраненного голоса (`store = true`) или имя из каталога для предварительно созданного голоса.
Только для вывода. Временная метка, по истечении срока действия пользовательского сохраненного голоса (`store = true`) или реплицированного ключа голоса (`store = false`). Не задано для предварительно созданных голосов каталога («prebuilt»), срок действия которых не истекает.
Необязательно. Воспринимаемое гендерное обозначение голоса (например, «женский», «мужской», «нейтральный»).
Только вывод. Уникальный идентификатор голоса. * Для пользовательских голосов, управляемых Google (`store = true`), это сгенерированный идентификатор с префиксом `voice_` (например, `voice_abc123def456`). Передайте `voices/{id}` в качестве `name` в `GetVoice` и `DeleteVoice`, а `{id}` передайте напрямую в `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи. * Для предварительно созданных голосов каталога (`"prebuilt"`, возвращаемых `ListVoices`), это имя говорящего (например, `Puck` или `Charon`). * Не устанавливается, если `CreateVoice` вызывается с `store = false`.
Только для вывода. Ключ репликации голоса, управляемый клиентом (с префиксом `voicekey_`). Возвращается только функцией `CreateVoice`, когда `type` равно `"replicated"` и `store` равно `false`. Передайте этот ключ функции `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи.
Необязательно. Основной языковой тег BCP-47 (например, "en-US", "fr-FR").
Необязательный параметр. Модель, используемая для создания или воспроизведения голоса. Если параметр опущен в `CreateVoice`, по умолчанию используется последняя поддерживаемая модель создания голоса. Возвращается в ответах `CreateVoice`, `GetVoice` и `ListVoices` для пользовательских голосов («prompted» и «replicated»); не задано для голосов «prebuilt». Созданные голоса могут быть синтезированы с использованием любой поддерживаемой модели синтеза речи.
Необязательно. Предполагаемый образ или архетип персонажа (например, «Теплый, дружелюбный», «Рассказчик»).
Высота тона ( необязательно)
Необязательно. Классификация высоты голоса.
Возможные значения
-
lowПониженный тембр голоса.
-
mediumГолос среднего тембра.
-
highБолее высокий тембр голоса.
promptedVoice (необязательно )
Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.
Поля
Обязательно. Текст на естественном языке, описывающий желаемый голос, например: «Глубокий, громогласный мужской голос огромного злого огра средних лет».
Необязательно. Код географического региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "GB", "001").
sample_audio AudioData (необязательно)
Только вывод. Образец аудио (аудиозапись подсказки синтезатора), сгенерированный для выбранного голоса. Заполняется только в ответах `CreateVoice` и `GetVoice`, когда `type` имеет значение `"prompted"`; не задается в ответах `ListVoices` и для голосов с параметрами `"replicated"` или `"prebuilt"`.
Поля
Обязательно. Исходные аудиобайты.
Обязательно. MIME-тип аудиоданных по стандарту IANA (например, `audio/wav` или `audio/mpeg`).
тип VoiceType (необязательно)
Обязательно. Тип голоса. В функции `CreateVoice` должен быть `"replicated"" или `"prompted"". В ответах функции `ListVoices` может быть также `"prebuilt"".
Возможные значения
-
replicatedГолос, созданный на основе эталонного аудиосэмпла и записи согласия говорящего.
-
promptedГолос, сгенерированный на основе текстовой подсказки на естественном языке.
-
prebuiltВстроенный системный голос из каталога голосов Google (например, `Puck`, `Charon`). Возвращается в ответах; не может быть указан в качестве типа в `CreateVoice`.
Использование (необязательно )
Только вывод. Статистика использования токенов для запроса на создание голоса. Заполняется только в ответе `CreateVoice`, когда `type` задано как `"prompted"`; не задается для `"replicated"` и в ответах `GetVoice` и `ListVoices`.
Поля
массив cached_tokens_by_modality (ModalityTokens) (необязательно)
Анализ использования кэшированных токенов по способам доступа.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
массив grounding_tool_count (GroundingToolCount) (необязательно)
Количество инструментов для заземления.
Поля
Количество заземляющих инструментов подсчитывается.
Тип заземляющего инструмента, связанный с подсчетом.
Возможные значения:
-
google_searchИнтеграция веб-поиска Google и поиска изображений, а также интеграция веб-поиска с корпоративными приложениями.
-
google_mapsОпределить местоположение с помощью Google Maps.
input_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования входных токенов в зависимости от модальности ввода.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
output_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования выходных токенов по видам модальностей.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования токенов инструментов в зависимости от модальности.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
Количество токенов в кэшированной части запроса (кэшированное содержимое).
Количество токенов в подсказке (контексте).
Общее количество токенов во всех сгенерированных ответах.
Количество токенов мыслей для моделей мышления.
Общее количество токенов для запроса на взаимодействие (запрос + ответы + другие внутренние токены).
Количество токенов, присутствующих в подсказках использования инструмента.
Пример
Пример ответа
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
В списке отображаются пользовательские сохраненные голоса, принадлежащие вызывающему абоненту (в порядке убывания возраста), а затем предварительно созданные системные голоса из каталога голосов Google.
Путь / Параметры запроса
Необязательно. Фильтр по описанию акцента (например, «американский», «британский»). Точное совпадение без учета регистра. Если указано несколько значений, выполняется поиск голосов с любым из указанных акцентов (ИЛИ).
Необязательно. Фильтрация по предполагаемому контексту или домену (например, «Новости, Реклама»). Точное совпадение без учета регистра. Если указано несколько значений, выполняется сопоставление голосов с любым из указанных контекстов (ИЛИ).
Необязательно. Фильтрация по гендерной принадлежности (например, "женский", "мужской", "нейтральный"). Точное совпадение без учета регистра. Если указано несколько значений, выполняется сопоставление голосов с любым из указанных полов (ИЛИ).
Необязательно. Фильтрация по коду языка BCP-47 (например, "en-US"). Точное совпадение без учета регистра. Если указано несколько значений, выполняется сопоставление голосов с любым из указанных кодов языка (ИЛИ).
Необязательный параметр. Максимальное количество голосов, возвращаемых на странице. Сервис может вернуть меньше этого значения. Если параметр не указан, возвращается не более 50 голосов. Максимальное значение — 1000; значения выше 1000 преобразуются в 1000.
Необязательный параметр. Токен страницы, полученный из предыдущего вызова `ListVoices`. Укажите его, чтобы получить следующую страницу. При постраничной навигации все параметры запроса фильтра (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` и `search`) должны соответствовать вызову, вернувшему этот токен; в противном случае запрос завершится ошибкой `INVALID_ARGUMENT`. Параметр `page_size` может изменяться между страницами.
Необязательно. Фильтр по голосовому типу (например, «Теплый, дружелюбный»). Точное совпадение без учета регистра. Если указано несколько значений, сопоставляет голоса с любым из указанных типов (ИЛИ).
Необязательный параметр. Фильтрация по высоте вокала. Принимает значения "low", "medium", "high" или "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (регистр нечувствителен). Если указано несколько значений, выполняется сопоставление голосов с любой из указанных высот (ИЛИ).
Необязательно. Фильтрация по коду региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "001"). Точное совпадение без учета регистра. Если указано несколько значений, выполняется поиск голосов с любым из указанных кодов регионов (ИЛИ).
Необязательно. Поиск подстроки в свободном текстовом формате, нечувствительный к регистру, по параметрам `display_name` и `description`. Максимальный размер: 2048 байт.
Необязательный параметр. Фильтр по типу голоса. Принимает значения "prebuilt", "replicated", "prompted" или "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (регистр нечувствителен). Если указано несколько значений, выполняется сопоставление голосов с любым из указанных типов (ИЛИ).
Ответ
В случае успеха тело ответа содержит данные следующей структуры:
Токен, который можно отправить в качестве `page_token` для получения следующей страницы. Если он пуст, то последующих страниц нет.
Голоса из указанной коллекции.
Пример
Пример ответа
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Получает пользовательский сохраненный голос (`store = true`) по имени ресурса. Предварительно созданные голоса каталога (`VOICE_TYPE_PREBUILT`) нельзя получить с помощью `GetVoice`; используйте вместо этого `ListVoices`.
Путь / Параметры запроса
Обязательно. Имя ресурса пользовательского сохраненного голоса, который необходимо получить (например, `voices/voice_abc123def456`).
Ответ
В случае успеха тело ответа содержит данные следующей структуры:
Необязательно. Описание регионального акцента (например, «американский», «британский»).
Необязательно. Оптимальный контекст или область применения (например, «Разговорный», «Аудиокнига», «Новости»).
Необязательно. Краткое описание тембра голоса, характера и тембра.
Необязательно. Пользовательское отображаемое имя для сохраненного голоса (`store = true`) или имя из каталога для предварительно созданного голоса.
Только для вывода. Временная метка, по истечении срока действия пользовательского сохраненного голоса (`store = true`) или реплицированного ключа голоса (`store = false`). Не задано для предварительно созданных голосов каталога («prebuilt»), срок действия которых не истекает.
Необязательно. Воспринимаемое гендерное обозначение голоса (например, «женский», «мужской», «нейтральный»).
Только вывод. Уникальный идентификатор голоса. * Для пользовательских голосов, управляемых Google (`store = true`), это сгенерированный идентификатор с префиксом `voice_` (например, `voice_abc123def456`). Передайте `voices/{id}` в качестве `name` в `GetVoice` и `DeleteVoice`, а `{id}` передайте напрямую в `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи. * Для предварительно созданных голосов каталога (`"prebuilt"`, возвращаемых `ListVoices`), это имя говорящего (например, `Puck` или `Charon`). * Не устанавливается, если `CreateVoice` вызывается с `store = false`.
Только для вывода. Ключ репликации голоса, управляемый клиентом (с префиксом `voicekey_`). Возвращается только функцией `CreateVoice`, когда `type` равно `"replicated"` и `store` равно `false`. Передайте этот ключ функции `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи.
Необязательно. Основной языковой тег BCP-47 (например, "en-US", "fr-FR").
Необязательный параметр. Модель, используемая для создания или воспроизведения голоса. Если параметр опущен в `CreateVoice`, по умолчанию используется последняя поддерживаемая модель создания голоса. Возвращается в ответах `CreateVoice`, `GetVoice` и `ListVoices` для пользовательских голосов («prompted» и «replicated»); не задано для голосов «prebuilt». Созданные голоса могут быть синтезированы с использованием любой поддерживаемой модели синтеза речи.
Необязательно. Предполагаемый образ или архетип персонажа (например, «Теплый, дружелюбный», «Рассказчик»).
Высота тона ( необязательно)
Необязательно. Классификация высоты голоса.
Возможные значения
-
lowПониженный тембр голоса.
-
mediumГолос среднего тембра.
-
highБолее высокий тембр голоса.
promptedVoice (необязательно )
Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.
Поля
Обязательно. Текст на естественном языке, описывающий желаемый голос, например: «Глубокий, громогласный мужской голос огромного злого огра средних лет».
Необязательно. Код географического региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "GB", "001").
sample_audio AudioData (необязательно)
Только вывод. Образец аудио (аудиозапись подсказки синтезатора), сгенерированный для выбранного голоса. Заполняется только в ответах `CreateVoice` и `GetVoice`, когда `type` имеет значение `"prompted"`; не задается в ответах `ListVoices` и для голосов с параметрами `"replicated"` или `"prebuilt"`.
Поля
Обязательно. Исходные аудиобайты.
Обязательно. MIME-тип аудиоданных по стандарту IANA (например, `audio/wav` или `audio/mpeg`).
тип VoiceType (необязательно)
Обязательно. Тип голоса. В функции `CreateVoice` должен быть `"replicated"" или `"prompted"". В ответах функции `ListVoices` может быть также `"prebuilt"".
Возможные значения
-
replicatedГолос, созданный на основе эталонного аудиосэмпла и записи согласия говорящего.
-
promptedГолос, сгенерированный на основе текстовой подсказки на естественном языке.
-
prebuiltВстроенный системный голос из каталога голосов Google (например, `Puck`, `Charon`). Возвращается в ответах; не может быть указан в качестве типа в `CreateVoice`.
Использование (необязательно )
Только вывод. Статистика использования токенов для запроса на создание голоса. Заполняется только в ответе `CreateVoice`, когда `type` задано как `"prompted"`; не задается для `"replicated"` и в ответах `GetVoice` и `ListVoices`.
Поля
массив cached_tokens_by_modality (ModalityTokens) (необязательно)
Анализ использования кэшированных токенов по способам доступа.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
массив grounding_tool_count (GroundingToolCount) (необязательно)
Количество инструментов для заземления.
Поля
Количество заземляющих инструментов подсчитывается.
Тип заземляющего инструмента, связанный с подсчетом.
Возможные значения:
-
google_searchИнтеграция веб-поиска Google и поиска изображений, а также интеграция веб-поиска с корпоративными приложениями.
-
google_mapsОпределить местоположение с помощью Google Maps.
input_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования входных токенов в зависимости от модальности ввода.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
output_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования выходных токенов по видам модальностей.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования токенов инструментов в зависимости от модальности.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
Количество токенов в кэшированной части запроса (кэшированное содержимое).
Количество токенов в подсказке (контексте).
Общее количество токенов во всех сгенерированных ответах.
Количество токенов мыслей для моделей мышления.
Общее количество токенов для запроса на взаимодействие (запрос + ответы + другие внутренние токены).
Количество токенов, присутствующих в подсказках использования инструмента.
Пример
Пример ответа
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Удаляет пользовательский сохраненный голос (`store = true`) по имени ресурса. Предварительно созданные голоса каталога (`VOICE_TYPE_PREBUILT`) удалить нельзя.
Путь / Параметры запроса
Обязательно. Имя ресурса пользовательского сохраненного голоса для удаления (например, `voices/voice_abc123def456`).
Ответ
В случае успеха ответ будет пустым.
Пример
Ресурсы
Голос
Ресурс голоса, представляющий собой либо пользовательский голос (созданный с помощью `CreateVoice`), либо предварительно созданный системный голос (возвращаемый функцией `ListVoices`).
Поля
Необязательно. Описание регионального акцента (например, «американский», «британский»).
Необязательно. Оптимальный контекст или область применения (например, «Разговорный», «Аудиокнига», «Новости»).
Необязательно. Краткое описание тембра голоса, характера и тембра.
Необязательно. Пользовательское отображаемое имя для сохраненного голоса (`store = true`) или имя из каталога для предварительно созданного голоса.
Только для вывода. Временная метка, по истечении срока действия пользовательского сохраненного голоса (`store = true`) или реплицированного ключа голоса (`store = false`). Не задано для предварительно созданных голосов каталога («prebuilt»), срок действия которых не истекает.
Необязательно. Воспринимаемое гендерное обозначение голоса (например, «женский», «мужской», «нейтральный»).
Только вывод. Уникальный идентификатор голоса. * Для пользовательских голосов, управляемых Google (`store = true`), это сгенерированный идентификатор с префиксом `voice_` (например, `voice_abc123def456`). Передайте `voices/{id}` в качестве `name` в `GetVoice` и `DeleteVoice`, а `{id}` передайте напрямую в `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи. * Для предварительно созданных голосов каталога (`"prebuilt"`, возвращаемых `ListVoices`), это имя говорящего (например, `Puck` или `Charon`). * Не устанавливается, если `CreateVoice` вызывается с `store = false`.
Только для вывода. Ключ репликации голоса, управляемый клиентом (с префиксом `voicekey_`). Возвращается только функцией `CreateVoice`, когда `type` равно `"replicated"` и `store` равно `false`. Передайте этот ключ функции `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи.
Необязательно. Основной языковой тег BCP-47 (например, "en-US", "fr-FR").
Необязательный параметр. Модель, используемая для создания или воспроизведения голоса. Если параметр опущен в `CreateVoice`, по умолчанию используется последняя поддерживаемая модель создания голоса. Возвращается в ответах `CreateVoice`, `GetVoice` и `ListVoices` для пользовательских голосов («prompted» и «replicated»); не задано для голосов «prebuilt». Созданные голоса могут быть синтезированы с использованием любой поддерживаемой модели синтеза речи.
Необязательно. Предполагаемый образ или архетип персонажа (например, «Теплый, дружелюбный», «Рассказчик»).
Высота тона ( необязательно)
Необязательно. Классификация высоты голоса.
Возможные значения
-
lowПониженный тембр голоса.
-
mediumГолос среднего тембра.
-
highБолее высокий тембр голоса.
promptedVoice (необязательно )
Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.
Поля
Обязательно. Текст на естественном языке, описывающий желаемый голос, например: «Глубокий, громогласный мужской голос огромного злого огра средних лет».
Необязательно. Код географического региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "GB", "001").
sample_audio AudioData (необязательно)
Только вывод. Образец аудио (аудиозапись подсказки синтезатора), сгенерированный для выбранного голоса. Заполняется только в ответах `CreateVoice` и `GetVoice`, когда `type` имеет значение `"prompted"`; не задается в ответах `ListVoices` и для голосов с параметрами `"replicated"` или `"prebuilt"`.
Поля
Обязательно. Исходные аудиобайты.
Обязательно. MIME-тип аудиоданных по стандарту IANA (например, `audio/wav` или `audio/mpeg`).
тип VoiceType (необязательно)
Обязательно. Тип голоса. В функции `CreateVoice` должен быть `"replicated"" или `"prompted"". В ответах функции `ListVoices` может быть также `"prebuilt"".
Возможные значения
-
replicatedГолос, созданный на основе эталонного аудиосэмпла и записи согласия говорящего.
-
promptedГолос, сгенерированный на основе текстовой подсказки на естественном языке.
-
prebuiltВстроенный системный голос из каталога голосов Google (например, `Puck`, `Charon`). Возвращается в ответах; не может быть указан в качестве типа в `CreateVoice`.
Использование (необязательно )
Только вывод. Статистика использования токенов для запроса на создание голоса. Заполняется только в ответе `CreateVoice`, когда `type` задано как `"prompted"`; не задается для `"replicated"` и в ответах `GetVoice` и `ListVoices`.
Поля
массив cached_tokens_by_modality (ModalityTokens) (необязательно)
Анализ использования кэшированных токенов по способам доступа.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
массив grounding_tool_count (GroundingToolCount) (необязательно)
Количество инструментов для заземления.
Поля
Количество заземляющих инструментов подсчитывается.
Тип заземляющего инструмента, связанный с подсчетом.
Возможные значения:
-
google_searchИнтеграция веб-поиска Google и поиска изображений, а также интеграция веб-поиска с корпоративными приложениями.
-
google_mapsОпределить местоположение с помощью Google Maps.
input_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования входных токенов в зависимости от модальности ввода.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
output_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования выходных токенов по видам модальностей.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
Анализ использования токенов инструментов в зависимости от модальности.
Поля
модальность ResponseModality (необязательно)
Способ отображения количества токенов.
Возможные значения
-
textУказывает, что модель должна возвращать текст.
-
imageУказывает, что модель должна возвращать изображения.
-
audioУказывает, что модель должна возвращать аудиоданные.
-
videoУказывает, что модель должна возвращать видео.
-
documentУказывает, что модель должна возвращать документы.
Количество токенов для данного режима.
Количество токенов в кэшированной части запроса (кэшированное содержимое).
Количество токенов в подсказке (контексте).
Общее количество токенов во всех сгенерированных ответах.
Количество токенов мыслей для моделей мышления.
Общее количество токенов для запроса на взаимодействие (запрос + ответы + другие внутренние токены).
Количество токенов, присутствующих в подсказках использования инструмента.