Gemini Voices API

API Voices позволяет создавать пользовательские голоса на основе подсказок на естественном языке (Voice Design) или на основе эталонных аудиозаписей и записей согласия говорящего (Voice Replication), а также получать список, извлекать и управлять пользовательскими и готовыми голосами для синтеза речи (TTS).

CreateVoice

ссылка: https://generativelanguage.googleapis.com/v1beta/voices

Создает пользовательский голос на основе подсказки на естественном языке («VOICE_TYPE_PROMPTED») или на основе эталонных и подтвержденных аудиозаписей («VOICE_TYPE_REPLICATED»).

Текст запроса

Тело запроса содержит данные следующей структуры:

хранить логическое значение (необязательно)

Необязательный параметр. Определяет, сохраняется ли созданный голос и управляется ли он Google. * Если `true`, Google сохраняет голос и возвращает `Voice.id` (например, `voice_abc123def456`), которым можно управлять с помощью `GetVoice`, `ListVoices` и `DeleteVoice`, а также ссылаться на него по ID в запросах синтеза. Для проектов действует максимальная квота на количество активных сохраненных голосов; превышение квоты возвращает `RESOURCE_EXHAUSTED`. * Если `false` (по умолчанию), голос не сохраняется Google, и для хранения и синтеза на стороне клиента возвращается `Voice.key` (например, `voicekey_...`). Необязательные поля метаданных обнаружения для `voice` не сохраняются и не возвращаются, если `store` равно `false`. * Обязательно должно быть `true`, если `voice.type` запрашивается (в противном случае возникает ошибка `INVALID_ARGUMENT`).

Голос (обязательно )

Обязательно. Голос для создания. `voice.model` — необязательный параметр; если он опущен, сервис выбирает модель создания голоса по умолчанию. Поля, предназначенные только для вывода в `Voice` (`id`, `key`, `expire_time`, `usage`), игнорируются, если они заданы.

Ответ

В случае успеха тело ответа содержит данные следующей структуры:

акцентная строка (необязательно)

Необязательно. Описание регионального акцента (например, «американский», «британский»).

строка контекста (необязательно)

Необязательно. Оптимальный контекст или область применения (например, «Разговорный», «Аудиокнига», «Новости»).

строка описания (необязательно)

Необязательно. Краткое описание тембра голоса, характера и тембра.

display_name строка (необязательно)

Необязательно. Пользовательское отображаемое имя для сохраненного голоса (`store = true`) или имя из каталога для предварительно созданного голоса.

expire_time строка (необязательно)

Только для вывода. Временная метка, по истечении срока действия пользовательского сохраненного голоса (`store = true`) или реплицированного ключа голоса (`store = false`). Не задано для предварительно созданных голосов каталога («prebuilt»), срок действия которых не истекает.

строка пола (необязательно)

Необязательно. Воспринимаемое гендерное обозначение голоса (например, «женский», «мужской», «нейтральный»).

строка идентификатора (необязательно)

Только вывод. Уникальный идентификатор голоса. * Для пользовательских голосов, управляемых Google (`store = true`), это сгенерированный идентификатор с префиксом `voice_` (например, `voice_abc123def456`). Передайте `voices/{id}` в качестве `name` в `GetVoice` и `DeleteVoice`, а `{id}` передайте напрямую в `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи. * Для предварительно созданных голосов каталога (`"prebuilt"`, возвращаемых `ListVoices`), это имя говорящего (например, `Puck` или `Charon`). * Не устанавливается, если `CreateVoice` вызывается с `store = false`.

ключевая строка (необязательно)

Только для вывода. Ключ репликации голоса, управляемый клиентом (с префиксом `voicekey_`). Возвращается только функцией `CreateVoice`, когда `type` равно `"replicated"` и `store` равно `false`. Передайте этот ключ функции `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи.

строка language_code (необязательно)

Необязательно. Основной языковой тег BCP-47 (например, "en-US", "fr-FR").

строка модели (необязательно)

Необязательный параметр. Модель, используемая для создания или воспроизведения голоса. Если параметр опущен в `CreateVoice`, по умолчанию используется последняя поддерживаемая модель создания голоса. Возвращается в ответах `CreateVoice`, `GetVoice` и `ListVoices` для пользовательских голосов («prompted» и «replicated»); не задано для голосов «prebuilt». Созданные голоса могут быть синтезированы с использованием любой поддерживаемой модели синтеза речи.

Строка имени пользователя (необязательно)

Необязательно. Предполагаемый образ или архетип персонажа (например, «Теплый, дружелюбный», «Рассказчик»).

Высота тона ( необязательно)

Необязательно. Классификация высоты голоса.

Возможные значения

  • low

    Пониженный тембр голоса.

  • medium

    Голос среднего тембра.

  • high

    Более высокий тембр голоса.

promptedVoice (необязательно )

Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.

Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.

Поля

входная строка (необязательно)

Обязательно. Текст на естественном языке, описывающий желаемый голос, например: «Глубокий, громогласный мужской голос огромного злого огра средних лет».

строка region_code (необязательно)

Необязательно. Код географического региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "GB", "001").

sample_audio AudioData (необязательно)

Только вывод. Образец аудио (аудиозапись подсказки синтезатора), сгенерированный для выбранного голоса. Заполняется только в ответах `CreateVoice` и `GetVoice`, когда `type` имеет значение `"prompted"`; не задается в ответах `ListVoices` и для голосов с параметрами `"replicated"` или `"prebuilt"`.

Аудиоданные используются для создания голоса.

Поля

строка данных (необязательно)

Обязательно. Исходные аудиобайты.

строка mime_type (необязательно)

Обязательно. MIME-тип аудиоданных по стандарту IANA (например, `audio/wav` или `audio/mpeg`).

тип VoiceType (необязательно)

Обязательно. Тип голоса. В функции `CreateVoice` должен быть `"replicated"" или `"prompted"". В ответах функции `ListVoices` может быть также `"prebuilt"".

Возможные значения

  • replicated

    Голос, созданный на основе эталонного аудиосэмпла и записи согласия говорящего.

  • prompted

    Голос, сгенерированный на основе текстовой подсказки на естественном языке.

  • prebuilt

    Встроенный системный голос из каталога голосов Google (например, `Puck`, `Charon`). Возвращается в ответах; не может быть указан в качестве типа в `CreateVoice`.

Использование (необязательно )

Только вывод. Статистика использования токенов для запроса на создание голоса. Заполняется только в ответе `CreateVoice`, когда `type` задано как `"prompted"`; не задается для `"replicated"` и в ответах `GetVoice` и `ListVoices`.

Статистика использования токенов в запросах на взаимодействие.

Поля

массив cached_tokens_by_modality (ModalityTokens) (необязательно)

Анализ использования кэшированных токенов по способам доступа.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

массив grounding_tool_count (GroundingToolCount) (необязательно)

Количество инструментов для заземления.

Количество заземляющих инструментов подсчитывается.

Поля

count целое число (необязательно)

Количество заземляющих инструментов подсчитывается.

тип перечисления (строка) (необязательно)

Тип заземляющего инструмента, связанный с подсчетом.

Возможные значения:

  • google_search

    Интеграция веб-поиска Google и поиска изображений, а также интеграция веб-поиска с корпоративными приложениями.

  • google_maps

    Определить местоположение с помощью Google Maps.

input_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования входных токенов в зависимости от модальности ввода.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

output_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования выходных токенов по видам модальностей.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

tool_use_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования токенов инструментов в зависимости от модальности.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

total_cached_tokens — целое число (необязательно)

Количество токенов в кэшированной части запроса (кэшированное содержимое).

total_input_tokens целое число (необязательно)

Количество токенов в подсказке (контексте).

total_output_tokens целое число (необязательно)

Общее количество токенов во всех сгенерированных ответах.

total_thought_tokens целое число (необязательно)

Количество токенов мыслей для моделей мышления.

total_tokens целое число (необязательно)

Общее количество токенов для запроса на взаимодействие (запрос + ответы + другие внутренние токены).

total_tool_use_tokens целое число (необязательно)

Количество токенов, присутствующих в подсказках использования инструмента.

Пример

Пример ответа

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

получить https://generativelanguage.googleapis.com/v1beta/voices

В списке отображаются пользовательские сохраненные голоса, принадлежащие вызывающему абоненту (в порядке убывания возраста), а затем предварительно созданные системные голоса из каталога голосов Google.

Путь / Параметры запроса

массив акцентов (строка) (необязательно)

Необязательно. Фильтр по описанию акцента (например, «американский», «британский»). Точное совпадение без учета регистра. Если указано несколько значений, выполняется поиск голосов с любым из указанных акцентов (ИЛИ).

контекстный массив (строка) (необязательно)

Необязательно. Фильтрация по предполагаемому контексту или домену (например, «Новости, Реклама»). Точное совпадение без учета регистра. Если указано несколько значений, выполняется сопоставление голосов с любым из указанных контекстов (ИЛИ).

массив пола (строка) (необязательно)

Необязательно. Фильтрация по гендерной принадлежности (например, "женский", "мужской", "нейтральный"). Точное совпадение без учета регистра. Если указано несколько значений, выполняется сопоставление голосов с любым из указанных полов (ИЛИ).

массив language_code (строка) (необязательно)

Необязательно. Фильтрация по коду языка BCP-47 (например, "en-US"). Точное совпадение без учета регистра. Если указано несколько значений, выполняется сопоставление голосов с любым из указанных кодов языка (ИЛИ).

page_size — целое число (необязательно)

Необязательный параметр. Максимальное количество голосов, возвращаемых на странице. Сервис может вернуть меньше этого значения. Если параметр не указан, возвращается не более 50 голосов. Максимальное значение — 1000; значения выше 1000 преобразуются в 1000.

строка page_token (необязательно)

Необязательный параметр. Токен страницы, полученный из предыдущего вызова `ListVoices`. Укажите его, чтобы получить следующую страницу. При постраничной навигации все параметры запроса фильтра (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` и `search`) должны соответствовать вызову, вернувшему этот токен; в противном случае запрос завершится ошибкой `INVALID_ARGUMENT`. Параметр `page_size` может изменяться между страницами.

Массив персон (строка) (необязательно)

Необязательно. Фильтр по голосовому типу (например, «Теплый, дружелюбный»). Точное совпадение без учета регистра. Если указано несколько значений, сопоставляет голоса с любым из указанных типов (ИЛИ).

Массив высоты тона (строка) (необязательно)

Необязательный параметр. Фильтрация по высоте вокала. Принимает значения "low", "medium", "high" или "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (регистр нечувствителен). Если указано несколько значений, выполняется сопоставление голосов с любой из указанных высот (ИЛИ).

массив region_code (строка) (необязательно)

Необязательно. Фильтрация по коду региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "001"). Точное совпадение без учета регистра. Если указано несколько значений, выполняется поиск голосов с любым из указанных кодов регионов (ИЛИ).

поисковая строка (необязательно)

Необязательно. Поиск подстроки в свободном текстовом формате, нечувствительный к регистру, по параметрам `display_name` и `description`. Максимальный размер: 2048 байт.

тип массив (строка) (необязательно)

Необязательный параметр. Фильтр по типу голоса. Принимает значения "prebuilt", "replicated", "prompted" или "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (регистр нечувствителен). Если указано несколько значений, выполняется сопоставление голосов с любым из указанных типов (ИЛИ).

Ответ

В случае успеха тело ответа содержит данные следующей структуры:

строка next_page_token (необязательно)

Токен, который можно отправить в качестве `page_token` для получения следующей страницы. Если он пуст, то последующих страниц нет.

массив голосов ( Голос ) (необязательно)

Голоса из указанной коллекции.

Пример

Пример ответа

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

получить https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Получает пользовательский сохраненный голос (`store = true`) по имени ресурса. Предварительно созданные голоса каталога (`VOICE_TYPE_PREBUILT`) нельзя получить с помощью `GetVoice`; используйте вместо этого `ListVoices`.

Путь / Параметры запроса

voicesId строка (обязательно)

Обязательно. Имя ресурса пользовательского сохраненного голоса, который необходимо получить (например, `voices/voice_abc123def456`).

Ответ

В случае успеха тело ответа содержит данные следующей структуры:

акцентная строка (необязательно)

Необязательно. Описание регионального акцента (например, «американский», «британский»).

строка контекста (необязательно)

Необязательно. Оптимальный контекст или область применения (например, «Разговорный», «Аудиокнига», «Новости»).

строка описания (необязательно)

Необязательно. Краткое описание тембра голоса, характера и тембра.

display_name строка (необязательно)

Необязательно. Пользовательское отображаемое имя для сохраненного голоса (`store = true`) или имя из каталога для предварительно созданного голоса.

expire_time строка (необязательно)

Только для вывода. Временная метка, по истечении срока действия пользовательского сохраненного голоса (`store = true`) или реплицированного ключа голоса (`store = false`). Не задано для предварительно созданных голосов каталога («prebuilt»), срок действия которых не истекает.

строка пола (необязательно)

Необязательно. Воспринимаемое гендерное обозначение голоса (например, «женский», «мужской», «нейтральный»).

строка идентификатора (необязательно)

Только вывод. Уникальный идентификатор голоса. * Для пользовательских голосов, управляемых Google (`store = true`), это сгенерированный идентификатор с префиксом `voice_` (например, `voice_abc123def456`). Передайте `voices/{id}` в качестве `name` в `GetVoice` и `DeleteVoice`, а `{id}` передайте напрямую в `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи. * Для предварительно созданных голосов каталога (`"prebuilt"`, возвращаемых `ListVoices`), это имя говорящего (например, `Puck` или `Charon`). * Не устанавливается, если `CreateVoice` вызывается с `store = false`.

ключевая строка (необязательно)

Только для вывода. Ключ репликации голоса, управляемый клиентом (с префиксом `voicekey_`). Возвращается только функцией `CreateVoice`, когда `type` равно `"replicated"` и `store` равно `false`. Передайте этот ключ функции `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи.

строка language_code (необязательно)

Необязательно. Основной языковой тег BCP-47 (например, "en-US", "fr-FR").

строка модели (необязательно)

Необязательный параметр. Модель, используемая для создания или воспроизведения голоса. Если параметр опущен в `CreateVoice`, по умолчанию используется последняя поддерживаемая модель создания голоса. Возвращается в ответах `CreateVoice`, `GetVoice` и `ListVoices` для пользовательских голосов («prompted» и «replicated»); не задано для голосов «prebuilt». Созданные голоса могут быть синтезированы с использованием любой поддерживаемой модели синтеза речи.

Строка имени пользователя (необязательно)

Необязательно. Предполагаемый образ или архетип персонажа (например, «Теплый, дружелюбный», «Рассказчик»).

Высота тона ( необязательно)

Необязательно. Классификация высоты голоса.

Возможные значения

  • low

    Пониженный тембр голоса.

  • medium

    Голос среднего тембра.

  • high

    Более высокий тембр голоса.

promptedVoice (необязательно )

Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.

Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.

Поля

входная строка (необязательно)

Обязательно. Текст на естественном языке, описывающий желаемый голос, например: «Глубокий, громогласный мужской голос огромного злого огра средних лет».

строка region_code (необязательно)

Необязательно. Код географического региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "GB", "001").

sample_audio AudioData (необязательно)

Только вывод. Образец аудио (аудиозапись подсказки синтезатора), сгенерированный для выбранного голоса. Заполняется только в ответах `CreateVoice` и `GetVoice`, когда `type` имеет значение `"prompted"`; не задается в ответах `ListVoices` и для голосов с параметрами `"replicated"` или `"prebuilt"`.

Аудиоданные используются для создания голоса.

Поля

строка данных (необязательно)

Обязательно. Исходные аудиобайты.

строка mime_type (необязательно)

Обязательно. MIME-тип аудиоданных по стандарту IANA (например, `audio/wav` или `audio/mpeg`).

тип VoiceType (необязательно)

Обязательно. Тип голоса. В функции `CreateVoice` должен быть `"replicated"" или `"prompted"". В ответах функции `ListVoices` может быть также `"prebuilt"".

Возможные значения

  • replicated

    Голос, созданный на основе эталонного аудиосэмпла и записи согласия говорящего.

  • prompted

    Голос, сгенерированный на основе текстовой подсказки на естественном языке.

  • prebuilt

    Встроенный системный голос из каталога голосов Google (например, `Puck`, `Charon`). Возвращается в ответах; не может быть указан в качестве типа в `CreateVoice`.

Использование (необязательно )

Только вывод. Статистика использования токенов для запроса на создание голоса. Заполняется только в ответе `CreateVoice`, когда `type` задано как `"prompted"`; не задается для `"replicated"` и в ответах `GetVoice` и `ListVoices`.

Статистика использования токенов в запросах на взаимодействие.

Поля

массив cached_tokens_by_modality (ModalityTokens) (необязательно)

Анализ использования кэшированных токенов по способам доступа.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

массив grounding_tool_count (GroundingToolCount) (необязательно)

Количество инструментов для заземления.

Количество заземляющих инструментов подсчитывается.

Поля

count целое число (необязательно)

Количество заземляющих инструментов подсчитывается.

тип перечисления (строка) (необязательно)

Тип заземляющего инструмента, связанный с подсчетом.

Возможные значения:

  • google_search

    Интеграция веб-поиска Google и поиска изображений, а также интеграция веб-поиска с корпоративными приложениями.

  • google_maps

    Определить местоположение с помощью Google Maps.

input_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования входных токенов в зависимости от модальности ввода.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

output_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования выходных токенов по видам модальностей.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

tool_use_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования токенов инструментов в зависимости от модальности.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

total_cached_tokens — целое число (необязательно)

Количество токенов в кэшированной части запроса (кэшированное содержимое).

total_input_tokens целое число (необязательно)

Количество токенов в подсказке (контексте).

total_output_tokens целое число (необязательно)

Общее количество токенов во всех сгенерированных ответах.

total_thought_tokens целое число (необязательно)

Количество токенов мыслей для моделей мышления.

total_tokens целое число (необязательно)

Общее количество токенов для запроса на взаимодействие (запрос + ответы + другие внутренние токены).

total_tool_use_tokens целое число (необязательно)

Количество токенов, присутствующих в подсказках использования инструмента.

Пример

Пример ответа

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

удалить https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Удаляет пользовательский сохраненный голос (`store = true`) по имени ресурса. Предварительно созданные голоса каталога (`VOICE_TYPE_PREBUILT`) удалить нельзя.

Путь / Параметры запроса

voicesId строка (обязательно)

Обязательно. Имя ресурса пользовательского сохраненного голоса для удаления (например, `voices/voice_abc123def456`).

Ответ

В случае успеха ответ будет пустым.

Пример

Ресурсы

Голос

Ресурс голоса, представляющий собой либо пользовательский голос (созданный с помощью `CreateVoice`), либо предварительно созданный системный голос (возвращаемый функцией `ListVoices`).

Поля

акцентная строка (необязательно)

Необязательно. Описание регионального акцента (например, «американский», «британский»).

строка контекста (необязательно)

Необязательно. Оптимальный контекст или область применения (например, «Разговорный», «Аудиокнига», «Новости»).

строка описания (необязательно)

Необязательно. Краткое описание тембра голоса, характера и тембра.

display_name строка (необязательно)

Необязательно. Пользовательское отображаемое имя для сохраненного голоса (`store = true`) или имя из каталога для предварительно созданного голоса.

expire_time строка (необязательно)

Только для вывода. Временная метка, по истечении срока действия пользовательского сохраненного голоса (`store = true`) или реплицированного ключа голоса (`store = false`). Не задано для предварительно созданных голосов каталога («prebuilt»), срок действия которых не истекает.

строка пола (необязательно)

Необязательно. Воспринимаемое гендерное обозначение голоса (например, «женский», «мужской», «нейтральный»).

строка идентификатора (необязательно)

Только вывод. Уникальный идентификатор голоса. * Для пользовательских голосов, управляемых Google (`store = true`), это сгенерированный идентификатор с префиксом `voice_` (например, `voice_abc123def456`). Передайте `voices/{id}` в качестве `name` в `GetVoice` и `DeleteVoice`, а `{id}` передайте напрямую в `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи. * Для предварительно созданных голосов каталога (`"prebuilt"`, возвращаемых `ListVoices`), это имя говорящего (например, `Puck` или `Charon`). * Не устанавливается, если `CreateVoice` вызывается с `store = false`.

ключевая строка (необязательно)

Только для вывода. Ключ репликации голоса, управляемый клиентом (с префиксом `voicekey_`). Возвращается только функцией `CreateVoice`, когда `type` равно `"replicated"` и `store` равно `false`. Передайте этот ключ функции `SpeechConfig.voice_config.voice` (или `SpeechConfig.voice`) во время синтеза речи.

строка language_code (необязательно)

Необязательно. Основной языковой тег BCP-47 (например, "en-US", "fr-FR").

строка модели (необязательно)

Необязательный параметр. Модель, используемая для создания или воспроизведения голоса. Если параметр опущен в `CreateVoice`, по умолчанию используется последняя поддерживаемая модель создания голоса. Возвращается в ответах `CreateVoice`, `GetVoice` и `ListVoices` для пользовательских голосов («prompted» и «replicated»); не задано для голосов «prebuilt». Созданные голоса могут быть синтезированы с использованием любой поддерживаемой модели синтеза речи.

Строка имени пользователя (необязательно)

Необязательно. Предполагаемый образ или архетип персонажа (например, «Теплый, дружелюбный», «Рассказчик»).

Высота тона ( необязательно)

Необязательно. Классификация высоты голоса.

Возможные значения

  • low

    Пониженный тембр голоса.

  • medium

    Голос среднего тембра.

  • high

    Более высокий тембр голоса.

promptedVoice (необязательно )

Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.

Параметры для генерации голосовых подсказок. Обязательны в функции `CreateVoice`, когда `type` имеет значение `"prompted"`. Возвращаются в ответах функций `CreateVoice`, `GetVoice` и `ListVoices` для голосовых подсказок.

Поля

входная строка (необязательно)

Обязательно. Текст на естественном языке, описывающий желаемый голос, например: «Глубокий, громогласный мужской голос огромного злого огра средних лет».

строка region_code (необязательно)

Необязательно. Код географического региона ISO 3166-1 alpha-2 или UN M.49 (например, "US", "GB", "001").

sample_audio AudioData (необязательно)

Только вывод. Образец аудио (аудиозапись подсказки синтезатора), сгенерированный для выбранного голоса. Заполняется только в ответах `CreateVoice` и `GetVoice`, когда `type` имеет значение `"prompted"`; не задается в ответах `ListVoices` и для голосов с параметрами `"replicated"` или `"prebuilt"`.

Аудиоданные используются для создания голоса.

Поля

строка данных (необязательно)

Обязательно. Исходные аудиобайты.

строка mime_type (необязательно)

Обязательно. MIME-тип аудиоданных по стандарту IANA (например, `audio/wav` или `audio/mpeg`).

тип VoiceType (необязательно)

Обязательно. Тип голоса. В функции `CreateVoice` должен быть `"replicated"" или `"prompted"". В ответах функции `ListVoices` может быть также `"prebuilt"".

Возможные значения

  • replicated

    Голос, созданный на основе эталонного аудиосэмпла и записи согласия говорящего.

  • prompted

    Голос, сгенерированный на основе текстовой подсказки на естественном языке.

  • prebuilt

    Встроенный системный голос из каталога голосов Google (например, `Puck`, `Charon`). Возвращается в ответах; не может быть указан в качестве типа в `CreateVoice`.

Использование (необязательно )

Только вывод. Статистика использования токенов для запроса на создание голоса. Заполняется только в ответе `CreateVoice`, когда `type` задано как `"prompted"`; не задается для `"replicated"` и в ответах `GetVoice` и `ListVoices`.

Статистика использования токенов в запросах на взаимодействие.

Поля

массив cached_tokens_by_modality (ModalityTokens) (необязательно)

Анализ использования кэшированных токенов по способам доступа.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

массив grounding_tool_count (GroundingToolCount) (необязательно)

Количество инструментов для заземления.

Количество заземляющих инструментов подсчитывается.

Поля

count целое число (необязательно)

Количество заземляющих инструментов подсчитывается.

тип перечисления (строка) (необязательно)

Тип заземляющего инструмента, связанный с подсчетом.

Возможные значения:

  • google_search

    Интеграция веб-поиска Google и поиска изображений, а также интеграция веб-поиска с корпоративными приложениями.

  • google_maps

    Определить местоположение с помощью Google Maps.

input_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования входных токенов в зависимости от модальности ввода.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

output_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования выходных токенов по видам модальностей.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

tool_use_tokens_by_modality array (ModalityTokens) (optional)

Анализ использования токенов инструментов в зависимости от модальности.

Количество токенов для одного варианта ответа.

Поля

модальность ResponseModality (необязательно)

Способ отображения количества токенов.

Возможные значения

  • text

    Указывает, что модель должна возвращать текст.

  • image

    Указывает, что модель должна возвращать изображения.

  • audio

    Указывает, что модель должна возвращать аудиоданные.

  • video

    Указывает, что модель должна возвращать видео.

  • document

    Указывает, что модель должна возвращать документы.

токены целое число (необязательно)

Количество токенов для данного режима.

total_cached_tokens — целое число (необязательно)

Количество токенов в кэшированной части запроса (кэшированное содержимое).

total_input_tokens целое число (необязательно)

Количество токенов в подсказке (контексте).

total_output_tokens целое число (необязательно)

Общее количество токенов во всех сгенерированных ответах.

total_thought_tokens целое число (необязательно)

Количество токенов мыслей для моделей мышления.

total_tokens целое число (необязательно)

Общее количество токенов для запроса на взаимодействие (запрос + ответы + другие внутренние токены).

total_tool_use_tokens целое число (необязательно)

Количество токенов, присутствующих в подсказках использования инструмента.