Gemini Voices API

Com a API Voices, é possível criar vozes personalizadas com base em comandos de linguagem natural (design de voz) ou em áudio de referência e gravações de consentimento do falante (replicação de voz), além de listar, recuperar e gerenciar vozes personalizadas e pré-criadas para síntese de Text-to-Speech (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Cria uma voz personalizada com base em um comando de linguagem natural (`VOICE_TYPE_PROMPTED`) ou em gravações de áudio de referência e consentimento (`VOICE_TYPE_REPLICATED`).

Corpo da solicitação

O corpo da solicitação contém dados com a seguinte estrutura:

store boolean  (opcional)

Opcional. Se a voz criada é mantida e gerenciada pelo Google. * Quando é "true", o Google armazena a voz e retorna "Voice.id" (por exemplo, "voice_abc123def456"), que pode ser gerenciado por "GetVoice", "ListVoices", e "DeleteVoice" e referenciado por ID em solicitações de síntese. Os projetos estão sujeitos a uma cota máxima de voz armazenada ativa. Exceder a cota retorna `RESOURCE_EXHAUSTED`. Quando `false` (padrão), a voz não é armazenada pelo Google, e `Voice.key` (por exemplo, `voicekey_...`) é retornado para armazenamento e síntese do lado do cliente. Os campos opcionais de metadados de descoberta em "voice" não são mantidos nem retornados quando "store" é "false". * É necessário que seja "true" quando "voice.type" é "prompted". Caso contrário, a solicitação falha com "INVALID_ARGUMENT".

voice Voice  (obrigatório)

Obrigatório. A voz a ser criada. `voice.model` é opcional. Se for omitido, o serviço vai selecionar o modelo padrão de criação de voz. Os campos somente de saída em "Voice" ("id", "key", "expire_time", "usage") são ignorados se definidos.

Resposta

Se bem-sucedido, o corpo da resposta incluirá dados com a estrutura a seguir:

accent string  (opcional)

Opcional. Descritor de sotaque regional (por exemplo, "americano", "britânico").

context string  (opcional)

Opcional. Contexto ou domínio de uso ideal (por exemplo, "Conversacional", "Audiolivro", "Notícias").

description string  (opcional)

Opcional. Resumo descritivo do timbre, da personalidade e do tom da voz.

display_name string  (opcional)

Opcional. Nome de exibição fornecido pelo usuário para uma voz armazenada (`store = true`) ou o nome do catálogo para uma voz pré-criada.

expire_time string  (opcional)

Apenas saída. O carimbo de data/hora em que uma voz personalizada armazenada (`store = true`) ou uma chave de voz replicada (`store = false`) expira. Não definido para vozes de catálogo pré-criadas (`"prebuilt"`), que não expiram.

gender string  (opcional)

Opcional. Apresentação do gênero da voz percebida (por exemplo, "feminino", "masculino", "neutro").

id string  (opcional)

Apenas saída. O identificador exclusivo da voz. * Para vozes personalizadas gerenciadas pelo Google (`store = true`), esse é um ID gerado com o prefixo `voice_` (por exemplo, `voice_abc123def456`). Transmita `voices/{id}` como o `name` em `GetVoice` e `DeleteVoice`, e transmita `{id}` diretamente para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz. * Para vozes de catálogo pré-criadas (`"prebuilt"` retornado por `ListVoices`), esse é o nome do locutor (por exemplo, `Puck` ou `Charon`). * Não definido quando `CreateVoice` é chamado com `store = false`.

key string  (opcional)

Apenas saída. A chave de replicação de voz gerenciada pelo cliente (com o prefixo `voicekey_`). Retornada apenas por `CreateVoice` quando `type` é `"replicated"` e `store` é `false`. Transmita essa chave para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz.

language_code string  (opcional)

Opcional. Tag de idioma BCP-47 principal (por exemplo, "en-US", "fr-FR").

model string  (opcional)

Opcional. O modelo usado para criar ou replicar a voz. Se omitido em "CreateVoice", o padrão será o modelo de design de voz mais recente compatível. Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes personalizadas ("prompted" e "replicated"); não definido para vozes "prebuilt". As vozes criadas podem ser sintetizadas em qualquer modelo de síntese de TTS compatível.

persona string  (opcional)

Opcional. Arquétipo de personagem ou perfil pretendido (por exemplo, "Calmo, simpático", "Narrador").

pitch Pitch  (opcional)

Opcional. Classificação de tom de voz.

Possíveis valores

  • low

    Fale com uma voz mais grave.

  • medium

    Voz com tom médio.

  • high

    Voz mais aguda.

prompted PromptedVoice  (opcional)

Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.

Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.

Campos

input string  (opcional)

Obrigatório. O comando em linguagem natural que descreve a voz desejada, por exemplo, "Uma voz masculina grave e estrondosa de um ogro malvado e enorme na meia-idade".

region_code string  (opcional)

Opcional. Código da região geográfica ISO 3166-1 alfa-2 ou UN M.49 (por exemplo, "US", "GB", "001").

sample_audio AudioData  (opcional)

Apenas saída. Exemplo de áudio (áudio de comando do sintetizador) gerado para uma voz solicitada. Preenchido apenas nas respostas `CreateVoice` e `GetVoice` quando `type` é `"prompted"`; não definido nas respostas `ListVoices` e para vozes `"replicated"` ou `"prebuilt"`.

Payload de áudio usado para criação de voz.

Campos

data string  (opcional)

Obrigatório. Os bytes de áudio brutos.

mime_type string  (opcional)

Obrigatório. O tipo MIME IANA dos dados de áudio (por exemplo, "audio/wav" ou "audio/mpeg").

type VoiceType  (opcional)

Obrigatório. O tipo da voz. Em "CreateVoice", precisa ser "replicated" ou "prompted". Em respostas de "ListVoices", também pode ser "prebuilt".

Possíveis valores

  • replicated

    Uma voz personalizada replicada de uma amostra de áudio de referência e uma gravação de consentimento do falante.

  • prompted

    Uma voz personalizada gerada com base em um comando de texto em linguagem natural.

  • prebuilt

    Uma voz do sistema integrada do catálogo de vozes do Google (por exemplo, "Puck" e "Charon"). Retornada em respostas. Não pode ser especificada como o tipo em "CreateVoice".

usage Usage  (opcional)

Apenas saída. Estatísticas de uso de token para a solicitação de criação de voz. Preenchido apenas na resposta de "CreateVoice" quando "type" é "prompted". Não definido para "replicated" e nas respostas de "GetVoice" e "ListVoices".

Estatísticas sobre o uso de tokens da solicitação de interação.

Campos

cached_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens em cache por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

grounding_tool_count array (GroundingToolCount)  (opcional)

Contagem de ferramentas de embasamento.

O número de contagens de ferramentas de embasamento.

Campos

count integer  (opcional)

O número de contagens de ferramentas de embasamento.

type enum (string)  (opcional)

O tipo de ferramenta de embasamento associado à contagem.

Valores possíveis:

  • google_search

    Embasamento com a Pesquisa Google na Web e a Pesquisa de imagens, além do Embasamento na Web para empresas.

  • google_maps

    Embasamento com o Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de entrada por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

output_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de saída por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

tool_use_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de uso de ferramentas por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

total_cached_tokens integer  (optional)

Número de tokens na parte armazenada em cache do comando (o conteúdo em cache).

total_input_tokens integer  (optional)

Número de tokens no comando (contexto).

total_output_tokens integer  (opcional)

Número total de tokens em todas as respostas geradas.

total_thought_tokens integer  (opcional)

Número de tokens de ideias para modelos de raciocínio.

total_tokens integer  (optional)

Contagem total de tokens para a solicitação de interação (comando + respostas + outros tokens internos).

total_tool_use_tokens integer  (optional)

Número de tokens presentes nos comandos de uso da ferramenta.

Exemplo

Exemplo de resposta

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Lista as vozes personalizadas armazenadas de propriedade do autor da chamada (ordenadas da mais recente para a mais antiga), seguidas pelas vozes predefinidas do sistema do catálogo de vozes do Google.

Parâmetros de caminho / consulta

accent array (string)  (opcional)

Opcional. Filtre por descrição do sotaque (por exemplo, "americano", "britânico"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, a correspondência será feita com vozes que tenham qualquer um dos sotaques especificados (OR).

context array (string)  (opcional)

Opcional. Filtre por contexto ou domínio pretendido (por exemplo, "Notícias, Comercial"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, corresponderá a vozes com qualquer um dos contextos especificados (OR).

gender array (string)  (opcional)

Opcional. Filtre por apresentação de gênero (por exemplo, "feminino", "masculino", "neutro"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, a correspondência será feita com vozes de qualquer um dos gêneros especificados (OR).

language_code array (string)  (opcional)

Opcional. Filtre por código de idioma BCP-47 (por exemplo, "en-US"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, as vozes serão correspondentes a qualquer um dos códigos de idioma especificados (OR).

page_size integer  (optional)

Opcional. O número máximo de vozes a serem retornadas por página. O serviço pode retornar menos que esse valor. Se não for especificado, no máximo 50 vozes serão retornadas. O valor máximo é 1.000. Valores maiores serão convertidos para 1.000.

page_token string  (opcional)

Opcional. Um token de página recebido de uma chamada "ListVoices" anterior. Informe isso para recuperar a página seguinte. Ao paginar, todos os parâmetros de consulta de filtro (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` e `search`) precisam corresponder à chamada que retornou esse token. Caso contrário, a solicitação falha com `INVALID_ARGUMENT`. `page_size` pode mudar entre as páginas.

persona array (string)  (opcional)

Opcional. Filtre por persona vocal (por exemplo, "Calma e amigável"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, as vozes com qualquer uma das personas especificadas serão correspondentes (OR).

pitch array (string)  (opcional)

Opcional. Filtre por tom de voz. Aceita "low", "medium", "high" ou "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (sem diferenciação de maiúsculas e minúsculas). Se vários valores forem especificados, a voz vai corresponder a qualquer uma das alturas especificadas (OR).

region_code array (string)  (opcional)

Opcional. Filtre por ISO 3166-1 alfa-2 ou código regional UN M.49 (por exemplo, "US", "001"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, corresponderá às vozes com qualquer um dos códigos de região especificados (OR).

search string  (opcional)

Opcional. A consulta de pesquisa de substring de texto livre correspondeu sem sensibilidade a maiúsculas e minúsculas em relação a `display_name` e `description`. Máximo de 2.048 bytes.

type array (string)  (opcional)

Opcional. Filtre por tipo de voz. Aceita "prebuilt", "replicated", "prompted" ou "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (sem diferenciação de maiúsculas e minúsculas). Se vários valores forem especificados, as vozes com qualquer um dos tipos especificados serão correspondentes (OR).

Resposta

Se bem-sucedido, o corpo da resposta incluirá dados com a estrutura a seguir:

next_page_token string  (opcional)

Um token que pode ser enviado como "page_token" para recuperar a próxima página. Se estiver vazio, não haverá páginas subsequentes.

voices array (Voice)  (opcional)

As vozes da coleção especificada.

Exemplo

Exemplo de resposta

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Recebe uma voz armazenada personalizada (`store = true`) pelo nome do recurso. As vozes do catálogo pré-criado (`VOICE_TYPE_PREBUILT`) não podem ser recuperadas usando `GetVoice`. Use `ListVoices`.

Parâmetros de caminho / consulta

voicesId string  (obrigatório)

Obrigatório. O nome do recurso da voz armazenada personalizada a ser recuperada (por exemplo, "voices/voice_abc123def456").

Resposta

Se bem-sucedido, o corpo da resposta incluirá dados com a estrutura a seguir:

accent string  (opcional)

Opcional. Descritor de sotaque regional (por exemplo, "americano", "britânico").

context string  (opcional)

Opcional. Contexto ou domínio de uso ideal (por exemplo, "Conversacional", "Audiolivro", "Notícias").

description string  (opcional)

Opcional. Resumo descritivo do timbre, da personalidade e do tom da voz.

display_name string  (opcional)

Opcional. Nome de exibição fornecido pelo usuário para uma voz armazenada (`store = true`) ou o nome do catálogo para uma voz pré-criada.

expire_time string  (opcional)

Apenas saída. O carimbo de data/hora em que uma voz personalizada armazenada (`store = true`) ou uma chave de voz replicada (`store = false`) expira. Não definido para vozes de catálogo pré-criadas (`"prebuilt"`), que não expiram.

gender string  (opcional)

Opcional. Apresentação do gênero da voz percebida (por exemplo, "feminino", "masculino", "neutro").

id string  (opcional)

Apenas saída. O identificador exclusivo da voz. * Para vozes personalizadas gerenciadas pelo Google (`store = true`), esse é um ID gerado com o prefixo `voice_` (por exemplo, `voice_abc123def456`). Transmita `voices/{id}` como o `name` em `GetVoice` e `DeleteVoice`, e transmita `{id}` diretamente para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz. * Para vozes de catálogo pré-criadas (`"prebuilt"` retornado por `ListVoices`), esse é o nome do locutor (por exemplo, `Puck` ou `Charon`). * Não definido quando `CreateVoice` é chamado com `store = false`.

key string  (opcional)

Apenas saída. A chave de replicação de voz gerenciada pelo cliente (com o prefixo `voicekey_`). Retornada apenas por `CreateVoice` quando `type` é `"replicated"` e `store` é `false`. Transmita essa chave para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz.

language_code string  (opcional)

Opcional. Tag de idioma BCP-47 principal (por exemplo, "en-US", "fr-FR").

model string  (opcional)

Opcional. O modelo usado para criar ou replicar a voz. Se omitido em "CreateVoice", o padrão será o modelo de design de voz mais recente compatível. Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes personalizadas ("prompted" e "replicated"); não definido para vozes "prebuilt". As vozes criadas podem ser sintetizadas em qualquer modelo de síntese de TTS compatível.

persona string  (opcional)

Opcional. Arquétipo de personagem ou perfil pretendido (por exemplo, "Calmo, simpático", "Narrador").

pitch Pitch  (opcional)

Opcional. Classificação de tom de voz.

Possíveis valores

  • low

    Fale com uma voz mais grave.

  • medium

    Voz com tom médio.

  • high

    Voz mais aguda.

prompted PromptedVoice  (opcional)

Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.

Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.

Campos

input string  (opcional)

Obrigatório. O comando em linguagem natural que descreve a voz desejada, por exemplo, "Uma voz masculina grave e estrondosa de um ogro malvado e enorme na meia-idade".

region_code string  (opcional)

Opcional. Código da região geográfica ISO 3166-1 alfa-2 ou UN M.49 (por exemplo, "US", "GB", "001").

sample_audio AudioData  (opcional)

Apenas saída. Exemplo de áudio (áudio de comando do sintetizador) gerado para uma voz solicitada. Preenchido apenas nas respostas `CreateVoice` e `GetVoice` quando `type` é `"prompted"`; não definido nas respostas `ListVoices` e para vozes `"replicated"` ou `"prebuilt"`.

Payload de áudio usado para criação de voz.

Campos

data string  (opcional)

Obrigatório. Os bytes de áudio brutos.

mime_type string  (opcional)

Obrigatório. O tipo MIME IANA dos dados de áudio (por exemplo, "audio/wav" ou "audio/mpeg").

type VoiceType  (opcional)

Obrigatório. O tipo da voz. Em "CreateVoice", precisa ser "replicated" ou "prompted". Em respostas de "ListVoices", também pode ser "prebuilt".

Possíveis valores

  • replicated

    Uma voz personalizada replicada de uma amostra de áudio de referência e uma gravação de consentimento do falante.

  • prompted

    Uma voz personalizada gerada com base em um comando de texto em linguagem natural.

  • prebuilt

    Uma voz do sistema integrada do catálogo de vozes do Google (por exemplo, "Puck" e "Charon"). Retornada em respostas. Não pode ser especificada como o tipo em "CreateVoice".

usage Usage  (opcional)

Apenas saída. Estatísticas de uso de token para a solicitação de criação de voz. Preenchido apenas na resposta de "CreateVoice" quando "type" é "prompted". Não definido para "replicated" e nas respostas de "GetVoice" e "ListVoices".

Estatísticas sobre o uso de tokens da solicitação de interação.

Campos

cached_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens em cache por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

grounding_tool_count array (GroundingToolCount)  (opcional)

Contagem de ferramentas de embasamento.

O número de contagens de ferramentas de embasamento.

Campos

count integer  (opcional)

O número de contagens de ferramentas de embasamento.

type enum (string)  (opcional)

O tipo de ferramenta de embasamento associado à contagem.

Valores possíveis:

  • google_search

    Embasamento com a Pesquisa Google na Web e a Pesquisa de imagens, além do Embasamento na Web para empresas.

  • google_maps

    Embasamento com o Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de entrada por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

output_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de saída por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

tool_use_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de uso de ferramentas por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

total_cached_tokens integer  (optional)

Número de tokens na parte armazenada em cache do comando (o conteúdo em cache).

total_input_tokens integer  (optional)

Número de tokens no comando (contexto).

total_output_tokens integer  (opcional)

Número total de tokens em todas as respostas geradas.

total_thought_tokens integer  (opcional)

Número de tokens de ideias para modelos de raciocínio.

total_tokens integer  (optional)

Contagem total de tokens para a solicitação de interação (comando + respostas + outros tokens internos).

total_tool_use_tokens integer  (optional)

Número de tokens presentes nos comandos de uso da ferramenta.

Exemplo

Exemplo de resposta

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Exclui uma voz armazenada personalizada (`store = true`) por nome do recurso. Não é possível excluir vozes predefinidas do catálogo (`VOICE_TYPE_PREBUILT`).

Parâmetros de caminho / consulta

voicesId string  (obrigatório)

Obrigatório. O nome do recurso da voz armazenada personalizada a ser excluída (por exemplo, "voices/voice_abc123def456").

Resposta

Se a solicitação for concluída, a resposta estará vazia.

Exemplo

Recursos

Voz

Um recurso de voz que representa uma voz personalizada (criada usando `CreateVoice`) ou uma voz de sistema pré-criada (retornada por `ListVoices`).

Campos

accent string  (opcional)

Opcional. Descritor de sotaque regional (por exemplo, "americano", "britânico").

context string  (opcional)

Opcional. Contexto ou domínio de uso ideal (por exemplo, "Conversacional", "Audiolivro", "Notícias").

description string  (opcional)

Opcional. Resumo descritivo do timbre, da personalidade e do tom da voz.

display_name string  (opcional)

Opcional. Nome de exibição fornecido pelo usuário para uma voz armazenada (`store = true`) ou o nome do catálogo para uma voz pré-criada.

expire_time string  (opcional)

Apenas saída. O carimbo de data/hora em que uma voz personalizada armazenada (`store = true`) ou uma chave de voz replicada (`store = false`) expira. Não definido para vozes de catálogo pré-criadas (`"prebuilt"`), que não expiram.

gender string  (opcional)

Opcional. Apresentação do gênero da voz percebida (por exemplo, "feminino", "masculino", "neutro").

id string  (opcional)

Apenas saída. O identificador exclusivo da voz. * Para vozes personalizadas gerenciadas pelo Google (`store = true`), esse é um ID gerado com o prefixo `voice_` (por exemplo, `voice_abc123def456`). Transmita `voices/{id}` como o `name` em `GetVoice` e `DeleteVoice`, e transmita `{id}` diretamente para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz. * Para vozes de catálogo pré-criadas (`"prebuilt"` retornado por `ListVoices`), esse é o nome do locutor (por exemplo, `Puck` ou `Charon`). * Não definido quando `CreateVoice` é chamado com `store = false`.

key string  (opcional)

Apenas saída. A chave de replicação de voz gerenciada pelo cliente (com o prefixo `voicekey_`). Retornada apenas por `CreateVoice` quando `type` é `"replicated"` e `store` é `false`. Transmita essa chave para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz.

language_code string  (opcional)

Opcional. Tag de idioma BCP-47 principal (por exemplo, "en-US", "fr-FR").

model string  (opcional)

Opcional. O modelo usado para criar ou replicar a voz. Se omitido em "CreateVoice", o padrão será o modelo de design de voz mais recente compatível. Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes personalizadas ("prompted" e "replicated"); não definido para vozes "prebuilt". As vozes criadas podem ser sintetizadas em qualquer modelo de síntese de TTS compatível.

persona string  (opcional)

Opcional. Arquétipo de personagem ou perfil pretendido (por exemplo, "Calmo, simpático", "Narrador").

pitch Pitch  (opcional)

Opcional. Classificação de tom de voz.

Possíveis valores

  • low

    Fale com uma voz mais grave.

  • medium

    Voz com tom médio.

  • high

    Voz mais aguda.

prompted PromptedVoice  (opcional)

Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.

Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.

Campos

input string  (opcional)

Obrigatório. O comando em linguagem natural que descreve a voz desejada, por exemplo, "Uma voz masculina grave e estrondosa de um ogro malvado e enorme na meia-idade".

region_code string  (opcional)

Opcional. Código da região geográfica ISO 3166-1 alfa-2 ou UN M.49 (por exemplo, "US", "GB", "001").

sample_audio AudioData  (opcional)

Apenas saída. Exemplo de áudio (áudio de comando do sintetizador) gerado para uma voz solicitada. Preenchido apenas nas respostas `CreateVoice` e `GetVoice` quando `type` é `"prompted"`; não definido nas respostas `ListVoices` e para vozes `"replicated"` ou `"prebuilt"`.

Payload de áudio usado para criação de voz.

Campos

data string  (opcional)

Obrigatório. Os bytes de áudio brutos.

mime_type string  (opcional)

Obrigatório. O tipo MIME IANA dos dados de áudio (por exemplo, "audio/wav" ou "audio/mpeg").

type VoiceType  (opcional)

Obrigatório. O tipo da voz. Em "CreateVoice", precisa ser "replicated" ou "prompted". Em respostas de "ListVoices", também pode ser "prebuilt".

Possíveis valores

  • replicated

    Uma voz personalizada replicada de uma amostra de áudio de referência e uma gravação de consentimento do falante.

  • prompted

    Uma voz personalizada gerada com base em um comando de texto em linguagem natural.

  • prebuilt

    Uma voz do sistema integrada do catálogo de vozes do Google (por exemplo, "Puck" e "Charon"). Retornada em respostas, não pode ser especificada como o tipo em "CreateVoice".

usage Usage  (opcional)

Apenas saída. Estatísticas de uso de token para a solicitação de criação de voz. Preenchido apenas na resposta de "CreateVoice" quando "type" é "prompted". Não definido para "replicated" e nas respostas de "GetVoice" e "ListVoices".

Estatísticas sobre o uso de tokens da solicitação de interação.

Campos

cached_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens em cache por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

grounding_tool_count array (GroundingToolCount)  (opcional)

Contagem de ferramentas de embasamento.

O número de contagens de ferramentas de embasamento.

Campos

count integer  (opcional)

O número de contagens de ferramentas de embasamento.

type enum (string)  (opcional)

O tipo de ferramenta de embasamento associado à contagem.

Valores possíveis:

  • google_search

    Embasamento com a Pesquisa Google na Web e a Pesquisa de imagens, além do Embasamento na Web para empresas.

  • google_maps

    Embasamento com o Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de entrada por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

output_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de saída por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

tool_use_tokens_by_modality array (ModalityTokens)  (opcional)

Um detalhamento do uso de tokens de uso de ferramentas por modalidade.

A contagem de tokens para uma única modalidade de resposta.

Campos

modalidade ResponseModality  (opcional)

A modalidade associada à contagem de tokens.

Possíveis valores

  • text

    Indica que o modelo precisa retornar texto.

  • image

    Indica que o modelo precisa retornar imagens.

  • audio

    Indica que o modelo precisa retornar áudio.

  • video

    Indica que o modelo precisa retornar vídeo.

  • document

    Indica que o modelo precisa retornar documentos.

tokens integer  (opcional)

Número de tokens para a modalidade.

total_cached_tokens integer  (optional)

Número de tokens na parte armazenada em cache do comando (o conteúdo em cache).

total_input_tokens integer  (optional)

Número de tokens no comando (contexto).

total_output_tokens integer  (opcional)

Número total de tokens em todas as respostas geradas.

total_thought_tokens integer  (opcional)

Número de tokens de ideias para modelos de raciocínio.

total_tokens integer  (optional)

Contagem total de tokens para a solicitação de interação (comando + respostas + outros tokens internos).

total_tool_use_tokens integer  (optional)

Número de tokens presentes nos comandos de uso da ferramenta.