Com a API Voices, é possível criar vozes personalizadas com base em comandos de linguagem natural (design de voz) ou em áudio de referência e gravações de consentimento do falante (replicação de voz), além de listar, recuperar e gerenciar vozes personalizadas e pré-criadas para síntese de Text-to-Speech (TTS).
CreateVoice
Cria uma voz personalizada com base em um comando de linguagem natural (`VOICE_TYPE_PROMPTED`) ou em gravações de áudio de referência e consentimento (`VOICE_TYPE_REPLICATED`).
Corpo da solicitação
O corpo da solicitação contém dados com a seguinte estrutura:
Opcional. Se a voz criada é mantida e gerenciada pelo Google. * Quando é "true", o Google armazena a voz e retorna "Voice.id" (por exemplo, "voice_abc123def456"), que pode ser gerenciado por "GetVoice", "ListVoices", e "DeleteVoice" e referenciado por ID em solicitações de síntese. Os projetos estão sujeitos a uma cota máxima de voz armazenada ativa. Exceder a cota retorna `RESOURCE_EXHAUSTED`. Quando `false` (padrão), a voz não é armazenada pelo Google, e `Voice.key` (por exemplo, `voicekey_...`) é retornado para armazenamento e síntese do lado do cliente. Os campos opcionais de metadados de descoberta em "voice" não são mantidos nem retornados quando "store" é "false". * É necessário que seja "true" quando "voice.type" é "prompted". Caso contrário, a solicitação falha com "INVALID_ARGUMENT".
Obrigatório. A voz a ser criada. `voice.model` é opcional. Se for omitido, o serviço vai selecionar o modelo padrão de criação de voz. Os campos somente de saída em "Voice" ("id", "key", "expire_time", "usage") são ignorados se definidos.
Resposta
Se bem-sucedido, o corpo da resposta incluirá dados com a estrutura a seguir:
Opcional. Descritor de sotaque regional (por exemplo, "americano", "britânico").
Opcional. Contexto ou domínio de uso ideal (por exemplo, "Conversacional", "Audiolivro", "Notícias").
Opcional. Resumo descritivo do timbre, da personalidade e do tom da voz.
Opcional. Nome de exibição fornecido pelo usuário para uma voz armazenada (`store = true`) ou o nome do catálogo para uma voz pré-criada.
Apenas saída. O carimbo de data/hora em que uma voz personalizada armazenada (`store = true`) ou uma chave de voz replicada (`store = false`) expira. Não definido para vozes de catálogo pré-criadas (`"prebuilt"`), que não expiram.
Opcional. Apresentação do gênero da voz percebida (por exemplo, "feminino", "masculino", "neutro").
Apenas saída. O identificador exclusivo da voz. * Para vozes personalizadas gerenciadas pelo Google (`store = true`), esse é um ID gerado com o prefixo `voice_` (por exemplo, `voice_abc123def456`). Transmita `voices/{id}` como o `name` em `GetVoice` e `DeleteVoice`, e transmita `{id}` diretamente para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz. * Para vozes de catálogo pré-criadas (`"prebuilt"` retornado por `ListVoices`), esse é o nome do locutor (por exemplo, `Puck` ou `Charon`). * Não definido quando `CreateVoice` é chamado com `store = false`.
Apenas saída. A chave de replicação de voz gerenciada pelo cliente (com o prefixo `voicekey_`). Retornada apenas por `CreateVoice` quando `type` é `"replicated"` e `store` é `false`. Transmita essa chave para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz.
Opcional. Tag de idioma BCP-47 principal (por exemplo, "en-US", "fr-FR").
Opcional. O modelo usado para criar ou replicar a voz. Se omitido em "CreateVoice", o padrão será o modelo de design de voz mais recente compatível. Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes personalizadas ("prompted" e "replicated"); não definido para vozes "prebuilt". As vozes criadas podem ser sintetizadas em qualquer modelo de síntese de TTS compatível.
Opcional. Arquétipo de personagem ou perfil pretendido (por exemplo, "Calmo, simpático", "Narrador").
pitch Pitch (opcional)
Opcional. Classificação de tom de voz.
Possíveis valores
-
lowFale com uma voz mais grave.
-
mediumVoz com tom médio.
-
highVoz mais aguda.
prompted PromptedVoice (opcional)
Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.
Campos
Obrigatório. O comando em linguagem natural que descreve a voz desejada, por exemplo, "Uma voz masculina grave e estrondosa de um ogro malvado e enorme na meia-idade".
Opcional. Código da região geográfica ISO 3166-1 alfa-2 ou UN M.49 (por exemplo, "US", "GB", "001").
sample_audio AudioData (opcional)
Apenas saída. Exemplo de áudio (áudio de comando do sintetizador) gerado para uma voz solicitada. Preenchido apenas nas respostas `CreateVoice` e `GetVoice` quando `type` é `"prompted"`; não definido nas respostas `ListVoices` e para vozes `"replicated"` ou `"prebuilt"`.
Campos
Obrigatório. Os bytes de áudio brutos.
Obrigatório. O tipo MIME IANA dos dados de áudio (por exemplo, "audio/wav" ou "audio/mpeg").
type VoiceType (opcional)
Obrigatório. O tipo da voz. Em "CreateVoice", precisa ser "replicated" ou "prompted". Em respostas de "ListVoices", também pode ser "prebuilt".
Possíveis valores
-
replicatedUma voz personalizada replicada de uma amostra de áudio de referência e uma gravação de consentimento do falante.
-
promptedUma voz personalizada gerada com base em um comando de texto em linguagem natural.
-
prebuiltUma voz do sistema integrada do catálogo de vozes do Google (por exemplo, "Puck" e "Charon"). Retornada em respostas. Não pode ser especificada como o tipo em "CreateVoice".
usage Usage (opcional)
Apenas saída. Estatísticas de uso de token para a solicitação de criação de voz. Preenchido apenas na resposta de "CreateVoice" quando "type" é "prompted". Não definido para "replicated" e nas respostas de "GetVoice" e "ListVoices".
Campos
cached_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens em cache por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
grounding_tool_count array (GroundingToolCount) (opcional)
Contagem de ferramentas de embasamento.
Campos
O número de contagens de ferramentas de embasamento.
O tipo de ferramenta de embasamento associado à contagem.
Valores possíveis:
-
google_searchEmbasamento com a Pesquisa Google na Web e a Pesquisa de imagens, além do Embasamento na Web para empresas.
-
google_mapsEmbasamento com o Google Maps.
input_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de entrada por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
output_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de saída por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
tool_use_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de uso de ferramentas por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
Número de tokens na parte armazenada em cache do comando (o conteúdo em cache).
Número de tokens no comando (contexto).
Número total de tokens em todas as respostas geradas.
Número de tokens de ideias para modelos de raciocínio.
Contagem total de tokens para a solicitação de interação (comando + respostas + outros tokens internos).
Número de tokens presentes nos comandos de uso da ferramenta.
Exemplo
Exemplo de resposta
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Lista as vozes personalizadas armazenadas de propriedade do autor da chamada (ordenadas da mais recente para a mais antiga), seguidas pelas vozes predefinidas do sistema do catálogo de vozes do Google.
Parâmetros de caminho / consulta
Opcional. Filtre por descrição do sotaque (por exemplo, "americano", "britânico"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, a correspondência será feita com vozes que tenham qualquer um dos sotaques especificados (OR).
Opcional. Filtre por contexto ou domínio pretendido (por exemplo, "Notícias, Comercial"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, corresponderá a vozes com qualquer um dos contextos especificados (OR).
Opcional. Filtre por apresentação de gênero (por exemplo, "feminino", "masculino", "neutro"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, a correspondência será feita com vozes de qualquer um dos gêneros especificados (OR).
Opcional. Filtre por código de idioma BCP-47 (por exemplo, "en-US"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, as vozes serão correspondentes a qualquer um dos códigos de idioma especificados (OR).
Opcional. O número máximo de vozes a serem retornadas por página. O serviço pode retornar menos que esse valor. Se não for especificado, no máximo 50 vozes serão retornadas. O valor máximo é 1.000. Valores maiores serão convertidos para 1.000.
Opcional. Um token de página recebido de uma chamada "ListVoices" anterior. Informe isso para recuperar a página seguinte. Ao paginar, todos os parâmetros de consulta de filtro (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` e `search`) precisam corresponder à chamada que retornou esse token. Caso contrário, a solicitação falha com `INVALID_ARGUMENT`. `page_size` pode mudar entre as páginas.
Opcional. Filtre por persona vocal (por exemplo, "Calma e amigável"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, as vozes com qualquer uma das personas especificadas serão correspondentes (OR).
Opcional. Filtre por tom de voz. Aceita "low", "medium", "high" ou "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (sem diferenciação de maiúsculas e minúsculas). Se vários valores forem especificados, a voz vai corresponder a qualquer uma das alturas especificadas (OR).
Opcional. Filtre por ISO 3166-1 alfa-2 ou código regional UN M.49 (por exemplo, "US", "001"). Correspondência exata que não diferencia maiúsculas de minúsculas. Se vários valores forem especificados, corresponderá às vozes com qualquer um dos códigos de região especificados (OR).
Opcional. A consulta de pesquisa de substring de texto livre correspondeu sem sensibilidade a maiúsculas e minúsculas em relação a `display_name` e `description`. Máximo de 2.048 bytes.
Opcional. Filtre por tipo de voz. Aceita "prebuilt", "replicated", "prompted" ou "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (sem diferenciação de maiúsculas e minúsculas). Se vários valores forem especificados, as vozes com qualquer um dos tipos especificados serão correspondentes (OR).
Resposta
Se bem-sucedido, o corpo da resposta incluirá dados com a estrutura a seguir:
Um token que pode ser enviado como "page_token" para recuperar a próxima página. Se estiver vazio, não haverá páginas subsequentes.
As vozes da coleção especificada.
Exemplo
Exemplo de resposta
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Recebe uma voz armazenada personalizada (`store = true`) pelo nome do recurso. As vozes do catálogo pré-criado (`VOICE_TYPE_PREBUILT`) não podem ser recuperadas usando `GetVoice`. Use `ListVoices`.
Parâmetros de caminho / consulta
Obrigatório. O nome do recurso da voz armazenada personalizada a ser recuperada (por exemplo, "voices/voice_abc123def456").
Resposta
Se bem-sucedido, o corpo da resposta incluirá dados com a estrutura a seguir:
Opcional. Descritor de sotaque regional (por exemplo, "americano", "britânico").
Opcional. Contexto ou domínio de uso ideal (por exemplo, "Conversacional", "Audiolivro", "Notícias").
Opcional. Resumo descritivo do timbre, da personalidade e do tom da voz.
Opcional. Nome de exibição fornecido pelo usuário para uma voz armazenada (`store = true`) ou o nome do catálogo para uma voz pré-criada.
Apenas saída. O carimbo de data/hora em que uma voz personalizada armazenada (`store = true`) ou uma chave de voz replicada (`store = false`) expira. Não definido para vozes de catálogo pré-criadas (`"prebuilt"`), que não expiram.
Opcional. Apresentação do gênero da voz percebida (por exemplo, "feminino", "masculino", "neutro").
Apenas saída. O identificador exclusivo da voz. * Para vozes personalizadas gerenciadas pelo Google (`store = true`), esse é um ID gerado com o prefixo `voice_` (por exemplo, `voice_abc123def456`). Transmita `voices/{id}` como o `name` em `GetVoice` e `DeleteVoice`, e transmita `{id}` diretamente para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz. * Para vozes de catálogo pré-criadas (`"prebuilt"` retornado por `ListVoices`), esse é o nome do locutor (por exemplo, `Puck` ou `Charon`). * Não definido quando `CreateVoice` é chamado com `store = false`.
Apenas saída. A chave de replicação de voz gerenciada pelo cliente (com o prefixo `voicekey_`). Retornada apenas por `CreateVoice` quando `type` é `"replicated"` e `store` é `false`. Transmita essa chave para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz.
Opcional. Tag de idioma BCP-47 principal (por exemplo, "en-US", "fr-FR").
Opcional. O modelo usado para criar ou replicar a voz. Se omitido em "CreateVoice", o padrão será o modelo de design de voz mais recente compatível. Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes personalizadas ("prompted" e "replicated"); não definido para vozes "prebuilt". As vozes criadas podem ser sintetizadas em qualquer modelo de síntese de TTS compatível.
Opcional. Arquétipo de personagem ou perfil pretendido (por exemplo, "Calmo, simpático", "Narrador").
pitch Pitch (opcional)
Opcional. Classificação de tom de voz.
Possíveis valores
-
lowFale com uma voz mais grave.
-
mediumVoz com tom médio.
-
highVoz mais aguda.
prompted PromptedVoice (opcional)
Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.
Campos
Obrigatório. O comando em linguagem natural que descreve a voz desejada, por exemplo, "Uma voz masculina grave e estrondosa de um ogro malvado e enorme na meia-idade".
Opcional. Código da região geográfica ISO 3166-1 alfa-2 ou UN M.49 (por exemplo, "US", "GB", "001").
sample_audio AudioData (opcional)
Apenas saída. Exemplo de áudio (áudio de comando do sintetizador) gerado para uma voz solicitada. Preenchido apenas nas respostas `CreateVoice` e `GetVoice` quando `type` é `"prompted"`; não definido nas respostas `ListVoices` e para vozes `"replicated"` ou `"prebuilt"`.
Campos
Obrigatório. Os bytes de áudio brutos.
Obrigatório. O tipo MIME IANA dos dados de áudio (por exemplo, "audio/wav" ou "audio/mpeg").
type VoiceType (opcional)
Obrigatório. O tipo da voz. Em "CreateVoice", precisa ser "replicated" ou "prompted". Em respostas de "ListVoices", também pode ser "prebuilt".
Possíveis valores
-
replicatedUma voz personalizada replicada de uma amostra de áudio de referência e uma gravação de consentimento do falante.
-
promptedUma voz personalizada gerada com base em um comando de texto em linguagem natural.
-
prebuiltUma voz do sistema integrada do catálogo de vozes do Google (por exemplo, "Puck" e "Charon"). Retornada em respostas. Não pode ser especificada como o tipo em "CreateVoice".
usage Usage (opcional)
Apenas saída. Estatísticas de uso de token para a solicitação de criação de voz. Preenchido apenas na resposta de "CreateVoice" quando "type" é "prompted". Não definido para "replicated" e nas respostas de "GetVoice" e "ListVoices".
Campos
cached_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens em cache por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
grounding_tool_count array (GroundingToolCount) (opcional)
Contagem de ferramentas de embasamento.
Campos
O número de contagens de ferramentas de embasamento.
O tipo de ferramenta de embasamento associado à contagem.
Valores possíveis:
-
google_searchEmbasamento com a Pesquisa Google na Web e a Pesquisa de imagens, além do Embasamento na Web para empresas.
-
google_mapsEmbasamento com o Google Maps.
input_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de entrada por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
output_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de saída por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
tool_use_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de uso de ferramentas por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
Número de tokens na parte armazenada em cache do comando (o conteúdo em cache).
Número de tokens no comando (contexto).
Número total de tokens em todas as respostas geradas.
Número de tokens de ideias para modelos de raciocínio.
Contagem total de tokens para a solicitação de interação (comando + respostas + outros tokens internos).
Número de tokens presentes nos comandos de uso da ferramenta.
Exemplo
Exemplo de resposta
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Exclui uma voz armazenada personalizada (`store = true`) por nome do recurso. Não é possível excluir vozes predefinidas do catálogo (`VOICE_TYPE_PREBUILT`).
Parâmetros de caminho / consulta
Obrigatório. O nome do recurso da voz armazenada personalizada a ser excluída (por exemplo, "voices/voice_abc123def456").
Resposta
Se a solicitação for concluída, a resposta estará vazia.
Exemplo
Recursos
Voz
Um recurso de voz que representa uma voz personalizada (criada usando `CreateVoice`) ou uma voz de sistema pré-criada (retornada por `ListVoices`).
Campos
Opcional. Descritor de sotaque regional (por exemplo, "americano", "britânico").
Opcional. Contexto ou domínio de uso ideal (por exemplo, "Conversacional", "Audiolivro", "Notícias").
Opcional. Resumo descritivo do timbre, da personalidade e do tom da voz.
Opcional. Nome de exibição fornecido pelo usuário para uma voz armazenada (`store = true`) ou o nome do catálogo para uma voz pré-criada.
Apenas saída. O carimbo de data/hora em que uma voz personalizada armazenada (`store = true`) ou uma chave de voz replicada (`store = false`) expira. Não definido para vozes de catálogo pré-criadas (`"prebuilt"`), que não expiram.
Opcional. Apresentação do gênero da voz percebida (por exemplo, "feminino", "masculino", "neutro").
Apenas saída. O identificador exclusivo da voz. * Para vozes personalizadas gerenciadas pelo Google (`store = true`), esse é um ID gerado com o prefixo `voice_` (por exemplo, `voice_abc123def456`). Transmita `voices/{id}` como o `name` em `GetVoice` e `DeleteVoice`, e transmita `{id}` diretamente para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz. * Para vozes de catálogo pré-criadas (`"prebuilt"` retornado por `ListVoices`), esse é o nome do locutor (por exemplo, `Puck` ou `Charon`). * Não definido quando `CreateVoice` é chamado com `store = false`.
Apenas saída. A chave de replicação de voz gerenciada pelo cliente (com o prefixo `voicekey_`). Retornada apenas por `CreateVoice` quando `type` é `"replicated"` e `store` é `false`. Transmita essa chave para `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) durante a síntese de voz.
Opcional. Tag de idioma BCP-47 principal (por exemplo, "en-US", "fr-FR").
Opcional. O modelo usado para criar ou replicar a voz. Se omitido em "CreateVoice", o padrão será o modelo de design de voz mais recente compatível. Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes personalizadas ("prompted" e "replicated"); não definido para vozes "prebuilt". As vozes criadas podem ser sintetizadas em qualquer modelo de síntese de TTS compatível.
Opcional. Arquétipo de personagem ou perfil pretendido (por exemplo, "Calmo, simpático", "Narrador").
pitch Pitch (opcional)
Opcional. Classificação de tom de voz.
Possíveis valores
-
lowFale com uma voz mais grave.
-
mediumVoz com tom médio.
-
highVoz mais aguda.
prompted PromptedVoice (opcional)
Parâmetros para geração de voz com comando. Obrigatório em "CreateVoice" quando "type" é "prompted". Retornado nas respostas "CreateVoice", "GetVoice" e "ListVoices" para vozes solicitadas.
Campos
Obrigatório. O comando em linguagem natural que descreve a voz desejada, por exemplo, "Uma voz masculina grave e estrondosa de um ogro malvado e enorme na meia-idade".
Opcional. Código da região geográfica ISO 3166-1 alfa-2 ou UN M.49 (por exemplo, "US", "GB", "001").
sample_audio AudioData (opcional)
Apenas saída. Exemplo de áudio (áudio de comando do sintetizador) gerado para uma voz solicitada. Preenchido apenas nas respostas `CreateVoice` e `GetVoice` quando `type` é `"prompted"`; não definido nas respostas `ListVoices` e para vozes `"replicated"` ou `"prebuilt"`.
Campos
Obrigatório. Os bytes de áudio brutos.
Obrigatório. O tipo MIME IANA dos dados de áudio (por exemplo, "audio/wav" ou "audio/mpeg").
type VoiceType (opcional)
Obrigatório. O tipo da voz. Em "CreateVoice", precisa ser "replicated" ou "prompted". Em respostas de "ListVoices", também pode ser "prebuilt".
Possíveis valores
-
replicatedUma voz personalizada replicada de uma amostra de áudio de referência e uma gravação de consentimento do falante.
-
promptedUma voz personalizada gerada com base em um comando de texto em linguagem natural.
-
prebuiltUma voz do sistema integrada do catálogo de vozes do Google (por exemplo, "Puck" e "Charon"). Retornada em respostas, não pode ser especificada como o tipo em "CreateVoice".
usage Usage (opcional)
Apenas saída. Estatísticas de uso de token para a solicitação de criação de voz. Preenchido apenas na resposta de "CreateVoice" quando "type" é "prompted". Não definido para "replicated" e nas respostas de "GetVoice" e "ListVoices".
Campos
cached_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens em cache por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
grounding_tool_count array (GroundingToolCount) (opcional)
Contagem de ferramentas de embasamento.
Campos
O número de contagens de ferramentas de embasamento.
O tipo de ferramenta de embasamento associado à contagem.
Valores possíveis:
-
google_searchEmbasamento com a Pesquisa Google na Web e a Pesquisa de imagens, além do Embasamento na Web para empresas.
-
google_mapsEmbasamento com o Google Maps.
input_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de entrada por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
output_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de saída por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
tool_use_tokens_by_modality array (ModalityTokens) (opcional)
Um detalhamento do uso de tokens de uso de ferramentas por modalidade.
Campos
modalidade ResponseModality (opcional)
A modalidade associada à contagem de tokens.
Possíveis valores
-
textIndica que o modelo precisa retornar texto.
-
imageIndica que o modelo precisa retornar imagens.
-
audioIndica que o modelo precisa retornar áudio.
-
videoIndica que o modelo precisa retornar vídeo.
-
documentIndica que o modelo precisa retornar documentos.
Número de tokens para a modalidade.
Número de tokens na parte armazenada em cache do comando (o conteúdo em cache).
Número de tokens no comando (contexto).
Número total de tokens em todas as respostas geradas.
Número de tokens de ideias para modelos de raciocínio.
Contagem total de tokens para a solicitação de interação (comando + respostas + outros tokens internos).
Número de tokens presentes nos comandos de uso da ferramenta.