L'API Voices consente di creare voci personalizzate da prompt in linguaggio naturale (progettazione vocale) o da audio di riferimento e registrazioni del consenso del relatore (replica vocale), nonché di elencare, recuperare e gestire voci personalizzate e predefinite per la sintesi vocale (TTS).
CreateVoice
Crea una voce personalizzata da un prompt in linguaggio naturale (`VOICE_TYPE_PROMPTED`) o da registrazioni audio di riferimento e consenso (`VOICE_TYPE_REPLICATED`).
Corpo della richiesta
Il corpo della richiesta contiene dati con la seguente struttura:
Facoltativo. Indica se la voce creata viene mantenuta e gestita da Google. * Se `true`, Google memorizza la voce e restituisce `Voice.id` (ad esempio, `voice_abc123def456`), che può essere gestita tramite `GetVoice`, `ListVoices` e `DeleteVoice` e a cui si fa riferimento per ID nelle richieste di sintesi. I progetti sono soggetti a una quota massima di voci attive memorizzate; il superamento della quota restituisce `RESOURCE_EXHAUSTED`. * Se `false` (impostazione predefinita), la voce non viene memorizzata da Google e viene restituita `Voice.key` (ad esempio, `voicekey_…`) per l'archiviazione e la sintesi lato client. I campi facoltativi dei metadati di rilevamento in "voice" non vengono memorizzati o restituiti quando "store" è "false". * Deve essere "true" quando "voice.type" è "prompted" (altrimenti l'operazione non va a buon fine e viene restituito l'errore "INVALID_ARGUMENT").
Obbligatorio. La voce da creare. `voice.model` è facoltativo; se omesso, il servizio seleziona il modello di creazione della voce predefinito. I campi di sola output in "Voice" ("id", "key", "expire_time", "usage") vengono ignorati se impostati.
Risposta
In caso di esito positivo, il corpo della risposta contiene dati con la seguente struttura:
Facoltativo. Descrittore dell'accento regionale (ad es. "americano", "britannico").
Facoltativo. Contesto o dominio di utilizzo ottimale (ad es. "Conversazionale", "Audiobook", "News").
Facoltativo. Riepilogo descrittivo del timbro, della personalità e del tono della voce.
Facoltativo. Nome visualizzato fornito dall'utente per una voce memorizzata (`store = true`) o il nome del catalogo per una voce predefinita.
Solo output. Il timestamp in cui scade una voce personalizzata memorizzata (`store = true`) o una chiave vocale replicata (`store = false`). Annulla l'impostazione per le voci del catalogo predefinite ("prebuilt"), che non scadono.
Facoltativo. Presentazione del genere della voce percepita (ad es. "femminile", "maschile", "neutrale").
Solo output. L'identificatore univoco della voce. * Per le voci personalizzate gestite da Google (`store = true`), si tratta di un ID generato con il prefisso `voice_` (ad esempio, `voice_abc123def456`). Trasmetti `voices/{id}` come `name` in `GetVoice` e `DeleteVoice` e trasmetti `{id}` direttamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale. * Per le voci del catalogo predefinite (`"prebuilt"` restituito da `ListVoices`), questo è il nome dell'oratore (ad esempio, `Puck` o `Charon`). * Non impostato quando `CreateVoice` viene chiamato con `store = false`.
Solo output. La chiave di replica della voce gestita dal cliente (con il prefisso `voicekey_`). Restituita solo da `CreateVoice` quando `type` è `"replicated"` e `store` è `false`. Passa questa chiave a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale.
Facoltativo. Tag lingua BCP-47 principale (ad es. "en-US", "fr-FR").
Facoltativo. Il modello utilizzato per progettare o replicare la voce. Se omesso in `CreateVoice`, il valore predefinito è l'ultimo modello di progettazione vocale supportato. Restituito nelle risposte di `CreateVoice`, `GetVoice` e `ListVoices` per le voci personalizzate (`"prompted"` e `"replicated"`); non impostato per le voci `"prebuilt"`. Le voci create possono essere sintetizzate in qualsiasi modello di sintesi vocale supportato.
Facoltativo. Personaggio o archetipo previsto (ad es. "Caldo, amichevole", "Narratore").
pitch Pitch (facoltativo)
Facoltativo. Classificazione del tono della voce.
Valori possibili
-
lowVoce più grave.
-
mediumVoce con tonalità media.
-
highVoce più acuta.
prompted PromptedVoice (facoltativo)
Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.
Campi
Obbligatorio. Il prompt in linguaggio naturale che descrive la voce desiderata, ad esempio: "Una voce maschile profonda e fragorosa di un orco malvagio di mezza età".
Facoltativo. Codice regione geografica ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "GB", "001").
sample_audio AudioData (facoltativo)
Solo output. Audio campione (audio del prompt del sintetizzatore) generato per una voce richiesta. Compilato solo nelle risposte `CreateVoice` e `GetVoice` quando `type` è `"prompted"`; non impostato nelle risposte `ListVoices` e per le voci `"replicated"` o `"prebuilt"`.
Campi
Obbligatorio. I byte audio non elaborati.
Obbligatorio. Il tipo MIME IANA dei dati audio (ad esempio, `audio/wav` o `audio/mpeg`).
type VoiceType (facoltativo)
Obbligatorio. Il tipo di voce. In `CreateVoice`, deve essere `"replicated"` o `"prompted"`. Nelle risposte di `ListVoices`, può essere anche `"prebuilt"`.
Valori possibili
-
replicatedUna voce personalizzata replicata da un campione audio di riferimento e dalla registrazione del consenso dell'oratore.
-
promptedUna voce personalizzata generata da un prompt testuale in linguaggio naturale.
-
prebuiltUna voce di sistema integrata dal catalogo di voci di Google (ad es. `Puck`, `Charon`). Restituita nelle risposte; non può essere specificata come tipo in `CreateVoice`.
usage Utilizzo (facoltativo)
Solo output. Statistiche sull'utilizzo dei token per la richiesta di creazione della voce. Compilato solo nella risposta di `CreateVoice` quando `type` è `"prompted"`; non impostato per `"replicated"` e nelle risposte di `GetVoice` e `ListVoices`.
Campi
cached_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token nella cache per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
grounding_tool_count array (GroundingToolCount) (facoltativo)
Conteggio degli strumenti di grounding.
Campi
Il numero di conteggi dello strumento di messa a terra.
Il tipo di strumento di base associato al conteggio.
Valori possibili:
-
google_searchGrounding con la Ricerca Google e la Ricerca immagini e Grounding web per le aziende.
-
google_mapsGrounding con Google Maps.
input_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di input per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
output_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di output per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
tool_use_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di utilizzo degli strumenti per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
Numero di token nella parte memorizzata nella cache del prompt (i contenuti memorizzati nella cache).
Numero di token nel prompt (contesto).
Numero totale di token in tutte le risposte generate.
Numero di token di pensieri per i modelli di pensiero.
Conteggio totale dei token per la richiesta di interazione (prompt + risposte + altri token interni).
Numero di token presenti nei prompt di utilizzo degli strumenti.
Esempio
Esempio di risposta
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Elenca le voci personalizzate memorizzate di proprietà del chiamante (ordinate dalla più recente alla meno recente), seguite dalle voci di sistema predefinite del catalogo di voci di Google.
Parametri percorso / query
Facoltativo. Filtra in base alla descrizione dell'accento (ad es. "americano", "britannico"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi degli accenti specificati (OR).
Facoltativo. Filtra in base al contesto o al dominio previsto (ad es. "Notizie, Commerciale"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei contesti specificati (OR).
Facoltativo. Filtra in base alla presentazione del genere (ad es. "femminile", "maschile", "neutro"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei generi specificati (OR).
Facoltativo. Filtra per codice lingua BCP-47 (ad es. "en-US"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei codici di lingua specificati (OR).
Facoltativo. Il numero massimo di voci da restituire per pagina. Il servizio potrebbe restituire un numero inferiore a questo valore. Se non specificato, vengono restituite al massimo 50 voci. Il valore massimo è 1000; i valori superiori a 1000 vengono forzati a 1000.
Facoltativo. Un token di pagina ricevuto da una precedente chiamata `ListVoices`. Fornisci questo valore per recuperare la pagina successiva. Durante la paginazione, tutti i parametri di query del filtro (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, e `search`) devono corrispondere alla chiamata che ha restituito questo token; in caso contrario, la richiesta non va a buon fine e viene restituito l'errore `INVALID_ARGUMENT`. `page_size` può variare tra le pagine.
Facoltativo. Filtra per persona vocale (ad es. "Calda e amichevole"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a una qualsiasi delle personalità specificate (OR).
Facoltativo. Filtra per intonazione della voce. Accetta "low", "medium", "high" o "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (senza distinzione tra maiuscole e minuscole). Se vengono specificati più valori, vengono abbinate le voci con una qualsiasi delle intonazioni specificate (OR).
Facoltativo. Filtra per codice regione ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "001"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei codici regione specificati (OR).
Facoltativo. Query di ricerca di sottostringhe di testo libero con corrispondenza senza distinzione tra maiuscole e minuscole rispetto a `display_name` e `description`. Massimo 2048 byte.
Facoltativo. Filtra per tipo di voce. Accetta "prebuilt", "replicated", "prompted" o "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (senza distinzione tra maiuscole e minuscole). Se vengono specificati più valori, corrispondono alle voci con uno qualsiasi dei tipi specificati (OR).
Risposta
In caso di esito positivo, il corpo della risposta contiene dati con la seguente struttura:
Un token che può essere inviato come `page_token` per recuperare la pagina successiva. Se è vuoto, non verranno visualizzate altre pagine.
Le voci della raccolta specificata.
Esempio
Esempio di risposta
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Recupera una voce personalizzata memorizzata (`store = true`) in base al nome risorsa. Le voci del catalogo predefinite (`VOICE_TYPE_PREBUILT`) non possono essere recuperate tramite `GetVoice`; utilizza invece `ListVoices`.
Parametri di percorso / query
Obbligatorio. Il nome della risorsa della voce personalizzata archiviata da recuperare (ad esempio, `voices/voice_abc123def456`).
Risposta
In caso di esito positivo, il corpo della risposta contiene dati con la seguente struttura:
Facoltativo. Descrittore dell'accento regionale (ad es. "americano", "britannico").
Facoltativo. Contesto o dominio di utilizzo ottimale (ad es. "Conversazionale", "Audiobook", "News").
Facoltativo. Riepilogo descrittivo del timbro, della personalità e del tono della voce.
Facoltativo. Nome visualizzato fornito dall'utente per una voce memorizzata (`store = true`) o il nome del catalogo per una voce predefinita.
Solo output. Il timestamp in cui scade una voce personalizzata memorizzata (`store = true`) o una chiave vocale replicata (`store = false`). Annulla l'impostazione per le voci del catalogo predefinite ("prebuilt"), che non scadono.
Facoltativo. Presentazione del genere della voce percepita (ad es. "femminile", "maschile", "neutrale").
Solo output. L'identificatore univoco della voce. * Per le voci personalizzate gestite da Google (`store = true`), si tratta di un ID generato con il prefisso `voice_` (ad esempio, `voice_abc123def456`). Trasmetti `voices/{id}` come `name` in `GetVoice` e `DeleteVoice` e trasmetti `{id}` direttamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale. * Per le voci del catalogo predefinite (`"prebuilt"` restituito da `ListVoices`), questo è il nome dell'oratore (ad esempio, `Puck` o `Charon`). * Non impostato quando `CreateVoice` viene chiamato con `store = false`.
Solo output. La chiave di replica della voce gestita dal cliente (con il prefisso `voicekey_`). Restituita solo da `CreateVoice` quando `type` è `"replicated"` e `store` è `false`. Passa questa chiave a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale.
Facoltativo. Tag lingua BCP-47 principale (ad es. "en-US", "fr-FR").
Facoltativo. Il modello utilizzato per progettare o replicare la voce. Se omesso in `CreateVoice`, il valore predefinito è l'ultimo modello di progettazione vocale supportato. Restituito nelle risposte di `CreateVoice`, `GetVoice` e `ListVoices` per le voci personalizzate (`"prompted"` e `"replicated"`); non impostato per le voci `"prebuilt"`. Le voci create possono essere sintetizzate in qualsiasi modello di sintesi vocale supportato.
Facoltativo. Personaggio o archetipo previsto (ad es. "Caldo, amichevole", "Narratore").
pitch Pitch (facoltativo)
Facoltativo. Classificazione del tono della voce.
Valori possibili
-
lowVoce più grave.
-
mediumVoce con tonalità media.
-
highVoce più acuta.
prompted PromptedVoice (facoltativo)
Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.
Campi
Obbligatorio. Il prompt in linguaggio naturale che descrive la voce desiderata, ad esempio: "Una voce maschile profonda e fragorosa di un orco malvagio di mezza età".
Facoltativo. Codice regione geografica ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "GB", "001").
sample_audio AudioData (facoltativo)
Solo output. Audio campione (audio del prompt del sintetizzatore) generato per una voce richiesta. Compilato solo nelle risposte `CreateVoice` e `GetVoice` quando `type` è `"prompted"`; non impostato nelle risposte `ListVoices` e per le voci `"replicated"` o `"prebuilt"`.
Campi
Obbligatorio. I byte audio non elaborati.
Obbligatorio. Il tipo MIME IANA dei dati audio (ad esempio, `audio/wav` o `audio/mpeg`).
type VoiceType (facoltativo)
Obbligatorio. Il tipo di voce. In `CreateVoice`, deve essere `"replicated"` o `"prompted"`. Nelle risposte di `ListVoices`, può essere anche `"prebuilt"`.
Valori possibili
-
replicatedUna voce personalizzata replicata da un campione audio di riferimento e dalla registrazione del consenso dell'oratore.
-
promptedUna voce personalizzata generata da un prompt testuale in linguaggio naturale.
-
prebuiltUna voce di sistema integrata dal catalogo di voci di Google (ad es. `Puck`, `Charon`). Restituita nelle risposte; non può essere specificata come tipo in `CreateVoice`.
usage Utilizzo (facoltativo)
Solo output. Statistiche sull'utilizzo dei token per la richiesta di creazione della voce. Compilato solo nella risposta di `CreateVoice` quando `type` è `"prompted"`; non impostato per `"replicated"` e nelle risposte di `GetVoice` e `ListVoices`.
Campi
cached_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token nella cache per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
grounding_tool_count array (GroundingToolCount) (facoltativo)
Conteggio degli strumenti di grounding.
Campi
Il numero di conteggi dello strumento di messa a terra.
Il tipo di strumento di base associato al conteggio.
Valori possibili:
-
google_searchGrounding con la Ricerca Google e la Ricerca immagini e Grounding web per le aziende.
-
google_mapsGrounding con Google Maps.
input_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di input per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
output_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di output per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
tool_use_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di utilizzo degli strumenti per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
Numero di token nella parte memorizzata nella cache del prompt (i contenuti memorizzati nella cache).
Numero di token nel prompt (contesto).
Numero totale di token in tutte le risposte generate.
Numero di token di pensieri per i modelli di pensiero.
Conteggio totale dei token per la richiesta di interazione (prompt + risposte + altri token interni).
Numero di token presenti nei prompt di utilizzo degli strumenti.
Esempio
Esempio di risposta
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Elimina una voce personalizzata memorizzata (`store = true`) in base al nome della risorsa. Le voci del catalogo predefinite (`VOICE_TYPE_PREBUILT`) non possono essere eliminate.
Parametri di percorso / query
Obbligatorio. Il nome della risorsa della voce personalizzata memorizzata da eliminare (ad esempio, `voices/voice_abc123def456`).
Risposta
In caso di esito positivo, la risposta è vuota.
Esempio
Risorse
Voce
Una risorsa vocale che rappresenta una voce personalizzata (creata tramite `CreateVoice`) o una voce di sistema predefinita (restituita da `ListVoices`).
Campi
Facoltativo. Descrittore dell'accento regionale (ad es. "americano", "britannico").
Facoltativo. Contesto o dominio di utilizzo ottimale (ad es. "Conversazionale", "Audiobook", "News").
Facoltativo. Riepilogo descrittivo del timbro, della personalità e del tono della voce.
Facoltativo. Nome visualizzato fornito dall'utente per una voce memorizzata (`store = true`) o il nome del catalogo per una voce predefinita.
Solo output. Il timestamp in cui scade una voce personalizzata memorizzata (`store = true`) o una chiave vocale replicata (`store = false`). Annulla l'impostazione per le voci del catalogo predefinite ("prebuilt"), che non scadono.
Facoltativo. Presentazione del genere della voce percepita (ad es. "femminile", "maschile", "neutrale").
Solo output. L'identificatore univoco della voce. * Per le voci personalizzate gestite da Google (`store = true`), si tratta di un ID generato con il prefisso `voice_` (ad esempio, `voice_abc123def456`). Trasmetti `voices/{id}` come `name` in `GetVoice` e `DeleteVoice` e trasmetti `{id}` direttamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale. * Per le voci del catalogo predefinite (`"prebuilt"` restituito da `ListVoices`), questo è il nome dell'oratore (ad esempio, `Puck` o `Charon`). * Non impostato quando `CreateVoice` viene chiamato con `store = false`.
Solo output. La chiave di replica della voce gestita dal cliente (con il prefisso `voicekey_`). Restituita solo da `CreateVoice` quando `type` è `"replicated"` e `store` è `false`. Passa questa chiave a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale.
Facoltativo. Tag lingua BCP-47 principale (ad es. "en-US", "fr-FR").
Facoltativo. Il modello utilizzato per progettare o replicare la voce. Se omesso in `CreateVoice`, il valore predefinito è l'ultimo modello di progettazione vocale supportato. Restituito nelle risposte di `CreateVoice`, `GetVoice` e `ListVoices` per le voci personalizzate (`"prompted"` e `"replicated"`); non impostato per le voci `"prebuilt"`. Le voci create possono essere sintetizzate in qualsiasi modello di sintesi vocale supportato.
Facoltativo. Personaggio o archetipo previsto (ad es. "Caldo, amichevole", "Narratore").
pitch Pitch (facoltativo)
Facoltativo. Classificazione del tono della voce.
Valori possibili
-
lowVoce più grave.
-
mediumVoce con tonalità media.
-
highVoce più acuta.
prompted PromptedVoice (facoltativo)
Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.
Campi
Obbligatorio. Il prompt in linguaggio naturale che descrive la voce desiderata, ad esempio: "Una voce maschile profonda e fragorosa di un orco malvagio di mezza età".
Facoltativo. Codice regione geografica ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "GB", "001").
sample_audio AudioData (facoltativo)
Solo output. Audio campione (audio del prompt del sintetizzatore) generato per una voce richiesta. Compilato solo nelle risposte `CreateVoice` e `GetVoice` quando `type` è `"prompted"`; non impostato nelle risposte `ListVoices` e per le voci `"replicated"` o `"prebuilt"`.
Campi
Obbligatorio. I byte audio non elaborati.
Obbligatorio. Il tipo MIME IANA dei dati audio (ad esempio, `audio/wav` o `audio/mpeg`).
type VoiceType (facoltativo)
Obbligatorio. Il tipo di voce. In `CreateVoice`, deve essere `"replicated"` o `"prompted"`. Nelle risposte di `ListVoices`, può essere anche `"prebuilt"`.
Valori possibili
-
replicatedUna voce personalizzata replicata da un campione audio di riferimento e dalla registrazione del consenso dell'oratore.
-
promptedUna voce personalizzata generata da un prompt testuale in linguaggio naturale.
-
prebuiltUna voce di sistema integrata dal catalogo di voci di Google (ad es. `Puck`, `Charon`). Restituita nelle risposte; non può essere specificata come tipo in `CreateVoice`.
utilizzo Utilizzo (facoltativo)
Solo output. Statistiche sull'utilizzo dei token per la richiesta di creazione della voce. Compilato solo nella risposta di `CreateVoice` quando `type` è `"prompted"`; non impostato per `"replicated"` e nelle risposte di `GetVoice` e `ListVoices`.
Campi
cached_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token nella cache per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
grounding_tool_count array (GroundingToolCount) (facoltativo)
Conteggio degli strumenti di grounding.
Campi
Il numero di conteggi dello strumento di messa a terra.
Il tipo di strumento di base associato al conteggio.
Valori possibili:
-
google_searchGrounding con la Ricerca Google e la Ricerca immagini e Grounding web per le aziende.
-
google_mapsGrounding con Google Maps.
input_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di input per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
output_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di output per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
tool_use_tokens_by_modality array (ModalityTokens) (facoltativo)
Una suddivisione dell'utilizzo dei token di utilizzo degli strumenti per modalità.
Campi
modalità ResponseModality (facoltativo)
La modalità associata al conteggio dei token.
Valori possibili
-
textIndica che il modello deve restituire testo.
-
imageIndica che il modello deve restituire immagini.
-
audioIndica che il modello deve restituire l'audio.
-
videoIndica che il modello deve restituire un video.
-
documentIndica che il modello deve restituire documenti.
Numero di token per la modalità.
Numero di token nella parte memorizzata nella cache del prompt (i contenuti memorizzati nella cache).
Numero di token nel prompt (contesto).
Numero totale di token in tutte le risposte generate.
Numero di token di pensieri per i modelli di pensiero.
Conteggio totale dei token per la richiesta di interazione (prompt + risposte + altri token interni).
Numero di token presenti nei prompt di utilizzo degli strumenti.