L'API Voices vous permet de créer des voix personnalisées à partir de requêtes en langage naturel (conception de voix) ou à partir d'enregistrements audio de référence et d'enregistrements de consentement du locuteur (réplication de voix). Elle vous permet également de lister, de récupérer et de gérer les voix personnalisées et prédéfinies pour la synthèse vocale (TTS).
CreateVoice
Crée une voix personnalisée à partir d'un prompt en langage naturel (`VOICE_TYPE_PROMPTED`) ou à partir d'enregistrements audio de référence et de consentement (`VOICE_TYPE_REPLICATED`).
Corps de la requête
Le corps de la requête contient des données présentant la structure suivante :
Facultatif. Indique si la voix créée est conservée et gérée par Google. * Lorsque la valeur est "true", Google stocke la voix et renvoie `Voice.id` (par exemple, `voice_abc123def456`), qui peut être gérée via `GetVoice`, `ListVoices` et `DeleteVoice`, et référencée par ID dans les requêtes de synthèse. Les projets sont soumis à un quota maximal de voix stockées actives. Si ce quota est dépassé, le code d'erreur `RESOURCE_EXHAUSTED` est renvoyé. * Si la valeur est définie sur `false` (par défaut), la voix n'est pas stockée par Google et `Voice.key` (par exemple, `voicekey_...`) est renvoyé pour le stockage et la synthèse côté client. Les champs de métadonnées de découverte facultatifs sur "voice" ne sont pas conservés ni renvoyés lorsque "store" est défini sur "false". * Doit être défini sur "true" lorsque "voice.type" est défini sur "prompted" (sinon, une erreur INVALID_ARGUMENT est renvoyée).
Obligatoire. Voix à créer. `voice.model` est facultatif. S'il est omis, le service sélectionne le modèle de création de voix par défaut. Les champs en sortie seule de "Voice" ("id", "key", "expire_time", "usage") sont ignorés s'ils sont définis.
Réponse
Si la requête aboutit, le corps de la réponse contient des données qui ont la structure suivante :
Facultatif. Descripteur d'accent régional (par exemple, "américain", "britannique").
Facultatif. Contexte ou domaine d'utilisation optimal (par exemple, "Conversationnel", "Livre audio", "Actualités").
Facultatif. Résumé descriptif du timbre, de la personnalité et du ton de la voix.
Facultatif. Nom à afficher fourni par l'utilisateur pour une voix stockée (`store = true`), ou nom du catalogue pour une voix prédéfinie.
Uniquement en sortie. Code temporel d'expiration d'une voix stockée personnalisée (`store = true`) ou d'une clé vocale répliquée (`store = false`). Non défini pour les voix de catalogue prédéfinies ("prebuilt"), qui n'expirent pas.
Facultatif. Genre perçu de la voix (par exemple, "féminin", "masculin" ou "neutre").
Uniquement en sortie. Identifiant unique de la voix. * Pour les voix personnalisées gérées par Google (`store = true`), il s'agit d'un ID généré avec le préfixe `voice_` (par exemple, `voice_abc123def456`). Transmettez `voices/{id}` en tant que `name` dans `GetVoice` et `DeleteVoice`, et transmettez `{id}` directement à `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) lors de la synthèse vocale. * Pour les voix de catalogue prédéfinies (`"prebuilt"` renvoyé par `ListVoices`), il s'agit du nom du locuteur (par exemple, `Puck` ou `Charon`). * Non défini lorsque `CreateVoice` est appelé avec `store = false`.
Uniquement en sortie. Clé de réplication vocale gérée par le client (avec le préfixe "voicekey_"). Elle n'est renvoyée par "CreateVoice" que lorsque le paramètre "type" est défini sur "replicated" et que le paramètre "store" est défini sur "false". Transmettez cette clé à "SpeechConfig.voice_config.voice" (ou "SpeechConfig.voice") lors de la synthèse vocale.
Facultatif. Tag de langue BCP-47 principal (par exemple, "en-US" ou "fr-FR").
Facultatif. Modèle utilisé pour concevoir ou répliquer la voix. Si elle est omise dans `CreateVoice`, la valeur par défaut est le dernier modèle de conception vocale compatible. Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix personnalisées ("prompted" et"replicated"). Non défini pour les voix"prebuilt". Les voix créées peuvent être synthétisées dans n'importe quel modèle de synthèse vocale compatible.
Facultatif. Persona ou archétype de personnage souhaité (par exemple, "Chaleureux, amical" ou "Narrateur").
pitch Hauteur (facultatif)
Facultatif. Classification du ton de la voix.
Valeurs possibles
-
lowVoix plus grave
-
mediumVoix de hauteur moyenne.
-
highVoix plus aiguë.
prompted PromptedVoice (facultatif)
Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.
Champs
Obligatoire. Requête en langage naturel décrivant la voix souhaitée, par exemple : "Une voix masculine grave et tonitruante d'un ogre maléfique massif dans la force de l'âge."
Facultatif. Code de région géographique ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "GB" ou "001").
sample_audio AudioData (facultatif)
Uniquement en sortie. Exemple audio (audio de synthèse) généré pour une voix sollicitée. Renseigné uniquement dans les réponses `CreateVoice` et `GetVoice` lorsque `type` est défini sur"prompted". Non défini dans les réponses `ListVoices` et pour les voix"replicated" ou"prebuilt".
Champs
Obligatoire. Octets audio bruts.
Obligatoire. Type MIME IANA des données audio (par exemple, "audio/wav" ou "audio/mpeg").
type VoiceType (facultatif)
Obligatoire. Type de voix. Dans `CreateVoice`, la valeur doit être `"replicated"` ou `"prompted"`. Dans les réponses `ListVoices`, la valeur peut également être `"prebuilt"`.
Valeurs possibles
-
replicatedVoix personnalisée répliquée à partir d'un échantillon audio de référence et d'un enregistrement du consentement du locuteur.
-
promptedVoix personnalisée générée à partir d'un prompt textuel en langage naturel.
-
prebuiltVoix système intégrée du catalogue de voix de Google (par exemple, `Puck`, `Charon`). Renvoyée dans les réponses. Ne peut pas être spécifiée comme type dans `CreateVoice`.
usage Usage (facultatif)
Uniquement en sortie. Statistiques d'utilisation des jetons pour la demande de création de voix. N'est renseigné que dans la réponse de `CreateVoice` lorsque `type` est défini sur "prompted". N'est pas défini pour "replicated" ni dans les réponses `GetVoice` et `ListVoices`.
Champs
cached_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons mis en cache par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
grounding_tool_count array (GroundingToolCount) (facultatif)
Nombre d'outils d'ancrage.
Champs
Nombre d'outils d'ancrage.
Type d'outil d'ancrage associé au nombre.
Valeurs possibles :
-
google_searchAncrage avec la recherche sur le Web Google et la recherche d'images, et ancrage Web pour les entreprises.
-
google_mapsAncrage avec Google Maps.
input_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons d'entrée par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
output_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons de sortie par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
tool_use_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons d'utilisation des outils par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
Nombre de jetons dans la partie mise en cache de la requête (le contenu mis en cache).
Nombre de jetons dans le prompt (contexte).
Nombre total de jetons dans toutes les réponses générées.
Nombre de jetons de pensées pour les modèles à raisonnement.
Nombre total de jetons pour la requête d'interaction (prompt + réponses + autres jetons internes).
Nombre de jetons présents dans le ou les prompts d'utilisation d'outils.
Exemple
Exemple de réponse
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Liste des voix personnalisées stockées appartenant à l'appelant (classées de la plus récente à la plus ancienne), suivie des voix système prédéfinies du catalogue de voix de Google.
Paramètres de chemin d'accès / de requête
Facultatif. Filtrez par description de l'accent (par exemple, "Américain", "Britannique"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des accents spécifiés sont mises en correspondance (OR).
Facultatif. Filtrez par contexte ou domaine prévu (par exemple, "Actualités, Commercial"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondent à l'un des contextes spécifiés (OR).
Facultatif. Filtrez par genre (par exemple, "féminin", "masculin" ou "neutre"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des genres spécifiés sont mises en correspondance (OR).
Facultatif. Filtrez par code de langue BCP-47 (par exemple, "en-US"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des codes de langue spécifiés sont mises en correspondance (OR).
Facultatif. Nombre maximal de voix à renvoyer par page. Le service peut renvoyer un nombre inférieur à cette valeur. Si aucune valeur n'est spécifiée, 50 voix au maximum sont renvoyées. La valeur maximale est 1 000. Les valeurs supérieures sont réduites à 1 000.
Facultatif. Jeton de page reçu d'un appel `ListVoices` précédent. Fournissez-le pour récupérer la page suivante. Lors de la pagination, tous les paramètres de requête de filtre (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, et `search`) doivent correspondre à l'appel qui a renvoyé ce jeton. Sinon, la requête échoue avec le code d'erreur `INVALID_ARGUMENT`. `page_size` peut changer d'une page à l'autre.
Facultatif. Filtrer par personnalité vocale (par exemple, "Chaleureux, amical"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondent à l'une des personnalités spécifiées (OR).
Facultatif. Filtrer par hauteur de voix. Accepte les valeurs "low", "medium", "high" ou "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (non sensibles à la casse). Si plusieurs valeurs sont spécifiées, les voix correspondent à l'une des tonalités spécifiées (OR).
Facultatif. Filtrez par code de région ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "001"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des codes régionaux spécifiés (OR) sont mises en correspondance.
Facultatif. Requête de recherche de sous-chaîne en texte libre, mise en correspondance sans tenir compte de la casse avec `display_name` et `description`. 2 048 octets maximum.
Facultatif. Filtrer par type de voix. Accepte "prebuilt", "replicated", "prompted", "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED" ou "VOICE_TYPE_PROMPTED" (non sensible à la casse). Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des types spécifiés sont mises en correspondance (OR).
Réponse
Si la requête aboutit, le corps de la réponse contient des données qui ont la structure suivante :
Jeton pouvant être envoyé en tant que "page_token" pour récupérer la page suivante. Si ce champ est vide, il n'y a pas d'autres pages.
Voix de la collection spécifiée.
Exemple
Exemple de réponse
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Récupère une voix stockée personnalisée (`store = true`) par nom de ressource. Les voix de catalogue prédéfinies (`VOICE_TYPE_PREBUILT`) ne peuvent pas être récupérées via `GetVoice`. Utilisez plutôt `ListVoices`.
Paramètres de chemin d'accès / de requête
Obligatoire. Nom de ressource de la voix stockée personnalisée à récupérer (par exemple, "voices/voice_abc123def456").
Réponse
Si la requête aboutit, le corps de la réponse contient des données qui ont la structure suivante :
Facultatif. Descripteur d'accent régional (par exemple, "américain", "britannique").
Facultatif. Contexte ou domaine d'utilisation optimal (par exemple, "Conversationnel", "Livre audio", "Actualités").
Facultatif. Résumé descriptif du timbre, de la personnalité et du ton de la voix.
Facultatif. Nom à afficher fourni par l'utilisateur pour une voix stockée (`store = true`), ou nom du catalogue pour une voix prédéfinie.
Uniquement en sortie. Code temporel d'expiration d'une voix stockée personnalisée (`store = true`) ou d'une clé vocale répliquée (`store = false`). Non défini pour les voix de catalogue prédéfinies ("prebuilt"), qui n'expirent pas.
Facultatif. Genre perçu de la voix (par exemple, "féminin", "masculin" ou "neutre").
Uniquement en sortie. Identifiant unique de la voix. * Pour les voix personnalisées gérées par Google (`store = true`), il s'agit d'un ID généré avec le préfixe `voice_` (par exemple, `voice_abc123def456`). Transmettez `voices/{id}` en tant que `name` dans `GetVoice` et `DeleteVoice`, et transmettez `{id}` directement à `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) lors de la synthèse vocale. * Pour les voix de catalogue prédéfinies (`"prebuilt"` renvoyé par `ListVoices`), il s'agit du nom du locuteur (par exemple, `Puck` ou `Charon`). * Non défini lorsque `CreateVoice` est appelé avec `store = false`.
Uniquement en sortie. Clé de réplication vocale gérée par le client (avec le préfixe "voicekey_"). Elle n'est renvoyée par "CreateVoice" que lorsque le paramètre "type" est défini sur "replicated" et que le paramètre "store" est défini sur "false". Transmettez cette clé à "SpeechConfig.voice_config.voice" (ou "SpeechConfig.voice") lors de la synthèse vocale.
Facultatif. Tag de langue BCP-47 principal (par exemple, "en-US" ou "fr-FR").
Facultatif. Modèle utilisé pour concevoir ou répliquer la voix. Si elle est omise dans `CreateVoice`, la valeur par défaut est le dernier modèle de conception vocale compatible. Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix personnalisées ("prompted" et"replicated"). Non défini pour les voix"prebuilt". Les voix créées peuvent être synthétisées dans n'importe quel modèle de synthèse vocale compatible.
Facultatif. Persona ou archétype de personnage souhaité (par exemple, "Chaleureux, amical" ou "Narrateur").
pitch Hauteur (facultatif)
Facultatif. Classification du ton de la voix.
Valeurs possibles
-
lowVoix plus grave
-
mediumVoix de hauteur moyenne.
-
highVoix plus aiguë.
prompted PromptedVoice (facultatif)
Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.
Champs
Obligatoire. Requête en langage naturel décrivant la voix souhaitée, par exemple : "Une voix masculine grave et tonitruante d'un ogre maléfique massif dans la force de l'âge."
Facultatif. Code de région géographique ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "GB" ou "001").
sample_audio AudioData (facultatif)
Uniquement en sortie. Exemple audio (audio de synthèse) généré pour une voix sollicitée. Renseigné uniquement dans les réponses `CreateVoice` et `GetVoice` lorsque `type` est défini sur"prompted". Non défini dans les réponses `ListVoices` et pour les voix"replicated" ou"prebuilt".
Champs
Obligatoire. Octets audio bruts.
Obligatoire. Type MIME IANA des données audio (par exemple, "audio/wav" ou "audio/mpeg").
type VoiceType (facultatif)
Obligatoire. Type de voix. Dans `CreateVoice`, la valeur doit être `"replicated"` ou `"prompted"`. Dans les réponses `ListVoices`, la valeur peut également être `"prebuilt"`.
Valeurs possibles
-
replicatedVoix personnalisée répliquée à partir d'un échantillon audio de référence et d'un enregistrement du consentement du locuteur.
-
promptedVoix personnalisée générée à partir d'un prompt textuel en langage naturel.
-
prebuiltVoix système intégrée du catalogue de voix de Google (par exemple, `Puck`, `Charon`). Renvoyée dans les réponses. Ne peut pas être spécifiée comme type dans `CreateVoice`.
usage Usage (facultatif)
Uniquement en sortie. Statistiques d'utilisation des jetons pour la demande de création de voix. N'est renseigné que dans la réponse de `CreateVoice` lorsque `type` est défini sur "prompted". N'est pas défini pour "replicated" ni dans les réponses `GetVoice` et `ListVoices`.
Champs
cached_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons mis en cache par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
grounding_tool_count array (GroundingToolCount) (facultatif)
Nombre d'outils d'ancrage.
Champs
Nombre d'outils d'ancrage.
Type d'outil d'ancrage associé au nombre.
Valeurs possibles :
-
google_searchAncrage avec la recherche sur le Web Google et la recherche d'images, et ancrage Web pour les entreprises.
-
google_mapsAncrage avec Google Maps.
input_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons d'entrée par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
output_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons de sortie par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
tool_use_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons d'utilisation des outils par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
Nombre de jetons dans la partie mise en cache de la requête (le contenu mis en cache).
Nombre de jetons dans le prompt (contexte).
Nombre total de jetons dans toutes les réponses générées.
Nombre de jetons de pensées pour les modèles à raisonnement.
Nombre total de jetons pour la requête d'interaction (prompt + réponses + autres jetons internes).
Nombre de jetons présents dans le ou les prompts d'utilisation d'outils.
Exemple
Exemple de réponse
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Supprime une voix stockée personnalisée ("store" défini sur "true") par nom de ressource. Les voix de catalogue prédéfinies (`VOICE_TYPE_PREBUILT`) ne peuvent pas être supprimées.
Paramètres de chemin d'accès / de requête
Obligatoire. Nom de ressource de la voix stockée personnalisée à supprimer (par exemple, `voices/voice_abc123def456`).
Réponse
Si l'opération réussit, la réponse est vide.
Exemple
Ressources
Voice
Ressource vocale représentant une voix personnalisée (créée via `CreateVoice`) ou une voix système prédéfinie (renvoyée par `ListVoices`).
Champs
Facultatif. Descripteur d'accent régional (par exemple, "américain", "britannique").
Facultatif. Contexte ou domaine d'utilisation optimal (par exemple, "Conversationnel", "Livre audio", "Actualités").
Facultatif. Résumé descriptif du timbre, de la personnalité et du ton de la voix.
Facultatif. Nom à afficher fourni par l'utilisateur pour une voix stockée (`store = true`), ou nom du catalogue pour une voix prédéfinie.
Uniquement en sortie. Code temporel d'expiration d'une voix stockée personnalisée (`store = true`) ou d'une clé vocale répliquée (`store = false`). Non défini pour les voix de catalogue prédéfinies ("prebuilt"), qui n'expirent pas.
Facultatif. Genre perçu de la voix (par exemple, "féminin", "masculin" ou "neutre").
Uniquement en sortie. Identifiant unique de la voix. * Pour les voix personnalisées gérées par Google (`store = true`), il s'agit d'un ID généré avec le préfixe `voice_` (par exemple, `voice_abc123def456`). Transmettez `voices/{id}` en tant que `name` dans `GetVoice` et `DeleteVoice`, et transmettez `{id}` directement à `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) lors de la synthèse vocale. * Pour les voix de catalogue prédéfinies (`"prebuilt"` renvoyé par `ListVoices`), il s'agit du nom du locuteur (par exemple, `Puck` ou `Charon`). * Non défini lorsque `CreateVoice` est appelé avec `store = false`.
Uniquement en sortie. Clé de réplication vocale gérée par le client (avec le préfixe "voicekey_"). Elle n'est renvoyée par "CreateVoice" que lorsque le paramètre "type" est défini sur "replicated" et que le paramètre "store" est défini sur "false". Transmettez cette clé à "SpeechConfig.voice_config.voice" (ou "SpeechConfig.voice") lors de la synthèse vocale.
Facultatif. Tag de langue BCP-47 principal (par exemple, "en-US" ou "fr-FR").
Facultatif. Modèle utilisé pour concevoir ou répliquer la voix. Si elle est omise dans `CreateVoice`, la valeur par défaut est le dernier modèle de conception vocale compatible. Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix personnalisées ("prompted" et"replicated"). Non défini pour les voix"prebuilt". Les voix créées peuvent être synthétisées dans n'importe quel modèle de synthèse vocale compatible.
Facultatif. Persona ou archétype de personnage souhaité (par exemple, "Chaleureux, amical" ou "Narrateur").
pitch Hauteur (facultatif)
Facultatif. Classification du ton de la voix.
Valeurs possibles
-
lowVoix plus grave
-
mediumVoix de hauteur moyenne.
-
highVoix plus aiguë.
prompted PromptedVoice (facultatif)
Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix incitées.
Champs
Obligatoire. Requête en langage naturel décrivant la voix souhaitée, par exemple : "Une voix masculine grave et tonitruante d'un ogre maléfique massif dans la force de l'âge."
Facultatif. Code de région géographique ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "GB" ou "001").
sample_audio AudioData (facultatif)
Uniquement en sortie. Exemple audio (audio de synthèse) généré pour une voix sollicitée. Renseigné uniquement dans les réponses `CreateVoice` et `GetVoice` lorsque `type` est défini sur"prompted". Non défini dans les réponses `ListVoices` et pour les voix"replicated" ou"prebuilt".
Champs
Obligatoire. Octets audio bruts.
Obligatoire. Type MIME IANA des données audio (par exemple, "audio/wav" ou "audio/mpeg").
type VoiceType (facultatif)
Obligatoire. Type de voix. Dans `CreateVoice`, doit être `"replicated"` ou `"prompted"`. Dans les réponses `ListVoices`, peut également être `"prebuilt"`.
Valeurs possibles
-
replicatedVoix personnalisée répliquée à partir d'un échantillon audio de référence et d'un enregistrement du consentement du locuteur.
-
promptedVoix personnalisée générée à partir d'un prompt textuel en langage naturel.
-
prebuiltVoix système intégrée du catalogue de voix de Google (par exemple, `Puck`, `Charon`). Renvoyée dans les réponses. Ne peut pas être spécifiée comme type dans `CreateVoice`.
usage Usage (facultatif)
Uniquement en sortie. Statistiques d'utilisation des jetons pour la demande de création de voix. N'est renseigné que dans la réponse de `CreateVoice` lorsque `type` est défini sur "prompted". N'est pas défini pour "replicated" ni dans les réponses `GetVoice` et `ListVoices`.
Champs
cached_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons mis en cache par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
grounding_tool_count array (GroundingToolCount) (facultatif)
Nombre d'outils d'ancrage.
Champs
Nombre d'outils d'ancrage.
Type d'outil d'ancrage associé au nombre.
Valeurs possibles :
-
google_searchAncrage avec la recherche sur le Web Google et la recherche d'images, et ancrage Web pour les entreprises.
-
google_mapsAncrage avec Google Maps.
input_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons d'entrée par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
output_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons de sortie par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
tool_use_tokens_by_modality array (ModalityTokens) (facultatif)
Répartition de l'utilisation des jetons d'utilisation des outils par modalité.
Champs
modality ResponseModality (facultatif)
Modalité associée au nombre de jetons.
Valeurs possibles
-
textIndique que le modèle doit renvoyer du texte.
-
imageIndique que le modèle doit renvoyer des images.
-
audioIndique que le modèle doit renvoyer de l'audio.
-
videoIndique que le modèle doit renvoyer une vidéo.
-
documentIndique que le modèle doit renvoyer des documents.
Nombre de jetons pour la modalité.
Nombre de jetons dans la partie mise en cache de la requête (le contenu mis en cache).
Nombre de jetons dans le prompt (contexte).
Nombre total de jetons dans toutes les réponses générées.
Nombre de jetons de pensées pour les modèles à raisonnement.
Nombre total de jetons pour la requête d'interaction (prompt + réponses + autres jetons internes).
Nombre de jetons présents dans le ou les prompts d'utilisation d'outils.