Gemini Voices API

L'API Voices vous permet de créer des voix personnalisées à partir de requêtes en langage naturel (conception de voix) ou à partir d'enregistrements audio de référence et d'enregistrements de consentement du locuteur (réplication de voix). Elle vous permet également de lister, de récupérer et de gérer les voix personnalisées et prédéfinies pour la synthèse vocale (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Crée une voix personnalisée à partir d'un prompt en langage naturel (`VOICE_TYPE_PROMPTED`) ou à partir d'enregistrements audio de référence et de consentement (`VOICE_TYPE_REPLICATED`).

Corps de la requête

Le corps de la requête contient des données présentant la structure suivante :

store boolean  (facultatif)

Facultatif. Indique si la voix créée est conservée et gérée par Google. * Lorsque la valeur est "true", Google stocke la voix et renvoie `Voice.id` (par exemple, `voice_abc123def456`), qui peut être gérée via `GetVoice`, `ListVoices` et `DeleteVoice`, et référencée par ID dans les requêtes de synthèse. Les projets sont soumis à un quota maximal de voix stockées actives. Si ce quota est dépassé, le code d'erreur `RESOURCE_EXHAUSTED` est renvoyé. * Si la valeur est définie sur `false` (par défaut), la voix n'est pas stockée par Google et `Voice.key` (par exemple, `voicekey_...`) est renvoyé pour le stockage et la synthèse côté client. Les champs de métadonnées de découverte facultatifs sur "voice" ne sont pas conservés ni renvoyés lorsque "store" est défini sur "false". * Doit être défini sur "true" lorsque "voice.type" est défini sur "prompted" (sinon, une erreur INVALID_ARGUMENT est renvoyée).

voice Voice  (required)

Obligatoire. Voix à créer. `voice.model` est facultatif. S'il est omis, le service sélectionne le modèle de création de voix par défaut. Les champs en sortie seule de "Voice" ("id", "key", "expire_time", "usage") sont ignorés s'ils sont définis.

Réponse

Si la requête aboutit, le corps de la réponse contient des données qui ont la structure suivante :

accent string  (facultatif)

Facultatif. Descripteur d'accent régional (par exemple, "américain", "britannique").

context string  (facultatif)

Facultatif. Contexte ou domaine d'utilisation optimal (par exemple, "Conversationnel", "Livre audio", "Actualités").

description string  (facultatif)

Facultatif. Résumé descriptif du timbre, de la personnalité et du ton de la voix.

display_name string  (facultatif)

Facultatif. Nom à afficher fourni par l'utilisateur pour une voix stockée (`store = true`), ou nom du catalogue pour une voix prédéfinie.

expire_time string  (facultatif)

Uniquement en sortie. Code temporel d'expiration d'une voix stockée personnalisée (`store = true`) ou d'une clé vocale répliquée (`store = false`). Non défini pour les voix de catalogue prédéfinies ("prebuilt"), qui n'expirent pas.

gender string  (facultatif)

Facultatif. Genre perçu de la voix (par exemple, "féminin", "masculin" ou "neutre").

id string  (facultatif)

Uniquement en sortie. Identifiant unique de la voix. * Pour les voix personnalisées gérées par Google (`store = true`), il s'agit d'un ID généré avec le préfixe `voice_` (par exemple, `voice_abc123def456`). Transmettez `voices/{id}` en tant que `name` dans `GetVoice` et `DeleteVoice`, et transmettez `{id}` directement à `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) lors de la synthèse vocale. * Pour les voix de catalogue prédéfinies (`"prebuilt"` renvoyé par `ListVoices`), il s'agit du nom du locuteur (par exemple, `Puck` ou `Charon`). * Non défini lorsque `CreateVoice` est appelé avec `store = false`.

key string  (facultatif)

Uniquement en sortie. Clé de réplication vocale gérée par le client (avec le préfixe "voicekey_"). Elle n'est renvoyée par "CreateVoice" que lorsque le paramètre "type" est défini sur "replicated" et que le paramètre "store" est défini sur "false". Transmettez cette clé à "SpeechConfig.voice_config.voice" (ou "SpeechConfig.voice") lors de la synthèse vocale.

language_code string  (facultatif)

Facultatif. Tag de langue BCP-47 principal (par exemple, "en-US" ou "fr-FR").

model string  (facultatif)

Facultatif. Modèle utilisé pour concevoir ou répliquer la voix. Si elle est omise dans `CreateVoice`, la valeur par défaut est le dernier modèle de conception vocale compatible. Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix personnalisées ("prompted" et"replicated"). Non défini pour les voix"prebuilt". Les voix créées peuvent être synthétisées dans n'importe quel modèle de synthèse vocale compatible.

persona string  (facultatif)

Facultatif. Persona ou archétype de personnage souhaité (par exemple, "Chaleureux, amical" ou "Narrateur").

pitch Hauteur  (facultatif)

Facultatif. Classification du ton de la voix.

Valeurs possibles

  • low

    Voix plus grave

  • medium

    Voix de hauteur moyenne.

  • high

    Voix plus aiguë.

prompted PromptedVoice  (facultatif)

Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.

Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.

Champs

input string  (facultatif)

Obligatoire. Requête en langage naturel décrivant la voix souhaitée, par exemple : "Une voix masculine grave et tonitruante d'un ogre maléfique massif dans la force de l'âge."

region_code string  (facultatif)

Facultatif. Code de région géographique ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "GB" ou "001").

sample_audio AudioData  (facultatif)

Uniquement en sortie. Exemple audio (audio de synthèse) généré pour une voix sollicitée. Renseigné uniquement dans les réponses `CreateVoice` et `GetVoice` lorsque `type` est défini sur"prompted". Non défini dans les réponses `ListVoices` et pour les voix"replicated" ou"prebuilt".

Charge utile audio utilisée pour la création de voix.

Champs

data string  (facultatif)

Obligatoire. Octets audio bruts.

mime_type string  (facultatif)

Obligatoire. Type MIME IANA des données audio (par exemple, "audio/wav" ou "audio/mpeg").

type VoiceType  (facultatif)

Obligatoire. Type de voix. Dans `CreateVoice`, la valeur doit être `"replicated"` ou `"prompted"`. Dans les réponses `ListVoices`, la valeur peut également être `"prebuilt"`.

Valeurs possibles

  • replicated

    Voix personnalisée répliquée à partir d'un échantillon audio de référence et d'un enregistrement du consentement du locuteur.

  • prompted

    Voix personnalisée générée à partir d'un prompt textuel en langage naturel.

  • prebuilt

    Voix système intégrée du catalogue de voix de Google (par exemple, `Puck`, `Charon`). Renvoyée dans les réponses. Ne peut pas être spécifiée comme type dans `CreateVoice`.

usage Usage  (facultatif)

Uniquement en sortie. Statistiques d'utilisation des jetons pour la demande de création de voix. N'est renseigné que dans la réponse de `CreateVoice` lorsque `type` est défini sur "prompted". N'est pas défini pour "replicated" ni dans les réponses `GetVoice` et `ListVoices`.

Statistiques sur l'utilisation des jetons de la demande d'interaction.

Champs

cached_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons mis en cache par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

grounding_tool_count array (GroundingToolCount)  (facultatif)

Nombre d'outils d'ancrage.

Nombre d'outils d'ancrage.

Champs

count integer  (facultatif)

Nombre d'outils d'ancrage.

type enum (string)  (facultatif)

Type d'outil d'ancrage associé au nombre.

Valeurs possibles :

  • google_search

    Ancrage avec la recherche sur le Web Google et la recherche d'images, et ancrage Web pour les entreprises.

  • google_maps

    Ancrage avec Google Maps.

input_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons d'entrée par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

output_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons de sortie par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

tool_use_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons d'utilisation des outils par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

total_cached_tokens integer  (optional)

Nombre de jetons dans la partie mise en cache de la requête (le contenu mis en cache).

total_input_tokens integer  (optional)

Nombre de jetons dans le prompt (contexte).

total_output_tokens integer  (optional)

Nombre total de jetons dans toutes les réponses générées.

total_thought_tokens integer  (optional)

Nombre de jetons de pensées pour les modèles à raisonnement.

total_tokens integer  (optional)

Nombre total de jetons pour la requête d'interaction (prompt + réponses + autres jetons internes).

total_tool_use_tokens integer  (optional)

Nombre de jetons présents dans le ou les prompts d'utilisation d'outils.

Exemple

Exemple de réponse

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Liste des voix personnalisées stockées appartenant à l'appelant (classées de la plus récente à la plus ancienne), suivie des voix système prédéfinies du catalogue de voix de Google.

Paramètres de chemin d'accès / de requête

accent array (string)  (facultatif)

Facultatif. Filtrez par description de l'accent (par exemple, "Américain", "Britannique"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des accents spécifiés sont mises en correspondance (OR).

context array (string)  (optional)

Facultatif. Filtrez par contexte ou domaine prévu (par exemple, "Actualités, Commercial"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondent à l'un des contextes spécifiés (OR).

gender array (string)  (optional)

Facultatif. Filtrez par genre (par exemple, "féminin", "masculin" ou "neutre"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des genres spécifiés sont mises en correspondance (OR).

language_code array (string)  (optional)

Facultatif. Filtrez par code de langue BCP-47 (par exemple, "en-US"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des codes de langue spécifiés sont mises en correspondance (OR).

page_size integer  (facultatif)

Facultatif. Nombre maximal de voix à renvoyer par page. Le service peut renvoyer un nombre inférieur à cette valeur. Si aucune valeur n'est spécifiée, 50 voix au maximum sont renvoyées. La valeur maximale est 1 000. Les valeurs supérieures sont réduites à 1 000.

page_token string  (facultatif)

Facultatif. Jeton de page reçu d'un appel `ListVoices` précédent. Fournissez-le pour récupérer la page suivante. Lors de la pagination, tous les paramètres de requête de filtre (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, et `search`) doivent correspondre à l'appel qui a renvoyé ce jeton. Sinon, la requête échoue avec le code d'erreur `INVALID_ARGUMENT`. `page_size` peut changer d'une page à l'autre.

persona array (string)  (facultatif)

Facultatif. Filtrer par personnalité vocale (par exemple, "Chaleureux, amical"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondent à l'une des personnalités spécifiées (OR).

pitch array (string)  (facultatif)

Facultatif. Filtrer par hauteur de voix. Accepte les valeurs "low", "medium", "high" ou "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (non sensibles à la casse). Si plusieurs valeurs sont spécifiées, les voix correspondent à l'une des tonalités spécifiées (OR).

region_code array (string)  (optional)

Facultatif. Filtrez par code de région ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "001"). Correspondance exacte non sensible à la casse. Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des codes régionaux spécifiés (OR) sont mises en correspondance.

search string  (facultatif)

Facultatif. Requête de recherche de sous-chaîne en texte libre, mise en correspondance sans tenir compte de la casse avec `display_name` et `description`. 2 048 octets maximum.

type array (string)  (facultatif)

Facultatif. Filtrer par type de voix. Accepte "prebuilt", "replicated", "prompted", "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED" ou "VOICE_TYPE_PROMPTED" (non sensible à la casse). Si plusieurs valeurs sont spécifiées, les voix correspondant à l'un des types spécifiés sont mises en correspondance (OR).

Réponse

Si la requête aboutit, le corps de la réponse contient des données qui ont la structure suivante :

next_page_token string  (facultatif)

Jeton pouvant être envoyé en tant que "page_token" pour récupérer la page suivante. Si ce champ est vide, il n'y a pas d'autres pages.

voices array (Voice)  (facultatif)

Voix de la collection spécifiée.

Exemple

Exemple de réponse

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Récupère une voix stockée personnalisée (`store = true`) par nom de ressource. Les voix de catalogue prédéfinies (`VOICE_TYPE_PREBUILT`) ne peuvent pas être récupérées via `GetVoice`. Utilisez plutôt `ListVoices`.

Paramètres de chemin d'accès / de requête

voicesId string  (obligatoire)

Obligatoire. Nom de ressource de la voix stockée personnalisée à récupérer (par exemple, "voices/voice_abc123def456").

Réponse

Si la requête aboutit, le corps de la réponse contient des données qui ont la structure suivante :

accent string  (facultatif)

Facultatif. Descripteur d'accent régional (par exemple, "américain", "britannique").

context string  (facultatif)

Facultatif. Contexte ou domaine d'utilisation optimal (par exemple, "Conversationnel", "Livre audio", "Actualités").

description string  (facultatif)

Facultatif. Résumé descriptif du timbre, de la personnalité et du ton de la voix.

display_name string  (facultatif)

Facultatif. Nom à afficher fourni par l'utilisateur pour une voix stockée (`store = true`), ou nom du catalogue pour une voix prédéfinie.

expire_time string  (facultatif)

Uniquement en sortie. Code temporel d'expiration d'une voix stockée personnalisée (`store = true`) ou d'une clé vocale répliquée (`store = false`). Non défini pour les voix de catalogue prédéfinies ("prebuilt"), qui n'expirent pas.

gender string  (facultatif)

Facultatif. Genre perçu de la voix (par exemple, "féminin", "masculin" ou "neutre").

id string  (facultatif)

Uniquement en sortie. Identifiant unique de la voix. * Pour les voix personnalisées gérées par Google (`store = true`), il s'agit d'un ID généré avec le préfixe `voice_` (par exemple, `voice_abc123def456`). Transmettez `voices/{id}` en tant que `name` dans `GetVoice` et `DeleteVoice`, et transmettez `{id}` directement à `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) lors de la synthèse vocale. * Pour les voix de catalogue prédéfinies (`"prebuilt"` renvoyé par `ListVoices`), il s'agit du nom du locuteur (par exemple, `Puck` ou `Charon`). * Non défini lorsque `CreateVoice` est appelé avec `store = false`.

key string  (facultatif)

Uniquement en sortie. Clé de réplication vocale gérée par le client (avec le préfixe "voicekey_"). Elle n'est renvoyée par "CreateVoice" que lorsque le paramètre "type" est défini sur "replicated" et que le paramètre "store" est défini sur "false". Transmettez cette clé à "SpeechConfig.voice_config.voice" (ou "SpeechConfig.voice") lors de la synthèse vocale.

language_code string  (facultatif)

Facultatif. Tag de langue BCP-47 principal (par exemple, "en-US" ou "fr-FR").

model string  (facultatif)

Facultatif. Modèle utilisé pour concevoir ou répliquer la voix. Si elle est omise dans `CreateVoice`, la valeur par défaut est le dernier modèle de conception vocale compatible. Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix personnalisées ("prompted" et"replicated"). Non défini pour les voix"prebuilt". Les voix créées peuvent être synthétisées dans n'importe quel modèle de synthèse vocale compatible.

persona string  (facultatif)

Facultatif. Persona ou archétype de personnage souhaité (par exemple, "Chaleureux, amical" ou "Narrateur").

pitch Hauteur  (facultatif)

Facultatif. Classification du ton de la voix.

Valeurs possibles

  • low

    Voix plus grave

  • medium

    Voix de hauteur moyenne.

  • high

    Voix plus aiguë.

prompted PromptedVoice  (facultatif)

Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.

Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.

Champs

input string  (facultatif)

Obligatoire. Requête en langage naturel décrivant la voix souhaitée, par exemple : "Une voix masculine grave et tonitruante d'un ogre maléfique massif dans la force de l'âge."

region_code string  (facultatif)

Facultatif. Code de région géographique ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "GB" ou "001").

sample_audio AudioData  (facultatif)

Uniquement en sortie. Exemple audio (audio de synthèse) généré pour une voix sollicitée. Renseigné uniquement dans les réponses `CreateVoice` et `GetVoice` lorsque `type` est défini sur"prompted". Non défini dans les réponses `ListVoices` et pour les voix"replicated" ou"prebuilt".

Charge utile audio utilisée pour la création de voix.

Champs

data string  (facultatif)

Obligatoire. Octets audio bruts.

mime_type string  (facultatif)

Obligatoire. Type MIME IANA des données audio (par exemple, "audio/wav" ou "audio/mpeg").

type VoiceType  (facultatif)

Obligatoire. Type de voix. Dans `CreateVoice`, la valeur doit être `"replicated"` ou `"prompted"`. Dans les réponses `ListVoices`, la valeur peut également être `"prebuilt"`.

Valeurs possibles

  • replicated

    Voix personnalisée répliquée à partir d'un échantillon audio de référence et d'un enregistrement du consentement du locuteur.

  • prompted

    Voix personnalisée générée à partir d'un prompt textuel en langage naturel.

  • prebuilt

    Voix système intégrée du catalogue de voix de Google (par exemple, `Puck`, `Charon`). Renvoyée dans les réponses. Ne peut pas être spécifiée comme type dans `CreateVoice`.

usage Usage  (facultatif)

Uniquement en sortie. Statistiques d'utilisation des jetons pour la demande de création de voix. N'est renseigné que dans la réponse de `CreateVoice` lorsque `type` est défini sur "prompted". N'est pas défini pour "replicated" ni dans les réponses `GetVoice` et `ListVoices`.

Statistiques sur l'utilisation des jetons de la demande d'interaction.

Champs

cached_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons mis en cache par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

grounding_tool_count array (GroundingToolCount)  (facultatif)

Nombre d'outils d'ancrage.

Nombre d'outils d'ancrage.

Champs

count integer  (facultatif)

Nombre d'outils d'ancrage.

type enum (string)  (facultatif)

Type d'outil d'ancrage associé au nombre.

Valeurs possibles :

  • google_search

    Ancrage avec la recherche sur le Web Google et la recherche d'images, et ancrage Web pour les entreprises.

  • google_maps

    Ancrage avec Google Maps.

input_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons d'entrée par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

output_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons de sortie par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

tool_use_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons d'utilisation des outils par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

total_cached_tokens integer  (optional)

Nombre de jetons dans la partie mise en cache de la requête (le contenu mis en cache).

total_input_tokens integer  (optional)

Nombre de jetons dans le prompt (contexte).

total_output_tokens integer  (optional)

Nombre total de jetons dans toutes les réponses générées.

total_thought_tokens integer  (optional)

Nombre de jetons de pensées pour les modèles à raisonnement.

total_tokens integer  (optional)

Nombre total de jetons pour la requête d'interaction (prompt + réponses + autres jetons internes).

total_tool_use_tokens integer  (optional)

Nombre de jetons présents dans le ou les prompts d'utilisation d'outils.

Exemple

Exemple de réponse

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Supprime une voix stockée personnalisée ("store" défini sur "true") par nom de ressource. Les voix de catalogue prédéfinies (`VOICE_TYPE_PREBUILT`) ne peuvent pas être supprimées.

Paramètres de chemin d'accès / de requête

voicesId string  (obligatoire)

Obligatoire. Nom de ressource de la voix stockée personnalisée à supprimer (par exemple, `voices/voice_abc123def456`).

Réponse

Si l'opération réussit, la réponse est vide.

Exemple

Ressources

Voice

Ressource vocale représentant une voix personnalisée (créée via `CreateVoice`) ou une voix système prédéfinie (renvoyée par `ListVoices`).

Champs

accent string  (facultatif)

Facultatif. Descripteur d'accent régional (par exemple, "américain", "britannique").

context string  (facultatif)

Facultatif. Contexte ou domaine d'utilisation optimal (par exemple, "Conversationnel", "Livre audio", "Actualités").

description string  (facultatif)

Facultatif. Résumé descriptif du timbre, de la personnalité et du ton de la voix.

display_name string  (facultatif)

Facultatif. Nom à afficher fourni par l'utilisateur pour une voix stockée (`store = true`), ou nom du catalogue pour une voix prédéfinie.

expire_time string  (facultatif)

Uniquement en sortie. Code temporel d'expiration d'une voix stockée personnalisée (`store = true`) ou d'une clé vocale répliquée (`store = false`). Non défini pour les voix de catalogue prédéfinies ("prebuilt"), qui n'expirent pas.

gender string  (facultatif)

Facultatif. Genre perçu de la voix (par exemple, "féminin", "masculin" ou "neutre").

id string  (facultatif)

Uniquement en sortie. Identifiant unique de la voix. * Pour les voix personnalisées gérées par Google (`store = true`), il s'agit d'un ID généré avec le préfixe `voice_` (par exemple, `voice_abc123def456`). Transmettez `voices/{id}` en tant que `name` dans `GetVoice` et `DeleteVoice`, et transmettez `{id}` directement à `SpeechConfig.voice_config.voice` (ou `SpeechConfig.voice`) lors de la synthèse vocale. * Pour les voix de catalogue prédéfinies (`"prebuilt"` renvoyé par `ListVoices`), il s'agit du nom du locuteur (par exemple, `Puck` ou `Charon`). * Non défini lorsque `CreateVoice` est appelé avec `store = false`.

key string  (facultatif)

Uniquement en sortie. Clé de réplication vocale gérée par le client (avec le préfixe "voicekey_"). Elle n'est renvoyée par "CreateVoice" que lorsque le paramètre "type" est défini sur "replicated" et que le paramètre "store" est défini sur "false". Transmettez cette clé à "SpeechConfig.voice_config.voice" (ou "SpeechConfig.voice") lors de la synthèse vocale.

language_code string  (facultatif)

Facultatif. Tag de langue BCP-47 principal (par exemple, "en-US" ou "fr-FR").

model string  (facultatif)

Facultatif. Modèle utilisé pour concevoir ou répliquer la voix. Si elle est omise dans `CreateVoice`, la valeur par défaut est le dernier modèle de conception vocale compatible. Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix personnalisées ("prompted" et"replicated"). Non défini pour les voix"prebuilt". Les voix créées peuvent être synthétisées dans n'importe quel modèle de synthèse vocale compatible.

persona string  (facultatif)

Facultatif. Persona ou archétype de personnage souhaité (par exemple, "Chaleureux, amical" ou "Narrateur").

pitch Hauteur  (facultatif)

Facultatif. Classification du ton de la voix.

Valeurs possibles

  • low

    Voix plus grave

  • medium

    Voix de hauteur moyenne.

  • high

    Voix plus aiguë.

prompted PromptedVoice  (facultatif)

Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoie les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix incitées.

Paramètres pour la génération de voix à partir d'une invite. Obligatoire dans `CreateVoice` lorsque `type` est défini sur"prompted". Renvoyé dans les réponses `CreateVoice`, `GetVoice` et `ListVoices` pour les voix sollicitées.

Champs

input string  (facultatif)

Obligatoire. Requête en langage naturel décrivant la voix souhaitée, par exemple : "Une voix masculine grave et tonitruante d'un ogre maléfique massif dans la force de l'âge."

region_code string  (facultatif)

Facultatif. Code de région géographique ISO 3166-1 alpha-2 ou UN M.49 (par exemple, "US", "GB" ou "001").

sample_audio AudioData  (facultatif)

Uniquement en sortie. Exemple audio (audio de synthèse) généré pour une voix sollicitée. Renseigné uniquement dans les réponses `CreateVoice` et `GetVoice` lorsque `type` est défini sur"prompted". Non défini dans les réponses `ListVoices` et pour les voix"replicated" ou"prebuilt".

Charge utile audio utilisée pour la création de voix.

Champs

data string  (facultatif)

Obligatoire. Octets audio bruts.

mime_type string  (facultatif)

Obligatoire. Type MIME IANA des données audio (par exemple, "audio/wav" ou "audio/mpeg").

type VoiceType  (facultatif)

Obligatoire. Type de voix. Dans `CreateVoice`, doit être `"replicated"` ou `"prompted"`. Dans les réponses `ListVoices`, peut également être `"prebuilt"`.

Valeurs possibles

  • replicated

    Voix personnalisée répliquée à partir d'un échantillon audio de référence et d'un enregistrement du consentement du locuteur.

  • prompted

    Voix personnalisée générée à partir d'un prompt textuel en langage naturel.

  • prebuilt

    Voix système intégrée du catalogue de voix de Google (par exemple, `Puck`, `Charon`). Renvoyée dans les réponses. Ne peut pas être spécifiée comme type dans `CreateVoice`.

usage Usage  (facultatif)

Uniquement en sortie. Statistiques d'utilisation des jetons pour la demande de création de voix. N'est renseigné que dans la réponse de `CreateVoice` lorsque `type` est défini sur "prompted". N'est pas défini pour "replicated" ni dans les réponses `GetVoice` et `ListVoices`.

Statistiques sur l'utilisation des jetons de la demande d'interaction.

Champs

cached_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons mis en cache par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

grounding_tool_count array (GroundingToolCount)  (facultatif)

Nombre d'outils d'ancrage.

Nombre d'outils d'ancrage.

Champs

count integer  (facultatif)

Nombre d'outils d'ancrage.

type enum (string)  (facultatif)

Type d'outil d'ancrage associé au nombre.

Valeurs possibles :

  • google_search

    Ancrage avec la recherche sur le Web Google et la recherche d'images, et ancrage Web pour les entreprises.

  • google_maps

    Ancrage avec Google Maps.

input_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons d'entrée par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

output_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons de sortie par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

tool_use_tokens_by_modality array (ModalityTokens)  (facultatif)

Répartition de l'utilisation des jetons d'utilisation des outils par modalité.

Nombre de jetons pour une seule modalité de réponse.

Champs

modality ResponseModality  (facultatif)

Modalité associée au nombre de jetons.

Valeurs possibles

  • text

    Indique que le modèle doit renvoyer du texte.

  • image

    Indique que le modèle doit renvoyer des images.

  • audio

    Indique que le modèle doit renvoyer de l'audio.

  • video

    Indique que le modèle doit renvoyer une vidéo.

  • document

    Indique que le modèle doit renvoyer des documents.

tokens integer  (facultatif)

Nombre de jetons pour la modalité.

total_cached_tokens integer  (optional)

Nombre de jetons dans la partie mise en cache de la requête (le contenu mis en cache).

total_input_tokens integer  (optional)

Nombre de jetons dans le prompt (contexte).

total_output_tokens integer  (optional)

Nombre total de jetons dans toutes les réponses générées.

total_thought_tokens integer  (optional)

Nombre de jetons de pensées pour les modèles à raisonnement.

total_tokens integer  (optional)

Nombre total de jetons pour la requête d'interaction (prompt + réponses + autres jetons internes).

total_tool_use_tokens integer  (optional)

Nombre de jetons présents dans le ou les prompts d'utilisation d'outils.