Gemini Voices API

L'API Voices consente di creare voci personalizzate da prompt in linguaggio naturale (progettazione vocale) o da audio di riferimento e registrazioni del consenso del relatore (replica vocale), nonché di elencare, recuperare e gestire voci personalizzate e predefinite per la sintesi vocale (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Crea una voce personalizzata da un prompt in linguaggio naturale (`VOICE_TYPE_PROMPTED`) o da registrazioni audio di riferimento e consenso (`VOICE_TYPE_REPLICATED`).

Corpo della richiesta

Il corpo della richiesta contiene dati con la seguente struttura:

store boolean  (facoltativo)

Facoltativo. Indica se la voce creata viene mantenuta e gestita da Google. * Se `true`, Google memorizza la voce e restituisce `Voice.id` (ad esempio, `voice_abc123def456`), che può essere gestita tramite `GetVoice`, `ListVoices` e `DeleteVoice` e a cui si fa riferimento per ID nelle richieste di sintesi. I progetti sono soggetti a una quota massima di voci attive memorizzate; il superamento della quota restituisce `RESOURCE_EXHAUSTED`. * Se `false` (impostazione predefinita), la voce non viene memorizzata da Google e viene restituita `Voice.key` (ad esempio, `voicekey_…`) per l'archiviazione e la sintesi lato client. I campi facoltativi dei metadati di rilevamento in "voice" non vengono memorizzati o restituiti quando "store" è "false". * Deve essere "true" quando "voice.type" è "prompted" (altrimenti l'operazione non va a buon fine e viene restituito l'errore "INVALID_ARGUMENT").

voice Voice  (obbligatorio)

Obbligatorio. La voce da creare. `voice.model` è facoltativo; se omesso, il servizio seleziona il modello di creazione della voce predefinito. I campi di sola output in "Voice" ("id", "key", "expire_time", "usage") vengono ignorati se impostati.

Risposta

In caso di esito positivo, il corpo della risposta contiene dati con la seguente struttura:

accent string  (facoltativo)

Facoltativo. Descrittore dell'accento regionale (ad es. "americano", "britannico").

context string  (facoltativo)

Facoltativo. Contesto o dominio di utilizzo ottimale (ad es. "Conversazionale", "Audiobook", "News").

description string  (facoltativo)

Facoltativo. Riepilogo descrittivo del timbro, della personalità e del tono della voce.

display_name string  (facoltativo)

Facoltativo. Nome visualizzato fornito dall'utente per una voce memorizzata (`store = true`) o il nome del catalogo per una voce predefinita.

expire_time string  (facoltativo)

Solo output. Il timestamp in cui scade una voce personalizzata memorizzata (`store = true`) o una chiave vocale replicata (`store = false`). Annulla l'impostazione per le voci del catalogo predefinite ("prebuilt"), che non scadono.

gender string  (facoltativo)

Facoltativo. Presentazione del genere della voce percepita (ad es. "femminile", "maschile", "neutrale").

id string  (facoltativo)

Solo output. L'identificatore univoco della voce. * Per le voci personalizzate gestite da Google (`store = true`), si tratta di un ID generato con il prefisso `voice_` (ad esempio, `voice_abc123def456`). Trasmetti `voices/{id}` come `name` in `GetVoice` e `DeleteVoice` e trasmetti `{id}` direttamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale. * Per le voci del catalogo predefinite (`"prebuilt"` restituito da `ListVoices`), questo è il nome dell'oratore (ad esempio, `Puck` o `Charon`). * Non impostato quando `CreateVoice` viene chiamato con `store = false`.

key string  (facoltativo)

Solo output. La chiave di replica della voce gestita dal cliente (con il prefisso `voicekey_`). Restituita solo da `CreateVoice` quando `type` è `"replicated"` e `store` è `false`. Passa questa chiave a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale.

language_code stringa  (facoltativo)

Facoltativo. Tag lingua BCP-47 principale (ad es. "en-US", "fr-FR").

model string  (facoltativo)

Facoltativo. Il modello utilizzato per progettare o replicare la voce. Se omesso in `CreateVoice`, il valore predefinito è l'ultimo modello di progettazione vocale supportato. Restituito nelle risposte di `CreateVoice`, `GetVoice` e `ListVoices` per le voci personalizzate (`"prompted"` e `"replicated"`); non impostato per le voci `"prebuilt"`. Le voci create possono essere sintetizzate in qualsiasi modello di sintesi vocale supportato.

persona stringa  (facoltativo)

Facoltativo. Personaggio o archetipo previsto (ad es. "Caldo, amichevole", "Narratore").

pitch Pitch  (facoltativo)

Facoltativo. Classificazione del tono della voce.

Valori possibili

  • low

    Voce più grave.

  • medium

    Voce con tonalità media.

  • high

    Voce più acuta.

prompted PromptedVoice  (facoltativo)

Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.

Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.

Campi

input string  (facoltativo)

Obbligatorio. Il prompt in linguaggio naturale che descrive la voce desiderata, ad esempio: "Una voce maschile profonda e fragorosa di un orco malvagio di mezza età".

region_code stringa  (facoltativo)

Facoltativo. Codice regione geografica ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "GB", "001").

sample_audio AudioData  (facoltativo)

Solo output. Audio campione (audio del prompt del sintetizzatore) generato per una voce richiesta. Compilato solo nelle risposte `CreateVoice` e `GetVoice` quando `type` è `"prompted"`; non impostato nelle risposte `ListVoices` e per le voci `"replicated"` o `"prebuilt"`.

Payload audio utilizzato per la creazione della voce.

Campi

data stringa  (facoltativo)

Obbligatorio. I byte audio non elaborati.

mime_type string  (facoltativo)

Obbligatorio. Il tipo MIME IANA dei dati audio (ad esempio, `audio/wav` o `audio/mpeg`).

type VoiceType  (facoltativo)

Obbligatorio. Il tipo di voce. In `CreateVoice`, deve essere `"replicated"` o `"prompted"`. Nelle risposte di `ListVoices`, può essere anche `"prebuilt"`.

Valori possibili

  • replicated

    Una voce personalizzata replicata da un campione audio di riferimento e dalla registrazione del consenso dell'oratore.

  • prompted

    Una voce personalizzata generata da un prompt testuale in linguaggio naturale.

  • prebuilt

    Una voce di sistema integrata dal catalogo di voci di Google (ad es. `Puck`, `Charon`). Restituita nelle risposte; non può essere specificata come tipo in `CreateVoice`.

usage Utilizzo  (facoltativo)

Solo output. Statistiche sull'utilizzo dei token per la richiesta di creazione della voce. Compilato solo nella risposta di `CreateVoice` quando `type` è `"prompted"`; non impostato per `"replicated"` e nelle risposte di `GetVoice` e `ListVoices`.

Statistiche sull'utilizzo dei token della richiesta di interazione.

Campi

cached_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token nella cache per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

grounding_tool_count array (GroundingToolCount)  (facoltativo)

Conteggio degli strumenti di grounding.

Il numero di conteggi dello strumento di messa a terra.

Campi

count integer  (facoltativo)

Il numero di conteggi dello strumento di messa a terra.

type enum (string)  (facoltativo)

Il tipo di strumento di base associato al conteggio.

Valori possibili:

  • google_search

    Grounding con la Ricerca Google e la Ricerca immagini e Grounding web per le aziende.

  • google_maps

    Grounding con Google Maps.

input_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di input per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

output_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di output per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

tool_use_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di utilizzo degli strumenti per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

total_cached_tokens integer  (facoltativo)

Numero di token nella parte memorizzata nella cache del prompt (i contenuti memorizzati nella cache).

total_input_tokens integer  (facoltativo)

Numero di token nel prompt (contesto).

total_output_tokens integer  (facoltativo)

Numero totale di token in tutte le risposte generate.

total_thought_tokens integer  (facoltativo)

Numero di token di pensieri per i modelli di pensiero.

total_tokens integer  (facoltativo)

Conteggio totale dei token per la richiesta di interazione (prompt + risposte + altri token interni).

total_tool_use_tokens integer  (facoltativo)

Numero di token presenti nei prompt di utilizzo degli strumenti.

Esempio

Esempio di risposta

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Elenca le voci personalizzate memorizzate di proprietà del chiamante (ordinate dalla più recente alla meno recente), seguite dalle voci di sistema predefinite del catalogo di voci di Google.

Parametri percorso / query

accent array (string)  (facoltativo)

Facoltativo. Filtra in base alla descrizione dell'accento (ad es. "americano", "britannico"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi degli accenti specificati (OR).

context array (string)  (facoltativo)

Facoltativo. Filtra in base al contesto o al dominio previsto (ad es. "Notizie, Commerciale"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei contesti specificati (OR).

gender array (string)  (facoltativo)

Facoltativo. Filtra in base alla presentazione del genere (ad es. "femminile", "maschile", "neutro"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei generi specificati (OR).

language_code array (string)  (facoltativo)

Facoltativo. Filtra per codice lingua BCP-47 (ad es. "en-US"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei codici di lingua specificati (OR).

page_size integer  (facoltativo)

Facoltativo. Il numero massimo di voci da restituire per pagina. Il servizio potrebbe restituire un numero inferiore a questo valore. Se non specificato, vengono restituite al massimo 50 voci. Il valore massimo è 1000; i valori superiori a 1000 vengono forzati a 1000.

page_token stringa  (facoltativo)

Facoltativo. Un token di pagina ricevuto da una precedente chiamata `ListVoices`. Fornisci questo valore per recuperare la pagina successiva. Durante la paginazione, tutti i parametri di query del filtro (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, e `search`) devono corrispondere alla chiamata che ha restituito questo token; in caso contrario, la richiesta non va a buon fine e viene restituito l'errore `INVALID_ARGUMENT`. `page_size` può variare tra le pagine.

persona array (string)  (facoltativo)

Facoltativo. Filtra per persona vocale (ad es. "Calda e amichevole"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a una qualsiasi delle personalità specificate (OR).

pitch array (string)  (facoltativo)

Facoltativo. Filtra per intonazione della voce. Accetta "low", "medium", "high" o "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (senza distinzione tra maiuscole e minuscole). Se vengono specificati più valori, vengono abbinate le voci con una qualsiasi delle intonazioni specificate (OR).

region_code array (string)  (facoltativo)

Facoltativo. Filtra per codice regione ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "001"). Corrispondenza esatta senza distinzione tra maiuscole e minuscole. Se vengono specificati più valori, le voci corrispondono a uno qualsiasi dei codici regione specificati (OR).

search string  (facoltativo)

Facoltativo. Query di ricerca di sottostringhe di testo libero con corrispondenza senza distinzione tra maiuscole e minuscole rispetto a `display_name` e `description`. Massimo 2048 byte.

type array (string)  (facoltativo)

Facoltativo. Filtra per tipo di voce. Accetta "prebuilt", "replicated", "prompted" o "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (senza distinzione tra maiuscole e minuscole). Se vengono specificati più valori, corrispondono alle voci con uno qualsiasi dei tipi specificati (OR).

Risposta

In caso di esito positivo, il corpo della risposta contiene dati con la seguente struttura:

next_page_token string  (facoltativo)

Un token che può essere inviato come `page_token` per recuperare la pagina successiva. Se è vuoto, non verranno visualizzate altre pagine.

voices array (Voice)  (facoltativo)

Le voci della raccolta specificata.

Esempio

Esempio di risposta

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Recupera una voce personalizzata memorizzata (`store = true`) in base al nome risorsa. Le voci del catalogo predefinite (`VOICE_TYPE_PREBUILT`) non possono essere recuperate tramite `GetVoice`; utilizza invece `ListVoices`.

Parametri di percorso / query

voicesId string  (obbligatorio)

Obbligatorio. Il nome della risorsa della voce personalizzata archiviata da recuperare (ad esempio, `voices/voice_abc123def456`).

Risposta

In caso di esito positivo, il corpo della risposta contiene dati con la seguente struttura:

accent string  (facoltativo)

Facoltativo. Descrittore dell'accento regionale (ad es. "americano", "britannico").

context string  (facoltativo)

Facoltativo. Contesto o dominio di utilizzo ottimale (ad es. "Conversazionale", "Audiobook", "News").

description string  (facoltativo)

Facoltativo. Riepilogo descrittivo del timbro, della personalità e del tono della voce.

display_name string  (facoltativo)

Facoltativo. Nome visualizzato fornito dall'utente per una voce memorizzata (`store = true`) o il nome del catalogo per una voce predefinita.

expire_time string  (facoltativo)

Solo output. Il timestamp in cui scade una voce personalizzata memorizzata (`store = true`) o una chiave vocale replicata (`store = false`). Annulla l'impostazione per le voci del catalogo predefinite ("prebuilt"), che non scadono.

gender string  (facoltativo)

Facoltativo. Presentazione del genere della voce percepita (ad es. "femminile", "maschile", "neutrale").

id string  (facoltativo)

Solo output. L'identificatore univoco della voce. * Per le voci personalizzate gestite da Google (`store = true`), si tratta di un ID generato con il prefisso `voice_` (ad esempio, `voice_abc123def456`). Trasmetti `voices/{id}` come `name` in `GetVoice` e `DeleteVoice` e trasmetti `{id}` direttamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale. * Per le voci del catalogo predefinite (`"prebuilt"` restituito da `ListVoices`), questo è il nome dell'oratore (ad esempio, `Puck` o `Charon`). * Non impostato quando `CreateVoice` viene chiamato con `store = false`.

key string  (facoltativo)

Solo output. La chiave di replica della voce gestita dal cliente (con il prefisso `voicekey_`). Restituita solo da `CreateVoice` quando `type` è `"replicated"` e `store` è `false`. Passa questa chiave a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale.

language_code stringa  (facoltativo)

Facoltativo. Tag lingua BCP-47 principale (ad es. "en-US", "fr-FR").

model string  (facoltativo)

Facoltativo. Il modello utilizzato per progettare o replicare la voce. Se omesso in `CreateVoice`, il valore predefinito è l'ultimo modello di progettazione vocale supportato. Restituito nelle risposte di `CreateVoice`, `GetVoice` e `ListVoices` per le voci personalizzate (`"prompted"` e `"replicated"`); non impostato per le voci `"prebuilt"`. Le voci create possono essere sintetizzate in qualsiasi modello di sintesi vocale supportato.

persona stringa  (facoltativo)

Facoltativo. Personaggio o archetipo previsto (ad es. "Caldo, amichevole", "Narratore").

pitch Pitch  (facoltativo)

Facoltativo. Classificazione del tono della voce.

Valori possibili

  • low

    Voce più grave.

  • medium

    Voce con tonalità media.

  • high

    Voce più acuta.

prompted PromptedVoice  (facoltativo)

Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.

Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.

Campi

input string  (facoltativo)

Obbligatorio. Il prompt in linguaggio naturale che descrive la voce desiderata, ad esempio: "Una voce maschile profonda e fragorosa di un orco malvagio di mezza età".

region_code stringa  (facoltativo)

Facoltativo. Codice regione geografica ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "GB", "001").

sample_audio AudioData  (facoltativo)

Solo output. Audio campione (audio del prompt del sintetizzatore) generato per una voce richiesta. Compilato solo nelle risposte `CreateVoice` e `GetVoice` quando `type` è `"prompted"`; non impostato nelle risposte `ListVoices` e per le voci `"replicated"` o `"prebuilt"`.

Payload audio utilizzato per la creazione della voce.

Campi

data stringa  (facoltativo)

Obbligatorio. I byte audio non elaborati.

mime_type string  (facoltativo)

Obbligatorio. Il tipo MIME IANA dei dati audio (ad esempio, `audio/wav` o `audio/mpeg`).

type VoiceType  (facoltativo)

Obbligatorio. Il tipo di voce. In `CreateVoice`, deve essere `"replicated"` o `"prompted"`. Nelle risposte di `ListVoices`, può essere anche `"prebuilt"`.

Valori possibili

  • replicated

    Una voce personalizzata replicata da un campione audio di riferimento e dalla registrazione del consenso dell'oratore.

  • prompted

    Una voce personalizzata generata da un prompt testuale in linguaggio naturale.

  • prebuilt

    Una voce di sistema integrata dal catalogo di voci di Google (ad es. `Puck`, `Charon`). Restituita nelle risposte; non può essere specificata come tipo in `CreateVoice`.

usage Utilizzo  (facoltativo)

Solo output. Statistiche sull'utilizzo dei token per la richiesta di creazione della voce. Compilato solo nella risposta di `CreateVoice` quando `type` è `"prompted"`; non impostato per `"replicated"` e nelle risposte di `GetVoice` e `ListVoices`.

Statistiche sull'utilizzo dei token della richiesta di interazione.

Campi

cached_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token nella cache per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

grounding_tool_count array (GroundingToolCount)  (facoltativo)

Conteggio degli strumenti di grounding.

Il numero di conteggi dello strumento di messa a terra.

Campi

count integer  (facoltativo)

Il numero di conteggi dello strumento di messa a terra.

type enum (string)  (facoltativo)

Il tipo di strumento di base associato al conteggio.

Valori possibili:

  • google_search

    Grounding con la Ricerca Google e la Ricerca immagini e Grounding web per le aziende.

  • google_maps

    Grounding con Google Maps.

input_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di input per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

output_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di output per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

tool_use_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di utilizzo degli strumenti per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

total_cached_tokens integer  (facoltativo)

Numero di token nella parte memorizzata nella cache del prompt (i contenuti memorizzati nella cache).

total_input_tokens integer  (facoltativo)

Numero di token nel prompt (contesto).

total_output_tokens integer  (facoltativo)

Numero totale di token in tutte le risposte generate.

total_thought_tokens integer  (facoltativo)

Numero di token di pensieri per i modelli di pensiero.

total_tokens integer  (facoltativo)

Conteggio totale dei token per la richiesta di interazione (prompt + risposte + altri token interni).

total_tool_use_tokens integer  (facoltativo)

Numero di token presenti nei prompt di utilizzo degli strumenti.

Esempio

Esempio di risposta

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Elimina una voce personalizzata memorizzata (`store = true`) in base al nome della risorsa. Le voci del catalogo predefinite (`VOICE_TYPE_PREBUILT`) non possono essere eliminate.

Parametri di percorso / query

voicesId string  (obbligatorio)

Obbligatorio. Il nome della risorsa della voce personalizzata memorizzata da eliminare (ad esempio, `voices/voice_abc123def456`).

Risposta

In caso di esito positivo, la risposta è vuota.

Esempio

Risorse

Voce

Una risorsa vocale che rappresenta una voce personalizzata (creata tramite `CreateVoice`) o una voce di sistema predefinita (restituita da `ListVoices`).

Campi

accent string  (facoltativo)

Facoltativo. Descrittore dell'accento regionale (ad es. "americano", "britannico").

context string  (facoltativo)

Facoltativo. Contesto o dominio di utilizzo ottimale (ad es. "Conversazionale", "Audiobook", "News").

description string  (facoltativo)

Facoltativo. Riepilogo descrittivo del timbro, della personalità e del tono della voce.

display_name string  (facoltativo)

Facoltativo. Nome visualizzato fornito dall'utente per una voce memorizzata (`store = true`) o il nome del catalogo per una voce predefinita.

expire_time string  (facoltativo)

Solo output. Il timestamp in cui scade una voce personalizzata memorizzata (`store = true`) o una chiave vocale replicata (`store = false`). Annulla l'impostazione per le voci del catalogo predefinite ("prebuilt"), che non scadono.

gender string  (facoltativo)

Facoltativo. Presentazione del genere della voce percepita (ad es. "femminile", "maschile", "neutrale").

id string  (facoltativo)

Solo output. L'identificatore univoco della voce. * Per le voci personalizzate gestite da Google (`store = true`), si tratta di un ID generato con il prefisso `voice_` (ad esempio, `voice_abc123def456`). Trasmetti `voices/{id}` come `name` in `GetVoice` e `DeleteVoice` e trasmetti `{id}` direttamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale. * Per le voci del catalogo predefinite (`"prebuilt"` restituito da `ListVoices`), questo è il nome dell'oratore (ad esempio, `Puck` o `Charon`). * Non impostato quando `CreateVoice` viene chiamato con `store = false`.

key string  (facoltativo)

Solo output. La chiave di replica della voce gestita dal cliente (con il prefisso `voicekey_`). Restituita solo da `CreateVoice` quando `type` è `"replicated"` e `store` è `false`. Passa questa chiave a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la sintesi vocale.

language_code stringa  (facoltativo)

Facoltativo. Tag lingua BCP-47 principale (ad es. "en-US", "fr-FR").

model string  (facoltativo)

Facoltativo. Il modello utilizzato per progettare o replicare la voce. Se omesso in `CreateVoice`, il valore predefinito è l'ultimo modello di progettazione vocale supportato. Restituito nelle risposte di `CreateVoice`, `GetVoice` e `ListVoices` per le voci personalizzate (`"prompted"` e `"replicated"`); non impostato per le voci `"prebuilt"`. Le voci create possono essere sintetizzate in qualsiasi modello di sintesi vocale supportato.

persona stringa  (facoltativo)

Facoltativo. Personaggio o archetipo previsto (ad es. "Caldo, amichevole", "Narratore").

pitch Pitch  (facoltativo)

Facoltativo. Classificazione del tono della voce.

Valori possibili

  • low

    Voce più grave.

  • medium

    Voce con tonalità media.

  • high

    Voce più acuta.

prompted PromptedVoice  (facoltativo)

Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.

Parametri per la generazione di voci richieste. Obbligatorio in `CreateVoice` quando `type` è `"prompted"`. Restituito nelle risposte `CreateVoice`, `GetVoice` e `ListVoices` per le voci richieste.

Campi

input string  (facoltativo)

Obbligatorio. Il prompt in linguaggio naturale che descrive la voce desiderata, ad esempio: "Una voce maschile profonda e fragorosa di un orco malvagio di mezza età".

region_code stringa  (facoltativo)

Facoltativo. Codice regione geografica ISO 3166-1 alpha-2 o UN M.49 (ad es. "US", "GB", "001").

sample_audio AudioData  (facoltativo)

Solo output. Audio campione (audio del prompt del sintetizzatore) generato per una voce richiesta. Compilato solo nelle risposte `CreateVoice` e `GetVoice` quando `type` è `"prompted"`; non impostato nelle risposte `ListVoices` e per le voci `"replicated"` o `"prebuilt"`.

Payload audio utilizzato per la creazione della voce.

Campi

data stringa  (facoltativo)

Obbligatorio. I byte audio non elaborati.

mime_type string  (facoltativo)

Obbligatorio. Il tipo MIME IANA dei dati audio (ad esempio, `audio/wav` o `audio/mpeg`).

type VoiceType  (facoltativo)

Obbligatorio. Il tipo di voce. In `CreateVoice`, deve essere `"replicated"` o `"prompted"`. Nelle risposte di `ListVoices`, può essere anche `"prebuilt"`.

Valori possibili

  • replicated

    Una voce personalizzata replicata da un campione audio di riferimento e dalla registrazione del consenso dell'oratore.

  • prompted

    Una voce personalizzata generata da un prompt testuale in linguaggio naturale.

  • prebuilt

    Una voce di sistema integrata dal catalogo di voci di Google (ad es. `Puck`, `Charon`). Restituita nelle risposte; non può essere specificata come tipo in `CreateVoice`.

utilizzo Utilizzo  (facoltativo)

Solo output. Statistiche sull'utilizzo dei token per la richiesta di creazione della voce. Compilato solo nella risposta di `CreateVoice` quando `type` è `"prompted"`; non impostato per `"replicated"` e nelle risposte di `GetVoice` e `ListVoices`.

Statistiche sull'utilizzo dei token della richiesta di interazione.

Campi

cached_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token nella cache per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

grounding_tool_count array (GroundingToolCount)  (facoltativo)

Conteggio degli strumenti di grounding.

Il numero di conteggi dello strumento di messa a terra.

Campi

count integer  (facoltativo)

Il numero di conteggi dello strumento di messa a terra.

type enum (string)  (facoltativo)

Il tipo di strumento di base associato al conteggio.

Valori possibili:

  • google_search

    Grounding con la Ricerca Google e la Ricerca immagini e Grounding web per le aziende.

  • google_maps

    Grounding con Google Maps.

input_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di input per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

output_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di output per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

tool_use_tokens_by_modality array (ModalityTokens)  (facoltativo)

Una suddivisione dell'utilizzo dei token di utilizzo degli strumenti per modalità.

Il conteggio dei token per una singola modalità di risposta.

Campi

modalità ResponseModality  (facoltativo)

La modalità associata al conteggio dei token.

Valori possibili

  • text

    Indica che il modello deve restituire testo.

  • image

    Indica che il modello deve restituire immagini.

  • audio

    Indica che il modello deve restituire l'audio.

  • video

    Indica che il modello deve restituire un video.

  • document

    Indica che il modello deve restituire documenti.

token integer  (facoltativo)

Numero di token per la modalità.

total_cached_tokens integer  (facoltativo)

Numero di token nella parte memorizzata nella cache del prompt (i contenuti memorizzati nella cache).

total_input_tokens integer  (facoltativo)

Numero di token nel prompt (contesto).

total_output_tokens integer  (facoltativo)

Numero totale di token in tutte le risposte generate.

total_thought_tokens integer  (facoltativo)

Numero di token di pensieri per i modelli di pensiero.

total_tokens integer  (facoltativo)

Conteggio totale dei token per la richiesta di interazione (prompt + risposte + altri token interni).

total_tool_use_tokens integer  (facoltativo)

Numero di token presenti nei prompt di utilizzo degli strumenti.