Gemini Voices API

La API de Voices te permite crear voces personalizadas a partir de instrucciones en lenguaje natural (diseño de voz) o de grabaciones de audio de referencia y consentimiento del orador (replicación de voz), así como enumerar, recuperar y administrar voces personalizadas y prediseñadas para la síntesis de Text-to-Speech (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Crea una voz personalizada a partir de una instrucción en lenguaje natural (`VOICE_TYPE_PROMPTED`) o de grabaciones de audio de referencia y consentimiento (`VOICE_TYPE_REPLICATED`).

Cuerpo de la solicitud

El cuerpo de la solicitud contiene datos con la siguiente estructura:

store booleano  (opcional)

Opcional. Indica si Google conserva y administra la voz creada. * Cuando es "true", Google almacena la voz y devuelve `Voice.id` (por ejemplo, `voice_abc123def456`), que se puede administrar a través de `GetVoice`, `ListVoices` y `DeleteVoice`, y al que se puede hacer referencia por ID en las solicitudes de síntesis. Los proyectos están sujetos a una cuota máxima de voces almacenadas activas. Si se supera la cuota, se devuelve `RESOURCE_EXHAUSTED`. * Cuando es "false" (valor predeterminado), Google no almacena la voz y se devuelve `Voice.key` (por ejemplo, `voicekey_...`) para el almacenamiento y la síntesis del cliente. Los campos de metadatos de descubrimiento opcionales en "voz" no se conservan ni se muestran cuando "almacén" es "falso". * Debe ser "verdadero" cuando "voice.type" es "prompted" (de lo contrario, se produce un error de "INVALID_ARGUMENT").

voz Voz  (obligatorio)

Obligatorio. La voz que se creará. `voice.model` es opcional. Si se omite, el servicio selecciona el modelo de creación de voz predeterminado. Los campos de solo salida en "Voice" ("id", "key", "expire_time", "usage") se ignoran si se configuran.

Respuesta

Si se ejecuta correctamente, el cuerpo de la respuesta contendrá datos con la siguiente estructura:

acento cadena  (opcional)

Opcional. Descriptor de acento regional (p.ej., "estadounidense", "británico").

context string  (opcional)

Opcional. Contexto o dominio de uso óptimo (p. ej., "Conversacional", "Audiolibro", "Noticias")

description cadena  (opcional)

Opcional. Resumen descriptivo del timbre, la personalidad y el tono de la voz.

display_name cadena  (opcional)

Opcional. Es el nombre visible proporcionado por el usuario para una voz almacenada (`store = true`) o el nombre del catálogo para una voz prediseñada.

expire_time cadena  (opcional)

Solo salida. Es la marca de tiempo en la que vence una voz personalizada almacenada (`store = true`) o una clave de voz replicada (`store = false`). No se establece para las voces de catálogo prediseñadas (`"prebuilt"`), que no vencen.

gender cadena  (opcional)

Opcional. Presentación del género de la voz percibida (p.ej., "femenina", "masculina", "neutra").

id cadena  (opcional)

Solo salida. Es el identificador único de la voz. * En el caso de las voces personalizadas administradas por Google (`store = true`), se trata de un ID generado con el prefijo `voice_` (por ejemplo, `voice_abc123def456`). Pasa `voices/{id}` como el `name` en `GetVoice` y `DeleteVoice`, y pasa `{id}` directamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la síntesis de voz. * Para las voces de catálogo prediseñadas (el valor "prebuilt" que devuelve `ListVoices`), este es el nombre del altavoz (por ejemplo, "Puck" o "Charon"). * No se establece cuando se llama a `CreateVoice` con `store = false`.

key cadena  (opcional)

Solo salida. Es la clave de replicación de voz administrada por el cliente (con el prefijo "voicekey_"). Solo la devuelve "CreateVoice" cuando "type" es "replicated" y "store" es "false". Pasa esta clave a "SpeechConfig.voice_config.voice" (o "SpeechConfig.voice") durante la síntesis de voz.

language_code cadena  (opcional)

Opcional. Es la etiqueta de idioma principal BCP-47 (p.ej., "en-US", "fr-FR").

modelo cadena  (opcional)

Opcional. Es el modelo que se usó para diseñar o replicar la voz. Si se omite en `CreateVoice`, se usa de forma predeterminada el modelo de diseño de voz compatible más reciente. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces personalizadas (`"prompted"` y `"replicated"`); no se establece para las voces `"prebuilt"`. Las voces creadas se pueden sintetizar en cualquier modelo de síntesis de TTS compatible.

persona cadena  (opcional)

Opcional. Arquetipo de personaje o arquetipo de persona previsto (p. ej., "Cálido y amigable", "Narrador")

pitch Pitch  (opcional)

Opcional. Clasificación del tono de voz.

Valores posibles

  • low

    Voz más grave

  • medium

    Voz de tono medio.

  • high

    Voz más aguda.

prompted PromptedVoice  (opcional)

Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces creadas a partir de instrucciones.

Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces basadas en instrucciones.

Campos

input string  (opcional)

Obligatorio. Es la instrucción en lenguaje natural que describe la voz deseada, p.ej., "Una voz masculina profunda y resonante de un ogro malvado y enorme en la mediana edad".

region_code cadena  (opcional)

Opcional. Código de región geográfica ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "GB", "001").

sample_audio AudioData  (opcional)

Solo salida. Es el audio de muestra (audio de la instrucción del sintetizador) que se genera para una voz solicitada. Solo se propaga en las respuestas de `CreateVoice` y `GetVoice` cuando `type` es"prompted"; no se establece en las respuestas de `ListVoices` ni para las voces"replicated" o"prebuilt".

Es la carga útil de audio que se usa para la creación de voz.

Campos

data cadena  (opcional)

Obligatorio. Son los bytes de audio sin procesar.

mime_type cadena  (opcional)

Obligatorio. Es el tipo de MIME de IANA de los datos de audio (por ejemplo, "audio/wav" o "audio/mpeg").

type VoiceType  (opcional)

Obligatorio. Es el tipo de voz. En `CreateVoice`, debe ser `"replicated"` o `"prompted"`. En las respuestas de `ListVoices`, también puede ser `"prebuilt"`.

Valores posibles

  • replicated

    Una voz personalizada replicada a partir de una muestra de audio de referencia y una grabación del consentimiento del orador.

  • prompted

    Una voz personalizada generada a partir de una instrucción de texto en lenguaje natural.

  • prebuilt

    Es una voz del sistema integrada del catálogo de voces de Google (p.ej., "Puck" o "Charon"). Se devuelve en las respuestas y no se puede especificar como el tipo en `CreateVoice`.

usage Usage  (opcional)

Solo salida. Son las estadísticas de uso de tokens para la solicitud de creación de voz. Solo se propaga en la respuesta de `CreateVoice` cuando `type` es `"prompted"`; no se establece para `"replicated"` ni en las respuestas de `GetVoice` y `ListVoices`.

Son estadísticas sobre el uso de tokens de la solicitud de interacción.

Campos

cached_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens almacenados en caché por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

grounding_tool_count array (GroundingToolCount)  (opcional)

Es el recuento de herramientas de fundamentación.

Es la cantidad de herramientas de fundamentación.

Campos

count integer  (opcional)

Es la cantidad de herramientas de fundamentación.

type enum (string)  (opcional)

Es el tipo de herramienta de fundamentación asociada con el recuento.

Valores posibles:

  • google_search

    Fundamentación con la Búsqueda web de Google y la Búsqueda con imágenes, y fundamentación web para empresas.

  • google_maps

    Fundamentación con Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de entrada por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

output_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de salida por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

tool_use_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de uso de herramientas por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

total_cached_tokens integer  (opcional)

Cantidad de tokens en la parte almacenada en caché de la instrucción (el contenido almacenado en caché).

total_input_tokens integer  (opcional)

Cantidad de tokens en la instrucción (contexto).

total_output_tokens integer  (opcional)

Es la cantidad total de tokens en todas las respuestas generadas.

total_thought_tokens integer  (opcional)

Es la cantidad de tokens de pensamientos para los modelos de pensamiento.

total_tokens integer  (opcional)

Es el recuento total de tokens para la solicitud de interacción (instrucción + respuestas + otros tokens internos).

total_tool_use_tokens integer  (opcional)

Cantidad de tokens presentes en las instrucciones de uso de herramientas.

Ejemplo

Ejemplo de respuesta

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Enumera las voces personalizadas almacenadas que pertenecen a la persona que llama (ordenadas de la más reciente a la más antigua) y, luego, las voces del sistema prediseñadas del catálogo de voces de Google.

Parámetros de ruta de acceso y de consulta

acento array (cadena)  (opcional)

Opcional. Filtra por descripción del acento (p.ej., "Americano", "Británico"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán coincidencias con voces que tengan cualquiera de los acentos especificados (OR).

context array (string)  (opcional)

Opcional. Filtra por contexto o dominio previsto (p.ej., "Noticias, Comercial"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán coincidencias con voces que tengan cualquiera de los contextos especificados (OR).

gender array (cadena)  (opcional)

Opcional. Filtra por presentación de género (p.ej., "femenino", "masculino", "neutro"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán coincidencias con voces de cualquiera de los géneros especificados (OR).

language_code array (cadena)  (opcional)

Opcional. Filtra por código de idioma BCP-47 (p.ej., "en-US"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se comparan las voces con cualquiera de los códigos de idioma especificados (OR).

page_size integer  (opcional)

Opcional. Es la cantidad máxima de voces que se devolverán por página. El servicio puede devolver menos que este valor. Si no se especifica, se devolverán, como máximo, 50 voces. El valor máximo es 1,000; los valores superiores a 1,000 se limitarán automáticamente a 1,000.

page_token cadena  (opcional)

Opcional. Es un token de página que se recibió de una llamada a `ListVoices` anterior. Proporciona este valor para recuperar la página siguiente. Cuando se realiza la paginación, todos los parámetros de consulta de filtro (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` y `search`) deben coincidir con la llamada que devolvió este token. De lo contrario, la solicitud fallará con el error `INVALID_ARGUMENT`. El parámetro `page_size` puede cambiar entre páginas.

persona array (cadena)  (opcional)

Opcional. Filtrar por arquetipo vocal (p. ej., "Cálido y amigable") Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán voces que coincidan con cualquiera de los arquetipos especificados (OR).

pitch array (string)  (opcional)

Opcional. Filtrar por tono vocal Acepta "low", "medium", "high" o "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (sin distinción entre mayúsculas y minúsculas). Si se especifican varios valores, se identifican las voces con cualquiera de los tonos especificados (OR).

region_code array (cadena)  (opcional)

Opcional. Filtra por código de región ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "001"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscan coincidencias con voces que tengan cualquiera de los códigos de región especificados (OR).

search cadena  (opcional)

Opcional. Es una consulta de búsqueda de subcadena de texto libre que coincide sin distinguir mayúsculas de minúsculas con `display_name` y `description`. El máximo es de 2,048 bytes.

type array (string)  (opcional)

Opcional. Filtrar por tipo de voz Acepta "prebuilt", "replicated", "prompted" o "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (sin distinción entre mayúsculas y minúsculas). Si se especifican varios valores, se buscarán voces con cualquiera de los tipos especificados (OR).

Respuesta

Si se ejecuta correctamente, el cuerpo de la respuesta contendrá datos con la siguiente estructura:

next_page_token cadena  (opcional)

Es un token que se puede enviar como `page_token` para recuperar la página siguiente. Si está vacío, no hay páginas siguientes.

voices array (Voice)  (opcional)

Voces de la colección especificada.

Ejemplo

Ejemplo de respuesta

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Obtiene una voz personalizada almacenada (`store = true`) por nombre de recurso. Las voces de catálogo prediseñadas (`VOICE_TYPE_PREBUILT`) no se pueden recuperar con `GetVoice`; en su lugar, usa `ListVoices`.

Parámetros de ruta de acceso y de consulta

voicesId cadena  (obligatorio)

Obligatorio. Nombre del recurso de la voz almacenada personalizada que se recuperará (por ejemplo, "voices/voice_abc123def456").

Respuesta

Si se ejecuta correctamente, el cuerpo de la respuesta contendrá datos con la siguiente estructura:

acento cadena  (opcional)

Opcional. Descriptor de acento regional (p.ej., "estadounidense", "británico").

context string  (opcional)

Opcional. Contexto o dominio de uso óptimo (p. ej., "Conversacional", "Audiolibro", "Noticias")

description cadena  (opcional)

Opcional. Resumen descriptivo del timbre, la personalidad y el tono de la voz.

display_name cadena  (opcional)

Opcional. Es el nombre visible proporcionado por el usuario para una voz almacenada (`store = true`) o el nombre del catálogo para una voz prediseñada.

expire_time cadena  (opcional)

Solo salida. Es la marca de tiempo en la que vence una voz personalizada almacenada (`store = true`) o una clave de voz replicada (`store = false`). No se establece para las voces de catálogo prediseñadas (`"prebuilt"`), que no vencen.

gender cadena  (opcional)

Opcional. Presentación del género de la voz percibida (p.ej., "femenina", "masculina", "neutra").

id cadena  (opcional)

Solo salida. Es el identificador único de la voz. * En el caso de las voces personalizadas administradas por Google (`store = true`), se trata de un ID generado con el prefijo `voice_` (por ejemplo, `voice_abc123def456`). Pasa `voices/{id}` como el `name` en `GetVoice` y `DeleteVoice`, y pasa `{id}` directamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la síntesis de voz. * Para las voces de catálogo prediseñadas (el valor "prebuilt" que devuelve `ListVoices`), este es el nombre del altavoz (por ejemplo, "Puck" o "Charon"). * No se establece cuando se llama a `CreateVoice` con `store = false`.

key cadena  (opcional)

Solo salida. Es la clave de replicación de voz administrada por el cliente (con el prefijo "voicekey_"). Solo la devuelve "CreateVoice" cuando "type" es "replicated" y "store" es "false". Pasa esta clave a "SpeechConfig.voice_config.voice" (o "SpeechConfig.voice") durante la síntesis de voz.

language_code cadena  (opcional)

Opcional. Es la etiqueta de idioma principal BCP-47 (p.ej., "en-US", "fr-FR").

modelo cadena  (opcional)

Opcional. Es el modelo que se usó para diseñar o replicar la voz. Si se omite en `CreateVoice`, se usa de forma predeterminada el modelo de diseño de voz compatible más reciente. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces personalizadas (`"prompted"` y `"replicated"`); no se establece para las voces `"prebuilt"`. Las voces creadas se pueden sintetizar en cualquier modelo de síntesis de TTS compatible.

persona cadena  (opcional)

Opcional. Arquetipo de personaje o arquetipo de persona previsto (p. ej., "Cálido y amigable", "Narrador")

pitch Pitch  (opcional)

Opcional. Clasificación del tono de voz.

Valores posibles

  • low

    Voz más grave

  • medium

    Voz de tono medio.

  • high

    Voz más aguda.

prompted PromptedVoice  (opcional)

Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces creadas a partir de instrucciones.

Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces basadas en instrucciones.

Campos

input string  (opcional)

Obligatorio. Es la instrucción en lenguaje natural que describe la voz deseada, p.ej., "Una voz masculina profunda y resonante de un ogro malvado y enorme en la mediana edad".

region_code cadena  (opcional)

Opcional. Código de región geográfica ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "GB", "001").

sample_audio AudioData  (opcional)

Solo salida. Es el audio de muestra (audio de la instrucción del sintetizador) que se genera para una voz solicitada. Solo se propaga en las respuestas de `CreateVoice` y `GetVoice` cuando `type` es"prompted"; no se establece en las respuestas de `ListVoices` ni para las voces"replicated" o"prebuilt".

Es la carga útil de audio que se usa para la creación de voz.

Campos

data cadena  (opcional)

Obligatorio. Son los bytes de audio sin procesar.

mime_type cadena  (opcional)

Obligatorio. Es el tipo de MIME de IANA de los datos de audio (por ejemplo, "audio/wav" o "audio/mpeg").

type VoiceType  (opcional)

Obligatorio. Es el tipo de voz. En `CreateVoice`, debe ser `"replicated"` o `"prompted"`. En las respuestas de `ListVoices`, también puede ser `"prebuilt"`.

Valores posibles

  • replicated

    Una voz personalizada replicada a partir de una muestra de audio de referencia y una grabación del consentimiento del orador.

  • prompted

    Una voz personalizada generada a partir de una instrucción de texto en lenguaje natural.

  • prebuilt

    Es una voz del sistema integrada del catálogo de voces de Google (p.ej., "Puck" o "Charon"). Se devuelve en las respuestas y no se puede especificar como el tipo en `CreateVoice`.

usage Usage  (opcional)

Solo salida. Son las estadísticas de uso de tokens para la solicitud de creación de voz. Solo se propaga en la respuesta de `CreateVoice` cuando `type` es `"prompted"`; no se establece para `"replicated"` ni en las respuestas de `GetVoice` y `ListVoices`.

Son estadísticas sobre el uso de tokens de la solicitud de interacción.

Campos

cached_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens almacenados en caché por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

grounding_tool_count array (GroundingToolCount)  (opcional)

Es el recuento de herramientas de fundamentación.

Es la cantidad de herramientas de fundamentación.

Campos

count integer  (opcional)

Es la cantidad de herramientas de fundamentación.

type enum (string)  (opcional)

Es el tipo de herramienta de fundamentación asociada con el recuento.

Valores posibles:

  • google_search

    Fundamentación con la Búsqueda web de Google y la Búsqueda con imágenes, y fundamentación web para empresas.

  • google_maps

    Fundamentación con Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de entrada por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

output_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de salida por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

tool_use_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de uso de herramientas por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

total_cached_tokens integer  (opcional)

Cantidad de tokens en la parte almacenada en caché de la instrucción (el contenido almacenado en caché).

total_input_tokens integer  (opcional)

Cantidad de tokens en la instrucción (contexto).

total_output_tokens integer  (opcional)

Es la cantidad total de tokens en todas las respuestas generadas.

total_thought_tokens integer  (opcional)

Es la cantidad de tokens de pensamientos para los modelos de pensamiento.

total_tokens integer  (opcional)

Es el recuento total de tokens para la solicitud de interacción (instrucción + respuestas + otros tokens internos).

total_tool_use_tokens integer  (opcional)

Cantidad de tokens presentes en las instrucciones de uso de herramientas.

Ejemplo

Ejemplo de respuesta

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Borra una voz almacenada personalizada (`store = true`) por nombre de recurso. No se pueden borrar las voces de catálogo prediseñadas (`VOICE_TYPE_PREBUILT`).

Parámetros de ruta de acceso y de consulta

voicesId cadena  (obligatorio)

Obligatorio. Nombre del recurso de la voz almacenada personalizada que se borrará (por ejemplo, `voices/voice_abc123def456`).

Respuesta

Si se ejecuta correctamente, la respuesta estará vacía.

Ejemplo

Recursos

Voz

Es un recurso de voz que representa una voz personalizada (creada a través de `CreateVoice`) o una voz del sistema prediseñada (devuelta por `ListVoices`).

Campos

acento cadena  (opcional)

Opcional. Descriptor de acento regional (p.ej., "estadounidense", "británico").

context string  (opcional)

Opcional. Contexto o dominio de uso óptimo (p. ej., "Conversacional", "Audiolibro", "Noticias")

description cadena  (opcional)

Opcional. Resumen descriptivo del timbre, la personalidad y el tono de la voz.

display_name cadena  (opcional)

Opcional. Es el nombre visible proporcionado por el usuario para una voz almacenada (`store = true`) o el nombre del catálogo para una voz prediseñada.

expire_time cadena  (opcional)

Solo salida. Es la marca de tiempo en la que vence una voz personalizada almacenada (`store = true`) o una clave de voz replicada (`store = false`). No se establece para las voces de catálogo prediseñadas (`"prebuilt"`), que no vencen.

gender cadena  (opcional)

Opcional. Presentación del género de la voz percibida (p.ej., "femenina", "masculina", "neutra").

id cadena  (opcional)

Solo salida. Es el identificador único de la voz. * En el caso de las voces personalizadas administradas por Google (`store = true`), se trata de un ID generado con el prefijo `voice_` (por ejemplo, `voice_abc123def456`). Pasa `voices/{id}` como el `name` en `GetVoice` y `DeleteVoice`, y pasa `{id}` directamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la síntesis de voz. * Para las voces de catálogo prediseñadas (el valor "prebuilt" que devuelve `ListVoices`), este es el nombre del altavoz (por ejemplo, "Puck" o "Charon"). * No se establece cuando se llama a `CreateVoice` con `store = false`.

key cadena  (opcional)

Solo salida. Es la clave de replicación de voz administrada por el cliente (con el prefijo "voicekey_"). Solo la devuelve "CreateVoice" cuando "type" es "replicated" y "store" es "false". Pasa esta clave a "SpeechConfig.voice_config.voice" (o "SpeechConfig.voice") durante la síntesis de voz.

language_code cadena  (opcional)

Opcional. Es la etiqueta de idioma principal BCP-47 (p.ej., "en-US", "fr-FR").

modelo cadena  (opcional)

Opcional. Es el modelo que se usó para diseñar o replicar la voz. Si se omite en `CreateVoice`, se usa de forma predeterminada el modelo de diseño de voz compatible más reciente. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces personalizadas (`"prompted"` y `"replicated"`); no se establece para las voces `"prebuilt"`. Las voces creadas se pueden sintetizar en cualquier modelo de síntesis de TTS compatible.

persona cadena  (opcional)

Opcional. Arquetipo de personaje o arquetipo de persona previsto (p. ej., "Cálido y amigable", "Narrador")

pitch Pitch  (opcional)

Opcional. Clasificación del tono de voz.

Valores posibles

  • low

    Voz más grave

  • medium

    Voz de tono medio.

  • high

    Voz más aguda.

prompted PromptedVoice  (opcional)

Son los parámetros para la generación de voz a partir de instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces creadas a partir de instrucciones.

Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces basadas en instrucciones.

Campos

input string  (opcional)

Obligatorio. Es la instrucción en lenguaje natural que describe la voz deseada, p.ej., "Una voz masculina profunda y resonante de un ogro malvado y enorme en la mediana edad".

region_code cadena  (opcional)

Opcional. Código de región geográfica ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "GB", "001").

sample_audio AudioData  (opcional)

Solo salida. Es el audio de muestra (audio de la instrucción del sintetizador) que se genera para una voz solicitada. Solo se propaga en las respuestas de `CreateVoice` y `GetVoice` cuando `type` es"prompted"; no se establece en las respuestas de `ListVoices` ni para las voces"replicated" o"prebuilt".

Es la carga útil de audio que se usa para la creación de voz.

Campos

data cadena  (opcional)

Obligatorio. Son los bytes de audio sin procesar.

mime_type cadena  (opcional)

Obligatorio. Es el tipo de MIME de IANA de los datos de audio (por ejemplo, "audio/wav" o "audio/mpeg").

type VoiceType  (opcional)

Obligatorio. Es el tipo de voz. En `CreateVoice`, debe ser `"replicated"` o `"prompted"`. En las respuestas de `ListVoices`, también puede ser `"prebuilt"`.

Valores posibles

  • replicated

    Una voz personalizada replicada a partir de una muestra de audio de referencia y una grabación del consentimiento del orador.

  • prompted

    Una voz personalizada generada a partir de una instrucción de texto en lenguaje natural.

  • prebuilt

    Es una voz del sistema integrada del catálogo de voces de Google (p.ej., "Puck", "Charon"). Se devuelve en las respuestas y no se puede especificar como el tipo en `CreateVoice`.

usage Usage  (opcional)

Solo salida. Son las estadísticas de uso de tokens para la solicitud de creación de voz. Solo se completa en la respuesta de `CreateVoice` cuando `type` es `"prompted"`; no se establece para `"replicated"` ni en las respuestas de `GetVoice` y `ListVoices`.

Son estadísticas sobre el uso de tokens de la solicitud de interacción.

Campos

cached_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens almacenados en caché por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

grounding_tool_count array (GroundingToolCount)  (opcional)

Es el recuento de herramientas de fundamentación.

Es la cantidad de herramientas de fundamentación.

Campos

count integer  (opcional)

Es la cantidad de herramientas de fundamentación.

type enum (string)  (opcional)

Es el tipo de herramienta de fundamentación asociada con el recuento.

Valores posibles:

  • google_search

    Fundamentación con la Búsqueda web de Google y la Búsqueda con imágenes, y fundamentación web para empresas.

  • google_maps

    Fundamentación con Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de entrada por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

output_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de salida por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

tool_use_tokens_by_modality array (ModalityTokens)  (opcional)

Es un desglose del uso de tokens de uso de herramientas por modalidad.

Es el recuento de tokens para una sola modalidad de respuesta.

Campos

modalidad ResponseModality  (opcional)

Es la modalidad asociada con el recuento de tokens.

Valores posibles

  • text

    Indica que el modelo debe devolver texto.

  • image

    Indica que el modelo debe devolver imágenes.

  • audio

    Indica que el modelo debe devolver audio.

  • video

    Indica que el modelo debe devolver videos.

  • document

    Indica que el modelo debe devolver documentos.

tokens integer  (opcional)

Cantidad de tokens para la modalidad.

total_cached_tokens integer  (opcional)

Cantidad de tokens en la parte almacenada en caché de la instrucción (el contenido almacenado en caché).

total_input_tokens integer  (opcional)

Cantidad de tokens en la instrucción (contexto).

total_output_tokens integer  (opcional)

Es la cantidad total de tokens en todas las respuestas generadas.

total_thought_tokens integer  (opcional)

Es la cantidad de tokens de pensamientos para los modelos de pensamiento.

total_tokens integer  (opcional)

Es el recuento total de tokens para la solicitud de interacción (instrucción + respuestas + otros tokens internos).

total_tool_use_tokens integer  (opcional)

Cantidad de tokens presentes en las instrucciones de uso de herramientas.