La API de Voices te permite crear voces personalizadas a partir de instrucciones en lenguaje natural (diseño de voz) o de grabaciones de audio de referencia y consentimiento del orador (replicación de voz), así como enumerar, recuperar y administrar voces personalizadas y prediseñadas para la síntesis de Text-to-Speech (TTS).
CreateVoice
Crea una voz personalizada a partir de una instrucción en lenguaje natural (`VOICE_TYPE_PROMPTED`) o de grabaciones de audio de referencia y consentimiento (`VOICE_TYPE_REPLICATED`).
Cuerpo de la solicitud
El cuerpo de la solicitud contiene datos con la siguiente estructura:
Opcional. Indica si Google conserva y administra la voz creada. * Cuando es "true", Google almacena la voz y devuelve `Voice.id` (por ejemplo, `voice_abc123def456`), que se puede administrar a través de `GetVoice`, `ListVoices` y `DeleteVoice`, y al que se puede hacer referencia por ID en las solicitudes de síntesis. Los proyectos están sujetos a una cuota máxima de voces almacenadas activas. Si se supera la cuota, se devuelve `RESOURCE_EXHAUSTED`. * Cuando es "false" (valor predeterminado), Google no almacena la voz y se devuelve `Voice.key` (por ejemplo, `voicekey_...`) para el almacenamiento y la síntesis del cliente. Los campos de metadatos de descubrimiento opcionales en "voz" no se conservan ni se muestran cuando "almacén" es "falso". * Debe ser "verdadero" cuando "voice.type" es "prompted" (de lo contrario, se produce un error de "INVALID_ARGUMENT").
Obligatorio. La voz que se creará. `voice.model` es opcional. Si se omite, el servicio selecciona el modelo de creación de voz predeterminado. Los campos de solo salida en "Voice" ("id", "key", "expire_time", "usage") se ignoran si se configuran.
Respuesta
Si se ejecuta correctamente, el cuerpo de la respuesta contendrá datos con la siguiente estructura:
Opcional. Descriptor de acento regional (p.ej., "estadounidense", "británico").
Opcional. Contexto o dominio de uso óptimo (p. ej., "Conversacional", "Audiolibro", "Noticias")
Opcional. Resumen descriptivo del timbre, la personalidad y el tono de la voz.
Opcional. Es el nombre visible proporcionado por el usuario para una voz almacenada (`store = true`) o el nombre del catálogo para una voz prediseñada.
Solo salida. Es la marca de tiempo en la que vence una voz personalizada almacenada (`store = true`) o una clave de voz replicada (`store = false`). No se establece para las voces de catálogo prediseñadas (`"prebuilt"`), que no vencen.
Opcional. Presentación del género de la voz percibida (p.ej., "femenina", "masculina", "neutra").
Solo salida. Es el identificador único de la voz. * En el caso de las voces personalizadas administradas por Google (`store = true`), se trata de un ID generado con el prefijo `voice_` (por ejemplo, `voice_abc123def456`). Pasa `voices/{id}` como el `name` en `GetVoice` y `DeleteVoice`, y pasa `{id}` directamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la síntesis de voz. * Para las voces de catálogo prediseñadas (el valor "prebuilt" que devuelve `ListVoices`), este es el nombre del altavoz (por ejemplo, "Puck" o "Charon"). * No se establece cuando se llama a `CreateVoice` con `store = false`.
Solo salida. Es la clave de replicación de voz administrada por el cliente (con el prefijo "voicekey_"). Solo la devuelve "CreateVoice" cuando "type" es "replicated" y "store" es "false". Pasa esta clave a "SpeechConfig.voice_config.voice" (o "SpeechConfig.voice") durante la síntesis de voz.
Opcional. Es la etiqueta de idioma principal BCP-47 (p.ej., "en-US", "fr-FR").
Opcional. Es el modelo que se usó para diseñar o replicar la voz. Si se omite en `CreateVoice`, se usa de forma predeterminada el modelo de diseño de voz compatible más reciente. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces personalizadas (`"prompted"` y `"replicated"`); no se establece para las voces `"prebuilt"`. Las voces creadas se pueden sintetizar en cualquier modelo de síntesis de TTS compatible.
Opcional. Arquetipo de personaje o arquetipo de persona previsto (p. ej., "Cálido y amigable", "Narrador")
pitch Pitch (opcional)
Opcional. Clasificación del tono de voz.
Valores posibles
-
lowVoz más grave
-
mediumVoz de tono medio.
-
highVoz más aguda.
prompted PromptedVoice (opcional)
Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces creadas a partir de instrucciones.
Campos
Obligatorio. Es la instrucción en lenguaje natural que describe la voz deseada, p.ej., "Una voz masculina profunda y resonante de un ogro malvado y enorme en la mediana edad".
Opcional. Código de región geográfica ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "GB", "001").
sample_audio AudioData (opcional)
Solo salida. Es el audio de muestra (audio de la instrucción del sintetizador) que se genera para una voz solicitada. Solo se propaga en las respuestas de `CreateVoice` y `GetVoice` cuando `type` es"prompted"; no se establece en las respuestas de `ListVoices` ni para las voces"replicated" o"prebuilt".
Campos
Obligatorio. Son los bytes de audio sin procesar.
Obligatorio. Es el tipo de MIME de IANA de los datos de audio (por ejemplo, "audio/wav" o "audio/mpeg").
type VoiceType (opcional)
Obligatorio. Es el tipo de voz. En `CreateVoice`, debe ser `"replicated"` o `"prompted"`. En las respuestas de `ListVoices`, también puede ser `"prebuilt"`.
Valores posibles
-
replicatedUna voz personalizada replicada a partir de una muestra de audio de referencia y una grabación del consentimiento del orador.
-
promptedUna voz personalizada generada a partir de una instrucción de texto en lenguaje natural.
-
prebuiltEs una voz del sistema integrada del catálogo de voces de Google (p.ej., "Puck" o "Charon"). Se devuelve en las respuestas y no se puede especificar como el tipo en `CreateVoice`.
usage Usage (opcional)
Solo salida. Son las estadísticas de uso de tokens para la solicitud de creación de voz. Solo se propaga en la respuesta de `CreateVoice` cuando `type` es `"prompted"`; no se establece para `"replicated"` ni en las respuestas de `GetVoice` y `ListVoices`.
Campos
cached_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens almacenados en caché por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
grounding_tool_count array (GroundingToolCount) (opcional)
Es el recuento de herramientas de fundamentación.
Campos
Es la cantidad de herramientas de fundamentación.
Es el tipo de herramienta de fundamentación asociada con el recuento.
Valores posibles:
-
google_searchFundamentación con la Búsqueda web de Google y la Búsqueda con imágenes, y fundamentación web para empresas.
-
google_mapsFundamentación con Google Maps.
input_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de entrada por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
output_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de salida por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
tool_use_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de uso de herramientas por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
Cantidad de tokens en la parte almacenada en caché de la instrucción (el contenido almacenado en caché).
Cantidad de tokens en la instrucción (contexto).
Es la cantidad total de tokens en todas las respuestas generadas.
Es la cantidad de tokens de pensamientos para los modelos de pensamiento.
Es el recuento total de tokens para la solicitud de interacción (instrucción + respuestas + otros tokens internos).
Cantidad de tokens presentes en las instrucciones de uso de herramientas.
Ejemplo
Ejemplo de respuesta
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Enumera las voces personalizadas almacenadas que pertenecen a la persona que llama (ordenadas de la más reciente a la más antigua) y, luego, las voces del sistema prediseñadas del catálogo de voces de Google.
Parámetros de ruta de acceso y de consulta
Opcional. Filtra por descripción del acento (p.ej., "Americano", "Británico"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán coincidencias con voces que tengan cualquiera de los acentos especificados (OR).
Opcional. Filtra por contexto o dominio previsto (p.ej., "Noticias, Comercial"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán coincidencias con voces que tengan cualquiera de los contextos especificados (OR).
Opcional. Filtra por presentación de género (p.ej., "femenino", "masculino", "neutro"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán coincidencias con voces de cualquiera de los géneros especificados (OR).
Opcional. Filtra por código de idioma BCP-47 (p.ej., "en-US"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se comparan las voces con cualquiera de los códigos de idioma especificados (OR).
Opcional. Es la cantidad máxima de voces que se devolverán por página. El servicio puede devolver menos que este valor. Si no se especifica, se devolverán, como máximo, 50 voces. El valor máximo es 1,000; los valores superiores a 1,000 se limitarán automáticamente a 1,000.
Opcional. Es un token de página que se recibió de una llamada a `ListVoices` anterior. Proporciona este valor para recuperar la página siguiente. Cuando se realiza la paginación, todos los parámetros de consulta de filtro (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` y `search`) deben coincidir con la llamada que devolvió este token. De lo contrario, la solicitud fallará con el error `INVALID_ARGUMENT`. El parámetro `page_size` puede cambiar entre páginas.
Opcional. Filtrar por arquetipo vocal (p. ej., "Cálido y amigable") Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscarán voces que coincidan con cualquiera de los arquetipos especificados (OR).
Opcional. Filtrar por tono vocal Acepta "low", "medium", "high" o "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (sin distinción entre mayúsculas y minúsculas). Si se especifican varios valores, se identifican las voces con cualquiera de los tonos especificados (OR).
Opcional. Filtra por código de región ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "001"). Es una concordancia exacta que no distingue mayúsculas de minúsculas. Si se especifican varios valores, se buscan coincidencias con voces que tengan cualquiera de los códigos de región especificados (OR).
Opcional. Es una consulta de búsqueda de subcadena de texto libre que coincide sin distinguir mayúsculas de minúsculas con `display_name` y `description`. El máximo es de 2,048 bytes.
Opcional. Filtrar por tipo de voz Acepta "prebuilt", "replicated", "prompted" o "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (sin distinción entre mayúsculas y minúsculas). Si se especifican varios valores, se buscarán voces con cualquiera de los tipos especificados (OR).
Respuesta
Si se ejecuta correctamente, el cuerpo de la respuesta contendrá datos con la siguiente estructura:
Es un token que se puede enviar como `page_token` para recuperar la página siguiente. Si está vacío, no hay páginas siguientes.
Voces de la colección especificada.
Ejemplo
Ejemplo de respuesta
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Obtiene una voz personalizada almacenada (`store = true`) por nombre de recurso. Las voces de catálogo prediseñadas (`VOICE_TYPE_PREBUILT`) no se pueden recuperar con `GetVoice`; en su lugar, usa `ListVoices`.
Parámetros de ruta de acceso y de consulta
Obligatorio. Nombre del recurso de la voz almacenada personalizada que se recuperará (por ejemplo, "voices/voice_abc123def456").
Respuesta
Si se ejecuta correctamente, el cuerpo de la respuesta contendrá datos con la siguiente estructura:
Opcional. Descriptor de acento regional (p.ej., "estadounidense", "británico").
Opcional. Contexto o dominio de uso óptimo (p. ej., "Conversacional", "Audiolibro", "Noticias")
Opcional. Resumen descriptivo del timbre, la personalidad y el tono de la voz.
Opcional. Es el nombre visible proporcionado por el usuario para una voz almacenada (`store = true`) o el nombre del catálogo para una voz prediseñada.
Solo salida. Es la marca de tiempo en la que vence una voz personalizada almacenada (`store = true`) o una clave de voz replicada (`store = false`). No se establece para las voces de catálogo prediseñadas (`"prebuilt"`), que no vencen.
Opcional. Presentación del género de la voz percibida (p.ej., "femenina", "masculina", "neutra").
Solo salida. Es el identificador único de la voz. * En el caso de las voces personalizadas administradas por Google (`store = true`), se trata de un ID generado con el prefijo `voice_` (por ejemplo, `voice_abc123def456`). Pasa `voices/{id}` como el `name` en `GetVoice` y `DeleteVoice`, y pasa `{id}` directamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la síntesis de voz. * Para las voces de catálogo prediseñadas (el valor "prebuilt" que devuelve `ListVoices`), este es el nombre del altavoz (por ejemplo, "Puck" o "Charon"). * No se establece cuando se llama a `CreateVoice` con `store = false`.
Solo salida. Es la clave de replicación de voz administrada por el cliente (con el prefijo "voicekey_"). Solo la devuelve "CreateVoice" cuando "type" es "replicated" y "store" es "false". Pasa esta clave a "SpeechConfig.voice_config.voice" (o "SpeechConfig.voice") durante la síntesis de voz.
Opcional. Es la etiqueta de idioma principal BCP-47 (p.ej., "en-US", "fr-FR").
Opcional. Es el modelo que se usó para diseñar o replicar la voz. Si se omite en `CreateVoice`, se usa de forma predeterminada el modelo de diseño de voz compatible más reciente. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces personalizadas (`"prompted"` y `"replicated"`); no se establece para las voces `"prebuilt"`. Las voces creadas se pueden sintetizar en cualquier modelo de síntesis de TTS compatible.
Opcional. Arquetipo de personaje o arquetipo de persona previsto (p. ej., "Cálido y amigable", "Narrador")
pitch Pitch (opcional)
Opcional. Clasificación del tono de voz.
Valores posibles
-
lowVoz más grave
-
mediumVoz de tono medio.
-
highVoz más aguda.
prompted PromptedVoice (opcional)
Son los parámetros para la generación de voz con instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces creadas a partir de instrucciones.
Campos
Obligatorio. Es la instrucción en lenguaje natural que describe la voz deseada, p.ej., "Una voz masculina profunda y resonante de un ogro malvado y enorme en la mediana edad".
Opcional. Código de región geográfica ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "GB", "001").
sample_audio AudioData (opcional)
Solo salida. Es el audio de muestra (audio de la instrucción del sintetizador) que se genera para una voz solicitada. Solo se propaga en las respuestas de `CreateVoice` y `GetVoice` cuando `type` es"prompted"; no se establece en las respuestas de `ListVoices` ni para las voces"replicated" o"prebuilt".
Campos
Obligatorio. Son los bytes de audio sin procesar.
Obligatorio. Es el tipo de MIME de IANA de los datos de audio (por ejemplo, "audio/wav" o "audio/mpeg").
type VoiceType (opcional)
Obligatorio. Es el tipo de voz. En `CreateVoice`, debe ser `"replicated"` o `"prompted"`. En las respuestas de `ListVoices`, también puede ser `"prebuilt"`.
Valores posibles
-
replicatedUna voz personalizada replicada a partir de una muestra de audio de referencia y una grabación del consentimiento del orador.
-
promptedUna voz personalizada generada a partir de una instrucción de texto en lenguaje natural.
-
prebuiltEs una voz del sistema integrada del catálogo de voces de Google (p.ej., "Puck" o "Charon"). Se devuelve en las respuestas y no se puede especificar como el tipo en `CreateVoice`.
usage Usage (opcional)
Solo salida. Son las estadísticas de uso de tokens para la solicitud de creación de voz. Solo se propaga en la respuesta de `CreateVoice` cuando `type` es `"prompted"`; no se establece para `"replicated"` ni en las respuestas de `GetVoice` y `ListVoices`.
Campos
cached_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens almacenados en caché por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
grounding_tool_count array (GroundingToolCount) (opcional)
Es el recuento de herramientas de fundamentación.
Campos
Es la cantidad de herramientas de fundamentación.
Es el tipo de herramienta de fundamentación asociada con el recuento.
Valores posibles:
-
google_searchFundamentación con la Búsqueda web de Google y la Búsqueda con imágenes, y fundamentación web para empresas.
-
google_mapsFundamentación con Google Maps.
input_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de entrada por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
output_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de salida por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
tool_use_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de uso de herramientas por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
Cantidad de tokens en la parte almacenada en caché de la instrucción (el contenido almacenado en caché).
Cantidad de tokens en la instrucción (contexto).
Es la cantidad total de tokens en todas las respuestas generadas.
Es la cantidad de tokens de pensamientos para los modelos de pensamiento.
Es el recuento total de tokens para la solicitud de interacción (instrucción + respuestas + otros tokens internos).
Cantidad de tokens presentes en las instrucciones de uso de herramientas.
Ejemplo
Ejemplo de respuesta
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Borra una voz almacenada personalizada (`store = true`) por nombre de recurso. No se pueden borrar las voces de catálogo prediseñadas (`VOICE_TYPE_PREBUILT`).
Parámetros de ruta de acceso y de consulta
Obligatorio. Nombre del recurso de la voz almacenada personalizada que se borrará (por ejemplo, `voices/voice_abc123def456`).
Respuesta
Si se ejecuta correctamente, la respuesta estará vacía.
Ejemplo
Recursos
Voz
Es un recurso de voz que representa una voz personalizada (creada a través de `CreateVoice`) o una voz del sistema prediseñada (devuelta por `ListVoices`).
Campos
Opcional. Descriptor de acento regional (p.ej., "estadounidense", "británico").
Opcional. Contexto o dominio de uso óptimo (p. ej., "Conversacional", "Audiolibro", "Noticias")
Opcional. Resumen descriptivo del timbre, la personalidad y el tono de la voz.
Opcional. Es el nombre visible proporcionado por el usuario para una voz almacenada (`store = true`) o el nombre del catálogo para una voz prediseñada.
Solo salida. Es la marca de tiempo en la que vence una voz personalizada almacenada (`store = true`) o una clave de voz replicada (`store = false`). No se establece para las voces de catálogo prediseñadas (`"prebuilt"`), que no vencen.
Opcional. Presentación del género de la voz percibida (p.ej., "femenina", "masculina", "neutra").
Solo salida. Es el identificador único de la voz. * En el caso de las voces personalizadas administradas por Google (`store = true`), se trata de un ID generado con el prefijo `voice_` (por ejemplo, `voice_abc123def456`). Pasa `voices/{id}` como el `name` en `GetVoice` y `DeleteVoice`, y pasa `{id}` directamente a `SpeechConfig.voice_config.voice` (o `SpeechConfig.voice`) durante la síntesis de voz. * Para las voces de catálogo prediseñadas (el valor "prebuilt" que devuelve `ListVoices`), este es el nombre del altavoz (por ejemplo, "Puck" o "Charon"). * No se establece cuando se llama a `CreateVoice` con `store = false`.
Solo salida. Es la clave de replicación de voz administrada por el cliente (con el prefijo "voicekey_"). Solo la devuelve "CreateVoice" cuando "type" es "replicated" y "store" es "false". Pasa esta clave a "SpeechConfig.voice_config.voice" (o "SpeechConfig.voice") durante la síntesis de voz.
Opcional. Es la etiqueta de idioma principal BCP-47 (p.ej., "en-US", "fr-FR").
Opcional. Es el modelo que se usó para diseñar o replicar la voz. Si se omite en `CreateVoice`, se usa de forma predeterminada el modelo de diseño de voz compatible más reciente. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces personalizadas (`"prompted"` y `"replicated"`); no se establece para las voces `"prebuilt"`. Las voces creadas se pueden sintetizar en cualquier modelo de síntesis de TTS compatible.
Opcional. Arquetipo de personaje o arquetipo de persona previsto (p. ej., "Cálido y amigable", "Narrador")
pitch Pitch (opcional)
Opcional. Clasificación del tono de voz.
Valores posibles
-
lowVoz más grave
-
mediumVoz de tono medio.
-
highVoz más aguda.
prompted PromptedVoice (opcional)
Son los parámetros para la generación de voz a partir de instrucciones. Se requiere en `CreateVoice` cuando `type` es `"prompted"`. Se devuelve en las respuestas de `CreateVoice`, `GetVoice` y `ListVoices` para las voces creadas a partir de instrucciones.
Campos
Obligatorio. Es la instrucción en lenguaje natural que describe la voz deseada, p.ej., "Una voz masculina profunda y resonante de un ogro malvado y enorme en la mediana edad".
Opcional. Código de región geográfica ISO 3166-1 alpha-2 o UN M.49 (p.ej., "US", "GB", "001").
sample_audio AudioData (opcional)
Solo salida. Es el audio de muestra (audio de la instrucción del sintetizador) que se genera para una voz solicitada. Solo se propaga en las respuestas de `CreateVoice` y `GetVoice` cuando `type` es"prompted"; no se establece en las respuestas de `ListVoices` ni para las voces"replicated" o"prebuilt".
Campos
Obligatorio. Son los bytes de audio sin procesar.
Obligatorio. Es el tipo de MIME de IANA de los datos de audio (por ejemplo, "audio/wav" o "audio/mpeg").
type VoiceType (opcional)
Obligatorio. Es el tipo de voz. En `CreateVoice`, debe ser `"replicated"` o `"prompted"`. En las respuestas de `ListVoices`, también puede ser `"prebuilt"`.
Valores posibles
-
replicatedUna voz personalizada replicada a partir de una muestra de audio de referencia y una grabación del consentimiento del orador.
-
promptedUna voz personalizada generada a partir de una instrucción de texto en lenguaje natural.
-
prebuiltEs una voz del sistema integrada del catálogo de voces de Google (p.ej., "Puck", "Charon"). Se devuelve en las respuestas y no se puede especificar como el tipo en `CreateVoice`.
usage Usage (opcional)
Solo salida. Son las estadísticas de uso de tokens para la solicitud de creación de voz. Solo se completa en la respuesta de `CreateVoice` cuando `type` es `"prompted"`; no se establece para `"replicated"` ni en las respuestas de `GetVoice` y `ListVoices`.
Campos
cached_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens almacenados en caché por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
grounding_tool_count array (GroundingToolCount) (opcional)
Es el recuento de herramientas de fundamentación.
Campos
Es la cantidad de herramientas de fundamentación.
Es el tipo de herramienta de fundamentación asociada con el recuento.
Valores posibles:
-
google_searchFundamentación con la Búsqueda web de Google y la Búsqueda con imágenes, y fundamentación web para empresas.
-
google_mapsFundamentación con Google Maps.
input_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de entrada por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
output_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de salida por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
tool_use_tokens_by_modality array (ModalityTokens) (opcional)
Es un desglose del uso de tokens de uso de herramientas por modalidad.
Campos
modalidad ResponseModality (opcional)
Es la modalidad asociada con el recuento de tokens.
Valores posibles
-
textIndica que el modelo debe devolver texto.
-
imageIndica que el modelo debe devolver imágenes.
-
audioIndica que el modelo debe devolver audio.
-
videoIndica que el modelo debe devolver videos.
-
documentIndica que el modelo debe devolver documentos.
Cantidad de tokens para la modalidad.
Cantidad de tokens en la parte almacenada en caché de la instrucción (el contenido almacenado en caché).
Cantidad de tokens en la instrucción (contexto).
Es la cantidad total de tokens en todas las respuestas generadas.
Es la cantidad de tokens de pensamientos para los modelos de pensamiento.
Es el recuento total de tokens para la solicitud de interacción (instrucción + respuestas + otros tokens internos).
Cantidad de tokens presentes en las instrucciones de uso de herramientas.