Mit der Voices API können Sie benutzerdefinierte Stimmen aus Prompts in natürlicher Sprache (Voice Design) oder aus Referenz-Audio und Aufnahmen mit Einwilligung des Sprechers (Voice Replication) erstellen sowie benutzerdefinierte und vordefinierte Stimmen für die Text-to-Speech-Synthese (TTS) auflisten, abrufen und verwalten.
CreateVoice
Erstellt eine benutzerdefinierte Stimme aus einem Prompt in natürlicher Sprache (`VOICE_TYPE_PROMPTED`) oder aus Referenz- und Einwilligungs-Audioaufnahmen (`VOICE_TYPE_REPLICATED`).
Anfragetext
Der Anfragetext enthält Daten mit folgender Struktur:
Optional. Gibt an, ob die erstellte Stimme von Google gespeichert und verwaltet wird. * Wenn „true“, speichert Google die Stimme und gibt „Voice.id“ zurück (z. B. „voice_abc123def456“). Diese kann über „GetVoice“, „ListVoices“ und „DeleteVoice“ verwaltet und in Syntheseanfragen per ID referenziert werden. Für Projekte gilt ein maximales Kontingent für aktive gespeicherte Stimmen. Wenn das Kontingent überschritten wird, wird `RESOURCE_EXHAUSTED` zurückgegeben. * Wenn `false` (Standard) festgelegt ist, wird die Stimme nicht von Google gespeichert und `Voice.key` (z. B. `voicekey_...`) wird für die clientseitige Speicherung und Synthese zurückgegeben. Optionale Metadatenfelder für die Suche unter „voice“ werden nicht gespeichert oder zurückgegeben, wenn „store“ auf „false“ gesetzt ist. * Muss „true“ sein, wenn „voice.type“ auf „prompted“ gesetzt ist (andernfalls wird der Fehler „INVALID_ARGUMENT“ zurückgegeben).
Erforderlich. Die zu erstellende Stimme. `voice.model` ist optional. Wenn es weggelassen wird, wählt der Dienst das Standardmodell für die Spracherstellung aus. Nur-Ausgabe-Felder für „Voice“ („id“, „key“, „expire_time“, „usage“) werden ignoriert, wenn sie festgelegt sind.
Antwort
Bei Erfolg enthält der Antworttext Daten mit der folgenden Struktur:
Optional. Deskriptor für regionalen Akzent (z. B. „amerikanisch“, „britisch“)
Optional. Optimaler Nutzungskontext oder ‑bereich (z. B. „Unterhaltung“, „Hörbuch“, „Nachrichten“)
Optional. Eine beschreibende Zusammenfassung von Stimmklang, Persönlichkeit und Ton.
Optional. Der vom Nutzer angegebene Anzeigename für eine gespeicherte Stimme (`store = true`) oder der Katalognamen für eine vordefinierte Stimme.
Nur Ausgabe. Der Zeitstempel, zu dem eine benutzerdefinierte gespeicherte Stimme (`store = true`) oder ein replizierter Stimmschlüssel (`store = false`) abläuft. Nicht festgelegt für integrierte Katalogstimmen („prebuilt“), die nicht ablaufen.
Optional. Wahrgenommene Darstellung des Geschlechts der Stimme (z.B. „weiblich“, „männlich“, „neutral“).
Nur Ausgabe. Die eindeutige Kennung der Stimme. * Bei von Google verwalteten benutzerdefinierten Stimmen (`store = true`) ist dies eine generierte ID mit dem Präfix `voice_` (z. B. `voice_abc123def456`). Übergeben Sie `voices/{id}` als `name` in `GetVoice` und `DeleteVoice` und `{id}` direkt an `SpeechConfig.voice_config.voice` (oder `SpeechConfig.voice`) während der Sprachsynthese. * Bei vordefinierten Katalogstimmen (`"prebuilt"`, zurückgegeben von `ListVoices`) ist dies der Name des Sprechers (z. B. `Puck` oder `Charon`). * Nicht festgelegt, wenn `CreateVoice` mit `store = false` aufgerufen wird.
Nur Ausgabe. Der vom Client verwaltete Schlüssel für die Sprachreplikation (mit dem Präfix „voicekey_“). Wird nur von „CreateVoice“ zurückgegeben, wenn „type“ auf „replicated“ und „store“ auf „false“ gesetzt ist. Übergeben Sie diesen Schlüssel während der Sprachsynthese an „SpeechConfig.voice_config.voice“ (oder „SpeechConfig.voice“).
Optional. Primäres BCP-47-Sprachtag (z.B. „en-US“, „fr-FR“).
Optional. Das Modell, das zum Erstellen oder Replizieren der Stimme verwendet wurde. Wenn in „CreateVoice“ nicht angegeben, wird standardmäßig das neueste unterstützte Voice Design-Modell verwendet. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für benutzerdefinierte Stimmen (`"prompted"` und `"replicated"`) zurückgegeben; nicht festgelegt für `"prebuilt"`-Stimmen. Erstellte Stimmen können mit jedem unterstützten TTS-Synthesemodell synthetisiert werden.
Optional. Vorgesehene Persona oder Charakterarchetyp (z.B. „Warm, freundlich“, „Erzähler“).
pitch Tonhöhe (optional)
Optional. Klassifizierung der Stimmlage.
Mögliche Werte
-
lowTiefere Stimmlage.
-
mediumStimme mit mittlerer Tonhöhe.
-
highHöhere Stimmlage.
prompted PromptedVoice (optional)
Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` auf `"prompted"` gesetzt ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderungen basierende Stimmen zurückgegeben.
Felder
Erforderlich. Der Prompt in natürlicher Sprache, der die gewünschte Stimme beschreibt, z.B. „Eine tiefe, dröhnende Männerstimme eines riesigen bösen Ogers mittleren Alters“.
Optional. ISO 3166-1-Alpha-2- oder UN M.49-Code für geografische Regionen (z.B. „US“, „GB“, „001“).
sample_audio AudioData (optional)
Nur Ausgabe. Beispiel-Audio (Synthesizer-Prompt-Audio), das für eine angeforderte Stimme generiert wurde. Wird nur in `CreateVoice`- und `GetVoice`-Antworten ausgefüllt, wenn `type` auf `"prompted"` festgelegt ist. In `ListVoices`-Antworten und für Stimmen vom Typ `"replicated"` oder `"prebuilt"` ist der Wert nicht festgelegt.
Felder
Erforderlich. Die Rohbyte des Audiosignals.
Erforderlich. Der IANA-MIME-Typ der Audiodaten (z. B. „audio/wav“ oder „audio/mpeg“).
type VoiceType (optional)
Erforderlich. Der Typ der Stimme. In `CreateVoice` muss der Wert `"replicated"` oder `"prompted"` sein. In `ListVoices`-Antworten kann auch `"prebuilt"` verwendet werden.
Mögliche Werte
-
replicatedEine benutzerdefinierte Stimme, die aus einem Referenzaudiobeispiel und einer Einwilligungserklärung des Sprechers erstellt wurde.
-
promptedEine benutzerdefinierte Stimme, die aus einem Text-Prompt in natürlicher Sprache generiert wurde.
-
prebuiltEine integrierte Systemstimme aus dem Sprachkatalog von Google (z.B. „Puck“, „Charon“). Wird in Antworten zurückgegeben; kann nicht als Typ in `CreateVoice` angegeben werden.
usage Usage (optional)
Nur Ausgabe. Statistiken zur Tokennutzung für die Anfrage zur Erstellung von Voice. Wird nur in der Antwort von „CreateVoice“ ausgefüllt, wenn „type“ auf „prompted“ festgelegt ist. Für „replicated“ und in den Antworten von „GetVoice“ und „ListVoices“ ist der Wert nicht festgelegt.
Felder
cached_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von im Cache gespeicherten Tokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
grounding_tool_count array (GroundingToolCount) (optional)
Anzahl der Fundierungs-Tools.
Felder
Die Anzahl der Fundierungstools.
Der Typ des Grounding-Tools, das mit der Anzahl verknüpft ist.
Mögliche Werte:
-
google_searchFundierung mit der Google Websuche und Bildersuche sowie Webfundierung für Unternehmen.
-
google_mapsFundierung mit Google Maps.
input_tokens_by_modality Array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von Eingabetokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
output_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von Ausgabetokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Tokennutzung für die Tool-Verwendung nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
Anzahl der Tokens im im Cache gespeicherten Teil des Prompts (im Cache gespeicherter Inhalt).
Anzahl der Tokens im Prompt (Kontext).
Gesamtzahl der Tokens in allen generierten Antworten.
Anzahl der Tokens für Gedanken für Thinking-Modelle.
Gesamtzahl der Tokens für die Interaktionsanfrage (Prompt + Antworten + andere interne Tokens).
Anzahl der Tokens in den Tool-Nutzungs-Prompts.
Beispiel
Beispielantwort
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Listet benutzerdefinierte gespeicherte Stimmen auf, die dem Anrufer gehören (neueste zuerst), gefolgt von vordefinierten Systemstimmen aus dem Sprachkatalog von Google.
Pfad-/Abfrageparameter
Optional. Nach Akzentbeschreibung filtern (z.B. „Amerikanisch“, „Britisch“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Akzente abgeglichen (ODER).
Optional. Filtern Sie nach dem beabsichtigten Kontext oder der beabsichtigten Domain (z.B. „Nachrichten, kommerziell“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Kontexte abgeglichen (ODER).
Optional. Nach Geschlechtsdarstellung filtern, z.B. „weiblich“, „männlich“ oder „neutral“. Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Geschlechter (ODER) abgeglichen.
Optional. Nach BCP-47-Sprachcode filtern (z.B. „en-US“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Sprachcodes abgeglichen (ODER).
Optional. Die maximale Anzahl von Stimmen, die pro Seite zurückgegeben werden sollen. Der Dienst gibt möglicherweise weniger als diesen Wert zurück. Wenn nicht angegeben, werden maximal 50 Stimmen zurückgegeben. Der Höchstwert ist 1.000. Werte über 1.000 werden implizit auf 1.000 umgewandelt.
Optional. Ein Seitentoken, das von einem vorherigen `ListVoices`-Aufruf empfangen wurde. Geben Sie dieses an, um die nachfolgende Seite abzurufen. Bei der Paginierung müssen alle Filter-Suchparameter („language_code“, „region_code“, „accent“, „persona“, „context“, „gender“, „pitch“, „type“ und „search“) mit dem Aufruf übereinstimmen, der dieses Token zurückgegeben hat. Andernfalls schlägt die Anfrage mit „INVALID_ARGUMENT“ fehl. „page_size“ kann sich zwischen den Seiten ändern.
Optional. Nach stimmlicher Persona filtern (z. B. „Warm, freundlich“) Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einer der angegebenen Personas abgeglichen (ODER).
Optional. Nach Tonhöhe filtern. Akzeptiert „low“, „medium“, „high“ oder „PITCH_LOW“, „PITCH_MEDIUM“, „PITCH_HIGH“ (Groß-/Kleinschreibung wird nicht beachtet). Wenn mehrere Werte angegeben sind, werden Stimmen mit einer der angegebenen Tonhöhen abgeglichen (ODER).
Optional. Filtern Sie nach ISO 3166-1 Alpha-2- oder UN M.49-Regionscode (z.B. „US“, „001“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Regionscodes abgeglichen (ODER).
Optional. Bei der Freitext-Teilstringsuche wird die Groß-/Kleinschreibung nicht beachtet. Die Suche erfolgt sowohl für `display_name` als auch für `description`. Maximal 2.048 Byte.
Optional. Nach Sprachtyp filtern. Akzeptiert „prebuilt“, „replicated“, „prompted“ oder „VOICE_TYPE_PREBUILT“, „VOICE_TYPE_REPLICATED“, „VOICE_TYPE_PROMPTED“ (Groß-/Kleinschreibung wird nicht beachtet). Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Typen abgeglichen (ODER).
Antwort
Bei Erfolg enthält der Antworttext Daten mit der folgenden Struktur:
Ein Token, das als „page_token“ gesendet werden kann, um die nächste Seite abzurufen. Wenn leer, gibt es keine nachfolgenden Seiten.
Die Stimmen aus der angegebenen Sammlung.
Beispiel
Beispielantwort
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Ruft eine benutzerdefinierte gespeicherte Stimme (`store = true`) anhand des Ressourcennamens ab. Vorgefertigte Katalogstimmen (`VOICE_TYPE_PREBUILT`) können nicht über `GetVoice` abgerufen werden. Verwenden Sie stattdessen `ListVoices`.
Pfad-/Abfrageparameter
Erforderlich. Der Ressourcenname der abzurufenden benutzerdefinierten gespeicherten Stimme (z. B. „voices/voice_abc123def456“).
Antwort
Bei Erfolg enthält der Antworttext Daten mit der folgenden Struktur:
Optional. Deskriptor für regionalen Akzent (z. B. „amerikanisch“, „britisch“)
Optional. Optimaler Nutzungskontext oder ‑bereich (z. B. „Unterhaltung“, „Hörbuch“, „Nachrichten“)
Optional. Eine beschreibende Zusammenfassung von Stimmklang, Persönlichkeit und Ton.
Optional. Der vom Nutzer angegebene Anzeigename für eine gespeicherte Stimme (`store = true`) oder der Katalognamen für eine vordefinierte Stimme.
Nur Ausgabe. Der Zeitstempel, zu dem eine benutzerdefinierte gespeicherte Stimme (`store = true`) oder ein replizierter Stimmschlüssel (`store = false`) abläuft. Nicht festgelegt für integrierte Katalogstimmen („prebuilt“), die nicht ablaufen.
Optional. Wahrgenommene Darstellung des Geschlechts der Stimme (z.B. „weiblich“, „männlich“, „neutral“).
Nur Ausgabe. Die eindeutige Kennung der Stimme. * Bei von Google verwalteten benutzerdefinierten Stimmen (`store = true`) ist dies eine generierte ID mit dem Präfix `voice_` (z. B. `voice_abc123def456`). Übergeben Sie `voices/{id}` als `name` in `GetVoice` und `DeleteVoice` und `{id}` direkt an `SpeechConfig.voice_config.voice` (oder `SpeechConfig.voice`) während der Sprachsynthese. * Bei vordefinierten Katalogstimmen (`"prebuilt"`, zurückgegeben von `ListVoices`) ist dies der Name des Sprechers (z. B. `Puck` oder `Charon`). * Nicht festgelegt, wenn `CreateVoice` mit `store = false` aufgerufen wird.
Nur Ausgabe. Der vom Client verwaltete Schlüssel für die Sprachreplikation (mit dem Präfix „voicekey_“). Wird nur von „CreateVoice“ zurückgegeben, wenn „type“ auf „replicated“ und „store“ auf „false“ gesetzt ist. Übergeben Sie diesen Schlüssel während der Sprachsynthese an „SpeechConfig.voice_config.voice“ (oder „SpeechConfig.voice“).
Optional. Primäres BCP-47-Sprachtag (z.B. „en-US“, „fr-FR“).
Optional. Das Modell, das zum Erstellen oder Replizieren der Stimme verwendet wurde. Wenn in „CreateVoice“ nicht angegeben, wird standardmäßig das neueste unterstützte Voice Design-Modell verwendet. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für benutzerdefinierte Stimmen (`"prompted"` und `"replicated"`) zurückgegeben; nicht festgelegt für `"prebuilt"`-Stimmen. Erstellte Stimmen können mit jedem unterstützten TTS-Synthesemodell synthetisiert werden.
Optional. Vorgesehene Persona oder Charakterarchetyp (z.B. „Warm, freundlich“, „Erzähler“).
pitch Tonhöhe (optional)
Optional. Klassifizierung der Stimmlage.
Mögliche Werte
-
lowTiefere Stimmlage.
-
mediumStimme mit mittlerer Tonhöhe.
-
highHöhere Stimmlage.
prompted PromptedVoice (optional)
Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` auf `"prompted"` gesetzt ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderungen basierende Stimmen zurückgegeben.
Felder
Erforderlich. Der Prompt in natürlicher Sprache, der die gewünschte Stimme beschreibt, z.B. „Eine tiefe, dröhnende Männerstimme eines riesigen bösen Ogers mittleren Alters“.
Optional. ISO 3166-1-Alpha-2- oder UN M.49-Code für geografische Regionen (z.B. „US“, „GB“, „001“).
sample_audio AudioData (optional)
Nur Ausgabe. Beispiel-Audio (Synthesizer-Prompt-Audio), das für eine angeforderte Stimme generiert wurde. Wird nur in `CreateVoice`- und `GetVoice`-Antworten ausgefüllt, wenn `type` auf `"prompted"` festgelegt ist. In `ListVoices`-Antworten und für Stimmen vom Typ `"replicated"` oder `"prebuilt"` ist der Wert nicht festgelegt.
Felder
Erforderlich. Die Rohbyte des Audiosignals.
Erforderlich. Der IANA-MIME-Typ der Audiodaten (z. B. „audio/wav“ oder „audio/mpeg“).
type VoiceType (optional)
Erforderlich. Der Typ der Stimme. In `CreateVoice` muss der Wert `"replicated"` oder `"prompted"` sein. In `ListVoices`-Antworten kann auch `"prebuilt"` verwendet werden.
Mögliche Werte
-
replicatedEine benutzerdefinierte Stimme, die aus einem Referenzaudiobeispiel und einer Einwilligungserklärung des Sprechers erstellt wurde.
-
promptedEine benutzerdefinierte Stimme, die aus einem Text-Prompt in natürlicher Sprache generiert wurde.
-
prebuiltEine integrierte Systemstimme aus dem Sprachkatalog von Google (z.B. „Puck“, „Charon“). Wird in Antworten zurückgegeben; kann nicht als Typ in `CreateVoice` angegeben werden.
usage Usage (optional)
Nur Ausgabe. Statistiken zur Tokennutzung für die Anfrage zur Erstellung von Voice. Wird nur in der Antwort von „CreateVoice“ ausgefüllt, wenn „type“ auf „prompted“ festgelegt ist. Für „replicated“ und in den Antworten von „GetVoice“ und „ListVoices“ ist der Wert nicht festgelegt.
Felder
cached_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von im Cache gespeicherten Tokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
grounding_tool_count array (GroundingToolCount) (optional)
Anzahl der Fundierungs-Tools.
Felder
Die Anzahl der Fundierungstools.
Der Typ des Grounding-Tools, das mit der Anzahl verknüpft ist.
Mögliche Werte:
-
google_searchFundierung mit der Google Websuche und Bildersuche sowie Webfundierung für Unternehmen.
-
google_mapsFundierung mit Google Maps.
input_tokens_by_modality Array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von Eingabetokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
output_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von Ausgabetokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Tokennutzung für die Tool-Verwendung nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
Anzahl der Tokens im im Cache gespeicherten Teil des Prompts (im Cache gespeicherter Inhalt).
Anzahl der Tokens im Prompt (Kontext).
Gesamtzahl der Tokens in allen generierten Antworten.
Anzahl der Tokens für Gedanken für Thinking-Modelle.
Gesamtzahl der Tokens für die Interaktionsanfrage (Prompt + Antworten + andere interne Tokens).
Anzahl der Tokens in den Tool-Nutzungs-Prompts.
Beispiel
Beispielantwort
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Löscht eine benutzerdefinierte gespeicherte Stimme („store“ = „true“) anhand des Ressourcennamens. Vorgefertigte Katalogstimmen (`VOICE_TYPE_PREBUILT`) können nicht gelöscht werden.
Pfad-/Abfrageparameter
Erforderlich. Der Ressourcenname der zu löschenden benutzerdefinierten gespeicherten Stimme (z. B. „voices/voice_abc123def456“).
Antwort
Wenn der Vorgang erfolgreich ist, ist die Antwort leer.
Beispiel
Ressourcen
Sprache
Eine Sprachressource, die entweder eine benutzerdefinierte Stimme (erstellt über `CreateVoice`) oder eine vordefinierte Systemstimme (zurückgegeben von `ListVoices`) darstellt.
Felder
Optional. Deskriptor für regionalen Akzent (z. B. „amerikanisch“, „britisch“)
Optional. Optimaler Nutzungskontext oder ‑bereich (z. B. „Unterhaltung“, „Hörbuch“, „Nachrichten“)
Optional. Eine beschreibende Zusammenfassung von Stimmklang, Persönlichkeit und Ton.
Optional. Der vom Nutzer angegebene Anzeigename für eine gespeicherte Stimme (`store = true`) oder der Katalognamen für eine vordefinierte Stimme.
Nur Ausgabe. Der Zeitstempel, zu dem eine benutzerdefinierte gespeicherte Stimme (`store = true`) oder ein replizierter Stimmschlüssel (`store = false`) abläuft. Nicht festgelegt für integrierte Katalogstimmen („prebuilt“), die nicht ablaufen.
Optional. Wahrgenommene Darstellung des Geschlechts der Stimme (z.B. „weiblich“, „männlich“, „neutral“).
Nur Ausgabe. Die eindeutige Kennung der Stimme. * Bei von Google verwalteten benutzerdefinierten Stimmen (`store = true`) ist dies eine generierte ID mit dem Präfix `voice_` (z. B. `voice_abc123def456`). Übergeben Sie `voices/{id}` als `name` in `GetVoice` und `DeleteVoice` und `{id}` direkt an `SpeechConfig.voice_config.voice` (oder `SpeechConfig.voice`) während der Sprachsynthese. * Bei vordefinierten Katalogstimmen (`"prebuilt"`, zurückgegeben von `ListVoices`) ist dies der Name des Sprechers (z. B. `Puck` oder `Charon`). * Nicht festgelegt, wenn `CreateVoice` mit `store = false` aufgerufen wird.
Nur Ausgabe. Der vom Client verwaltete Schlüssel für die Sprachreplikation (mit dem Präfix „voicekey_“). Wird nur von „CreateVoice“ zurückgegeben, wenn „type“ auf „replicated“ und „store“ auf „false“ gesetzt ist. Übergeben Sie diesen Schlüssel während der Sprachsynthese an „SpeechConfig.voice_config.voice“ (oder „SpeechConfig.voice“).
Optional. Primäres BCP-47-Sprachtag (z.B. „en-US“, „fr-FR“).
Optional. Das Modell, das zum Erstellen oder Replizieren der Stimme verwendet wurde. Wenn in „CreateVoice“ nicht angegeben, wird standardmäßig das neueste unterstützte Voice Design-Modell verwendet. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für benutzerdefinierte Stimmen (`"prompted"` und `"replicated"`) zurückgegeben; nicht festgelegt für `"prebuilt"`-Stimmen. Erstellte Stimmen können mit jedem unterstützten TTS-Synthesemodell synthetisiert werden.
Optional. Vorgesehene Persona oder Charakterarchetyp (z.B. „Warm, freundlich“, „Erzähler“).
pitch Tonhöhe (optional)
Optional. Klassifizierung der Stimmlage.
Mögliche Werte
-
lowTiefere Stimmlage.
-
mediumStimme mit mittlerer Tonhöhe.
-
highHöhere Stimmlage.
prompted PromptedVoice (optional)
Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` gleich `"prompted"` ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderung erstellte Stimmen zurückgegeben.
Felder
Erforderlich. Der Prompt in natürlicher Sprache, der die gewünschte Stimme beschreibt, z.B. „Eine tiefe, dröhnende Männerstimme eines riesigen bösen Ogers mittleren Alters“.
Optional. ISO 3166-1-Alpha-2- oder UN M.49-Code für geografische Regionen (z.B. „US“, „GB“, „001“).
sample_audio AudioData (optional)
Nur Ausgabe. Beispiel-Audio (Synthesizer-Prompt-Audio), das für eine angeforderte Stimme generiert wurde. Wird nur in `CreateVoice`- und `GetVoice`-Antworten ausgefüllt, wenn `type` auf `"prompted"` festgelegt ist. In `ListVoices`-Antworten und für Stimmen vom Typ `"replicated"` oder `"prebuilt"` ist der Wert nicht festgelegt.
Felder
Erforderlich. Die Rohbyte des Audiosignals.
Erforderlich. Der IANA-MIME-Typ der Audiodaten (z. B. „audio/wav“ oder „audio/mpeg“).
type VoiceType (optional)
Erforderlich. Der Typ der Stimme. In `CreateVoice` muss der Wert `"replicated"` oder `"prompted"` sein. In `ListVoices`-Antworten kann auch `"prebuilt"` verwendet werden.
Mögliche Werte
-
replicatedEine benutzerdefinierte Stimme, die aus einem Referenzaudiobeispiel und einer Einwilligungserklärung des Sprechers erstellt wurde.
-
promptedEine benutzerdefinierte Stimme, die aus einem Text-Prompt in natürlicher Sprache generiert wurde.
-
prebuiltEine integrierte Systemstimme aus dem Sprachkatalog von Google (z.B. „Puck“, „Charon“). Wird in Antworten zurückgegeben; kann nicht als Typ in `CreateVoice` angegeben werden.
usage Usage (optional)
Nur Ausgabe. Statistiken zur Tokennutzung für die Anfrage zur Erstellung von Voice. Wird nur in der Antwort von „CreateVoice“ ausgefüllt, wenn „type“ auf „prompted“ festgelegt ist. Für „replicated“ und in den Antworten von „GetVoice“ und „ListVoices“ ist der Wert nicht festgelegt.
Felder
cached_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von im Cache gespeicherten Tokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
grounding_tool_count array (GroundingToolCount) (optional)
Anzahl der Fundierungs-Tools.
Felder
Die Anzahl der Fundierungstools.
Der Typ des Grounding-Tools, das mit der Anzahl verknüpft ist.
Mögliche Werte:
-
google_searchFundierung mit der Google Websuche und Bildersuche sowie Webfundierung für Unternehmen.
-
google_mapsFundierung mit Google Maps.
input_tokens_by_modality Array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von Eingabetokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
output_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Nutzung von Ausgabetokens nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
Eine Aufschlüsselung der Tokennutzung für die Tool-Verwendung nach Modalität.
Felder
modality ResponseModality (optional)
Die mit der Anzahl der Tokens verknüpfte Modalität.
Mögliche Werte
-
textGibt an, dass das Modell Text zurückgeben soll.
-
imageGibt an, dass das Modell Bilder zurückgeben soll.
-
audioGibt an, dass das Modell Audio zurückgeben soll.
-
videoGibt an, dass das Modell Videos zurückgeben soll.
-
documentGibt an, dass das Modell Dokumente zurückgeben soll.
Anzahl der Tokens für die Modalität.
Anzahl der Tokens im im Cache gespeicherten Teil des Prompts (im Cache gespeicherter Inhalt).
Anzahl der Tokens im Prompt (Kontext).
Gesamtzahl der Tokens in allen generierten Antworten.
Anzahl der Tokens für Gedanken für Thinking-Modelle.
Gesamtzahl der Tokens für die Interaktionsanfrage (Prompt + Antworten + andere interne Tokens).
Anzahl der Tokens in den Tool-Nutzungs-Prompts.