Gemini Voices API

Mit der Voices API können Sie benutzerdefinierte Stimmen aus Prompts in natürlicher Sprache (Voice Design) oder aus Referenz-Audio und Aufnahmen mit Einwilligung des Sprechers (Voice Replication) erstellen sowie benutzerdefinierte und vordefinierte Stimmen für die Text-to-Speech-Synthese (TTS) auflisten, abrufen und verwalten.

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Erstellt eine benutzerdefinierte Stimme aus einem Prompt in natürlicher Sprache (`VOICE_TYPE_PROMPTED`) oder aus Referenz- und Einwilligungs-Audioaufnahmen (`VOICE_TYPE_REPLICATED`).

Anfragetext

Der Anfragetext enthält Daten mit folgender Struktur:

store boolean  (optional)

Optional. Gibt an, ob die erstellte Stimme von Google gespeichert und verwaltet wird. * Wenn „true“, speichert Google die Stimme und gibt „Voice.id“ zurück (z. B. „voice_abc123def456“). Diese kann über „GetVoice“, „ListVoices“ und „DeleteVoice“ verwaltet und in Syntheseanfragen per ID referenziert werden. Für Projekte gilt ein maximales Kontingent für aktive gespeicherte Stimmen. Wenn das Kontingent überschritten wird, wird `RESOURCE_EXHAUSTED` zurückgegeben. * Wenn `false` (Standard) festgelegt ist, wird die Stimme nicht von Google gespeichert und `Voice.key` (z. B. `voicekey_...`) wird für die clientseitige Speicherung und Synthese zurückgegeben. Optionale Metadatenfelder für die Suche unter „voice“ werden nicht gespeichert oder zurückgegeben, wenn „store“ auf „false“ gesetzt ist. * Muss „true“ sein, wenn „voice.type“ auf „prompted“ gesetzt ist (andernfalls wird der Fehler „INVALID_ARGUMENT“ zurückgegeben).

voice Voice  (erforderlich)

Erforderlich. Die zu erstellende Stimme. `voice.model` ist optional. Wenn es weggelassen wird, wählt der Dienst das Standardmodell für die Spracherstellung aus. Nur-Ausgabe-Felder für „Voice“ („id“, „key“, „expire_time“, „usage“) werden ignoriert, wenn sie festgelegt sind.

Antwort

Bei Erfolg enthält der Antworttext Daten mit der folgenden Struktur:

accent string  (optional)

Optional. Deskriptor für regionalen Akzent (z. B. „amerikanisch“, „britisch“)

context string  (optional)

Optional. Optimaler Nutzungskontext oder ‑bereich (z. B. „Unterhaltung“, „Hörbuch“, „Nachrichten“)

description string  (optional)

Optional. Eine beschreibende Zusammenfassung von Stimmklang, Persönlichkeit und Ton.

display_name string  (optional)

Optional. Der vom Nutzer angegebene Anzeigename für eine gespeicherte Stimme (`store = true`) oder der Katalognamen für eine vordefinierte Stimme.

expire_time string  (optional)

Nur Ausgabe. Der Zeitstempel, zu dem eine benutzerdefinierte gespeicherte Stimme (`store = true`) oder ein replizierter Stimmschlüssel (`store = false`) abläuft. Nicht festgelegt für integrierte Katalogstimmen („prebuilt“), die nicht ablaufen.

gender string  (optional)

Optional. Wahrgenommene Darstellung des Geschlechts der Stimme (z.B. „weiblich“, „männlich“, „neutral“).

id String  (optional)

Nur Ausgabe. Die eindeutige Kennung der Stimme. * Bei von Google verwalteten benutzerdefinierten Stimmen (`store = true`) ist dies eine generierte ID mit dem Präfix `voice_` (z. B. `voice_abc123def456`). Übergeben Sie `voices/{id}` als `name` in `GetVoice` und `DeleteVoice` und `{id}` direkt an `SpeechConfig.voice_config.voice` (oder `SpeechConfig.voice`) während der Sprachsynthese. * Bei vordefinierten Katalogstimmen (`"prebuilt"`, zurückgegeben von `ListVoices`) ist dies der Name des Sprechers (z. B. `Puck` oder `Charon`). * Nicht festgelegt, wenn `CreateVoice` mit `store = false` aufgerufen wird.

key String  (optional)

Nur Ausgabe. Der vom Client verwaltete Schlüssel für die Sprachreplikation (mit dem Präfix „voicekey_“). Wird nur von „CreateVoice“ zurückgegeben, wenn „type“ auf „replicated“ und „store“ auf „false“ gesetzt ist. Übergeben Sie diesen Schlüssel während der Sprachsynthese an „SpeechConfig.voice_config.voice“ (oder „SpeechConfig.voice“).

language_code string  (optional)

Optional. Primäres BCP-47-Sprachtag (z.B. „en-US“, „fr-FR“).

model string  (optional)

Optional. Das Modell, das zum Erstellen oder Replizieren der Stimme verwendet wurde. Wenn in „CreateVoice“ nicht angegeben, wird standardmäßig das neueste unterstützte Voice Design-Modell verwendet. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für benutzerdefinierte Stimmen (`"prompted"` und `"replicated"`) zurückgegeben; nicht festgelegt für `"prebuilt"`-Stimmen. Erstellte Stimmen können mit jedem unterstützten TTS-Synthesemodell synthetisiert werden.

persona string  (optional)

Optional. Vorgesehene Persona oder Charakterarchetyp (z.B. „Warm, freundlich“, „Erzähler“).

pitch Tonhöhe  (optional)

Optional. Klassifizierung der Stimmlage.

Mögliche Werte

  • low

    Tiefere Stimmlage.

  • medium

    Stimme mit mittlerer Tonhöhe.

  • high

    Höhere Stimmlage.

prompted PromptedVoice  (optional)

Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` auf `"prompted"` gesetzt ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderungen basierende Stimmen zurückgegeben.

Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` gleich `"prompted"` ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderung erstellte Stimmen zurückgegeben.

Felder

input string  (optional)

Erforderlich. Der Prompt in natürlicher Sprache, der die gewünschte Stimme beschreibt, z.B. „Eine tiefe, dröhnende Männerstimme eines riesigen bösen Ogers mittleren Alters“.

region_code string  (optional)

Optional. ISO 3166-1-Alpha-2- oder UN M.49-Code für geografische Regionen (z.B. „US“, „GB“, „001“).

sample_audio AudioData  (optional)

Nur Ausgabe. Beispiel-Audio (Synthesizer-Prompt-Audio), das für eine angeforderte Stimme generiert wurde. Wird nur in `CreateVoice`- und `GetVoice`-Antworten ausgefüllt, wenn `type` auf `"prompted"` festgelegt ist. In `ListVoices`-Antworten und für Stimmen vom Typ `"replicated"` oder `"prebuilt"` ist der Wert nicht festgelegt.

Die Audio-Nutzlast, die zum Erstellen der Stimme verwendet wird.

Felder

data string  (optional)

Erforderlich. Die Rohbyte des Audiosignals.

mime_type string  (optional)

Erforderlich. Der IANA-MIME-Typ der Audiodaten (z. B. „audio/wav“ oder „audio/mpeg“).

type VoiceType  (optional)

Erforderlich. Der Typ der Stimme. In `CreateVoice` muss der Wert `"replicated"` oder `"prompted"` sein. In `ListVoices`-Antworten kann auch `"prebuilt"` verwendet werden.

Mögliche Werte

  • replicated

    Eine benutzerdefinierte Stimme, die aus einem Referenzaudiobeispiel und einer Einwilligungserklärung des Sprechers erstellt wurde.

  • prompted

    Eine benutzerdefinierte Stimme, die aus einem Text-Prompt in natürlicher Sprache generiert wurde.

  • prebuilt

    Eine integrierte Systemstimme aus dem Sprachkatalog von Google (z.B. „Puck“, „Charon“). Wird in Antworten zurückgegeben; kann nicht als Typ in `CreateVoice` angegeben werden.

usage Usage  (optional)

Nur Ausgabe. Statistiken zur Tokennutzung für die Anfrage zur Erstellung von Voice. Wird nur in der Antwort von „CreateVoice“ ausgefüllt, wenn „type“ auf „prompted“ festgelegt ist. Für „replicated“ und in den Antworten von „GetVoice“ und „ListVoices“ ist der Wert nicht festgelegt.

Statistiken zur Tokennutzung der Interaktionsanfrage.

Felder

cached_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von im Cache gespeicherten Tokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

grounding_tool_count array (GroundingToolCount)  (optional)

Anzahl der Fundierungs-Tools.

Die Anzahl der Grounding-Tool-Zählungen.

Felder

count integer  (optional)

Die Anzahl der Fundierungstools.

type enum (string)  (optional)

Der Typ des Grounding-Tools, das mit der Anzahl verknüpft ist.

Mögliche Werte:

  • google_search

    Fundierung mit der Google Websuche und Bildersuche sowie Webfundierung für Unternehmen.

  • google_maps

    Fundierung mit Google Maps.

input_tokens_by_modality Array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von Eingabetokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

output_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von Ausgabetokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

tool_use_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Tokennutzung für die Tool-Verwendung nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

total_cached_tokens integer  (optional)

Anzahl der Tokens im im Cache gespeicherten Teil des Prompts (im Cache gespeicherter Inhalt).

total_input_tokens integer  (optional)

Anzahl der Tokens im Prompt (Kontext).

total_output_tokens integer  (optional)

Gesamtzahl der Tokens in allen generierten Antworten.

total_thought_tokens integer  (optional)

Anzahl der Tokens für Gedanken für Thinking-Modelle.

total_tokens integer  (optional)

Gesamtzahl der Tokens für die Interaktionsanfrage (Prompt + Antworten + andere interne Tokens).

total_tool_use_tokens integer  (optional)

Anzahl der Tokens in den Tool-Nutzungs-Prompts.

Beispiel

Beispielantwort

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Listet benutzerdefinierte gespeicherte Stimmen auf, die dem Anrufer gehören (neueste zuerst), gefolgt von vordefinierten Systemstimmen aus dem Sprachkatalog von Google.

Pfad-/Abfrageparameter

accent array (string)  (optional)

Optional. Nach Akzentbeschreibung filtern (z.B. „Amerikanisch“, „Britisch“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Akzente abgeglichen (ODER).

context array (string)  (optional)

Optional. Filtern Sie nach dem beabsichtigten Kontext oder der beabsichtigten Domain (z.B. „Nachrichten, kommerziell“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Kontexte abgeglichen (ODER).

gender array (string)  (optional)

Optional. Nach Geschlechtsdarstellung filtern, z.B. „weiblich“, „männlich“ oder „neutral“. Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Geschlechter (ODER) abgeglichen.

language_code Array (String)  (optional)

Optional. Nach BCP-47-Sprachcode filtern (z.B. „en-US“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Sprachcodes abgeglichen (ODER).

page_size integer  (optional)

Optional. Die maximale Anzahl von Stimmen, die pro Seite zurückgegeben werden sollen. Der Dienst gibt möglicherweise weniger als diesen Wert zurück. Wenn nicht angegeben, werden maximal 50 Stimmen zurückgegeben. Der Höchstwert ist 1.000. Werte über 1.000 werden implizit auf 1.000 umgewandelt.

page_token String  (optional)

Optional. Ein Seitentoken, das von einem vorherigen `ListVoices`-Aufruf empfangen wurde. Geben Sie dieses an, um die nachfolgende Seite abzurufen. Bei der Paginierung müssen alle Filter-Suchparameter („language_code“, „region_code“, „accent“, „persona“, „context“, „gender“, „pitch“, „type“ und „search“) mit dem Aufruf übereinstimmen, der dieses Token zurückgegeben hat. Andernfalls schlägt die Anfrage mit „INVALID_ARGUMENT“ fehl. „page_size“ kann sich zwischen den Seiten ändern.

persona array (string)  (optional)

Optional. Nach stimmlicher Persona filtern (z. B. „Warm, freundlich“) Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einer der angegebenen Personas abgeglichen (ODER).

pitch array (string)  (optional)

Optional. Nach Tonhöhe filtern. Akzeptiert „low“, „medium“, „high“ oder „PITCH_LOW“, „PITCH_MEDIUM“, „PITCH_HIGH“ (Groß-/Kleinschreibung wird nicht beachtet). Wenn mehrere Werte angegeben sind, werden Stimmen mit einer der angegebenen Tonhöhen abgeglichen (ODER).

region_code Array (String)  (optional)

Optional. Filtern Sie nach ISO 3166-1 Alpha-2- oder UN M.49-Regionscode (z.B. „US“, „001“). Genaue Übereinstimmung ohne Berücksichtigung der Groß-/Kleinschreibung. Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Regionscodes abgeglichen (ODER).

search string  (optional)

Optional. Bei der Freitext-Teilstringsuche wird die Groß-/Kleinschreibung nicht beachtet. Die Suche erfolgt sowohl für `display_name` als auch für `description`. Maximal 2.048 Byte.

type array (string)  (optional)

Optional. Nach Sprachtyp filtern. Akzeptiert „prebuilt“, „replicated“, „prompted“ oder „VOICE_TYPE_PREBUILT“, „VOICE_TYPE_REPLICATED“, „VOICE_TYPE_PROMPTED“ (Groß-/Kleinschreibung wird nicht beachtet). Wenn mehrere Werte angegeben sind, werden Stimmen mit einem der angegebenen Typen abgeglichen (ODER).

Antwort

Bei Erfolg enthält der Antworttext Daten mit der folgenden Struktur:

next_page_token string  (optional)

Ein Token, das als „page_token“ gesendet werden kann, um die nächste Seite abzurufen. Wenn leer, gibt es keine nachfolgenden Seiten.

voices array (Voice)  (optional)

Die Stimmen aus der angegebenen Sammlung.

Beispiel

Beispielantwort

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Ruft eine benutzerdefinierte gespeicherte Stimme (`store = true`) anhand des Ressourcennamens ab. Vorgefertigte Katalogstimmen (`VOICE_TYPE_PREBUILT`) können nicht über `GetVoice` abgerufen werden. Verwenden Sie stattdessen `ListVoices`.

Pfad-/Abfrageparameter

voicesId string  (erforderlich)

Erforderlich. Der Ressourcenname der abzurufenden benutzerdefinierten gespeicherten Stimme (z. B. „voices/voice_abc123def456“).

Antwort

Bei Erfolg enthält der Antworttext Daten mit der folgenden Struktur:

accent string  (optional)

Optional. Deskriptor für regionalen Akzent (z. B. „amerikanisch“, „britisch“)

context string  (optional)

Optional. Optimaler Nutzungskontext oder ‑bereich (z. B. „Unterhaltung“, „Hörbuch“, „Nachrichten“)

description string  (optional)

Optional. Eine beschreibende Zusammenfassung von Stimmklang, Persönlichkeit und Ton.

display_name string  (optional)

Optional. Der vom Nutzer angegebene Anzeigename für eine gespeicherte Stimme (`store = true`) oder der Katalognamen für eine vordefinierte Stimme.

expire_time string  (optional)

Nur Ausgabe. Der Zeitstempel, zu dem eine benutzerdefinierte gespeicherte Stimme (`store = true`) oder ein replizierter Stimmschlüssel (`store = false`) abläuft. Nicht festgelegt für integrierte Katalogstimmen („prebuilt“), die nicht ablaufen.

gender string  (optional)

Optional. Wahrgenommene Darstellung des Geschlechts der Stimme (z.B. „weiblich“, „männlich“, „neutral“).

id String  (optional)

Nur Ausgabe. Die eindeutige Kennung der Stimme. * Bei von Google verwalteten benutzerdefinierten Stimmen (`store = true`) ist dies eine generierte ID mit dem Präfix `voice_` (z. B. `voice_abc123def456`). Übergeben Sie `voices/{id}` als `name` in `GetVoice` und `DeleteVoice` und `{id}` direkt an `SpeechConfig.voice_config.voice` (oder `SpeechConfig.voice`) während der Sprachsynthese. * Bei vordefinierten Katalogstimmen (`"prebuilt"`, zurückgegeben von `ListVoices`) ist dies der Name des Sprechers (z. B. `Puck` oder `Charon`). * Nicht festgelegt, wenn `CreateVoice` mit `store = false` aufgerufen wird.

key String  (optional)

Nur Ausgabe. Der vom Client verwaltete Schlüssel für die Sprachreplikation (mit dem Präfix „voicekey_“). Wird nur von „CreateVoice“ zurückgegeben, wenn „type“ auf „replicated“ und „store“ auf „false“ gesetzt ist. Übergeben Sie diesen Schlüssel während der Sprachsynthese an „SpeechConfig.voice_config.voice“ (oder „SpeechConfig.voice“).

language_code string  (optional)

Optional. Primäres BCP-47-Sprachtag (z.B. „en-US“, „fr-FR“).

model string  (optional)

Optional. Das Modell, das zum Erstellen oder Replizieren der Stimme verwendet wurde. Wenn in „CreateVoice“ nicht angegeben, wird standardmäßig das neueste unterstützte Voice Design-Modell verwendet. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für benutzerdefinierte Stimmen (`"prompted"` und `"replicated"`) zurückgegeben; nicht festgelegt für `"prebuilt"`-Stimmen. Erstellte Stimmen können mit jedem unterstützten TTS-Synthesemodell synthetisiert werden.

persona string  (optional)

Optional. Vorgesehene Persona oder Charakterarchetyp (z.B. „Warm, freundlich“, „Erzähler“).

pitch Tonhöhe  (optional)

Optional. Klassifizierung der Stimmlage.

Mögliche Werte

  • low

    Tiefere Stimmlage.

  • medium

    Stimme mit mittlerer Tonhöhe.

  • high

    Höhere Stimmlage.

prompted PromptedVoice  (optional)

Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` auf `"prompted"` gesetzt ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderungen basierende Stimmen zurückgegeben.

Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` gleich `"prompted"` ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderung erstellte Stimmen zurückgegeben.

Felder

input string  (optional)

Erforderlich. Der Prompt in natürlicher Sprache, der die gewünschte Stimme beschreibt, z.B. „Eine tiefe, dröhnende Männerstimme eines riesigen bösen Ogers mittleren Alters“.

region_code string  (optional)

Optional. ISO 3166-1-Alpha-2- oder UN M.49-Code für geografische Regionen (z.B. „US“, „GB“, „001“).

sample_audio AudioData  (optional)

Nur Ausgabe. Beispiel-Audio (Synthesizer-Prompt-Audio), das für eine angeforderte Stimme generiert wurde. Wird nur in `CreateVoice`- und `GetVoice`-Antworten ausgefüllt, wenn `type` auf `"prompted"` festgelegt ist. In `ListVoices`-Antworten und für Stimmen vom Typ `"replicated"` oder `"prebuilt"` ist der Wert nicht festgelegt.

Die Audio-Nutzlast, die zum Erstellen der Stimme verwendet wird.

Felder

data string  (optional)

Erforderlich. Die Rohbyte des Audiosignals.

mime_type string  (optional)

Erforderlich. Der IANA-MIME-Typ der Audiodaten (z. B. „audio/wav“ oder „audio/mpeg“).

type VoiceType  (optional)

Erforderlich. Der Typ der Stimme. In `CreateVoice` muss der Wert `"replicated"` oder `"prompted"` sein. In `ListVoices`-Antworten kann auch `"prebuilt"` verwendet werden.

Mögliche Werte

  • replicated

    Eine benutzerdefinierte Stimme, die aus einem Referenzaudiobeispiel und einer Einwilligungserklärung des Sprechers erstellt wurde.

  • prompted

    Eine benutzerdefinierte Stimme, die aus einem Text-Prompt in natürlicher Sprache generiert wurde.

  • prebuilt

    Eine integrierte Systemstimme aus dem Sprachkatalog von Google (z.B. „Puck“, „Charon“). Wird in Antworten zurückgegeben; kann nicht als Typ in `CreateVoice` angegeben werden.

usage Usage  (optional)

Nur Ausgabe. Statistiken zur Tokennutzung für die Anfrage zur Erstellung von Voice. Wird nur in der Antwort von „CreateVoice“ ausgefüllt, wenn „type“ auf „prompted“ festgelegt ist. Für „replicated“ und in den Antworten von „GetVoice“ und „ListVoices“ ist der Wert nicht festgelegt.

Statistiken zur Tokennutzung der Interaktionsanfrage.

Felder

cached_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von im Cache gespeicherten Tokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

grounding_tool_count array (GroundingToolCount)  (optional)

Anzahl der Fundierungs-Tools.

Die Anzahl der Grounding-Tool-Zählungen.

Felder

count integer  (optional)

Die Anzahl der Fundierungstools.

type enum (string)  (optional)

Der Typ des Grounding-Tools, das mit der Anzahl verknüpft ist.

Mögliche Werte:

  • google_search

    Fundierung mit der Google Websuche und Bildersuche sowie Webfundierung für Unternehmen.

  • google_maps

    Fundierung mit Google Maps.

input_tokens_by_modality Array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von Eingabetokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

output_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von Ausgabetokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

tool_use_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Tokennutzung für die Tool-Verwendung nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

total_cached_tokens integer  (optional)

Anzahl der Tokens im im Cache gespeicherten Teil des Prompts (im Cache gespeicherter Inhalt).

total_input_tokens integer  (optional)

Anzahl der Tokens im Prompt (Kontext).

total_output_tokens integer  (optional)

Gesamtzahl der Tokens in allen generierten Antworten.

total_thought_tokens integer  (optional)

Anzahl der Tokens für Gedanken für Thinking-Modelle.

total_tokens integer  (optional)

Gesamtzahl der Tokens für die Interaktionsanfrage (Prompt + Antworten + andere interne Tokens).

total_tool_use_tokens integer  (optional)

Anzahl der Tokens in den Tool-Nutzungs-Prompts.

Beispiel

Beispielantwort

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Löscht eine benutzerdefinierte gespeicherte Stimme („store“ = „true“) anhand des Ressourcennamens. Vorgefertigte Katalogstimmen (`VOICE_TYPE_PREBUILT`) können nicht gelöscht werden.

Pfad-/Abfrageparameter

voicesId string  (erforderlich)

Erforderlich. Der Ressourcenname der zu löschenden benutzerdefinierten gespeicherten Stimme (z. B. „voices/voice_abc123def456“).

Antwort

Wenn der Vorgang erfolgreich ist, ist die Antwort leer.

Beispiel

Ressourcen

Sprache

Eine Sprachressource, die entweder eine benutzerdefinierte Stimme (erstellt über `CreateVoice`) oder eine vordefinierte Systemstimme (zurückgegeben von `ListVoices`) darstellt.

Felder

accent string  (optional)

Optional. Deskriptor für regionalen Akzent (z. B. „amerikanisch“, „britisch“)

context string  (optional)

Optional. Optimaler Nutzungskontext oder ‑bereich (z. B. „Unterhaltung“, „Hörbuch“, „Nachrichten“)

description string  (optional)

Optional. Eine beschreibende Zusammenfassung von Stimmklang, Persönlichkeit und Ton.

display_name string  (optional)

Optional. Der vom Nutzer angegebene Anzeigename für eine gespeicherte Stimme (`store = true`) oder der Katalognamen für eine vordefinierte Stimme.

expire_time string  (optional)

Nur Ausgabe. Der Zeitstempel, zu dem eine benutzerdefinierte gespeicherte Stimme (`store = true`) oder ein replizierter Stimmschlüssel (`store = false`) abläuft. Nicht festgelegt für integrierte Katalogstimmen („prebuilt“), die nicht ablaufen.

gender string  (optional)

Optional. Wahrgenommene Darstellung des Geschlechts der Stimme (z.B. „weiblich“, „männlich“, „neutral“).

id String  (optional)

Nur Ausgabe. Die eindeutige Kennung der Stimme. * Bei von Google verwalteten benutzerdefinierten Stimmen (`store = true`) ist dies eine generierte ID mit dem Präfix `voice_` (z. B. `voice_abc123def456`). Übergeben Sie `voices/{id}` als `name` in `GetVoice` und `DeleteVoice` und `{id}` direkt an `SpeechConfig.voice_config.voice` (oder `SpeechConfig.voice`) während der Sprachsynthese. * Bei vordefinierten Katalogstimmen (`"prebuilt"`, zurückgegeben von `ListVoices`) ist dies der Name des Sprechers (z. B. `Puck` oder `Charon`). * Nicht festgelegt, wenn `CreateVoice` mit `store = false` aufgerufen wird.

key String  (optional)

Nur Ausgabe. Der vom Client verwaltete Schlüssel für die Sprachreplikation (mit dem Präfix „voicekey_“). Wird nur von „CreateVoice“ zurückgegeben, wenn „type“ auf „replicated“ und „store“ auf „false“ gesetzt ist. Übergeben Sie diesen Schlüssel während der Sprachsynthese an „SpeechConfig.voice_config.voice“ (oder „SpeechConfig.voice“).

language_code string  (optional)

Optional. Primäres BCP-47-Sprachtag (z.B. „en-US“, „fr-FR“).

model string  (optional)

Optional. Das Modell, das zum Erstellen oder Replizieren der Stimme verwendet wurde. Wenn in „CreateVoice“ nicht angegeben, wird standardmäßig das neueste unterstützte Voice Design-Modell verwendet. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für benutzerdefinierte Stimmen (`"prompted"` und `"replicated"`) zurückgegeben; nicht festgelegt für `"prebuilt"`-Stimmen. Erstellte Stimmen können mit jedem unterstützten TTS-Synthesemodell synthetisiert werden.

persona string  (optional)

Optional. Vorgesehene Persona oder Charakterarchetyp (z.B. „Warm, freundlich“, „Erzähler“).

pitch Tonhöhe  (optional)

Optional. Klassifizierung der Stimmlage.

Mögliche Werte

  • low

    Tiefere Stimmlage.

  • medium

    Stimme mit mittlerer Tonhöhe.

  • high

    Höhere Stimmlage.

prompted PromptedVoice  (optional)

Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` gleich `"prompted"` ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderung erstellte Stimmen zurückgegeben.

Parameter für die sprachbasierte Generierung. Erforderlich in `CreateVoice`, wenn `type` gleich `"prompted"` ist. Wird in den Antworten von `CreateVoice`, `GetVoice` und `ListVoices` für auf Aufforderung erstellte Stimmen zurückgegeben.

Felder

input string  (optional)

Erforderlich. Der Prompt in natürlicher Sprache, der die gewünschte Stimme beschreibt, z.B. „Eine tiefe, dröhnende Männerstimme eines riesigen bösen Ogers mittleren Alters“.

region_code string  (optional)

Optional. ISO 3166-1-Alpha-2- oder UN M.49-Code für geografische Regionen (z.B. „US“, „GB“, „001“).

sample_audio AudioData  (optional)

Nur Ausgabe. Beispiel-Audio (Synthesizer-Prompt-Audio), das für eine angeforderte Stimme generiert wurde. Wird nur in `CreateVoice`- und `GetVoice`-Antworten ausgefüllt, wenn `type` auf `"prompted"` festgelegt ist. In `ListVoices`-Antworten und für Stimmen vom Typ `"replicated"` oder `"prebuilt"` ist der Wert nicht festgelegt.

Die Audio-Nutzlast, die zum Erstellen der Stimme verwendet wird.

Felder

data string  (optional)

Erforderlich. Die Rohbyte des Audiosignals.

mime_type string  (optional)

Erforderlich. Der IANA-MIME-Typ der Audiodaten (z. B. „audio/wav“ oder „audio/mpeg“).

type VoiceType  (optional)

Erforderlich. Der Typ der Stimme. In `CreateVoice` muss der Wert `"replicated"` oder `"prompted"` sein. In `ListVoices`-Antworten kann auch `"prebuilt"` verwendet werden.

Mögliche Werte

  • replicated

    Eine benutzerdefinierte Stimme, die aus einem Referenzaudiobeispiel und einer Einwilligungserklärung des Sprechers erstellt wurde.

  • prompted

    Eine benutzerdefinierte Stimme, die aus einem Text-Prompt in natürlicher Sprache generiert wurde.

  • prebuilt

    Eine integrierte Systemstimme aus dem Sprachkatalog von Google (z.B. „Puck“, „Charon“). Wird in Antworten zurückgegeben; kann nicht als Typ in `CreateVoice` angegeben werden.

usage Usage  (optional)

Nur Ausgabe. Statistiken zur Tokennutzung für die Anfrage zur Erstellung von Voice. Wird nur in der Antwort von „CreateVoice“ ausgefüllt, wenn „type“ auf „prompted“ festgelegt ist. Für „replicated“ und in den Antworten von „GetVoice“ und „ListVoices“ ist der Wert nicht festgelegt.

Statistiken zur Tokennutzung der Interaktionsanfrage.

Felder

cached_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von im Cache gespeicherten Tokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

grounding_tool_count array (GroundingToolCount)  (optional)

Anzahl der Fundierungs-Tools.

Die Anzahl der Grounding-Tool-Zählungen.

Felder

count integer  (optional)

Die Anzahl der Fundierungstools.

type enum (string)  (optional)

Der Typ des Grounding-Tools, das mit der Anzahl verknüpft ist.

Mögliche Werte:

  • google_search

    Fundierung mit der Google Websuche und Bildersuche sowie Webfundierung für Unternehmen.

  • google_maps

    Fundierung mit Google Maps.

input_tokens_by_modality Array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von Eingabetokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

output_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Nutzung von Ausgabetokens nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

tool_use_tokens_by_modality array (ModalityTokens)  (optional)

Eine Aufschlüsselung der Tokennutzung für die Tool-Verwendung nach Modalität.

Die Tokenanzahl für eine einzelne Antwortmodalität.

Felder

modality ResponseModality  (optional)

Die mit der Anzahl der Tokens verknüpfte Modalität.

Mögliche Werte

  • text

    Gibt an, dass das Modell Text zurückgeben soll.

  • image

    Gibt an, dass das Modell Bilder zurückgeben soll.

  • audio

    Gibt an, dass das Modell Audio zurückgeben soll.

  • video

    Gibt an, dass das Modell Videos zurückgeben soll.

  • document

    Gibt an, dass das Modell Dokumente zurückgeben soll.

Tokens Ganzzahl  (optional)

Anzahl der Tokens für die Modalität.

total_cached_tokens integer  (optional)

Anzahl der Tokens im im Cache gespeicherten Teil des Prompts (im Cache gespeicherter Inhalt).

total_input_tokens integer  (optional)

Anzahl der Tokens im Prompt (Kontext).

total_output_tokens integer  (optional)

Gesamtzahl der Tokens in allen generierten Antworten.

total_thought_tokens integer  (optional)

Anzahl der Tokens für Gedanken für Thinking-Modelle.

total_tokens integer  (optional)

Gesamtzahl der Tokens für die Interaktionsanfrage (Prompt + Antworten + andere interne Tokens).

total_tool_use_tokens integer  (optional)

Anzahl der Tokens in den Tool-Nutzungs-Prompts.