Gemini Voices API

Interfejs Voices API umożliwia tworzenie głosów niestandardowych na podstawie promptów w języku naturalnym (projektowanie głosu) lub nagrań referencyjnych i nagranych zgód mówcy (replikacja głosu), a także wyświetlanie, pobieranie i zarządzanie głosami niestandardowymi i gotowymi do użycia na potrzeby syntezy mowy (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Tworzy głos niestandardowy na podstawie promptu w języku naturalnym (`VOICE_TYPE_PROMPTED`) lub nagrań dźwiękowych z referencjami i zgodą (`VOICE_TYPE_REPLICATED`).

Treść żądania

Treść żądania zawiera dane o następującej strukturze:

store wartość logiczna  (opcjonalnie)

Opcjonalnie: Określa, czy utworzony głos jest przechowywany i zarządzany przez Google. * Gdy wartość to „true”, Google przechowuje głos i zwraca wartość `Voice.id` (np. `voice_abc123def456`), którą można zarządzać za pomocą funkcji `GetVoice`, `ListVoices` i `DeleteVoice` oraz do której można się odwoływać w żądaniach syntezy za pomocą identyfikatora. Projekty podlegają maksymalnemu limitowi aktywnych zapisanych głosów. Przekroczenie limitu powoduje zwrócenie błędu `RESOURCE_EXHAUSTED`. * Gdy wartość to „false” (domyślnie), głos nie jest przechowywany przez Google, a w przypadku przechowywania i syntezy po stronie klienta zwracany jest element `Voice.key` (np. `voicekey_...`). Opcjonalne pola metadanych wykrywania w przypadku parametru „voice” nie są zapisywane ani zwracane, gdy parametr „store” ma wartość „false”. * Musi mieć wartość „true”, gdy parametr „voice.type” ma wartość „prompted” (w przeciwnym razie zwracany jest błąd „INVALID_ARGUMENT”).

voice Voice  (wymagany)

Wymagane. Głos do utworzenia. Parametr `voice.model` jest opcjonalny. Jeśli go pominiesz, usługa wybierze domyślny model tworzenia głosu. Pola tylko do odczytu w obiekcie `Voice` (`id`, `key`, `expire_time`, `usage`) są ignorowane, jeśli są ustawione.

Odpowiedź

W przypadku powodzenia treść żądania zawiera dane o następującej strukturze:

accent string  (opcjonalnie)

Opcjonalnie: Opis akcentu regionalnego (np. „amerykański”, „brytyjski”).

context string  (opcjonalnie)

Opcjonalnie: Optymalny kontekst lub domena użycia (np. „Konwersacyjny”, „Audiobook”, „Wiadomości”).

description string  (opcjonalnie)

Opcjonalnie: Opis barwy głosu, osobowości i tonu.

display_name string  (opcjonalny)

Opcjonalnie: Wyświetlana nazwa podana przez użytkownika dla zapisanego głosu (`store = true`) lub nazwa katalogu dla gotowego głosu.

expire_time string  (opcjonalny)

Tylko dane wyjściowe. Sygnatura czasowa, po której wygasa niestandardowy zapisany głos (`store = true`) lub skopiowany klucz głosu (`store = false`). Nie ustawiono w przypadku gotowych głosów z katalogu („prebuilt”), które nie wygasają.

gender string  (opcjonalnie)

Opcjonalnie: Prezentacja postrzeganej płci głosu (np. „kobieta”, „mężczyzna”, „neutralna”).

id ciąg znaków  (opcjonalnie)

Tylko dane wyjściowe. Unikalny identyfikator głosu. * W przypadku niestandardowych głosów zarządzanych przez Google (`store = true`) jest to wygenerowany identyfikator z prefiksem `voice_` (np. `voice_abc123def456`). Przekaż `voices/{id}` jako `name` w funkcjach `GetVoice` i `DeleteVoice`, a `{id}` bezpośrednio do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy. * W przypadku gotowych głosów katalogowych (wartość „prebuilt” zwracana przez `ListVoices`) jest to nazwa lektora (np. „Puck” lub „Charon”). * Nieustawione, gdy wywoływana jest funkcja `CreateVoice` z parametrem `store = false`.

key string  (opcjonalnie)

Tylko dane wyjściowe. Klucz replikacji głosu zarządzany przez klienta (z prefiksem `voicekey_`). Zwracany tylko przez `CreateVoice`, gdy `type` ma wartość `"replicated"` i `store` ma wartość `false`. Przekaż ten klucz do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy.

language_code ciąg  (opcjonalny)

Opcjonalnie: Główny tag języka w standardzie BCP-47 (np. „en-US”, „fr-FR”).

model string  (opcjonalnie)

Opcjonalnie: Model użyty do zaprojektowania lub skopiowania głosu. Jeśli ten parametr zostanie pominięty w przypadku funkcji `CreateVoice`, domyślnie zostanie użyty najnowszy obsługiwany model projektu głosu. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów niestandardowych (`"prompted"` i `"replicated"`); nieustawiony w przypadku głosów `"prebuilt"`. Utworzone głosy można syntetyzować w dowolnym obsługiwanym modelu syntezy mowy.

persona string  (opcjonalnie)

Opcjonalnie: Docelowa persona lub archetyp postaci (np. „ciepła, przyjazna”, „narrator”).

pitch Pitch  (opcjonalnie)

Opcjonalnie: Klasyfikacja wysokości głosu.

Dozwolone wartości

  • low

    Głos o niższej tonacji.

  • medium

    Średni ton głosu.

  • high

    Głos o wyższej tonacji.

prompted PromptedVoice  (opcjonalnie)

Parametry generowania głosu na podstawie prompta. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.

Parametry generowania głosu na podstawie promptu. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.

Pola

input string  (opcjonalnie)

Wymagane. Prompt w języku naturalnym opisujący pożądany głos, np. „Głęboki, donośny głos mężczyzny w średnim wieku, który należy do ogromnego, złego ogra”.

region_code ciąg znaków  (opcjonalny)

Opcjonalnie: Kod regionu geograficznego w formacie ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „GB”, „001”).

sample_audio AudioData  (opcjonalnie)

Tylko dane wyjściowe. Próbka dźwięku (dźwięk wygenerowany na podstawie promptu syntezatora) wygenerowana na podstawie promptu głosowego. Wypełniane tylko w odpowiedziach `CreateVoice` i `GetVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w odpowiedziach `ListVoices` oraz w przypadku głosów `"replicated"` lub `"prebuilt"`.

Ładunek audio używany do tworzenia głosu.

Pola

data string  (opcjonalnie)

Wymagane. Surowe bajty audio.

mime_type ciąg znaków  (opcjonalny)

Wymagane. Typ MIME danych audio zgodny z IANA (np. `audio/wav` lub `audio/mpeg`).

type VoiceType  (opcjonalnie)

Wymagane. Typ głosu. W przypadku żądania `CreateVoice` musi mieć wartość `"replicated"` lub `"prompted"`. W odpowiedziach `ListVoices` może też mieć wartość `"prebuilt"`.

Dozwolone wartości

  • replicated

    Niestandardowy głos odtworzony na podstawie próbki referencyjnej dźwięku i nagrania zgody osoby, której głos został wykorzystany.

  • prompted

    Głos niestandardowy wygenerowany na podstawie prompta tekstowego w języku naturalnym.

  • prebuilt

    Wbudowany głos systemowy z katalogu głosów Google (np. `Puck`, `Charon`). Zwracany w odpowiedziach; nie można go określić jako typu w `CreateVoice`.

usage Usage  (opcjonalnie)

Tylko dane wyjściowe. Statystyki wykorzystania tokenów w przypadku żądania utworzenia głosu. Wypełniane tylko w odpowiedzi funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w przypadku wartości `"replicated"` oraz w odpowiedziach funkcji `GetVoice` i `ListVoices`.

Statystyki wykorzystania tokenów przez żądanie interakcji.

Pola

cached_tokens_by_modality array (ModalityTokens)  (optional)

Zestawienie wykorzystania tokenów w pamięci podręcznej według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

grounding_tool_count array (GroundingToolCount)  (opcjonalnie)

Liczba narzędzi do powiązania ze źródłem informacji.

Liczba narzędzi uziemiających.

Pola

count liczba całkowita  (opcjonalnie)

Liczba narzędzi uziemiających.

type enum (string)  (opcjonalnie)

Typ narzędzia do uziemienia powiązany z liczbą.

Możliwe wartości:

  • google_search

    Powiązanie ze źródłem informacji przy użyciu wyszukiwarki Google i wyszukiwarki obrazów oraz powiązanie ze źródłem informacji przy użyciu wyszukiwania w internecie dla firm.

  • google_maps

    Powiązanie ze źródłem informacji przy użyciu Map Google.

input_tokens_by_modality array (ModalityTokens)  (optional)

Zestawienie wykorzystania tokenów wejściowych według rodzaju danych.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

output_tokens_by_modality array (ModalityTokens)  (opcjonalnie)

Zestawienie wykorzystania tokenów wyjściowych według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

tool_use_tokens_by_modality array (ModalityTokens)  (opcjonalny)

Zestawienie wykorzystania tokenów narzędzi według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

total_cached_tokens integer  (opcjonalnie)

Liczba tokenów w części promptu zapisanej w pamięci podręcznej (treści w pamięci podręcznej).

total_input_tokens liczba całkowita  (opcjonalnie)

Liczba tokenów w prompcie (kontekście).

total_output_tokens integer  (opcjonalnie)

Łączna liczba tokenów we wszystkich wygenerowanych odpowiedziach.

total_thought_tokens integer  (opcjonalny)

Liczba tokenów myśli w przypadku modeli myślących.

total_tokens integer  (opcjonalnie)

Łączna liczba tokenów w żądaniu interakcji (prompt + odpowiedzi + inne tokeny wewnętrzne).

total_tool_use_tokens integer  (opcjonalny)

Liczba tokenów w promptach dotyczących korzystania z narzędzi.

Przykład

Przykładowa odpowiedź

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Zawiera listę niestandardowych zapisanych głosów należących do dzwoniącego (uporządkowanych od najnowszych) oraz gotowych głosów systemowych z katalogu głosów Google.

Parametry ścieżki lub zapytania

accent tablica (ciąg znaków)  (opcjonalnie)

Opcjonalnie: Filtruj według opisu akcentu (np. „amerykański”, „brytyjski”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, dopasuje głosy z dowolnym z określonych akcentów (OR).

context tablica (ciąg znaków)  (opcjonalnie)

Opcjonalnie: Filtruj według zamierzonego kontekstu lub domeny (np. „Wiadomości, komercyjne”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, funkcja dopasuje głosy do dowolnego z określonych kontekstów (OR).

gender tablica (ciąg znaków)  (opcjonalnie)

Opcjonalnie: Filtruj według prezentacji płciowej (np. „kobieta”, „mężczyzna”, „neutralna”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podano wiele wartości, funkcja dopasowuje głosy o dowolnej z określonych płci (OR).

language_code tablica (ciąg znaków)  (opcjonalny)

Opcjonalnie: Filtruj według kodu języka BCP-47 (np. „en-US”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, funkcja dopasuje głosy z dowolnym z określonych kodów języka (OR).

page_size integer  (opcjonalnie)

Opcjonalnie: Maksymalna liczba głosów do zwrócenia na stronie. Usługa może zwrócić mniej niż ta wartość. Jeśli nie określono inaczej, zwracanych jest maksymalnie 50 głosów. Maksymalna wartość to 1000. Wartości powyżej 1000 są zaokrąglane do 1000.

page_token ciąg  (opcjonalny)

Opcjonalnie: Token strony otrzymany z poprzedniego wywołania `ListVoices`. Podaj ten token, aby pobrać kolejną stronę. Podczas stronicowania wszystkie parametry zapytania filtra (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` i `search`) muszą być zgodne z wywołaniem, które zwróciło ten token. W przeciwnym razie żądanie zakończy się niepowodzeniem z powodu błędu `INVALID_ARGUMENT`. Wartość `page_size` może się zmieniać między stronami.

persona tablica (ciąg znaków)  (opcjonalnie)

Opcjonalnie: Filtruj według osobowości głosu (np. „Ciepły, przyjazny”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, dopasuje głosy do dowolnej z określonych person (OR).

pitch tablica (ciąg znaków)  (opcjonalnie)

Opcjonalnie: Filtrowanie według wysokości głosu. Akceptuje wartości „low”, „medium”, „high” lub „PITCH_LOW”, „PITCH_MEDIUM”, „PITCH_HIGH” (bez rozróżniania wielkości liter). Jeśli podasz kilka wartości, dopasuje głosy o dowolnej z określonych wysokości (LUB).

region_code tablica (ciąg znaków)  (opcjonalny)

Opcjonalnie: Filtruj według kodu regionu ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „001”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, funkcja dopasuje głosy z dowolnym z określonych kodów regionów (OR).

search ciąg znaków  (opcjonalnie)

Opcjonalnie: Zapytanie wyszukiwania podciągu w formie tekstu swobodnego, które jest dopasowywane bez uwzględniania wielkości liter do pól `display_name` i `description`. Maksymalnie 2048 bajtów.

type tablica (ciąg znaków)  (opcjonalnie)

Opcjonalnie: Filtruj według typu głosu. Akceptuje wartości „prebuilt”, „replicated”, „prompted” lub „VOICE_TYPE_PREBUILT”, „VOICE_TYPE_REPLICATED”, „VOICE_TYPE_PROMPTED” (bez rozróżniania wielkości liter). Jeśli podano wiele wartości, dopasowuje głosy o dowolnym z określonych typów (OR).

Odpowiedź

W przypadku powodzenia treść żądania zawiera dane o następującej strukturze:

next_page_token ciąg znaków  (opcjonalny)

Token, który można wysłać jako „page_token”, aby pobrać następną stronę. Jeśli jest puste, nie ma kolejnych stron.

voices tablica (Voice)  (opcjonalnie)

Głosy z określonej kolekcji.

Przykład

Przykładowa odpowiedź

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Pobiera niestandardowy zapisany głos (`store = true`) według nazwy zasobu. Wstępnie utworzonych głosów z katalogu (`VOICE_TYPE_PREBUILT`) nie można pobrać za pomocą metody `GetVoice`. Zamiast tego użyj metody `ListVoices`.

Parametry ścieżki lub zapytania

voicesId string  (required)

Wymagane. Nazwa zasobu niestandardowego zapisanego głosu do pobrania (np. `voices/voice_abc123def456`).

Odpowiedź

W przypadku powodzenia treść żądania zawiera dane o następującej strukturze:

accent string  (opcjonalnie)

Opcjonalnie: Opis akcentu regionalnego (np. „amerykański”, „brytyjski”).

context string  (opcjonalnie)

Opcjonalnie: Optymalny kontekst lub domena użycia (np. „Konwersacyjny”, „Audiobook”, „Wiadomości”).

description string  (opcjonalnie)

Opcjonalnie: Opis barwy głosu, osobowości i tonu.

display_name string  (opcjonalny)

Opcjonalnie: Wyświetlana nazwa podana przez użytkownika dla zapisanego głosu (`store = true`) lub nazwa katalogu dla gotowego głosu.

expire_time string  (opcjonalny)

Tylko dane wyjściowe. Sygnatura czasowa, po której wygasa niestandardowy zapisany głos (`store = true`) lub skopiowany klucz głosu (`store = false`). Nie ustawiono w przypadku gotowych głosów z katalogu („prebuilt”), które nie wygasają.

gender string  (opcjonalnie)

Opcjonalnie: Prezentacja postrzeganej płci głosu (np. „kobieta”, „mężczyzna”, „neutralna”).

id ciąg znaków  (opcjonalnie)

Tylko dane wyjściowe. Unikalny identyfikator głosu. * W przypadku niestandardowych głosów zarządzanych przez Google (`store = true`) jest to wygenerowany identyfikator z prefiksem `voice_` (np. `voice_abc123def456`). Przekaż `voices/{id}` jako `name` w funkcjach `GetVoice` i `DeleteVoice`, a `{id}` bezpośrednio do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy. * W przypadku gotowych głosów katalogowych (wartość „prebuilt” zwracana przez `ListVoices`) jest to nazwa lektora (np. „Puck” lub „Charon”). * Nieustawione, gdy wywoływana jest funkcja `CreateVoice` z parametrem `store = false`.

key string  (opcjonalnie)

Tylko dane wyjściowe. Klucz replikacji głosu zarządzany przez klienta (z prefiksem `voicekey_`). Zwracany tylko przez `CreateVoice`, gdy `type` ma wartość `"replicated"` i `store` ma wartość `false`. Przekaż ten klucz do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy.

language_code ciąg  (opcjonalny)

Opcjonalnie: Główny tag języka w standardzie BCP-47 (np. „en-US”, „fr-FR”).

model string  (opcjonalnie)

Opcjonalnie: Model użyty do zaprojektowania lub skopiowania głosu. Jeśli ten parametr zostanie pominięty w przypadku funkcji `CreateVoice`, domyślnie zostanie użyty najnowszy obsługiwany model projektu głosu. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów niestandardowych (`"prompted"` i `"replicated"`); nieustawiony w przypadku głosów `"prebuilt"`. Utworzone głosy można syntetyzować w dowolnym obsługiwanym modelu syntezy mowy.

persona string  (opcjonalnie)

Opcjonalnie: Docelowa persona lub archetyp postaci (np. „ciepła, przyjazna”, „narrator”).

pitch Pitch  (opcjonalnie)

Opcjonalnie: Klasyfikacja wysokości głosu.

Dozwolone wartości

  • low

    Głos o niższej tonacji.

  • medium

    Średni ton głosu.

  • high

    Głos o wyższej tonacji.

prompted PromptedVoice  (opcjonalnie)

Parametry generowania głosu na podstawie prompta. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.

Parametry generowania głosu na podstawie promptu. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.

Pola

input string  (opcjonalnie)

Wymagane. Prompt w języku naturalnym opisujący pożądany głos, np. „Głęboki, donośny głos mężczyzny w średnim wieku, który należy do ogromnego, złego ogra”.

region_code ciąg znaków  (opcjonalny)

Opcjonalnie: Kod regionu geograficznego w formacie ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „GB”, „001”).

sample_audio AudioData  (opcjonalnie)

Tylko dane wyjściowe. Próbka dźwięku (dźwięk wygenerowany na podstawie promptu syntezatora) wygenerowana na podstawie promptu głosowego. Wypełniane tylko w odpowiedziach `CreateVoice` i `GetVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w odpowiedziach `ListVoices` oraz w przypadku głosów `"replicated"` lub `"prebuilt"`.

Ładunek audio używany do tworzenia głosu.

Pola

data string  (opcjonalnie)

Wymagane. Surowe bajty audio.

mime_type ciąg znaków  (opcjonalny)

Wymagane. Typ MIME danych audio zgodny z IANA (np. `audio/wav` lub `audio/mpeg`).

type VoiceType  (opcjonalnie)

Wymagane. Typ głosu. W przypadku żądania `CreateVoice` musi mieć wartość `"replicated"` lub `"prompted"`. W odpowiedziach `ListVoices` może też mieć wartość `"prebuilt"`.

Dozwolone wartości

  • replicated

    Niestandardowy głos odtworzony na podstawie próbki referencyjnej dźwięku i nagrania zgody osoby, której głos został wykorzystany.

  • prompted

    Głos niestandardowy wygenerowany na podstawie prompta tekstowego w języku naturalnym.

  • prebuilt

    Wbudowany głos systemowy z katalogu głosów Google (np. `Puck`, `Charon`). Zwracany w odpowiedziach; nie można go określić jako typu w `CreateVoice`.

usage Usage  (opcjonalnie)

Tylko dane wyjściowe. Statystyki wykorzystania tokenów w przypadku żądania utworzenia głosu. Wypełniane tylko w odpowiedzi funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w przypadku wartości `"replicated"` oraz w odpowiedziach funkcji `GetVoice` i `ListVoices`.

Statystyki wykorzystania tokenów przez żądanie interakcji.

Pola

cached_tokens_by_modality array (ModalityTokens)  (optional)

Zestawienie wykorzystania tokenów w pamięci podręcznej według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

grounding_tool_count array (GroundingToolCount)  (opcjonalnie)

Liczba narzędzi do powiązania ze źródłem informacji.

Liczba narzędzi uziemiających.

Pola

count liczba całkowita  (opcjonalnie)

Liczba narzędzi uziemiających.

type enum (string)  (opcjonalnie)

Typ narzędzia do uziemienia powiązany z liczbą.

Możliwe wartości:

  • google_search

    Powiązanie ze źródłem informacji przy użyciu wyszukiwarki Google i wyszukiwarki obrazów oraz powiązanie ze źródłem informacji przy użyciu wyszukiwania w internecie dla firm.

  • google_maps

    Powiązanie ze źródłem informacji przy użyciu Map Google.

input_tokens_by_modality array (ModalityTokens)  (optional)

Zestawienie wykorzystania tokenów wejściowych według rodzaju danych.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

output_tokens_by_modality array (ModalityTokens)  (opcjonalnie)

Zestawienie wykorzystania tokenów wyjściowych według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

tool_use_tokens_by_modality array (ModalityTokens)  (opcjonalny)

Zestawienie wykorzystania tokenów narzędzi według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

total_cached_tokens integer  (opcjonalnie)

Liczba tokenów w części promptu zapisanej w pamięci podręcznej (treści w pamięci podręcznej).

total_input_tokens liczba całkowita  (opcjonalnie)

Liczba tokenów w prompcie (kontekście).

total_output_tokens integer  (opcjonalnie)

Łączna liczba tokenów we wszystkich wygenerowanych odpowiedziach.

total_thought_tokens integer  (opcjonalny)

Liczba tokenów myśli w przypadku modeli myślących.

total_tokens integer  (opcjonalnie)

Łączna liczba tokenów w żądaniu interakcji (prompt + odpowiedzi + inne tokeny wewnętrzne).

total_tool_use_tokens integer  (opcjonalny)

Liczba tokenów w promptach dotyczących korzystania z narzędzi.

Przykład

Przykładowa odpowiedź

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Usuwa niestandardowy zapisany głos (`store = true`) według nazwy zasobu. Wstępnie utworzonych głosów katalogowych (`VOICE_TYPE_PREBUILT`) nie można usuwać.

Parametry ścieżki lub zapytania

voicesId string  (required)

Wymagane. Nazwa zasobu niestandardowego zapisanego głosu do usunięcia (np. `voices/voice_abc123def456`).

Odpowiedź

Jeśli operacja się uda, odpowiedź będzie pusta.

Przykład

Zasoby

Głos

Zasób głosowy reprezentujący głos niestandardowy (utworzony za pomocą funkcji `CreateVoice`) lub gotowy głos systemowy (zwrócony przez funkcję `ListVoices`).

Pola

accent string  (opcjonalnie)

Opcjonalnie: Opis akcentu regionalnego (np. „amerykański”, „brytyjski”).

context string  (opcjonalnie)

Opcjonalnie: Optymalny kontekst lub domena użycia (np. „Konwersacyjny”, „Audiobook”, „Wiadomości”).

description string  (opcjonalnie)

Opcjonalnie: Opis barwy głosu, osobowości i tonu.

display_name string  (opcjonalny)

Opcjonalnie: Wyświetlana nazwa podana przez użytkownika dla zapisanego głosu (`store = true`) lub nazwa katalogu dla gotowego głosu.

expire_time string  (opcjonalny)

Tylko dane wyjściowe. Sygnatura czasowa, po której wygasa niestandardowy zapisany głos (`store = true`) lub skopiowany klucz głosu (`store = false`). Nie ustawiono w przypadku gotowych głosów z katalogu („prebuilt”), które nie wygasają.

gender string  (opcjonalnie)

Opcjonalnie: Prezentacja postrzeganej płci głosu (np. „kobieta”, „mężczyzna”, „neutralna”).

id ciąg znaków  (opcjonalnie)

Tylko dane wyjściowe. Unikalny identyfikator głosu. * W przypadku niestandardowych głosów zarządzanych przez Google (`store = true`) jest to wygenerowany identyfikator z prefiksem `voice_` (np. `voice_abc123def456`). Przekaż `voices/{id}` jako `name` w funkcjach `GetVoice` i `DeleteVoice`, a `{id}` bezpośrednio do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy. * W przypadku gotowych głosów katalogowych (wartość „prebuilt” zwracana przez `ListVoices`) jest to nazwa lektora (np. „Puck” lub „Charon”). * Nieustawione, gdy wywoływana jest funkcja `CreateVoice` z parametrem `store = false`.

key string  (opcjonalnie)

Tylko dane wyjściowe. Klucz replikacji głosu zarządzany przez klienta (z prefiksem `voicekey_`). Zwracany tylko przez `CreateVoice`, gdy `type` ma wartość `"replicated"` i `store` ma wartość `false`. Przekaż ten klucz do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy.

language_code ciąg  (opcjonalny)

Opcjonalnie: Główny tag języka w standardzie BCP-47 (np. „en-US”, „fr-FR”).

model string  (opcjonalnie)

Opcjonalnie: Model użyty do zaprojektowania lub skopiowania głosu. Jeśli ten parametr zostanie pominięty w przypadku funkcji `CreateVoice`, domyślnie zostanie użyty najnowszy obsługiwany model projektu głosu. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów niestandardowych (`"prompted"` i `"replicated"`); nieustawiony w przypadku głosów `"prebuilt"`. Utworzone głosy można syntetyzować w dowolnym obsługiwanym modelu syntezy mowy.

persona string  (opcjonalnie)

Opcjonalnie: Docelowa persona lub archetyp postaci (np. „ciepła, przyjazna”, „narrator”).

pitch Pitch  (opcjonalnie)

Opcjonalnie: Klasyfikacja wysokości głosu.

Dozwolone wartości

  • low

    Głos o niższej tonacji.

  • medium

    Średni ton głosu.

  • high

    Głos o wyższej tonacji.

prompted PromptedVoice  (opcjonalnie)

Parametry generowania głosu na podstawie promptu. Wymagany w przypadku wywołania `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.

Parametry generowania głosu na podstawie promptu. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.

Pola

input string  (opcjonalnie)

Wymagane. Prompt w języku naturalnym opisujący pożądany głos, np. „Głęboki, donośny głos mężczyzny w średnim wieku, który należy do ogromnego, złego ogra”.

region_code ciąg znaków  (opcjonalny)

Opcjonalnie: Kod regionu geograficznego w formacie ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „GB”, „001”).

sample_audio AudioData  (opcjonalny)

Tylko dane wyjściowe. Próbka dźwięku (dźwięk wygenerowany na podstawie promptu syntezatora) wygenerowana na podstawie promptu głosowego. Wypełniane tylko w odpowiedziach `CreateVoice` i `GetVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w odpowiedziach `ListVoices` oraz w przypadku głosów `"replicated"` lub `"prebuilt"`.

Ładunek audio używany do tworzenia głosu.

Pola

data string  (opcjonalnie)

Wymagane. Surowe bajty audio.

mime_type ciąg znaków  (opcjonalny)

Wymagane. Typ MIME danych audio zgodny z IANA (np. `audio/wav` lub `audio/mpeg`).

type VoiceType  (opcjonalnie)

Wymagane. Typ głosu. W przypadku żądania `CreateVoice` musi mieć wartość `"replicated"` lub `"prompted"`. W odpowiedziach `ListVoices` może też mieć wartość `"prebuilt"`.

Dozwolone wartości

  • replicated

    Niestandardowy głos odtworzony na podstawie próbki referencyjnej dźwięku i nagrania zgody osoby, której głos został wykorzystany.

  • prompted

    Głos niestandardowy wygenerowany na podstawie prompta tekstowego w języku naturalnym.

  • prebuilt

    Wbudowany głos systemowy z katalogu głosów Google (np. `Puck`, `Charon`). Zwracany w odpowiedziach; nie można go określić jako typu w metodzie `CreateVoice`.

usage Usage  (opcjonalnie)

Tylko dane wyjściowe. Statystyki wykorzystania tokenów w przypadku żądania utworzenia głosu. Wypełniane tylko w odpowiedzi funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w przypadku wartości `"replicated"` oraz w odpowiedziach funkcji `GetVoice` i `ListVoices`.

Statystyki wykorzystania tokenów przez żądanie interakcji.

Pola

cached_tokens_by_modality array (ModalityTokens)  (optional)

Zestawienie wykorzystania tokenów w pamięci podręcznej według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

grounding_tool_count array (GroundingToolCount)  (opcjonalnie)

Liczba narzędzi do powiązania ze źródłem informacji.

Liczba narzędzi uziemiających.

Pola

count liczba całkowita  (opcjonalnie)

Liczba narzędzi uziemiających.

type enum (string)  (opcjonalnie)

Typ narzędzia do uziemienia powiązany z liczbą.

Możliwe wartości:

  • google_search

    Powiązanie ze źródłem informacji przy użyciu wyszukiwarki Google i wyszukiwarki obrazów oraz powiązanie ze źródłem informacji przy użyciu wyszukiwania w internecie dla firm.

  • google_maps

    Powiązanie ze źródłem informacji przy użyciu Map Google.

input_tokens_by_modality array (ModalityTokens)  (optional)

Zestawienie wykorzystania tokenów wejściowych według rodzaju danych.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

output_tokens_by_modality array (ModalityTokens)  (opcjonalnie)

Zestawienie wykorzystania tokenów wyjściowych według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

tool_use_tokens_by_modality array (ModalityTokens)  (opcjonalny)

Zestawienie wykorzystania tokenów narzędzi według rodzaju.

Liczba tokenów dla pojedynczej modalności odpowiedzi.

Pola

modality ResponseModality  (opcjonalnie)

Rodzaj powiązany z liczbą tokenów.

Dozwolone wartości

  • text

    Wskazuje, że model powinien zwrócić tekst.

  • image

    Wskazuje, że model powinien zwracać obrazy.

  • audio

    Wskazuje, że model powinien zwrócić dźwięk.

  • video

    Wskazuje, że model powinien zwrócić film.

  • document

    Wskazuje, że model powinien zwracać dokumenty.

tokens integer  (opcjonalnie)

Liczba tokenów dla danego rodzaju danych.

total_cached_tokens integer  (opcjonalnie)

Liczba tokenów w części promptu zapisanej w pamięci podręcznej (treści w pamięci podręcznej).

total_input_tokens liczba całkowita  (opcjonalnie)

Liczba tokenów w prompcie (kontekście).

total_output_tokens integer  (opcjonalnie)

Łączna liczba tokenów we wszystkich wygenerowanych odpowiedziach.

total_thought_tokens integer  (opcjonalny)

Liczba tokenów myśli w przypadku modeli myślących.

total_tokens integer  (opcjonalnie)

Łączna liczba tokenów w żądaniu interakcji (prompt + odpowiedzi + inne tokeny wewnętrzne).

total_tool_use_tokens integer  (opcjonalny)

Liczba tokenów w promptach dotyczących korzystania z narzędzi.