Interfejs Voices API umożliwia tworzenie głosów niestandardowych na podstawie promptów w języku naturalnym (projektowanie głosu) lub nagrań referencyjnych i nagranych zgód mówcy (replikacja głosu), a także wyświetlanie, pobieranie i zarządzanie głosami niestandardowymi i gotowymi do użycia na potrzeby syntezy mowy (TTS).
CreateVoice
Tworzy głos niestandardowy na podstawie promptu w języku naturalnym (`VOICE_TYPE_PROMPTED`) lub nagrań dźwiękowych z referencjami i zgodą (`VOICE_TYPE_REPLICATED`).
Treść żądania
Treść żądania zawiera dane o następującej strukturze:
Opcjonalnie: Określa, czy utworzony głos jest przechowywany i zarządzany przez Google. * Gdy wartość to „true”, Google przechowuje głos i zwraca wartość `Voice.id` (np. `voice_abc123def456`), którą można zarządzać za pomocą funkcji `GetVoice`, `ListVoices` i `DeleteVoice` oraz do której można się odwoływać w żądaniach syntezy za pomocą identyfikatora. Projekty podlegają maksymalnemu limitowi aktywnych zapisanych głosów. Przekroczenie limitu powoduje zwrócenie błędu `RESOURCE_EXHAUSTED`. * Gdy wartość to „false” (domyślnie), głos nie jest przechowywany przez Google, a w przypadku przechowywania i syntezy po stronie klienta zwracany jest element `Voice.key` (np. `voicekey_...`). Opcjonalne pola metadanych wykrywania w przypadku parametru „voice” nie są zapisywane ani zwracane, gdy parametr „store” ma wartość „false”. * Musi mieć wartość „true”, gdy parametr „voice.type” ma wartość „prompted” (w przeciwnym razie zwracany jest błąd „INVALID_ARGUMENT”).
Wymagane. Głos do utworzenia. Parametr `voice.model` jest opcjonalny. Jeśli go pominiesz, usługa wybierze domyślny model tworzenia głosu. Pola tylko do odczytu w obiekcie `Voice` (`id`, `key`, `expire_time`, `usage`) są ignorowane, jeśli są ustawione.
Odpowiedź
W przypadku powodzenia treść żądania zawiera dane o następującej strukturze:
Opcjonalnie: Opis akcentu regionalnego (np. „amerykański”, „brytyjski”).
Opcjonalnie: Optymalny kontekst lub domena użycia (np. „Konwersacyjny”, „Audiobook”, „Wiadomości”).
Opcjonalnie: Opis barwy głosu, osobowości i tonu.
Opcjonalnie: Wyświetlana nazwa podana przez użytkownika dla zapisanego głosu (`store = true`) lub nazwa katalogu dla gotowego głosu.
Tylko dane wyjściowe. Sygnatura czasowa, po której wygasa niestandardowy zapisany głos (`store = true`) lub skopiowany klucz głosu (`store = false`). Nie ustawiono w przypadku gotowych głosów z katalogu („prebuilt”), które nie wygasają.
Opcjonalnie: Prezentacja postrzeganej płci głosu (np. „kobieta”, „mężczyzna”, „neutralna”).
Tylko dane wyjściowe. Unikalny identyfikator głosu. * W przypadku niestandardowych głosów zarządzanych przez Google (`store = true`) jest to wygenerowany identyfikator z prefiksem `voice_` (np. `voice_abc123def456`). Przekaż `voices/{id}` jako `name` w funkcjach `GetVoice` i `DeleteVoice`, a `{id}` bezpośrednio do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy. * W przypadku gotowych głosów katalogowych (wartość „prebuilt” zwracana przez `ListVoices`) jest to nazwa lektora (np. „Puck” lub „Charon”). * Nieustawione, gdy wywoływana jest funkcja `CreateVoice` z parametrem `store = false`.
Tylko dane wyjściowe. Klucz replikacji głosu zarządzany przez klienta (z prefiksem `voicekey_`). Zwracany tylko przez `CreateVoice`, gdy `type` ma wartość `"replicated"` i `store` ma wartość `false`. Przekaż ten klucz do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy.
Opcjonalnie: Główny tag języka w standardzie BCP-47 (np. „en-US”, „fr-FR”).
Opcjonalnie: Model użyty do zaprojektowania lub skopiowania głosu. Jeśli ten parametr zostanie pominięty w przypadku funkcji `CreateVoice`, domyślnie zostanie użyty najnowszy obsługiwany model projektu głosu. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów niestandardowych (`"prompted"` i `"replicated"`); nieustawiony w przypadku głosów `"prebuilt"`. Utworzone głosy można syntetyzować w dowolnym obsługiwanym modelu syntezy mowy.
Opcjonalnie: Docelowa persona lub archetyp postaci (np. „ciepła, przyjazna”, „narrator”).
pitch Pitch (opcjonalnie)
Opcjonalnie: Klasyfikacja wysokości głosu.
Dozwolone wartości
-
lowGłos o niższej tonacji.
-
mediumŚredni ton głosu.
-
highGłos o wyższej tonacji.
prompted PromptedVoice (opcjonalnie)
Parametry generowania głosu na podstawie prompta. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.
Pola
Wymagane. Prompt w języku naturalnym opisujący pożądany głos, np. „Głęboki, donośny głos mężczyzny w średnim wieku, który należy do ogromnego, złego ogra”.
Opcjonalnie: Kod regionu geograficznego w formacie ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „GB”, „001”).
sample_audio AudioData (opcjonalnie)
Tylko dane wyjściowe. Próbka dźwięku (dźwięk wygenerowany na podstawie promptu syntezatora) wygenerowana na podstawie promptu głosowego. Wypełniane tylko w odpowiedziach `CreateVoice` i `GetVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w odpowiedziach `ListVoices` oraz w przypadku głosów `"replicated"` lub `"prebuilt"`.
Pola
Wymagane. Surowe bajty audio.
Wymagane. Typ MIME danych audio zgodny z IANA (np. `audio/wav` lub `audio/mpeg`).
type VoiceType (opcjonalnie)
Wymagane. Typ głosu. W przypadku żądania `CreateVoice` musi mieć wartość `"replicated"` lub `"prompted"`. W odpowiedziach `ListVoices` może też mieć wartość `"prebuilt"`.
Dozwolone wartości
-
replicatedNiestandardowy głos odtworzony na podstawie próbki referencyjnej dźwięku i nagrania zgody osoby, której głos został wykorzystany.
-
promptedGłos niestandardowy wygenerowany na podstawie prompta tekstowego w języku naturalnym.
-
prebuiltWbudowany głos systemowy z katalogu głosów Google (np. `Puck`, `Charon`). Zwracany w odpowiedziach; nie można go określić jako typu w `CreateVoice`.
usage Usage (opcjonalnie)
Tylko dane wyjściowe. Statystyki wykorzystania tokenów w przypadku żądania utworzenia głosu. Wypełniane tylko w odpowiedzi funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w przypadku wartości `"replicated"` oraz w odpowiedziach funkcji `GetVoice` i `ListVoices`.
Pola
cached_tokens_by_modality array (ModalityTokens) (optional)
Zestawienie wykorzystania tokenów w pamięci podręcznej według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
grounding_tool_count array (GroundingToolCount) (opcjonalnie)
Liczba narzędzi do powiązania ze źródłem informacji.
Pola
Liczba narzędzi uziemiających.
Typ narzędzia do uziemienia powiązany z liczbą.
Możliwe wartości:
-
google_searchPowiązanie ze źródłem informacji przy użyciu wyszukiwarki Google i wyszukiwarki obrazów oraz powiązanie ze źródłem informacji przy użyciu wyszukiwania w internecie dla firm.
-
google_mapsPowiązanie ze źródłem informacji przy użyciu Map Google.
input_tokens_by_modality array (ModalityTokens) (optional)
Zestawienie wykorzystania tokenów wejściowych według rodzaju danych.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
output_tokens_by_modality array (ModalityTokens) (opcjonalnie)
Zestawienie wykorzystania tokenów wyjściowych według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
tool_use_tokens_by_modality array (ModalityTokens) (opcjonalny)
Zestawienie wykorzystania tokenów narzędzi według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
Liczba tokenów w części promptu zapisanej w pamięci podręcznej (treści w pamięci podręcznej).
Liczba tokenów w prompcie (kontekście).
Łączna liczba tokenów we wszystkich wygenerowanych odpowiedziach.
Liczba tokenów myśli w przypadku modeli myślących.
Łączna liczba tokenów w żądaniu interakcji (prompt + odpowiedzi + inne tokeny wewnętrzne).
Liczba tokenów w promptach dotyczących korzystania z narzędzi.
Przykład
Przykładowa odpowiedź
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Zawiera listę niestandardowych zapisanych głosów należących do dzwoniącego (uporządkowanych od najnowszych) oraz gotowych głosów systemowych z katalogu głosów Google.
Parametry ścieżki lub zapytania
Opcjonalnie: Filtruj według opisu akcentu (np. „amerykański”, „brytyjski”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, dopasuje głosy z dowolnym z określonych akcentów (OR).
Opcjonalnie: Filtruj według zamierzonego kontekstu lub domeny (np. „Wiadomości, komercyjne”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, funkcja dopasuje głosy do dowolnego z określonych kontekstów (OR).
Opcjonalnie: Filtruj według prezentacji płciowej (np. „kobieta”, „mężczyzna”, „neutralna”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podano wiele wartości, funkcja dopasowuje głosy o dowolnej z określonych płci (OR).
Opcjonalnie: Filtruj według kodu języka BCP-47 (np. „en-US”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, funkcja dopasuje głosy z dowolnym z określonych kodów języka (OR).
Opcjonalnie: Maksymalna liczba głosów do zwrócenia na stronie. Usługa może zwrócić mniej niż ta wartość. Jeśli nie określono inaczej, zwracanych jest maksymalnie 50 głosów. Maksymalna wartość to 1000. Wartości powyżej 1000 są zaokrąglane do 1000.
Opcjonalnie: Token strony otrzymany z poprzedniego wywołania `ListVoices`. Podaj ten token, aby pobrać kolejną stronę. Podczas stronicowania wszystkie parametry zapytania filtra (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` i `search`) muszą być zgodne z wywołaniem, które zwróciło ten token. W przeciwnym razie żądanie zakończy się niepowodzeniem z powodu błędu `INVALID_ARGUMENT`. Wartość `page_size` może się zmieniać między stronami.
Opcjonalnie: Filtruj według osobowości głosu (np. „Ciepły, przyjazny”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, dopasuje głosy do dowolnej z określonych person (OR).
Opcjonalnie: Filtrowanie według wysokości głosu. Akceptuje wartości „low”, „medium”, „high” lub „PITCH_LOW”, „PITCH_MEDIUM”, „PITCH_HIGH” (bez rozróżniania wielkości liter). Jeśli podasz kilka wartości, dopasuje głosy o dowolnej z określonych wysokości (LUB).
Opcjonalnie: Filtruj według kodu regionu ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „001”). Dopasowanie ścisłe bez rozróżniania wielkości liter. Jeśli podasz kilka wartości, funkcja dopasuje głosy z dowolnym z określonych kodów regionów (OR).
Opcjonalnie: Zapytanie wyszukiwania podciągu w formie tekstu swobodnego, które jest dopasowywane bez uwzględniania wielkości liter do pól `display_name` i `description`. Maksymalnie 2048 bajtów.
Opcjonalnie: Filtruj według typu głosu. Akceptuje wartości „prebuilt”, „replicated”, „prompted” lub „VOICE_TYPE_PREBUILT”, „VOICE_TYPE_REPLICATED”, „VOICE_TYPE_PROMPTED” (bez rozróżniania wielkości liter). Jeśli podano wiele wartości, dopasowuje głosy o dowolnym z określonych typów (OR).
Odpowiedź
W przypadku powodzenia treść żądania zawiera dane o następującej strukturze:
Token, który można wysłać jako „page_token”, aby pobrać następną stronę. Jeśli jest puste, nie ma kolejnych stron.
Głosy z określonej kolekcji.
Przykład
Przykładowa odpowiedź
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Pobiera niestandardowy zapisany głos (`store = true`) według nazwy zasobu. Wstępnie utworzonych głosów z katalogu (`VOICE_TYPE_PREBUILT`) nie można pobrać za pomocą metody `GetVoice`. Zamiast tego użyj metody `ListVoices`.
Parametry ścieżki lub zapytania
Wymagane. Nazwa zasobu niestandardowego zapisanego głosu do pobrania (np. `voices/voice_abc123def456`).
Odpowiedź
W przypadku powodzenia treść żądania zawiera dane o następującej strukturze:
Opcjonalnie: Opis akcentu regionalnego (np. „amerykański”, „brytyjski”).
Opcjonalnie: Optymalny kontekst lub domena użycia (np. „Konwersacyjny”, „Audiobook”, „Wiadomości”).
Opcjonalnie: Opis barwy głosu, osobowości i tonu.
Opcjonalnie: Wyświetlana nazwa podana przez użytkownika dla zapisanego głosu (`store = true`) lub nazwa katalogu dla gotowego głosu.
Tylko dane wyjściowe. Sygnatura czasowa, po której wygasa niestandardowy zapisany głos (`store = true`) lub skopiowany klucz głosu (`store = false`). Nie ustawiono w przypadku gotowych głosów z katalogu („prebuilt”), które nie wygasają.
Opcjonalnie: Prezentacja postrzeganej płci głosu (np. „kobieta”, „mężczyzna”, „neutralna”).
Tylko dane wyjściowe. Unikalny identyfikator głosu. * W przypadku niestandardowych głosów zarządzanych przez Google (`store = true`) jest to wygenerowany identyfikator z prefiksem `voice_` (np. `voice_abc123def456`). Przekaż `voices/{id}` jako `name` w funkcjach `GetVoice` i `DeleteVoice`, a `{id}` bezpośrednio do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy. * W przypadku gotowych głosów katalogowych (wartość „prebuilt” zwracana przez `ListVoices`) jest to nazwa lektora (np. „Puck” lub „Charon”). * Nieustawione, gdy wywoływana jest funkcja `CreateVoice` z parametrem `store = false`.
Tylko dane wyjściowe. Klucz replikacji głosu zarządzany przez klienta (z prefiksem `voicekey_`). Zwracany tylko przez `CreateVoice`, gdy `type` ma wartość `"replicated"` i `store` ma wartość `false`. Przekaż ten klucz do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy.
Opcjonalnie: Główny tag języka w standardzie BCP-47 (np. „en-US”, „fr-FR”).
Opcjonalnie: Model użyty do zaprojektowania lub skopiowania głosu. Jeśli ten parametr zostanie pominięty w przypadku funkcji `CreateVoice`, domyślnie zostanie użyty najnowszy obsługiwany model projektu głosu. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów niestandardowych (`"prompted"` i `"replicated"`); nieustawiony w przypadku głosów `"prebuilt"`. Utworzone głosy można syntetyzować w dowolnym obsługiwanym modelu syntezy mowy.
Opcjonalnie: Docelowa persona lub archetyp postaci (np. „ciepła, przyjazna”, „narrator”).
pitch Pitch (opcjonalnie)
Opcjonalnie: Klasyfikacja wysokości głosu.
Dozwolone wartości
-
lowGłos o niższej tonacji.
-
mediumŚredni ton głosu.
-
highGłos o wyższej tonacji.
prompted PromptedVoice (opcjonalnie)
Parametry generowania głosu na podstawie prompta. Wymagany w przypadku funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach funkcji `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.
Pola
Wymagane. Prompt w języku naturalnym opisujący pożądany głos, np. „Głęboki, donośny głos mężczyzny w średnim wieku, który należy do ogromnego, złego ogra”.
Opcjonalnie: Kod regionu geograficznego w formacie ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „GB”, „001”).
sample_audio AudioData (opcjonalnie)
Tylko dane wyjściowe. Próbka dźwięku (dźwięk wygenerowany na podstawie promptu syntezatora) wygenerowana na podstawie promptu głosowego. Wypełniane tylko w odpowiedziach `CreateVoice` i `GetVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w odpowiedziach `ListVoices` oraz w przypadku głosów `"replicated"` lub `"prebuilt"`.
Pola
Wymagane. Surowe bajty audio.
Wymagane. Typ MIME danych audio zgodny z IANA (np. `audio/wav` lub `audio/mpeg`).
type VoiceType (opcjonalnie)
Wymagane. Typ głosu. W przypadku żądania `CreateVoice` musi mieć wartość `"replicated"` lub `"prompted"`. W odpowiedziach `ListVoices` może też mieć wartość `"prebuilt"`.
Dozwolone wartości
-
replicatedNiestandardowy głos odtworzony na podstawie próbki referencyjnej dźwięku i nagrania zgody osoby, której głos został wykorzystany.
-
promptedGłos niestandardowy wygenerowany na podstawie prompta tekstowego w języku naturalnym.
-
prebuiltWbudowany głos systemowy z katalogu głosów Google (np. `Puck`, `Charon`). Zwracany w odpowiedziach; nie można go określić jako typu w `CreateVoice`.
usage Usage (opcjonalnie)
Tylko dane wyjściowe. Statystyki wykorzystania tokenów w przypadku żądania utworzenia głosu. Wypełniane tylko w odpowiedzi funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w przypadku wartości `"replicated"` oraz w odpowiedziach funkcji `GetVoice` i `ListVoices`.
Pola
cached_tokens_by_modality array (ModalityTokens) (optional)
Zestawienie wykorzystania tokenów w pamięci podręcznej według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
grounding_tool_count array (GroundingToolCount) (opcjonalnie)
Liczba narzędzi do powiązania ze źródłem informacji.
Pola
Liczba narzędzi uziemiających.
Typ narzędzia do uziemienia powiązany z liczbą.
Możliwe wartości:
-
google_searchPowiązanie ze źródłem informacji przy użyciu wyszukiwarki Google i wyszukiwarki obrazów oraz powiązanie ze źródłem informacji przy użyciu wyszukiwania w internecie dla firm.
-
google_mapsPowiązanie ze źródłem informacji przy użyciu Map Google.
input_tokens_by_modality array (ModalityTokens) (optional)
Zestawienie wykorzystania tokenów wejściowych według rodzaju danych.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
output_tokens_by_modality array (ModalityTokens) (opcjonalnie)
Zestawienie wykorzystania tokenów wyjściowych według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
tool_use_tokens_by_modality array (ModalityTokens) (opcjonalny)
Zestawienie wykorzystania tokenów narzędzi według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
Liczba tokenów w części promptu zapisanej w pamięci podręcznej (treści w pamięci podręcznej).
Liczba tokenów w prompcie (kontekście).
Łączna liczba tokenów we wszystkich wygenerowanych odpowiedziach.
Liczba tokenów myśli w przypadku modeli myślących.
Łączna liczba tokenów w żądaniu interakcji (prompt + odpowiedzi + inne tokeny wewnętrzne).
Liczba tokenów w promptach dotyczących korzystania z narzędzi.
Przykład
Przykładowa odpowiedź
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Usuwa niestandardowy zapisany głos (`store = true`) według nazwy zasobu. Wstępnie utworzonych głosów katalogowych (`VOICE_TYPE_PREBUILT`) nie można usuwać.
Parametry ścieżki lub zapytania
Wymagane. Nazwa zasobu niestandardowego zapisanego głosu do usunięcia (np. `voices/voice_abc123def456`).
Odpowiedź
Jeśli operacja się uda, odpowiedź będzie pusta.
Przykład
Zasoby
Głos
Zasób głosowy reprezentujący głos niestandardowy (utworzony za pomocą funkcji `CreateVoice`) lub gotowy głos systemowy (zwrócony przez funkcję `ListVoices`).
Pola
Opcjonalnie: Opis akcentu regionalnego (np. „amerykański”, „brytyjski”).
Opcjonalnie: Optymalny kontekst lub domena użycia (np. „Konwersacyjny”, „Audiobook”, „Wiadomości”).
Opcjonalnie: Opis barwy głosu, osobowości i tonu.
Opcjonalnie: Wyświetlana nazwa podana przez użytkownika dla zapisanego głosu (`store = true`) lub nazwa katalogu dla gotowego głosu.
Tylko dane wyjściowe. Sygnatura czasowa, po której wygasa niestandardowy zapisany głos (`store = true`) lub skopiowany klucz głosu (`store = false`). Nie ustawiono w przypadku gotowych głosów z katalogu („prebuilt”), które nie wygasają.
Opcjonalnie: Prezentacja postrzeganej płci głosu (np. „kobieta”, „mężczyzna”, „neutralna”).
Tylko dane wyjściowe. Unikalny identyfikator głosu. * W przypadku niestandardowych głosów zarządzanych przez Google (`store = true`) jest to wygenerowany identyfikator z prefiksem `voice_` (np. `voice_abc123def456`). Przekaż `voices/{id}` jako `name` w funkcjach `GetVoice` i `DeleteVoice`, a `{id}` bezpośrednio do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy. * W przypadku gotowych głosów katalogowych (wartość „prebuilt” zwracana przez `ListVoices`) jest to nazwa lektora (np. „Puck” lub „Charon”). * Nieustawione, gdy wywoływana jest funkcja `CreateVoice` z parametrem `store = false`.
Tylko dane wyjściowe. Klucz replikacji głosu zarządzany przez klienta (z prefiksem `voicekey_`). Zwracany tylko przez `CreateVoice`, gdy `type` ma wartość `"replicated"` i `store` ma wartość `false`. Przekaż ten klucz do `SpeechConfig.voice_config.voice` (lub `SpeechConfig.voice`) podczas syntezy mowy.
Opcjonalnie: Główny tag języka w standardzie BCP-47 (np. „en-US”, „fr-FR”).
Opcjonalnie: Model użyty do zaprojektowania lub skopiowania głosu. Jeśli ten parametr zostanie pominięty w przypadku funkcji `CreateVoice`, domyślnie zostanie użyty najnowszy obsługiwany model projektu głosu. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów niestandardowych (`"prompted"` i `"replicated"`); nieustawiony w przypadku głosów `"prebuilt"`. Utworzone głosy można syntetyzować w dowolnym obsługiwanym modelu syntezy mowy.
Opcjonalnie: Docelowa persona lub archetyp postaci (np. „ciepła, przyjazna”, „narrator”).
pitch Pitch (opcjonalnie)
Opcjonalnie: Klasyfikacja wysokości głosu.
Dozwolone wartości
-
lowGłos o niższej tonacji.
-
mediumŚredni ton głosu.
-
highGłos o wyższej tonacji.
prompted PromptedVoice (opcjonalnie)
Parametry generowania głosu na podstawie promptu. Wymagany w przypadku wywołania `CreateVoice`, gdy `type` ma wartość `"prompted"`. Zwracany w odpowiedziach `CreateVoice`, `GetVoice` i `ListVoices` w przypadku głosów wygenerowanych na podstawie promptu.
Pola
Wymagane. Prompt w języku naturalnym opisujący pożądany głos, np. „Głęboki, donośny głos mężczyzny w średnim wieku, który należy do ogromnego, złego ogra”.
Opcjonalnie: Kod regionu geograficznego w formacie ISO 3166-1 alfa-2 lub UN M.49 (np. „US”, „GB”, „001”).
sample_audio AudioData (opcjonalny)
Tylko dane wyjściowe. Próbka dźwięku (dźwięk wygenerowany na podstawie promptu syntezatora) wygenerowana na podstawie promptu głosowego. Wypełniane tylko w odpowiedziach `CreateVoice` i `GetVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w odpowiedziach `ListVoices` oraz w przypadku głosów `"replicated"` lub `"prebuilt"`.
Pola
Wymagane. Surowe bajty audio.
Wymagane. Typ MIME danych audio zgodny z IANA (np. `audio/wav` lub `audio/mpeg`).
type VoiceType (opcjonalnie)
Wymagane. Typ głosu. W przypadku żądania `CreateVoice` musi mieć wartość `"replicated"` lub `"prompted"`. W odpowiedziach `ListVoices` może też mieć wartość `"prebuilt"`.
Dozwolone wartości
-
replicatedNiestandardowy głos odtworzony na podstawie próbki referencyjnej dźwięku i nagrania zgody osoby, której głos został wykorzystany.
-
promptedGłos niestandardowy wygenerowany na podstawie prompta tekstowego w języku naturalnym.
-
prebuiltWbudowany głos systemowy z katalogu głosów Google (np. `Puck`, `Charon`). Zwracany w odpowiedziach; nie można go określić jako typu w metodzie `CreateVoice`.
usage Usage (opcjonalnie)
Tylko dane wyjściowe. Statystyki wykorzystania tokenów w przypadku żądania utworzenia głosu. Wypełniane tylko w odpowiedzi funkcji `CreateVoice`, gdy `type` ma wartość `"prompted"`; nieustawione w przypadku wartości `"replicated"` oraz w odpowiedziach funkcji `GetVoice` i `ListVoices`.
Pola
cached_tokens_by_modality array (ModalityTokens) (optional)
Zestawienie wykorzystania tokenów w pamięci podręcznej według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
grounding_tool_count array (GroundingToolCount) (opcjonalnie)
Liczba narzędzi do powiązania ze źródłem informacji.
Pola
Liczba narzędzi uziemiających.
Typ narzędzia do uziemienia powiązany z liczbą.
Możliwe wartości:
-
google_searchPowiązanie ze źródłem informacji przy użyciu wyszukiwarki Google i wyszukiwarki obrazów oraz powiązanie ze źródłem informacji przy użyciu wyszukiwania w internecie dla firm.
-
google_mapsPowiązanie ze źródłem informacji przy użyciu Map Google.
input_tokens_by_modality array (ModalityTokens) (optional)
Zestawienie wykorzystania tokenów wejściowych według rodzaju danych.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
output_tokens_by_modality array (ModalityTokens) (opcjonalnie)
Zestawienie wykorzystania tokenów wyjściowych według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
tool_use_tokens_by_modality array (ModalityTokens) (opcjonalny)
Zestawienie wykorzystania tokenów narzędzi według rodzaju.
Pola
modality ResponseModality (opcjonalnie)
Rodzaj powiązany z liczbą tokenów.
Dozwolone wartości
-
textWskazuje, że model powinien zwrócić tekst.
-
imageWskazuje, że model powinien zwracać obrazy.
-
audioWskazuje, że model powinien zwrócić dźwięk.
-
videoWskazuje, że model powinien zwrócić film.
-
documentWskazuje, że model powinien zwracać dokumenty.
Liczba tokenów dla danego rodzaju danych.
Liczba tokenów w części promptu zapisanej w pamięci podręcznej (treści w pamięci podręcznej).
Liczba tokenów w prompcie (kontekście).
Łączna liczba tokenów we wszystkich wygenerowanych odpowiedziach.
Liczba tokenów myśli w przypadku modeli myślących.
Łączna liczba tokenów w żądaniu interakcji (prompt + odpowiedzi + inne tokeny wewnętrzne).
Liczba tokenów w promptach dotyczących korzystania z narzędzi.