API-ja e Zërave ju lejon të krijoni zëra të personalizuar nga udhëzimet në gjuhën natyrore (Dizajni i Zërit) ose nga regjistrimet audio referuese dhe të pëlqimit të folësit (Replikimi i Zërit), si dhe të listoni, merrni dhe menaxhoni zëra të personalizuar dhe të parapërgatitur për sintezën Tekst-në-Fjalë (TTS).
KrijoZë
Krijon një zë të personalizuar nga një kërkesë në gjuhë natyrale (`VOICE_TYPE_PROMPTED`) ose nga regjistrimet audio të referencës dhe pëlqimit (`VOICE_TYPE_REPLICATED`).
Trupi i kërkesës
Trupi i kërkesës përmban të dhëna me strukturën e mëposhtme:
Opsionale. Nëse zëri i krijuar ruhet dhe menaxhohet nga Google. * Kur është `true`, Google e ruan zërin dhe kthen `Voice.id` (për shembull, `voice_abc123def456`), i cili mund të menaxhohet nëpërmjet `GetVoice`, `ListVoices` dhe `DeleteVoice` dhe të referohet nga ID në kërkesat e sintezës. Projektet i nënshtrohen një kuote maksimale aktive të zërit të ruajtur; tejkalimi i kuotës kthen `RESOURCE_EXHAUSTED`. * Kur është `false` (parazgjedhur), zëri nuk ruhet nga Google dhe `Voice.key` (për shembull, `voicekey_...`) kthehet për ruajtje dhe sintezë në anën e klientit. Fushat opsionale të meta të dhënave të zbulimit në `voice` nuk ruhen ose nuk kthehen kur `store` është `false`. * Kërkohet të jetë `true` kur `voice.type` `"kërkohet"` (përndryshe dështon me `INVALID_ARGUMENT`).
E detyrueshme. Zëri që do të krijohet. `voice.model` është opsional; nëse hiqet, shërbimi zgjedh modelin e parazgjedhur të krijimit të zërit. Fushat vetëm për dalje në `Voice` (`id`, `key`, `expire_time`, `usage`) injorohen nëse janë vendosur.
Përgjigje
Nëse është i suksesshëm, trupi i përgjigjes përmban të dhëna me strukturën e mëposhtme:
Opsionale. Përshkrues me theks rajonal (p.sh. "Amerikan", "Britanik").
Opsionale. Kontekst ose domen përdorimi optimal (p.sh. "Bisedë", "Libër audio", "Lajme").
Opsionale. Përmbledhje përshkruese e timbrit vokal, personalitetit dhe tonit.
Opsionale. Emri i shfaqur i dhënë nga përdoruesi për një zë të ruajtur (`store = true`), ose emri i katalogut për një zë të parapërgatitur.
Vetëm dalje. Vula kohore në të cilën skadon një zë i ruajtur me porosi (`store = true`) ose një çelës zëri i replikuar (`store = false`). I pacaktuar për zërat e katalogut të parapërgatitur (`"parapërgatitur"`), të cilët nuk skadojnë.
Opsionale. Prezantimi i gjinisë së zërit të perceptuar (p.sh. "femër", "mashkull", "neutral").
Vetëm Dalje. Identifikuesi unik i zërit. * Për zërat e personalizuar të menaxhuar nga Google (`store = true`), ky është një ID i gjeneruar me parashtesën `voice_` (për shembull, `voice_abc123def456`). Kaloni `voices/{id}` si `name` në `GetVoice` dhe `DeleteVoice`, dhe kaloni `{id}` direkt te `SpeechConfig.voice_config.voice` (ose `SpeechConfig.voice`) gjatë sintezës së të folurit. * Për zërat e katalogut të parapërgatitur (`"prebuilt"` të kthyer nga `ListVoices`), ky është emri i folësit (për shembull, `Puck` ose `Charon`). * Çcaktohet kur `CreateVoice` thirret me `store = false`.
Vetëm dalje. Çelësi i replikimit të zërit i menaxhuar nga klienti (me parashtesën `voicekey_`). Kthehet vetëm nga `CreateVoice` kur `type` është `"replicated"` dhe `store` është `false`. Kalojeni këtë çelës te `SpeechConfig.voice_config.voice` (ose `SpeechConfig.voice`) gjatë sintezës së të folurit.
Opsionale. Etiketa kryesore gjuhësore BCP-47 (p.sh. "en-US", "fr-FR").
Opsionale. Modeli i përdorur për të projektuar ose replikuar zërin. Nëse lihet jashtë në `CreateVoice`, parazgjedhja është modeli më i fundit i mbështetur i projektimit të zërit. Kthehet në përgjigjet `CreateVoice`, `GetVoice` dhe `ListVoices` për zërat e personalizuar (`"të kërkuar"` dhe `"të replikuar"`); i pacaktuar për zërat `"të parapërgatitur"`. Zërat e krijuar mund të sintetizohen në çdo model të mbështetur të sintezës TTS.
Opsionale. Personazhi ose arketipi i personazhit i synuar (p.sh. "I ngrohtë, Miqësor", "Narrator").
pjerrësia e pjerrët (opsionale)
Opsionale. Klasifikimi i lartësisë së zërit.
Vlerat e mundshme
-
lowZë me ton më të ulët.
-
mediumZë me lartësi mesatare.
-
highZë me frekuencë më të lartë.
nxiti PromptedVoice (opsionale)
Parametrat për gjenerimin e zërit të nxitur. Kërkohet në `CreateVoice` kur `type` `"kërkohet"`. Kthehet në përgjigjet `CreateVoice`, `GetVoice` dhe `ListVoices` për zërat e nxitur.
Fushat
E detyrueshme. Kërkesa në gjuhën natyrore që përshkruan zërin e dëshiruar, p.sh. "Një zë i thellë dhe i fuqishëm mashkullor i një përbindëshi të lig masiv në moshën e mesme."
Opsionale. Kodi i rajonit gjeografik ISO 3166-1 alfa-2 ose UN M.49 (p.sh. "US", "GB", "001").
sample_audio AudioData (opsionale)
Vetëm dalje. Audio shembull (audio i kërkesës së sintetizuesit) i gjeneruar për një zë të nxitur. Plotësohet vetëm në përgjigjet `CreateVoice` dhe `GetVoice` kur `type` është `"i kërkuar"`; i pacaktuar në përgjigjet `ListVoices` dhe për zërat `"të replikuar"` ose `"të parapërgatitur"`.
Fushat
E detyrueshme. Bajtet audio të papërpunuara.
E detyrueshme. Lloji IANA MIME i të dhënave audio (për shembull, `audio/wav` ose `audio/mpeg`).
shkruani Lloji i Zërit (opsional)
E detyrueshme. Lloji i zërit. Në `CreateVoice`, duhet të jetë `"replikuar"` ose `"kërkuar"`. Në përgjigjet `ListVoices`, mund të jenë gjithashtu `"të parapërgatitura"`.
Vlerat e mundshme
-
replicatedNjë zë i personalizuar i replikuar nga një mostër audio referuese dhe regjistrimi i pëlqimit të folësit.
-
promptedNjë zë i personalizuar i gjeneruar nga një kërkesë teksti në gjuhë natyrore.
-
prebuiltNjë zë sistemi i integruar nga katalogu i zërit të Google (p.sh., `Puck`, `Charon`). Kthehet në përgjigje; nuk mund të specifikohet si lloji në `CreateVoice`.
Përdorimi Përdorimi (opsional)
Vetëm dalje. Statistikat e përdorimit të tokenit për kërkesën e krijimit të zërit. Plotësohet vetëm në përgjigjen e `CreateVoice` kur `type` `"kërkohet"`; nuk është vendosur për `"replikuar"` dhe në përgjigjet `GetVoice` dhe `ListVoices`.
Fushat
cached_tokens_by_modality matricë (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenëve të ruajtur në memorje sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu grounding_tool_count (GroundingToolCount) (opsionale)
Numri i mjeteve të tokëzimit.
Fushat
Numri i mjeteve të tokëzimit numërohet.
Lloji i mjetit të tokëzimit i lidhur me numërimin.
Vlerat e mundshme:
-
google_searchBazë me Kërkimin në Ueb të Google dhe Kërkimin e Imazheve, dhe Bazë në Ueb për Ndërmarrjet.
-
google_mapsTokëzimi me Google Maps.
vargu input_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenit të hyrjes sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu output_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenit të daljes sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu tool_use_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenëve të përdorimit të mjeteve sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
Numri i tokenëve në pjesën e ruajtur në memorien e përkohshme të kërkesës (përmbajtja e ruajtur në memorien e përkohshme).
Numri i tokenëve në kërkesë (konteksti).
Numri total i tokenëve në të gjitha përgjigjet e gjeneruara.
Numri i tokenëve të mendimeve për modelet e të menduarit.
Numri total i tokenëve për kërkesën e ndërveprimit (kërkesa + përgjigjet + tokenët e tjerë të brendshëm).
Numri i tokenëve të pranishëm në kërkesën/kërkesat e përdorimit të mjetit.
Shembull
Shembull Përgjigjeje
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
Zërat e Listës
Liston zërat e ruajtur sipas porosisë në pronësi të telefonuesit (të renditur më të riun së pari) të ndjekur nga zërat e sistemit të parapërgatitur nga katalogu i zërave të Google.
Parametrat e Shtegut / Pyetjes
Opsionale. Filtro sipas përshkrimit të theksit (p.sh. "Amerikan", "Britanik"). Përputhje e saktë pa ndjeshmëri ndaj shkronjave të mëdha dhe të vogla. Nëse specifikohen vlera të shumëfishta, përputh zërat me cilindo nga thekset e specifikuara (OSE).
Opsionale. Filtro sipas kontekstit ose domenit të synuar (p.sh. "Lajme, Tregtare"). Përputhje e saktë pa ndjeshmëri ndaj shkronjave të mëdha dhe të vogla. Nëse specifikohen vlera të shumëfishta, përputh zërat me cilindo nga kontekstet e specifikuara (OSE).
Opsionale. Filtro sipas paraqitjes së gjinisë (p.sh. "femër", "mashkull", "neutral"). Përputhje e saktë pa ndjeshmëri ndaj shkronjave të mëdha dhe të vogla. Nëse specifikohen vlera të shumëfishta, përputh zërat me cilëndo nga gjinitë e specifikuara (OSE).
Opsionale. Filtro sipas kodit të gjuhës BCP-47 (p.sh. "en-US"). Përputhje e saktë pa ndjeshmëri ndaj shkronjave të mëdha dhe të mëdha. Nëse specifikohen vlera të shumëfishta, përputh zërat me cilindo nga kodet e gjuhës së specifikuar (OSE).
Opsionale. Numri maksimal i zërave që duhen kthyer për faqe. Shërbimi mund të kthejë më pak se kjo vlerë. Nëse nuk specifikohet, kthehen maksimumi 50 zëra. Vlera maksimale është 1000; vlerat mbi 1000 detyrohen të jenë 1000.
Opsionale. Një shenjë faqeje e marrë nga një thirrje e mëparshme `ListVoices`. Jepni këtë për të marrë faqen pasuese. Gjatë faqezimit, të gjithë parametrat e pyetjes së filtrit (`kodi_i_gjuhës`, `kodi_i_rajonit`, `akcenti`, `personi`, `konteksti`, `gjinia`, `largësia`, `lloji` dhe `kërkimi`) duhet të përputhen me thirrjen që e ktheu këtë shenjë; përndryshe kërkesa dështon me `ARGUMENT_INVALID`. `madhësia_e_faqes` mund të ndryshojë midis faqeve.
Opsionale. Filtro sipas personazhit vokal (p.sh. "I ngrohtë, Miqësor"). Përputhje e saktë pa ndjeshmëri ndaj shkronjave të mëdha dhe të mëdha. Nëse specifikohen vlera të shumëfishta, përputh zërat me cilindo nga personazhet e specifikuara (OSE).
Opsionale. Filtro sipas lartësisë së zërit. Pranon "të ulët", "mesatare", "të lartë" ose "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (pa ndjeshmëri ndaj shkronjave të mëdha dhe të vogla). Nëse specifikohen vlera të shumëfishta, përputh zërat me cilëndo nga lartësitë e specifikuara (OSE).
Opsionale. Filtro sipas kodit të rajonit ISO 3166-1 alfa-2 ose UN M.49 (p.sh. "US", "001"). Përputhje e saktë pa ndjeshmëri ndaj shkronjave të mëdha dhe të mëdha. Nëse specifikohen vlera të shumëfishta, përputh zërat me cilindo nga kodet e rajonit të specifikuara (OR).
Opsionale. Kërkesa e kërkimit me nënvarg me tekst të lirë përputhej pa ndjeshmëri ndaj shkronjave të mëdha dhe të vogla si me `emrin_e_shfaqjes` ashtu edhe me `përshkrimin`. Maksimumi 2048 bajt.
Opsionale. Filtro sipas llojit të zërit. Pranon "të parapërgatitur", "të replikuar", "të kërkuar" ose "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (pa ndjeshmëri ndaj shkronjave të mëdha dhe të vogla). Nëse specifikohen vlera të shumëfishta, përputh zërat me cilindo nga llojet e specifikuara (OSE).
Përgjigje
Nëse është i suksesshëm, trupi i përgjigjes përmban të dhëna me strukturën e mëposhtme:
Një shenjë që mund të dërgohet si `page_token` për të marrë faqen tjetër. Nëse është bosh, nuk ka faqe pasuese.
Zërat nga koleksioni i specifikuar.
Shembull
Shembull Përgjigjeje
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Merr një zë të ruajtur me porosi (`store = true`) sipas emrit të burimit. Zërat e katalogut të parapërgatitur (`VOICE_TYPE_PREBUILT`) nuk mund të merren nëpërmjet `GetVoice`; përdorni `ListVoices` në vend të kësaj.
Parametrat e Shtegut / Pyetjes
E detyrueshme. Emri i burimit të zërit të ruajtur me porosi që do të rikuperohet (për shembull, `voices/voice_abc123def456`).
Përgjigje
Nëse është i suksesshëm, trupi i përgjigjes përmban të dhëna me strukturën e mëposhtme:
Opsionale. Përshkrues me theks rajonal (p.sh. "Amerikan", "Britanik").
Opsionale. Kontekst ose domen përdorimi optimal (p.sh. "Bisedë", "Libër audio", "Lajme").
Opsionale. Përmbledhje përshkruese e timbrit vokal, personalitetit dhe tonit.
Opsionale. Emri i shfaqur i dhënë nga përdoruesi për një zë të ruajtur (`store = true`), ose emri i katalogut për një zë të parapërgatitur.
Vetëm dalje. Vula kohore në të cilën skadon një zë i ruajtur me porosi (`store = true`) ose një çelës zëri i replikuar (`store = false`). I pacaktuar për zërat e katalogut të parapërgatitur (`"parapërgatitur"`), të cilët nuk skadojnë.
Opsionale. Prezantimi i gjinisë së zërit të perceptuar (p.sh. "femër", "mashkull", "neutral").
Vetëm Dalje. Identifikuesi unik i zërit. * Për zërat e personalizuar të menaxhuar nga Google (`store = true`), ky është një ID i gjeneruar me parashtesën `voice_` (për shembull, `voice_abc123def456`). Kaloni `voices/{id}` si `name` në `GetVoice` dhe `DeleteVoice`, dhe kaloni `{id}` direkt te `SpeechConfig.voice_config.voice` (ose `SpeechConfig.voice`) gjatë sintezës së të folurit. * Për zërat e katalogut të parapërgatitur (`"prebuilt"` të kthyer nga `ListVoices`), ky është emri i folësit (për shembull, `Puck` ose `Charon`). * Çcaktohet kur `CreateVoice` thirret me `store = false`.
Vetëm dalje. Çelësi i replikimit të zërit i menaxhuar nga klienti (me parashtesën `voicekey_`). Kthehet vetëm nga `CreateVoice` kur `type` është `"replicated"` dhe `store` është `false`. Kalojeni këtë çelës te `SpeechConfig.voice_config.voice` (ose `SpeechConfig.voice`) gjatë sintezës së të folurit.
Opsionale. Etiketa kryesore gjuhësore BCP-47 (p.sh. "en-US", "fr-FR").
Opsionale. Modeli i përdorur për të projektuar ose replikuar zërin. Nëse lihet jashtë në `CreateVoice`, parazgjedhja është modeli më i fundit i mbështetur i projektimit të zërit. Kthehet në përgjigjet `CreateVoice`, `GetVoice` dhe `ListVoices` për zërat e personalizuar (`"të kërkuar"` dhe `"të replikuar"`); i pacaktuar për zërat `"të parapërgatitur"`. Zërat e krijuar mund të sintetizohen në çdo model të mbështetur të sintezës TTS.
Opsionale. Personazhi ose arketipi i personazhit i synuar (p.sh. "I ngrohtë, Miqësor", "Narrator").
pjerrësia e pjerrët (opsionale)
Opsionale. Klasifikimi i lartësisë së zërit.
Vlerat e mundshme
-
lowZë me ton më të ulët.
-
mediumZë me lartësi mesatare.
-
highZë me frekuencë më të lartë.
nxiti PromptedVoice (opsionale)
Parametrat për gjenerimin e zërit të nxitur. Kërkohet në `CreateVoice` kur `type` `"kërkohet"`. Kthehet në përgjigjet `CreateVoice`, `GetVoice` dhe `ListVoices` për zërat e nxitur.
Fushat
E detyrueshme. Kërkesa në gjuhën natyrore që përshkruan zërin e dëshiruar, p.sh. "Një zë i thellë dhe i fuqishëm mashkullor i një përbindëshi të lig masiv në moshën e mesme."
Opsionale. Kodi i rajonit gjeografik ISO 3166-1 alfa-2 ose UN M.49 (p.sh. "US", "GB", "001").
sample_audio AudioData (opsionale)
Vetëm dalje. Audio shembull (audio i kërkesës së sintetizuesit) i gjeneruar për një zë të nxitur. Plotësohet vetëm në përgjigjet `CreateVoice` dhe `GetVoice` kur `type` është `"i kërkuar"`; i pacaktuar në përgjigjet `ListVoices` dhe për zërat `"të replikuar"` ose `"të parapërgatitur"`.
Fushat
E detyrueshme. Bajtet audio të papërpunuara.
E detyrueshme. Lloji IANA MIME i të dhënave audio (për shembull, `audio/wav` ose `audio/mpeg`).
shkruani Lloji i Zërit (opsional)
E detyrueshme. Lloji i zërit. Në `CreateVoice`, duhet të jetë `"replikuar"` ose `"kërkuar"`. Në përgjigjet `ListVoices`, mund të jenë gjithashtu `"të parapërgatitura"`.
Vlerat e mundshme
-
replicatedNjë zë i personalizuar i replikuar nga një mostër audio referuese dhe regjistrimi i pëlqimit të folësit.
-
promptedNjë zë i personalizuar i gjeneruar nga një kërkesë teksti në gjuhë natyrore.
-
prebuiltNjë zë sistemi i integruar nga katalogu i zërit të Google (p.sh., `Puck`, `Charon`). Kthehet në përgjigje; nuk mund të specifikohet si lloji në `CreateVoice`.
Përdorimi Përdorimi (opsional)
Vetëm dalje. Statistikat e përdorimit të tokenit për kërkesën e krijimit të zërit. Plotësohet vetëm në përgjigjen e `CreateVoice` kur `type` `"kërkohet"`; nuk është vendosur për `"replikuar"` dhe në përgjigjet `GetVoice` dhe `ListVoices`.
Fushat
cached_tokens_by_modality matricë (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenëve të ruajtur në memorje sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu grounding_tool_count (GroundingToolCount) (opsionale)
Numri i mjeteve të tokëzimit.
Fushat
Numri i mjeteve të tokëzimit numërohet.
Lloji i mjetit të tokëzimit i lidhur me numërimin.
Vlerat e mundshme:
-
google_searchBazë me Kërkimin në Ueb të Google dhe Kërkimin e Imazheve, dhe Bazë në Ueb për Ndërmarrjet.
-
google_mapsTokëzimi me Google Maps.
vargu input_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenit të hyrjes sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu output_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenit të daljes sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu tool_use_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenëve të përdorimit të mjeteve sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
Numri i tokenëve në pjesën e ruajtur në memorien e përkohshme të kërkesës (përmbajtja e ruajtur në memorien e përkohshme).
Numri i tokenëve në kërkesë (konteksti).
Numri total i tokenëve në të gjitha përgjigjet e gjeneruara.
Numri i tokenëve të mendimeve për modelet e të menduarit.
Numri total i tokenëve për kërkesën e ndërveprimit (kërkesa + përgjigjet + tokenët e tjerë të brendshëm).
Numri i tokenëve të pranishëm në kërkesën/kërkesat e përdorimit të mjetit.
Shembull
Shembull Përgjigjeje
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
FshijZërin
Fshin një zë të ruajtur me porosi (`store = true`) sipas emrit të burimit. Zërat e parapërgatitur të katalogut (`VOICE_TYPE_PREBUILT`) nuk mund të fshihen.
Parametrat e Shtegut / Pyetjes
E detyrueshme. Emri i burimit të zërit të ruajtur të personalizuar që do të fshihet (për shembull, `voices/voice_abc123def456`).
Përgjigje
Nëse ka sukses, përgjigja është bosh.
Shembull
Burimet
Zëri
Një burim zëri që përfaqëson ose një zë të personalizuar (të krijuar nëpërmjet `CreateVoice`) ose një zë sistemi të parapërgatitur (i kthyer nga `ListVoices`).
Fushat
Opsionale. Përshkrues me theks rajonal (p.sh. "Amerikan", "Britanik").
Opsionale. Kontekst ose domen përdorimi optimal (p.sh. "Bisedë", "Libër audio", "Lajme").
Opsionale. Përmbledhje përshkruese e timbrit vokal, personalitetit dhe tonit.
Opsionale. Emri i shfaqur i dhënë nga përdoruesi për një zë të ruajtur (`store = true`), ose emri i katalogut për një zë të parapërgatitur.
Vetëm dalje. Vula kohore në të cilën skadon një zë i ruajtur me porosi (`store = true`) ose një çelës zëri i replikuar (`store = false`). I pacaktuar për zërat e katalogut të parapërgatitur (`"parapërgatitur"`), të cilët nuk skadojnë.
Opsionale. Prezantimi i gjinisë së zërit të perceptuar (p.sh. "femër", "mashkull", "neutral").
Vetëm Dalje. Identifikuesi unik i zërit. * Për zërat e personalizuar të menaxhuar nga Google (`store = true`), ky është një ID i gjeneruar me parashtesën `voice_` (për shembull, `voice_abc123def456`). Kaloni `voices/{id}` si `name` në `GetVoice` dhe `DeleteVoice`, dhe kaloni `{id}` direkt te `SpeechConfig.voice_config.voice` (ose `SpeechConfig.voice`) gjatë sintezës së të folurit. * Për zërat e katalogut të parapërgatitur (`"prebuilt"` të kthyer nga `ListVoices`), ky është emri i folësit (për shembull, `Puck` ose `Charon`). * Çcaktohet kur `CreateVoice` thirret me `store = false`.
Vetëm dalje. Çelësi i replikimit të zërit i menaxhuar nga klienti (me parashtesën `voicekey_`). Kthehet vetëm nga `CreateVoice` kur `type` është `"replicated"` dhe `store` është `false`. Kalojeni këtë çelës te `SpeechConfig.voice_config.voice` (ose `SpeechConfig.voice`) gjatë sintezës së të folurit.
Opsionale. Etiketa kryesore gjuhësore BCP-47 (p.sh. "en-US", "fr-FR").
Opsionale. Modeli i përdorur për të projektuar ose replikuar zërin. Nëse lihet jashtë në `CreateVoice`, parazgjedhja është modeli më i fundit i mbështetur i projektimit të zërit. Kthehet në përgjigjet `CreateVoice`, `GetVoice` dhe `ListVoices` për zërat e personalizuar (`"të kërkuar"` dhe `"të replikuar"`); i pacaktuar për zërat `"të parapërgatitur"`. Zërat e krijuar mund të sintetizohen në çdo model të mbështetur të sintezës TTS.
Opsionale. Personazhi ose arketipi i personazhit i synuar (p.sh. "I ngrohtë, Miqësor", "Narrator").
pjerrësia e pjerrët (opsionale)
Opsionale. Klasifikimi i lartësisë së zërit.
Vlerat e mundshme
-
lowZë me ton më të ulët.
-
mediumZë me lartësi mesatare.
-
highZë me frekuencë më të lartë.
nxiti PromptedVoice (opsionale)
Parametrat për gjenerimin e zërit të nxitur. Kërkohet në `CreateVoice` kur `type` `"kërkohet"`. Kthehet në përgjigjet `CreateVoice`, `GetVoice` dhe `ListVoices` për zërat e nxitur.
Fushat
E detyrueshme. Kërkesa në gjuhën natyrore që përshkruan zërin e dëshiruar, p.sh. "Një zë i thellë dhe i fuqishëm mashkullor i një përbindëshi të lig masiv në moshën e mesme."
Opsionale. Kodi i rajonit gjeografik ISO 3166-1 alfa-2 ose UN M.49 (p.sh. "US", "GB", "001").
sample_audio AudioData (opsionale)
Vetëm dalje. Audio shembull (audio i kërkesës së sintetizuesit) i gjeneruar për një zë të nxitur. Plotësohet vetëm në përgjigjet `CreateVoice` dhe `GetVoice` kur `type` është `"i kërkuar"`; i pacaktuar në përgjigjet `ListVoices` dhe për zërat `"të replikuar"` ose `"të parapërgatitur"`.
Fushat
E detyrueshme. Bajtet audio të papërpunuara.
E detyrueshme. Lloji IANA MIME i të dhënave audio (për shembull, `audio/wav` ose `audio/mpeg`).
shkruani Lloji i Zërit (opsional)
E detyrueshme. Lloji i zërit. Në `CreateVoice`, duhet të jetë `"replikuar"` ose `"kërkuar"`. Në përgjigjet `ListVoices`, mund të jenë gjithashtu `"të parapërgatitura"`.
Vlerat e mundshme
-
replicatedNjë zë i personalizuar i replikuar nga një mostër audio referuese dhe regjistrimi i pëlqimit të folësit.
-
promptedNjë zë i personalizuar i gjeneruar nga një kërkesë teksti në gjuhë natyrore.
-
prebuiltNjë zë sistemi i integruar nga katalogu i zërit të Google (p.sh., `Puck`, `Charon`). Kthehet në përgjigje; nuk mund të specifikohet si lloji në `CreateVoice`.
Përdorimi Përdorimi (opsional)
Vetëm dalje. Statistikat e përdorimit të tokenit për kërkesën e krijimit të zërit. Plotësohet vetëm në përgjigjen e `CreateVoice` kur `type` `"kërkohet"`; nuk është vendosur për `"replikuar"` dhe në përgjigjet `GetVoice` dhe `ListVoices`.
Fushat
cached_tokens_by_modality matricë (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenëve të ruajtur në memorje sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu grounding_tool_count (GroundingToolCount) (opsionale)
Numri i mjeteve të tokëzimit.
Fushat
Numri i mjeteve të tokëzimit numërohet.
Lloji i mjetit të tokëzimit i lidhur me numërimin.
Vlerat e mundshme:
-
google_searchBazë me Kërkimin në Ueb të Google dhe Kërkimin e Imazheve, dhe Bazë në Ueb për Ndërmarrjet.
-
google_mapsTokëzimi me Google Maps.
vargu input_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenit të hyrjes sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu output_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenit të daljes sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
vargu tool_use_tokens_by_modality (ModalityTokens) (opsionale)
Një ndarje e përdorimit të tokenëve të përdorimit të mjeteve sipas modalitetit.
Fushat
modaliteti ResponseModality (opsionale)
Modaliteti i lidhur me numërimin e tokenëve.
Vlerat e mundshme
-
textTregon se modeli duhet të kthejë tekst.
-
imageTregon se modeli duhet të kthejë imazhe.
-
audioTregon se modeli duhet të kthejë audio.
-
videoTregon se modeli duhet të kthejë videon.
-
documentTregon se modeli duhet të kthejë dokumente.
Numri i tokenëve për modalitetin.
Numri i tokenëve në pjesën e ruajtur në memorien e përkohshme të kërkesës (përmbajtja e ruajtur në memorien e përkohshme).
Numri i tokenëve në kërkesë (konteksti).
Numri total i tokenëve në të gjitha përgjigjet e gjeneruara.
Numri i tokenëve të mendimeve për modelet e të menduarit.
Numri total i tokenëve për kërkesën e ndërveprimit (kërkesa + përgjigjet + tokenët e tjerë të brendshëm).
Numri i tokenëve të pranishëm në kërkesën/kërkesat e përdorimit të mjetit.