Voices API memungkinkan Anda membuat suara kustom dari perintah bahasa alami (Desain Suara) atau dari audio referensi dan rekaman izin pembicara (Replikasi Suara), serta mencantumkan, mengambil, dan mengelola suara kustom dan bawaan untuk sintesis Text-to-Speech (TTS).
CreateVoice
Membuat suara kustom dari perintah bahasa alami (`VOICE_TYPE_PROMPTED`) atau dari rekaman audio rujukan dan izin (`VOICE_TYPE_REPLICATED`).
Isi permintaan
Isi permintaan memuat data dengan struktur berikut:
Opsional. Apakah suara yang dibuat dipertahankan dan dikelola oleh Google. * Jika `true`, Google akan menyimpan suara dan menampilkan `Voice.id` (misalnya, `voice_abc123def456`), yang dapat dikelola melalui `GetVoice`, `ListVoices`, dan `DeleteVoice` serta dirujuk berdasarkan ID dalam permintaan sintesis. Project tunduk pada kuota suara tersimpan aktif maksimum; jika kuota terlampaui, `RESOURCE_EXHAUSTED` akan ditampilkan. * Jika `false` (default), suara tidak disimpan oleh Google dan `Voice.key` (misalnya, `voicekey_...`) ditampilkan untuk penyimpanan dan sintesis sisi klien. Bidang metadata penemuan opsional di `voice` tidak dipertahankan atau ditampilkan saat `store` adalah `false`. * Harus `true` saat `voice.type` adalah `"prompted"` (jika tidak, akan gagal dengan `INVALID_ARGUMENT`).
Wajib. Suara yang akan dibuat. `voice.model` bersifat opsional; jika tidak ada, layanan akan memilih model pembuatan suara default. Kolom hanya baca di `Voice` (`id`, `key`, `expire_time`, `usage`) diabaikan jika ditetapkan.
Respons
Jika berhasil, isi respons memuat data dengan struktur berikut:
Opsional. Deskriptor aksen regional (misalnya, "Amerika", "Inggris").
Opsional. Konteks atau domain penggunaan yang optimal (misalnya, "Percakapan", "Buku audio", "Berita").
Opsional. Ringkasan deskriptif tentang timbre vokal, kepribadian, dan gaya bahasa.
Opsional. Nama tampilan yang diberikan pengguna untuk suara tersimpan (`store = true`), atau nama katalog untuk suara bawaan.
Hanya output. Stempel waktu saat suara tersimpan kustom (`store = true`) atau kunci suara yang direplikasi (`store = false`) berakhir. Tidak disetel untuk suara katalog bawaan (`"prebuilt"`), yang tidak akan berakhir.
Opsional. Persepsi presentasi gender suara (misalnya, "perempuan", "laki-laki", "netral").
Hanya output. ID unik suara. * Untuk suara kustom yang dikelola Google (`store = true`), ini adalah ID yang dibuat dengan awalan `voice_` (misalnya, `voice_abc123def456`). Teruskan `voices/{id}` sebagai `name` di `GetVoice` dan `DeleteVoice`, lalu teruskan `{id}` langsung ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan. * Untuk suara katalog bawaan (`"prebuilt"` yang ditampilkan oleh `ListVoices`), ini adalah nama penutur (misalnya, `Puck` atau `Charon`). * Tidak disetel saat `CreateVoice` dipanggil dengan `store = false`.
Hanya output. Kunci replikasi suara yang dikelola klien (dengan awalan `voicekey_`). Hanya ditampilkan oleh `CreateVoice` saat `type` adalah `"replicated"` dan `store` adalah `false`. Teruskan kunci ini ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan.
Opsional. Tag bahasa BCP-47 utama (misalnya, "en-US", "fr-FR").
Opsional. Model yang digunakan untuk mendesain atau mereplikasi suara. Jika tidak disertakan dalam `CreateVoice`, defaultnya adalah model desain suara yang didukung terbaru. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara kustom (`"prompted"` dan `"replicated"`); tidak ditetapkan untuk suara `"prebuilt"`. Suara yang dibuat dapat disintesis di seluruh model sintesis TTS yang didukung.
Opsional. Persona atau arketipe karakter yang diinginkan (misalnya, "Ramah", "Narator").
pitch Pitch (opsional)
Opsional. Klasifikasi nada suara.
Nilai yang mungkin
-
lowSuara dengan nada rendah.
-
mediumSuara dengan nada sedang.
-
highSuara dengan nada lebih tinggi.
diminta PromptedVoice (opsional)
Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.
Kolom
Wajib. Perintah bahasa alami yang mendeskripsikan suara yang diinginkan, misalnya: "Suara laki-laki yang dalam dan bergemuruh dari ogre jahat besar di usia paruh baya."
Opsional. Kode wilayah geografis ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "GB", "001").
sample_audio AudioData (opsional)
Hanya output. Contoh audio (audio perintah synthesizer) yang dihasilkan untuk suara yang diminta. Diisi hanya dalam respons `CreateVoice` dan `GetVoice` jika `type` adalah `"prompted"`; tidak disetel dalam respons `ListVoices` dan untuk suara `"replicated"` atau `"prebuilt"`.
Kolom
Wajib. Byte audio mentah.
Wajib. Jenis MIME IANA dari data audio (misalnya, `audio/wav` atau `audio/mpeg`).
type VoiceType (opsional)
Wajib. Jenis suara. Di `CreateVoice`, harus berupa `"replicated"` atau `"prompted"`. Dalam respons `ListVoices`, juga dapat berupa `"prebuilt"`.
Nilai yang mungkin
-
replicatedSuara kustom yang direplikasi dari sampel audio referensi dan rekaman izin penutur.
-
promptedSuara kustom yang dihasilkan dari perintah teks bahasa alami.
-
prebuiltSuara sistem bawaan dari katalog suara Google (misalnya, `Puck`, `Charon`). Ditampilkan dalam respons; tidak dapat ditentukan sebagai jenis dalam `CreateVoice`.
penggunaan Penggunaan (opsional)
Hanya output. Statistik penggunaan token untuk permintaan pembuatan suara. Diisi hanya dalam respons `CreateVoice` saat `type` adalah `"prompted"`; tidak disetel untuk `"replicated"` dan dalam respons `GetVoice` dan `ListVoices`.
Kolom
cached_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token yang di-cache menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
grounding_tool_count array (GroundingToolCount) (opsional)
Jumlah alat perujukan.
Kolom
Jumlah alat perataan tanah.
Jenis alat perujukan yang terkait dengan jumlah.
Nilai yang mungkin:
-
google_searchGrounding dengan Google Penelusuran Web dan Penelusuran Gambar, & Grounding Web untuk Perusahaan.
-
google_mapsGrounding with Google Maps.
input_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token input menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
output_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token output menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
tool_use_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token penggunaan alat berdasarkan modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
Jumlah token di bagian perintah yang di-cache (konten yang di-cache).
Jumlah token dalam perintah (konteks).
Jumlah total token di semua respons yang dihasilkan.
Jumlah token pemikiran untuk model penalaran.
Jumlah total token untuk permintaan interaksi (prompt + respons + token internal lainnya).
Jumlah token yang ada dalam perintah penggunaan alat.
Contoh
Contoh Respons
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
Mencantumkan suara kustom tersimpan yang dimiliki oleh pemanggil (diurutkan dari yang terbaru terlebih dahulu), diikuti dengan suara sistem bawaan dari katalog suara Google.
Parameter Jalur / Kueri
Opsional. Filter menurut deskripsi aksen (misalnya, "Amerika", "Inggris"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, cocokkan suara dengan aksen yang ditentukan (OR).
Opsional. Filter menurut konteks atau domain yang dimaksud (misalnya, "Berita, Komersial"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, suara yang cocok adalah suara dengan salah satu konteks yang ditentukan (OR).
Opsional. Filter menurut presentasi gender (misalnya, "perempuan", "laki-laki", "netral"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, cocokkan suara dengan salah satu jenis kelamin yang ditentukan (OR).
Opsional. Memfilter menurut kode bahasa BCP-47 (misalnya, "en-US"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, suara akan dicocokkan dengan salah satu kode bahasa yang ditentukan (OR).
Opsional. Jumlah maksimum suara yang akan ditampilkan per halaman. Layanan mungkin menampilkan lebih sedikit dari nilai ini. Jika tidak ditentukan, paling banyak 50 suara akan ditampilkan. Nilai maksimum adalah 1.000; nilai di atas 1.000 akan dikonversi menjadi 1.000.
Opsional. Token halaman yang diterima dari panggilan `ListVoices` sebelumnya. Berikan ini untuk mengambil halaman selanjutnya. Saat melakukan penomoran halaman, semua parameter kueri filter (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, dan `search`) harus cocok dengan panggilan yang menampilkan token ini; jika tidak, permintaan akan gagal dengan `INVALID_ARGUMENT`. `page_size` dapat berubah di antara halaman.
Opsional. Filter menurut persona suara (misalnya, "Hangat, Ramah"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, cocokkan suara dengan salah satu persona yang ditentukan (OR).
Opsional. Filter menurut nada suara. Menerima "low", "medium", "high" atau "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (tidak peka huruf besar/kecil). Jika beberapa nilai ditentukan, cocokkan suara dengan nada yang ditentukan (OR).
Opsional. Filter menurut kode wilayah ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "001"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, suara yang cocok adalah suara dengan salah satu kode wilayah yang ditentukan (OR).
Opsional. Kueri penelusuran substring teks bebas cocok dengan `display_name` dan `description` tanpa membedakan huruf besar/kecil. Maksimum 2.048 byte.
Opsional. Filter menurut jenis suara. Menerima "prebuilt", "replicated", "prompted" atau "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (tidak peka huruf besar/kecil). Jika beberapa nilai ditentukan, mencocokkan suara dengan salah satu jenis yang ditentukan (OR).
Respons
Jika berhasil, isi respons memuat data dengan struktur berikut:
Token yang dapat dikirim sebagai `page_token` untuk mengambil halaman berikutnya. Jika kosong, tidak ada halaman berikutnya.
Suara dari koleksi yang ditentukan.
Contoh
Contoh Respons
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
Mendapatkan suara tersimpan kustom (`store = true`) berdasarkan nama resource. Suara katalog bawaan (`VOICE_TYPE_PREBUILT`) tidak dapat diambil melalui `GetVoice`; gunakan `ListVoices` sebagai gantinya.
Parameter Jalur / Kueri
Wajib. Nama resource suara tersimpan kustom yang akan diambil (misalnya, `voices/voice_abc123def456`).
Respons
Jika berhasil, isi respons memuat data dengan struktur berikut:
Opsional. Deskriptor aksen regional (misalnya, "Amerika", "Inggris").
Opsional. Konteks atau domain penggunaan yang optimal (misalnya, "Percakapan", "Buku audio", "Berita").
Opsional. Ringkasan deskriptif tentang timbre vokal, kepribadian, dan gaya bahasa.
Opsional. Nama tampilan yang diberikan pengguna untuk suara tersimpan (`store = true`), atau nama katalog untuk suara bawaan.
Hanya output. Stempel waktu saat suara tersimpan kustom (`store = true`) atau kunci suara yang direplikasi (`store = false`) berakhir. Tidak disetel untuk suara katalog bawaan (`"prebuilt"`), yang tidak akan berakhir.
Opsional. Persepsi presentasi gender suara (misalnya, "perempuan", "laki-laki", "netral").
Hanya output. ID unik suara. * Untuk suara kustom yang dikelola Google (`store = true`), ini adalah ID yang dibuat dengan awalan `voice_` (misalnya, `voice_abc123def456`). Teruskan `voices/{id}` sebagai `name` di `GetVoice` dan `DeleteVoice`, lalu teruskan `{id}` langsung ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan. * Untuk suara katalog bawaan (`"prebuilt"` yang ditampilkan oleh `ListVoices`), ini adalah nama penutur (misalnya, `Puck` atau `Charon`). * Tidak disetel saat `CreateVoice` dipanggil dengan `store = false`.
Hanya output. Kunci replikasi suara yang dikelola klien (dengan awalan `voicekey_`). Hanya ditampilkan oleh `CreateVoice` saat `type` adalah `"replicated"` dan `store` adalah `false`. Teruskan kunci ini ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan.
Opsional. Tag bahasa BCP-47 utama (misalnya, "en-US", "fr-FR").
Opsional. Model yang digunakan untuk mendesain atau mereplikasi suara. Jika tidak disertakan dalam `CreateVoice`, defaultnya adalah model desain suara yang didukung terbaru. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara kustom (`"prompted"` dan `"replicated"`); tidak ditetapkan untuk suara `"prebuilt"`. Suara yang dibuat dapat disintesis di seluruh model sintesis TTS yang didukung.
Opsional. Persona atau arketipe karakter yang diinginkan (misalnya, "Ramah", "Narator").
pitch Pitch (opsional)
Opsional. Klasifikasi nada suara.
Nilai yang mungkin
-
lowSuara dengan nada rendah.
-
mediumSuara dengan nada sedang.
-
highSuara dengan nada lebih tinggi.
diminta PromptedVoice (opsional)
Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.
Kolom
Wajib. Perintah bahasa alami yang mendeskripsikan suara yang diinginkan, misalnya: "Suara laki-laki yang dalam dan bergemuruh dari ogre jahat besar di usia paruh baya."
Opsional. Kode wilayah geografis ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "GB", "001").
sample_audio AudioData (opsional)
Hanya output. Contoh audio (audio perintah synthesizer) yang dihasilkan untuk suara yang diminta. Diisi hanya dalam respons `CreateVoice` dan `GetVoice` jika `type` adalah `"prompted"`; tidak disetel dalam respons `ListVoices` dan untuk suara `"replicated"` atau `"prebuilt"`.
Kolom
Wajib. Byte audio mentah.
Wajib. Jenis MIME IANA dari data audio (misalnya, `audio/wav` atau `audio/mpeg`).
type VoiceType (opsional)
Wajib. Jenis suara. Di `CreateVoice`, harus berupa `"replicated"` atau `"prompted"`. Dalam respons `ListVoices`, juga dapat berupa `"prebuilt"`.
Nilai yang mungkin
-
replicatedSuara kustom yang direplikasi dari sampel audio referensi dan rekaman izin penutur.
-
promptedSuara kustom yang dihasilkan dari perintah teks bahasa alami.
-
prebuiltSuara sistem bawaan dari katalog suara Google (misalnya, `Puck`, `Charon`). Ditampilkan dalam respons; tidak dapat ditentukan sebagai jenis dalam `CreateVoice`.
penggunaan Penggunaan (opsional)
Hanya output. Statistik penggunaan token untuk permintaan pembuatan suara. Diisi hanya dalam respons `CreateVoice` saat `type` adalah `"prompted"`; tidak disetel untuk `"replicated"` dan dalam respons `GetVoice` dan `ListVoices`.
Kolom
cached_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token yang di-cache menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
grounding_tool_count array (GroundingToolCount) (opsional)
Jumlah alat perujukan.
Kolom
Jumlah alat perataan tanah.
Jenis alat perujukan yang terkait dengan jumlah.
Nilai yang mungkin:
-
google_searchGrounding dengan Google Penelusuran Web dan Penelusuran Gambar, & Grounding Web untuk Perusahaan.
-
google_mapsGrounding with Google Maps.
input_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token input menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
output_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token output menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
tool_use_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token penggunaan alat berdasarkan modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
Jumlah token di bagian perintah yang di-cache (konten yang di-cache).
Jumlah token dalam perintah (konteks).
Jumlah total token di semua respons yang dihasilkan.
Jumlah token pemikiran untuk model penalaran.
Jumlah total token untuk permintaan interaksi (prompt + respons + token internal lainnya).
Jumlah token yang ada dalam perintah penggunaan alat.
Contoh
Contoh Respons
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
Menghapus suara tersimpan kustom (`store = true`) berdasarkan nama resource. Suara katalog bawaan (`VOICE_TYPE_PREBUILT`) tidak dapat dihapus.
Parameter Jalur / Kueri
Wajib. Nama resource suara tersimpan kustom yang akan dihapus (misalnya, `voices/voice_abc123def456`).
Respons
Jika berhasil, respons akan kosong.
Contoh
Resource
Suara
Resource suara yang merepresentasikan suara kustom (dibuat melalui `CreateVoice`) atau suara sistem bawaan (ditampilkan oleh `ListVoices`).
Kolom
Opsional. Deskriptor aksen regional (misalnya, "Amerika", "Inggris").
Opsional. Konteks atau domain penggunaan yang optimal (misalnya, "Percakapan", "Buku audio", "Berita").
Opsional. Ringkasan deskriptif tentang timbre vokal, kepribadian, dan gaya bahasa.
Opsional. Nama tampilan yang diberikan pengguna untuk suara tersimpan (`store = true`), atau nama katalog untuk suara bawaan.
Hanya output. Stempel waktu saat suara tersimpan kustom (`store = true`) atau kunci suara yang direplikasi (`store = false`) berakhir. Tidak disetel untuk suara katalog bawaan (`"prebuilt"`), yang tidak akan berakhir.
Opsional. Persepsi presentasi gender suara (misalnya, "perempuan", "laki-laki", "netral").
Hanya output. ID unik suara. * Untuk suara kustom yang dikelola Google (`store = true`), ini adalah ID yang dibuat dengan awalan `voice_` (misalnya, `voice_abc123def456`). Teruskan `voices/{id}` sebagai `name` di `GetVoice` dan `DeleteVoice`, lalu teruskan `{id}` langsung ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan. * Untuk suara katalog bawaan (`"prebuilt"` yang ditampilkan oleh `ListVoices`), ini adalah nama penutur (misalnya, `Puck` atau `Charon`). * Tidak disetel saat `CreateVoice` dipanggil dengan `store = false`.
Hanya output. Kunci replikasi suara yang dikelola klien (dengan awalan `voicekey_`). Hanya ditampilkan oleh `CreateVoice` saat `type` adalah `"replicated"` dan `store` adalah `false`. Teruskan kunci ini ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan.
Opsional. Tag bahasa BCP-47 utama (misalnya, "en-US", "fr-FR").
Opsional. Model yang digunakan untuk mendesain atau mereplikasi suara. Jika tidak disertakan dalam `CreateVoice`, defaultnya adalah model desain suara yang didukung terbaru. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara kustom (`"prompted"` dan `"replicated"`); tidak ditetapkan untuk suara `"prebuilt"`. Suara yang dibuat dapat disintesis di seluruh model sintesis TTS yang didukung.
Opsional. Persona atau arketipe karakter yang diinginkan (misalnya, "Ramah", "Narator").
pitch Pitch (opsional)
Opsional. Klasifikasi nada suara.
Nilai yang mungkin
-
lowSuara dengan nada rendah.
-
mediumSuara dengan nada sedang.
-
highSuara dengan nada lebih tinggi.
diminta PromptedVoice (opsional)
Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.
Kolom
Wajib. Perintah bahasa alami yang mendeskripsikan suara yang diinginkan, misalnya: "Suara laki-laki yang dalam dan bergemuruh dari ogre jahat besar di usia paruh baya."
Opsional. Kode wilayah geografis ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "GB", "001").
sample_audio AudioData (opsional)
Hanya output. Contoh audio (audio perintah synthesizer) yang dihasilkan untuk suara yang diminta. Diisi hanya dalam respons `CreateVoice` dan `GetVoice` jika `type` adalah `"prompted"`; tidak disetel dalam respons `ListVoices` dan untuk suara `"replicated"` atau `"prebuilt"`.
Kolom
Wajib. Byte audio mentah.
Wajib. Jenis MIME IANA dari data audio (misalnya, `audio/wav` atau `audio/mpeg`).
type VoiceType (opsional)
Wajib. Jenis suara. Di `CreateVoice`, harus berupa `"replicated"` atau `"prompted"`. Dalam respons `ListVoices`, juga dapat berupa `"prebuilt"`.
Nilai yang mungkin
-
replicatedSuara kustom yang direplikasi dari sampel audio referensi dan rekaman izin penutur.
-
promptedSuara kustom yang dihasilkan dari perintah teks bahasa alami.
-
prebuiltSuara sistem bawaan dari katalog suara Google (misalnya, `Puck`, `Charon`). Ditampilkan dalam respons; tidak dapat ditentukan sebagai jenis dalam `CreateVoice`.
penggunaan Penggunaan (opsional)
Hanya output. Statistik penggunaan token untuk permintaan pembuatan suara. Diisi hanya dalam respons `CreateVoice` saat `type` adalah `"prompted"`; tidak disetel untuk `"replicated"` dan dalam respons `GetVoice` dan `ListVoices`.
Kolom
cached_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token yang di-cache menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
grounding_tool_count array (GroundingToolCount) (opsional)
Jumlah alat perujukan.
Kolom
Jumlah alat perataan tanah.
Jenis alat perujukan yang terkait dengan jumlah.
Nilai yang mungkin:
-
google_searchGrounding dengan Google Penelusuran Web dan Penelusuran Gambar, & Grounding Web untuk Perusahaan.
-
google_mapsGrounding with Google Maps.
input_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token input menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
output_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token output menurut modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
tool_use_tokens_by_modality array (ModalityTokens) (opsional)
Perincian penggunaan token penggunaan alat berdasarkan modalitas.
Kolom
modalitas ResponseModality (opsional)
Modalitas yang terkait dengan jumlah token.
Nilai yang mungkin
-
textMenunjukkan bahwa model harus menampilkan teks.
-
imageMenunjukkan bahwa model harus menampilkan gambar.
-
audioMenunjukkan bahwa model harus menampilkan audio.
-
videoMenunjukkan bahwa model harus menampilkan video.
-
documentMenunjukkan bahwa model harus menampilkan dokumen.
Jumlah token untuk modalitas.
Jumlah token di bagian perintah yang di-cache (konten yang di-cache).
Jumlah token dalam perintah (konteks).
Jumlah total token di semua respons yang dihasilkan.
Jumlah token pemikiran untuk model penalaran.
Jumlah total token untuk permintaan interaksi (prompt + respons + token internal lainnya).
Jumlah token yang ada dalam perintah penggunaan alat.