Gemini Voices API

Voices API memungkinkan Anda membuat suara kustom dari perintah bahasa alami (Desain Suara) atau dari audio referensi dan rekaman izin pembicara (Replikasi Suara), serta mencantumkan, mengambil, dan mengelola suara kustom dan bawaan untuk sintesis Text-to-Speech (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

Membuat suara kustom dari perintah bahasa alami (`VOICE_TYPE_PROMPTED`) atau dari rekaman audio rujukan dan izin (`VOICE_TYPE_REPLICATED`).

Isi permintaan

Isi permintaan memuat data dengan struktur berikut:

store boolean  (opsional)

Opsional. Apakah suara yang dibuat dipertahankan dan dikelola oleh Google. * Jika `true`, Google akan menyimpan suara dan menampilkan `Voice.id` (misalnya, `voice_abc123def456`), yang dapat dikelola melalui `GetVoice`, `ListVoices`, dan `DeleteVoice` serta dirujuk berdasarkan ID dalam permintaan sintesis. Project tunduk pada kuota suara tersimpan aktif maksimum; jika kuota terlampaui, `RESOURCE_EXHAUSTED` akan ditampilkan. * Jika `false` (default), suara tidak disimpan oleh Google dan `Voice.key` (misalnya, `voicekey_...`) ditampilkan untuk penyimpanan dan sintesis sisi klien. Bidang metadata penemuan opsional di `voice` tidak dipertahankan atau ditampilkan saat `store` adalah `false`. * Harus `true` saat `voice.type` adalah `"prompted"` (jika tidak, akan gagal dengan `INVALID_ARGUMENT`).

voice Voice  (wajib)

Wajib. Suara yang akan dibuat. `voice.model` bersifat opsional; jika tidak ada, layanan akan memilih model pembuatan suara default. Kolom hanya baca di `Voice` (`id`, `key`, `expire_time`, `usage`) diabaikan jika ditetapkan.

Respons

Jika berhasil, isi respons memuat data dengan struktur berikut:

aksen string  (opsional)

Opsional. Deskriptor aksen regional (misalnya, "Amerika", "Inggris").

context string  (opsional)

Opsional. Konteks atau domain penggunaan yang optimal (misalnya, "Percakapan", "Buku audio", "Berita").

description string  (opsional)

Opsional. Ringkasan deskriptif tentang timbre vokal, kepribadian, dan gaya bahasa.

display_name string  (opsional)

Opsional. Nama tampilan yang diberikan pengguna untuk suara tersimpan (`store = true`), atau nama katalog untuk suara bawaan.

expire_time string  (opsional)

Hanya output. Stempel waktu saat suara tersimpan kustom (`store = true`) atau kunci suara yang direplikasi (`store = false`) berakhir. Tidak disetel untuk suara katalog bawaan (`"prebuilt"`), yang tidak akan berakhir.

gender string  (opsional)

Opsional. Persepsi presentasi gender suara (misalnya, "perempuan", "laki-laki", "netral").

id string  (opsional)

Hanya output. ID unik suara. * Untuk suara kustom yang dikelola Google (`store = true`), ini adalah ID yang dibuat dengan awalan `voice_` (misalnya, `voice_abc123def456`). Teruskan `voices/{id}` sebagai `name` di `GetVoice` dan `DeleteVoice`, lalu teruskan `{id}` langsung ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan. * Untuk suara katalog bawaan (`"prebuilt"` yang ditampilkan oleh `ListVoices`), ini adalah nama penutur (misalnya, `Puck` atau `Charon`). * Tidak disetel saat `CreateVoice` dipanggil dengan `store = false`.

key string  (opsional)

Hanya output. Kunci replikasi suara yang dikelola klien (dengan awalan `voicekey_`). Hanya ditampilkan oleh `CreateVoice` saat `type` adalah `"replicated"` dan `store` adalah `false`. Teruskan kunci ini ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan.

language_code string  (opsional)

Opsional. Tag bahasa BCP-47 utama (misalnya, "en-US", "fr-FR").

model string  (opsional)

Opsional. Model yang digunakan untuk mendesain atau mereplikasi suara. Jika tidak disertakan dalam `CreateVoice`, defaultnya adalah model desain suara yang didukung terbaru. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara kustom (`"prompted"` dan `"replicated"`); tidak ditetapkan untuk suara `"prebuilt"`. Suara yang dibuat dapat disintesis di seluruh model sintesis TTS yang didukung.

persona string  (opsional)

Opsional. Persona atau arketipe karakter yang diinginkan (misalnya, "Ramah", "Narator").

pitch Pitch  (opsional)

Opsional. Klasifikasi nada suara.

Nilai yang mungkin

  • low

    Suara dengan nada rendah.

  • medium

    Suara dengan nada sedang.

  • high

    Suara dengan nada lebih tinggi.

diminta PromptedVoice  (opsional)

Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.

Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.

Kolom

input string  (opsional)

Wajib. Perintah bahasa alami yang mendeskripsikan suara yang diinginkan, misalnya: "Suara laki-laki yang dalam dan bergemuruh dari ogre jahat besar di usia paruh baya."

region_code string  (opsional)

Opsional. Kode wilayah geografis ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "GB", "001").

sample_audio AudioData  (opsional)

Hanya output. Contoh audio (audio perintah synthesizer) yang dihasilkan untuk suara yang diminta. Diisi hanya dalam respons `CreateVoice` dan `GetVoice` jika `type` adalah `"prompted"`; tidak disetel dalam respons `ListVoices` dan untuk suara `"replicated"` atau `"prebuilt"`.

Payload audio yang digunakan untuk pembuatan suara.

Kolom

data string  (opsional)

Wajib. Byte audio mentah.

mime_type string  (opsional)

Wajib. Jenis MIME IANA dari data audio (misalnya, `audio/wav` atau `audio/mpeg`).

type VoiceType  (opsional)

Wajib. Jenis suara. Di `CreateVoice`, harus berupa `"replicated"` atau `"prompted"`. Dalam respons `ListVoices`, juga dapat berupa `"prebuilt"`.

Nilai yang mungkin

  • replicated

    Suara kustom yang direplikasi dari sampel audio referensi dan rekaman izin penutur.

  • prompted

    Suara kustom yang dihasilkan dari perintah teks bahasa alami.

  • prebuilt

    Suara sistem bawaan dari katalog suara Google (misalnya, `Puck`, `Charon`). Ditampilkan dalam respons; tidak dapat ditentukan sebagai jenis dalam `CreateVoice`.

penggunaan Penggunaan  (opsional)

Hanya output. Statistik penggunaan token untuk permintaan pembuatan suara. Diisi hanya dalam respons `CreateVoice` saat `type` adalah `"prompted"`; tidak disetel untuk `"replicated"` dan dalam respons `GetVoice` dan `ListVoices`.

Statistik penggunaan token permintaan interaksi.

Kolom

cached_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token yang di-cache menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

grounding_tool_count array (GroundingToolCount)  (opsional)

Jumlah alat perujukan.

Jumlah alat perataan tanah.

Kolom

count integer  (opsional)

Jumlah alat perataan tanah.

type enum (string)  (opsional)

Jenis alat perujukan yang terkait dengan jumlah.

Nilai yang mungkin:

  • google_search

    Grounding dengan Google Penelusuran Web dan Penelusuran Gambar, & Grounding Web untuk Perusahaan.

  • google_maps

    Grounding with Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token input menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

output_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token output menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

tool_use_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token penggunaan alat berdasarkan modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

total_cached_tokens integer  (opsional)

Jumlah token di bagian perintah yang di-cache (konten yang di-cache).

total_input_tokens integer  (opsional)

Jumlah token dalam perintah (konteks).

total_output_tokens integer  (opsional)

Jumlah total token di semua respons yang dihasilkan.

total_thought_tokens integer  (opsional)

Jumlah token pemikiran untuk model penalaran.

total_tokens integer  (opsional)

Jumlah total token untuk permintaan interaksi (prompt + respons + token internal lainnya).

total_tool_use_tokens integer  (opsional)

Jumlah token yang ada dalam perintah penggunaan alat.

Contoh

Contoh Respons

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

Mencantumkan suara kustom tersimpan yang dimiliki oleh pemanggil (diurutkan dari yang terbaru terlebih dahulu), diikuti dengan suara sistem bawaan dari katalog suara Google.

Parameter Jalur / Kueri

aksen array (string)  (opsional)

Opsional. Filter menurut deskripsi aksen (misalnya, "Amerika", "Inggris"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, cocokkan suara dengan aksen yang ditentukan (OR).

context array (string)  (opsional)

Opsional. Filter menurut konteks atau domain yang dimaksud (misalnya, "Berita, Komersial"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, suara yang cocok adalah suara dengan salah satu konteks yang ditentukan (OR).

gender array (string)  (opsional)

Opsional. Filter menurut presentasi gender (misalnya, "perempuan", "laki-laki", "netral"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, cocokkan suara dengan salah satu jenis kelamin yang ditentukan (OR).

language_code array (string)  (opsional)

Opsional. Memfilter menurut kode bahasa BCP-47 (misalnya, "en-US"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, suara akan dicocokkan dengan salah satu kode bahasa yang ditentukan (OR).

page_size integer  (opsional)

Opsional. Jumlah maksimum suara yang akan ditampilkan per halaman. Layanan mungkin menampilkan lebih sedikit dari nilai ini. Jika tidak ditentukan, paling banyak 50 suara akan ditampilkan. Nilai maksimum adalah 1.000; nilai di atas 1.000 akan dikonversi menjadi 1.000.

page_token string  (opsional)

Opsional. Token halaman yang diterima dari panggilan `ListVoices` sebelumnya. Berikan ini untuk mengambil halaman selanjutnya. Saat melakukan penomoran halaman, semua parameter kueri filter (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, dan `search`) harus cocok dengan panggilan yang menampilkan token ini; jika tidak, permintaan akan gagal dengan `INVALID_ARGUMENT`. `page_size` dapat berubah di antara halaman.

persona array (string)  (opsional)

Opsional. Filter menurut persona suara (misalnya, "Hangat, Ramah"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, cocokkan suara dengan salah satu persona yang ditentukan (OR).

pitch array (string)  (opsional)

Opsional. Filter menurut nada suara. Menerima "low", "medium", "high" atau "PITCH_LOW", "PITCH_MEDIUM", "PITCH_HIGH" (tidak peka huruf besar/kecil). Jika beberapa nilai ditentukan, cocokkan suara dengan nada yang ditentukan (OR).

region_code array (string)  (opsional)

Opsional. Filter menurut kode wilayah ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "001"). Pencocokan persis yang tidak peka huruf besar/kecil. Jika beberapa nilai ditentukan, suara yang cocok adalah suara dengan salah satu kode wilayah yang ditentukan (OR).

search string  (opsional)

Opsional. Kueri penelusuran substring teks bebas cocok dengan `display_name` dan `description` tanpa membedakan huruf besar/kecil. Maksimum 2.048 byte.

type array (string)  (opsional)

Opsional. Filter menurut jenis suara. Menerima "prebuilt", "replicated", "prompted" atau "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (tidak peka huruf besar/kecil). Jika beberapa nilai ditentukan, mencocokkan suara dengan salah satu jenis yang ditentukan (OR).

Respons

Jika berhasil, isi respons memuat data dengan struktur berikut:

next_page_token string  (opsional)

Token yang dapat dikirim sebagai `page_token` untuk mengambil halaman berikutnya. Jika kosong, tidak ada halaman berikutnya.

voices array (Voice)  (opsional)

Suara dari koleksi yang ditentukan.

Contoh

Contoh Respons

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Mendapatkan suara tersimpan kustom (`store = true`) berdasarkan nama resource. Suara katalog bawaan (`VOICE_TYPE_PREBUILT`) tidak dapat diambil melalui `GetVoice`; gunakan `ListVoices` sebagai gantinya.

Parameter Jalur / Kueri

voicesId string  (wajib)

Wajib. Nama resource suara tersimpan kustom yang akan diambil (misalnya, `voices/voice_abc123def456`).

Respons

Jika berhasil, isi respons memuat data dengan struktur berikut:

aksen string  (opsional)

Opsional. Deskriptor aksen regional (misalnya, "Amerika", "Inggris").

context string  (opsional)

Opsional. Konteks atau domain penggunaan yang optimal (misalnya, "Percakapan", "Buku audio", "Berita").

description string  (opsional)

Opsional. Ringkasan deskriptif tentang timbre vokal, kepribadian, dan gaya bahasa.

display_name string  (opsional)

Opsional. Nama tampilan yang diberikan pengguna untuk suara tersimpan (`store = true`), atau nama katalog untuk suara bawaan.

expire_time string  (opsional)

Hanya output. Stempel waktu saat suara tersimpan kustom (`store = true`) atau kunci suara yang direplikasi (`store = false`) berakhir. Tidak disetel untuk suara katalog bawaan (`"prebuilt"`), yang tidak akan berakhir.

gender string  (opsional)

Opsional. Persepsi presentasi gender suara (misalnya, "perempuan", "laki-laki", "netral").

id string  (opsional)

Hanya output. ID unik suara. * Untuk suara kustom yang dikelola Google (`store = true`), ini adalah ID yang dibuat dengan awalan `voice_` (misalnya, `voice_abc123def456`). Teruskan `voices/{id}` sebagai `name` di `GetVoice` dan `DeleteVoice`, lalu teruskan `{id}` langsung ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan. * Untuk suara katalog bawaan (`"prebuilt"` yang ditampilkan oleh `ListVoices`), ini adalah nama penutur (misalnya, `Puck` atau `Charon`). * Tidak disetel saat `CreateVoice` dipanggil dengan `store = false`.

key string  (opsional)

Hanya output. Kunci replikasi suara yang dikelola klien (dengan awalan `voicekey_`). Hanya ditampilkan oleh `CreateVoice` saat `type` adalah `"replicated"` dan `store` adalah `false`. Teruskan kunci ini ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan.

language_code string  (opsional)

Opsional. Tag bahasa BCP-47 utama (misalnya, "en-US", "fr-FR").

model string  (opsional)

Opsional. Model yang digunakan untuk mendesain atau mereplikasi suara. Jika tidak disertakan dalam `CreateVoice`, defaultnya adalah model desain suara yang didukung terbaru. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara kustom (`"prompted"` dan `"replicated"`); tidak ditetapkan untuk suara `"prebuilt"`. Suara yang dibuat dapat disintesis di seluruh model sintesis TTS yang didukung.

persona string  (opsional)

Opsional. Persona atau arketipe karakter yang diinginkan (misalnya, "Ramah", "Narator").

pitch Pitch  (opsional)

Opsional. Klasifikasi nada suara.

Nilai yang mungkin

  • low

    Suara dengan nada rendah.

  • medium

    Suara dengan nada sedang.

  • high

    Suara dengan nada lebih tinggi.

diminta PromptedVoice  (opsional)

Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.

Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.

Kolom

input string  (opsional)

Wajib. Perintah bahasa alami yang mendeskripsikan suara yang diinginkan, misalnya: "Suara laki-laki yang dalam dan bergemuruh dari ogre jahat besar di usia paruh baya."

region_code string  (opsional)

Opsional. Kode wilayah geografis ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "GB", "001").

sample_audio AudioData  (opsional)

Hanya output. Contoh audio (audio perintah synthesizer) yang dihasilkan untuk suara yang diminta. Diisi hanya dalam respons `CreateVoice` dan `GetVoice` jika `type` adalah `"prompted"`; tidak disetel dalam respons `ListVoices` dan untuk suara `"replicated"` atau `"prebuilt"`.

Payload audio yang digunakan untuk pembuatan suara.

Kolom

data string  (opsional)

Wajib. Byte audio mentah.

mime_type string  (opsional)

Wajib. Jenis MIME IANA dari data audio (misalnya, `audio/wav` atau `audio/mpeg`).

type VoiceType  (opsional)

Wajib. Jenis suara. Di `CreateVoice`, harus berupa `"replicated"` atau `"prompted"`. Dalam respons `ListVoices`, juga dapat berupa `"prebuilt"`.

Nilai yang mungkin

  • replicated

    Suara kustom yang direplikasi dari sampel audio referensi dan rekaman izin penutur.

  • prompted

    Suara kustom yang dihasilkan dari perintah teks bahasa alami.

  • prebuilt

    Suara sistem bawaan dari katalog suara Google (misalnya, `Puck`, `Charon`). Ditampilkan dalam respons; tidak dapat ditentukan sebagai jenis dalam `CreateVoice`.

penggunaan Penggunaan  (opsional)

Hanya output. Statistik penggunaan token untuk permintaan pembuatan suara. Diisi hanya dalam respons `CreateVoice` saat `type` adalah `"prompted"`; tidak disetel untuk `"replicated"` dan dalam respons `GetVoice` dan `ListVoices`.

Statistik penggunaan token permintaan interaksi.

Kolom

cached_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token yang di-cache menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

grounding_tool_count array (GroundingToolCount)  (opsional)

Jumlah alat perujukan.

Jumlah alat perataan tanah.

Kolom

count integer  (opsional)

Jumlah alat perataan tanah.

type enum (string)  (opsional)

Jenis alat perujukan yang terkait dengan jumlah.

Nilai yang mungkin:

  • google_search

    Grounding dengan Google Penelusuran Web dan Penelusuran Gambar, & Grounding Web untuk Perusahaan.

  • google_maps

    Grounding with Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token input menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

output_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token output menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

tool_use_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token penggunaan alat berdasarkan modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

total_cached_tokens integer  (opsional)

Jumlah token di bagian perintah yang di-cache (konten yang di-cache).

total_input_tokens integer  (opsional)

Jumlah token dalam perintah (konteks).

total_output_tokens integer  (opsional)

Jumlah total token di semua respons yang dihasilkan.

total_thought_tokens integer  (opsional)

Jumlah token pemikiran untuk model penalaran.

total_tokens integer  (opsional)

Jumlah total token untuk permintaan interaksi (prompt + respons + token internal lainnya).

total_tool_use_tokens integer  (opsional)

Jumlah token yang ada dalam perintah penggunaan alat.

Contoh

Contoh Respons

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

Menghapus suara tersimpan kustom (`store = true`) berdasarkan nama resource. Suara katalog bawaan (`VOICE_TYPE_PREBUILT`) tidak dapat dihapus.

Parameter Jalur / Kueri

voicesId string  (wajib)

Wajib. Nama resource suara tersimpan kustom yang akan dihapus (misalnya, `voices/voice_abc123def456`).

Respons

Jika berhasil, respons akan kosong.

Contoh

Resource

Suara

Resource suara yang merepresentasikan suara kustom (dibuat melalui `CreateVoice`) atau suara sistem bawaan (ditampilkan oleh `ListVoices`).

Kolom

aksen string  (opsional)

Opsional. Deskriptor aksen regional (misalnya, "Amerika", "Inggris").

context string  (opsional)

Opsional. Konteks atau domain penggunaan yang optimal (misalnya, "Percakapan", "Buku audio", "Berita").

description string  (opsional)

Opsional. Ringkasan deskriptif tentang timbre vokal, kepribadian, dan gaya bahasa.

display_name string  (opsional)

Opsional. Nama tampilan yang diberikan pengguna untuk suara tersimpan (`store = true`), atau nama katalog untuk suara bawaan.

expire_time string  (opsional)

Hanya output. Stempel waktu saat suara tersimpan kustom (`store = true`) atau kunci suara yang direplikasi (`store = false`) berakhir. Tidak disetel untuk suara katalog bawaan (`"prebuilt"`), yang tidak akan berakhir.

gender string  (opsional)

Opsional. Persepsi presentasi gender suara (misalnya, "perempuan", "laki-laki", "netral").

id string  (opsional)

Hanya output. ID unik suara. * Untuk suara kustom yang dikelola Google (`store = true`), ini adalah ID yang dibuat dengan awalan `voice_` (misalnya, `voice_abc123def456`). Teruskan `voices/{id}` sebagai `name` di `GetVoice` dan `DeleteVoice`, lalu teruskan `{id}` langsung ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan. * Untuk suara katalog bawaan (`"prebuilt"` yang ditampilkan oleh `ListVoices`), ini adalah nama penutur (misalnya, `Puck` atau `Charon`). * Tidak disetel saat `CreateVoice` dipanggil dengan `store = false`.

key string  (opsional)

Hanya output. Kunci replikasi suara yang dikelola klien (dengan awalan `voicekey_`). Hanya ditampilkan oleh `CreateVoice` saat `type` adalah `"replicated"` dan `store` adalah `false`. Teruskan kunci ini ke `SpeechConfig.voice_config.voice` (atau `SpeechConfig.voice`) selama sintesis ucapan.

language_code string  (opsional)

Opsional. Tag bahasa BCP-47 utama (misalnya, "en-US", "fr-FR").

model string  (opsional)

Opsional. Model yang digunakan untuk mendesain atau mereplikasi suara. Jika tidak disertakan dalam `CreateVoice`, defaultnya adalah model desain suara yang didukung terbaru. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara kustom (`"prompted"` dan `"replicated"`); tidak ditetapkan untuk suara `"prebuilt"`. Suara yang dibuat dapat disintesis di seluruh model sintesis TTS yang didukung.

persona string  (opsional)

Opsional. Persona atau arketipe karakter yang diinginkan (misalnya, "Ramah", "Narator").

pitch Pitch  (opsional)

Opsional. Klasifikasi nada suara.

Nilai yang mungkin

  • low

    Suara dengan nada rendah.

  • medium

    Suara dengan nada sedang.

  • high

    Suara dengan nada lebih tinggi.

diminta PromptedVoice  (opsional)

Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.

Parameter untuk pembuatan suara yang dipicu. Wajib di `CreateVoice` jika `type` adalah `"prompted"`. Ditampilkan dalam respons `CreateVoice`, `GetVoice`, dan `ListVoices` untuk suara yang diminta.

Kolom

input string  (opsional)

Wajib. Perintah bahasa alami yang mendeskripsikan suara yang diinginkan, misalnya: "Suara laki-laki yang dalam dan bergemuruh dari ogre jahat besar di usia paruh baya."

region_code string  (opsional)

Opsional. Kode wilayah geografis ISO 3166-1 alpha-2 atau UN M.49 (misalnya, "US", "GB", "001").

sample_audio AudioData  (opsional)

Hanya output. Contoh audio (audio perintah synthesizer) yang dihasilkan untuk suara yang diminta. Diisi hanya dalam respons `CreateVoice` dan `GetVoice` jika `type` adalah `"prompted"`; tidak disetel dalam respons `ListVoices` dan untuk suara `"replicated"` atau `"prebuilt"`.

Payload audio yang digunakan untuk pembuatan suara.

Kolom

data string  (opsional)

Wajib. Byte audio mentah.

mime_type string  (opsional)

Wajib. Jenis MIME IANA dari data audio (misalnya, `audio/wav` atau `audio/mpeg`).

type VoiceType  (opsional)

Wajib. Jenis suara. Di `CreateVoice`, harus berupa `"replicated"` atau `"prompted"`. Dalam respons `ListVoices`, juga dapat berupa `"prebuilt"`.

Nilai yang mungkin

  • replicated

    Suara kustom yang direplikasi dari sampel audio referensi dan rekaman izin penutur.

  • prompted

    Suara kustom yang dihasilkan dari perintah teks bahasa alami.

  • prebuilt

    Suara sistem bawaan dari katalog suara Google (misalnya, `Puck`, `Charon`). Ditampilkan dalam respons; tidak dapat ditentukan sebagai jenis dalam `CreateVoice`.

penggunaan Penggunaan  (opsional)

Hanya output. Statistik penggunaan token untuk permintaan pembuatan suara. Diisi hanya dalam respons `CreateVoice` saat `type` adalah `"prompted"`; tidak disetel untuk `"replicated"` dan dalam respons `GetVoice` dan `ListVoices`.

Statistik penggunaan token permintaan interaksi.

Kolom

cached_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token yang di-cache menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

grounding_tool_count array (GroundingToolCount)  (opsional)

Jumlah alat perujukan.

Jumlah alat perataan tanah.

Kolom

count integer  (opsional)

Jumlah alat perataan tanah.

type enum (string)  (opsional)

Jenis alat perujukan yang terkait dengan jumlah.

Nilai yang mungkin:

  • google_search

    Grounding dengan Google Penelusuran Web dan Penelusuran Gambar, & Grounding Web untuk Perusahaan.

  • google_maps

    Grounding with Google Maps.

input_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token input menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

output_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token output menurut modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

tool_use_tokens_by_modality array (ModalityTokens)  (opsional)

Perincian penggunaan token penggunaan alat berdasarkan modalitas.

Jumlah token untuk modalitas respons tunggal.

Kolom

modalitas ResponseModality  (opsional)

Modalitas yang terkait dengan jumlah token.

Nilai yang mungkin

  • text

    Menunjukkan bahwa model harus menampilkan teks.

  • image

    Menunjukkan bahwa model harus menampilkan gambar.

  • audio

    Menunjukkan bahwa model harus menampilkan audio.

  • video

    Menunjukkan bahwa model harus menampilkan video.

  • document

    Menunjukkan bahwa model harus menampilkan dokumen.

token integer  (opsional)

Jumlah token untuk modalitas.

total_cached_tokens integer  (opsional)

Jumlah token di bagian perintah yang di-cache (konten yang di-cache).

total_input_tokens integer  (opsional)

Jumlah token dalam perintah (konteks).

total_output_tokens integer  (opsional)

Jumlah total token di semua respons yang dihasilkan.

total_thought_tokens integer  (opsional)

Jumlah token pemikiran untuk model penalaran.

total_tokens integer  (opsional)

Jumlah total token untuk permintaan interaksi (prompt + respons + token internal lainnya).

total_tool_use_tokens integer  (opsional)

Jumlah token yang ada dalam perintah penggunaan alat.