Gemini Voices API

Voices API ช่วยให้คุณสร้างเสียงที่กำหนดเองจากพรอมต์ภาษาธรรมชาติ (การออกแบบเสียง) หรือจากเสียงอ้างอิงและเสียงบันทึกความยินยอมของผู้พูด (การจำลองเสียง) รวมถึงแสดง เรียกข้อมูล และจัดการเสียงที่กำหนดเองและเสียงที่สร้างไว้ล่วงหน้าสำหรับการสังเคราะห์ข้อความเป็นคำพูด (TTS)

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

สร้างเสียงที่กำหนดเองจากพรอมต์ภาษาธรรมชาติ (`VOICE_TYPE_PROMPTED`) หรือจากไฟล์บันทึกเสียงอ้างอิงและเสียงที่ได้รับความยินยอม (`VOICE_TYPE_REPLICATED`)

เนื้อความของคำขอ

เนื้อหาของคำขอมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้

store boolean  (ไม่บังคับ)

ไม่บังคับ Google จะจัดเก็บและจัดการเสียงที่สร้างขึ้นหรือไม่ * เมื่อเป็น `true` Google จะจัดเก็บเสียงและแสดงผล `Voice.id` (เช่น `voice_abc123def456`) ซึ่งจัดการได้ผ่าน `GetVoice`, `ListVoices`, และ `DeleteVoice` และอ้างอิงตามรหัสในคำขอการสังเคราะห์ โปรเจ็กต์ มีโควต้าเสียงที่จัดเก็บที่ใช้งานอยู่สูงสุด การใช้โควต้าเกิน จะทำให้ระบบแสดง `RESOURCE_EXHAUSTED` * เมื่อเป็น `false` (ค่าเริ่มต้น) Google จะไม่จัดเก็บเสียงและจะแสดง `Voice.key` (เช่น `voicekey_...`) สำหรับการจัดเก็บและการสังเคราะห์ฝั่งไคลเอ็นต์ ระบบจะไม่บันทึกหรือแสดงช่องข้อมูลเมตาการค้นพบที่ไม่บังคับใน `voice` เมื่อ `store` เป็น `false` * ต้องเป็น `true` เมื่อ `voice.type` เป็น `"prompted"` (มิฉะนั้นจะล้มเหลวด้วย `INVALID_ARGUMENT`)

voice Voice  (ต้องระบุ)

ต้องระบุ เสียงที่จะสร้าง `voice.model` เป็นพารามิเตอร์ที่ไม่บังคับ หากไม่ระบุ บริการจะเลือกโมเดลการสร้างเสียงเริ่มต้น ระบบจะไม่สนใจฟิลด์เอาต์พุตเท่านั้นใน `Voice` (`id`, `key`, `expire_time`, `usage`) หากมีการตั้งค่า

คำตอบ

หากทำสำเร็จ เนื้อหาการตอบกลับจะมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้

accent string  (ไม่บังคับ)

ไม่บังคับ คำอธิบายสำเนียงในภูมิภาค (เช่น "อเมริกัน" "อังกฤษ")

บริบท สตริง  (ไม่บังคับ)

ไม่บังคับ บริบทหรือโดเมนการใช้งานที่เหมาะสม (เช่น "การสนทนา", "หนังสือเสียง" "ข่าว")

description string  (ไม่บังคับ)

ไม่บังคับ สรุปเชิงพรรณนาเกี่ยวกับคุณภาพเสียง บุคลิก และโทนเสียง

display_name string  (ไม่บังคับ)

ไม่บังคับ ชื่อที่แสดงที่ผู้ใช้ระบุสำหรับเสียงที่จัดเก็บ (`store = true`) หรือชื่อแคตตาล็อกสำหรับเสียงที่สร้างไว้ล่วงหน้า

expire_time string  (ไม่บังคับ)

เอาต์พุตเท่านั้น การประทับเวลาที่คีย์เสียงที่จัดเก็บที่กำหนดเอง (`store = true`) หรือคีย์เสียงที่จำลอง (`store = false`) หมดอายุ ยกเลิกการตั้งค่าสำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"`) ซึ่งไม่มีวันหมดอายุ

เพศ สตริง  (ไม่บังคับ)

ไม่บังคับ การนำเสนอเพศของเสียงที่รับรู้ (เช่น "หญิง" "ชาย" "เป็นกลาง")

id สตริง  (ไม่บังคับ)

เอาต์พุตเท่านั้น ตัวระบุที่ไม่ซ้ำกันของเสียง * สำหรับเสียงที่กำหนดเองซึ่ง Google จัดการ (`store = true`) นี่คือรหัสที่สร้างขึ้น โดยมีคำนำหน้า `voice_` (เช่น `voice_abc123def456`) ส่ง `voices/{id}` เป็น `name` ใน `GetVoice` และ `DeleteVoice` และส่ง `{id}` ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) โดยตรงในระหว่างการสังเคราะห์เสียงพูด * สำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"` ที่ส่งคืนโดย `ListVoices`) นี่คือชื่อผู้พูด (เช่น `Puck` หรือ `Charon`) * ไม่ได้ตั้งค่าเมื่อมีการเรียก `CreateVoice` ด้วย `store = false`

คีย์ สตริง  (ไม่บังคับ)

เอาต์พุตเท่านั้น คีย์การจำลองเสียงที่ไคลเอ็นต์จัดการ (มีคำนำหน้าเป็น "voicekey_") จะแสดงโดย `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"replicated"` และ `store` เป็น `false` ส่งคีย์นี้ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) ในระหว่างการสังเคราะห์เสียงพูด

language_code string  (ไม่บังคับ)

ไม่บังคับ แท็กภาษา BCP-47 หลัก (เช่น "en-US", "fr-FR")

model string  (ไม่บังคับ)

ไม่บังคับ โมเดลที่ใช้ในการออกแบบหรือจำลองเสียง หากไม่ระบุใน `CreateVoice` ระบบจะใช้โมเดลการออกแบบเสียงล่าสุดที่รองรับโดยค่าเริ่มต้น ส่งคืนในการตอบกลับ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่กำหนดเอง (`"prompted"` และ `"replicated"`) ไม่ได้ตั้งค่าสำหรับเสียง `"prebuilt"` คุณสามารถสังเคราะห์เสียงที่สร้างขึ้นในโมเดลการสังเคราะห์ TTS ที่รองรับ

persona string  (ไม่บังคับ)

ไม่บังคับ อวตารหรือต้นแบบตัวละครที่ต้องการ (เช่น "อบอุ่น เป็นมิตร" "ผู้บรรยาย")

pitch Pitch  (ไม่บังคับ)

ไม่บังคับ การจัดประเภทระดับเสียงสูงต่ำ

ค่าที่เป็นไปได้

  • low

    เสียงต่ำกว่านี้

  • medium

    เสียงระดับกลาง

  • high

    เสียงสูงกว่านี้

ได้รับแจ้ง PromptedVoice  (ไม่บังคับ)

พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง

พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง

ช่อง

input string  (ไม่บังคับ)

ต้องระบุ พรอมต์ภาษาธรรมชาติที่อธิบายเสียงที่ต้องการ เช่น "เสียงผู้ชายทุ้มก้องของยักษ์ชั่วร้ายตัวใหญ่ในวัยกลางคน"

region_code string  (ไม่บังคับ)

ไม่บังคับ รหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "GB", "001")

sample_audio AudioData  (ไม่บังคับ)

เอาต์พุตเท่านั้น เสียงตัวอย่าง (เสียงพรอมต์ของซินธิไซเซอร์) ที่สร้างขึ้นสำหรับ เสียงที่ได้รับพรอมต์ จะแสดงในคำตอบ `CreateVoice` และ `GetVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` และจะไม่มีการตั้งค่าในคำตอบ `ListVoices` และสำหรับเสียง `"replicated"` หรือ `"prebuilt"`

เพย์โหลดเสียงที่ใช้ในการสร้างเสียง

ช่อง

data string  (ไม่บังคับ)

ต้องระบุ ไบต์เสียงดิบ

mime_type string  (ไม่บังคับ)

ต้องระบุ ประเภท MIME ของ IANA ของข้อมูลเสียง (เช่น `audio/wav` หรือ `audio/mpeg`)

type VoiceType  (ไม่บังคับ)

ต้องระบุ ประเภทของเสียง ใน `CreateVoice` ต้องเป็น `"replicated"` หรือ `"prompted"` ในการตอบกลับ `ListVoices` อาจเป็น `"prebuilt"` ด้วย

ค่าที่เป็นไปได้

  • replicated

    เสียงที่กำหนดเองซึ่งจำลองจากตัวอย่างเสียงอ้างอิงและบันทึกความยินยอมของผู้พูด

  • prompted

    เสียงที่กำหนดเองซึ่งสร้างจากพรอมต์ข้อความภาษาธรรมชาติ

  • prebuilt

    เสียงของระบบในตัวจากแคตตาล็อกเสียงของ Google (เช่น `Puck`, `Charon`) แสดงในคำตอบ โดยระบุเป็นประเภทใน `CreateVoice` ไม่ได้

usage Usage  (ไม่บังคับ)

เอาต์พุตเท่านั้น สถิติการใช้โทเค็นสำหรับคำขอสร้างเสียง จะแสดงในคำตอบของ `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` โดยจะไม่มีการตั้งค่าสำหรับ `"replicated"` และในคำตอบของ `GetVoice` และ `ListVoices`

สถิติการใช้โทเค็นของคำขอโต้ตอบ

ช่อง

cached_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้งานโทเค็นที่แคชไว้ตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

grounding_tool_count array (GroundingToolCount)  (ไม่บังคับ)

จำนวนเครื่องมือเชื่อมต่อแหล่งข้อมูล

จำนวนเครื่องมือต่อสายดิน

ช่อง

count integer  (ไม่บังคับ)

จำนวนเครื่องมือต่อสายดิน

ประเภท enum (สตริง)  (ไม่บังคับ)

ประเภทเครื่องมือการอ้างอิงที่เชื่อมโยงกับการนับ

ค่าที่เป็นไปได้ มีดังนี้

  • google_search

    การเชื่อมต่อแหล่งข้อมูลกับ Google Web Search และ Image Search รวมถึงการเชื่อมต่อแหล่งข้อมูลบนเว็บ สำหรับองค์กร

  • google_maps

    การเชื่อมต่อแหล่งข้อมูลกับ Google Maps

input_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้โทเค็นอินพุตตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

output_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้โทเค็นเอาต์พุตตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

tool_use_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้งานโทเค็นการใช้เครื่องมือตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

total_cached_tokens integer  (ไม่บังคับ)

จํานวนโทเค็นในส่วนที่แคชของพรอมต์ (เนื้อหาที่แคช)

total_input_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นในพรอมต์ (บริบท)

total_output_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นทั้งหมดในคำตอบที่สร้างขึ้นทั้งหมด

total_thought_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นของความคิดสำหรับโมเดลการคิด

total_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นทั้งหมดสำหรับคำขอการโต้ตอบ (พรอมต์ + คำตอบ + โทเค็นภายในอื่นๆ )

total_tool_use_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นที่อยู่ในพรอมต์การใช้เครื่องมือ

ตัวอย่าง

ตัวอย่างการตอบกลับ

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

แสดงรายการเสียงที่กำหนดเองซึ่งผู้โทรเป็นเจ้าของ (เรียงจากใหม่สุดไปเก่าสุด) ตามด้วยเสียงของระบบที่สร้างไว้ล่วงหน้าจากแคตตาล็อกเสียงของ Google

พารามิเตอร์เส้นทาง / การค้นหา

accent array (string)  (ไม่บังคับ)

ไม่บังคับ กรองตามคำอธิบายสำเนียง (เช่น "อเมริกัน" "อังกฤษ") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่เสียงที่มีสำเนียงที่ระบุ (OR)

บริบท อาร์เรย์ (สตริง)  (ไม่บังคับ)

ไม่บังคับ กรองตามบริบทหรือโดเมนที่ต้องการ (เช่น "ข่าว, เชิงพาณิชย์") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่ เสียงกับบริบทใดก็ได้ที่ระบุ (OR)

gender อาร์เรย์ (สตริง)  (ไม่บังคับ)

ไม่บังคับ กรองตามการนำเสนอเพศ (เช่น "หญิง" "ชาย" "เป็นกลาง") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่ เสียงกับเพศที่ระบุ (OR)

language_code array (string)  (ไม่บังคับ)

ไม่บังคับ กรองตามรหัสภาษา BCP-47 (เช่น "en-US") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่ เสียงกับรหัสภาษาที่ระบุ (OR)

page_size integer  (ไม่บังคับ)

ไม่บังคับ จำนวนเสียงสูงสุดที่จะแสดงต่อหน้า บริการอาจ แสดงผลน้อยกว่าค่านี้ หากไม่ได้ระบุ ระบบจะแสดงผลเสียงอย่างน้อย 50 เสียง ค่าสูงสุดคือ 1,000 และระบบจะบังคับให้ค่าที่มากกว่า 1,000 เป็น 1,000

page_token string  (ไม่บังคับ)

ไม่บังคับ โทเค็นหน้าเว็บที่ได้รับจากการเรียกใช้ `ListVoices` ก่อนหน้า ระบุ นี้เพื่อดึงข้อมูลหน้าถัดไป เมื่อแบ่งหน้า พารามิเตอร์การค้นหาตัวกรองทั้งหมด (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, และ `search`) ต้องตรงกับการเรียกที่แสดงโทเค็นนี้ ไม่เช่นนั้นคำขอจะล้มเหลวโดยมีข้อความ `INVALID_ARGUMENT` `page_size` อาจเปลี่ยนแปลงระหว่าง หน้า

persona array (string)  (ไม่บังคับ)

ไม่บังคับ กรองตามลักษณะเสียง (เช่น "อบอุ่น เป็นมิตร") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่เสียงกับลักษณะตัวตนที่ระบุ (OR)

pitch อาร์เรย์ (สตริง)  (ไม่บังคับ)

ไม่บังคับ กรองตามระดับเสียงร้อง ยอมรับ "ต่ำ" "ปานกลาง" "สูง" หรือ "PITCH_LOW" "PITCH_MEDIUM" "PITCH_HIGH" (ไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่) หากระบุค่าหลายค่า ระบบจะจับคู่เสียงที่มีระดับเสียงใดก็ได้ที่ระบุ (OR)

region_code array (string)  (ไม่บังคับ)

ไม่บังคับ กรองตามรหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "001") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่เสียงกับรหัสภูมิภาคที่ระบุ (OR)

search string  (ไม่บังคับ)

ไม่บังคับ คำค้นหาแบบข้อความอิสระที่ตรงกันโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ กับทั้ง `display_name` และ `description` สูงสุด 2048 ไบต์

ประเภท อาร์เรย์ (สตริง)  (ไม่บังคับ)

ไม่บังคับ กรองตามประเภทเสียง ยอมรับ "prebuilt", "replicated", "prompted" หรือ "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (ไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่) หากระบุค่าหลายค่า จะจับคู่เสียงกับประเภทที่ระบุ (OR)

คำตอบ

หากทำสำเร็จ เนื้อหาการตอบกลับจะมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้

next_page_token string  (ไม่บังคับ)

โทเค็นที่ส่งเป็น `page_token` เพื่อดึงข้อมูลหน้าถัดไปได้ หากว่างเปล่า แสดงว่าไม่มีหน้าถัดไป

voices array (Voice)  (ไม่บังคับ)

เสียงจากคอลเล็กชันที่ระบุ

ตัวอย่าง

ตัวอย่างการตอบกลับ

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

รับเสียงที่กำหนดเองที่จัดเก็บไว้ (`store = true`) ตามชื่อทรัพยากร เรียกเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`VOICE_TYPE_PREBUILT`) ผ่าน `GetVoice` ไม่ได้ ให้ใช้ `ListVoices` แทน

พารามิเตอร์เส้นทาง / การค้นหา

voicesId string  (ต้องระบุ)

ต้องระบุ ชื่อทรัพยากรของเสียงที่กำหนดเองที่จัดเก็บไว้เพื่อดึงข้อมูล (เช่น `voices/voice_abc123def456`)

คำตอบ

หากทำสำเร็จ เนื้อหาการตอบกลับจะมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้

accent string  (ไม่บังคับ)

ไม่บังคับ คำอธิบายสำเนียงในภูมิภาค (เช่น "อเมริกัน" "อังกฤษ")

บริบท สตริง  (ไม่บังคับ)

ไม่บังคับ บริบทหรือโดเมนการใช้งานที่เหมาะสม (เช่น "การสนทนา", "หนังสือเสียง" "ข่าว")

description string  (ไม่บังคับ)

ไม่บังคับ สรุปเชิงพรรณนาเกี่ยวกับคุณภาพเสียง บุคลิก และโทนเสียง

display_name string  (ไม่บังคับ)

ไม่บังคับ ชื่อที่แสดงที่ผู้ใช้ระบุสำหรับเสียงที่จัดเก็บ (`store = true`) หรือชื่อแคตตาล็อกสำหรับเสียงที่สร้างไว้ล่วงหน้า

expire_time string  (ไม่บังคับ)

เอาต์พุตเท่านั้น การประทับเวลาที่คีย์เสียงที่จัดเก็บที่กำหนดเอง (`store = true`) หรือคีย์เสียงที่จำลอง (`store = false`) หมดอายุ ยกเลิกการตั้งค่าสำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"`) ซึ่งไม่มีวันหมดอายุ

เพศ สตริง  (ไม่บังคับ)

ไม่บังคับ การนำเสนอเพศของเสียงที่รับรู้ (เช่น "หญิง" "ชาย" "เป็นกลาง")

id สตริง  (ไม่บังคับ)

เอาต์พุตเท่านั้น ตัวระบุที่ไม่ซ้ำกันของเสียง * สำหรับเสียงที่กำหนดเองซึ่ง Google จัดการ (`store = true`) นี่คือรหัสที่สร้างขึ้น โดยมีคำนำหน้า `voice_` (เช่น `voice_abc123def456`) ส่ง `voices/{id}` เป็น `name` ใน `GetVoice` และ `DeleteVoice` และส่ง `{id}` ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) โดยตรงในระหว่างการสังเคราะห์เสียงพูด * สำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"` ที่ส่งคืนโดย `ListVoices`) นี่คือชื่อผู้พูด (เช่น `Puck` หรือ `Charon`) * ไม่ได้ตั้งค่าเมื่อมีการเรียก `CreateVoice` ด้วย `store = false`

คีย์ สตริง  (ไม่บังคับ)

เอาต์พุตเท่านั้น คีย์การจำลองเสียงที่ไคลเอ็นต์จัดการ (มีคำนำหน้าเป็น "voicekey_") จะแสดงโดย `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"replicated"` และ `store` เป็น `false` ส่งคีย์นี้ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) ในระหว่างการสังเคราะห์เสียงพูด

language_code string  (ไม่บังคับ)

ไม่บังคับ แท็กภาษา BCP-47 หลัก (เช่น "en-US", "fr-FR")

model string  (ไม่บังคับ)

ไม่บังคับ โมเดลที่ใช้ในการออกแบบหรือจำลองเสียง หากไม่ระบุใน `CreateVoice` ระบบจะใช้โมเดลการออกแบบเสียงล่าสุดที่รองรับโดยค่าเริ่มต้น ส่งคืนในการตอบกลับ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่กำหนดเอง (`"prompted"` และ `"replicated"`) ไม่ได้ตั้งค่าสำหรับเสียง `"prebuilt"` คุณสามารถสังเคราะห์เสียงที่สร้างขึ้นในโมเดลการสังเคราะห์ TTS ที่รองรับ

persona string  (ไม่บังคับ)

ไม่บังคับ อวตารหรือต้นแบบตัวละครที่ต้องการ (เช่น "อบอุ่น เป็นมิตร" "ผู้บรรยาย")

pitch Pitch  (ไม่บังคับ)

ไม่บังคับ การจัดประเภทระดับเสียงสูงต่ำ

ค่าที่เป็นไปได้

  • low

    เสียงต่ำกว่านี้

  • medium

    เสียงระดับกลาง

  • high

    เสียงสูงกว่านี้

ได้รับแจ้ง PromptedVoice  (ไม่บังคับ)

พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง

พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง

ช่อง

input string  (ไม่บังคับ)

ต้องระบุ พรอมต์ภาษาธรรมชาติที่อธิบายเสียงที่ต้องการ เช่น "เสียงผู้ชายทุ้มก้องของยักษ์ชั่วร้ายตัวใหญ่ในวัยกลางคน"

region_code string  (ไม่บังคับ)

ไม่บังคับ รหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "GB", "001")

sample_audio AudioData  (ไม่บังคับ)

เอาต์พุตเท่านั้น เสียงตัวอย่าง (เสียงพรอมต์ของซินธิไซเซอร์) ที่สร้างขึ้นสำหรับ เสียงที่ได้รับพรอมต์ จะแสดงในคำตอบ `CreateVoice` และ `GetVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` และจะไม่มีการตั้งค่าในคำตอบ `ListVoices` และสำหรับเสียง `"replicated"` หรือ `"prebuilt"`

เพย์โหลดเสียงที่ใช้ในการสร้างเสียง

ช่อง

data string  (ไม่บังคับ)

ต้องระบุ ไบต์เสียงดิบ

mime_type string  (ไม่บังคับ)

ต้องระบุ ประเภท MIME ของ IANA ของข้อมูลเสียง (เช่น `audio/wav` หรือ `audio/mpeg`)

type VoiceType  (ไม่บังคับ)

ต้องระบุ ประเภทของเสียง ใน `CreateVoice` ต้องเป็น `"replicated"` หรือ `"prompted"` ในการตอบกลับ `ListVoices` อาจเป็น `"prebuilt"` ด้วย

ค่าที่เป็นไปได้

  • replicated

    เสียงที่กำหนดเองซึ่งจำลองจากตัวอย่างเสียงอ้างอิงและบันทึกความยินยอมของผู้พูด

  • prompted

    เสียงที่กำหนดเองซึ่งสร้างจากพรอมต์ข้อความภาษาธรรมชาติ

  • prebuilt

    เสียงของระบบในตัวจากแคตตาล็อกเสียงของ Google (เช่น `Puck`, `Charon`) แสดงในคำตอบ โดยระบุเป็นประเภทใน `CreateVoice` ไม่ได้

usage Usage  (ไม่บังคับ)

เอาต์พุตเท่านั้น สถิติการใช้โทเค็นสำหรับคำขอสร้างเสียง จะแสดงในคำตอบของ `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` โดยจะไม่มีการตั้งค่าสำหรับ `"replicated"` และในคำตอบของ `GetVoice` และ `ListVoices`

สถิติการใช้โทเค็นของคำขอโต้ตอบ

ช่อง

cached_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้งานโทเค็นที่แคชไว้ตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

grounding_tool_count array (GroundingToolCount)  (ไม่บังคับ)

จำนวนเครื่องมือเชื่อมต่อแหล่งข้อมูล

จำนวนเครื่องมือต่อสายดิน

ช่อง

count integer  (ไม่บังคับ)

จำนวนเครื่องมือต่อสายดิน

ประเภท enum (สตริง)  (ไม่บังคับ)

ประเภทเครื่องมือการอ้างอิงที่เชื่อมโยงกับการนับ

ค่าที่เป็นไปได้ มีดังนี้

  • google_search

    การเชื่อมต่อแหล่งข้อมูลกับ Google Web Search และ Image Search รวมถึงการเชื่อมต่อแหล่งข้อมูลบนเว็บ สำหรับองค์กร

  • google_maps

    การเชื่อมต่อแหล่งข้อมูลกับ Google Maps

input_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้โทเค็นอินพุตตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

output_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้โทเค็นเอาต์พุตตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

tool_use_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้งานโทเค็นการใช้เครื่องมือตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

total_cached_tokens integer  (ไม่บังคับ)

จํานวนโทเค็นในส่วนที่แคชของพรอมต์ (เนื้อหาที่แคช)

total_input_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นในพรอมต์ (บริบท)

total_output_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นทั้งหมดในคำตอบที่สร้างขึ้นทั้งหมด

total_thought_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นของความคิดสำหรับโมเดลการคิด

total_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นทั้งหมดสำหรับคำขอการโต้ตอบ (พรอมต์ + คำตอบ + โทเค็นภายในอื่นๆ )

total_tool_use_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นที่อยู่ในพรอมต์การใช้เครื่องมือ

ตัวอย่าง

ตัวอย่างการตอบกลับ

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

ลบเสียงที่กำหนดเองที่จัดเก็บไว้ (`store = true`) ตามชื่อทรัพยากร ลบเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`VOICE_TYPE_PREBUILT`) ไม่ได้

พารามิเตอร์เส้นทาง / การค้นหา

voicesId string  (ต้องระบุ)

ต้องระบุ ชื่อทรัพยากรของเสียงที่กำหนดเองที่จัดเก็บไว้ซึ่งจะลบ (เช่น `voices/voice_abc123def456`)

คำตอบ

หากทำสำเร็จ การตอบกลับจะว่างเปล่า

ตัวอย่าง

แหล่งข้อมูล

Voice

ทรัพยากรเสียงที่แสดงถึงเสียงที่กำหนดเอง (สร้างผ่าน `CreateVoice`) หรือเสียงของระบบที่สร้างไว้ล่วงหน้า (แสดงผลโดย `ListVoices`)

ช่อง

accent string  (ไม่บังคับ)

ไม่บังคับ คำอธิบายสำเนียงในภูมิภาค (เช่น "อเมริกัน" "อังกฤษ")

บริบท สตริง  (ไม่บังคับ)

ไม่บังคับ บริบทหรือโดเมนการใช้งานที่เหมาะสม (เช่น "การสนทนา", "หนังสือเสียง" "ข่าว")

description string  (ไม่บังคับ)

ไม่บังคับ สรุปเชิงพรรณนาเกี่ยวกับคุณภาพเสียง บุคลิก และโทนเสียง

display_name string  (ไม่บังคับ)

ไม่บังคับ ชื่อที่แสดงที่ผู้ใช้ระบุสำหรับเสียงที่จัดเก็บ (`store = true`) หรือชื่อแคตตาล็อกสำหรับเสียงที่สร้างไว้ล่วงหน้า

expire_time string  (ไม่บังคับ)

เอาต์พุตเท่านั้น การประทับเวลาที่คีย์เสียงที่จัดเก็บที่กำหนดเอง (`store = true`) หรือคีย์เสียงที่จำลอง (`store = false`) หมดอายุ ยกเลิกการตั้งค่าสำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"`) ซึ่งไม่มีวันหมดอายุ

เพศ สตริง  (ไม่บังคับ)

ไม่บังคับ การนำเสนอเพศของเสียงที่รับรู้ (เช่น "หญิง" "ชาย" "เป็นกลาง")

id สตริง  (ไม่บังคับ)

เอาต์พุตเท่านั้น ตัวระบุที่ไม่ซ้ำกันของเสียง * สำหรับเสียงที่กำหนดเองซึ่ง Google จัดการ (`store = true`) นี่คือรหัสที่สร้างขึ้น โดยมีคำนำหน้า `voice_` (เช่น `voice_abc123def456`) ส่ง `voices/{id}` เป็น `name` ใน `GetVoice` และ `DeleteVoice` และส่ง `{id}` ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) โดยตรงในระหว่างการสังเคราะห์เสียงพูด * สำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"` ที่ส่งคืนโดย `ListVoices`) นี่คือชื่อผู้พูด (เช่น `Puck` หรือ `Charon`) * ไม่ได้ตั้งค่าเมื่อมีการเรียก `CreateVoice` ด้วย `store = false`

คีย์ สตริง  (ไม่บังคับ)

เอาต์พุตเท่านั้น คีย์การจำลองเสียงที่ไคลเอ็นต์จัดการ (มีคำนำหน้าเป็น "voicekey_") จะแสดงโดย `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"replicated"` และ `store` เป็น `false` ส่งคีย์นี้ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) ในระหว่างการสังเคราะห์เสียงพูด

language_code string  (ไม่บังคับ)

ไม่บังคับ แท็กภาษา BCP-47 หลัก (เช่น "en-US", "fr-FR")

model string  (ไม่บังคับ)

ไม่บังคับ โมเดลที่ใช้ในการออกแบบหรือจำลองเสียง หากไม่ระบุใน `CreateVoice` ระบบจะใช้โมเดลการออกแบบเสียงล่าสุดที่รองรับโดยค่าเริ่มต้น ส่งคืนในการตอบกลับ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่กำหนดเอง (`"prompted"` และ `"replicated"`) ไม่ได้ตั้งค่าสำหรับเสียง `"prebuilt"` คุณสามารถสังเคราะห์เสียงที่สร้างขึ้นในโมเดลการสังเคราะห์ TTS ที่รองรับ

persona string  (ไม่บังคับ)

ไม่บังคับ อวตารหรือต้นแบบตัวละครที่ต้องการ (เช่น "อบอุ่น เป็นมิตร" "ผู้บรรยาย")

pitch Pitch  (ไม่บังคับ)

ไม่บังคับ การจัดประเภทระดับเสียงสูงต่ำ

ค่าที่เป็นไปได้

  • low

    เสียงต่ำกว่านี้

  • medium

    เสียงระดับกลาง

  • high

    เสียงสูงกว่านี้

พรอมต์ PromptedVoice  (ไม่บังคับ)

พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง

พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง

ช่อง

input string  (ไม่บังคับ)

ต้องระบุ พรอมต์ภาษาธรรมชาติที่อธิบายเสียงที่ต้องการ เช่น "เสียงผู้ชายทุ้มก้องของยักษ์ชั่วร้ายตัวใหญ่ในวัยกลางคน"

region_code string  (ไม่บังคับ)

ไม่บังคับ รหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "GB", "001")

sample_audio AudioData  (ไม่บังคับ)

เอาต์พุตเท่านั้น เสียงตัวอย่าง (เสียงพรอมต์ของซินธิไซเซอร์) ที่สร้างขึ้นสำหรับ เสียงที่ได้รับพรอมต์ จะแสดงในคำตอบ `CreateVoice` และ `GetVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` และจะไม่มีการตั้งค่าในคำตอบ `ListVoices` และสำหรับเสียง `"replicated"` หรือ `"prebuilt"`

เพย์โหลดเสียงที่ใช้ในการสร้างเสียง

ช่อง

data string  (ไม่บังคับ)

ต้องระบุ ไบต์เสียงดิบ

mime_type string  (ไม่บังคับ)

ต้องระบุ ประเภท MIME ของ IANA ของข้อมูลเสียง (เช่น `audio/wav` หรือ `audio/mpeg`)

type VoiceType  (ไม่บังคับ)

ต้องระบุ ประเภทของเสียง ใน `CreateVoice` ต้องเป็น `"replicated"` หรือ `"prompted"` ในการตอบกลับ `ListVoices` อาจเป็น `"prebuilt"` ด้วย

ค่าที่เป็นไปได้

  • replicated

    เสียงที่กำหนดเองซึ่งจำลองจากตัวอย่างเสียงอ้างอิงและบันทึกความยินยอมของผู้พูด

  • prompted

    เสียงที่กำหนดเองซึ่งสร้างจากพรอมต์ข้อความภาษาธรรมชาติ

  • prebuilt

    เสียงของระบบในตัวจากแคตตาล็อกเสียงของ Google (เช่น `Puck`, `Charon`) แสดงในคำตอบ โดยระบุเป็นประเภทใน `CreateVoice` ไม่ได้

usage Usage  (ไม่บังคับ)

เอาต์พุตเท่านั้น สถิติการใช้โทเค็นสำหรับคำขอสร้างเสียง จะแสดงในคำตอบของ `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` โดยจะไม่มีการตั้งค่าสำหรับ `"replicated"` และในคำตอบของ `GetVoice` และ `ListVoices`

สถิติการใช้โทเค็นของคำขอโต้ตอบ

ช่อง

cached_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้งานโทเค็นที่แคชไว้ตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

grounding_tool_count array (GroundingToolCount)  (ไม่บังคับ)

จำนวนเครื่องมือเชื่อมต่อแหล่งข้อมูล

จำนวนเครื่องมือต่อสายดิน

ช่อง

count integer  (ไม่บังคับ)

จำนวนเครื่องมือต่อสายดิน

ประเภท enum (สตริง)  (ไม่บังคับ)

ประเภทเครื่องมือการอ้างอิงที่เชื่อมโยงกับการนับ

ค่าที่เป็นไปได้ มีดังนี้

  • google_search

    การเชื่อมต่อแหล่งข้อมูลกับ Google Web Search และ Image Search รวมถึงการเชื่อมต่อแหล่งข้อมูลบนเว็บ สำหรับองค์กร

  • google_maps

    การเชื่อมต่อแหล่งข้อมูลกับ Google Maps

input_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้โทเค็นอินพุตตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

output_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้โทเค็นเอาต์พุตตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

tool_use_tokens_by_modality array (ModalityTokens)  (ไม่บังคับ)

รายละเอียดการใช้งานโทเค็นการใช้เครื่องมือตามรูปแบบ

จำนวนโทเค็นสำหรับรูปแบบการตอบกลับเดียว

ช่อง

modality ResponseModality  (ไม่บังคับ)

รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น

ค่าที่เป็นไปได้

  • text

    ระบุว่าโมเดลควรแสดงผลข้อความ

  • image

    ระบุว่าโมเดลควรแสดงรูปภาพ

  • audio

    ระบุว่าโมเดลควรส่งคืนเสียง

  • video

    ระบุว่าโมเดลควรแสดงวิดีโอ

  • document

    ระบุว่าโมเดลควรแสดงเอกสาร

โทเค็น จำนวนเต็ม  (ไม่บังคับ)

จำนวนโทเค็นสำหรับรูปแบบ

total_cached_tokens integer  (ไม่บังคับ)

จํานวนโทเค็นในส่วนที่แคชของพรอมต์ (เนื้อหาที่แคช)

total_input_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นในพรอมต์ (บริบท)

total_output_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นทั้งหมดในคำตอบที่สร้างขึ้นทั้งหมด

total_thought_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นของความคิดสำหรับโมเดลการคิด

total_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นทั้งหมดสำหรับคำขอการโต้ตอบ (พรอมต์ + คำตอบ + โทเค็นภายในอื่นๆ )

total_tool_use_tokens integer  (ไม่บังคับ)

จำนวนโทเค็นที่อยู่ในพรอมต์การใช้เครื่องมือ