Voices API ช่วยให้คุณสร้างเสียงที่กำหนดเองจากพรอมต์ภาษาธรรมชาติ (การออกแบบเสียง) หรือจากเสียงอ้างอิงและเสียงบันทึกความยินยอมของผู้พูด (การจำลองเสียง) รวมถึงแสดง เรียกข้อมูล และจัดการเสียงที่กำหนดเองและเสียงที่สร้างไว้ล่วงหน้าสำหรับการสังเคราะห์ข้อความเป็นคำพูด (TTS)
CreateVoice
สร้างเสียงที่กำหนดเองจากพรอมต์ภาษาธรรมชาติ (`VOICE_TYPE_PROMPTED`) หรือจากไฟล์บันทึกเสียงอ้างอิงและเสียงที่ได้รับความยินยอม (`VOICE_TYPE_REPLICATED`)
เนื้อความของคำขอ
เนื้อหาของคำขอมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้
ไม่บังคับ Google จะจัดเก็บและจัดการเสียงที่สร้างขึ้นหรือไม่ * เมื่อเป็น `true` Google จะจัดเก็บเสียงและแสดงผล `Voice.id` (เช่น `voice_abc123def456`) ซึ่งจัดการได้ผ่าน `GetVoice`, `ListVoices`, และ `DeleteVoice` และอ้างอิงตามรหัสในคำขอการสังเคราะห์ โปรเจ็กต์ มีโควต้าเสียงที่จัดเก็บที่ใช้งานอยู่สูงสุด การใช้โควต้าเกิน จะทำให้ระบบแสดง `RESOURCE_EXHAUSTED` * เมื่อเป็น `false` (ค่าเริ่มต้น) Google จะไม่จัดเก็บเสียงและจะแสดง `Voice.key` (เช่น `voicekey_...`) สำหรับการจัดเก็บและการสังเคราะห์ฝั่งไคลเอ็นต์ ระบบจะไม่บันทึกหรือแสดงช่องข้อมูลเมตาการค้นพบที่ไม่บังคับใน `voice` เมื่อ `store` เป็น `false` * ต้องเป็น `true` เมื่อ `voice.type` เป็น `"prompted"` (มิฉะนั้นจะล้มเหลวด้วย `INVALID_ARGUMENT`)
ต้องระบุ เสียงที่จะสร้าง `voice.model` เป็นพารามิเตอร์ที่ไม่บังคับ หากไม่ระบุ บริการจะเลือกโมเดลการสร้างเสียงเริ่มต้น ระบบจะไม่สนใจฟิลด์เอาต์พุตเท่านั้นใน `Voice` (`id`, `key`, `expire_time`, `usage`) หากมีการตั้งค่า
คำตอบ
หากทำสำเร็จ เนื้อหาการตอบกลับจะมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้
ไม่บังคับ คำอธิบายสำเนียงในภูมิภาค (เช่น "อเมริกัน" "อังกฤษ")
ไม่บังคับ บริบทหรือโดเมนการใช้งานที่เหมาะสม (เช่น "การสนทนา", "หนังสือเสียง" "ข่าว")
ไม่บังคับ สรุปเชิงพรรณนาเกี่ยวกับคุณภาพเสียง บุคลิก และโทนเสียง
ไม่บังคับ ชื่อที่แสดงที่ผู้ใช้ระบุสำหรับเสียงที่จัดเก็บ (`store = true`) หรือชื่อแคตตาล็อกสำหรับเสียงที่สร้างไว้ล่วงหน้า
เอาต์พุตเท่านั้น การประทับเวลาที่คีย์เสียงที่จัดเก็บที่กำหนดเอง (`store = true`) หรือคีย์เสียงที่จำลอง (`store = false`) หมดอายุ ยกเลิกการตั้งค่าสำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"`) ซึ่งไม่มีวันหมดอายุ
ไม่บังคับ การนำเสนอเพศของเสียงที่รับรู้ (เช่น "หญิง" "ชาย" "เป็นกลาง")
เอาต์พุตเท่านั้น ตัวระบุที่ไม่ซ้ำกันของเสียง * สำหรับเสียงที่กำหนดเองซึ่ง Google จัดการ (`store = true`) นี่คือรหัสที่สร้างขึ้น โดยมีคำนำหน้า `voice_` (เช่น `voice_abc123def456`) ส่ง `voices/{id}` เป็น `name` ใน `GetVoice` และ `DeleteVoice` และส่ง `{id}` ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) โดยตรงในระหว่างการสังเคราะห์เสียงพูด * สำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"` ที่ส่งคืนโดย `ListVoices`) นี่คือชื่อผู้พูด (เช่น `Puck` หรือ `Charon`) * ไม่ได้ตั้งค่าเมื่อมีการเรียก `CreateVoice` ด้วย `store = false`
เอาต์พุตเท่านั้น คีย์การจำลองเสียงที่ไคลเอ็นต์จัดการ (มีคำนำหน้าเป็น "voicekey_") จะแสดงโดย `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"replicated"` และ `store` เป็น `false` ส่งคีย์นี้ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) ในระหว่างการสังเคราะห์เสียงพูด
ไม่บังคับ แท็กภาษา BCP-47 หลัก (เช่น "en-US", "fr-FR")
ไม่บังคับ โมเดลที่ใช้ในการออกแบบหรือจำลองเสียง หากไม่ระบุใน `CreateVoice` ระบบจะใช้โมเดลการออกแบบเสียงล่าสุดที่รองรับโดยค่าเริ่มต้น ส่งคืนในการตอบกลับ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่กำหนดเอง (`"prompted"` และ `"replicated"`) ไม่ได้ตั้งค่าสำหรับเสียง `"prebuilt"` คุณสามารถสังเคราะห์เสียงที่สร้างขึ้นในโมเดลการสังเคราะห์ TTS ที่รองรับ
ไม่บังคับ อวตารหรือต้นแบบตัวละครที่ต้องการ (เช่น "อบอุ่น เป็นมิตร" "ผู้บรรยาย")
pitch Pitch (ไม่บังคับ)
ไม่บังคับ การจัดประเภทระดับเสียงสูงต่ำ
ค่าที่เป็นไปได้
-
lowเสียงต่ำกว่านี้
-
mediumเสียงระดับกลาง
-
highเสียงสูงกว่านี้
ได้รับแจ้ง PromptedVoice (ไม่บังคับ)
พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง
ช่อง
ต้องระบุ พรอมต์ภาษาธรรมชาติที่อธิบายเสียงที่ต้องการ เช่น "เสียงผู้ชายทุ้มก้องของยักษ์ชั่วร้ายตัวใหญ่ในวัยกลางคน"
ไม่บังคับ รหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "GB", "001")
sample_audio AudioData (ไม่บังคับ)
เอาต์พุตเท่านั้น เสียงตัวอย่าง (เสียงพรอมต์ของซินธิไซเซอร์) ที่สร้างขึ้นสำหรับ เสียงที่ได้รับพรอมต์ จะแสดงในคำตอบ `CreateVoice` และ `GetVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` และจะไม่มีการตั้งค่าในคำตอบ `ListVoices` และสำหรับเสียง `"replicated"` หรือ `"prebuilt"`
ช่อง
ต้องระบุ ไบต์เสียงดิบ
ต้องระบุ ประเภท MIME ของ IANA ของข้อมูลเสียง (เช่น `audio/wav` หรือ `audio/mpeg`)
type VoiceType (ไม่บังคับ)
ต้องระบุ ประเภทของเสียง ใน `CreateVoice` ต้องเป็น `"replicated"` หรือ `"prompted"` ในการตอบกลับ `ListVoices` อาจเป็น `"prebuilt"` ด้วย
ค่าที่เป็นไปได้
-
replicatedเสียงที่กำหนดเองซึ่งจำลองจากตัวอย่างเสียงอ้างอิงและบันทึกความยินยอมของผู้พูด
-
promptedเสียงที่กำหนดเองซึ่งสร้างจากพรอมต์ข้อความภาษาธรรมชาติ
-
prebuiltเสียงของระบบในตัวจากแคตตาล็อกเสียงของ Google (เช่น `Puck`, `Charon`) แสดงในคำตอบ โดยระบุเป็นประเภทใน `CreateVoice` ไม่ได้
usage Usage (ไม่บังคับ)
เอาต์พุตเท่านั้น สถิติการใช้โทเค็นสำหรับคำขอสร้างเสียง จะแสดงในคำตอบของ `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` โดยจะไม่มีการตั้งค่าสำหรับ `"replicated"` และในคำตอบของ `GetVoice` และ `ListVoices`
ช่อง
cached_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้งานโทเค็นที่แคชไว้ตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
grounding_tool_count array (GroundingToolCount) (ไม่บังคับ)
จำนวนเครื่องมือเชื่อมต่อแหล่งข้อมูล
ช่อง
จำนวนเครื่องมือต่อสายดิน
ประเภทเครื่องมือการอ้างอิงที่เชื่อมโยงกับการนับ
ค่าที่เป็นไปได้ มีดังนี้
-
google_searchการเชื่อมต่อแหล่งข้อมูลกับ Google Web Search และ Image Search รวมถึงการเชื่อมต่อแหล่งข้อมูลบนเว็บ สำหรับองค์กร
-
google_mapsการเชื่อมต่อแหล่งข้อมูลกับ Google Maps
input_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้โทเค็นอินพุตตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
output_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้โทเค็นเอาต์พุตตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
tool_use_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้งานโทเค็นการใช้เครื่องมือตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
จํานวนโทเค็นในส่วนที่แคชของพรอมต์ (เนื้อหาที่แคช)
จำนวนโทเค็นในพรอมต์ (บริบท)
จำนวนโทเค็นทั้งหมดในคำตอบที่สร้างขึ้นทั้งหมด
จำนวนโทเค็นของความคิดสำหรับโมเดลการคิด
จำนวนโทเค็นทั้งหมดสำหรับคำขอการโต้ตอบ (พรอมต์ + คำตอบ + โทเค็นภายในอื่นๆ )
จำนวนโทเค็นที่อยู่ในพรอมต์การใช้เครื่องมือ
ตัวอย่าง
ตัวอย่างการตอบกลับ
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
แสดงรายการเสียงที่กำหนดเองซึ่งผู้โทรเป็นเจ้าของ (เรียงจากใหม่สุดไปเก่าสุด) ตามด้วยเสียงของระบบที่สร้างไว้ล่วงหน้าจากแคตตาล็อกเสียงของ Google
พารามิเตอร์เส้นทาง / การค้นหา
ไม่บังคับ กรองตามคำอธิบายสำเนียง (เช่น "อเมริกัน" "อังกฤษ") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่เสียงที่มีสำเนียงที่ระบุ (OR)
ไม่บังคับ กรองตามบริบทหรือโดเมนที่ต้องการ (เช่น "ข่าว, เชิงพาณิชย์") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่ เสียงกับบริบทใดก็ได้ที่ระบุ (OR)
ไม่บังคับ กรองตามการนำเสนอเพศ (เช่น "หญิง" "ชาย" "เป็นกลาง") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่ เสียงกับเพศที่ระบุ (OR)
ไม่บังคับ กรองตามรหัสภาษา BCP-47 (เช่น "en-US") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่ เสียงกับรหัสภาษาที่ระบุ (OR)
ไม่บังคับ จำนวนเสียงสูงสุดที่จะแสดงต่อหน้า บริการอาจ แสดงผลน้อยกว่าค่านี้ หากไม่ได้ระบุ ระบบจะแสดงผลเสียงอย่างน้อย 50 เสียง ค่าสูงสุดคือ 1,000 และระบบจะบังคับให้ค่าที่มากกว่า 1,000 เป็น 1,000
ไม่บังคับ โทเค็นหน้าเว็บที่ได้รับจากการเรียกใช้ `ListVoices` ก่อนหน้า ระบุ นี้เพื่อดึงข้อมูลหน้าถัดไป เมื่อแบ่งหน้า พารามิเตอร์การค้นหาตัวกรองทั้งหมด (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type`, และ `search`) ต้องตรงกับการเรียกที่แสดงโทเค็นนี้ ไม่เช่นนั้นคำขอจะล้มเหลวโดยมีข้อความ `INVALID_ARGUMENT` `page_size` อาจเปลี่ยนแปลงระหว่าง หน้า
ไม่บังคับ กรองตามลักษณะเสียง (เช่น "อบอุ่น เป็นมิตร") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่เสียงกับลักษณะตัวตนที่ระบุ (OR)
ไม่บังคับ กรองตามระดับเสียงร้อง ยอมรับ "ต่ำ" "ปานกลาง" "สูง" หรือ "PITCH_LOW" "PITCH_MEDIUM" "PITCH_HIGH" (ไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่) หากระบุค่าหลายค่า ระบบจะจับคู่เสียงที่มีระดับเสียงใดก็ได้ที่ระบุ (OR)
ไม่บังคับ กรองตามรหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "001") การทำงานแบบตรงทั้งหมดโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ หากระบุค่าหลายค่า ระบบจะจับคู่เสียงกับรหัสภูมิภาคที่ระบุ (OR)
ไม่บังคับ คำค้นหาแบบข้อความอิสระที่ตรงกันโดยไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ กับทั้ง `display_name` และ `description` สูงสุด 2048 ไบต์
ไม่บังคับ กรองตามประเภทเสียง ยอมรับ "prebuilt", "replicated", "prompted" หรือ "VOICE_TYPE_PREBUILT", "VOICE_TYPE_REPLICATED", "VOICE_TYPE_PROMPTED" (ไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่) หากระบุค่าหลายค่า จะจับคู่เสียงกับประเภทที่ระบุ (OR)
คำตอบ
หากทำสำเร็จ เนื้อหาการตอบกลับจะมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้
โทเค็นที่ส่งเป็น `page_token` เพื่อดึงข้อมูลหน้าถัดไปได้ หากว่างเปล่า แสดงว่าไม่มีหน้าถัดไป
เสียงจากคอลเล็กชันที่ระบุ
ตัวอย่าง
ตัวอย่างการตอบกลับ
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
รับเสียงที่กำหนดเองที่จัดเก็บไว้ (`store = true`) ตามชื่อทรัพยากร เรียกเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`VOICE_TYPE_PREBUILT`) ผ่าน `GetVoice` ไม่ได้ ให้ใช้ `ListVoices` แทน
พารามิเตอร์เส้นทาง / การค้นหา
ต้องระบุ ชื่อทรัพยากรของเสียงที่กำหนดเองที่จัดเก็บไว้เพื่อดึงข้อมูล (เช่น `voices/voice_abc123def456`)
คำตอบ
หากทำสำเร็จ เนื้อหาการตอบกลับจะมีข้อมูลซึ่งมีโครงสร้างดังต่อไปนี้
ไม่บังคับ คำอธิบายสำเนียงในภูมิภาค (เช่น "อเมริกัน" "อังกฤษ")
ไม่บังคับ บริบทหรือโดเมนการใช้งานที่เหมาะสม (เช่น "การสนทนา", "หนังสือเสียง" "ข่าว")
ไม่บังคับ สรุปเชิงพรรณนาเกี่ยวกับคุณภาพเสียง บุคลิก และโทนเสียง
ไม่บังคับ ชื่อที่แสดงที่ผู้ใช้ระบุสำหรับเสียงที่จัดเก็บ (`store = true`) หรือชื่อแคตตาล็อกสำหรับเสียงที่สร้างไว้ล่วงหน้า
เอาต์พุตเท่านั้น การประทับเวลาที่คีย์เสียงที่จัดเก็บที่กำหนดเอง (`store = true`) หรือคีย์เสียงที่จำลอง (`store = false`) หมดอายุ ยกเลิกการตั้งค่าสำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"`) ซึ่งไม่มีวันหมดอายุ
ไม่บังคับ การนำเสนอเพศของเสียงที่รับรู้ (เช่น "หญิง" "ชาย" "เป็นกลาง")
เอาต์พุตเท่านั้น ตัวระบุที่ไม่ซ้ำกันของเสียง * สำหรับเสียงที่กำหนดเองซึ่ง Google จัดการ (`store = true`) นี่คือรหัสที่สร้างขึ้น โดยมีคำนำหน้า `voice_` (เช่น `voice_abc123def456`) ส่ง `voices/{id}` เป็น `name` ใน `GetVoice` และ `DeleteVoice` และส่ง `{id}` ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) โดยตรงในระหว่างการสังเคราะห์เสียงพูด * สำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"` ที่ส่งคืนโดย `ListVoices`) นี่คือชื่อผู้พูด (เช่น `Puck` หรือ `Charon`) * ไม่ได้ตั้งค่าเมื่อมีการเรียก `CreateVoice` ด้วย `store = false`
เอาต์พุตเท่านั้น คีย์การจำลองเสียงที่ไคลเอ็นต์จัดการ (มีคำนำหน้าเป็น "voicekey_") จะแสดงโดย `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"replicated"` และ `store` เป็น `false` ส่งคีย์นี้ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) ในระหว่างการสังเคราะห์เสียงพูด
ไม่บังคับ แท็กภาษา BCP-47 หลัก (เช่น "en-US", "fr-FR")
ไม่บังคับ โมเดลที่ใช้ในการออกแบบหรือจำลองเสียง หากไม่ระบุใน `CreateVoice` ระบบจะใช้โมเดลการออกแบบเสียงล่าสุดที่รองรับโดยค่าเริ่มต้น ส่งคืนในการตอบกลับ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่กำหนดเอง (`"prompted"` และ `"replicated"`) ไม่ได้ตั้งค่าสำหรับเสียง `"prebuilt"` คุณสามารถสังเคราะห์เสียงที่สร้างขึ้นในโมเดลการสังเคราะห์ TTS ที่รองรับ
ไม่บังคับ อวตารหรือต้นแบบตัวละครที่ต้องการ (เช่น "อบอุ่น เป็นมิตร" "ผู้บรรยาย")
pitch Pitch (ไม่บังคับ)
ไม่บังคับ การจัดประเภทระดับเสียงสูงต่ำ
ค่าที่เป็นไปได้
-
lowเสียงต่ำกว่านี้
-
mediumเสียงระดับกลาง
-
highเสียงสูงกว่านี้
ได้รับแจ้ง PromptedVoice (ไม่บังคับ)
พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง
ช่อง
ต้องระบุ พรอมต์ภาษาธรรมชาติที่อธิบายเสียงที่ต้องการ เช่น "เสียงผู้ชายทุ้มก้องของยักษ์ชั่วร้ายตัวใหญ่ในวัยกลางคน"
ไม่บังคับ รหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "GB", "001")
sample_audio AudioData (ไม่บังคับ)
เอาต์พุตเท่านั้น เสียงตัวอย่าง (เสียงพรอมต์ของซินธิไซเซอร์) ที่สร้างขึ้นสำหรับ เสียงที่ได้รับพรอมต์ จะแสดงในคำตอบ `CreateVoice` และ `GetVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` และจะไม่มีการตั้งค่าในคำตอบ `ListVoices` และสำหรับเสียง `"replicated"` หรือ `"prebuilt"`
ช่อง
ต้องระบุ ไบต์เสียงดิบ
ต้องระบุ ประเภท MIME ของ IANA ของข้อมูลเสียง (เช่น `audio/wav` หรือ `audio/mpeg`)
type VoiceType (ไม่บังคับ)
ต้องระบุ ประเภทของเสียง ใน `CreateVoice` ต้องเป็น `"replicated"` หรือ `"prompted"` ในการตอบกลับ `ListVoices` อาจเป็น `"prebuilt"` ด้วย
ค่าที่เป็นไปได้
-
replicatedเสียงที่กำหนดเองซึ่งจำลองจากตัวอย่างเสียงอ้างอิงและบันทึกความยินยอมของผู้พูด
-
promptedเสียงที่กำหนดเองซึ่งสร้างจากพรอมต์ข้อความภาษาธรรมชาติ
-
prebuiltเสียงของระบบในตัวจากแคตตาล็อกเสียงของ Google (เช่น `Puck`, `Charon`) แสดงในคำตอบ โดยระบุเป็นประเภทใน `CreateVoice` ไม่ได้
usage Usage (ไม่บังคับ)
เอาต์พุตเท่านั้น สถิติการใช้โทเค็นสำหรับคำขอสร้างเสียง จะแสดงในคำตอบของ `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` โดยจะไม่มีการตั้งค่าสำหรับ `"replicated"` และในคำตอบของ `GetVoice` และ `ListVoices`
ช่อง
cached_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้งานโทเค็นที่แคชไว้ตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
grounding_tool_count array (GroundingToolCount) (ไม่บังคับ)
จำนวนเครื่องมือเชื่อมต่อแหล่งข้อมูล
ช่อง
จำนวนเครื่องมือต่อสายดิน
ประเภทเครื่องมือการอ้างอิงที่เชื่อมโยงกับการนับ
ค่าที่เป็นไปได้ มีดังนี้
-
google_searchการเชื่อมต่อแหล่งข้อมูลกับ Google Web Search และ Image Search รวมถึงการเชื่อมต่อแหล่งข้อมูลบนเว็บ สำหรับองค์กร
-
google_mapsการเชื่อมต่อแหล่งข้อมูลกับ Google Maps
input_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้โทเค็นอินพุตตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
output_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้โทเค็นเอาต์พุตตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
tool_use_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้งานโทเค็นการใช้เครื่องมือตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
จํานวนโทเค็นในส่วนที่แคชของพรอมต์ (เนื้อหาที่แคช)
จำนวนโทเค็นในพรอมต์ (บริบท)
จำนวนโทเค็นทั้งหมดในคำตอบที่สร้างขึ้นทั้งหมด
จำนวนโทเค็นของความคิดสำหรับโมเดลการคิด
จำนวนโทเค็นทั้งหมดสำหรับคำขอการโต้ตอบ (พรอมต์ + คำตอบ + โทเค็นภายในอื่นๆ )
จำนวนโทเค็นที่อยู่ในพรอมต์การใช้เครื่องมือ
ตัวอย่าง
ตัวอย่างการตอบกลับ
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
ลบเสียงที่กำหนดเองที่จัดเก็บไว้ (`store = true`) ตามชื่อทรัพยากร ลบเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`VOICE_TYPE_PREBUILT`) ไม่ได้
พารามิเตอร์เส้นทาง / การค้นหา
ต้องระบุ ชื่อทรัพยากรของเสียงที่กำหนดเองที่จัดเก็บไว้ซึ่งจะลบ (เช่น `voices/voice_abc123def456`)
คำตอบ
หากทำสำเร็จ การตอบกลับจะว่างเปล่า
ตัวอย่าง
แหล่งข้อมูล
Voice
ทรัพยากรเสียงที่แสดงถึงเสียงที่กำหนดเอง (สร้างผ่าน `CreateVoice`) หรือเสียงของระบบที่สร้างไว้ล่วงหน้า (แสดงผลโดย `ListVoices`)
ช่อง
ไม่บังคับ คำอธิบายสำเนียงในภูมิภาค (เช่น "อเมริกัน" "อังกฤษ")
ไม่บังคับ บริบทหรือโดเมนการใช้งานที่เหมาะสม (เช่น "การสนทนา", "หนังสือเสียง" "ข่าว")
ไม่บังคับ สรุปเชิงพรรณนาเกี่ยวกับคุณภาพเสียง บุคลิก และโทนเสียง
ไม่บังคับ ชื่อที่แสดงที่ผู้ใช้ระบุสำหรับเสียงที่จัดเก็บ (`store = true`) หรือชื่อแคตตาล็อกสำหรับเสียงที่สร้างไว้ล่วงหน้า
เอาต์พุตเท่านั้น การประทับเวลาที่คีย์เสียงที่จัดเก็บที่กำหนดเอง (`store = true`) หรือคีย์เสียงที่จำลอง (`store = false`) หมดอายุ ยกเลิกการตั้งค่าสำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"`) ซึ่งไม่มีวันหมดอายุ
ไม่บังคับ การนำเสนอเพศของเสียงที่รับรู้ (เช่น "หญิง" "ชาย" "เป็นกลาง")
เอาต์พุตเท่านั้น ตัวระบุที่ไม่ซ้ำกันของเสียง * สำหรับเสียงที่กำหนดเองซึ่ง Google จัดการ (`store = true`) นี่คือรหัสที่สร้างขึ้น โดยมีคำนำหน้า `voice_` (เช่น `voice_abc123def456`) ส่ง `voices/{id}` เป็น `name` ใน `GetVoice` และ `DeleteVoice` และส่ง `{id}` ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) โดยตรงในระหว่างการสังเคราะห์เสียงพูด * สำหรับเสียงแคตตาล็อกที่สร้างไว้ล่วงหน้า (`"prebuilt"` ที่ส่งคืนโดย `ListVoices`) นี่คือชื่อผู้พูด (เช่น `Puck` หรือ `Charon`) * ไม่ได้ตั้งค่าเมื่อมีการเรียก `CreateVoice` ด้วย `store = false`
เอาต์พุตเท่านั้น คีย์การจำลองเสียงที่ไคลเอ็นต์จัดการ (มีคำนำหน้าเป็น "voicekey_") จะแสดงโดย `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"replicated"` และ `store` เป็น `false` ส่งคีย์นี้ไปยัง `SpeechConfig.voice_config.voice` (หรือ `SpeechConfig.voice`) ในระหว่างการสังเคราะห์เสียงพูด
ไม่บังคับ แท็กภาษา BCP-47 หลัก (เช่น "en-US", "fr-FR")
ไม่บังคับ โมเดลที่ใช้ในการออกแบบหรือจำลองเสียง หากไม่ระบุใน `CreateVoice` ระบบจะใช้โมเดลการออกแบบเสียงล่าสุดที่รองรับโดยค่าเริ่มต้น ส่งคืนในการตอบกลับ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่กำหนดเอง (`"prompted"` และ `"replicated"`) ไม่ได้ตั้งค่าสำหรับเสียง `"prebuilt"` คุณสามารถสังเคราะห์เสียงที่สร้างขึ้นในโมเดลการสังเคราะห์ TTS ที่รองรับ
ไม่บังคับ อวตารหรือต้นแบบตัวละครที่ต้องการ (เช่น "อบอุ่น เป็นมิตร" "ผู้บรรยาย")
pitch Pitch (ไม่บังคับ)
ไม่บังคับ การจัดประเภทระดับเสียงสูงต่ำ
ค่าที่เป็นไปได้
-
lowเสียงต่ำกว่านี้
-
mediumเสียงระดับกลาง
-
highเสียงสูงกว่านี้
พรอมต์ PromptedVoice (ไม่บังคับ)
พารามิเตอร์สำหรับการสร้างเสียงตามพรอมต์ ต้องระบุใน `CreateVoice` เมื่อ `type` เป็น `"prompted"` ระบบจะแสดงในคำตอบของ `CreateVoice`, `GetVoice` และ `ListVoices` สำหรับเสียงที่แจ้ง
ช่อง
ต้องระบุ พรอมต์ภาษาธรรมชาติที่อธิบายเสียงที่ต้องการ เช่น "เสียงผู้ชายทุ้มก้องของยักษ์ชั่วร้ายตัวใหญ่ในวัยกลางคน"
ไม่บังคับ รหัสภูมิภาค ISO 3166-1 alpha-2 หรือ UN M.49 (เช่น "US", "GB", "001")
sample_audio AudioData (ไม่บังคับ)
เอาต์พุตเท่านั้น เสียงตัวอย่าง (เสียงพรอมต์ของซินธิไซเซอร์) ที่สร้างขึ้นสำหรับ เสียงที่ได้รับพรอมต์ จะแสดงในคำตอบ `CreateVoice` และ `GetVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` และจะไม่มีการตั้งค่าในคำตอบ `ListVoices` และสำหรับเสียง `"replicated"` หรือ `"prebuilt"`
ช่อง
ต้องระบุ ไบต์เสียงดิบ
ต้องระบุ ประเภท MIME ของ IANA ของข้อมูลเสียง (เช่น `audio/wav` หรือ `audio/mpeg`)
type VoiceType (ไม่บังคับ)
ต้องระบุ ประเภทของเสียง ใน `CreateVoice` ต้องเป็น `"replicated"` หรือ `"prompted"` ในการตอบกลับ `ListVoices` อาจเป็น `"prebuilt"` ด้วย
ค่าที่เป็นไปได้
-
replicatedเสียงที่กำหนดเองซึ่งจำลองจากตัวอย่างเสียงอ้างอิงและบันทึกความยินยอมของผู้พูด
-
promptedเสียงที่กำหนดเองซึ่งสร้างจากพรอมต์ข้อความภาษาธรรมชาติ
-
prebuiltเสียงของระบบในตัวจากแคตตาล็อกเสียงของ Google (เช่น `Puck`, `Charon`) แสดงในคำตอบ โดยระบุเป็นประเภทใน `CreateVoice` ไม่ได้
usage Usage (ไม่บังคับ)
เอาต์พุตเท่านั้น สถิติการใช้โทเค็นสำหรับคำขอสร้างเสียง จะแสดงในคำตอบของ `CreateVoice` เท่านั้นเมื่อ `type` เป็น `"prompted"` โดยจะไม่มีการตั้งค่าสำหรับ `"replicated"` และในคำตอบของ `GetVoice` และ `ListVoices`
ช่อง
cached_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้งานโทเค็นที่แคชไว้ตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
grounding_tool_count array (GroundingToolCount) (ไม่บังคับ)
จำนวนเครื่องมือเชื่อมต่อแหล่งข้อมูล
ช่อง
จำนวนเครื่องมือต่อสายดิน
ประเภทเครื่องมือการอ้างอิงที่เชื่อมโยงกับการนับ
ค่าที่เป็นไปได้ มีดังนี้
-
google_searchการเชื่อมต่อแหล่งข้อมูลกับ Google Web Search และ Image Search รวมถึงการเชื่อมต่อแหล่งข้อมูลบนเว็บ สำหรับองค์กร
-
google_mapsการเชื่อมต่อแหล่งข้อมูลกับ Google Maps
input_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้โทเค็นอินพุตตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
output_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้โทเค็นเอาต์พุตตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
tool_use_tokens_by_modality array (ModalityTokens) (ไม่บังคับ)
รายละเอียดการใช้งานโทเค็นการใช้เครื่องมือตามรูปแบบ
ช่อง
modality ResponseModality (ไม่บังคับ)
รูปแบบที่เชื่อมโยงกับจำนวนโทเค็น
ค่าที่เป็นไปได้
-
textระบุว่าโมเดลควรแสดงผลข้อความ
-
imageระบุว่าโมเดลควรแสดงรูปภาพ
-
audioระบุว่าโมเดลควรส่งคืนเสียง
-
videoระบุว่าโมเดลควรแสดงวิดีโอ
-
documentระบุว่าโมเดลควรแสดงเอกสาร
จำนวนโทเค็นสำหรับรูปแบบ
จํานวนโทเค็นในส่วนที่แคชของพรอมต์ (เนื้อหาที่แคช)
จำนวนโทเค็นในพรอมต์ (บริบท)
จำนวนโทเค็นทั้งหมดในคำตอบที่สร้างขึ้นทั้งหมด
จำนวนโทเค็นของความคิดสำหรับโมเดลการคิด
จำนวนโทเค็นทั้งหมดสำหรับคำขอการโต้ตอบ (พรอมต์ + คำตอบ + โทเค็นภายในอื่นๆ )
จำนวนโทเค็นที่อยู่ในพรอมต์การใช้เครื่องมือ