رابط برنامهنویسی کاربردی صداها (Voices API) به شما امکان میدهد صداهای سفارشی را از پیامهای زبان طبیعی (طراحی صدا) یا از صداهای مرجع و ضبطهای رضایت گوینده (تکثیر صدا) ایجاد کنید، و همچنین صداهای سفارشی و از پیش ساخته شده را برای سنتز متن به گفتار (TTS) فهرست، بازیابی و مدیریت کنید.
صدای ایجاد کن
یک صدای سفارشی از یک پیام صوتی به زبان طبیعی (`VOICE_TYPE_PROMPTED`) یا از ضبطهای صوتی مرجع و رضایت (`VOICE_TYPE_REPLICATED`) ایجاد میکند.
درخواست بدنه
بدنه درخواست شامل دادههایی با ساختار زیر است:
اختیاری. اینکه آیا صدای ایجاد شده توسط گوگل ذخیره و مدیریت میشود یا خیر. * وقتی `true` باشد، گوگل صدا را ذخیره کرده و `Voice.id` (برای مثال، `voice_abc123def456`) را برمیگرداند، که میتواند از طریق `GetVoice`، `ListVoices` و `DeleteVoice` مدیریت شود و در درخواستهای سنتز توسط شناسه ارجاع داده شود. پروژهها مشمول حداکثر سهمیه صدای ذخیره شده فعال هستند؛ تجاوز از سهمیه، `RESOURCE_EXHAUSTED` را برمیگرداند. * وقتی `false` (پیشفرض) باشد، صدا توسط گوگل ذخیره نمیشود و `Voice.key` (برای مثال، `voicekey_...`) برای ذخیرهسازی و سنتز سمت کلاینت بازگردانده میشود. فیلدهای فراداده اکتشاف اختیاری در `voice` ذخیره نمیشوند یا وقتی `store` `false` باشد، بازگردانده نمیشوند. * وقتی `voice.type` `درخواست` میشود، باید `true` باشد (در غیر این صورت با `INVALID_ARGUMENT` ناموفق خواهد بود).
الزامی. صدای مورد نظر برای ایجاد. `voice.model` اختیاری است؛ در صورت حذف، سرویس مدل ایجاد صدای پیشفرض را انتخاب میکند. فیلدهای فقط خروجی در `Voice` (`id`، `key`، `expire_time`، `usage`) در صورت تنظیم، نادیده گرفته میشوند.
پاسخ
در صورت موفقیت، بدنه پاسخ شامل دادههایی با ساختار زیر است:
اختیاری. توصیفگر لهجه منطقهای (مثلاً «آمریکایی»، «بریتانیایی»).
اختیاری. زمینه یا دامنه استفاده بهینه (مثلاً "محاورهای"، "کتاب صوتی"، "اخبار").
اختیاری. خلاصه توصیفی از طنین صدا، شخصیت و لحن.
اختیاری. نام نمایشی ارائه شده توسط کاربر برای صدای ذخیره شده (`store = true`) یا نام کاتالوگ برای صدای از پیش ساخته شده.
فقط خروجی. مهر زمانی که در آن صدای ذخیره شده سفارشی (`store = true`) یا کلید صدای کپی شده (`store = false`) منقضی میشود. برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"`) که منقضی نمیشوند، تنظیم نشده است.
اختیاری. نمایش جنسیتی صدای ادراکشده (مثلاً «زن»، «مرد»، «خنثی»).
فقط خروجی. شناسه منحصر به فرد صدا. * برای صداهای سفارشی مدیریتشده توسط گوگل (`store = true`)، این یک شناسه تولید شده با پیشوند `voice_` است (برای مثال، `voice_abc123def456`). `voices/{id}` را به عنوان `name` در `GetVoice` و `DeleteVoice` وارد کنید و `{id}` را مستقیماً در طول سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) وارد کنید. * برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"` که توسط `ListVoices` برگردانده میشود)، این نام گوینده است (برای مثال، `Puck` یا `Charon`). * هنگام فراخوانی `CreateVoice` با `store = false`، تنظیم مجدد شود.
فقط خروجی. کلید تکثیر صدای مدیریتشده توسط کلاینت (با پیشوند `voicekey_`). فقط توسط `CreateVoice` زمانی که `type` برابر با `"replicated" و `store` برابر با `false` باشد، برگردانده میشود. این کلید را در حین سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) ارسال کنید.
اختیاری. برچسب زبان اصلی BCP-47 (مثلاً "en-US"، "fr-FR").
اختیاری. مدلی که برای طراحی یا تکثیر صدا استفاده شده است. اگر در `CreateVoice` حذف شود، به طور پیشفرض روی آخرین مدل طراحی صدای پشتیبانیشده تنظیم میشود. در پاسخهای `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای سفارشی (`"prompted"` و ``replicated"`) برگردانده میشود؛ برای صداهای ``prebuilt`` تنظیم نشده است. صداهای ایجاد شده را میتوان در هر مدل سنتز TTS پشتیبانیشده سنتز کرد.
اختیاری. شخصیت یا کهن الگوی مورد نظر (مثلاً "گرم، دوستانه"، "راوی").
گام صدا (اختیاری)
اختیاری. طبقهبندی زیر و بمی صدا.
مقادیر ممکن
-
lowصدای بمتر.
-
mediumصدای با گام متوسط.
-
highصدای با گام بالاتر.
صدای درخواستی (اختیاری)
پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخهای `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده میشود.
فیلدها
الزامی. عبارت پیشنهادی به زبان طبیعی که صدای مورد نظر را توصیف میکند، مثلاً «صدای بم و بم مردانهی یک غول شیطانی عظیمالجثه در میانسالیاش».
اختیاری. کد منطقه جغرافیایی ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "GB"، "001").
sample_audio AudioData (اختیاری)
فقط خروجی. نمونه صدا (صدای اعلان موتور سخنگو) که برای صدای درخواستی تولید میشود. فقط در پاسخهای `CreateVoice` و `GetVoice` وقتی `type` ``درخواست شده`` باشد، مقداردهی میشود؛ در پاسخهای `ListVoices` و برای صداهای ``تکثیر شده`` یا ``از پیش ساخته شده`` تنظیم نشده است.
فیلدها
الزامی. بایتهای خام صوتی.
الزامی. نوع MIME IANA مربوط به دادههای صوتی (مثلاً `audio/wav` یا `audio/mpeg`).
تایپ صوتی (اختیاری)
الزامی. نوع صدا. در `CreateVoice`، باید `"replicated"` یا `"prompted"` باشد. در `ListVoices` پاسخها، همچنین میتوانند `"prebuilt"` باشند.
مقادیر ممکن
-
replicatedصدای سفارشی که از روی یک نمونه صوتی مرجع و صدای ضبط شده با رضایت گوینده کپی شده است.
-
promptedصدای سفارشی تولید شده از یک پیام متنی به زبان طبیعی.
-
prebuiltیک صدای سیستمی داخلی از کاتالوگ صدای گوگل (مثلاً `Puck`، `Charon`). در پاسخها برگردانده میشود؛ نمیتوان آن را به عنوان نوع در `CreateVoice` مشخص کرد.
کاربرد (اختیاری )
فقط خروجی. آمار استفاده از توکن برای درخواست ایجاد صدا. فقط در پاسخ `CreateVoice` وقتی `type` درخواست میشود، جمعآوری میشود؛ برای `replicated` و در پاسخهای `GetVoice` و `ListVoices` تنظیم نشده است.
فیلدها
آرایه cached_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک میزان استفاده از توکنهای ذخیرهشده بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه grounding_tool_count (GroundingToolCount) (اختیاری)
تعداد ابزار اتصال به زمین
فیلدها
تعداد ابزار اتصال به زمین مهم است.
نوع ابزار اتصال زمین مرتبط با شمارش.
مقادیر ممکن:
-
google_searchاتصال به زمین با جستجوی وب و جستجوی تصویر گوگل، و اتصال به زمین وب برای سازمانها.
-
google_mapsاتصال به زمین با نقشههای گوگل.
آرایه input_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک استفاده از توکن ورودی بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه output_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک استفاده از توکن خروجی بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه tool_use_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک میزان استفاده از توکنهای ابزار بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
تعداد توکنها در بخش ذخیرهشدهی اعلان (محتوای ذخیرهشده).
تعداد توکنها در اعلان (زمینه).
تعداد کل توکنها در تمام پاسخهای تولید شده.
تعداد توکنهای افکار برای مدلهای تفکر.
تعداد کل توکنها برای درخواست تعامل (درخواست + پاسخها + سایر توکنهای داخلی).
تعداد توکنهای موجود در اعلان(های) استفاده از ابزار.
مثال
پاسخ نمونه
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
لیست وویسز
صداهای ذخیرهشدهی سفارشی متعلق به تماسگیرنده (به ترتیب جدیدترینها) و به دنبال آن صداهای سیستمی از پیش ساختهشده از کاتالوگ صدای گوگل را فهرست میکند.
پارامترهای مسیر/پرسوجو
اختیاری. فیلتر بر اساس توضیحات لهجه (مثلاً "آمریکایی"، "بریتانیایی"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از لهجههای مشخص شده مطابقت میدهد (OR).
اختیاری. فیلتر بر اساس زمینه یا دامنه مورد نظر (مثلاً "اخبار، بازرگانی"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از زمینههای مشخص شده مطابقت میدهد (OR).
اختیاری. فیلتر بر اساس نمایش جنسیت (مثلاً "زن"، "مرد"، "خنثی"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از جنسیتهای مشخص شده مطابقت میدهد (OR).
اختیاری. فیلتر بر اساس کد زبان BCP-47 (مثلاً "en-US"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از کدهای زبان مشخص شده (OR) مطابقت میدهد.
اختیاری. حداکثر تعداد صداهایی که در هر صفحه برگردانده میشود. سرویس ممکن است کمتر از این مقدار برگرداند. اگر مشخص نشود، حداکثر ۵۰ صدا برگردانده میشود. حداکثر مقدار ۱۰۰۰ است؛ مقادیر بالاتر از ۱۰۰۰ به ۱۰۰۰ محدود میشوند.
اختیاری. یک توکن صفحه که از فراخوانی قبلی `ListVoices` دریافت شده است. برای بازیابی صفحه بعدی، این را ارائه دهید. هنگام صفحهبندی، تمام پارامترهای پرسوجوی فیلتر (`language_code`، `region_code`، `accent`، `persona`، `context`، `gender`، `pitch`، `type` و `search`) باید با فراخوانی که این توکن را برگردانده است مطابقت داشته باشند. در غیر این صورت درخواست با `INVALID_ARGUMENT` شکست میخورد. `page_size` ممکن است بین صفحات تغییر کند.
اختیاری. فیلتر بر اساس شخصیت صوتی (مثلاً "گرم، دوستانه"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از شخصیتهای مشخص شده مطابقت میدهد (OR).
اختیاری. فیلتر بر اساس زیر و بمی صدا. "low"، "medium"، "high" یا "PITCH_LOW"، "PITCH_MEDIUM"، "PITCH_HIGH" (غیر حساس به حروف بزرگ و کوچک) را میپذیرد. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از زیر و بمیهای مشخص شده مطابقت میدهد (OR).
اختیاری. فیلتر بر اساس کد منطقه ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "001"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از کدهای منطقه مشخص شده (OR) مطابقت میدهد.
اختیاری. عبارت جستجوی زیررشته متن آزاد، بدون حساسیت به حروف بزرگ و کوچک، با هر دو `display_name` و `description` مطابقت داده شد. حداکثر ۲۰۴۸ بایت.
اختیاری. فیلتر بر اساس نوع صدا. "پیشساخته"، "تکرار شده"، "درخواست شده" یا "VOICE_TYPE_PREBUILT"، "VOICE_TYPE_REPLICATED"، "VOICE_TYPE_PROMPTED" (غیرحساس به حروف بزرگ و کوچک) را میپذیرد. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از انواع مشخص شده مطابقت میدهد (OR).
پاسخ
در صورت موفقیت، بدنه پاسخ شامل دادههایی با ساختار زیر است:
یک توکن که میتواند به عنوان `page_token` برای بازیابی صفحه بعدی ارسال شود. اگر خالی باشد، صفحات بعدی وجود ندارند.
صداهایی از مجموعه مشخص شده.
مثال
پاسخ نمونه
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
یک صدای ذخیره شده سفارشی (`store = true`) را بر اساس نام منبع دریافت میکند. صداهای کاتالوگ از پیش ساخته شده (`VOICE_TYPE_PREBUILT`) را نمیتوان از طریق `GetVoice` بازیابی کرد؛ به جای آن از `ListVoices` استفاده کنید.
پارامترهای مسیر/پرسوجو
الزامی. نام منبع صدای ذخیرهشدهی سفارشی برای بازیابی (برای مثال، `voices/voice_abc123def456`).
پاسخ
در صورت موفقیت، بدنه پاسخ شامل دادههایی با ساختار زیر است:
اختیاری. توصیفگر لهجه منطقهای (مثلاً «آمریکایی»، «بریتانیایی»).
اختیاری. زمینه یا دامنه استفاده بهینه (مثلاً "محاورهای"، "کتاب صوتی"، "اخبار").
اختیاری. خلاصه توصیفی از طنین صدا، شخصیت و لحن.
اختیاری. نام نمایشی ارائه شده توسط کاربر برای صدای ذخیره شده (`store = true`) یا نام کاتالوگ برای صدای از پیش ساخته شده.
فقط خروجی. مهر زمانی که در آن صدای ذخیره شده سفارشی (`store = true`) یا کلید صدای کپی شده (`store = false`) منقضی میشود. برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"`) که منقضی نمیشوند، تنظیم نشده است.
اختیاری. نمایش جنسیتی صدای ادراکشده (مثلاً «زن»، «مرد»، «خنثی»).
فقط خروجی. شناسه منحصر به فرد صدا. * برای صداهای سفارشی مدیریتشده توسط گوگل (`store = true`)، این یک شناسه تولید شده با پیشوند `voice_` است (برای مثال، `voice_abc123def456`). `voices/{id}` را به عنوان `name` در `GetVoice` و `DeleteVoice` وارد کنید و `{id}` را مستقیماً در طول سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) وارد کنید. * برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"` که توسط `ListVoices` برگردانده میشود)، این نام گوینده است (برای مثال، `Puck` یا `Charon`). * هنگام فراخوانی `CreateVoice` با `store = false`، تنظیم مجدد شود.
فقط خروجی. کلید تکثیر صدای مدیریتشده توسط کلاینت (با پیشوند `voicekey_`). فقط توسط `CreateVoice` زمانی که `type` برابر با `"replicated" و `store` برابر با `false` باشد، برگردانده میشود. این کلید را در حین سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) ارسال کنید.
اختیاری. برچسب زبان اصلی BCP-47 (مثلاً "en-US"، "fr-FR").
اختیاری. مدلی که برای طراحی یا تکثیر صدا استفاده شده است. اگر در `CreateVoice` حذف شود، به طور پیشفرض روی آخرین مدل طراحی صدای پشتیبانیشده تنظیم میشود. در پاسخهای `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای سفارشی (`"prompted"` و ``replicated"`) برگردانده میشود؛ برای صداهای ``prebuilt`` تنظیم نشده است. صداهای ایجاد شده را میتوان در هر مدل سنتز TTS پشتیبانیشده سنتز کرد.
اختیاری. شخصیت یا کهن الگوی مورد نظر (مثلاً "گرم، دوستانه"، "راوی").
گام صدا (اختیاری)
اختیاری. طبقهبندی زیر و بمی صدا.
مقادیر ممکن
-
lowصدای بمتر.
-
mediumصدای با گام متوسط.
-
highصدای با گام بالاتر.
صدای درخواستی (اختیاری)
پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخهای `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده میشود.
فیلدها
الزامی. عبارت پیشنهادی به زبان طبیعی که صدای مورد نظر را توصیف میکند، مثلاً «صدای بم و بم مردانهی یک غول شیطانی عظیمالجثه در میانسالیاش».
اختیاری. کد منطقه جغرافیایی ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "GB"، "001").
sample_audio AudioData (اختیاری)
فقط خروجی. نمونه صدا (صدای اعلان موتور سخنگو) که برای صدای درخواستی تولید میشود. فقط در پاسخهای `CreateVoice` و `GetVoice` وقتی `type` ``درخواست شده`` باشد، مقداردهی میشود؛ در پاسخهای `ListVoices` و برای صداهای ``تکثیر شده`` یا ``از پیش ساخته شده`` تنظیم نشده است.
فیلدها
الزامی. بایتهای خام صوتی.
الزامی. نوع MIME IANA مربوط به دادههای صوتی (مثلاً `audio/wav` یا `audio/mpeg`).
تایپ صوتی (اختیاری)
الزامی. نوع صدا. در `CreateVoice`، باید `"replicated"` یا `"prompted"` باشد. در `ListVoices` پاسخها، همچنین میتوانند `"prebuilt"` باشند.
مقادیر ممکن
-
replicatedصدای سفارشی که از روی یک نمونه صوتی مرجع و صدای ضبط شده با رضایت گوینده کپی شده است.
-
promptedصدای سفارشی تولید شده از یک پیام متنی به زبان طبیعی.
-
prebuiltیک صدای سیستمی داخلی از کاتالوگ صدای گوگل (مثلاً `Puck`، `Charon`). در پاسخها برگردانده میشود؛ نمیتوان آن را به عنوان نوع در `CreateVoice` مشخص کرد.
کاربرد (اختیاری )
فقط خروجی. آمار استفاده از توکن برای درخواست ایجاد صدا. فقط در پاسخ `CreateVoice` وقتی `type` درخواست میشود، جمعآوری میشود؛ برای `replicated` و در پاسخهای `GetVoice` و `ListVoices` تنظیم نشده است.
فیلدها
آرایه cached_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک میزان استفاده از توکنهای ذخیرهشده بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه grounding_tool_count (GroundingToolCount) (اختیاری)
تعداد ابزار اتصال به زمین
فیلدها
تعداد ابزار اتصال به زمین مهم است.
نوع ابزار اتصال زمین مرتبط با شمارش.
مقادیر ممکن:
-
google_searchاتصال به زمین با جستجوی وب و جستجوی تصویر گوگل، و اتصال به زمین وب برای سازمانها.
-
google_mapsاتصال به زمین با نقشههای گوگل.
آرایه input_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک استفاده از توکن ورودی بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه output_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک استفاده از توکن خروجی بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه tool_use_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک میزان استفاده از توکنهای ابزار بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
تعداد توکنها در بخش ذخیرهشدهی اعلان (محتوای ذخیرهشده).
تعداد توکنها در اعلان (زمینه).
تعداد کل توکنها در تمام پاسخهای تولید شده.
تعداد توکنهای افکار برای مدلهای تفکر.
تعداد کل توکنها برای درخواست تعامل (درخواست + پاسخها + سایر توکنهای داخلی).
تعداد توکنهای موجود در اعلان(های) استفاده از ابزار.
مثال
پاسخ نمونه
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
حذف صدا
یک صدای ذخیره شده سفارشی (`store = true`) را بر اساس نام منبع حذف میکند. صداهای کاتالوگ از پیش ساخته شده (`VOICE_TYPE_PREBUILT`) قابل حذف نیستند.
پارامترهای مسیر/پرسوجو
الزامی. نام منبع صدای ذخیرهشدهی سفارشی که باید حذف شود (برای مثال، `voices/voice_abc123def456`).
پاسخ
در صورت موفقیت، پاسخ خالی است.
مثال
منابع
صدا
یک منبع صوتی که نمایانگر یک صدای سفارشی (ایجاد شده از طریق `CreateVoice`) یا یک صدای سیستمی از پیش ساخته شده (برگردانده شده توسط `ListVoices`) است.
فیلدها
اختیاری. توصیفگر لهجه منطقهای (مثلاً «آمریکایی»، «بریتانیایی»).
اختیاری. زمینه یا دامنه استفاده بهینه (مثلاً "محاورهای"، "کتاب صوتی"، "اخبار").
اختیاری. خلاصه توصیفی از طنین صدا، شخصیت و لحن.
اختیاری. نام نمایشی ارائه شده توسط کاربر برای صدای ذخیره شده (`store = true`) یا نام کاتالوگ برای صدای از پیش ساخته شده.
فقط خروجی. مهر زمانی که در آن صدای ذخیره شده سفارشی (`store = true`) یا کلید صدای کپی شده (`store = false`) منقضی میشود. برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"`) که منقضی نمیشوند، تنظیم نشده است.
اختیاری. نمایش جنسیتی صدای ادراکشده (مثلاً «زن»، «مرد»، «خنثی»).
فقط خروجی. شناسه منحصر به فرد صدا. * برای صداهای سفارشی مدیریتشده توسط گوگل (`store = true`)، این یک شناسه تولید شده با پیشوند `voice_` است (برای مثال، `voice_abc123def456`). `voices/{id}` را به عنوان `name` در `GetVoice` و `DeleteVoice` وارد کنید و `{id}` را مستقیماً در طول سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) وارد کنید. * برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"` که توسط `ListVoices` برگردانده میشود)، این نام گوینده است (برای مثال، `Puck` یا `Charon`). * هنگام فراخوانی `CreateVoice` با `store = false`، تنظیم مجدد شود.
فقط خروجی. کلید تکثیر صدای مدیریتشده توسط کلاینت (با پیشوند `voicekey_`). فقط توسط `CreateVoice` زمانی که `type` برابر با `"replicated" و `store` برابر با `false` باشد، برگردانده میشود. این کلید را در حین سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) ارسال کنید.
اختیاری. برچسب زبان اصلی BCP-47 (مثلاً "en-US"، "fr-FR").
اختیاری. مدلی که برای طراحی یا تکثیر صدا استفاده شده است. اگر در `CreateVoice` حذف شود، به طور پیشفرض روی آخرین مدل طراحی صدای پشتیبانیشده تنظیم میشود. در پاسخهای `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای سفارشی (`"prompted"` و ``replicated"`) برگردانده میشود؛ برای صداهای ``prebuilt`` تنظیم نشده است. صداهای ایجاد شده را میتوان در هر مدل سنتز TTS پشتیبانیشده سنتز کرد.
اختیاری. شخصیت یا کهن الگوی مورد نظر (مثلاً "گرم، دوستانه"، "راوی").
گام صدا (اختیاری)
اختیاری. طبقهبندی زیر و بمی صدا.
مقادیر ممکن
-
lowصدای بمتر.
-
mediumصدای با گام متوسط.
-
highصدای با گام بالاتر.
صدای درخواستی (اختیاری)
پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخهای `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده میشود.
فیلدها
الزامی. عبارت پیشنهادی به زبان طبیعی که صدای مورد نظر را توصیف میکند، مثلاً «صدای بم و بم مردانهی یک غول شیطانی عظیمالجثه در میانسالیاش».
اختیاری. کد منطقه جغرافیایی ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "GB"، "001").
sample_audio AudioData (اختیاری)
فقط خروجی. نمونه صدا (صدای اعلان موتور سخنگو) که برای صدای درخواستی تولید میشود. فقط در پاسخهای `CreateVoice` و `GetVoice` وقتی `type` ``درخواست شده`` باشد، مقداردهی میشود؛ در پاسخهای `ListVoices` و برای صداهای ``تکثیر شده`` یا ``از پیش ساخته شده`` تنظیم نشده است.
فیلدها
الزامی. بایتهای خام صوتی.
الزامی. نوع MIME IANA مربوط به دادههای صوتی (مثلاً `audio/wav` یا `audio/mpeg`).
تایپ صوتی (اختیاری)
الزامی. نوع صدا. در `CreateVoice`، باید `"replicated"` یا `"prompted"` باشد. در `ListVoices` پاسخها، همچنین میتوانند `"prebuilt"` باشند.
مقادیر ممکن
-
replicatedصدای سفارشی که از روی یک نمونه صوتی مرجع و صدای ضبط شده با رضایت گوینده کپی شده است.
-
promptedصدای سفارشی تولید شده از یک پیام متنی به زبان طبیعی.
-
prebuiltیک صدای سیستمی داخلی از کاتالوگ صدای گوگل (مثلاً `Puck`، `Charon`). در پاسخها برگردانده میشود؛ نمیتوان آن را به عنوان نوع در `CreateVoice` مشخص کرد.
کاربرد (اختیاری )
فقط خروجی. آمار استفاده از توکن برای درخواست ایجاد صدا. فقط در پاسخ `CreateVoice` وقتی `type` درخواست میشود، جمعآوری میشود؛ برای `replicated` و در پاسخهای `GetVoice` و `ListVoices` تنظیم نشده است.
فیلدها
آرایه cached_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک میزان استفاده از توکنهای ذخیرهشده بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه grounding_tool_count (GroundingToolCount) (اختیاری)
تعداد ابزار اتصال به زمین
فیلدها
تعداد ابزار اتصال به زمین مهم است.
نوع ابزار اتصال زمین مرتبط با شمارش.
مقادیر ممکن:
-
google_searchاتصال به زمین با جستجوی وب و جستجوی تصویر گوگل، و اتصال به زمین وب برای سازمانها.
-
google_mapsاتصال به زمین با نقشههای گوگل.
آرایه input_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک استفاده از توکن ورودی بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه output_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک استفاده از توکن خروجی بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
آرایه tool_use_tokens_by_modality (ModalityTokens) (اختیاری)
تفکیک میزان استفاده از توکنهای ابزار بر اساس روش.
فیلدها
روش پاسخ (اختیاری)
روش مرتبط با شمارش توکنها.
مقادیر ممکن
-
textنشان میدهد که مدل باید متن را برگرداند.
-
imageنشان میدهد که مدل باید تصاویر را برگرداند.
-
audioنشان میدهد که مدل باید صدا را برگرداند.
-
videoنشان میدهد که مدل باید ویدیو برگرداند.
-
documentنشان میدهد که مدل باید اسناد را برگرداند.
تعداد توکنها برای روش.
تعداد توکنها در بخش ذخیرهشدهی اعلان (محتوای ذخیرهشده).
تعداد توکنها در اعلان (زمینه).
تعداد کل توکنها در تمام پاسخهای تولید شده.
تعداد توکنهای افکار برای مدلهای تفکر.
تعداد کل توکنها برای درخواست تعامل (درخواست + پاسخها + سایر توکنهای داخلی).
تعداد توکنهای موجود در اعلان(های) استفاده از ابزار.