Gemini Voices API

رابط برنامه‌نویسی کاربردی صداها (Voices API) به شما امکان می‌دهد صداهای سفارشی را از پیام‌های زبان طبیعی (طراحی صدا) یا از صداهای مرجع و ضبط‌های رضایت گوینده (تکثیر صدا) ایجاد کنید، و همچنین صداهای سفارشی و از پیش ساخته شده را برای سنتز متن به گفتار (TTS) فهرست، بازیابی و مدیریت کنید.

صدای ایجاد کن

پست https://generativelanguage.googleapis.com/v1beta/voices

یک صدای سفارشی از یک پیام صوتی به زبان طبیعی (`VOICE_TYPE_PROMPTED`) یا از ضبط‌های صوتی مرجع و رضایت (`VOICE_TYPE_REPLICATED`) ایجاد می‌کند.

درخواست بدنه

بدنه درخواست شامل داده‌هایی با ساختار زیر است:

ذخیره بولی (اختیاری)

اختیاری. اینکه آیا صدای ایجاد شده توسط گوگل ذخیره و مدیریت می‌شود یا خیر. * وقتی `true` باشد، گوگل صدا را ذخیره کرده و `Voice.id` (برای مثال، `voice_abc123def456`) را برمی‌گرداند، که می‌تواند از طریق `GetVoice`، `ListVoices` و `DeleteVoice` مدیریت شود و در درخواست‌های سنتز توسط شناسه ارجاع داده شود. پروژه‌ها مشمول حداکثر سهمیه صدای ذخیره شده فعال هستند؛ تجاوز از سهمیه، `RESOURCE_EXHAUSTED` را برمی‌گرداند. * وقتی `false` (پیش‌فرض) باشد، صدا توسط گوگل ذخیره نمی‌شود و `Voice.key` (برای مثال، `voicekey_...`) برای ذخیره‌سازی و سنتز سمت کلاینت بازگردانده می‌شود. فیلدهای فراداده اکتشاف اختیاری در `voice` ذخیره نمی‌شوند یا وقتی `store` `false` باشد، بازگردانده نمی‌شوند. * وقتی `voice.type` `درخواست` می‌شود، باید `true` باشد (در غیر این صورت با `INVALID_ARGUMENT` ناموفق خواهد بود).

صدا (الزامی )

الزامی. صدای مورد نظر برای ایجاد. `voice.model` اختیاری است؛ در صورت حذف، سرویس مدل ایجاد صدای پیش‌فرض را انتخاب می‌کند. فیلدهای فقط خروجی در `Voice` (`id`، `key`، `expire_time`، `usage`) در صورت تنظیم، نادیده گرفته می‌شوند.

پاسخ

در صورت موفقیت، بدنه پاسخ شامل داده‌هایی با ساختار زیر است:

رشته تاکیدی (اختیاری)

اختیاری. توصیفگر لهجه منطقه‌ای (مثلاً «آمریکایی»، «بریتانیایی»).

رشته زمینه (اختیاری)

اختیاری. زمینه یا دامنه استفاده بهینه (مثلاً "محاوره‌ای"، "کتاب صوتی"، "اخبار").

رشته توضیحات (اختیاری)

اختیاری. خلاصه توصیفی از طنین صدا، شخصیت و لحن.

رشته‌ی display_name (اختیاری)

اختیاری. نام نمایشی ارائه شده توسط کاربر برای صدای ذخیره شده (`store = true`) یا نام کاتالوگ برای صدای از پیش ساخته شده.

رشته expire_time (اختیاری)

فقط خروجی. مهر زمانی که در آن صدای ذخیره شده سفارشی (`store = true`) یا کلید صدای کپی شده (`store = false`) منقضی می‌شود. برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"`) که منقضی نمی‌شوند، تنظیم نشده است.

رشته جنسیت (اختیاری)

اختیاری. نمایش جنسیتی صدای ادراک‌شده (مثلاً «زن»، «مرد»، «خنثی»).

رشته شناسه (اختیاری)

فقط خروجی. شناسه منحصر به فرد صدا. * برای صداهای سفارشی مدیریت‌شده توسط گوگل (`store = true`)، این یک شناسه تولید شده با پیشوند `voice_` است (برای مثال، `voice_abc123def456`). `voices/{id}` را به عنوان `name` در `GetVoice` و `DeleteVoice` وارد کنید و `{id}` را مستقیماً در طول سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) وارد کنید. * برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"` که توسط `ListVoices` برگردانده می‌شود)، این نام گوینده است (برای مثال، `Puck` یا `Charon`). * هنگام فراخوانی `CreateVoice` با `store = false`، تنظیم مجدد شود.

رشته کلید (اختیاری)

فقط خروجی. کلید تکثیر صدای مدیریت‌شده توسط کلاینت (با پیشوند `voicekey_`). فقط توسط `CreateVoice` زمانی که `type` برابر با `"replicated" و `store` برابر با `false` باشد، برگردانده می‌شود. این کلید را در حین سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) ارسال کنید.

رشته‌ی کد زبان (اختیاری)

اختیاری. برچسب زبان اصلی BCP-47 (مثلاً "en-US"، "fr-FR").

رشته مدل (اختیاری)

اختیاری. مدلی که برای طراحی یا تکثیر صدا استفاده شده است. اگر در `CreateVoice` حذف شود، به طور پیش‌فرض روی آخرین مدل طراحی صدای پشتیبانی‌شده تنظیم می‌شود. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای سفارشی (`"prompted"` و ``replicated"`) برگردانده می‌شود؛ برای صداهای ``prebuilt`` تنظیم نشده است. صداهای ایجاد شده را می‌توان در هر مدل سنتز TTS پشتیبانی‌شده سنتز کرد.

رشته شخصیت (اختیاری)

اختیاری. شخصیت یا کهن الگوی مورد نظر (مثلاً "گرم، دوستانه"، "راوی").

گام صدا (اختیاری)

اختیاری. طبقه‌بندی زیر و بمی صدا.

مقادیر ممکن

  • low

    صدای بم‌تر.

  • medium

    صدای با گام متوسط.

  • high

    صدای با گام بالاتر.

صدای درخواستی (اختیاری)

پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده می‌شود.

پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده می‌شود.

فیلدها

رشته ورودی (اختیاری)

الزامی. عبارت پیشنهادی به زبان طبیعی که صدای مورد نظر را توصیف می‌کند، مثلاً «صدای بم و بم مردانه‌ی یک غول شیطانی عظیم‌الجثه در میانسالی‌اش».

رشته کد منطقه (اختیاری)

اختیاری. کد منطقه جغرافیایی ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "GB"، "001").

sample_audio AudioData (اختیاری)

فقط خروجی. نمونه صدا (صدای اعلان موتور سخنگو) که برای صدای درخواستی تولید می‌شود. فقط در پاسخ‌های `CreateVoice` و `GetVoice` وقتی `type` ``درخواست شده`` باشد، مقداردهی می‌شود؛ در پاسخ‌های `ListVoices` و برای صداهای ``تکثیر شده`` یا ``از پیش ساخته شده`` تنظیم نشده است.

محموله صوتی مورد استفاده برای ایجاد صدا.

فیلدها

رشته داده (اختیاری)

الزامی. بایت‌های خام صوتی.

رشته mime_type (اختیاری)

الزامی. نوع MIME IANA مربوط به داده‌های صوتی (مثلاً `audio/wav` یا `audio/mpeg`).

تایپ صوتی (اختیاری)

الزامی. نوع صدا. در `CreateVoice`، باید `"replicated"` یا `"prompted"` باشد. در `ListVoices` پاسخ‌ها، همچنین می‌توانند `"prebuilt"` باشند.

مقادیر ممکن

  • replicated

    صدای سفارشی که از روی یک نمونه صوتی مرجع و صدای ضبط شده با رضایت گوینده کپی شده است.

  • prompted

    صدای سفارشی تولید شده از یک پیام متنی به زبان طبیعی.

  • prebuilt

    یک صدای سیستمی داخلی از کاتالوگ صدای گوگل (مثلاً `Puck`، `Charon`). در پاسخ‌ها برگردانده می‌شود؛ نمی‌توان آن را به عنوان نوع در `CreateVoice` مشخص کرد.

کاربرد (اختیاری )

فقط خروجی. آمار استفاده از توکن برای درخواست ایجاد صدا. فقط در پاسخ `CreateVoice` وقتی `type` درخواست می‌شود، جمع‌آوری می‌شود؛ برای `replicated` و در پاسخ‌های `GetVoice` و `ListVoices` تنظیم نشده است.

آمار مربوط به میزان استفاده از توکن درخواست تعامل.

فیلدها

آرایه cached_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک میزان استفاده از توکن‌های ذخیره‌شده بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه grounding_tool_count (GroundingToolCount) (اختیاری)

تعداد ابزار اتصال به زمین

تعداد ابزار اتصال به زمین مهم است.

فیلدها

شمارش عدد صحیح (اختیاری)

تعداد ابزار اتصال به زمین مهم است.

نوع enum (رشته) (اختیاری)

نوع ابزار اتصال زمین مرتبط با شمارش.

مقادیر ممکن:

  • google_search

    اتصال به زمین با جستجوی وب و جستجوی تصویر گوگل، و اتصال به زمین وب برای سازمان‌ها.

  • google_maps

    اتصال به زمین با نقشه‌های گوگل.

آرایه input_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک استفاده از توکن ورودی بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه output_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک استفاده از توکن خروجی بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه tool_use_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک میزان استفاده از توکن‌های ابزار بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

عدد صحیح total_cached_tokens (اختیاری)

تعداد توکن‌ها در بخش ذخیره‌شده‌ی اعلان (محتوای ذخیره‌شده).

عدد صحیح total_input_tokens (اختیاری)

تعداد توکن‌ها در اعلان (زمینه).

total_output_tokens عدد صحیح (اختیاری)

تعداد کل توکن‌ها در تمام پاسخ‌های تولید شده.

total_thought_tokens عدد صحیح (اختیاری)

تعداد توکن‌های افکار برای مدل‌های تفکر.

عدد صحیح total_tokens (اختیاری)

تعداد کل توکن‌ها برای درخواست تعامل (درخواست + پاسخ‌ها + سایر توکن‌های داخلی).

عدد صحیح total_tool_use_tokens (اختیاری)

تعداد توکن‌های موجود در اعلان(های) استفاده از ابزار.

مثال

پاسخ نمونه

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

لیست وویسز

دریافت کنید https://generativelanguage.googleapis.com/v1beta/voices

صداهای ذخیره‌شده‌ی سفارشی متعلق به تماس‌گیرنده (به ترتیب جدیدترین‌ها) و به دنبال آن صداهای سیستمی از پیش ساخته‌شده از کاتالوگ صدای گوگل را فهرست می‌کند.

پارامترهای مسیر/پرس‌وجو

آرایه تاکیدی (رشته‌ای) (اختیاری)

اختیاری. فیلتر بر اساس توضیحات لهجه (مثلاً "آمریکایی"، "بریتانیایی"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از لهجه‌های مشخص شده مطابقت می‌دهد (OR).

آرایه زمینه (رشته) (اختیاری)

اختیاری. فیلتر بر اساس زمینه یا دامنه مورد نظر (مثلاً "اخبار، بازرگانی"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از زمینه‌های مشخص شده مطابقت می‌دهد (OR).

آرایه جنسیت (رشته) (اختیاری)

اختیاری. فیلتر بر اساس نمایش جنسیت (مثلاً "زن"، "مرد"، "خنثی"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از جنسیت‌های مشخص شده مطابقت می‌دهد (OR).

آرایه language_code (رشته) (اختیاری)

اختیاری. فیلتر بر اساس کد زبان BCP-47 (مثلاً "en-US"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از کدهای زبان مشخص شده (OR) مطابقت می‌دهد.

عدد صحیح page_size (اختیاری)

اختیاری. حداکثر تعداد صداهایی که در هر صفحه برگردانده می‌شود. سرویس ممکن است کمتر از این مقدار برگرداند. اگر مشخص نشود، حداکثر ۵۰ صدا برگردانده می‌شود. حداکثر مقدار ۱۰۰۰ است؛ مقادیر بالاتر از ۱۰۰۰ به ۱۰۰۰ محدود می‌شوند.

رشته‌ی page_token (اختیاری)

اختیاری. یک توکن صفحه که از فراخوانی قبلی `ListVoices` دریافت شده است. برای بازیابی صفحه بعدی، این را ارائه دهید. هنگام صفحه‌بندی، تمام پارامترهای پرس‌وجوی فیلتر (`language_code`، `region_code`، `accent`، `persona`، `context`، `gender`، `pitch`، `type` و `search`) باید با فراخوانی که این توکن را برگردانده است مطابقت داشته باشند. در غیر این صورت درخواست با `INVALID_ARGUMENT` شکست می‌خورد. `page_size` ممکن است بین صفحات تغییر کند.

آرایه پرسونا (رشته) (اختیاری)

اختیاری. فیلتر بر اساس شخصیت صوتی (مثلاً "گرم، دوستانه"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از شخصیت‌های مشخص شده مطابقت می‌دهد (OR).

آرایه گام (رشته) (اختیاری)

اختیاری. فیلتر بر اساس زیر و بمی صدا. "low"، "medium"، "high" یا "PITCH_LOW"، "PITCH_MEDIUM"، "PITCH_HIGH" (غیر حساس به حروف بزرگ و کوچک) را می‌پذیرد. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از زیر و بمی‌های مشخص شده مطابقت می‌دهد (OR).

آرایه region_code (رشته) (اختیاری)

اختیاری. فیلتر بر اساس کد منطقه ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "001"). تطبیق دقیق بدون حساسیت به حروف بزرگ و کوچک. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از کدهای منطقه مشخص شده (OR) مطابقت می‌دهد.

رشته جستجو (اختیاری)

اختیاری. عبارت جستجوی زیررشته متن آزاد، بدون حساسیت به حروف بزرگ و کوچک، با هر دو `display_name` و `description` مطابقت داده شد. حداکثر ۲۰۴۸ بایت.

نوع آرایه (رشته) (اختیاری)

اختیاری. فیلتر بر اساس نوع صدا. "پیش‌ساخته"، "تکرار شده"، "درخواست شده" یا "VOICE_TYPE_PREBUILT"، "VOICE_TYPE_REPLICATED"، "VOICE_TYPE_PROMPTED" (غیرحساس به حروف بزرگ و کوچک) را می‌پذیرد. اگر چندین مقدار مشخص شده باشد، صداها را با هر یک از انواع مشخص شده مطابقت می‌دهد (OR).

پاسخ

در صورت موفقیت، بدنه پاسخ شامل داده‌هایی با ساختار زیر است:

رشته‌ی next_page_token (اختیاری)

یک توکن که می‌تواند به عنوان `page_token` برای بازیابی صفحه بعدی ارسال شود. اگر خالی باشد، صفحات بعدی وجود ندارند.

آرایه صداها ( صدا ) (اختیاری)

صداهایی از مجموعه مشخص شده.

مثال

پاسخ نمونه

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

دریافت کنید https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

یک صدای ذخیره شده سفارشی (`store = true`) را بر اساس نام منبع دریافت می‌کند. صداهای کاتالوگ از پیش ساخته شده (`VOICE_TYPE_PREBUILT`) را نمی‌توان از طریق `GetVoice` بازیابی کرد؛ به جای آن از `ListVoices` استفاده کنید.

پارامترهای مسیر/پرس‌وجو

رشته voicesId (الزامی)

الزامی. نام منبع صدای ذخیره‌شده‌ی سفارشی برای بازیابی (برای مثال، `voices/voice_abc123def456`).

پاسخ

در صورت موفقیت، بدنه پاسخ شامل داده‌هایی با ساختار زیر است:

رشته تاکیدی (اختیاری)

اختیاری. توصیفگر لهجه منطقه‌ای (مثلاً «آمریکایی»، «بریتانیایی»).

رشته زمینه (اختیاری)

اختیاری. زمینه یا دامنه استفاده بهینه (مثلاً "محاوره‌ای"، "کتاب صوتی"، "اخبار").

رشته توضیحات (اختیاری)

اختیاری. خلاصه توصیفی از طنین صدا، شخصیت و لحن.

رشته‌ی display_name (اختیاری)

اختیاری. نام نمایشی ارائه شده توسط کاربر برای صدای ذخیره شده (`store = true`) یا نام کاتالوگ برای صدای از پیش ساخته شده.

رشته expire_time (اختیاری)

فقط خروجی. مهر زمانی که در آن صدای ذخیره شده سفارشی (`store = true`) یا کلید صدای کپی شده (`store = false`) منقضی می‌شود. برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"`) که منقضی نمی‌شوند، تنظیم نشده است.

رشته جنسیت (اختیاری)

اختیاری. نمایش جنسیتی صدای ادراک‌شده (مثلاً «زن»، «مرد»، «خنثی»).

رشته شناسه (اختیاری)

فقط خروجی. شناسه منحصر به فرد صدا. * برای صداهای سفارشی مدیریت‌شده توسط گوگل (`store = true`)، این یک شناسه تولید شده با پیشوند `voice_` است (برای مثال، `voice_abc123def456`). `voices/{id}` را به عنوان `name` در `GetVoice` و `DeleteVoice` وارد کنید و `{id}` را مستقیماً در طول سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) وارد کنید. * برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"` که توسط `ListVoices` برگردانده می‌شود)، این نام گوینده است (برای مثال، `Puck` یا `Charon`). * هنگام فراخوانی `CreateVoice` با `store = false`، تنظیم مجدد شود.

رشته کلید (اختیاری)

فقط خروجی. کلید تکثیر صدای مدیریت‌شده توسط کلاینت (با پیشوند `voicekey_`). فقط توسط `CreateVoice` زمانی که `type` برابر با `"replicated" و `store` برابر با `false` باشد، برگردانده می‌شود. این کلید را در حین سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) ارسال کنید.

رشته‌ی کد زبان (اختیاری)

اختیاری. برچسب زبان اصلی BCP-47 (مثلاً "en-US"، "fr-FR").

رشته مدل (اختیاری)

اختیاری. مدلی که برای طراحی یا تکثیر صدا استفاده شده است. اگر در `CreateVoice` حذف شود، به طور پیش‌فرض روی آخرین مدل طراحی صدای پشتیبانی‌شده تنظیم می‌شود. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای سفارشی (`"prompted"` و ``replicated"`) برگردانده می‌شود؛ برای صداهای ``prebuilt`` تنظیم نشده است. صداهای ایجاد شده را می‌توان در هر مدل سنتز TTS پشتیبانی‌شده سنتز کرد.

رشته شخصیت (اختیاری)

اختیاری. شخصیت یا کهن الگوی مورد نظر (مثلاً "گرم، دوستانه"، "راوی").

گام صدا (اختیاری)

اختیاری. طبقه‌بندی زیر و بمی صدا.

مقادیر ممکن

  • low

    صدای بم‌تر.

  • medium

    صدای با گام متوسط.

  • high

    صدای با گام بالاتر.

صدای درخواستی (اختیاری)

پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده می‌شود.

پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده می‌شود.

فیلدها

رشته ورودی (اختیاری)

الزامی. عبارت پیشنهادی به زبان طبیعی که صدای مورد نظر را توصیف می‌کند، مثلاً «صدای بم و بم مردانه‌ی یک غول شیطانی عظیم‌الجثه در میانسالی‌اش».

رشته کد منطقه (اختیاری)

اختیاری. کد منطقه جغرافیایی ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "GB"، "001").

sample_audio AudioData (اختیاری)

فقط خروجی. نمونه صدا (صدای اعلان موتور سخنگو) که برای صدای درخواستی تولید می‌شود. فقط در پاسخ‌های `CreateVoice` و `GetVoice` وقتی `type` ``درخواست شده`` باشد، مقداردهی می‌شود؛ در پاسخ‌های `ListVoices` و برای صداهای ``تکثیر شده`` یا ``از پیش ساخته شده`` تنظیم نشده است.

محموله صوتی مورد استفاده برای ایجاد صدا.

فیلدها

رشته داده (اختیاری)

الزامی. بایت‌های خام صوتی.

رشته mime_type (اختیاری)

الزامی. نوع MIME IANA مربوط به داده‌های صوتی (مثلاً `audio/wav` یا `audio/mpeg`).

تایپ صوتی (اختیاری)

الزامی. نوع صدا. در `CreateVoice`، باید `"replicated"` یا `"prompted"` باشد. در `ListVoices` پاسخ‌ها، همچنین می‌توانند `"prebuilt"` باشند.

مقادیر ممکن

  • replicated

    صدای سفارشی که از روی یک نمونه صوتی مرجع و صدای ضبط شده با رضایت گوینده کپی شده است.

  • prompted

    صدای سفارشی تولید شده از یک پیام متنی به زبان طبیعی.

  • prebuilt

    یک صدای سیستمی داخلی از کاتالوگ صدای گوگل (مثلاً `Puck`، `Charon`). در پاسخ‌ها برگردانده می‌شود؛ نمی‌توان آن را به عنوان نوع در `CreateVoice` مشخص کرد.

کاربرد (اختیاری )

فقط خروجی. آمار استفاده از توکن برای درخواست ایجاد صدا. فقط در پاسخ `CreateVoice` وقتی `type` درخواست می‌شود، جمع‌آوری می‌شود؛ برای `replicated` و در پاسخ‌های `GetVoice` و `ListVoices` تنظیم نشده است.

آمار مربوط به میزان استفاده از توکن درخواست تعامل.

فیلدها

آرایه cached_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک میزان استفاده از توکن‌های ذخیره‌شده بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه grounding_tool_count (GroundingToolCount) (اختیاری)

تعداد ابزار اتصال به زمین

تعداد ابزار اتصال به زمین مهم است.

فیلدها

شمارش عدد صحیح (اختیاری)

تعداد ابزار اتصال به زمین مهم است.

نوع enum (رشته) (اختیاری)

نوع ابزار اتصال زمین مرتبط با شمارش.

مقادیر ممکن:

  • google_search

    اتصال به زمین با جستجوی وب و جستجوی تصویر گوگل، و اتصال به زمین وب برای سازمان‌ها.

  • google_maps

    اتصال به زمین با نقشه‌های گوگل.

آرایه input_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک استفاده از توکن ورودی بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه output_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک استفاده از توکن خروجی بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه tool_use_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک میزان استفاده از توکن‌های ابزار بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

عدد صحیح total_cached_tokens (اختیاری)

تعداد توکن‌ها در بخش ذخیره‌شده‌ی اعلان (محتوای ذخیره‌شده).

عدد صحیح total_input_tokens (اختیاری)

تعداد توکن‌ها در اعلان (زمینه).

total_output_tokens عدد صحیح (اختیاری)

تعداد کل توکن‌ها در تمام پاسخ‌های تولید شده.

total_thought_tokens عدد صحیح (اختیاری)

تعداد توکن‌های افکار برای مدل‌های تفکر.

عدد صحیح total_tokens (اختیاری)

تعداد کل توکن‌ها برای درخواست تعامل (درخواست + پاسخ‌ها + سایر توکن‌های داخلی).

عدد صحیح total_tool_use_tokens (اختیاری)

تعداد توکن‌های موجود در اعلان(های) استفاده از ابزار.

مثال

پاسخ نمونه

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

حذف صدا

https://generativelanguage.googleapis.com/v1beta/voices/{voicesId} را حذف کنید

یک صدای ذخیره شده سفارشی (`store = true`) را بر اساس نام منبع حذف می‌کند. صداهای کاتالوگ از پیش ساخته شده (`VOICE_TYPE_PREBUILT`) قابل حذف نیستند.

پارامترهای مسیر/پرس‌وجو

رشته voicesId (الزامی)

الزامی. نام منبع صدای ذخیره‌شده‌ی سفارشی که باید حذف شود (برای مثال، `voices/voice_abc123def456`).

پاسخ

در صورت موفقیت، پاسخ خالی است.

مثال

منابع

صدا

یک منبع صوتی که نمایانگر یک صدای سفارشی (ایجاد شده از طریق `CreateVoice`) یا یک صدای سیستمی از پیش ساخته شده (برگردانده شده توسط `ListVoices`) است.

فیلدها

رشته تاکیدی (اختیاری)

اختیاری. توصیفگر لهجه منطقه‌ای (مثلاً «آمریکایی»، «بریتانیایی»).

رشته زمینه (اختیاری)

اختیاری. زمینه یا دامنه استفاده بهینه (مثلاً "محاوره‌ای"، "کتاب صوتی"، "اخبار").

رشته توضیحات (اختیاری)

اختیاری. خلاصه توصیفی از طنین صدا، شخصیت و لحن.

رشته‌ی display_name (اختیاری)

اختیاری. نام نمایشی ارائه شده توسط کاربر برای صدای ذخیره شده (`store = true`) یا نام کاتالوگ برای صدای از پیش ساخته شده.

رشته expire_time (اختیاری)

فقط خروجی. مهر زمانی که در آن صدای ذخیره شده سفارشی (`store = true`) یا کلید صدای کپی شده (`store = false`) منقضی می‌شود. برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"`) که منقضی نمی‌شوند، تنظیم نشده است.

رشته جنسیت (اختیاری)

اختیاری. نمایش جنسیتی صدای ادراک‌شده (مثلاً «زن»، «مرد»، «خنثی»).

رشته شناسه (اختیاری)

فقط خروجی. شناسه منحصر به فرد صدا. * برای صداهای سفارشی مدیریت‌شده توسط گوگل (`store = true`)، این یک شناسه تولید شده با پیشوند `voice_` است (برای مثال، `voice_abc123def456`). `voices/{id}` را به عنوان `name` در `GetVoice` و `DeleteVoice` وارد کنید و `{id}` را مستقیماً در طول سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) وارد کنید. * برای صداهای کاتالوگ از پیش ساخته شده (`"prebuilt"` که توسط `ListVoices` برگردانده می‌شود)، این نام گوینده است (برای مثال، `Puck` یا `Charon`). * هنگام فراخوانی `CreateVoice` با `store = false`، تنظیم مجدد شود.

رشته کلید (اختیاری)

فقط خروجی. کلید تکثیر صدای مدیریت‌شده توسط کلاینت (با پیشوند `voicekey_`). فقط توسط `CreateVoice` زمانی که `type` برابر با `"replicated" و `store` برابر با `false` باشد، برگردانده می‌شود. این کلید را در حین سنتز گفتار به `SpeechConfig.voice_config.voice` (یا `SpeechConfig.voice`) ارسال کنید.

رشته‌ی کد زبان (اختیاری)

اختیاری. برچسب زبان اصلی BCP-47 (مثلاً "en-US"، "fr-FR").

رشته مدل (اختیاری)

اختیاری. مدلی که برای طراحی یا تکثیر صدا استفاده شده است. اگر در `CreateVoice` حذف شود، به طور پیش‌فرض روی آخرین مدل طراحی صدای پشتیبانی‌شده تنظیم می‌شود. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای سفارشی (`"prompted"` و ``replicated"`) برگردانده می‌شود؛ برای صداهای ``prebuilt`` تنظیم نشده است. صداهای ایجاد شده را می‌توان در هر مدل سنتز TTS پشتیبانی‌شده سنتز کرد.

رشته شخصیت (اختیاری)

اختیاری. شخصیت یا کهن الگوی مورد نظر (مثلاً "گرم، دوستانه"، "راوی").

گام صدا (اختیاری)

اختیاری. طبقه‌بندی زیر و بمی صدا.

مقادیر ممکن

  • low

    صدای بم‌تر.

  • medium

    صدای با گام متوسط.

  • high

    صدای با گام بالاتر.

صدای درخواستی (اختیاری)

پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده می‌شود.

پارامترهایی برای تولید صدای درخواستی. در `CreateVoice` زمانی که `type` `درخواستی` باشد، الزامی است. در پاسخ‌های `CreateVoice`، `GetVoice` و `ListVoices` برای صداهای درخواستی بازگردانده می‌شود.

فیلدها

رشته ورودی (اختیاری)

الزامی. عبارت پیشنهادی به زبان طبیعی که صدای مورد نظر را توصیف می‌کند، مثلاً «صدای بم و بم مردانه‌ی یک غول شیطانی عظیم‌الجثه در میانسالی‌اش».

رشته کد منطقه (اختیاری)

اختیاری. کد منطقه جغرافیایی ISO 3166-1 alpha-2 یا UN M.49 (مثلاً "US"، "GB"، "001").

sample_audio AudioData (اختیاری)

فقط خروجی. نمونه صدا (صدای اعلان موتور سخنگو) که برای صدای درخواستی تولید می‌شود. فقط در پاسخ‌های `CreateVoice` و `GetVoice` وقتی `type` ``درخواست شده`` باشد، مقداردهی می‌شود؛ در پاسخ‌های `ListVoices` و برای صداهای ``تکثیر شده`` یا ``از پیش ساخته شده`` تنظیم نشده است.

محموله صوتی مورد استفاده برای ایجاد صدا.

فیلدها

رشته داده (اختیاری)

الزامی. بایت‌های خام صوتی.

رشته mime_type (اختیاری)

الزامی. نوع MIME IANA مربوط به داده‌های صوتی (مثلاً `audio/wav` یا `audio/mpeg`).

تایپ صوتی (اختیاری)

الزامی. نوع صدا. در `CreateVoice`، باید `"replicated"` یا `"prompted"` باشد. در `ListVoices` پاسخ‌ها، همچنین می‌توانند `"prebuilt"` باشند.

مقادیر ممکن

  • replicated

    صدای سفارشی که از روی یک نمونه صوتی مرجع و صدای ضبط شده با رضایت گوینده کپی شده است.

  • prompted

    صدای سفارشی تولید شده از یک پیام متنی به زبان طبیعی.

  • prebuilt

    یک صدای سیستمی داخلی از کاتالوگ صدای گوگل (مثلاً `Puck`، `Charon`). در پاسخ‌ها برگردانده می‌شود؛ نمی‌توان آن را به عنوان نوع در `CreateVoice` مشخص کرد.

کاربرد (اختیاری )

فقط خروجی. آمار استفاده از توکن برای درخواست ایجاد صدا. فقط در پاسخ `CreateVoice` وقتی `type` درخواست می‌شود، جمع‌آوری می‌شود؛ برای `replicated` و در پاسخ‌های `GetVoice` و `ListVoices` تنظیم نشده است.

آمار مربوط به میزان استفاده از توکن درخواست تعامل.

فیلدها

آرایه cached_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک میزان استفاده از توکن‌های ذخیره‌شده بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه grounding_tool_count (GroundingToolCount) (اختیاری)

تعداد ابزار اتصال به زمین

تعداد ابزار اتصال به زمین مهم است.

فیلدها

شمارش عدد صحیح (اختیاری)

تعداد ابزار اتصال به زمین مهم است.

نوع enum (رشته) (اختیاری)

نوع ابزار اتصال زمین مرتبط با شمارش.

مقادیر ممکن:

  • google_search

    اتصال به زمین با جستجوی وب و جستجوی تصویر گوگل، و اتصال به زمین وب برای سازمان‌ها.

  • google_maps

    اتصال به زمین با نقشه‌های گوگل.

آرایه input_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک استفاده از توکن ورودی بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه output_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک استفاده از توکن خروجی بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

آرایه tool_use_tokens_by_modality (ModalityTokens) (اختیاری)

تفکیک میزان استفاده از توکن‌های ابزار بر اساس روش.

تعداد توکن‌ها برای یک روش پاسخ واحد.

فیلدها

روش پاسخ (اختیاری)

روش مرتبط با شمارش توکن‌ها.

مقادیر ممکن

  • text

    نشان می‌دهد که مدل باید متن را برگرداند.

  • image

    نشان می‌دهد که مدل باید تصاویر را برگرداند.

  • audio

    نشان می‌دهد که مدل باید صدا را برگرداند.

  • video

    نشان می‌دهد که مدل باید ویدیو برگرداند.

  • document

    نشان می‌دهد که مدل باید اسناد را برگرداند.

عدد صحیح توکن (اختیاری)

تعداد توکن‌ها برای روش.

عدد صحیح total_cached_tokens (اختیاری)

تعداد توکن‌ها در بخش ذخیره‌شده‌ی اعلان (محتوای ذخیره‌شده).

عدد صحیح total_input_tokens (اختیاری)

تعداد توکن‌ها در اعلان (زمینه).

total_output_tokens عدد صحیح (اختیاری)

تعداد کل توکن‌ها در تمام پاسخ‌های تولید شده.

total_thought_tokens عدد صحیح (اختیاری)

تعداد توکن‌های افکار برای مدل‌های تفکر.

عدد صحیح total_tokens (اختیاری)

تعداد کل توکن‌ها برای درخواست تعامل (درخواست + پاسخ‌ها + سایر توکن‌های داخلی).

عدد صحیح total_tool_use_tokens (اختیاری)

تعداد توکن‌های موجود در اعلان(های) استفاده از ابزار.