Gemini Voices API

‫Voices API מאפשר ליצור קולות בהתאמה אישית מהנחיות בשפה טבעית (עיצוב קול) או מהקלטות אודיו של הפניה והסכמה של הדובר (שכפול קול), וגם לרשום, לאחזר ולנהל קולות בהתאמה אישית וקולות מוכנים מראש לסינתזה של טקסט לדיבור (TTS).

CreateVoice

post https://generativelanguage.googleapis.com/v1beta/voices

יצירת קול בהתאמה אישית מהנחיה בשפה טבעית (`VOICE_TYPE_PROMPTED`) או מהקלטות אודיו של קובצי עזר והסכמה (`VOICE_TYPE_REPLICATED`).

גוף הבקשה

גוף הבקשה מכיל נתונים במבנה הבא:

store boolean  (אופציונלי)

אופציונלי. האם הקול שנוצר נשמר ומנוהל על ידי Google. ‫* אם הערך הוא true, ‏ Google מאחסנת את הקול ומחזירה את הערך Voice.id (לדוגמה, voice_abc123def456), שאפשר לנהל באמצעות הפונקציות GetVoice, ‏ ListVoices ו-DeleteVoice, ולהפנות אליו באמצעות מזהה בבקשות סינתזה. בפרויקטים יש מכסת אחסון מקסימלית של קולות פעילים. חריגה מהמכסה מחזירה את השגיאה `RESOURCE_EXHAUSTED`. * אם הערך הוא `false` (ברירת המחדל), הקול לא מאוחסן על ידי Google ומוחזר הערך `Voice.key` (לדוגמה, `voicekey_...`) לאחסון וסינתזה בצד הלקוח. שדות אופציונליים של מטא-נתונים של גילוי ב-`voice` לא נשמרים ולא מוחזרים כש-`store` הוא `false`. * הערך חייב להיות `true` כש-`voice.type` הוא `"prompted"` (אחרת הפעולה נכשלת עם `INVALID_ARGUMENT`).

voice Voice  (חובה)

חובה. הקול שרוצים ליצור. הפרמטר `voice.model` הוא אופציונלי. אם הוא לא מצוין, השירות בוחר את מודל ברירת המחדל ליצירת קול. שדות לקריאה בלבד ב-Voice ‏ (`id`, ‏ `key`,‏ `expire_time`, ‏ `usage`) מוזנחים אם הם מוגדרים.

תשובה

אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל נתונים במבנה הבא:

accent string  (אופציונלי)

אופציונלי. תיאור של מבטא אזורי (לדוגמה, "אמריקאי", "בריטי").

context string  (אופציונלי)

אופציונלי. ההקשר או הדומיין האופטימליים לשימוש (למשל, 'שיחה', 'ספר אודיו', 'חדשות').

description string  (אופציונלי)

אופציונלי. סיכום תיאורי של גוון הקול, האישיות והטון.

display_name string  (optional)

אופציונלי. השם המוצג שהמשתמש סיפק לקול מאוחסן (<code>store = true</code>), או שם הקטלוג של קול מוכן מראש.

expire_time string  (optional)

פלט בלבד. חותמת הזמן שבה תוקף של קול מותאם אישית מאוחסן (store = true) או של מפתח קול משוכפל (store = false) פג. לא מוגדר מראש עבור קולות קטלוג מוכנים מראש ('prebuilt'), שתוקפם לא פג.

gender string  (optional)

אופציונלי. הצגת מגדר קולי (לדוגמה, 'נקבה', 'זכר', 'ניטרלי').

id string  (optional)

פלט בלבד. המזהה הייחודי של הקול. ‫* עבור קולות מותאמים אישית שמנוהלים על ידי Google ‏ (`store = true`), זהו מזהה שנוצר עם הקידומת `voice_` (לדוגמה, `voice_abc123def456`). מעבירים את המחרוזת `voices/{id}` כפרמטר `name` בפונקציות `GetVoice` ו-`DeleteVoice`, ומעבירים את המחרוזת `{id}` ישירות אל `SpeechConfig.voice_config.voice` (או אל `SpeechConfig.voice`) במהלך סינתזת הדיבור. ‫* עבור קולות קטלוג מוכנים מראש (הערך `"prebuilt"` שמוחזר על ידי `ListVoices`), זהו שם הדובר (לדוגמה, `Puck` או `Charon`). * לא מוגדר כשקוראים ל-`CreateVoice` עם `store = false`.

key string  (אופציונלי)

פלט בלבד. מפתח רפליקציה של קולות שמנוהל על ידי הלקוח (עם הקידומת voicekey_‎). מוחזר רק על ידי CreateVoice כאשר type הוא replicated ו-store הוא false. מעבירים את המפתח הזה אל SpeechConfig.voice_config.voice (או אל SpeechConfig.voice) במהלך סינתזת הדיבור.

‫language_code string  (אופציונלי)

אופציונלי. תג השפה הראשי בתקן BCP-47 (למשל, 'en-US',‏ 'fr-FR').

model string  (אופציונלי)

אופציונלי. המודל ששימש לעיצוב או לשכפול של הקול. אם לא מציינים את המודל ב-CreateVoice, ברירת המחדל היא המודל העדכני ביותר של עיצוב קול שנתמך. מוחזר בתגובות של הפונקציות CreateVoice,‏ GetVoice ו-ListVoices עבור קולות בהתאמה אישית (prompted ו-replicated); לא מוגדר עבור קולות prebuilt. אפשר לסנתז קולות שנוצרו באמצעות כל מודל סינתזה נתמך של TTS.

persona string  (אופציונלי)

אופציונלי. הפרסונה או הארכיטיפ של הדמות (לדוגמה, "חמה, ידידותית", "קריין").

pitch Pitch  (אופציונלי)

אופציונלי. סיווג של גובה הצליל של הקול.

ערכים אפשריים

  • low

    קול נמוך יותר.

  • medium

    קול בינוני.

  • high

    קול גבוה יותר.

prompted PromptedVoice  (אופציונלי)

פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`,‏ `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.

פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`,‏ `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.

שדות

input string  (אופציונלי)

חובה. פרומפט בשפה טבעית שמתאר את הקול הרצוי, למשל: "קול גברי עמוק ורועם של עוג מרושע וענק באמצע החיים".

‫region_code string  (optional)

אופציונלי. קוד אזור גיאוגרפי לפי תקן ISO 3166-1 alpha-2 או UN M.49 (לדוגמה, US,‏ GB,‏ 001).

sample_audio AudioData  (optional)

פלט בלבד. דגימת אודיו (אודיו של הנחיה לסינתיסייזר) שנוצרה עבור קול שהוזן בהנחיה. השדה הזה מאוכלס רק בתשובות של הפונקציות CreateVoice ו-GetVoice כשהערך של type הוא prompted. הוא לא מאוכלס בתשובות של הפונקציה ListVoices, וגם לא בקולות מסוג replicated או prebuilt.

מטען ייעודי (payload) של אודיו שמשמש ליצירת קול.

שדות

data string  (אופציונלי)

חובה. הבייטים הגולמיים של האודיו.

mime_type string  (optional)

חובה. סוג ה-MIME של נתוני האודיו לפי IANA (לדוגמה, ‎`audio/wav` ‎ או ‎`audio/mpeg`).

type VoiceType  (אופציונלי)

חובה. סוג הקול. ב-`CreateVoice`, הערך חייב להיות `"replicated"` או `"prompted"`. בתגובות של `ListVoices`, יכול להיות גם הערך `"prebuilt"`.

ערכים אפשריים

  • replicated

    קול בהתאמה אישית שנוצר משכפול של דגימת אודיו ושל הקלטה של הסכמת הדובר.

  • prompted

    קול בהתאמה אישית שנוצר מפרומפט טקסטואלי בשפה טבעית.

  • prebuilt

    קול מערכת מובנה מקטלוג הקולות של Google (לדוגמה, ‎`Puck`‎,‏ ‎`Charon`‎). מוחזר בתשובות. אי אפשר לציין אותו כסוג ב-‎`CreateVoice`‎.

usage Usage  (אופציונלי)

פלט בלבד. נתונים סטטיסטיים על השימוש באסימון עבור בקשת יצירת הקול. השדה הזה מאוכלס רק בתגובה של `CreateVoice` כשהערך של `type` הוא `"prompted"`; הוא לא מוגדר עבור `"replicated"` ובתגובות של `GetVoice` ו-`ListVoices`.

נתונים סטטיסטיים על השימוש באסימון של בקשת האינטראקציה.

שדות

cached_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש בטוקנים במטמון לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

grounding_tool_count array (GroundingToolCount)  (optional)

מספר כלי העיגון.

מספר כלי ההארקה.

שדות

count integer  (אופציונלי)

מספר כלי ההארקה.

type enum (string)  (optional)

סוג כלי ההארקה שמשויך לספירה.

ערכים אפשריים:

  • google_search

    עיגון באמצעות חיפוש אינטרנט של Google וחיפוש תמונות, ועיגון באינטרנט לארגונים.

  • google_maps

    עיגון בעזרת מפות Google.

input_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימוני קלט לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

output_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימוני פלט לפי אופן השימוש.

כמות הטוקנים עבור מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

tool_use_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימונים של כלי לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

total_cached_tokens integer  (optional)

מספר הטוקנים בחלק המאוחסן במטמון של ההנחיה (התוכן שנשמר במטמון).

total_input_tokens integer  (optional)

מספר הטוקנים בהנחיה (בהקשר).

total_output_tokens integer  (optional)

המספר הכולל של טוקנים בכל התשובות שנוצרו.

total_thought_tokens integer  (optional)

מספר הטוקנים של המחשבות של מודלים חושבים.

total_tokens integer  (optional)

המספר הכולל של הטוקנים בבקשת האינטראקציה (הנחיה + תגובות + טוקנים פנימיים אחרים).

total_tool_use_tokens integer  (optional)

מספר הטוקנים שמופיעים בהנחיות לשימוש בכלים.

דוגמה

דוגמה לתשובה

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

ListVoices

get https://generativelanguage.googleapis.com/v1beta/voices

רשימה של קולות מותאמים אישית ששמורים בבעלות המתקשר (בסדר מהחדש לישן), ואחריהם קולות מערכת מוכנים מראש מקטלוג הקולות של Google.

פרמטרים של נתיב או שאילתה

‫accent array (string)  (אופציונלי)

אופציונלי. מסננים לפי תיאור המבטא (למשל, "אמריקאי", "בריטי"). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות עם כל אחת מההדגשות שצוינו (OR).

context array (string)  (optional)

אופציונלי. סינון לפי הקשר או הדומיין המיועדים (לדוגמה, 'חדשות, מסחרי'). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מחפשת התאמות בין הקולות לבין אחד מההקשרים שצוינו (OR).

‫gender array (string)  (optional)

אופציונלי. סינון לפי הצגת מגדר (לדוגמה, 'נקבה', 'זכר', 'ניטרלי'). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות לכל אחד מהמינים שצוינו (OR).

‫language_code array (string)  (optional)

אופציונלי. מסננים לפי קוד שפה בתקן BCP-47 (למשל 'en-US'). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות עם כל אחד מקודי השפה שצוינו (OR).

page_size integer  (optional)

אופציונלי. המספר המקסימלי של קולות שיוחזרו בכל דף. יכול להיות שהשירות יחזיר פחות מהערך הזה. אם לא מציינים ערך, המערכת מחזירה עד 50 קולות. הערך המקסימלי הוא 1,000. ערכים גבוהים יותר יומרו ל-1,000.

page_token string  (optional)

אופציונלי. טוקן של דף שהתקבל מקריאה קודמת של ListVoices. צריך להזין את הטוקן כדי לאחזר את הדף הבא. כשמבצעים חלוקה לדפים, כל פרמטרי השאילתה של המסנן (‎`language_code`,‏ ‎`region_code`, ‏ ‎`accent`, ‏ ‎`persona`, ‏ ‎`context`, ‏ ‎`gender`, ‏ ‎`pitch`, ‏ ‎`type` ו-‎ `search`) צריכים להיות זהים לקריאה שהחזירה את הטוקן הזה. אחרת, הבקשה תיכשל עם השגיאה ‎ `INVALID_ARGUMENT`. יכול להיות שהערך של ‎`page_size` ישתנה בין הדפים.

persona array (string)  (optional)

אופציונלי. מסננים לפי דמות קולית (למשל, "חם, ידידותי"). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות לכל אחת מהפרסונות שצוינו (OR).

pitch array (string)  (optional)

אופציונלי. סינון לפי גובה הצליל של הקול. הערכים האפשריים הם low,‏ medium,‏ high או PITCH_LOW,‏ PITCH_MEDIUM,‏ PITCH_HIGH (לא תלוי באותיות רישיות או קטנות). אם מציינים כמה ערכים, המערכת מתאימה קולות עם כל אחד מהגבהים שצוינו (OR).

‫region_code array (string)  (optional)

אופציונלי. מסננים לפי קוד אזור בתקן ISO 3166-1 alpha-2 או לפי קוד אזור בתקן UN M.49 (לדוגמה, US או 001). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מחפשת התאמות לקולות עם אחד מקודי האזור שצוינו (OR).

search string  (אופציונלי)

אופציונלי. שאילתת חיפוש של מחרוזת משנה בטקסט חופשי, שמתאימה לחיפוש לא תלוי-רישיות גם ב-`display_name` וגם ב-`description`. אורך מקסימלי של 2,048 בייט.

‫type array (string)  (אופציונלי)

אופציונלי. סינון לפי סוג הקול. הערכים הקבילים הם prebuilt,‏ replicated,‏ prompted או VOICE_TYPE_PREBUILT,‏ VOICE_TYPE_REPLICATED,‏ VOICE_TYPE_PROMPTED (לא תלוי באותיות רישיות). אם מציינים כמה ערכים, המערכת תתאים קולות לכל אחד מהסוגים שצוינו (OR).

תשובה

אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל נתונים במבנה הבא:

next_page_token string  (optional)

טוקן שאפשר לשלוח כ-`page_token` כדי לאחזר את הדף הבא. אם השדה ריק, לא יופיעו דפים נוספים.

‫voices מערך (Voice)  (אופציונלי)

הקולות מהאוסף שצוין.

דוגמה

דוגמה לתשובה

{
  "next_page_token": "string",
  "voices": [
    {
      "accent": "string",
      "context": "string",
      "description": "string",
      "display_name": "string",
      "expire_time": "string",
      "gender": "string",
      "id": "string",
      "key": "string",
      "language_code": "string",
      "model": "string",
      "persona": "string",
      "pitch": "low",
      "prompted": {
        "input": "string"
      },
      "region_code": "string",
      "replicated": {
        "consent_audio": {
          "data": "string",
          "mime_type": "string"
        },
        "source_audio": {
          "data": "string",
          "mime_type": "string"
        }
      },
      "sample_audio": {
        "data": "string",
        "mime_type": "string"
      },
      "type": "replicated",
      "usage": {
        "cached_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "grounding_tool_count": [
          {
            "count": 0,
            "type": "google_search"
          }
        ],
        "input_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "output_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "tool_use_tokens_by_modality": [
          {
            "modality": "...",
            "tokens": 0
          }
        ],
        "total_cached_tokens": 0,
        "total_input_tokens": 0,
        "total_output_tokens": 0,
        "total_thought_tokens": 0,
        "total_tokens": 0,
        "total_tool_use_tokens": 0
      }
    }
  ]
}

GetVoice

get https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

מקבל קול מותאם אישית מאוחסן (`store = true`) לפי שם המשאב. אי אפשר לאחזר קולות מוכנים מראש מהקטלוג (`VOICE_TYPE_PREBUILT`) באמצעות `GetVoice`; צריך להשתמש במקום זאת ב-`ListVoices`.

פרמטרים של נתיב או שאילתה

voicesId string  (required)

חובה. שם המשאב של הקול המותאם אישית שרוצים לאחזר (לדוגמה, voices/voice_abc123def456).

תשובה

אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל נתונים במבנה הבא:

accent string  (אופציונלי)

אופציונלי. תיאור של מבטא אזורי (לדוגמה, "אמריקאי", "בריטי").

context string  (אופציונלי)

אופציונלי. ההקשר או הדומיין האופטימליים לשימוש (למשל, 'שיחה', 'ספר אודיו', 'חדשות').

description string  (אופציונלי)

אופציונלי. סיכום תיאורי של גוון הקול, האישיות והטון.

display_name string  (optional)

אופציונלי. השם המוצג שהמשתמש סיפק לקול מאוחסן (<code>store = true</code>), או שם הקטלוג של קול מוכן מראש.

expire_time string  (optional)

פלט בלבד. חותמת הזמן שבה תוקף של קול מותאם אישית מאוחסן (store = true) או של מפתח קול משוכפל (store = false) פג. לא מוגדר מראש עבור קולות קטלוג מוכנים מראש ('prebuilt'), שתוקפם לא פג.

gender string  (optional)

אופציונלי. הצגת מגדר קולי (לדוגמה, 'נקבה', 'זכר', 'ניטרלי').

id string  (optional)

פלט בלבד. המזהה הייחודי של הקול. ‫* עבור קולות מותאמים אישית שמנוהלים על ידי Google ‏ (`store = true`), זהו מזהה שנוצר עם הקידומת `voice_` (לדוגמה, `voice_abc123def456`). מעבירים את המחרוזת `voices/{id}` כפרמטר `name` בפונקציות `GetVoice` ו-`DeleteVoice`, ומעבירים את המחרוזת `{id}` ישירות אל `SpeechConfig.voice_config.voice` (או אל `SpeechConfig.voice`) במהלך סינתזת הדיבור. ‫* עבור קולות קטלוג מוכנים מראש (הערך `"prebuilt"` שמוחזר על ידי `ListVoices`), זהו שם הדובר (לדוגמה, `Puck` או `Charon`). * לא מוגדר כשקוראים ל-`CreateVoice` עם `store = false`.

key string  (אופציונלי)

פלט בלבד. מפתח רפליקציה של קולות שמנוהל על ידי הלקוח (עם הקידומת voicekey_‎). מוחזר רק על ידי CreateVoice כאשר type הוא replicated ו-store הוא false. מעבירים את המפתח הזה אל SpeechConfig.voice_config.voice (או אל SpeechConfig.voice) במהלך סינתזת הדיבור.

‫language_code string  (אופציונלי)

אופציונלי. תג השפה הראשי בתקן BCP-47 (למשל, 'en-US',‏ 'fr-FR').

model string  (אופציונלי)

אופציונלי. המודל ששימש לעיצוב או לשכפול של הקול. אם לא מציינים את המודל ב-CreateVoice, ברירת המחדל היא המודל העדכני ביותר של עיצוב קול שנתמך. מוחזר בתגובות של הפונקציות CreateVoice,‏ GetVoice ו-ListVoices עבור קולות בהתאמה אישית (prompted ו-replicated); לא מוגדר עבור קולות prebuilt. אפשר לסנתז קולות שנוצרו באמצעות כל מודל סינתזה נתמך של TTS.

persona string  (אופציונלי)

אופציונלי. הפרסונה או הארכיטיפ של הדמות (לדוגמה, "חמה, ידידותית", "קריין").

pitch Pitch  (אופציונלי)

אופציונלי. סיווג של גובה הצליל של הקול.

ערכים אפשריים

  • low

    קול נמוך יותר.

  • medium

    קול בינוני.

  • high

    קול גבוה יותר.

prompted PromptedVoice  (אופציונלי)

פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`,‏ `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.

פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`,‏ `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.

שדות

input string  (אופציונלי)

חובה. פרומפט בשפה טבעית שמתאר את הקול הרצוי, למשל: "קול גברי עמוק ורועם של עוג מרושע וענק באמצע החיים".

‫region_code string  (optional)

אופציונלי. קוד אזור גיאוגרפי לפי תקן ISO 3166-1 alpha-2 או UN M.49 (לדוגמה, US,‏ GB,‏ 001).

sample_audio AudioData  (optional)

פלט בלבד. דגימת אודיו (אודיו של הנחיה לסינתיסייזר) שנוצרה עבור קול שהוזן בהנחיה. השדה הזה מאוכלס רק בתשובות של הפונקציות CreateVoice ו-GetVoice כשהערך של type הוא prompted. הוא לא מאוכלס בתשובות של הפונקציה ListVoices, וגם לא בקולות מסוג replicated או prebuilt.

מטען ייעודי (payload) של אודיו שמשמש ליצירת קול.

שדות

data string  (אופציונלי)

חובה. הבייטים הגולמיים של האודיו.

mime_type string  (optional)

חובה. סוג ה-MIME של נתוני האודיו לפי IANA (לדוגמה, ‎`audio/wav` ‎ או ‎`audio/mpeg`).

type VoiceType  (אופציונלי)

חובה. סוג הקול. ב-`CreateVoice`, הערך חייב להיות `"replicated"` או `"prompted"`. בתגובות של `ListVoices`, יכול להיות גם הערך `"prebuilt"`.

ערכים אפשריים

  • replicated

    קול בהתאמה אישית שנוצר משכפול של דגימת אודיו ושל הקלטה של הסכמת הדובר.

  • prompted

    קול בהתאמה אישית שנוצר מפרומפט טקסטואלי בשפה טבעית.

  • prebuilt

    קול מערכת מובנה מקטלוג הקולות של Google (לדוגמה, ‎`Puck`‎,‏ ‎`Charon`‎). מוחזר בתשובות. אי אפשר לציין אותו כסוג ב-‎`CreateVoice`‎.

usage Usage  (אופציונלי)

פלט בלבד. נתונים סטטיסטיים על השימוש באסימון עבור בקשת יצירת הקול. השדה הזה מאוכלס רק בתגובה של `CreateVoice` כשהערך של `type` הוא `"prompted"`; הוא לא מוגדר עבור `"replicated"` ובתגובות של `GetVoice` ו-`ListVoices`.

נתונים סטטיסטיים על השימוש באסימון של בקשת האינטראקציה.

שדות

cached_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש בטוקנים במטמון לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

grounding_tool_count array (GroundingToolCount)  (optional)

מספר כלי העיגון.

מספר כלי ההארקה.

שדות

count integer  (אופציונלי)

מספר כלי ההארקה.

type enum (string)  (optional)

סוג כלי ההארקה שמשויך לספירה.

ערכים אפשריים:

  • google_search

    עיגון באמצעות חיפוש אינטרנט של Google וחיפוש תמונות, ועיגון באינטרנט לארגונים.

  • google_maps

    עיגון בעזרת מפות Google.

input_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימוני קלט לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

output_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימוני פלט לפי אופן השימוש.

כמות הטוקנים עבור מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

tool_use_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימונים של כלי לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

total_cached_tokens integer  (optional)

מספר הטוקנים בחלק המאוחסן במטמון של ההנחיה (התוכן שנשמר במטמון).

total_input_tokens integer  (optional)

מספר הטוקנים בהנחיה (בהקשר).

total_output_tokens integer  (optional)

המספר הכולל של טוקנים בכל התשובות שנוצרו.

total_thought_tokens integer  (optional)

מספר הטוקנים של המחשבות של מודלים חושבים.

total_tokens integer  (optional)

המספר הכולל של הטוקנים בבקשת האינטראקציה (הנחיה + תגובות + טוקנים פנימיים אחרים).

total_tool_use_tokens integer  (optional)

מספר הטוקנים שמופיעים בהנחיות לשימוש בכלים.

דוגמה

דוגמה לתשובה

{
  "accent": "string",
  "context": "string",
  "description": "string",
  "display_name": "string",
  "expire_time": "string",
  "gender": "string",
  "id": "string",
  "key": "string",
  "language_code": "string",
  "model": "string",
  "persona": "string",
  "pitch": "low",
  "prompted": {
    "input": "string"
  },
  "region_code": "string",
  "replicated": {
    "consent_audio": {
      "data": "string",
      "mime_type": "string"
    },
    "source_audio": {
      "data": "string",
      "mime_type": "string"
    }
  },
  "sample_audio": {
    "data": "string",
    "mime_type": "string"
  },
  "type": "replicated",
  "usage": {
    "cached_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "grounding_tool_count": [
      {
        "count": 0,
        "type": "google_search"
      }
    ],
    "input_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "output_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "tool_use_tokens_by_modality": [
      {
        "modality": "text",
        "tokens": 0
      }
    ],
    "total_cached_tokens": 0,
    "total_input_tokens": 0,
    "total_output_tokens": 0,
    "total_thought_tokens": 0,
    "total_tokens": 0,
    "total_tool_use_tokens": 0
  }
}

DeleteVoice

delete https://generativelanguage.googleapis.com/v1beta/voices/{voicesId}

מחיקת קול מותאם אישית שמאוחסן (`store = true`) לפי שם המשאב. אי אפשר למחוק קולות מוכנים מראש מהקטלוג (`VOICE_TYPE_PREBUILT`).

פרמטרים של נתיב או שאילתה

voicesId string  (required)

חובה. שם המשאב של הקול המותאם אישית שרוצים למחוק (לדוגמה, voices/voice_abc123def456).

תשובה

אם הפעולה בוצעה ללא שגיאות, התגובה תהיה ריקה.

דוגמה

משאבים

Voice

משאב קולי שמייצג קול בהתאמה אישית (שנוצר באמצעות CreateVoice) או קול מערכת מובנה מראש (שמוחזר על ידי ListVoices).

שדות

accent string  (אופציונלי)

אופציונלי. תיאור של מבטא אזורי (לדוגמה, "אמריקאי", "בריטי").

context string  (אופציונלי)

אופציונלי. ההקשר או הדומיין האופטימליים לשימוש (למשל, 'שיחה', 'ספר אודיו', 'חדשות').

description string  (אופציונלי)

אופציונלי. סיכום תיאורי של גוון הקול, האישיות והטון.

display_name string  (optional)

אופציונלי. השם המוצג שהמשתמש סיפק לקול מאוחסן (<code>store = true</code>), או שם הקטלוג של קול מוכן מראש.

expire_time string  (optional)

פלט בלבד. חותמת הזמן שבה תוקף של קול מותאם אישית מאוחסן (store = true) או של מפתח קול משוכפל (store = false) פג. לא מוגדר מראש עבור קולות קטלוג מוכנים מראש ('prebuilt'), שתוקפם לא פג.

gender string  (optional)

אופציונלי. הצגת מגדר קולי (לדוגמה, 'נקבה', 'זכר', 'ניטרלי').

id string  (optional)

פלט בלבד. המזהה הייחודי של הקול. ‫* עבור קולות מותאמים אישית שמנוהלים על ידי Google ‏ (`store = true`), זהו מזהה שנוצר עם הקידומת `voice_` (לדוגמה, `voice_abc123def456`). מעבירים את המחרוזת `voices/{id}` כפרמטר `name` בפונקציות `GetVoice` ו-`DeleteVoice`, ומעבירים את המחרוזת `{id}` ישירות אל `SpeechConfig.voice_config.voice` (או אל `SpeechConfig.voice`) במהלך סינתזת הדיבור. ‫* עבור קולות קטלוג מוכנים מראש (הערך `"prebuilt"` שמוחזר על ידי `ListVoices`), זהו שם הדובר (לדוגמה, `Puck` או `Charon`). * לא מוגדר כשקוראים ל-`CreateVoice` עם `store = false`.

key string  (אופציונלי)

פלט בלבד. מפתח רפליקציה של קולות שמנוהל על ידי הלקוח (עם הקידומת voicekey_‎). מוחזר רק על ידי CreateVoice כאשר type הוא replicated ו-store הוא false. מעבירים את המפתח הזה אל SpeechConfig.voice_config.voice (או אל SpeechConfig.voice) במהלך סינתזת הדיבור.

‫language_code string  (אופציונלי)

אופציונלי. תג השפה הראשי בתקן BCP-47 (למשל, 'en-US',‏ 'fr-FR').

model string  (אופציונלי)

אופציונלי. המודל ששימש לעיצוב או לשכפול של הקול. אם לא מציינים את המודל ב-CreateVoice, ברירת המחדל היא המודל העדכני ביותר של עיצוב קול שנתמך. מוחזר בתגובות של הפונקציות CreateVoice,‏ GetVoice ו-ListVoices עבור קולות בהתאמה אישית (prompted ו-replicated); לא מוגדר עבור קולות prebuilt. אפשר לסנתז קולות שנוצרו באמצעות כל מודל סינתזה נתמך של TTS.

persona string  (אופציונלי)

אופציונלי. הפרסונה או הארכיטיפ של הדמות (לדוגמה, "חמה, ידידותית", "קריין").

pitch Pitch  (אופציונלי)

אופציונלי. סיווג של גובה הצליל של הקול.

ערכים אפשריים

  • low

    קול נמוך יותר.

  • medium

    קול בינוני.

  • high

    קול גבוה יותר.

prompted PromptedVoice  (אופציונלי)

פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`,‏ `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.

פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`,‏ `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.

שדות

input string  (אופציונלי)

חובה. פרומפט בשפה טבעית שמתאר את הקול הרצוי, למשל: "קול גברי עמוק ורועם של עוג מרושע וענק באמצע החיים".

‫region_code string  (optional)

אופציונלי. קוד אזור גיאוגרפי לפי תקן ISO 3166-1 alpha-2 או UN M.49 (לדוגמה, US,‏ GB,‏ 001).

sample_audio AudioData  (optional)

פלט בלבד. דגימת אודיו (אודיו של הנחיה לסינתיסייזר) שנוצרה עבור קול שהוזן בהנחיה. השדה הזה מאוכלס רק בתשובות של הפונקציות CreateVoice ו-GetVoice כשהערך של type הוא prompted. הוא לא מאוכלס בתשובות של הפונקציה ListVoices, וגם לא בקולות מסוג replicated או prebuilt.

מטען ייעודי (payload) של אודיו שמשמש ליצירת קול.

שדות

data string  (אופציונלי)

חובה. הבייטים הגולמיים של האודיו.

mime_type string  (optional)

חובה. סוג ה-MIME של נתוני האודיו לפי IANA (לדוגמה, ‎`audio/wav` ‎ או ‎`audio/mpeg`).

type VoiceType  (אופציונלי)

חובה. סוג הקול. ב-`CreateVoice`, הערך חייב להיות `"replicated"` או `"prompted"`. בתגובות של `ListVoices`, יכול להיות גם הערך `"prebuilt"`.

ערכים אפשריים

  • replicated

    קול בהתאמה אישית שנוצר משכפול של דגימת אודיו ושל הקלטה של הסכמת הדובר.

  • prompted

    קול בהתאמה אישית שנוצר מפרומפט טקסטואלי בשפה טבעית.

  • prebuilt

    קול מערכת מובנה מקטלוג הקולות של Google (לדוגמה, ‎`Puck`‎,‏ ‎`Charon`‎). מוחזר בתשובות. אי אפשר לציין אותו כסוג ב-‎`CreateVoice`‎.

usage Usage  (אופציונלי)

פלט בלבד. נתונים סטטיסטיים על השימוש באסימון עבור בקשת יצירת הקול. השדה הזה מאוכלס רק בתגובה של `CreateVoice` כשהערך של `type` הוא `"prompted"`; הוא לא מוגדר עבור `"replicated"` ובתגובות של `GetVoice` ו-`ListVoices`.

נתונים סטטיסטיים על השימוש באסימון של בקשת האינטראקציה.

שדות

cached_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש בטוקנים במטמון לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

grounding_tool_count array (GroundingToolCount)  (optional)

מספר כלי העיגון.

מספר כלי ההארקה.

שדות

count integer  (אופציונלי)

מספר כלי ההארקה.

type enum (string)  (optional)

סוג כלי ההארקה שמשויך לספירה.

ערכים אפשריים:

  • google_search

    עיגון באמצעות חיפוש אינטרנט של Google וחיפוש תמונות, ועיגון באינטרנט לארגונים.

  • google_maps

    עיגון בעזרת מפות Google.

input_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימוני קלט לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

output_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימוני פלט לפי אופן השימוש.

כמות הטוקנים עבור מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

tool_use_tokens_by_modality array (ModalityTokens)  (optional)

פירוט של השימוש באסימונים של כלי לפי אופן השימוש.

כמות הטוקנים של מצב תגובה יחיד.

שדות

modality ResponseModality  (אופציונלי)

האופן שבו משתמשים בכמות טוקנים.

ערכים אפשריים

  • text

    מציין שהמודל צריך להחזיר טקסט.

  • image

    מציין שהמודל צריך להחזיר תמונות.

  • audio

    מציין שהמודל צריך להחזיר אודיו.

  • video

    מציין שהמודל צריך להחזיר סרטון.

  • document

    מציין שהמודל צריך להחזיר מסמכים.

‫tokens integer  (אופציונלי)

מספר הטוקנים של האופן.

total_cached_tokens integer  (optional)

מספר הטוקנים בחלק המאוחסן במטמון של ההנחיה (התוכן שנשמר במטמון).

total_input_tokens integer  (optional)

מספר הטוקנים בהנחיה (בהקשר).

total_output_tokens integer  (optional)

המספר הכולל של טוקנים בכל התשובות שנוצרו.

total_thought_tokens integer  (optional)

מספר הטוקנים של המחשבות של מודלים חושבים.

total_tokens integer  (optional)

המספר הכולל של הטוקנים בבקשת האינטראקציה (הנחיה + תגובות + טוקנים פנימיים אחרים).

total_tool_use_tokens integer  (optional)

מספר הטוקנים שמופיעים בהנחיות לשימוש בכלים.