Voices API מאפשר ליצור קולות בהתאמה אישית מהנחיות בשפה טבעית (עיצוב קול) או מהקלטות אודיו של הפניה והסכמה של הדובר (שכפול קול), וגם לרשום, לאחזר ולנהל קולות בהתאמה אישית וקולות מוכנים מראש לסינתזה של טקסט לדיבור (TTS).
CreateVoice
יצירת קול בהתאמה אישית מהנחיה בשפה טבעית (`VOICE_TYPE_PROMPTED`) או מהקלטות אודיו של קובצי עזר והסכמה (`VOICE_TYPE_REPLICATED`).
גוף הבקשה
גוף הבקשה מכיל נתונים במבנה הבא:
אופציונלי. האם הקול שנוצר נשמר ומנוהל על ידי Google. * אם הערך הוא true, Google מאחסנת את הקול ומחזירה את הערך Voice.id (לדוגמה, voice_abc123def456), שאפשר לנהל באמצעות הפונקציות GetVoice, ListVoices ו-DeleteVoice, ולהפנות אליו באמצעות מזהה בבקשות סינתזה. בפרויקטים יש מכסת אחסון מקסימלית של קולות פעילים. חריגה מהמכסה מחזירה את השגיאה `RESOURCE_EXHAUSTED`. * אם הערך הוא `false` (ברירת המחדל), הקול לא מאוחסן על ידי Google ומוחזר הערך `Voice.key` (לדוגמה, `voicekey_...`) לאחסון וסינתזה בצד הלקוח. שדות אופציונליים של מטא-נתונים של גילוי ב-`voice` לא נשמרים ולא מוחזרים כש-`store` הוא `false`. * הערך חייב להיות `true` כש-`voice.type` הוא `"prompted"` (אחרת הפעולה נכשלת עם `INVALID_ARGUMENT`).
חובה. הקול שרוצים ליצור. הפרמטר `voice.model` הוא אופציונלי. אם הוא לא מצוין, השירות בוחר את מודל ברירת המחדל ליצירת קול. שדות לקריאה בלבד ב-Voice (`id`, `key`, `expire_time`, `usage`) מוזנחים אם הם מוגדרים.
תשובה
אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל נתונים במבנה הבא:
אופציונלי. תיאור של מבטא אזורי (לדוגמה, "אמריקאי", "בריטי").
אופציונלי. ההקשר או הדומיין האופטימליים לשימוש (למשל, 'שיחה', 'ספר אודיו', 'חדשות').
אופציונלי. סיכום תיאורי של גוון הקול, האישיות והטון.
אופציונלי. השם המוצג שהמשתמש סיפק לקול מאוחסן (<code>store = true</code>), או שם הקטלוג של קול מוכן מראש.
פלט בלבד. חותמת הזמן שבה תוקף של קול מותאם אישית מאוחסן (store = true) או של מפתח קול משוכפל (store = false) פג. לא מוגדר מראש עבור קולות קטלוג מוכנים מראש ('prebuilt'), שתוקפם לא פג.
אופציונלי. הצגת מגדר קולי (לדוגמה, 'נקבה', 'זכר', 'ניטרלי').
פלט בלבד. המזהה הייחודי של הקול. * עבור קולות מותאמים אישית שמנוהלים על ידי Google (`store = true`), זהו מזהה שנוצר עם הקידומת `voice_` (לדוגמה, `voice_abc123def456`). מעבירים את המחרוזת `voices/{id}` כפרמטר `name` בפונקציות `GetVoice` ו-`DeleteVoice`, ומעבירים את המחרוזת `{id}` ישירות אל `SpeechConfig.voice_config.voice` (או אל `SpeechConfig.voice`) במהלך סינתזת הדיבור. * עבור קולות קטלוג מוכנים מראש (הערך `"prebuilt"` שמוחזר על ידי `ListVoices`), זהו שם הדובר (לדוגמה, `Puck` או `Charon`). * לא מוגדר כשקוראים ל-`CreateVoice` עם `store = false`.
פלט בלבד. מפתח רפליקציה של קולות שמנוהל על ידי הלקוח (עם הקידומת voicekey_). מוחזר רק על ידי CreateVoice כאשר type הוא replicated ו-store הוא false. מעבירים את המפתח הזה אל SpeechConfig.voice_config.voice (או אל SpeechConfig.voice) במהלך סינתזת הדיבור.
אופציונלי. תג השפה הראשי בתקן BCP-47 (למשל, 'en-US', 'fr-FR').
אופציונלי. המודל ששימש לעיצוב או לשכפול של הקול. אם לא מציינים את המודל ב-CreateVoice, ברירת המחדל היא המודל העדכני ביותר של עיצוב קול שנתמך. מוחזר בתגובות של הפונקציות CreateVoice, GetVoice ו-ListVoices עבור קולות בהתאמה אישית (prompted ו-replicated); לא מוגדר עבור קולות prebuilt. אפשר לסנתז קולות שנוצרו באמצעות כל מודל סינתזה נתמך של TTS.
אופציונלי. הפרסונה או הארכיטיפ של הדמות (לדוגמה, "חמה, ידידותית", "קריין").
pitch Pitch (אופציונלי)
אופציונלי. סיווג של גובה הצליל של הקול.
ערכים אפשריים
-
lowקול נמוך יותר.
-
mediumקול בינוני.
-
highקול גבוה יותר.
prompted PromptedVoice (אופציונלי)
פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`, `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.
שדות
חובה. פרומפט בשפה טבעית שמתאר את הקול הרצוי, למשל: "קול גברי עמוק ורועם של עוג מרושע וענק באמצע החיים".
אופציונלי. קוד אזור גיאוגרפי לפי תקן ISO 3166-1 alpha-2 או UN M.49 (לדוגמה, US, GB, 001).
sample_audio AudioData (optional)
פלט בלבד. דגימת אודיו (אודיו של הנחיה לסינתיסייזר) שנוצרה עבור קול שהוזן בהנחיה. השדה הזה מאוכלס רק בתשובות של הפונקציות CreateVoice ו-GetVoice כשהערך של type הוא prompted. הוא לא מאוכלס בתשובות של הפונקציה ListVoices, וגם לא בקולות מסוג replicated או prebuilt.
שדות
חובה. הבייטים הגולמיים של האודיו.
חובה. סוג ה-MIME של נתוני האודיו לפי IANA (לדוגמה, `audio/wav` או `audio/mpeg`).
type VoiceType (אופציונלי)
חובה. סוג הקול. ב-`CreateVoice`, הערך חייב להיות `"replicated"` או `"prompted"`. בתגובות של `ListVoices`, יכול להיות גם הערך `"prebuilt"`.
ערכים אפשריים
-
replicatedקול בהתאמה אישית שנוצר משכפול של דגימת אודיו ושל הקלטה של הסכמת הדובר.
-
promptedקול בהתאמה אישית שנוצר מפרומפט טקסטואלי בשפה טבעית.
-
prebuiltקול מערכת מובנה מקטלוג הקולות של Google (לדוגמה, `Puck`, `Charon`). מוחזר בתשובות. אי אפשר לציין אותו כסוג ב-`CreateVoice`.
usage Usage (אופציונלי)
פלט בלבד. נתונים סטטיסטיים על השימוש באסימון עבור בקשת יצירת הקול. השדה הזה מאוכלס רק בתגובה של `CreateVoice` כשהערך של `type` הוא `"prompted"`; הוא לא מוגדר עבור `"replicated"` ובתגובות של `GetVoice` ו-`ListVoices`.
שדות
cached_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש בטוקנים במטמון לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
grounding_tool_count array (GroundingToolCount) (optional)
מספר כלי העיגון.
שדות
מספר כלי ההארקה.
סוג כלי ההארקה שמשויך לספירה.
ערכים אפשריים:
-
google_searchעיגון באמצעות חיפוש אינטרנט של Google וחיפוש תמונות, ועיגון באינטרנט לארגונים.
-
google_mapsעיגון בעזרת מפות Google.
input_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימוני קלט לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
output_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימוני פלט לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימונים של כלי לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
מספר הטוקנים בחלק המאוחסן במטמון של ההנחיה (התוכן שנשמר במטמון).
מספר הטוקנים בהנחיה (בהקשר).
המספר הכולל של טוקנים בכל התשובות שנוצרו.
מספר הטוקנים של המחשבות של מודלים חושבים.
המספר הכולל של הטוקנים בבקשת האינטראקציה (הנחיה + תגובות + טוקנים פנימיים אחרים).
מספר הטוקנים שמופיעים בהנחיות לשימוש בכלים.
דוגמה
דוגמה לתשובה
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
ListVoices
רשימה של קולות מותאמים אישית ששמורים בבעלות המתקשר (בסדר מהחדש לישן), ואחריהם קולות מערכת מוכנים מראש מקטלוג הקולות של Google.
פרמטרים של נתיב או שאילתה
אופציונלי. מסננים לפי תיאור המבטא (למשל, "אמריקאי", "בריטי"). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות עם כל אחת מההדגשות שצוינו (OR).
אופציונלי. סינון לפי הקשר או הדומיין המיועדים (לדוגמה, 'חדשות, מסחרי'). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מחפשת התאמות בין הקולות לבין אחד מההקשרים שצוינו (OR).
אופציונלי. סינון לפי הצגת מגדר (לדוגמה, 'נקבה', 'זכר', 'ניטרלי'). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות לכל אחד מהמינים שצוינו (OR).
אופציונלי. מסננים לפי קוד שפה בתקן BCP-47 (למשל 'en-US'). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות עם כל אחד מקודי השפה שצוינו (OR).
אופציונלי. המספר המקסימלי של קולות שיוחזרו בכל דף. יכול להיות שהשירות יחזיר פחות מהערך הזה. אם לא מציינים ערך, המערכת מחזירה עד 50 קולות. הערך המקסימלי הוא 1,000. ערכים גבוהים יותר יומרו ל-1,000.
אופציונלי. טוקן של דף שהתקבל מקריאה קודמת של ListVoices. צריך להזין את הטוקן כדי לאחזר את הדף הבא. כשמבצעים חלוקה לדפים, כל פרמטרי השאילתה של המסנן (`language_code`, `region_code`, `accent`, `persona`, `context`, `gender`, `pitch`, `type` ו- `search`) צריכים להיות זהים לקריאה שהחזירה את הטוקן הזה. אחרת, הבקשה תיכשל עם השגיאה `INVALID_ARGUMENT`. יכול להיות שהערך של `page_size` ישתנה בין הדפים.
אופציונלי. מסננים לפי דמות קולית (למשל, "חם, ידידותי"). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מתאימה קולות לכל אחת מהפרסונות שצוינו (OR).
אופציונלי. סינון לפי גובה הצליל של הקול. הערכים האפשריים הם low, medium, high או PITCH_LOW, PITCH_MEDIUM, PITCH_HIGH (לא תלוי באותיות רישיות או קטנות). אם מציינים כמה ערכים, המערכת מתאימה קולות עם כל אחד מהגבהים שצוינו (OR).
אופציונלי. מסננים לפי קוד אזור בתקן ISO 3166-1 alpha-2 או לפי קוד אזור בתקן UN M.49 (לדוגמה, US או 001). התאמה מדויקת לא תלוית-רישיות. אם מציינים כמה ערכים, המערכת מחפשת התאמות לקולות עם אחד מקודי האזור שצוינו (OR).
אופציונלי. שאילתת חיפוש של מחרוזת משנה בטקסט חופשי, שמתאימה לחיפוש לא תלוי-רישיות גם ב-`display_name` וגם ב-`description`. אורך מקסימלי של 2,048 בייט.
אופציונלי. סינון לפי סוג הקול. הערכים הקבילים הם prebuilt, replicated, prompted או VOICE_TYPE_PREBUILT, VOICE_TYPE_REPLICATED, VOICE_TYPE_PROMPTED (לא תלוי באותיות רישיות). אם מציינים כמה ערכים, המערכת תתאים קולות לכל אחד מהסוגים שצוינו (OR).
תשובה
אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל נתונים במבנה הבא:
טוקן שאפשר לשלוח כ-`page_token` כדי לאחזר את הדף הבא. אם השדה ריק, לא יופיעו דפים נוספים.
הקולות מהאוסף שצוין.
דוגמה
דוגמה לתשובה
{ "next_page_token": "string", "voices": [ { "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "...", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } } ] }
GetVoice
מקבל קול מותאם אישית מאוחסן (`store = true`) לפי שם המשאב. אי אפשר לאחזר קולות מוכנים מראש מהקטלוג (`VOICE_TYPE_PREBUILT`) באמצעות `GetVoice`; צריך להשתמש במקום זאת ב-`ListVoices`.
פרמטרים של נתיב או שאילתה
חובה. שם המשאב של הקול המותאם אישית שרוצים לאחזר (לדוגמה, voices/voice_abc123def456).
תשובה
אם הפעולה בוצעה ללא שגיאות, גוף התגובה יכיל נתונים במבנה הבא:
אופציונלי. תיאור של מבטא אזורי (לדוגמה, "אמריקאי", "בריטי").
אופציונלי. ההקשר או הדומיין האופטימליים לשימוש (למשל, 'שיחה', 'ספר אודיו', 'חדשות').
אופציונלי. סיכום תיאורי של גוון הקול, האישיות והטון.
אופציונלי. השם המוצג שהמשתמש סיפק לקול מאוחסן (<code>store = true</code>), או שם הקטלוג של קול מוכן מראש.
פלט בלבד. חותמת הזמן שבה תוקף של קול מותאם אישית מאוחסן (store = true) או של מפתח קול משוכפל (store = false) פג. לא מוגדר מראש עבור קולות קטלוג מוכנים מראש ('prebuilt'), שתוקפם לא פג.
אופציונלי. הצגת מגדר קולי (לדוגמה, 'נקבה', 'זכר', 'ניטרלי').
פלט בלבד. המזהה הייחודי של הקול. * עבור קולות מותאמים אישית שמנוהלים על ידי Google (`store = true`), זהו מזהה שנוצר עם הקידומת `voice_` (לדוגמה, `voice_abc123def456`). מעבירים את המחרוזת `voices/{id}` כפרמטר `name` בפונקציות `GetVoice` ו-`DeleteVoice`, ומעבירים את המחרוזת `{id}` ישירות אל `SpeechConfig.voice_config.voice` (או אל `SpeechConfig.voice`) במהלך סינתזת הדיבור. * עבור קולות קטלוג מוכנים מראש (הערך `"prebuilt"` שמוחזר על ידי `ListVoices`), זהו שם הדובר (לדוגמה, `Puck` או `Charon`). * לא מוגדר כשקוראים ל-`CreateVoice` עם `store = false`.
פלט בלבד. מפתח רפליקציה של קולות שמנוהל על ידי הלקוח (עם הקידומת voicekey_). מוחזר רק על ידי CreateVoice כאשר type הוא replicated ו-store הוא false. מעבירים את המפתח הזה אל SpeechConfig.voice_config.voice (או אל SpeechConfig.voice) במהלך סינתזת הדיבור.
אופציונלי. תג השפה הראשי בתקן BCP-47 (למשל, 'en-US', 'fr-FR').
אופציונלי. המודל ששימש לעיצוב או לשכפול של הקול. אם לא מציינים את המודל ב-CreateVoice, ברירת המחדל היא המודל העדכני ביותר של עיצוב קול שנתמך. מוחזר בתגובות של הפונקציות CreateVoice, GetVoice ו-ListVoices עבור קולות בהתאמה אישית (prompted ו-replicated); לא מוגדר עבור קולות prebuilt. אפשר לסנתז קולות שנוצרו באמצעות כל מודל סינתזה נתמך של TTS.
אופציונלי. הפרסונה או הארכיטיפ של הדמות (לדוגמה, "חמה, ידידותית", "קריין").
pitch Pitch (אופציונלי)
אופציונלי. סיווג של גובה הצליל של הקול.
ערכים אפשריים
-
lowקול נמוך יותר.
-
mediumקול בינוני.
-
highקול גבוה יותר.
prompted PromptedVoice (אופציונלי)
פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`, `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.
שדות
חובה. פרומפט בשפה טבעית שמתאר את הקול הרצוי, למשל: "קול גברי עמוק ורועם של עוג מרושע וענק באמצע החיים".
אופציונלי. קוד אזור גיאוגרפי לפי תקן ISO 3166-1 alpha-2 או UN M.49 (לדוגמה, US, GB, 001).
sample_audio AudioData (optional)
פלט בלבד. דגימת אודיו (אודיו של הנחיה לסינתיסייזר) שנוצרה עבור קול שהוזן בהנחיה. השדה הזה מאוכלס רק בתשובות של הפונקציות CreateVoice ו-GetVoice כשהערך של type הוא prompted. הוא לא מאוכלס בתשובות של הפונקציה ListVoices, וגם לא בקולות מסוג replicated או prebuilt.
שדות
חובה. הבייטים הגולמיים של האודיו.
חובה. סוג ה-MIME של נתוני האודיו לפי IANA (לדוגמה, `audio/wav` או `audio/mpeg`).
type VoiceType (אופציונלי)
חובה. סוג הקול. ב-`CreateVoice`, הערך חייב להיות `"replicated"` או `"prompted"`. בתגובות של `ListVoices`, יכול להיות גם הערך `"prebuilt"`.
ערכים אפשריים
-
replicatedקול בהתאמה אישית שנוצר משכפול של דגימת אודיו ושל הקלטה של הסכמת הדובר.
-
promptedקול בהתאמה אישית שנוצר מפרומפט טקסטואלי בשפה טבעית.
-
prebuiltקול מערכת מובנה מקטלוג הקולות של Google (לדוגמה, `Puck`, `Charon`). מוחזר בתשובות. אי אפשר לציין אותו כסוג ב-`CreateVoice`.
usage Usage (אופציונלי)
פלט בלבד. נתונים סטטיסטיים על השימוש באסימון עבור בקשת יצירת הקול. השדה הזה מאוכלס רק בתגובה של `CreateVoice` כשהערך של `type` הוא `"prompted"`; הוא לא מוגדר עבור `"replicated"` ובתגובות של `GetVoice` ו-`ListVoices`.
שדות
cached_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש בטוקנים במטמון לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
grounding_tool_count array (GroundingToolCount) (optional)
מספר כלי העיגון.
שדות
מספר כלי ההארקה.
סוג כלי ההארקה שמשויך לספירה.
ערכים אפשריים:
-
google_searchעיגון באמצעות חיפוש אינטרנט של Google וחיפוש תמונות, ועיגון באינטרנט לארגונים.
-
google_mapsעיגון בעזרת מפות Google.
input_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימוני קלט לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
output_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימוני פלט לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימונים של כלי לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
מספר הטוקנים בחלק המאוחסן במטמון של ההנחיה (התוכן שנשמר במטמון).
מספר הטוקנים בהנחיה (בהקשר).
המספר הכולל של טוקנים בכל התשובות שנוצרו.
מספר הטוקנים של המחשבות של מודלים חושבים.
המספר הכולל של הטוקנים בבקשת האינטראקציה (הנחיה + תגובות + טוקנים פנימיים אחרים).
מספר הטוקנים שמופיעים בהנחיות לשימוש בכלים.
דוגמה
דוגמה לתשובה
{ "accent": "string", "context": "string", "description": "string", "display_name": "string", "expire_time": "string", "gender": "string", "id": "string", "key": "string", "language_code": "string", "model": "string", "persona": "string", "pitch": "low", "prompted": { "input": "string" }, "region_code": "string", "replicated": { "consent_audio": { "data": "string", "mime_type": "string" }, "source_audio": { "data": "string", "mime_type": "string" } }, "sample_audio": { "data": "string", "mime_type": "string" }, "type": "replicated", "usage": { "cached_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "grounding_tool_count": [ { "count": 0, "type": "google_search" } ], "input_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "output_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "tool_use_tokens_by_modality": [ { "modality": "text", "tokens": 0 } ], "total_cached_tokens": 0, "total_input_tokens": 0, "total_output_tokens": 0, "total_thought_tokens": 0, "total_tokens": 0, "total_tool_use_tokens": 0 } }
DeleteVoice
מחיקת קול מותאם אישית שמאוחסן (`store = true`) לפי שם המשאב. אי אפשר למחוק קולות מוכנים מראש מהקטלוג (`VOICE_TYPE_PREBUILT`).
פרמטרים של נתיב או שאילתה
חובה. שם המשאב של הקול המותאם אישית שרוצים למחוק (לדוגמה, voices/voice_abc123def456).
תשובה
אם הפעולה בוצעה ללא שגיאות, התגובה תהיה ריקה.
דוגמה
משאבים
Voice
משאב קולי שמייצג קול בהתאמה אישית (שנוצר באמצעות CreateVoice) או קול מערכת מובנה מראש (שמוחזר על ידי ListVoices).
שדות
אופציונלי. תיאור של מבטא אזורי (לדוגמה, "אמריקאי", "בריטי").
אופציונלי. ההקשר או הדומיין האופטימליים לשימוש (למשל, 'שיחה', 'ספר אודיו', 'חדשות').
אופציונלי. סיכום תיאורי של גוון הקול, האישיות והטון.
אופציונלי. השם המוצג שהמשתמש סיפק לקול מאוחסן (<code>store = true</code>), או שם הקטלוג של קול מוכן מראש.
פלט בלבד. חותמת הזמן שבה תוקף של קול מותאם אישית מאוחסן (store = true) או של מפתח קול משוכפל (store = false) פג. לא מוגדר מראש עבור קולות קטלוג מוכנים מראש ('prebuilt'), שתוקפם לא פג.
אופציונלי. הצגת מגדר קולי (לדוגמה, 'נקבה', 'זכר', 'ניטרלי').
פלט בלבד. המזהה הייחודי של הקול. * עבור קולות מותאמים אישית שמנוהלים על ידי Google (`store = true`), זהו מזהה שנוצר עם הקידומת `voice_` (לדוגמה, `voice_abc123def456`). מעבירים את המחרוזת `voices/{id}` כפרמטר `name` בפונקציות `GetVoice` ו-`DeleteVoice`, ומעבירים את המחרוזת `{id}` ישירות אל `SpeechConfig.voice_config.voice` (או אל `SpeechConfig.voice`) במהלך סינתזת הדיבור. * עבור קולות קטלוג מוכנים מראש (הערך `"prebuilt"` שמוחזר על ידי `ListVoices`), זהו שם הדובר (לדוגמה, `Puck` או `Charon`). * לא מוגדר כשקוראים ל-`CreateVoice` עם `store = false`.
פלט בלבד. מפתח רפליקציה של קולות שמנוהל על ידי הלקוח (עם הקידומת voicekey_). מוחזר רק על ידי CreateVoice כאשר type הוא replicated ו-store הוא false. מעבירים את המפתח הזה אל SpeechConfig.voice_config.voice (או אל SpeechConfig.voice) במהלך סינתזת הדיבור.
אופציונלי. תג השפה הראשי בתקן BCP-47 (למשל, 'en-US', 'fr-FR').
אופציונלי. המודל ששימש לעיצוב או לשכפול של הקול. אם לא מציינים את המודל ב-CreateVoice, ברירת המחדל היא המודל העדכני ביותר של עיצוב קול שנתמך. מוחזר בתגובות של הפונקציות CreateVoice, GetVoice ו-ListVoices עבור קולות בהתאמה אישית (prompted ו-replicated); לא מוגדר עבור קולות prebuilt. אפשר לסנתז קולות שנוצרו באמצעות כל מודל סינתזה נתמך של TTS.
אופציונלי. הפרסונה או הארכיטיפ של הדמות (לדוגמה, "חמה, ידידותית", "קריין").
pitch Pitch (אופציונלי)
אופציונלי. סיווג של גובה הצליל של הקול.
ערכים אפשריים
-
lowקול נמוך יותר.
-
mediumקול בינוני.
-
highקול גבוה יותר.
prompted PromptedVoice (אופציונלי)
פרמטרים ליצירת קול בהנחיה. חובה ב-`CreateVoice` אם הערך של `type` הוא `"prompted"`. מוחזר בתגובות של `CreateVoice`, `GetVoice` ו-`ListVoices` עבור קולות שנוצרו בעזרת הנחיה.
שדות
חובה. פרומפט בשפה טבעית שמתאר את הקול הרצוי, למשל: "קול גברי עמוק ורועם של עוג מרושע וענק באמצע החיים".
אופציונלי. קוד אזור גיאוגרפי לפי תקן ISO 3166-1 alpha-2 או UN M.49 (לדוגמה, US, GB, 001).
sample_audio AudioData (optional)
פלט בלבד. דגימת אודיו (אודיו של הנחיה לסינתיסייזר) שנוצרה עבור קול שהוזן בהנחיה. השדה הזה מאוכלס רק בתשובות של הפונקציות CreateVoice ו-GetVoice כשהערך של type הוא prompted. הוא לא מאוכלס בתשובות של הפונקציה ListVoices, וגם לא בקולות מסוג replicated או prebuilt.
שדות
חובה. הבייטים הגולמיים של האודיו.
חובה. סוג ה-MIME של נתוני האודיו לפי IANA (לדוגמה, `audio/wav` או `audio/mpeg`).
type VoiceType (אופציונלי)
חובה. סוג הקול. ב-`CreateVoice`, הערך חייב להיות `"replicated"` או `"prompted"`. בתגובות של `ListVoices`, יכול להיות גם הערך `"prebuilt"`.
ערכים אפשריים
-
replicatedקול בהתאמה אישית שנוצר משכפול של דגימת אודיו ושל הקלטה של הסכמת הדובר.
-
promptedקול בהתאמה אישית שנוצר מפרומפט טקסטואלי בשפה טבעית.
-
prebuiltקול מערכת מובנה מקטלוג הקולות של Google (לדוגמה, `Puck`, `Charon`). מוחזר בתשובות. אי אפשר לציין אותו כסוג ב-`CreateVoice`.
usage Usage (אופציונלי)
פלט בלבד. נתונים סטטיסטיים על השימוש באסימון עבור בקשת יצירת הקול. השדה הזה מאוכלס רק בתגובה של `CreateVoice` כשהערך של `type` הוא `"prompted"`; הוא לא מוגדר עבור `"replicated"` ובתגובות של `GetVoice` ו-`ListVoices`.
שדות
cached_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש בטוקנים במטמון לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
grounding_tool_count array (GroundingToolCount) (optional)
מספר כלי העיגון.
שדות
מספר כלי ההארקה.
סוג כלי ההארקה שמשויך לספירה.
ערכים אפשריים:
-
google_searchעיגון באמצעות חיפוש אינטרנט של Google וחיפוש תמונות, ועיגון באינטרנט לארגונים.
-
google_mapsעיגון בעזרת מפות Google.
input_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימוני קלט לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
output_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימוני פלט לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
tool_use_tokens_by_modality array (ModalityTokens) (optional)
פירוט של השימוש באסימונים של כלי לפי אופן השימוש.
שדות
modality ResponseModality (אופציונלי)
האופן שבו משתמשים בכמות טוקנים.
ערכים אפשריים
-
textמציין שהמודל צריך להחזיר טקסט.
-
imageמציין שהמודל צריך להחזיר תמונות.
-
audioמציין שהמודל צריך להחזיר אודיו.
-
videoמציין שהמודל צריך להחזיר סרטון.
-
documentמציין שהמודל צריך להחזיר מסמכים.
מספר הטוקנים של האופן.
מספר הטוקנים בחלק המאוחסן במטמון של ההנחיה (התוכן שנשמר במטמון).
מספר הטוקנים בהנחיה (בהקשר).
המספר הכולל של טוקנים בכל התשובות שנוצרו.
מספר הטוקנים של המחשבות של מודלים חושבים.
המספר הכולל של הטוקנים בבקשת האינטראקציה (הנחיה + תגובות + טוקנים פנימיים אחרים).
מספר הטוקנים שמופיעים בהנחיות לשימוש בכלים.