Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) הוא מודל מהיר וחסכוני של Google להמרת טקסט לדיבור, שנועד להחליף את gemini-3.1-flash-tts-preview בעומסי עבודה של ייצור עם תפוקה גבוהה.
סקירה כללית ויכולות
Gemini 3.8 Flash-Lite TTS משלב בין זמן אחזור נמוך לבין דיבור טבעי ובעל הבעה:
- יעילות גבוהה של תפוקה: מותאם לייצור בכמות גדולה, למפלי סוכני קוליים לשיחה, לתכונות של קריאה בקול רם וליצירת דיבור של דובר יחיד בשפות מרכזיות.
- תאימות סכמה מיידית: ל-
gemini-3.8-flash-ttsיש את אותה סכמת API ואותו פורמט של הנחיות מובנות כמו, כך שאפשר להחליף מודלים באמצעות שינוי של פרמטר אחד. - תמיכה מלאה במערכת אקולוגית של קולות: תמיכה בקולות מוכנים מראש, בספריית הקולות המורחבת (
GET /v1beta/voices), בפרסונות של עיצוב קול בהתאמה אישית ובשכפול קול (קולות שנשמרים כברירת מחדל, בתוספת מפתחות אופציונליים ללא שמירת מצב). אתם יכולים גם לעצב ולשכפל קולות באופן אינטראקטיבי ב-Google AI Studio.
במדריך המרת טקסט לדיבור יש מידע מפורט על התכונות, שיטות מומלצות לכתיבת הנחיות ודוגמאות קוד.
מתי כדאי להשתמש באיזה מודל TTS
לשני מודלי ה-TTS של Gemini 3.8 יש את אותה סכימת API ואותו מבנה של הנחיות. בוחרים את המודל שמתאים לעומס העבודה:
| תכונה / עומס עבודה | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| חוזק ראשי | תפוקה גבוהה, זמן אחזור נמוך ועלות-תועלת | איכות קול מקסימלית, ניואנסים במשחק וכיסוי של ניבים שונים |
| תרחישי שימוש מומלצים | הפקה בכמות גדולה, סוכני קול בזמן אמת, תכונות של קריאה בקול רם, רפליקציה של קולות, יצירה של קולות של דוברים יחידים לשימוש יומיומי | ספרי אודיו, קריינות באולפן, דיאלוג מורכב של כמה דוברים, משחק עם פרצי קול חזקים, הגייה קשה, ניבים אזוריים |
| שפות נתמכות | 101 שפות | 130 שפות |
| מומלץ להחליף את | gemini-3.1-flash-tts-preview |
רמת קריאייטיב חדשה ומובילה |
מדריך להעברת נתונים (מיגרציה)
אם אתם משדרגים מ-gemini-3.1-flash-tts-preview ל-gemini-3.8-flash-lite-tts, אתם צריכים לעדכן את הבקשות שלכם לסכימת ה-TTS של Gemini 3.8:
- העברת הוראות ברמת הפנייה אל
speech_metadata: ב-Gemini 3.8 TTS, טקסט הקלט נחשב לתמליל מילולי בלבד. יכול להיות שהוראות טקסט מוטמעות כמו"Say cheerfully: Hello!"או"Speaker 1: Hello!"יוקראו בקול. העברת הוראות להפצה מתמשכת (style) ותוויות לזיהוי דוברים (speaker) למטא-נתונים מובנים:- Interactions API: מצרפים הערה עם
"type": "speech_metadata","speaker"ו-"style"לכל בלוק של תוכן טקסט. - GenerateContent API: מצרפים את
"speech_metadata": {"speaker": "...", "style": "..."}לכלpart.
- Interactions API: מצרפים הערה עם
- משתמשים בתגי שורה עם סוגריים זוויתיים רק לאירועים קוליים בנקודת זמן מסוימת: שומרים על קולות רגעיים שאינם דיבור והפסקות בשורה בתמליל באמצעות סוגריים זוויתיים (כמו
<laugh>,<sigh>,<cough>,<breath>או<short pause>). סגנונות דיבור כמו לחישה מופיעים בתוךspeech_metadata.style. - צריך לציין
speakerבכל תור בבקשות עם כמה דוברים: בכל תור בבקשה עם כמה דוברים צריך לציין במפורש אתspeakerבתוךspeech_metadataשמתאים לאחד מהדוברים שהוגדרו. - עיצוב פרסונות מראש באמצעות עיצוב קול: מחליפים בלוקים ארוכים של פרופיל אודיו או הערות של במאי בקול מותאם אישית שנוצר בעיצוב קול, ואז מעבירים את מזהה
voice_...הזה בבקשות ה-TTS עם מחרוזותstyleמינימליות או ריקות. - חשבון עבור פלט WAV (
audio/wav) שמוגדר כברירת מחדל בבקשות unary: בניגוד למודלים של TTS מגרסהgemini-3.1-flash-tts-previewומגרסאות קודמות (שבהם הוחזר PCM גולמי ללא כותרתaudio/l16כברירת מחדל), מודל Gemini 3.8 TTS מחזיר אודיו בפורמט WAV (audio/wav/AUDIO_WAV) עם כותרת RIFF רגילה כברירת מחדל לבקשות unary.- אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול
waveשל Python אוffmpeg), צריך להסיר את העטיפה הידנית של הכותרת ולכתוב את הבייטים שהוחזרו ישירות לקובץ.wav. - אם צינור עיבוד הנתונים שלכם דורש אודיו PCM, mu-law או A-law גולמי ללא כותרת, צריך להגדיר במפורש את
response_formatל-"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") או"audio/alaw"("AUDIO_ALAW"). מידע נוסף זמין במאמר בנושא פורמטים של פלט אודיו.
- אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול
gemini-3.8-flash-lite-tts
| נכס | תיאור |
|---|---|
| קוד המודל | gemini-3.8-flash-lite-tts |
| סוגי נתונים נתמכים |
קלטים טקסט פלט אודיו |
| מגבלות על טוקנים[*] |
מגבלת טוקנים של קלט 8,192 מגבלת טוקנים של פלט 16,384 |
| יכולות | נתמך נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך |
| אפשרויות צריכה |
נתמך נתמך נתמך |
| גרסאות |
|
| העדכון האחרון | יולי 2026 |
שפות נתמכות
gemini-3.8-flash-lite-tts מזהה אוטומטית את שפת הקלט ותומך ב101 שפות:
| שפה | שפה | שפה |
|---|---|---|
| אצ'ה (כתב ערבי) | גאורגית | מלטית |
| אפריקאנס | גרמנית | מניפורית |
| אקאן | יוונית | מראטהית |
| אמהרית | גוג'ראטי | מיננגקבאו (כתב ערבי) |
| ארמנית | קריאולית האיטית | מיזו |
| אסאמית | מונגולית חלחה | נפאלית (שפה ספציפית) |
| עוואדי | האוסה | פולפולדה ניגרית |
| באלינזית | עברית | צפון אזרית |
| בנגלית | הינדי | סוטו צפונית |
| בנג'אר (כתב לטיני) | הונגרית | אוזבקית צפונית |
| בסקית | איסלנדית | נורבגית ספרותית |
| בלארוסית | אילוקו | נורווגית (Nynorsk) |
| בוג'פורי | אינדונזית | ניאנג'ה |
| בוסנית | פרסית איראנית | אורייה (שפה נפרדת) |
| בוגינזית | איטלקית | פרסית (אפגניסטן) |
| בולגרית | יפנית | פולנית |
| קנטונזית | ג'אווה | פורטוגזית |
| קטלאנית | קאמבה | פנג'אבי |
| סבואנו | קנאדה | רומנית |
| כורדית מרכזית | קשמירית (כתב ערבי) | רוסית |
| צ'אטיסגארי | קשמירית (כתב דוונאגרי) | סנטלי |
| סינית (כתב האן) | קזחית | סרבית |
| סינית (כתב האנט) | חמרית | סינהאלה |
| קרואטית | קיקויו | סלובקית |
| צ'כית | קינירואנדה | אזרית דרומית |
| דנית | קונגו | פאשטו דרומית |
| הולנדית | קוריאנית | ספרדית |
| ערבית מצרית | קירגיזית | ערבית רגילה (כתב ערבי) |
| אנגלית | לאו | ערבית רגילה (תסריט Latn) |
| אסטונית | לינגלה | לטבית רגילה |
| פיליפינית | מקדונית | מלאית תקנית |
| צרפתית | מגאהי | טמילית |
| גליציאנית | מאיטילית | טלוגו |
| גאנדה | מליאלאם | — |