Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) הוא מודל מהיר וחסכוני של Google להמרת טקסט לדיבור, שנועד להחליף את gemini-3.1-flash-tts-preview בעומסי עבודה של ייצור עם תפוקה גבוהה.
סקירה כללית ויכולות
Gemini 3.8 Flash-Lite TTS משלב בין זמן אחזור נמוך לבין דיבור טבעי ובעל הבעה:
- יעילות גבוהה של תפוקה: מותאם לייצור בכמות גדולה, למפל של סוכני קוליים לשיחה, לתכונות של קריאה בקול רם וליצירת דיבור של דובר יחיד בשפות עיקריות.
- תאימות סכמה מושלמת: יש לו את אותה סכמת API ואת אותו פורמט של הנחיות מובנות כמו
gemini-3.8-flash-tts, כך שאפשר להחליף מודלים באמצעות שינוי של פרמטר אחד. - תמיכה מלאה במערכת אקולוגית של קולות: תמיכה בקולות מוכנים מראש, בספריית הקולות המורחבת (
GET /v1beta/voices), בפרסונות של עיצוב קול בהתאמה אישית ובשכפול קול (קולות שנשמרים כברירת מחדל, בתוספת מפתחות אופציונליים ללא שמירת מצב). אתם יכולים גם לעצב ולשכפל קולות באופן אינטראקטיבי ב-Google AI Studio.
במדריך המרת טקסט לדיבור יש מידע מפורט על התכונות, שיטות מומלצות לכתיבת הנחיות ודוגמאות קוד.
מתי כדאי להשתמש באיזה מודל TTS
לשני מודלי ה-TTS של Gemini 3.8 יש את אותה סכימת API ואותו מבנה של הנחיות. בוחרים את המודל שמתאים לעומס העבודה:
| תכונה / עומס עבודה | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| חוזק ראשי | תפוקה גבוהה, זמן אחזור נמוך ועלות-תועלת | איכות קול מקסימלית, ניואנסים במשחק וכיסוי של ניבים שונים |
| תרחישי שימוש מומלצים | הפקה בכמות גדולה, סוכני קולות מדורגים בזמן אמת, תכונות של קריאה בקול רם, רפליקציה של קולות, יצירה יומיומית של קולות של דובר יחיד | ספרי אודיו, קריינות באולפן, דיאלוג מורכב בין כמה דוברים, משחק עם פרצי קול חזקים, הגייה מסובכת, ניבים אזוריים |
| שפות נתמכות | 101 שפות | 130 שפות |
| מומלץ להחליף את | gemini-3.1-flash-tts-preview |
רמת קריאייטיב חדשה ומובילה |
מדריך להעברת נתונים (מיגרציה)
אם אתם משדרגים מ-gemini-3.1-flash-tts-preview ל-gemini-3.8-flash-lite-tts, אתם צריכים לעדכן את הבקשות שלכם לסכימת Gemini 3.8 TTS:
- העברת הוראות ברמת הפנייה ל-
speech_metadata: Gemini 3.8 TTS מתייחס לטקסט הקלט כאל תמליל מילולי בלבד. יכול להיות שהוראות טקסט מוטבעות כמו"Say cheerfully: Hello!"או"Speaker 1: Hello!"יוקראו בקול. העברת הוראות להפצה מתמשכת (style) ותוויות לזיהוי דוברים (speaker) למטא-נתונים מובְנים:- Interactions API: מצרפים הערה עם
"type": "speech_metadata","speaker"ו-"style"לכל בלוק של תוכן טקסט. - GenerateContent API: מצרפים את
"speech_metadata": {"speaker": "...", "style": "..."}לכלpart.
- Interactions API: מצרפים הערה עם
- משתמשים בתגי שורה עם סוגריים זוויתיים רק לאירועים קוליים בנקודת זמן מסוימת: משתמשים בסוגריים זוויתיים (כמו
<laugh>,<sigh>,<cough>,<breath>או<short pause>) כדי לציין בתוך התמליל הפסקות וקולות רגעיים שאינם דיבור. משתמשים בסוגריים זוויתייםspeech_metadata.styleכדי לציין סגנונות דיבור כמו לחישה. - ציון
speakerבכל תור בבקשות עם כמה דוברים: כל תור בבקשה עם כמה דוברים חייב לכלול באופן מפורש אתspeakerבתוךspeech_metadataשתואם לאחד מהדוברים שהוגדרו. - עיצוב פרסונות מראש באמצעות עיצוב קול: מחליפים בלוקים ארוכים של פרופיל אודיו או הערות של במאי בקול מותאם אישית שנוצר בעיצוב קול, ואז מעבירים את מזהה
voice_...הזה דרך בקשות ה-TTS עם מחרוזותstyleמינימליות או ריקות. - הסבר על פלט WAV (
audio/wav) שמוגדר כברירת מחדל בבקשות unary: בניגוד למודלים של TTS מגרסהgemini-3.1-flash-tts-previewומגרסאות קודמות (שבהם הוחזר PCM גולמי ללא כותרתaudio/l16כברירת מחדל), מודל Gemini 3.8 TTS מחזיר אודיו בפורמט WAV (audio/wav/AUDIO_WAV) עם כותרת RIFF רגילה כברירת מחדל לבקשות unary.- אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול
waveשל Python אוffmpeg), צריך להסיר את העטיפה הידנית של הכותרת ולכתוב את הבייטים שהוחזרו ישירות לקובץ.wav. - אם צינור עיבוד הנתונים שלכם דורש אודיו בפורמט PCM, mu-law או A-law ללא כותרת, צריך להגדיר במפורש את
response_format.mime_typeל-"audio/l16","audio/mulaw"או"audio/alaw"(לדוגמה,{"response_format": {"type": "audio", "mime_type": "audio/l16"}}ב-Interactions API, אוAUDIO_L16,AUDIO_MULAWאוAUDIO_ALAWב-generateContent). מידע נוסף זמין במאמר בנושא פורמטים של פלט אודיו.
- אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול
gemini-3.8-flash-lite-tts
| נכס | תיאור |
|---|---|
| קוד המודל | gemini-3.8-flash-lite-tts |
| סוגי נתונים נתמכים |
הנחיות טקסט פלט אודיו |
| מגבלות על טוקנים[*] |
מגבלת טוקנים של קלט 8,192 Output token limit 16,384 (מגבלת השירות של Gemini API) |
| יכולות | נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך לא נתמך |
| אפשרויות צריכה |
נתמך נתמך נתמך |
| גרסאות |
|
| העדכון האחרון | ספטמבר 2026 |
שפות נתמכות
gemini-3.8-flash-lite-tts מזהה את שפת הקלט באופן אוטומטי ותומך ביותר מ-100 שפות:
| שפה | שפה | שפה |
|---|---|---|
| אצ'ה (כתב ערבי) | גרמנית | מניפורית |
| אפריקאנס | יוונית | מראטהית |
| אקאן | גוג'ראטי | מיננגקבאו (כתב ערבי) |
| אמהרית | קריאולית האיטית | מיזו |
| ארמנית | מונגולית חלחה | נפאלית (שפה נפרדת) |
| אסאמית | האוסה | פולפולדה ניגרי |
| עוואדי | עברית | צפון אזרית |
| באלינזית | הינדי | סוטו צפונית |
| בנגלית | הונגרית | צפון אוזבקי |
| בנג'אר (כתב לטיני) | איסלנדית | נורבגית ספרותית |
| בסקית | אילוקו | נורווגית (Nynorsk) |
| בלארוסית | אינדונזית | ניאנג'ה |
| בוג'פורי | פרסית איראנית | אודייה (שפה נפרדת) |
| בוסנית | איטלקית | פרסית (אפגניסטן) |
| בוגינזית | יפנית | פולנית |
| בולגרית | ג'אווה | פורטוגזית |
| קנטונזית | קאמבה | פנג'אבי |
| קטלאנית | קנאדה | רומנית |
| סבואנו | קשמירית (כתב ערבי) | רוסית |
| כורדית מרכזית | קשמירית (כתב דווה) | סנטלי |
| צ'אטיסגארי | קזחית | סרבית |
| סינית (כתב האן) | חמרית | סינהאלה |
| סינית (כתב האן) | קיקויו | סלובקית |
| קרואטית | קינירואנדה | אזרית דרומית |
| צ'כית | קונגו | פאשטו דרומית |
| דנית | קוריאנית | ספרדית |
| הולנדית | קירגיזית | ערבית רגילה (כתב ערבי) |
| ערבית מצרית | לאו | ערבית רגילה (תסריט Latn) |
| אנגלית | לינגלה | לטבית רגילה |
| אסטונית | מקדונית | מלאית תקנית |
| פיליפינית | מגאהי | טמילית |
| צרפתית | מאיטילית | טלוגו |
| גליציאנית | מליאלאם | טורקית |
| גאנדה | מלטית | וייטנאמית |
| גאורגית | — | — |