Gemini 3.8 Flash-Lite TTS

‫Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) הוא מודל מהיר וחסכוני של Google להמרת טקסט לדיבור, שנועד להחליף את gemini-3.1-flash-tts-preview בעומסי עבודה של ייצור עם תפוקה גבוהה.

סקירה כללית ויכולות

‫Gemini 3.8 Flash-Lite TTS משלב בין זמן אחזור נמוך לבין דיבור טבעי ובעל הבעה:

  • יעילות גבוהה של תפוקה: מותאם לייצור בכמות גדולה, למפל של סוכני קוליים לשיחה, לתכונות של קריאה בקול רם וליצירת דיבור של דובר יחיד בשפות עיקריות.
  • תאימות סכמה מושלמת: יש לו את אותה סכמת API ואת אותו פורמט של הנחיות מובנות כמו gemini-3.8-flash-tts, כך שאפשר להחליף מודלים באמצעות שינוי של פרמטר אחד.
  • תמיכה מלאה במערכת אקולוגית של קולות: תמיכה בקולות מוכנים מראש, בספריית הקולות המורחבת (GET /v1beta/voices), בפרסונות של עיצוב קול בהתאמה אישית ובשכפול קול (קולות שנשמרים כברירת מחדל, בתוספת מפתחות אופציונליים ללא שמירת מצב). אתם יכולים גם לעצב ולשכפל קולות באופן אינטראקטיבי ב-Google AI Studio.

במדריך המרת טקסט לדיבור יש מידע מפורט על התכונות, שיטות מומלצות לכתיבת הנחיות ודוגמאות קוד.

מתי כדאי להשתמש באיזה מודל TTS

לשני מודלי ה-TTS של Gemini 3.8 יש את אותה סכימת API ואותו מבנה של הנחיות. בוחרים את המודל שמתאים לעומס העבודה:

תכונה / עומס עבודה Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) Gemini 3.8 Flash TTS (gemini-3.8-flash-tts)
חוזק ראשי תפוקה גבוהה, זמן אחזור נמוך ועלות-תועלת איכות קול מקסימלית, ניואנסים במשחק וכיסוי של ניבים שונים
תרחישי שימוש מומלצים הפקה בכמות גדולה, סוכני קולות מדורגים בזמן אמת, תכונות של קריאה בקול רם, רפליקציה של קולות, יצירה יומיומית של קולות של דובר יחיד ספרי אודיו, קריינות באולפן, דיאלוג מורכב בין כמה דוברים, משחק עם פרצי קול חזקים, הגייה מסובכת, ניבים אזוריים
שפות נתמכות ‫101 שפות ‫130 שפות
מומלץ להחליף את gemini-3.1-flash-tts-preview רמת קריאייטיב חדשה ומובילה

מדריך להעברת נתונים (מיגרציה)

אם אתם משדרגים מ-gemini-3.1-flash-tts-preview ל-gemini-3.8-flash-lite-tts, אתם צריכים לעדכן את הבקשות שלכם לסכימת Gemini 3.8 TTS:

  1. העברת הוראות ברמת הפנייה ל-speech_metadata: Gemini 3.8 TTS מתייחס לטקסט הקלט כאל תמליל מילולי בלבד. יכול להיות שהוראות טקסט מוטבעות כמו "Say cheerfully: Hello!" או "Speaker 1: Hello!" יוקראו בקול. העברת הוראות להפצה מתמשכת (style) ותוויות לזיהוי דוברים (speaker) למטא-נתונים מובְנים:
    • ‫Interactions API: מצרפים הערה עם "type": "speech_metadata",‏ "speaker" ו-"style" לכל בלוק של תוכן טקסט.
    • ‫GenerateContent API: מצרפים את "speech_metadata": {"speaker": "...", "style": "..."} לכל part.
  2. משתמשים בתגי שורה עם סוגריים זוויתיים רק לאירועים קוליים בנקודת זמן מסוימת: משתמשים בסוגריים זוויתיים (כמו <laugh>, <sigh>, <cough>, <breath> או <short pause>) כדי לציין בתוך התמליל הפסקות וקולות רגעיים שאינם דיבור. משתמשים בסוגריים זוויתיים speech_metadata.style כדי לציין סגנונות דיבור כמו לחישה.
  3. ציון speaker בכל תור בבקשות עם כמה דוברים: כל תור בבקשה עם כמה דוברים חייב לכלול באופן מפורש את speaker בתוך speech_metadata שתואם לאחד מהדוברים שהוגדרו.
  4. עיצוב פרסונות מראש באמצעות עיצוב קול: מחליפים בלוקים ארוכים של פרופיל אודיו או הערות של במאי בקול מותאם אישית שנוצר בעיצוב קול, ואז מעבירים את מזהה voice_... הזה דרך בקשות ה-TTS עם מחרוזות style מינימליות או ריקות.
  5. הסבר על פלט WAV (audio/wav) שמוגדר כברירת מחדל בבקשות unary: בניגוד למודלים של TTS מגרסה gemini-3.1-flash-tts-preview ומגרסאות קודמות (שבהם הוחזר PCM גולמי ללא כותרת audio/l16 כברירת מחדל), מודל Gemini 3.8 TTS מחזיר אודיו בפורמט WAV ‏(audio/wav / AUDIO_WAV) עם כותרת RIFF רגילה כברירת מחדל לבקשות unary.
    • אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול wave של Python או ffmpeg), צריך להסיר את העטיפה הידנית של הכותרת ולכתוב את הבייטים שהוחזרו ישירות לקובץ .wav.
    • אם צינור עיבוד הנתונים שלכם דורש אודיו בפורמט PCM,‏ mu-law או A-law ללא כותרת, צריך להגדיר במפורש את response_format.mime_type ל-"audio/l16",‏ "audio/mulaw" או "audio/alaw" (לדוגמה, {"response_format": {"type": "audio", "mime_type": "audio/l16"}} ב-Interactions API, או AUDIO_L16,‏ AUDIO_MULAW או AUDIO_ALAW ב-generateContent). מידע נוסף זמין במאמר בנושא פורמטים של פלט אודיו.

gemini-3.8-flash-lite-tts

נכס תיאור
קוד המודל gemini-3.8-flash-lite-tts
סוגי נתונים נתמכים

הנחיות

טקסט

פלט

אודיו

‫מגבלות על טוקנים[*]

מגבלת טוקנים של קלט

‫8,192

Output token limit

‫16,384 (מגבלת השירות של Gemini API)

יכולות

יצירת אודיו

נתמך

שמירת נתונים במטמון

לא נתמך

הרצת קוד

לא נתמך

חיפוש קבצים

לא נתמך

בקשה להפעלת פונקציה

לא נתמך

עיגון בעזרת מפות Google

לא נתמך

יצירת תמונות

לא נתמך

‫Live API

לא נתמך

חיפוש עם עיגון בנתונים

לא נתמך

פלטים מובנים

לא נתמך

תהליך החשיבה

לא נתמך

הקשר של כתובת ה-URL

לא נתמך

אפשרויות צריכה

‫Batch API

נתמך

היקש ברמת Flex

נתמך

הסקת עדיפות

נתמך

גרסאות
פרטים נוספים זמינים במאמר בנושא דפוסי גרסאות של מודלים.
  • gemini-3.8-flash-lite-tts
העדכון האחרון ספטמבר 2026

שפות נתמכות

‫gemini-3.8-flash-lite-tts מזהה את שפת הקלט באופן אוטומטי ותומך ביותר מ-100 שפות:

שפה שפה שפה
אצ'ה (כתב ערבי) גרמנית מניפורית
אפריקאנס יוונית מראטהית
אקאן גוג'ראטי מיננגקבאו (כתב ערבי)
אמהרית קריאולית האיטית מיזו
ארמנית מונגולית חלחה נפאלית (שפה נפרדת)
אסאמית האוסה פולפולדה ניגרי
עוואדי עברית צפון אזרית
באלינזית הינדי סוטו צפונית
בנגלית הונגרית צפון אוזבקי
בנג'אר (כתב לטיני) איסלנדית ‏נורבגית ספרותית
בסקית אילוקו נורווגית (Nynorsk)
בלארוסית אינדונזית ניאנג'ה
בוג'פורי פרסית איראנית אודייה (שפה נפרדת)
בוסנית איטלקית פרסית (אפגניסטן)
בוגינזית יפנית פולנית
בולגרית ג'אווה פורטוגזית
קנטונזית קאמבה פנג'אבי
קטלאנית קנאדה רומנית
סבואנו קשמירית (כתב ערבי) רוסית
כורדית מרכזית קשמירית (כתב דווה) סנטלי
צ'אטיסגארי קזחית סרבית
סינית (כתב האן) חמרית סינהאלה
סינית (כתב האן) קיקויו סלובקית
קרואטית קינירואנדה אזרית דרומית
צ'כית קונגו פאשטו דרומית
דנית קוריאנית ספרדית
הולנדית קירגיזית ערבית רגילה (כתב ערבי)
ערבית מצרית לאו ערבית רגילה (תסריט Latn)
אנגלית לינגלה לטבית רגילה
אסטונית מקדונית מלאית תקנית
פיליפינית מגאהי טמילית
צרפתית מאיטילית טלוגו
גליציאנית מליאלאם טורקית
גאנדה מלטית וייטנאמית
גאורגית — —