Gemini 3.8 Flash TTS

‫Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) הוא מודל הדגל של Google ליצירת דיבור מתוך טקסט, שפותח במיוחד כדי ליצור דיבור באיכות גבוהה כמו באולפן, עם הבעה, מבטאים אזוריים אותנטיים ויציבות גבוהה בשיחות רב-שלביות ארוכות.

סקירה כללית ויכולות

‫Gemini 3.8 Flash TTS קובע סטנדרט חדש ליצירת אודיו עם הבעה:

  • נאמנות אקוסטית גבוהה וניואנסים במשחק: מפיק מגוון רגשי עשיר, קצב טבעי והקפדה מדויקת על הוראות ברמת התור styleועל אירועים קוליים מוטבעים (<laugh>, <sigh>, <short pause>).
  • יציבות בשיחות ארוכות רב-שלביות: שמירה על זהות קולית עקבית, גוון קול, עוצמת קול וטון אקוסטי של החדר לאורך דיאלוגים ארוכים וקריינות של כמה דקות, בלי שהקול ישתנה.
  • מבטא והגייה אזוריים אותנטיים: תמיכה במבטאים אזוריים ובניבים של מיעוטים.
  • תמיכה מלאה במערכת אקולוגית של קולות: פועל בצורה חלקה עם קולות מוכנים מראש, עם ספריית הקולות המורחבת (GET /v1beta/voices), עם פרסונות של עיצוב קול בהתאמה אישית ועם שכפול קול (קולות מאוחסנים קבועים כברירת מחדל, בנוסף למפתחות אופציונליים ללא שמירת מצב). אתם יכולים גם לעצב ולשכפל קולות באופן אינטראקטיבי ב-Google AI Studio.

במדריך המרת טקסט לדיבור יש מידע מפורט על התכונות, שיטות מומלצות לכתיבת הנחיות ודוגמאות קוד.

מתי כדאי להשתמש באיזה מודל TTS

לשני מודלי ה-TTS של Gemini 3.8 יש את אותה סכימת API ואותו מבנה של הנחיות. בוחרים את המודל שמתאים לעומס העבודה:

תכונה / עומס עבודה Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
חוזק ראשי איכות קול מקסימלית, ניואנסים במשחק וכיסוי של ניבים שונים תפוקה גבוהה, זמן אחזור נמוך ועלות-תועלת
תרחישי שימוש מומלצים ספרי אודיו, קריינות באולפן, דיאלוג מורכב של כמה דוברים, משחק עם פרצי קול חזקים, הגייה קשה, ניבים אזוריים הפקה בכמות גדולה, סוכני קול בזמן אמת, תכונות של קריאה בקול רם, רפליקציה של קולות, יצירה של קולות של דוברים יחידים לשימוש יומיומי
שפות נתמכות ‫130 שפות ‫101 שפות
מומלץ להחליף את רמת קריאייטיב חדשה ומובילה gemini-3.1-flash-tts-preview

מדריך להעברת נתונים (מיגרציה)

אם אתם מבצעים מיגרציה מגרסה gemini-3.1-flash-tts-preview או מגרסאות קודמות של מודלים של Gemini TTS, אתם צריכים לעדכן את הבקשות שלכם לסכימת Gemini 3.8 TTS:

  1. העברת הוראות ברמת הפנייה אל speech_metadata: ב-Gemini 3.8 TTS, טקסט הקלט נחשב לתמליל מילולי בלבד. יכול להיות שהוראות טקסט מוטמעות כמו "Say cheerfully: Hello!" או "Speaker 1: Hello!" יוקראו בקול. העברת הוראות להפצה מתמשכת (style) ותוויות לזיהוי דוברים (speaker) למטא-נתונים מובנים:
    • ‫Interactions API: מצרפים הערה עם "type": "speech_metadata",‏ "speaker" ו-"style" לכל בלוק של תוכן טקסט.
    • ‫GenerateContent API: מצרפים את "speech_metadata": {"speaker": "...", "style": "..."} לכל part.
  2. משתמשים בתגי שורה עם סוגריים זוויתיים רק לאירועים קוליים בנקודת זמן מסוימת: שומרים על קולות רגעיים שאינם דיבור והפסקות בשורה בתמליל באמצעות סוגריים זוויתיים (כמו <laugh>, <sigh>, <cough>, <breath> או <short pause>). סגנונות דיבור כמו לחישה מופיעים בתוך speech_metadata.style.
  3. צריך לציין speaker בכל תור בבקשות עם כמה דוברים: בכל תור בבקשה עם כמה דוברים צריך לציין במפורש את speaker בתוך speech_metadata שמתאים לאחד מהדוברים שהוגדרו.
  4. עיצוב פרסונות מראש באמצעות עיצוב קול: מחליפים בלוקים ארוכים של פרופיל אודיו או הערות של במאי בקול מותאם אישית שנוצר בעיצוב קול, ואז מעבירים את מזהה voice_... הזה בבקשות ה-TTS עם מחרוזות style מינימליות או ריקות.
  5. חשבון עבור פלט WAV (audio/wav) שמוגדר כברירת מחדל בבקשות unary: בניגוד למודלים של TTS מגרסה gemini-3.1-flash-tts-preview ומגרסאות קודמות (שבהם הוחזר PCM גולמי ללא כותרת audio/l16 כברירת מחדל), מודל Gemini 3.8 TTS מחזיר אודיו בפורמט WAV (audio/wav / AUDIO_WAV) עם כותרת RIFF רגילה כברירת מחדל לבקשות unary.
    • אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול wave של Python או ffmpeg), צריך להסיר את העטיפה הידנית של הכותרת ולכתוב את הבייטים שהוחזרו ישירות לקובץ .wav.
    • אם צינור עיבוד הנתונים שלכם דורש אודיו PCM,‏ mu-law או A-law גולמי ללא כותרת, צריך להגדיר במפורש את response_format ל-"audio/l16" ("AUDIO_L16"),‏ "audio/mulaw" ("AUDIO_MULAW") או "audio/alaw" ("AUDIO_ALAW"). מידע נוסף זמין במאמר בנושא פורמטים של פלט אודיו.

gemini-3.8-flash-tts

נכס תיאור
קוד המודל gemini-3.8-flash-tts
סוגי נתונים נתמכים

קלטים

טקסט

פלט

אודיו

‫מגבלות על טוקנים[*]

מגבלת טוקנים של קלט

‫8,192

Output token limit

‫16,384 (מגבלת השירות של Gemini API)

יכולות

יצירת אודיו

נתמך

שמירת נתונים במטמון

נתמך

הרצת קוד

לא נתמך

חיפוש קבצים

לא נתמך

בקשה להפעלת פונקציה

לא נתמך

עיגון בעזרת מפות Google

לא נתמך

יצירת תמונות

לא נתמך

‫Live API

לא נתמך

חיפוש עם עיגון בנתונים

לא נתמך

פלטים מובנים

לא נתמך

תהליך החשיבה

לא נתמך

הקשר של כתובת ה-URL

לא נתמך

אפשרויות צריכה

‫Batch API

נתמך

היקש ברמת Flex

נתמך

הסקת עדיפות

נתמך

גרסאות
פרטים נוספים זמינים במאמר בנושא תבניות של גרסאות מודלים.
  • gemini-3.8-flash-tts
העדכון האחרון ספטמבר 2026

שפות נתמכות

‫gemini-3.8-flash-tts מזהה את שפת הקלט באופן אוטומטי ותומך ביותר מ-130 שפות:

שפה שפה שפה
אצ'ה (כתב ערבי) יוונית נפאלית (שפה ספציפית)
אפריקאנס גוארני פולפולדה ניגרית
אקאן גוג'ראטי צפון אזרית
אמהרית קריאולית האיטית סוטו צפונית
ארמנית מונגולית חלחה אוזבקית צפונית
אסאמית האוסה ‏נורבגית ספרותית
עוואדי עברית נורווגית (Nynorsk)
באלינזית הינדי ניאנג'ה
בנגלית הונגרית אוקסיטנית
בנג'אר (כתב ערבי) איסלנדית אורייה (שפה נפרדת)
בנג'אר (כתב לטיני) איגבו פנגסינאן
בשקירית אילוקו פרסית (אפגניסטן)
בסקית אינדונזית פולנית
בלארוסית פרסית איראנית פורטוגזית
במבה איטלקית פנג'אבי
בוג'פורי יפנית רומנית
בוסנית ג'אווה רוסית
בוגינזית קביל סנטלי
בולגרית קאמבה סרבית
בורמזית קנאדה סינדהית
קנטונזית קשמירית (כתב ערבי) סינהאלה
קטלאנית קשמירית (כתב דוונאגרי) סלובקית
סבואנו קזחית סלובנית
כורדית מרכזית חמרית סומלית
צ'אטיסגארי קיקויו אזרית דרומית
סינית (כתב האן) קינירואנדה פאשטו דרומית
סינית (כתב האנט) קונגו ססוטו
טטארית של חצי האי קרים קוריאנית ספרדית
קרואטית קירגיזית ערבית רגילה (כתב ערבי)
צ'כית לאו ערבית רגילה (תסריט Latn)
דנית לטגאלית לטבית רגילה
הולנדית לינגלה מלאית תקנית
דיולה ליטאית סוואהילי (שפה נפרדת)
דזונקה לוקסמבורגית סוואטי
ערבית מצרית מקדונית שוודית
אנגלית מגאהי טג'יקית
אסטונית מאיטילית טמילית
פיליפינית מליאלאם טלוגו
פינית מלטית תאית
צרפתית מניפורית תיגרינית
גליציאנית מראטהית אלבנית טוסק
גאנדה מיננגקבאו (כתב ערבי) טורקית
גאורגית מיננגקבאו (כתב לטיני) אויגור
גרמנית מיזו וייטנאמית