Gemini 3.8 Flash TTS

‫Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) הוא מודל הדגל של Google ליצירת דיבור מתוך טקסט, שפותח במיוחד כדי ליצור דיבור באיכות גבוהה כמו באולפן, עם הבעה, מבטאים אזוריים אותנטיים ויציבות גבוהה בשיחות רב-שלביות ארוכות.

סקירה כללית ויכולות

‫Gemini 3.8 Flash TTS קובע סטנדרט חדש ליצירת אודיו עם הבעה:

  • נאמנות אקוסטית גבוהה וניואנסים במשחק: מפיק מגוון רגשי עשיר, קצב טבעי והקפדה מדויקת על הוראות ברמת התור styleועל אירועים קוליים מוטבעים (<laugh>, <sigh>, <short pause>).
  • יציבות בשיחות ארוכות רב-שלביות: שמירה על זהות קולית עקבית, גוון קול, עוצמת קול וטון אקוסטי של החדר לאורך דיאלוגים ארוכים וקריינות של כמה דקות, בלי שהקול ישתנה.
  • מבטא והגייה אזוריים אותנטיים: תמיכה במבטאים אזוריים, בניבים של מיעוטים ובשינויים של האלפבית הפונטי הבינלאומי (IPA) בשורה.
  • תמיכה מלאה במערכת אקולוגית של קולות: פועל בצורה חלקה עם קולות מוכנים מראש, עם ספריית הקולות המורחבת (GET /v1beta/voices), עם פרסונות של עיצוב קול בהתאמה אישית ועם שכפול קול (קולות מאוחסנים קבועים כברירת מחדל, בנוסף למפתחות אופציונליים ללא שמירת מצב). אתם יכולים גם לעצב ולשכפל קולות באופן אינטראקטיבי ב-Google AI Studio.

במדריך המרת טקסט לדיבור יש מידע מפורט על התכונות, שיטות מומלצות לכתיבת הנחיות ודוגמאות קוד.

מתי כדאי להשתמש באיזה מודל TTS

לשני מודלי ה-TTS של Gemini 3.8 יש את אותה סכימת API ואותו מבנה של הנחיות. בוחרים את המודל שמתאים לעומס העבודה:

תכונה / עומס עבודה Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts)
חוזק ראשי איכות קול מקסימלית, ניואנסים במשחק וכיסוי של ניבים שונים תפוקה גבוהה, זמן אחזור נמוך ועלות-תועלת
תרחישי שימוש מומלצים ספרי אודיו, קריינות באולפן, דיאלוג מורכב של כמה דוברים, משחק עם פרצי קול חזקים, הגייה קשה, ניבים אזוריים הפקה בכמות גדולה, סוכני קול בזמן אמת, תכונות של קריאה בקול רם, רפליקציה של קולות, יצירה של קולות של דוברים יחידים לשימוש יומיומי
שפות נתמכות ‫130 שפות ‫101 שפות
מומלץ להחליף את רמת קריאייטיב חדשה ומובילה gemini-3.1-flash-tts-preview

מדריך להעברת נתונים (מיגרציה)

אם אתם מבצעים מיגרציה מגרסה gemini-3.1-flash-tts-preview או מגרסאות קודמות של מודלים של Gemini TTS, אתם צריכים לעדכן את הבקשות שלכם לסכימת Gemini 3.8 TTS:

  1. העברת הוראות ברמת הפנייה אל speech_metadata: ב-Gemini 3.8 TTS, טקסט הקלט נחשב לתמליל מילולי בלבד. הוראות טקסט מוטבעות כמו "Say cheerfully: Hello!" או "Speaker 1: Hello!" עשויות להיות מוקראות בקול. העברה של הוראות להצגת מודעות לאורך זמן (style) ותוויות לזיהוי דוברים (speaker) למטא-נתונים מובְנים:
    • Interactions API: מצרפים הערה עם "type": "speech_metadata",‏ "speaker" ו-"style" לכל בלוק של תוכן טקסט.
    • GenerateContent API: מצרפים את "speech_metadata": {"speaker": "...", "style": "..."} לכל part.
  2. משתמשים בתגי שורה עם סוגריים זוויתיים רק לאירועים קוליים בנקודת זמן מסוימת: משתמשים בסוגריים זוויתיים (כמו <laugh>, <sigh>, <cough>, <breath> או <short pause>) כדי לציין בתוך התמליל הפסקות וקולות רגעיים שאינם דיבור. משתמשים בסוגריים זוויתיים speech_metadata.style כדי לציין סגנונות דיבור כמו לחישה.
  3. צריך לציין speaker בכל תור בבקשות עם כמה דוברים: בכל תור בבקשה עם כמה דוברים צריך לציין במפורש את speaker בתוך speech_metadata שמתאים לאחד מהדוברים שהוגדרו.
  4. עיצוב פרסונות מראש באמצעות עיצוב קול: מחליפים בלוקים ארוכים של פרופיל אודיו או הערות של במאי בקול מותאם אישית שנוצר בעיצוב קול, ואז מעבירים את מזהה voice_... הזה דרך בקשות ה-TTS עם מחרוזות style מינימליות או ריקות.
  5. הסבר על פלט WAV (‏audio/wav) שמוגדר כברירת מחדל בבקשות unary: בניגוד למודלים של TTS מגרסה gemini-3.1-flash-tts-preview ומגרסאות קודמות (שבהם הוחזר PCM גולמי ללא כותרת audio/l16 כברירת מחדל), מודל Gemini 3.8 TTS מחזיר אודיו בפורמט WAV (‏audio/wav / AUDIO_WAV) עם כותרת RIFF רגילה כברירת מחדל לבקשות unary.
    • אם הקוד שלכם עטף בעבר בייטים של PCM גולמיים בכותרת WAV (לדוגמה, באמצעות מודול wave של Python או ffmpeg), צריך להסיר את העטיפה הידנית של הכותרת ולכתוב את הבייטים שהוחזרו ישירות לקובץ .wav.
    • אם צינור עיבוד הנתונים שלכם דורש אודיו PCM,‏ mu-law או A-law גולמי ללא כותרת, צריך להגדיר במפורש את response_format ל-"audio/l16" ("AUDIO_L16"),‏ "audio/mulaw" ("AUDIO_MULAW") או "audio/alaw" ("AUDIO_ALAW"). מידע נוסף זמין במאמר בנושא פורמטים של פלט אודיו.

gemini-3.8-flash-tts

נכס תיאור
קוד המודל gemini-3.8-flash-tts
סוגי נתונים נתמכים

קלטים

טקסט

פלט

אודיו

מגבלות על טוקנים[*]

מגבלת טוקנים של קלט

‫8,192

מגבלת טוקנים של פלט

16,384

יכולות

יצירת אודיו

נתמך

שמירת נתונים במטמון

נתמך

הרצת קוד

לא נתמך

חיפוש קבצים

לא נתמך

בקשה להפעלת פונקציה

לא נתמך

עיגון בעזרת מפות Google

לא נתמך

יצירת תמונות

לא נתמך

Live API

לא נתמך

חיפוש עם עיגון בנתונים

לא נתמך

פלטים מובנים

לא נתמך

תהליך החשיבה

לא נתמך

הקשר של כתובת ה-URL

לא נתמך

אפשרויות צריכה

Batch API

נתמך

היקש ברמת Flex

נתמך

הסקת עדיפות

נתמך

גרסאות
פרטים נוספים זמינים במאמר בנושא דפוסי גרסאות של מודלים.
  • gemini-3.8-flash-tts
העדכון האחרון יולי 2026

שפות נתמכות

gemini-3.8-flash-tts מזהה את שפת הקלט באופן אוטומטי ותומך ב-130 שפות:

שפה שפה שפה
אצ'ה (כתב ערבי) יוונית נפאלית (שפה ספציפית)
אפריקאנס גוארני פולפולדה ניגרית
אקאן גוג'ראטי צפון אזרית
אמהרית קריאולית האיטית סוטו צפונית
ארמנית מונגולית חלחה אוזבקית צפונית
אסאמית האוסה ‏נורבגית ספרותית
עוואדי עברית נורווגית (Nynorsk)
באלינזית הינדי ניאנג'ה
בנגלית הונגרית אוקסיטנית
בנג'אר (כתב ערבי) איסלנדית אורייה (שפה נפרדת)
בנג'אר (כתב לטיני) איגבו פנגסינאן
בשקירית אילוקו פרסית (אפגניסטן)
בסקית אינדונזית פולנית
בלארוסית פרסית איראנית פורטוגזית
במבה איטלקית פנג'אבי
בוג'פורי יפנית רומנית
בוסנית ג'אווה רוסית
בוגינזית קביל סנטלי
בולגרית קאמבה סרבית
בורמזית קנאדה סינדהית
קנטונזית קשמירית (כתב ערבי) סינהאלה
קטלאנית קשמירית (כתב דוונאגרי) סלובקית
סבואנו קזחית סלובנית
כורדית מרכזית חמרית סומלית
צ'אטיסגארי קיקויו אזרית דרומית
סינית (כתב האן) קינירואנדה פאשטו דרומית
סינית (כתב האנט) קונגו ססוטו
טטארית של חצי האי קרים קוריאנית ספרדית
קרואטית קירגיזית ערבית רגילה (כתב ערבי)
צ'כית לאו ערבית רגילה (תסריט Latn)
דנית לטגאלית לטבית רגילה
הולנדית לינגלה מלאית תקנית
דיולה ליטאית סוואהילי (שפה נפרדת)
דזונקה לוקסמבורגית סוואטי
ערבית מצרית מקדונית שוודית
אנגלית מגאהי טג'יקית
אסטונית מאיטילית טמילית
פיליפינית מליאלאם טלוגו
פינית מלטית תאית
צרפתית מניפורית תיגרינית
גליציאנית מראטהית אלבנית טוסק
גאנדה מיננגקבאו (כתב ערבי) אויגור
גאורגית מיננגקבאו (כתב לטיני)
גרמנית מיזו