TTS ของ Gemini 3.8 Flash (gemini-3.8-flash-tts) เป็นโมเดลข้อความเป็นเสียงเชิงสร้างสรรค์ชั้นนำของ Google ซึ่งออกแบบมาเพื่อความเที่ยงตรงของเสียงระดับสตูดิโอ การแสดงออกที่สื่ออารมณ์ สำเนียงท้องถิ่นที่แท้จริง และความเสถียรแบบการสนทนาไปมาในรูปแบบขนาดยาวที่มั่นคง
ภาพรวมและความสามารถ
TTS ของ Gemini 3.8 Flash กำหนดมาตรฐานใหม่สำหรับการสร้างเสียงที่สื่ออารมณ์ได้ ดังนี้
- ความเที่ยงตรงของเสียงและรายละเอียดการแสดงสูง: สื่ออารมณ์ได้หลากหลาย
มีจังหวะที่เป็นธรรมชาติ และปฏิบัติตามคำสั่งระดับเทิร์น
styleและเหตุการณ์เสียงร้องในบรรทัด (<laugh>,<sigh>,<short pause>) ได้อย่างแม่นยำ - ความเสถียรแบบหลายรอบในรูปแบบขนาดยาว: รักษาเอกลักษณ์ของเสียง โทนเสียง ระดับเสียง และเสียงในห้องที่สอดคล้องกันตลอดการสนทนาไปมาที่ยาวนานและการบรรยายหลายนาทีโดยไม่มีการเปลี่ยนแปลงของเสียง
- สำเนียงและการออกเสียงในภูมิภาคที่ถูกต้อง: รองรับสำเนียงในภูมิภาค ภาษาถิ่นของชนกลุ่มน้อย และการลบล้างตัวอักษรสากลตามวิธีออกเสียง (IPA) ในบรรทัด
- รองรับระบบนิเวศเสียงอย่างเต็มรูปแบบ: ทำงานร่วมกับเสียงที่สร้างไว้ล่วงหน้าได้อย่างราบรื่น
คลังเสียงเพิ่มเติม (
GET /v1beta/voices) การออกแบบเสียงที่กำหนดเอง และการจำลองเสียง (เสียงที่จัดเก็บถาวร โดยค่าเริ่มต้น รวมถึงคีย์แบบไม่เก็บสถานะที่ไม่บังคับ) นอกจากนี้ คุณยังออกแบบและ จำลองเสียงแบบอินเทอร์แอกทีฟใน Google AI Studio ได้ด้วย
ไปที่คู่มือข้อความเป็นการอ่านเพื่อดูข้อมูลทั้งหมดเกี่ยวกับฟีเจอร์ แนวทางปฏิบัติแนะนำในการแจ้ง และตัวอย่างโค้ด
ควรใช้โมเดล TTS ใดเมื่อใด
โมเดล TTS ของ Gemini 3.8 ทั้ง 2 โมเดลใช้สคีมา API และโครงสร้างพรอมต์เดียวกัน เลือกโมเดลที่เหมาะกับภาระงานของคุณ
| ฟีเจอร์ / ภาระงาน | TTS ของ Gemini 3.8 Flash (gemini-3.8-flash-tts) |
TTS ของ Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts) |
|---|---|---|
| ความแข็งแรงหลัก | ความเที่ยงตรงของเสียงพูด การแสดงที่ละเอียดอ่อน และการครอบคลุมภาษาถิ่นสูงสุด | การส่งข้อความปริมาณมาก เวลาในการตอบสนองต่ำ และคุ้มค่า |
| Use Case ที่ดีที่สุด | หนังสือเสียง การบรรยายในสตูดิโอ บทสนทนาที่ซับซ้อนซึ่งมีผู้พูดหลายคน การแสดงที่ต้องเปล่งเสียงอย่างหนัก การออกเสียงที่ยาก สำเนียงท้องถิ่น | การผลิตปริมาณมาก การส่งต่อตัวแทนเสียงแบบเรียลไทม์ ฟีเจอร์อ่านออกเสียง การจำลองเสียง การสร้างเสียงแบบลำโพงเดียวในชีวิตประจำวัน |
| ภาษาที่รองรับ | 130 ภาษา | 101 ภาษา |
| แนะนำให้เปลี่ยนเป็น | ครีเอทีฟโฆษณาระดับเรือธงใหม่ | gemini-3.1-flash-tts-preview |
คำแนะนำในการย้ายข้อมูล
หากคุณย้ายข้อมูลจากโมเดล gemini-3.1-flash-tts-preview หรือโมเดล TTS ของ Gemini เวอร์ชันก่อนหน้า ให้อัปเดตคำขอสำหรับสคีมา TTS ของ Gemini 3.8 ดังนี้
- ย้ายคำสั่งระดับเลี้ยวไปยัง
speech_metadata: TTS ของ Gemini 3.8 จะถือว่า ข้อความที่ป้อนเป็นสำเนาที่ตรงตามต้นฉบับอย่างเคร่งครัด ระบบอาจอ่านออกเสียงข้อความในบรรทัด เช่น"Say cheerfully: Hello!"หรือ"Speaker 1: Hello!"ย้ายวิธีการนำส่งอย่างต่อเนื่อง (style) และป้ายกำกับผู้พูด (speaker) ไปยังข้อมูลเมตาที่มีโครงสร้าง- Interactions API: แนบคำอธิบายประกอบที่มี
"type": "speech_metadata","speaker"และ"style"ไปยังบล็อกเนื้อหาข้อความแต่ละบล็อก - GenerateContent API: แนบ
"speech_metadata": {"speaker": "...", "style": "..."}ไปกับpartแต่ละรายการ
- Interactions API: แนบคำอธิบายประกอบที่มี
- ใช้แท็กอินไลน์วงเล็บเหลี่ยมเฉพาะสำหรับเหตุการณ์เสียงร้อง ณ จุดใดจุดหนึ่ง: เก็บเสียงร้องที่ไม่ใช่คำพูดชั่วขณะและหยุดชั่วคราวไว้ในสำเนาการถอดเสียงโดยใช้วงเล็บเหลี่ยม (เช่น
<laugh>,<sigh>,<cough>,<breath>หรือ<short pause>) ระบุรูปแบบการพูด เช่น การกระซิบ ในspeech_metadata.style - ระบุ
speakerในทุกๆ เทิร์นในคำขอแบบหลายผู้พูด: ทุกๆ เทิร์นในคำขอแบบหลายผู้พูดต้องมีspeakerอยู่ภายในspeech_metadataที่ตรงกับผู้พูดที่กำหนดค่าไว้ - ออกแบบเพอร์โซนาล่วงหน้าด้วยการออกแบบเสียง: แทนที่บล็อก Audio
Profile / Director's Notes เดิมที่ยาวด้วยเสียงที่กำหนดเองซึ่งสร้างขึ้นในการออกแบบเสียง จากนั้นใช้รหัส
voice_...นั้นผ่านคำขอ TTS โดยมีสตริงstyleที่ว่างเปล่าหรือมีข้อมูลน้อยที่สุด - พิจารณาเอาต์พุต WAV (
audio/wav) เริ่มต้นในคำขอแบบเอกภาค: โมเดล TTS ของ Gemini 3.8 จะแสดงผลเสียง WAV (audio/wav/AUDIO_WAV) พร้อมส่วนหัว RIFF มาตรฐานโดยค่าเริ่มต้นสำหรับคำขอแบบเอกภาค ซึ่งแตกต่างจากโมเดล TTSgemini-3.1-flash-tts-previewและรุ่นก่อนหน้า (ซึ่งแสดงผล PCM ดิบแบบไม่มีส่วนหัวaudio/l16โดยค่าเริ่มต้น)- หากก่อนหน้านี้โค้ดของคุณห่อไบต์ PCM ดิบไว้ในส่วนหัวของ WAV (เช่น ใช้โมดูล
waveหรือffmpegของ Python) ให้นำ Wrapper ส่วนหัวที่สร้างขึ้นเองออก แล้วเขียนไบต์ที่ส่งคืนไปยังไฟล์.wavโดยตรง - หากไปป์ไลน์ของคุณต้องใช้เสียง PCM, mu-law หรือ A-law แบบดิบที่ไม่มีส่วนหัว
ให้ตั้งค่า
response_formatเป็น"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW") หรือ"audio/alaw"("AUDIO_ALAW") อย่างชัดเจน ดูรูปแบบเอาต์พุตเสียง
- หากก่อนหน้านี้โค้ดของคุณห่อไบต์ PCM ดิบไว้ในส่วนหัวของ WAV (เช่น ใช้โมดูล
gemini-3.8-flash-tts
| พร็อพเพอร์ตี้ | คำอธิบาย |
|---|---|
| รหัสโมเดล | gemini-3.8-flash-tts |
| ประเภทข้อมูลที่รองรับ |
อินพุต ข้อความ เอาต์พุต เสียง |
| ขีดจำกัดของโทเค็น[*] |
ขีดจำกัดโทเค็นอินพุต 8,192 ขีดจำกัดโทเค็นเอาต์พุต 16,384 |
| ความสามารถ | สิ่งที่ทำได้ สิ่งที่ทำได้ สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ การเชื่อมต่อแหล่งข้อมูลกับ Google Maps สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ การเชื่อมต่อแหล่งข้อมูลของ Search สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ สิ่งที่ทำไม่ได้ |
| ตัวเลือกการรับชม |
สิ่งที่ทำได้ สิ่งที่ทำได้ สิ่งที่ทำได้ |
| เวอร์ชัน |
|
| การอัปเดตล่าสุด | กรกฎาคม 2569 |
ภาษาที่รองรับ
gemini-3.8-flash-tts จะตรวจหาภาษาที่ป้อนโดยอัตโนมัติและรองรับ130 ภาษา
| ภาษา | ภาษา | ภาษา |
|---|---|---|
| อาเจะฮ์ (อักษรอาหรับ) | กรีก | เนปาล (ภาษาเฉพาะ) |
| อาฟรีกานส์ | กวารานี | ฟุลฟุลเดของไนจีเรีย |
| อะคัน | คุชราต | อาเซอร์ไบจานเหนือ |
| อัมฮาริก | เฮติครีโอล | โซโทเหนือ |
| อาร์เมเนีย | มองโกเลียคาลคา | อุซเบกเหนือ |
| อัสสัม | เฮาซา | นอร์เวย์บุคมอล |
| อวธี | ฮีบรู | นีนอสก์ของนอร์เวย์ |
| บาหลี | ฮินดี | เนียนจา |
| เบงกอล | ฮังการี | ออกซิแทน |
| บันจาร์ (อักษรอาหรับ) | ไอซ์แลนด์ | โอเดีย (ภาษาเฉพาะ) |
| บันจาร์ (อักษรละติน) | อิกโบ | ปังกาซินัน |
| แบชเคียร์ | อีโลโก | เปอร์เซีย (อัฟกานิสถาน) |
| บาสก์ | อินโดนีเซีย | โปแลนด์ |
| เบลารุส | เปอร์เซียอิหร่าน | โปรตุเกส |
| เบมบา | อิตาลี | ปัญจาบ |
| โภชปุระ | ญี่ปุ่น | โรมาเนีย |
| บอสเนีย | ชวา | รัสเซีย |
| บูกิส | คาไบล์ | สันถาลี |
| บัลแกเรีย | คัมบา | เซอร์เบีย |
| พม่า | กันนาดา | สินธี |
| จีนกวางตุ้ง | แคชเมียร์ (อักษรอาหรับ) | สิงหล |
| คาตาลัน | แคชเมียร์ (สคริปต์เทวนาครี) | สโลวัก |
| ซีบัวโน | คาซัค | สโลวีเนีย |
| เคิร์ดตอนกลาง | เขมร | โซมาลี |
| ฉัตติสครห์ | คิคูยู | อาเซอร์ไบจานใต้ |
| จีน (อักษรฮั่น) | คินยารวันดา | ปาทานใต้ |
| จีน (อักษรฮั่น) | คองโก | โซโทใต้ |
| ตาตาร์ไครเมีย | เกาหลี | สเปน |
| โครเอเชีย | คีร์กิซ | อาหรับมาตรฐาน (สคริปต์อาหรับ) |
| เช็ก | ภาษาลาว | อาหรับมาตรฐาน (สคริปต์ละติน) |
| เดนมาร์ก | ลัตกาเรียน | ลัตเวียมาตรฐาน |
| ดัตช์ | ลิงกาลา | ภาษามลายูมาตรฐาน |
| ดิวลา | ลิทัวเนีย | สวาฮีลี (ภาษาเฉพาะ) |
| ซองคา | ลักเซมเบิร์ก | สวาติ |
| อาหรับอียิปต์ | มาซีโดเนีย | สวีเดน |
| อังกฤษ | มคธี | ทาจิก |
| เอสโตเนีย | ไมถิลี | ทมิฬ |
| ฟิลิปปินส์ | มาลายาลัม | เตลูกู |
| ฟินแลนด์ | มอลตา | ไทย |
| ฝรั่งเศส | มานิพูรี | ทิกรินยา |
| กาลิเชียน | มราฐี | แอลบาเนียนแบบทอสก์ |
| กันดา | มินังกาเบา (อักษรอาหรับ) | อุยกูร์ |
| จอร์เจีย | มินังกาเบา (สคริปต์ละติน) | — |
| เยอรมัน | มิโซ | — |