TTS ของ Gemini 3.8 Flash

TTS ของ Gemini 3.8 Flash (gemini-3.8-flash-tts) เป็นโมเดลข้อความเป็นเสียงเชิงสร้างสรรค์ชั้นนำของ Google ซึ่งออกแบบมาเพื่อความเที่ยงตรงของเสียงระดับสตูดิโอ การแสดงออกที่สื่ออารมณ์ สำเนียงท้องถิ่นที่แท้จริง และความเสถียรแบบการสนทนาไปมาในรูปแบบขนาดยาวที่มั่นคง

ภาพรวมและความสามารถ

TTS ของ Gemini 3.8 Flash กำหนดมาตรฐานใหม่สำหรับการสร้างเสียงที่สื่ออารมณ์ได้ ดังนี้

  • ความเที่ยงตรงของเสียงและรายละเอียดการแสดงสูง: สื่ออารมณ์ได้หลากหลาย มีจังหวะที่เป็นธรรมชาติ และปฏิบัติตามคำสั่งระดับเทิร์น style และเหตุการณ์เสียงร้องในบรรทัด (<laugh>, <sigh>, <short pause>) ได้อย่างแม่นยำ
  • ความเสถียรแบบหลายรอบในรูปแบบขนาดยาว: รักษาเอกลักษณ์ของเสียง โทนเสียง ระดับเสียง และเสียงในห้องที่สอดคล้องกันตลอดการสนทนาไปมาที่ยาวนานและการบรรยายหลายนาทีโดยไม่มีการเปลี่ยนแปลงของเสียง
  • สำเนียงและการออกเสียงในภูมิภาคที่ถูกต้อง: รองรับสำเนียงในภูมิภาค ภาษาถิ่นของชนกลุ่มน้อย และการลบล้างตัวอักษรสากลตามวิธีออกเสียง (IPA) ในบรรทัด
  • รองรับระบบนิเวศเสียงอย่างเต็มรูปแบบ: ทำงานร่วมกับเสียงที่สร้างไว้ล่วงหน้าได้อย่างราบรื่น คลังเสียงเพิ่มเติม (GET /v1beta/voices) การออกแบบเสียงที่กำหนดเอง และการจำลองเสียง (เสียงที่จัดเก็บถาวร โดยค่าเริ่มต้น รวมถึงคีย์แบบไม่เก็บสถานะที่ไม่บังคับ) นอกจากนี้ คุณยังออกแบบและ จำลองเสียงแบบอินเทอร์แอกทีฟใน Google AI Studio ได้ด้วย

ไปที่คู่มือข้อความเป็นการอ่านเพื่อดูข้อมูลทั้งหมดเกี่ยวกับฟีเจอร์ แนวทางปฏิบัติแนะนำในการแจ้ง และตัวอย่างโค้ด

ควรใช้โมเดล TTS ใดเมื่อใด

โมเดล TTS ของ Gemini 3.8 ทั้ง 2 โมเดลใช้สคีมา API และโครงสร้างพรอมต์เดียวกัน เลือกโมเดลที่เหมาะกับภาระงานของคุณ

ฟีเจอร์ / ภาระงาน TTS ของ Gemini 3.8 Flash (gemini-3.8-flash-tts) TTS ของ Gemini 3.8 Flash-Lite (gemini-3.8-flash-lite-tts)
ความแข็งแรงหลัก ความเที่ยงตรงของเสียงพูด การแสดงที่ละเอียดอ่อน และการครอบคลุมภาษาถิ่นสูงสุด การส่งข้อความปริมาณมาก เวลาในการตอบสนองต่ำ และคุ้มค่า
Use Case ที่ดีที่สุด หนังสือเสียง การบรรยายในสตูดิโอ บทสนทนาที่ซับซ้อนซึ่งมีผู้พูดหลายคน การแสดงที่ต้องเปล่งเสียงอย่างหนัก การออกเสียงที่ยาก สำเนียงท้องถิ่น การผลิตปริมาณมาก การส่งต่อตัวแทนเสียงแบบเรียลไทม์ ฟีเจอร์อ่านออกเสียง การจำลองเสียง การสร้างเสียงแบบลำโพงเดียวในชีวิตประจำวัน
ภาษาที่รองรับ 130 ภาษา 101 ภาษา
แนะนำให้เปลี่ยนเป็น ครีเอทีฟโฆษณาระดับเรือธงใหม่ gemini-3.1-flash-tts-preview

คำแนะนำในการย้ายข้อมูล

หากคุณย้ายข้อมูลจากโมเดล gemini-3.1-flash-tts-preview หรือโมเดล TTS ของ Gemini เวอร์ชันก่อนหน้า ให้อัปเดตคำขอสำหรับสคีมา TTS ของ Gemini 3.8 ดังนี้

  1. ย้ายคำสั่งระดับเลี้ยวไปยัง speech_metadata: TTS ของ Gemini 3.8 จะถือว่า ข้อความที่ป้อนเป็นสำเนาที่ตรงตามต้นฉบับอย่างเคร่งครัด ระบบอาจอ่านออกเสียงข้อความในบรรทัด เช่น "Say cheerfully: Hello!" หรือ "Speaker 1: Hello!" ย้ายวิธีการนำส่งอย่างต่อเนื่อง (style) และป้ายกำกับผู้พูด (speaker) ไปยังข้อมูลเมตาที่มีโครงสร้าง
    • Interactions API: แนบคำอธิบายประกอบที่มี "type": "speech_metadata", "speaker" และ "style" ไปยังบล็อกเนื้อหาข้อความแต่ละบล็อก
    • GenerateContent API: แนบ "speech_metadata": {"speaker": "...", "style": "..."} ไปกับ part แต่ละรายการ
  2. ใช้แท็กอินไลน์วงเล็บเหลี่ยมเฉพาะสำหรับเหตุการณ์เสียงร้อง ณ จุดใดจุดหนึ่ง: เก็บเสียงร้องที่ไม่ใช่คำพูดชั่วขณะและหยุดชั่วคราวไว้ในสำเนาการถอดเสียงโดยใช้วงเล็บเหลี่ยม (เช่น <laugh>, <sigh>, <cough>, <breath> หรือ <short pause>) ระบุรูปแบบการพูด เช่น การกระซิบ ใน speech_metadata.style
  3. ระบุ speaker ในทุกๆ เทิร์นในคำขอแบบหลายผู้พูด: ทุกๆ เทิร์นในคำขอแบบหลายผู้พูดต้องมี speaker อยู่ภายใน speech_metadata ที่ตรงกับผู้พูดที่กำหนดค่าไว้
  4. ออกแบบเพอร์โซนาล่วงหน้าด้วยการออกแบบเสียง: แทนที่บล็อก Audio Profile / Director's Notes เดิมที่ยาวด้วยเสียงที่กำหนดเองซึ่งสร้างขึ้นในการออกแบบเสียง จากนั้นใช้รหัสvoice_... นั้นผ่านคำขอ TTS โดยมีสตริง style ที่ว่างเปล่าหรือมีข้อมูลน้อยที่สุด
  5. พิจารณาเอาต์พุต WAV (audio/wav) เริ่มต้นในคำขอแบบเอกภาค: โมเดล TTS ของ Gemini 3.8 จะแสดงผลเสียง WAV (audio/wav / AUDIO_WAV) พร้อมส่วนหัว RIFF มาตรฐานโดยค่าเริ่มต้นสำหรับคำขอแบบเอกภาค ซึ่งแตกต่างจากโมเดล TTS gemini-3.1-flash-tts-preview และรุ่นก่อนหน้า (ซึ่งแสดงผล PCM ดิบแบบไม่มีส่วนหัว audio/l16 โดยค่าเริ่มต้น)
    • หากก่อนหน้านี้โค้ดของคุณห่อไบต์ PCM ดิบไว้ในส่วนหัวของ WAV (เช่น ใช้โมดูล wave หรือ ffmpeg ของ Python) ให้นำ Wrapper ส่วนหัวที่สร้างขึ้นเองออก แล้วเขียนไบต์ที่ส่งคืนไปยังไฟล์ .wav โดยตรง
    • หากไปป์ไลน์ของคุณต้องใช้เสียง PCM, mu-law หรือ A-law แบบดิบที่ไม่มีส่วนหัว ให้ตั้งค่า response_format เป็น "audio/l16" ("AUDIO_L16"), "audio/mulaw" ("AUDIO_MULAW") หรือ "audio/alaw" ("AUDIO_ALAW") อย่างชัดเจน ดูรูปแบบเอาต์พุตเสียง

gemini-3.8-flash-tts

พร็อพเพอร์ตี้ คำอธิบาย
รหัสโมเดล gemini-3.8-flash-tts
ประเภทข้อมูลที่รองรับ

อินพุต

ข้อความ

เอาต์พุต

เสียง

ขีดจำกัดของโทเค็น[*]

ขีดจำกัดโทเค็นอินพุต

8,192

ขีดจำกัดโทเค็นเอาต์พุต

16,384

ความสามารถ

การสร้างเสียง

สิ่งที่ทำได้

การแคช

สิ่งที่ทำได้

การเรียกใช้โค้ด

สิ่งที่ทำไม่ได้

การค้นหาไฟล์

สิ่งที่ทำไม่ได้

การเรียกใช้ฟังก์ชัน

สิ่งที่ทำไม่ได้

การเชื่อมต่อแหล่งข้อมูลกับ Google Maps

สิ่งที่ทำไม่ได้

การสร้างรูปภาพ

สิ่งที่ทำไม่ได้

Live API

สิ่งที่ทำไม่ได้

การเชื่อมต่อแหล่งข้อมูลของ Search

สิ่งที่ทำไม่ได้

เอาต์พุตที่มีโครงสร้าง

สิ่งที่ทำไม่ได้

การคิด

สิ่งที่ทำไม่ได้

บริบทของ URL

สิ่งที่ทำไม่ได้

ตัวเลือกการรับชม

Batch API

สิ่งที่ทำได้

Flex Inference

สิ่งที่ทำได้

การอนุมานตามลำดับความสำคัญ

สิ่งที่ทำได้

เวอร์ชัน
อ่านรายละเอียดเพิ่มเติมได้ในรูปแบบเวอร์ชันของโมเดล
  • gemini-3.8-flash-tts
การอัปเดตล่าสุด กรกฎาคม 2569

ภาษาที่รองรับ

gemini-3.8-flash-tts จะตรวจหาภาษาที่ป้อนโดยอัตโนมัติและรองรับ130 ภาษา

ภาษา ภาษา ภาษา
อาเจะฮ์ (อักษรอาหรับ) กรีก เนปาล (ภาษาเฉพาะ)
อาฟรีกานส์ กวารานี ฟุลฟุลเดของไนจีเรีย
อะคัน คุชราต อาเซอร์ไบจานเหนือ
อัมฮาริก เฮติครีโอล โซโทเหนือ
อาร์เมเนีย มองโกเลียคาลคา อุซเบกเหนือ
อัสสัม เฮาซา นอร์เวย์บุคมอล
อวธี ฮีบรู นีนอสก์ของนอร์เวย์
บาหลี ฮินดี เนียนจา
เบงกอล ฮังการี ออกซิแทน
บันจาร์ (อักษรอาหรับ) ไอซ์แลนด์ โอเดีย (ภาษาเฉพาะ)
บันจาร์ (อักษรละติน) อิกโบ ปังกาซินัน
แบชเคียร์ อีโลโก เปอร์เซีย (อัฟกานิสถาน)
บาสก์ อินโดนีเซีย โปแลนด์
เบลารุส เปอร์เซียอิหร่าน โปรตุเกส
เบมบา อิตาลี ปัญจาบ
โภชปุระ ญี่ปุ่น โรมาเนีย
บอสเนีย ชวา รัสเซีย
บูกิส คาไบล์ สันถาลี
บัลแกเรีย คัมบา เซอร์เบีย
พม่า กันนาดา สินธี
จีนกวางตุ้ง แคชเมียร์ (อักษรอาหรับ) สิงหล
คาตาลัน แคชเมียร์ (สคริปต์เทวนาครี) สโลวัก
ซีบัวโน คาซัค สโลวีเนีย
เคิร์ดตอนกลาง เขมร โซมาลี
ฉัตติสครห์ คิคูยู อาเซอร์ไบจานใต้
จีน (อักษรฮั่น) คินยารวันดา ปาทานใต้
จีน (อักษรฮั่น) คองโก โซโทใต้
ตาตาร์ไครเมีย เกาหลี สเปน
โครเอเชีย คีร์กิซ อาหรับมาตรฐาน (สคริปต์อาหรับ)
เช็ก ภาษาลาว อาหรับมาตรฐาน (สคริปต์ละติน)
เดนมาร์ก ลัตกาเรียน ลัตเวียมาตรฐาน
ดัตช์ ลิงกาลา ภาษามลายูมาตรฐาน
ดิวลา ลิทัวเนีย สวาฮีลี (ภาษาเฉพาะ)
ซองคา ลักเซมเบิร์ก สวาติ
อาหรับอียิปต์ มาซีโดเนีย สวีเดน
อังกฤษ มคธี ทาจิก
เอสโตเนีย ไมถิลี ทมิฬ
ฟิลิปปินส์ มาลายาลัม เตลูกู
ฟินแลนด์ มอลตา ไทย
ฝรั่งเศส มานิพูรี ทิกรินยา
กาลิเชียน มราฐี แอลบาเนียนแบบทอสก์
กันดา มินังกาเบา (อักษรอาหรับ) อุยกูร์
จอร์เจีย มินังกาเบา (สคริปต์ละติน)
เยอรมัน มิโซ