Gemini 3.5 Transcribe

Gemini 3.5 Transcribe เป็นโมเดลการแปลงเสียงเป็นข้อความที่อิงตามความสามารถในการทำความเข้าใจเสียงของ Gemini โดยจะให้การถอดเสียงที่แม่นยำและมีเวลาในการตอบสนองต่ำ พร้อมการตรวจหาภาษาตามคำพูด การระบุผู้พูด การประทับเวลาที่ระดับคำ การถอดเสียงอัจฉริยะ และการปรับคำพูดตามคำศัพท์ที่กำหนดเอง

เอกสารประกอบ

Gemini 3.5 Transcribe จะแปลงเสียงพูดเป็นข้อความจากไฟล์เสียง โดยจะตรวจจับภาษาได้มากกว่า 85 ภาษาโดยอัตโนมัติ จัดการการสลับภาษาในโค้ด ระบุผู้พูดแต่ละคน แสดงการประทับเวลาที่ระดับคำ และปรับให้เข้ากับคำศัพท์เฉพาะโดเมนผ่านการกำหนดค่าคำศัพท์ที่กำหนดเอง

ดูคำแนะนำเกี่ยวกับการถอดเสียงเป็นคำของเสียงเพื่อดูข้อมูลทั้งหมดเกี่ยวกับฟีเจอร์ที่ไม่ใช่การสตรีม หากต้องการถอดเสียงสตรีมแบบเรียลไทม์ที่มีเวลาในการตอบสนองต่ำผ่าน WebSockets โปรดไปที่คู่มือการถอดเสียงเป็นคำแบบสดโดยใช้ gemini-3.5-transcribe-live ดูราคาโดยละเอียดได้ที่หน้าราคา

gemini-3.5-transcribe

พร็อพเพอร์ตี้ คำอธิบาย
รหัสโมเดล gemini-3.5-transcribe
ประเภทข้อมูลที่รองรับ

อินพุต

เสียง (สูงสุด 1 ชั่วโมง)

เอาต์พุต

ข้อความ คำอธิบายประกอบ Word

ขีดจำกัดของเสียง

ขีดจำกัดเสียงแบบเอกภาค

สูงสุด 1 ชั่วโมงต่อคำขอ (สูงสุด 30 นาทีเมื่อเปิดใช้การแยกแยะเสียงผู้พูดหรือการประทับเวลาที่ระดับคำ)

ความสามารถ

การถอดเสียงเป็นคำ

สิ่งที่ทำได้

การแยกแยะเสียงผู้พูด

สิ่งที่ทำได้

การประทับเวลาระดับคำ

สิ่งที่ทำได้

คำศัพท์ที่กำหนดเอง

สิ่งที่ทำได้

การถอดเสียงอัจฉริยะ

สิ่งที่ทำได้

การแคช

สิ่งที่ทำไม่ได้

การเรียกใช้โค้ด

สิ่งที่ทำไม่ได้

การค้นหาไฟล์

สิ่งที่ทำไม่ได้

การเรียกใช้ฟังก์ชัน

สิ่งที่ทำไม่ได้

การสร้างรูปภาพ

สิ่งที่ทำไม่ได้

การคิด

สิ่งที่ทำไม่ได้

ตัวเลือกการรับชม

Batch API

สิ่งที่ทำไม่ได้

Flex Inference

สิ่งที่ทำไม่ได้

การอนุมานตามลำดับความสำคัญ

สิ่งที่ทำไม่ได้

เวอร์ชัน
อ่านรายละเอียดเพิ่มเติมได้ในรูปแบบเวอร์ชันของโมเดล
  • gemini-3.5-transcribe (Unary)
  • gemini-3.5-transcribe-live (Live API)
การอัปเดตล่าสุด สิงหาคม 2569

การรองรับฟีเจอร์และข้อจำกัด

Gemini 3.5 Transcribe รองรับฟีเจอร์ต่อไปนี้ใน 2 Endpoint

ฟีเจอร์ การไลฟ์สด (gemini-3.5-transcribe-live) การประมวลผลไฟล์เสียง (gemini-3.5-transcribe) หมายเหตุ / ข้อจำกัด
การตรวจหาภาษาอัตโนมัติ รองรับ (มากกว่า 85 ภาษา) รองรับ (มากกว่า 85 ภาษา) รวมถึงการผสมภาษาในระหว่างเซสชัน
การประทับเวลาระดับคำ ไม่รองรับ รองรับ ลดความแม่นยำของการถอดเสียงเป็นคำ
การเอนเอียงคำศัพท์ที่กำหนดเอง รองรับ (สูงสุด 1,000 คำ) รองรับ (สูงสุด 1,000 คำ) โดยปกติแล้ว ลูกค้าจะได้รับผลลัพธ์ที่ดีที่สุดเมื่อใช้คำไม่เกิน 100 คำ
การเขียนตามคำบอกและการจัดรูปแบบอัจฉริยะ รองรับ รองรับ รวมถึงการนำคำพูดที่ไม่มีความหมายออกและการจัดรูปแบบตัวอักษรและตัวเลขโดยพิจารณาจากเจตนา
การระบุผู้พูด ไม่รองรับ รองรับ (สูงสุด 8 ลำโพง) การระบุแหล่งที่มาสำหรับลำโพง 3 เครื่องขึ้นไปอยู่ในขั้นทดลอง
ระยะเวลาเสียงสูงสุด 10 นาทีต่อเซสชัน นานสูงสุด 1 ชั่วโมง การประมวลผลไฟล์จะจำกัดไว้ที่ 30 นาทีเมื่อเปิดใช้ฟีเจอร์ต่างๆ เช่น การระบุผู้พูดหรือการประทับเวลา

ภาษาที่รองรับ

Gemini 3.5 Transcribe รองรับภาษาและรหัสภาษา BCP-47 ต่อไปนี้

ภาษา รหัส BCP-47 ภาษา รหัส BCP-47
อาฟรีกานส์ af-ZA ญี่ปุ่น ja-JP
อัมฮาริก am-ET ชวา jv-ID
อาหรับ (อียิปต์) ar-EG คาบูเวอร์เดียนู kea-CV
อาร์เมเนีย hy-AM กันนาดา kn-IN
อัสสัม as-IN คาซัค kk-KZ
อาร์เซอร์ไบจัน az-AZ เกาหลี ko-KR
เบลารุส be-BY คีร์กิซ ky-KG
เบงกาลี (บังกลาเทศ) bn-BD ลัตเวีย lv-LV
เบงกาลี (อินเดีย) bn-IN ลิงกาลา ln-CD
บอสเนีย bs-BA ลิทัวเนีย lt-LT
บัลแกเรีย bg-BG มาซีโดเนีย mk-MK
บัลแกเรีย (อโรมาเนีย) rup-BG มาเลย์ ms-MY
พม่า my-MM มาลายาลัม ml-IN
จีนกวางตุ้ง (ตัวเต็ม) yue-Hant-HK มอลตา mt-MT
คาตาลัน ca-ES จีนกลาง (ตัวย่อ) cmn-Hans-CN
ซีบัวโน ceb มราฐี mr-IN
เขมรตอนกลาง km-KH มองโกเลีย mn-MN
โครเอเชีย hr-HR เนปาล ne-NP
เช็ก cs-CZ นอร์เวย์ nb-NO
เดนมาร์ก da-DK โอริยา or-IN
ดัตช์ nl-NL โปแลนด์ pl-PL
อังกฤษ (บริเตนใหญ่) en-GB โปรตุเกส (บราซิล) pt-BR
อังกฤษ (อินเดีย) en-IN โปรตุเกส (โปรตุเกส) pt-PT
อังกฤษ (สหรัฐอเมริกา) en-US ปัญจาบ pa-IN
เอสโตเนีย et-EE ปัญจาบ (สคริปต์คุรมุขี) pa-Guru-IN
ฟาร์ซี fa-IR โรมาเนีย ro-RO
ฟิลิปปินส์ fil-PH รัสเซีย ru-RU
ฟินแลนด์ fi-FI เซอร์เบีย sr-RS
ฝรั่งเศส fr-FR ภาษาสินธี (อักษรอาหรับ) sd-Arab-IN
กาลิเชียน gl-ES สโลวัก sk-SK
จอร์เจีย ka-GE สโลวีเนีย sl-SI
เยอรมัน de-DE สเปน (ลาตินอเมริกา) es-419
กรีก el-GR สเปน (สหรัฐอเมริกา) es-US
คุชราต gu-IN สวาฮีลี (เคนยา) sw-KE
เฮาซา ha-NG สวีเดน sv-SE
ฮีบรู he-IL ทาจิก tg-TJ
ฮินดี hi-IN เตลูกู te-IN
ฮังการี hu-HU ไทย th-TH
ไอซ์แลนด์ is-IS ตุรกี tr-TR
อังกฤษ (อินเดีย) en-IN ยูเครน uk-UA
อินโดนีเซีย id-ID อุซเบก uz-UZ
อิตาลี it-IT เวียดนาม vi-VN