Live API ช่วยให้การโต้ตอบด้วยเสียงและภาพกับ Gemini เป็นแบบเรียลไทม์และมีความหน่วงต่ำ โดยจะประมวลผลสตรีมเสียง รูปภาพ และข้อความอย่างต่อเนื่องเพื่อแสดงเสียงตอบกลับที่เหมือนเสียงพูดของมนุษย์ในทันที ซึ่งจะสร้างประสบการณ์การสนทนาที่เป็นธรรมชาติให้กับผู้ใช้

กรณีการใช้งาน
คุณสามารถใช้ Live API เพื่อสร้าง Agent ที่ใช้เสียงแบบเรียลไทม์สำหรับอุตสาหกรรมต่างๆ ได้แก่
- อีคอมเมิร์ซและการค้าปลีก: ผู้ช่วยช็อปปิ้งที่ให้คำแนะนำเฉพาะบุคคลและ Agent ฝ่ายสนับสนุนที่แก้ไขปัญหาของลูกค้า
- เกม: ตัวละครที่ไม่ใช่ผู้เล่น (NPC) แบบอินเทอร์แอกทีฟ ผู้ช่วยในเกม และการแปลเนื้อหาในเกมแบบเรียลไทม์
- อินเทอร์เฟซยุคใหม่: ประสบการณ์ที่ใช้เสียงและวิดีโอได้ในหุ่นยนต์ แว่นตาอัจฉริยะ และยานพาหนะ
- การดูแลสุขภาพ: เพื่อนดูแลสุขภาพเพื่อสนับสนุนและให้ความรู้แก่ผู้ป่วย
- บริการทางการเงิน: ที่ปรึกษา AI สำหรับการจัดการความมั่งคั่งและคำแนะนำด้านการลงทุน
- การศึกษา: ครูฝึก AI และเพื่อนร่วมเรียนที่ให้คำแนะนำและข้อเสนอแนะเฉพาะบุคคล
- การแปลและการแปลเป็นภาษาท้องถิ่น: การแปลบทสนทนาแบบเรียลไทม์ที่มีความหน่วงต่ำ ซึ่งช่วยให้การสื่อสารหลายภาษาเป็นไปอย่างราบรื่น
- การถอดเสียงและการใส่คำบรรยายแทนเสียงแบบเรียลไทม์: การสตรีมการแปลงคำพูดเป็นข้อความแบบเรียลไทม์สำหรับคำบรรยายแทนเสียงแบบเรียลไทม์ การถอดเสียงการประชุม การป้อนข้อมูลด้วยเสียง และการบันทึกการโทรของลูกค้า
ฟีเจอร์หลัก
Live API มีชุดฟีเจอร์ที่ครอบคลุมสำหรับการสร้าง Agent ที่ใช้เสียงที่มีประสิทธิภาพ
- การรองรับหลายภาษา: สนทนาในภาษาที่รองรับ 70 ภาษา
- Barge-in: ผู้ใช้สามารถขัดจังหวะโมเดลได้ทุกเมื่อเพื่อการโต้ตอบที่ตอบสนอง
- การใช้เครื่องมือ: ผสานรวมเครื่องมือต่างๆ เช่น การเรียกใช้ฟังก์ชันและการค้นหาของ Google เพื่อการโต้ตอบแบบไดนามิก
- การถอดเสียง: ให้ข้อความถอดเสียงทั้งข้อมูลจากผู้ใช้และเอาต์พุตโมเดล
- เสียงเชิงรุก: ช่วยให้คุณควบคุมได้ว่าโมเดลจะตอบสนองเมื่อใดและในบริบทใด
- **การสนทนาที่แสดงอารมณ์**: ปรับรูปแบบและน้ำเสียงในการตอบสนองให้ตรงกับคำพูดที่ผู้ใช้ป้อน
- การถอดเสียงแบบเรียลไทม์: การสตรีมการแปลงคำพูดเป็นข้อความแบบเรียลไทม์อย่างต่อเนื่องพร้อมการตรวจหาภาษาอัตโนมัติและคำศัพท์ที่กำหนดเอง
- การแปลแบบเรียลไทม์: การแปลเสียงเป็นเสียงแบบเรียลไทม์ในภาษาต่างๆ มากกว่า 70 ภาษา
ข้อกำหนดทางเทคนิค
ตารางต่อไปนี้แสดงข้อกำหนดทางเทคนิคของ Live API
| หมวดหมู่ | รายละเอียด |
|---|---|
| รูปแบบอินพุต | เสียง (เสียง PCM แบบดิบ 16 บิต, 16 kHz, little-endian), รูปภาพ (JPEG <= 1 FPS), ข้อความ |
| รูปแบบเอาต์พุต | เสียง (เสียง PCM แบบดิบ 16 บิต, 24 kHz, little-endian) |
| โปรโตคอล | การเชื่อมต่อ WebSocket แบบมีสถานะ (WSS) |
เลือกวิธีการนำไปใช้งาน
เมื่อผสานรวมกับ Live API คุณจะต้องเลือกวิธีการนำไปใช้งานวิธีใดวิธีหนึ่งต่อไปนี้
- เซิร์ฟเวอร์ต่อเซิร์ฟเวอร์: แบ็กเอนด์ของคุณจะเชื่อมต่อกับ Live API โดยใช้ WebSockets โดยปกติแล้ว ไคลเอ็นต์จะส่งข้อมูลสตรีม (เสียง วิดีโอ ข้อความ) ไปยังเซิร์ฟเวอร์ ซึ่งจะส่งต่อข้อมูลไปยัง Live API
- ไคลเอ็นต์ต่อเซิร์ฟเวอร์: โค้ดส่วนหน้าจะเชื่อมต่อกับ Live API โดยตรง โดยใช้ WebSockets เพื่อสตรีมข้อมูล โดยไม่ต้องผ่านแบ็กเอนด์
เริ่มต้นใช้งาน
เลือกคำแนะนำที่ตรงกับสภาพแวดล้อมในการพัฒนาซอฟต์แวร์ของคุณ
บทแนะนำเกี่ยวกับ GenAI SDK
เชื่อมต่อกับ Gemini Live API โดยใช้ GenAI SDK เพื่อสร้างแอปพลิเคชันมัลติโมดัลแบบเรียลไทม์ด้วยแบ็กเอนด์ Python
บทแนะนำเกี่ยวกับ WebSocket
เชื่อมต่อกับ Gemini Live API โดยใช้ WebSocket เพื่อสร้างแอปพลิเคชันมัลติโมดัลแบบเรียลไทม์ด้วยส่วนหน้า JavaScript และโทเค็นชั่วคราว
บทแนะนำเกี่ยวกับ ADK
สร้าง Agent และใช้การสตรีมชุดเครื่องมือพัฒนา Agent (ADK) เพื่อเปิดใช้การสื่อสารด้วยเสียงและวิดีโอ
การผสานรวมพาร์ทเนอร์
หากต้องการเพิ่มประสิทธิภาพการพัฒนาแอปเสียงและวิดีโอแบบเรียลไทม์ คุณสามารถใช้ การผสานรวมของบุคคลที่สามที่รองรับ Gemini Live API ผ่าน WebRTC หรือ WebSocket
LiveKit
ใช้ Gemini Live API กับ LiveKit Agent
Pipecat by Daily
สร้างแชทบ็อต AI แบบเรียลไทม์โดยใช้ Gemini Live และ Pipecat
Fishjam by Software Mansion
สร้างแอปพลิเคชันการสตรีมวิดีโอสดและเสียงด้วย Fishjam
Vision Agents by Stream
สร้างแอปพลิเคชัน AI ที่ใช้เสียงและวิดีโอแบบเรียลไทม์ด้วย Vision Agents
Voximplant
เชื่อมต่อการโทรขาเข้าและขาออกกับ Live API ด้วย Voximplant
Agora
สร้างแอปพลิเคชัน AI สำหรับการสนทนาแบบเรียลไทม์ด้วย Agora
Firebase AI SDK
เริ่มต้นใช้งาน Gemini Live API โดยใช้ Firebase AI Logic