«میانای برنامهسازی کاربردی Live» امکان تعامل صوتی و تصویری با تأخیر کم و بهصورت همزمان با Gemini را فراهم میکند. این ابزار جاریسازیهای پیوسته صدا، تصویر، و نوشتار را پردازش میکند تا پاسخهای گفتاری فوری و شبیه انسان ارائه دهد و تجربه مکالمه طبیعی برای کاربران شما ایجاد کند.

موارد استفاده
از «میانای برنامهسازی کاربردی Live» میتوان برای ساختن کارگزاران صوتی همزمان برای صنایع مختلف استفاده کرد، ازجمله:
- تجارت الکترونیک و خردهفروشی: دستیاران خرید که توصیههای شخصیسازیشده ارائه میدهند و نمایندگان پشتیبانی که مشکلات مشتریان را حل میکنند.
- بازیهای کامپیوتری: شخصیتهای غیرقابل بازی تعاملی (NPC)، دستیارهای راهنمایی درونبازی، و ترجمه همزمان محتوای درونبازی.
- میاناهای نسل بعدی: تجربههای فعالشده با صدا و ویدیو در روباتیک، عینکهای هوشمند، و خودروها.
- خدمات درمانی: همراهان سلامت برای پشتیبانی و آموزش بیمار.
- خدمات مالی: مشاوران هوش مصنوعی برای مدیریت ثروت و راهنمایی سرمایهگذاری.
- آموزش: مربیان هوش مصنوعی و همراهان یادگیری که دستورالعملها و بازخوردهای شخصیسازیشده ارائه میدهند.
- ترجمه و بومیسازی: ترجمه همزمان و با تأخیر کم مکالمههای گفتاری، که امکان ارتباط چندزبانه یکپارچه را فراهم میکند.
- ترانویسی و زیرنویس ناشنوایان زنده: جاریسازی همزمان گفتار به نوشتار برای زیرنویس زنده، ترانویسی جلسه، دیکته صوتی، و گزارش تماس مشتری.
ویژگیهای مهم
«میانای برنامهسازی کاربردی زنده» مجموعه جامعی از ویژگیها را برای ساختن عاملهای صوتی قدرتمند ارائه میدهد:
- پشتیبانی چندزبانه: به ۷۰ زبان پشتیبانیشده مکالمه کنید.
- مداخله: کاربران میتوانند در هر زمانی برای تعاملات پاسخگو مدل را قطع کنند.
- استفاده از ابزار: ابزارهایی مثل فراخوانی تابع و «جستجوی Google» را برای تعاملهای پویا ادغام میکند.
- ترانویسیهای صوتی: ترانویسیهای نوشتاری از ورودی کاربر و برونداد مدل ارائه میدهد.
- صدای پیشکنشی: به شما امکان میدهد کنترل کنید مدل چه زمانی و در چه زمینههایی پاسخ دهد.
- گفتگوی عاطفی: سبک و لحن پاسخ را با بیان ورودی کاربر تطبیق میدهد.
- ترانویسی همزمان: جاریسازی همزمان و پیوسته گفتار به نوشتار با تشخیص خودکار زبان و واژگان سفارشی.
- ترجمه سریع: ترجمه همزمان گفتار به گفتار به بیشاز ۷۰ زبان.
مشخصات فنی
جدول زیر مشخصات فنی «میانای برنامهسازی کاربردی پخش زنده» را شرح میدهد:
| دسته | جزئیات |
|---|---|
| روشهای ورودی | صوت (صوت PCM خام ۱۶ بیتی، ۱۶ کیلوهرتز، ترتیب کوچک)، تصاویر (JPEG <= 1FPS)، نوشتار |
| روشهای برونداد | صوتی (صوت PCM خام ۱۶ بیتی، ۲۴ کیلوهرتز، ترتیب کوچک) |
| پروتکل | اتصال WebSocket حالتدار (WSS) |
انتخاب رویکرد پیادهسازی
هنگام ادغام با «میانای برنامهسازی کاربردی پخش زنده»، باید یکی از رویکردهای پیادهسازی زیر را انتخاب کنید:
- سرور به سرور: زیرینه شما بااستفاده از WebSockets به Live API متصل میشود. معمولاً، کارخواه شما دادههای جاریسازی (صوت، ویدیو، نوشتار) را به سرورتان ارسال میکند، که سپس آن را به «میانای برنامهسازی کاربردی پخش زنده» ارسال میکند.
- کارخواه به سرور: کد پیشبر شما مستقیماً بااستفاده از WebSockets به «میانای برنامهسازی کاربردی پخش زنده» متصل میشود تا دادهها را جاریسازی کند و از پشتیبان خود عبور کند.
شروع کنید
راهنمایی را که با محیط توسعه شما مطابقت دارد انتخاب کنید:
آموزش گامبهگام کیت توسعه نرمافزار GenAI
بااستفاده از GenAI SDK به Gemini Live API متصل شوید تا برنامه چندوجهی همزمان با زیرینه Python بسازید.
آموزش WebSocket
بااستفاده از WebSockets به Gemini Live API متصل شوید تا برنامه چندوجهی همزمان با پیشزمین جاوا اسکریپت و نشانهای موقت بسازید.
آموزش گامبهگام ADK
عاملی ایجاد کنید و از «جاریسازی کیت توسعه عامل» (ADK) برای فعال کردن ارتباط صوتی و تصویری استفاده کنید.
ادغامهای شریک
برای سادهسازی توسعه برنامههای صوتی و تصویری همزمان، میتوانید از ادغام طرف ثالثی که از Gemini Live API ازطریق WebRTC یا WebSockets پشتیبانی میکند استفاده کنید.
LiveKit
از Gemini Live API با LiveKit Agents استفاده کنید.
Pipecat by Daily
بااستفاده از Gemini Live و Pipecat، روبات گپ هوش مصنوعی همزمان ایجاد کنید.
Fishjam از Software Mansion
با Fishjam، برنامههای جاریسازی زنده صوتی و تصویری ایجاد کنید.
عاملهای Vision براساس جاریسازی
با «عاملهای دیداری»، برنامههای هوش مصنوعی صوتی و تصویری همزمان بسازید.
Voximplant
تماسهای ورودی و خروجی را با Voximplant به «میانای برنامهسازی کاربردی Live» متصل کنید.
Agora
با Agora، برنامههای هوش مصنوعی مکالمهای همزمان بسازید.
کیت توسعه نرمافزار هوش مصنوعی Firebase
بااستفاده از Firebase AI Logic، کار با Gemini Live API را شروع کنید.