نمای کلی Gemini Live API

«میانای برنامه‌سازی کاربردی Live» امکان تعامل صوتی و تصویری با تأخیر کم و به‌صورت هم‌زمان با Gemini را فراهم می‌کند. این ابزار جاری‌سازی‌های پیوسته صدا، تصویر، و نوشتار را پردازش می‌کند تا پاسخ‌های گفتاری فوری و شبیه انسان ارائه دهد و تجربه مکالمه طبیعی برای کاربران شما ایجاد کند.

نمای کلی Live API

موارد استفاده

از «میانای برنامه‌سازی کاربردی Live» می‌توان برای ساختن کارگزاران صوتی هم‌زمان برای صنایع مختلف استفاده کرد، ازجمله:

  • تجارت الکترونیک و خرده‌فروشی: دستیاران خرید که توصیه‌های شخصی‌سازی‌شده ارائه می‌دهند و نمایندگان پشتیبانی که مشکلات مشتریان را حل می‌کنند.
  • بازی‌های کامپیوتری: شخصیت‌های غیرقابل بازی تعاملی (NPC)، دستیارهای راهنمایی درون‌بازی، و ترجمه هم‌زمان محتوای درون‌بازی.
  • میاناهای نسل بعدی: تجربه‌های فعال‌شده با صدا و ویدیو در روباتیک، عینک‌های هوشمند، و خودروها.
  • خدمات درمانی: همراهان سلامت برای پشتیبانی و آموزش بیمار.
  • خدمات مالی: مشاوران هوش مصنوعی برای مدیریت ثروت و راهنمایی سرمایه‌گذاری.
  • آموزش: مربیان هوش مصنوعی و همراهان یادگیری که دستورالعمل‌ها و بازخوردهای شخصی‌سازی‌شده ارائه می‌دهند.
  • ترجمه و بومی‌سازی: ترجمه هم‌زمان و با تأخیر کم مکالمه‌های گفتاری، که امکان ارتباط چندزبانه یکپارچه را فراهم می‌کند.
  • ترانویسی و زیرنویس ناشنوایان زنده: جاری‌سازی هم‌زمان گفتار به نوشتار برای زیرنویس زنده، ترانویسی جلسه، دیکته صوتی، و گزارش تماس مشتری.

ویژگی‌های مهم

«میانای برنامه‌سازی کاربردی زنده» مجموعه جامعی از ویژگی‌ها را برای ساختن عامل‌های صوتی قدرتمند ارائه می‌دهد:

  • پشتیبانی چندزبانه: به ۷۰ زبان پشتیبانی‌شده مکالمه کنید.
  • مداخله: کاربران می‌توانند در هر زمانی برای تعاملات پاسخ‌گو مدل را قطع کنند.
  • استفاده از ابزار: ابزارهایی مثل فراخوانی تابع و «جستجوی Google» را برای تعامل‌های پویا ادغام می‌کند.
  • ترانویسی‌های صوتی: ترانویسی‌های نوشتاری از ورودی کاربر و برونداد مدل ارائه می‌دهد.
  • صدای پیش‌کنشی: به شما امکان می‌دهد کنترل کنید مدل چه زمانی و در چه زمینه‌هایی پاسخ دهد.
  • گفتگوی عاطفی: سبک و لحن پاسخ را با بیان ورودی کاربر تطبیق می‌دهد.
  • ترانویسی هم‌زمان: جاری‌سازی هم‌زمان و پیوسته گفتار به نوشتار با تشخیص خودکار زبان و واژگان سفارشی.
  • ترجمه سریع: ترجمه هم‌زمان گفتار به گفتار به بیش‌از ۷۰ زبان.

مشخصات فنی

جدول زیر مشخصات فنی «میانای برنامه‌سازی کاربردی پخش زنده» را شرح می‌دهد:

دسته جزئیات
روش‌های ورودی صوت (صوت PCM خام ۱۶ بیتی، ۱۶ کیلوهرتز، ترتیب کوچک)، تصاویر (JPEG <= 1FPS)، نوشتار
روش‌های برونداد صوتی (صوت PCM خام ۱۶ بیتی، ۲۴ کیلوهرتز، ترتیب کوچک)
پروتکل اتصال WebSocket حالت‌دار (WSS)

انتخاب رویکرد پیاده‌سازی

هنگام ادغام با «میانای برنامه‌سازی کاربردی پخش زنده»، باید یکی از رویکردهای پیاده‌سازی زیر را انتخاب کنید:

  • سرور به سرور: زیرینه شما بااستفاده از WebSockets به Live API متصل می‌شود. معمولاً، کارخواه شما داده‌های جاری‌سازی (صوت، ویدیو، نوشتار) را به سرورتان ارسال می‌کند، که سپس آن را به «میانای برنامه‌سازی کاربردی پخش زنده» ارسال می‌کند.
  • کارخواه به سرور: کد پیش‌بر شما مستقیماً بااستفاده از WebSockets به «میانای برنامه‌سازی کاربردی پخش زنده» متصل می‌شود تا داده‌ها را جاری‌سازی کند و از پشتیبان خود عبور کند.

شروع کنید

راهنمایی را که با محیط توسعه شما مطابقت دارد انتخاب کنید:

سرور به سرور

بااستفاده از GenAI SDK به Gemini Live API متصل شوید تا برنامه چندوجهی هم‌زمان با زیرینه Python بسازید.

کاربر به سرور

بااستفاده از WebSockets به Gemini Live API متصل شوید تا برنامه چندوجهی هم‌زمان با پیش‌زمین جاوا اسکریپت و نشان‌های موقت بسازید.

کیت توسعه عامل

عاملی ایجاد کنید و از «جاری‌سازی کیت توسعه عامل» (ADK) برای فعال کردن ارتباط صوتی و تصویری استفاده کنید.

ادغام‌های شریک

برای ساده‌سازی توسعه برنامه‌های صوتی و تصویری هم‌زمان، می‌توانید از ادغام طرف ثالثی که از Gemini Live API ازطریق WebRTC یا WebSockets پشتیبانی می‌کند استفاده کنید.