Обзор Gemini Live API

Live API позволяет общаться с Gemini голосом и с помощью изображений в реальном времени с низкой задержкой. Он обрабатывает непрерывные потоки аудио, изображений и текста, чтобы предоставлять мгновенные ответы, похожие на человеческую речь, и создавать естественный разговорный интерфейс для ваших пользователей.

Обзор Live API

Примеры использования

Live API можно использовать для создания голосовых агентов в реальном времени для разных отраслей, в том числе:

  • Электронная торговля и розничная торговля. Помощники по покупкам, которые предлагают персонализированные рекомендации, и агенты службы поддержки, которые решают проблемы клиентов.
  • Игры. Интерактивные неигровые персонажи, помощники в игре и перевод игрового контента в реальном времени.
  • Интерфейсы нового поколения. Голосовые и видеоинтерфейсы для роботов, умных очков и автомобилей.
  • Здравоохранение. Помощники для пациентов, которые могут поддерживать и обучать их.
  • Финансовые услуги. ИИ-консультанты по управлению капиталом и инвестициям.
  • Образование. ИИ-наставники и помощники, которые предоставляют персонализированные инструкции и отзывы.
  • Перевод и локализация. Перевод устной речи в реальном времени с низкой задержкой, позволяющий общаться на разных языках.
  • Прямая расшифровка и субтитры. Преобразование речи в текст в реальном времени для создания субтитров, расшифровки встреч, голосового ввода и записи звонков клиентов.

Основные функции

Действующий API предлагает широкий набор функций для создания надежных голосовых агентов:

Технические требования

В таблице ниже приведены технические характеристики Live API.

Категория Сведения
Способы ввода Аудио (необработанный 16-битный звук PCM, 16 кГц, little-endian), изображения (JPEG, не более 1 кадра в секунду), текст
Выходные модальности Аудио (необработанный звук PCM 16 бит, 24 кГц, little-endian)
Протокол Подключение WebSocket с сохранением состояния (WSS)

Как реализовать отслеживание конверсий

При интеграции с Live API вам нужно будет выбрать один из следующих подходов к реализации:

  • Сервер-сервер. Ваш сервер подключается к Live API с помощью WebSockets. Как правило, клиент отправляет данные трансляции (аудио, видео, текст) на ваш сервер, который затем пересылает их в Live API.
  • Клиент-сервер. Код интерфейса напрямую подключается к Live API с помощью WebSockets для передачи данных, минуя внутренний сервер.

Начать

Выберите руководство, соответствующее вашей среде разработки:

Межсерверное

Подключитесь к Gemini Live API с помощью GenAI SDK, чтобы создать мультимодальное приложение реального времени с бэкэндом на Python.

Клиент – сервер

Подключитесь к Gemini Live API с помощью WebSockets, чтобы создать мультимодальное приложение, работающее в реальном времени, с клиентской частью на JavaScript и временными токенами.

Набор для разработки агентов

Создайте агента и используйте потоковую передачу Agent Development Kit (ADK), чтобы включить голосовую и видеосвязь.

Интеграция с партнерами

Чтобы упростить разработку аудио- и видеоприложений, работающих в реальном времени, можно использовать стороннюю интеграцию, которая поддерживает Gemini Live API через WebRTC или WebSockets.