Omówienie interfejsu Gemini Live API

Interfejs Live API umożliwia interakcje głosowe i wizualne z Gemini w czasie rzeczywistym z niewielkimi opóźnieniami. Przetwarza on ciągłe strumienie audio, obrazów i tekstu, aby dostarczać natychmiastowe odpowiedzi głosowe przypominające ludzkie, co zapewnia użytkownikom naturalną rozmowę.

Omówienie interfejsu Live API

Przypadki użycia

Interfejs Live API może służyć do tworzenia agentów głosowych w czasie rzeczywistym w różnych branżach, m.in.:

  • E-commerce i handel detaliczny: asystenci zakupów, którzy oferują spersonalizowane rekomendacje, oraz agenci obsługi klienta, którzy rozwiązują problemy klientów.
  • Gry: interaktywne postacie niebędące graczami (NPC), asystenci pomocy w grze i tłumaczenie treści w grze w czasie rzeczywistym.
  • Interfejsy nowej generacji: funkcje głosowe i wideo w robotyce, inteligentnych okularach i pojazdach.
  • Opieka zdrowotna: towarzysze zdrowia, którzy wspierają pacjentów i edukują ich.
  • Usługi finansowe: doradcy AI w zakresie zarządzania majątkiem i doradztwa inwestycyjnego.
  • Edukacja: mentorzy AI i towarzysze uczniów, którzy zapewniają spersonalizowane instrukcje i informacje zwrotne.
  • Tłumaczenie i lokalizacja: tłumaczenie rozmów w czasie rzeczywistym z niewielkimi opóźnieniami, co umożliwia płynną komunikację w wielu językach.
  • Transkrypcja i napisy na żywo: przesyłanie strumieniowe mowy na tekst w czasie rzeczywistym na potrzeby napisów na żywo, transkrypcji spotkań, dyktowania głosowego i rejestrowania rozmów z klientami.

Najważniejsze funkcje

Interfejs Live API oferuje kompleksowy zestaw funkcji do tworzenia niezawodnych agentów głosowych:

  • Obsługa wielu języków: rozmowy w 70 obsługiwanych językach.
  • Przerwanie: użytkownicy mogą w każdej chwili przerwać model, aby uzyskać szybką reakcję.
  • Korzystanie z narzędzi: integracja narzędzi takich jak wywoływanie funkcji i wyszukiwarka Google w celu dynamicznych interakcji.
  • Transkrypcje audio: transkrypcje tekstowe danych wejściowych użytkownika i danych wyjściowych modelu.
  • Proaktywny dźwięk: umożliwia kontrolowanie, kiedy i w jakich kontekstach model odpowiada.
  • **Dialog afektywny**: dostosowuje styl i ton odpowiedzi do ekspresji użytkownika.
  • Transkrypcja na żywo: przesyłanie strumieniowe mowy na tekst w czasie rzeczywistym z automatycznym wykrywaniem języka i niestandardowym słownictwem.
  • Tłumaczenie na żywo: tłumaczenie głosu na głos w czasie rzeczywistym w ponad 70 językach.

Specyfikacja techniczna

W tabeli poniżej znajdziesz specyfikację techniczną interfejsu Live API:

Kategoria Szczegóły
Metody wprowadzania Dźwięk (surowy 16-bitowy dźwięk PCM, 16 kHz, little-endian), obrazy (JPEG <= 1 FPS), tekst
Metody wyjściowe Dźwięk (surowy 16-bitowy dźwięk PCM, 24 kHz, little-endian)
Protokół Połączenie WebSocket z zachowaniem stanu (WSS)

Wybierz metodę implementacji

Podczas integracji z interfejsem Live API musisz wybrać jedną z tych metod implementacji:

  • Serwer-serwer: backend łączy się z interfejsem Live API za pomocą WebSockets. Zazwyczaj klient wysyła dane strumieniowe (audio, wideo, tekst) do serwera, który przekazuje je do interfejsu Live API.
  • Klient-serwer: kod frontendu łączy się bezpośrednio z interfejsem Live API za pomocą protokołu WebSockets, aby przesyłać dane strumieniowo, pomijając backend.

Rozpocznij

Wybierz przewodnik odpowiedni dla Twojego środowiska programistycznego:

Serwer-serwer

Połącz się z interfejsem Gemini Live API za pomocą pakietu GenAI SDK, aby utworzyć multimodalną aplikację w czasie rzeczywistym z backendem w Pythonie.

Klient-serwer

Połącz się z interfejsem Gemini Live API za pomocą protokołu WebSocket, aby utworzyć multimodalną aplikację w czasie rzeczywistym z frontendem w JavaScript i tokenami tymczasowymi.

Pakiet Agent Development Kit

Utwórz agenta i użyj pakietu Agent Development Kit (ADK) Streaming, aby włączyć komunikację głosową i wideo.

Integracje z partnerami

Aby usprawnić tworzenie aplikacji audio i wideo w czasie rzeczywistym, możesz użyć integracji innej firmy, która obsługuje interfejs Gemini Live API za pomocą WebRTC lub WebSocket.