Interfejs Live API umożliwia interakcje głosowe i wizualne z Gemini w czasie rzeczywistym z niewielkimi opóźnieniami. Przetwarza on ciągłe strumienie audio, obrazów i tekstu, aby dostarczać natychmiastowe odpowiedzi głosowe przypominające ludzkie, co zapewnia użytkownikom naturalną rozmowę.

Przypadki użycia
Interfejs Live API może służyć do tworzenia agentów głosowych w czasie rzeczywistym w różnych branżach, m.in.:
- E-commerce i handel detaliczny: asystenci zakupów, którzy oferują spersonalizowane rekomendacje, oraz agenci obsługi klienta, którzy rozwiązują problemy klientów.
- Gry: interaktywne postacie niebędące graczami (NPC), asystenci pomocy w grze i tłumaczenie treści w grze w czasie rzeczywistym.
- Interfejsy nowej generacji: funkcje głosowe i wideo w robotyce, inteligentnych okularach i pojazdach.
- Opieka zdrowotna: towarzysze zdrowia, którzy wspierają pacjentów i edukują ich.
- Usługi finansowe: doradcy AI w zakresie zarządzania majątkiem i doradztwa inwestycyjnego.
- Edukacja: mentorzy AI i towarzysze uczniów, którzy zapewniają spersonalizowane instrukcje i informacje zwrotne.
- Tłumaczenie i lokalizacja: tłumaczenie rozmów w czasie rzeczywistym z niewielkimi opóźnieniami, co umożliwia płynną komunikację w wielu językach.
- Transkrypcja i napisy na żywo: przesyłanie strumieniowe mowy na tekst w czasie rzeczywistym na potrzeby napisów na żywo, transkrypcji spotkań, dyktowania głosowego i rejestrowania rozmów z klientami.
Najważniejsze funkcje
Interfejs Live API oferuje kompleksowy zestaw funkcji do tworzenia niezawodnych agentów głosowych:
- Obsługa wielu języków: rozmowy w 70 obsługiwanych językach.
- Przerwanie: użytkownicy mogą w każdej chwili przerwać model, aby uzyskać szybką reakcję.
- Korzystanie z narzędzi: integracja narzędzi takich jak wywoływanie funkcji i wyszukiwarka Google w celu dynamicznych interakcji.
- Transkrypcje audio: transkrypcje tekstowe danych wejściowych użytkownika i danych wyjściowych modelu.
- Proaktywny dźwięk: umożliwia kontrolowanie, kiedy i w jakich kontekstach model odpowiada.
- **Dialog afektywny**: dostosowuje styl i ton odpowiedzi do ekspresji użytkownika.
- Transkrypcja na żywo: przesyłanie strumieniowe mowy na tekst w czasie rzeczywistym z automatycznym wykrywaniem języka i niestandardowym słownictwem.
- Tłumaczenie na żywo: tłumaczenie głosu na głos w czasie rzeczywistym w ponad 70 językach.
Specyfikacja techniczna
W tabeli poniżej znajdziesz specyfikację techniczną interfejsu Live API:
| Kategoria | Szczegóły |
|---|---|
| Metody wprowadzania | Dźwięk (surowy 16-bitowy dźwięk PCM, 16 kHz, little-endian), obrazy (JPEG <= 1 FPS), tekst |
| Metody wyjściowe | Dźwięk (surowy 16-bitowy dźwięk PCM, 24 kHz, little-endian) |
| Protokół | Połączenie WebSocket z zachowaniem stanu (WSS) |
Wybierz metodę implementacji
Podczas integracji z interfejsem Live API musisz wybrać jedną z tych metod implementacji:
- Serwer-serwer: backend łączy się z interfejsem Live API za pomocą WebSockets. Zazwyczaj klient wysyła dane strumieniowe (audio, wideo, tekst) do serwera, który przekazuje je do interfejsu Live API.
- Klient-serwer: kod frontendu łączy się bezpośrednio z interfejsem Live API za pomocą protokołu WebSockets, aby przesyłać dane strumieniowo, pomijając backend.
Rozpocznij
Wybierz przewodnik odpowiedni dla Twojego środowiska programistycznego:
Samouczek pakietu GenAI SDK
Połącz się z interfejsem Gemini Live API za pomocą pakietu GenAI SDK, aby utworzyć multimodalną aplikację w czasie rzeczywistym z backendem w Pythonie.
Samouczek dotyczący protokołu WebSocket
Połącz się z interfejsem Gemini Live API za pomocą protokołu WebSocket, aby utworzyć multimodalną aplikację w czasie rzeczywistym z frontendem w JavaScript i tokenami tymczasowymi.
Samouczek pakietu ADK
Utwórz agenta i użyj pakietu Agent Development Kit (ADK) Streaming, aby włączyć komunikację głosową i wideo.
Integracje z partnerami
Aby usprawnić tworzenie aplikacji audio i wideo w czasie rzeczywistym, możesz użyć integracji innej firmy, która obsługuje interfejs Gemini Live API za pomocą WebRTC lub WebSocket.
LiveKit
Używaj interfejsu Gemini Live API z agentami LiveKit.
Pipecat by Daily
Utwórz chatbota AI w czasie rzeczywistym za pomocą Gemini Live i Pipecat.
Fishjam by Software Mansion
Twórz aplikacje do przesyłania strumieniowego audio i wideo na żywo za pomocą Fishjam.
Vision Agents by Stream
Twórz aplikacje AI do obsługi głosu i wideo w czasie rzeczywistym za pomocą Vision Agents.
Voximplant
Łącz połączenia przychodzące i wychodzące z interfejsem Live API za pomocą Voximplant.
Agora
Twórz aplikacje konwersacyjnej AI w czasie rzeczywistym za pomocą Agora.
Pakiet SDK Firebase AI
Rozpocznij korzystanie z interfejsu Gemini Live API za pomocą Firebase AI Logic.