Die Live API ermöglicht latenzarme Sprach- und Bildinteraktionen in Echtzeit mit Gemini. Die Funktion verarbeitet kontinuierliche Audio-, Bild- und Textstreams und liefert sofortige, menschenähnliche gesprochene Antworten, wodurch eine natürliche Konversation für Ihre Nutzer entsteht.

Anwendungsfälle
Mit der Live API können Sie Echtzeit-Sprach-Agents für eine Vielzahl von Branchen erstellen, darunter:
- E-Commerce und Einzelhandel:Shopping-Assistenten, die personalisierte Empfehlungen geben, und Support-Agenten, die Kundenprobleme lösen.
- Gaming:Interaktive Non-Player Characters (NPCs), In-Game-Hilfeassistenten und Echtzeitübersetzung von In-Game-Inhalten.
- Schnittstellen der nächsten Generation:Sprach- und videobasierte Funktionen in Robotern, Smart Glasses und Fahrzeugen.
- Gesundheitswesen:Gesundheitsbegleiter zur Unterstützung und Aufklärung von Patienten.
- Finanzdienstleistungen:KI-Berater für Vermögensverwaltung und Anlageberatung.
- Bildung:KI-Mentoren und Lernbegleiter, die personalisierte Anleitungen und Feedback geben.
- Übersetzung und Lokalisierung:Übersetzung von gesprochenen Unterhaltungen in Echtzeit mit geringer Latenz, um eine nahtlose mehrsprachige Kommunikation zu ermöglichen.
- Automatische Transkription und Untertitelung:Echtzeit-Streaming von Sprache zu Text für Live-Untertitel, Besprechungstranskription, Sprachsteuerung und Protokollierung von Kundenanrufen.
Wichtige Features
Die Live API bietet eine umfassende Reihe von Funktionen zum Erstellen leistungsstarker Sprach-Agents:
- Unterstützung mehrerer Sprachen: Unterhalten Sie sich in 70 unterstützten Sprachen.
- Barge-in: Nutzer können das Modell jederzeit unterbrechen, um responsive Interaktionen zu starten.
- Toolnutzung: Integriert Tools wie Funktionsaufrufe und die Google Suche für dynamische Interaktionen.
- Audio-Transkriptionen: Bietet Texttranskripte sowohl der Nutzereingabe als auch der Modellausgabe.
- Proaktive Audioausgabe: Damit können Sie steuern, wann und in welchen Kontexten das Modell antwortet.
- Affektiver Dialog: Passt den Antwortstil und den Tonfall an die Ausdrucksweise des Nutzers an.
- Automatische Transkription: Kontinuierliches Speech-to-Text-Streaming in Echtzeit mit automatischer Spracherkennung und benutzerdefiniertem Vokabular.
- Live-Übersetzung: Echtzeit-Sprachübersetzung in über 70 Sprachen.
Technische Daten
In der folgenden Tabelle sind die technischen Spezifikationen für die Live API aufgeführt:
| Kategorie | Details |
|---|---|
| Eingabemodalitäten | Audio (rohes 16-Bit-PCM-Audio, 16 kHz, Little Endian), Bilder (JPEG <= 1 FPS), Text |
| Ausgabemodalitäten | Audio (rohes 16‑Bit-PCM-Audio, 24 kHz, Little Endian) |
| Protokoll | Zustandsbehaftete WebSocket-Verbindung (WSS) |
Implementierungsansatz auswählen
Bei der Integration mit der Live API müssen Sie einen der folgenden Implementierungsansätze auswählen:
- Server-zu-Server: Ihr Backend stellt über WebSockets eine Verbindung zur Live API her. Normalerweise sendet Ihr Client Streamdaten (Audio, Video, Text) an Ihren Server, der sie dann an die Live API weiterleitet.
- Client-zu-Server: Ihr Frontend-Code stellt direkt über WebSockets eine Verbindung zur Live API her, um Daten zu streamen. Ihr Backend wird dabei umgangen.
Jetzt starten
Wählen Sie den Leitfaden aus, der Ihrer Entwicklungsumgebung entspricht:
GenAI SDK-Tutorial
Verbinden Sie sich mit der Gemini Live API über das GenAI SDK, um eine multimodale Echtzeitanwendung mit einem Python-Backend zu erstellen.
WebSocket-Tutorial
Verbinden Sie sich über WebSockets mit der Gemini Live API, um eine multimodale Echtzeitanwendung mit einem JavaScript-Frontend und temporären Tokens zu erstellen.
ADK-Tutorial
Erstellen Sie einen Agenten und verwenden Sie das Agent Development Kit (ADK) Streaming, um Sprach- und Videokommunikation zu ermöglichen.
Einbindung in Partnerlösungen
Um die Entwicklung von Echtzeit-Audio- und ‑Video-Apps zu vereinfachen, können Sie eine Drittanbieterintegration verwenden, die die Gemini Live API über WebRTC oder WebSockets unterstützt.
LiveKit
Gemini Live API mit LiveKit-Agents verwenden
Pipecat von Daily
Erstellen Sie mit Gemini Live und Pipecat einen KI-Chatbot in Echtzeit.
Fishjam von Software Mansion
Mit Fishjam können Sie Anwendungen für Live-Video- und ‑Audiostreaming erstellen.
Vision Agents nach Stream
Mit Vision Agents können Sie KI-Anwendungen für Sprach- und Videoinhalte in Echtzeit entwickeln.
Voximplant
Eingehende und ausgehende Anrufe mit Voximplant mit der Live API verbinden
Agora
Mit Agora konversationelle KI-Anwendungen in Echtzeit entwickeln
Firebase AI SDK
Erste Schritte mit der Gemini Live API und Firebase AI Logic