Übersicht über die Gemini Live API

Die Live API ermöglicht latenzarme Sprach- und Bildinteraktionen in Echtzeit mit Gemini. Die Funktion verarbeitet kontinuierliche Audio-, Bild- und Textstreams und liefert sofortige, menschenähnliche gesprochene Antworten, wodurch eine natürliche Konversation für Ihre Nutzer entsteht.

Live API – Übersicht

Anwendungsfälle

Mit der Live API können Sie Echtzeit-Sprach-Agents für eine Vielzahl von Branchen erstellen, darunter:

  • E-Commerce und Einzelhandel:Shopping-Assistenten, die personalisierte Empfehlungen geben, und Support-Agenten, die Kundenprobleme lösen.
  • Gaming:Interaktive Non-Player Characters (NPCs), In-Game-Hilfeassistenten und Echtzeitübersetzung von In-Game-Inhalten.
  • Schnittstellen der nächsten Generation:Sprach- und videobasierte Funktionen in Robotern, Smart Glasses und Fahrzeugen.
  • Gesundheitswesen:Gesundheitsbegleiter zur Unterstützung und Aufklärung von Patienten.
  • Finanzdienstleistungen:KI-Berater für Vermögensverwaltung und Anlageberatung.
  • Bildung:KI-Mentoren und Lernbegleiter, die personalisierte Anleitungen und Feedback geben.
  • Übersetzung und Lokalisierung:Übersetzung von gesprochenen Unterhaltungen in Echtzeit mit geringer Latenz, um eine nahtlose mehrsprachige Kommunikation zu ermöglichen.
  • Automatische Transkription und Untertitelung:Echtzeit-Streaming von Sprache zu Text für Live-Untertitel, Besprechungstranskription, Sprachsteuerung und Protokollierung von Kundenanrufen.

Wichtige Features

Die Live API bietet eine umfassende Reihe von Funktionen zum Erstellen leistungsstarker Sprach-Agents:

  • Unterstützung mehrerer Sprachen: Unterhalten Sie sich in 70 unterstützten Sprachen.
  • Barge-in: Nutzer können das Modell jederzeit unterbrechen, um responsive Interaktionen zu starten.
  • Toolnutzung: Integriert Tools wie Funktionsaufrufe und die Google Suche für dynamische Interaktionen.
  • Audio-Transkriptionen: Bietet Texttranskripte sowohl der Nutzereingabe als auch der Modellausgabe.
  • Proaktive Audioausgabe: Damit können Sie steuern, wann und in welchen Kontexten das Modell antwortet.
  • Affektiver Dialog: Passt den Antwortstil und den Tonfall an die Ausdrucksweise des Nutzers an.
  • Automatische Transkription: Kontinuierliches Speech-to-Text-Streaming in Echtzeit mit automatischer Spracherkennung und benutzerdefiniertem Vokabular.
  • Live-Übersetzung: Echtzeit-Sprachübersetzung in über 70 Sprachen.

Technische Daten

In der folgenden Tabelle sind die technischen Spezifikationen für die Live API aufgeführt:

Kategorie Details
Eingabemodalitäten Audio (rohes 16-Bit-PCM-Audio, 16 kHz, Little Endian), Bilder (JPEG <= 1 FPS), Text
Ausgabemodalitäten Audio (rohes 16‑Bit-PCM-Audio, 24 kHz, Little Endian)
Protokoll Zustandsbehaftete WebSocket-Verbindung (WSS)

Implementierungsansatz auswählen

Bei der Integration mit der Live API müssen Sie einen der folgenden Implementierungsansätze auswählen:

  • Server-zu-Server: Ihr Backend stellt über WebSockets eine Verbindung zur Live API her. Normalerweise sendet Ihr Client Streamdaten (Audio, Video, Text) an Ihren Server, der sie dann an die Live API weiterleitet.
  • Client-zu-Server: Ihr Frontend-Code stellt direkt über WebSockets eine Verbindung zur Live API her, um Daten zu streamen. Ihr Backend wird dabei umgangen.

Jetzt starten

Wählen Sie den Leitfaden aus, der Ihrer Entwicklungsumgebung entspricht:

Server-zu-Server

Verbinden Sie sich mit der Gemini Live API über das GenAI SDK, um eine multimodale Echtzeitanwendung mit einem Python-Backend zu erstellen.

Client-zu-Server

Verbinden Sie sich über WebSockets mit der Gemini Live API, um eine multimodale Echtzeitanwendung mit einem JavaScript-Frontend und temporären Tokens zu erstellen.

Agent Development Kit

Erstellen Sie einen Agenten und verwenden Sie das Agent Development Kit (ADK) Streaming, um Sprach- und Videokommunikation zu ermöglichen.

Einbindung in Partnerlösungen

Um die Entwicklung von Echtzeit-Audio- und ‑Video-Apps zu vereinfachen, können Sie eine Drittanbieterintegration verwenden, die die Gemini Live API über WebRTC oder WebSockets unterstützt.