Gemma mit der Kubernetes Engine ausführen

Google Cloud Kubernetes Engine bietet eine Vielzahl von Bereitstellungsoptionen zum Ausführen von Gemma-Modellen mit hoher Leistung und niedriger Latenz mithilfe bevorzugter Entwicklungsframeworks. Weitere Informationen finden Sie in den folgenden Bereitstellungsleitfäden für Hugging Face, vLLM, TensorRT-LLM auf GPUs und TPU-Ausführung mit JetStream sowie in den Anwendungs- und Optimierungsleitfäden:

Bereitstellen und bereitstellen

Daten analysieren

Abstimmung