Google Cloud Kubernetes Engine bietet eine Vielzahl von Bereitstellungsoptionen zum Ausführen von Gemma-Modellen mit hoher Leistung und niedriger Latenz mithilfe bevorzugter Entwicklungsframeworks. Weitere Informationen finden Sie in den folgenden Bereitstellungsleitfäden für Hugging Face, vLLM, TensorRT-LLM auf GPUs und TPU-Ausführung mit JetStream sowie in den Anwendungs- und Optimierungsleitfäden:
Bereitstellen und bereitstellen
Gemma auf GPUs mit vLLM bereitstellen: Stellen Sie Gemma mit vLLM bereit, um das Laden von Modellen zu vereinfachen und einen hohen Durchsatz zu erzielen.
Gemma auf GPUs mit TensorRT-LLM bereitstellen: Stellen Sie Gemma mit NVIDIA TensorRT-LLM bereit, um die Effizienz des Modellbetriebs zu maximieren.
Gemma auf TPUs mit JetStream bereitstellen: Stellen Sie Gemma mit JetStream auf TPU-Prozessoren bereit, um eine hohe Leistung und niedrige Latenz zu erzielen.
Daten analysieren
- Daten in GKE mit BigQuery, Cloud Run und Gemma analysieren: Erstellen Sie eine Datenanalysepipeline mit BigQuery und Gemma.
Abstimmung
- Offene Gemma-Modelle mit mehreren GPUs optimieren: Passen Sie das Verhalten von Gemma an Ihr eigenes Dataset an.