使用 Kubernetes Engine 執行 Gemma

Google Cloud Kubernetes Engine 提供多種部署選項,可使用偏好的開發架構,以高效能和低延遲的方式執行 Gemma 模型。請參閱下列部署指南,瞭解如何使用 JetStream 在 GPU 和 TPU 上執行 Hugging Face、vLLM 和 TensorRT-LLM,以及應用程式和微調指南:

部署及提供服務

分析資料

微調