Google Cloud Kubernetes Engine 提供多種部署選項,可使用偏好的開發架構,以高效能和低延遲的方式執行 Gemma 模型。請參閱下列部署指南,瞭解如何使用 JetStream 在 GPU 和 TPU 上執行 Hugging Face、vLLM 和 TensorRT-LLM,以及應用程式和微調指南:
部署及提供服務
透過 vLLM 在 GPU 提供 Gemma 服務: 使用 vLLM 部署 Gemma,方便管理模型載入作業,並提高輸送量。
透過 TensorRT-LLM 在 GPU 提供 Gemma 服務: 使用 NVIDIA TensorRT-LLM 部署 Gemma,盡可能提高模型運作效率。
透過 JetStream 在 TPU 上提供 Gemma 服務: 在 TPU 處理器上透過 JetStream 部署 Gemma,實現高效能和低延遲。
分析資料
- 使用 BigQuery、Cloud Run 和 Gemma 分析 GKE 資料: 使用 BigQuery 和 Gemma 建構資料分析管道。
微調
- 使用多個 GPU 微調 Gemma 開放模型: 根據自己的資料集自訂 Gemma 的行為。