Google Cloud Kubernetes Engine 提供多种部署选项,可使用首选的开发框架以高性能和低延迟运行 Gemma 模型。请参阅以下部署指南,了解如何使用 JetStream 在 GPU 和 TPU 上部署 Hugging Face、vLLM、TensorRT-LLM,以及应用和调优指南:
部署并提供
使用 vLLM 在 GPU 上提供 Gemma 服务:使用 vLLM 部署 Gemma,以便轻松管理模型加载并实现高吞吐量。
使用 TensorRT-LLM 在 GPU 上提供 Gemma 服务:使用 NVIDIA TensorRT-LLM 部署 Gemma,以最大限度地提高模型运行效率。
通过 JetStream 在 TPU 上提供 Gemma:在 TPU 处理器上通过 JetStream 部署 Gemma,以实现高性能和低延迟。
分析数据
- 使用 BigQuery、Cloud Run 和 Gemma 在 GKE 上分析数据:使用 BigQuery 和 Gemma 构建数据分析流水线。
微调
- 使用多个 GPU 微调 Gemma 开放模型:根据您自己的数据集自定义 Gemma 的行为。