使用 Kubernetes Engine 运行 Gemma

Google Cloud Kubernetes Engine 提供多种部署选项,可使用首选的开发框架以高性能和低延迟运行 Gemma 模型。请参阅以下部署指南,了解如何使用 JetStream 在 GPU 和 TPU 上部署 Hugging Face、vLLM、TensorRT-LLM,以及应用和调优指南:

部署并提供

分析数据

微调