Kubernetes Engine で Gemma を実行する

Google Cloud Kubernetes Engine は、優先する開発フレームワークを使用して、高パフォーマンスと低レイテンシで Gemma モデルを実行するための幅広いデプロイ オプションを提供します。GPU 上の Hugging Face、vLLM、TensorRT-LLM、JetStream を使用した TPU 実行に関する次のデプロイガイドと、アプリケーションとチューニングのガイドをご覧ください。

デプロイとサービス提供

データの分析

ファインチューニング