Google Cloud Kubernetes Engine は、優先する開発フレームワークを使用して、高パフォーマンスと低レイテンシで Gemma モデルを実行するための幅広いデプロイ オプションを提供します。GPU 上の Hugging Face、vLLM、TensorRT-LLM、JetStream を使用した TPU 実行に関する次のデプロイガイドと、アプリケーションとチューニングのガイドをご覧ください。
デプロイとサービス提供
vLLM を使用して GPU で Gemma をサービングする: vLLM を使用して Gemma をデプロイし、モデルの読み込み管理を容易にし、高スループットを実現します。
TensorRT-LLM を使用して GPU で Gemma を提供する: NVIDIA TensorRT-LLM を使用して Gemma をデプロイし、モデルの運用効率を最大化します。
JetStream を使用して TPU で Gemma を提供する: 高パフォーマンスと低レイテンシを実現するために、TPU プロセッサで JetStream を使用して Gemma をデプロイします。
データの分析
- BigQuery、Cloud Run、Gemma を使用して GKE のデータを分析する: BigQuery と Gemma を使用してデータ分析パイプラインを構築します。
ファインチューニング
- 複数の GPU を使用して Gemma オープンモデルをファインチューニングする: 独自のデータセットに基づいて Gemma の動作をカスタマイズします。