Google Cloud Kubernetes Engine, tercih edilen geliştirme çerçevelerini kullanarak Gemma modellerini yüksek performans ve düşük gecikme süresiyle çalıştırmak için çeşitli dağıtım seçenekleri sunar. HuggingFace, vLLM, GPU'larda TensorRT-LLM ve JetStream ile TPU yürütme için aşağıdaki dağıtım kılavuzlarının yanı sıra uygulama ve ayarlama kılavuzlarına göz atın:
Dağıtma ve yayınlama
vLLM ile GPU'larda Gemma'yı sunma: Kolay model yükleme yönetimi ve yüksek işleme hızı için Gemma'yı vLLM ile dağıtın.
TensorRT-LLM ile GPU'larda Gemma'yı sunma: Model işlem verimliliğini en üst düzeye çıkarmak için Gemma'yı NVIDIA TensorRT-LLM ile dağıtın.
JetStream ile TPU'larda Gemma'yı sunma: Yüksek performans ve düşük gecikme için Gemma'yı TPU işlemcilerde JetStream ile dağıtın.
Verileri analiz etme
- BigQuery, Cloud Run ve Gemma'yı kullanarak GKE'deki verileri analiz etme: BigQuery ve Gemma ile bir veri analizi ardışık düzeni oluşturun.
Hassas ayar
- Birden fazla GPU kullanarak Gemma açık modellerine ince ayar yapma: Gemma'nın davranışını kendi veri kümenize göre özelleştirin.