Gemma'yı Kubernetes Engine ile çalıştırma

Google Cloud Kubernetes Engine, tercih edilen geliştirme çerçevelerini kullanarak Gemma modellerini yüksek performans ve düşük gecikme süresiyle çalıştırmak için çeşitli dağıtım seçenekleri sunar. HuggingFace, vLLM, GPU'larda TensorRT-LLM ve JetStream ile TPU yürütme için aşağıdaki dağıtım kılavuzlarının yanı sıra uygulama ve ayarlama kılavuzlarına göz atın:

Dağıtma ve yayınlama

Verileri analiz etme

Hassas ayar