Google Cloud Kubernetes Engine, Gemma मॉडल को बेहतर परफ़ॉर्मेंस और कम समय में प्रोसेस करने के लिए, डिप्लॉयमेंट के कई विकल्प उपलब्ध कराता है. इसके लिए, पसंदीदा डेवलपमेंट फ़्रेमवर्क का इस्तेमाल किया जा सकता है. Hugging Face, vLLM, जीपीयू पर TensorRT-LLM, और JetStream के साथ TPU पर एक्ज़ीक्यूशन के लिए, डिप्लॉयमेंट से जुड़ी ये गाइड देखें. इसके अलावा, ऐप्लिकेशन और ट्यूनिंग से जुड़ी गाइड भी देखें:
डिप्लॉय और सर्व करना
vLLM की मदद से, जीपीयू पर Gemma को सर्व करना: मॉडल लोड को आसानी से मैनेज करने और ज़्यादा थ्रूपुट के लिए, vLLM की मदद से Gemma को डिप्लॉय करें.
TensorRT-LLM की मदद से, जीपीयू पर Gemma को सर्व करना: मॉडल के ऑपरेशन की क्षमता को ज़्यादा से ज़्यादा करने के लिए, NVIDIA TensorRT-LLM की मदद से Gemma को डिप्लॉय करें.
JetStream की मदद से, TPU पर Gemma को सर्व करना: बेहतर परफ़ॉर्मेंस और कम समय में प्रोसेस करने के लिए, TPU प्रोसेसर पर JetStream की मदद से Gemma को डिप्लॉय करें.
डेटा का विश्लेषण करें
- BigQuery, Cloud Run, और Gemma का इस्तेमाल करके, GKE पर डेटा का विश्लेषण करना: BigQuery और Gemma की मदद से, डेटा के विश्लेषण के लिए पाइपलाइन बनाएं.
फ़ाइन-ट्यून
- एक से ज़्यादा जीपीयू का इस्तेमाल करके, Gemma के ओपन मॉडल को फ़ाइन-ट्यून करना: अपने डेटासेट के आधार पर, Gemma के व्यवहार को पसंद के मुताबिक बनाएं.