توفّر خدمة Google Cloud Kubernetes Engine مجموعة كبيرة من خيارات النشر لتشغيل نماذج Gemma بأداء عالٍ ووقت استجابة سريع باستخدام أُطر التطوير المفضّلة. يمكنك الاطّلاع على أدلة النشر التالية بشأن Hugging Face وvLLM وTensorRT-LLM على وحدات معالجة الرسومات وتنفيذ TPU باستخدام JetStream، بالإضافة إلى أدلة التطبيقات والضبط:
التفعيل والعرض
تشغيل Gemma على وحدات معالجة الرسومات باستخدام vLLM: يمكنك نشر Gemma باستخدام vLLM لإدارة تحميل النماذج بسهولة وتحقيق معدل نقل بيانات مرتفع.
تشغيل Gemma على وحدات معالجة الرسومات باستخدام TensorRT-LLM: يمكنك نشر Gemma باستخدام NVIDIA TensorRT-LLM لتحقيق أقصى قدر من كفاءة تشغيل النموذج.
تشغيل Gemma على وحدات معالجة الموتّرات باستخدام JetStream: يمكنك نشر Gemma باستخدام JetStream على معالِجات وحدات معالجة الموتّرات للحصول على أداء عالٍ ووقت استجابة منخفض.
تحليل البيانات
- تحليل البيانات على GKE باستخدام BigQuery وCloud Run وGemma: يمكنك إنشاء مسار لمعالجة البيانات وتحليلها باستخدام BigQuery وGemma.
ضبط دقيق
- ضبط نماذج Gemma المتاحة للجميع باستخدام وحدات معالجة الرسومات المتعددة: يمكنك تخصيص سلوك Gemma استنادًا إلى مجموعة البيانات الخاصة بك.