Google Cloud Kubernetes Engine מספק מגוון רחב של אפשרויות פריסה להרצת מודלים של Gemma עם ביצועים גבוהים וזמן אחזור נמוך באמצעות מסגרות פיתוח מועדפות. כדאי לעיין במדריכי הפריסה הבאים של HuggingFace, vLLM, TensorRT-LLM ב-GPU והרצת TPU עם JetStream, וגם במדריכים בנושא אפליקציות וכוונון:
פריסה והצגה
מילוי בקשות של Gemma ב-GPU באמצעות vLLM: פריסת Gemma באמצעות vLLM לניהול נוח של טעינת המודל ותפוקה גבוהה.
מילוי בקשות של Gemma ביחידות GPU באמצעות TensorRT-LLM: פריסת Gemma באמצעות NVIDIA TensorRT-LLM כדי למקסם את יעילות הפעולה של המודל.
Serve Gemma on TPUs with JetStream: Deploy Gemma with JetStream on TPU processors for high-performance and low latency.
ניתוח נתונים
- ניתוח נתונים ב-GKE באמצעות BigQuery, Cloud Run ו-Gemma: יצירת צינור לעיבוד נתונים באמצעות BigQuery ו-Gemma.
כוונון עדין
- שיפור מודלים פתוחים של Gemma באמצעות כמה מעבדים גרפיים: התאמה אישית של ההתנהגות של Gemma על סמך קבוצת נתונים משלכם.