Gemma را با موتور Kubernetes اجرا کنید

موتور کوبرنتیز گوگل کلود (Google Cloud Kubernetes Engine) طیف گسترده‌ای از گزینه‌های استقرار را برای اجرای مدل‌های Gemma با عملکرد بالا و تأخیر کم با استفاده از چارچوب‌های توسعه ترجیحی ارائه می‌دهد. راهنماهای استقرار زیر را برای اجرای Hugging Face، vLLM، TensorRT-LLM روی GPUها و TPU با JetStream، به علاوه راهنماهای برنامه و تنظیم، بررسی کنید:

مستقر و خدمت رسانی

تجزیه و تحلیل داده‌ها

تنظیم دقیق