موتور کوبرنتیز گوگل کلود (Google Cloud Kubernetes Engine) طیف گستردهای از گزینههای استقرار را برای اجرای مدلهای Gemma با عملکرد بالا و تأخیر کم با استفاده از چارچوبهای توسعه ترجیحی ارائه میدهد. راهنماهای استقرار زیر را برای اجرای Hugging Face، vLLM، TensorRT-LLM روی GPUها و TPU با JetStream، به علاوه راهنماهای برنامه و تنظیم، بررسی کنید:
مستقر و خدمت رسانی
استقرار Gemma روی GPUها با vLLM : Gemma را با vLLM برای مدیریت راحت بار مدل و افزایش توان عملیاتی مستقر کنید.
ارائه Gemma روی GPUها با TensorRT-LLM : Gemma را با NVIDIA TensorRT-LLM مستقر کنید تا راندمان عملکرد مدل را به حداکثر برسانید.
نصب Gemma روی TPUها با JetStream : Gemma را با JetStream روی پردازندههای TPU برای عملکرد بالا و تأخیر کم مستقر کنید.
تجزیه و تحلیل دادهها
- تجزیه و تحلیل دادهها در GKE با استفاده از BigQuery، Cloud Run و Gemma : ساخت یک خط لوله تجزیه و تحلیل دادهها با BigQuery و Gemma.
تنظیم دقیق
- تنظیم دقیق مدلهای باز Gemma با استفاده از چندین پردازنده گرافیکی : رفتار Gemma را بر اساس مجموعه دادههای خود سفارشی کنید.