Google Cloud Kubernetes Engine มีตัวเลือกการติดตั้งใช้งานที่หลากหลายสำหรับการเรียกใช้โมเดล Gemma ด้วยประสิทธิภาพสูงและความหน่วงแฝงต่ำโดยใช้เฟรมเวิร์กการพัฒนาที่ต้องการ ดูคำแนะนำในการติดตั้งใช้งานต่อไปนี้สำหรับ Hugging Face, vLLM, TensorRT-LLM บน GPU และการดำเนินการ TPU ด้วย JetStream รวมถึงคำแนะนำเกี่ยวกับแอปพลิเคชันและการปรับแต่ง
ติดตั้งใช้งานและแสดงผล
แสดงผล Gemma บน GPU ด้วย vLLM: ติดตั้งใช้งาน Gemma ด้วย vLLM เพื่อการจัดการการโหลดโมเดลที่สะดวกและ มีปริมาณงานสูง
แสดงผล Gemma บน GPU ด้วย TensorRT-LLM: ติดตั้งใช้งาน Gemma ด้วย NVIDIA TensorRT-LLM เพื่อเพิ่มประสิทธิภาพการทำงานของโมเดลให้สูงสุด
แสดงผล Gemma บน TPU ด้วย JetStream: ติดตั้งใช้งาน Gemma ด้วย JetStream บนโปรเซสเซอร์ TPU เพื่อประสิทธิภาพสูงและความหน่วงแฝงต่ำ
วิเคราะห์ข้อมูล
- วิเคราะห์ข้อมูลบน GKE โดยใช้ BigQuery, Cloud Run และ Gemma: สร้างไปป์ไลน์การวิเคราะห์ข้อมูลด้วย BigQuery และ Gemma
ปรับแต่ง
- ปรับแต่งโมเดลโอเพนซอร์ส Gemma โดยใช้ GPU หลายตัว: ปรับแต่งลักษณะการทำงานของ Gemma ตามชุดข้อมูลของคุณเอง