เรียกใช้ Gemma ด้วย Kubernetes Engine

Google Cloud Kubernetes Engine มีตัวเลือกการติดตั้งใช้งานที่หลากหลายสำหรับการเรียกใช้โมเดล Gemma ด้วยประสิทธิภาพสูงและความหน่วงแฝงต่ำโดยใช้เฟรมเวิร์กการพัฒนาที่ต้องการ ดูคำแนะนำในการติดตั้งใช้งานต่อไปนี้สำหรับ Hugging Face, vLLM, TensorRT-LLM บน GPU และการดำเนินการ TPU ด้วย JetStream รวมถึงคำแนะนำเกี่ยวกับแอปพลิเคชันและการปรับแต่ง

ติดตั้งใช้งานและแสดงผล

วิเคราะห์ข้อมูล

ปรับแต่ง