Google Cloud Kubernetes Engine cung cấp nhiều lựa chọn triển khai để chạy các mô hình Gemma với hiệu suất cao và độ trễ thấp bằng cách sử dụng các khung phát triển ưu tiên. Hãy xem các hướng dẫn triển khai sau đây cho Hugging Face, vLLM, TensorRT-LLM trên GPU và quá trình thực thi TPU bằng JetStream, cùng với hướng dẫn về ứng dụng và điều chỉnh:
Triển khai và phân phát
Triển khai Gemma trên GPU bằng vLLM: Triển khai Gemma bằng vLLM để quản lý tải mô hình một cách thuận tiện và đạt được thông lượng cao.
Phân phát Gemma trên GPU bằng TensorRT-LLM: Triển khai Gemma bằng NVIDIA TensorRT-LLM để tối đa hoá hiệu quả hoạt động của mô hình.
Triển khai Gemma trên TPU bằng JetStream: Triển khai Gemma bằng JetStream trên bộ xử lý TPU để có hiệu suất cao và độ trễ thấp.
Phân tích dữ liệu
- Phân tích dữ liệu trên GKE bằng BigQuery, Cloud Run và Gemma: Xây dựng quy trình phân tích dữ liệu bằng BigQuery và Gemma.
Tinh chỉnh
- Tinh chỉnh các mô hình nguồn mở Gemma bằng nhiều GPU: Tuỳ chỉnh hành vi của Gemma dựa trên tập dữ liệu của riêng bạn.