Google Cloud Kubernetes Engine은 선호하는 개발 프레임워크를 사용하여 고성능 및 짧은 지연 시간으로 Gemma 모델을 실행하기 위한 다양한 배포 옵션을 제공합니다. GPU의 Hugging Face, vLLM, TensorRT-LLM, JetStream을 사용한 TPU 실행, 애플리케이션, 튜닝 가이드는 다음 배포 가이드를 확인하세요.
배포 및 서빙
vLLM을 사용해서 GPU에서 Gemma 제공: 편리한 모델 로드 관리 및 높은 처리량을 위해 vLLM으로 Gemma를 배포합니다.
TensorRT-LLM을 사용해서 GPU에서 Gemma 제공: 모델 작동 효율성을 극대화하기 위해 NVIDIA TensorRT-LLM으로 Gemma를 배포합니다.
JetStream을 사용하여 TPU에서 Gemma 제공: 고성능 및 짧은 지연 시간을 위해 TPU 프로세서에서 JetStream으로 Gemma를 배포합니다.
데이터 분석
- BigQuery, Cloud Run, Gemma를 사용하여 GKE에서 데이터 분석: BigQuery 및 Gemma로 데이터 분석 파이프라인을 빌드합니다.
미세 조정
- 여러 GPU를 사용하여 Gemma 개방형 모델 파인 튜닝: 자체 데이터 세트를 기반으로 Gemma의 동작을 맞춤설정합니다.