Kubernetes Engine으로 Gemma 실행

Google Cloud Kubernetes Engine은 선호하는 개발 프레임워크를 사용하여 고성능 및 짧은 지연 시간으로 Gemma 모델을 실행하기 위한 다양한 배포 옵션을 제공합니다. GPU의 Hugging Face, vLLM, TensorRT-LLM, JetStream을 사용한 TPU 실행, 애플리케이션, 튜닝 가이드는 다음 배포 가이드를 확인하세요.

배포 및 서빙

데이터 분석

미세 조정