Executar o Gemma com o Kubernetes Engine

O Google Cloud Kubernetes Engine oferece uma ampla variedade de opções de implantação para executar modelos do Gemma com alto desempenho e baixa latência usando frameworks de desenvolvimento preferidos. Confira os seguintes guias de implantação do Hugging Face, vLLM, TensorRT-LLM em GPUs e execução de TPU com JetStream, além de guias de aplicativos e ajuste:

Implantar e disponibilizar

Analisar dados

Ajustar detalhes