Ejecuta Gemma con Kubernetes Engine

Google Cloud Kubernetes Engine proporciona una amplia variedad de opciones de implementación para ejecutar modelos de Gemma con alto rendimiento y baja latencia con los frameworks de desarrollo preferidos. Consulta las siguientes guías de implementación para Hugging Face, vLLM, TensorRT-LLM en GPUs y ejecución de TPU con JetStream, además de guías de aplicaciones y ajuste:

Implementación y entrega

Analiza los datos

Optimizar