Google Cloud Kubernetes Engine proporciona una amplia variedad de opciones de implementación para ejecutar modelos de Gemma con alto rendimiento y baja latencia con los frameworks de desarrollo preferidos. Consulta las siguientes guías de implementación para Hugging Face, vLLM, TensorRT-LLM en GPUs y ejecución de TPU con JetStream, además de guías de aplicaciones y ajuste:
Implementación y entrega
Entrega Gemma en GPUs con vLLM: Implementa Gemma con vLLM para una administración conveniente de la carga del modelo y alto rendimiento.
Entrega Gemma en GPUs con TensorRT-LLM: Implementa Gemma con NVIDIA TensorRT-LLM para maximizar la eficiencia de la operación del modelo.
Entrega Gemma en TPUs con JetStream: Implementa Gemma con JetStream en procesadores de TPU para obtener un alto rendimiento y una baja latencia.
Analiza los datos
- Analiza datos en GKE con BigQuery, Cloud Run y Gemma: Compila una canalización de análisis de datos con BigQuery y Gemma.
Optimizar
- Ajusta los modelos abiertos de Gemma con varias GPUs: Personaliza el comportamiento de Gemma según tu propio conjunto de datos.