Google Cloud Kubernetes Engine предоставляет широкий спектр вариантов развертывания для запуска моделей Gemma с высокой производительностью и низкой задержкой с использованием предпочтительных фреймворков разработки. Ознакомьтесь со следующими руководствами по развертыванию Hugging Face, vLLM, TensorRT-LLM на графических процессорах и выполнению на TPU с помощью JetStream, а также руководствами по приложениям и настройке:
Развернуть и запустить
Развертывание Gemma на графических процессорах с помощью vLLM : используйте vLLM для удобного управления загрузкой моделей и обеспечения высокой пропускной способности.
Развертывание Gemma на графических процессорах с использованием TensorRT-LLM : используйте NVIDIA TensorRT-LLM для максимального повышения эффективности работы модели.
Развертывание Gemma на TPU с помощью JetStream : используйте JetStream на процессорах TPU для обеспечения высокой производительности и низкой задержки.
Анализ данных
- Анализ данных в GKE с использованием BigQuery, Cloud Run и Gemma : построение конвейера анализа данных с помощью BigQuery и Gemma.
Тонкая настройка
- Тонкая настройка открытых моделей Gemma с использованием нескольких графических процессоров : настройте поведение Gemma в соответствии с вашим собственным набором данных.