Запустите Gemma с помощью Kubernetes Engine

Google Cloud Kubernetes Engine предоставляет широкий спектр вариантов развертывания для запуска моделей Gemma с высокой производительностью и низкой задержкой с использованием предпочтительных фреймворков разработки. Ознакомьтесь со следующими руководствами по развертыванию Hugging Face, vLLM, TensorRT-LLM на графических процессорах и выполнению на TPU с помощью JetStream, а также руководствами по приложениям и настройке:

Развернуть и запустить

Анализ данных

Тонкая настройка