Google Cloud Kubernetes Engine oferuje szeroki zakres opcji wdrażania modeli Gemma z wysoką wydajnością i niskim opóźnieniem przy użyciu preferowanych platform programistycznych. Zapoznaj się z tymi przewodnikami wdrażania Hugging Face, vLLM, TensorRT-LLM na GPU i TPU z JetStream oraz przewodnikami dotyczącymi aplikacji i dostrajania:
Wdrażanie i udostępnianie
**Udostępnianie Gemma na GPU z użyciem vLLM**: wdróż Gemma z vLLM, aby wygodnie zarządzać wczytywaniem modeli i uzyskać wysoką przepustowość.
Udostępnianie Gemma na GPU z użyciem TensorRT-LLM: wdróż Gemma z NVIDIA TensorRT-LLM, aby zmaksymalizować wydajność działania modelu.
Udostępnianie Gemma na TPU z użyciem JetStream: wdróż Gemma z JetStream na procesorach TPU, aby uzyskać wysoką wydajność i niskie opóźnienie.
Analizowanie danych
- Analizowanie danych w GKE za pomocą BigQuery, Cloud Run i Gemma: utwórz potok analizy danych za pomocą BigQuery i Gemma.
Dostrajanie
- Dostrajanie otwartych modeli Gemma za pomocą wielu GPU: dostosuj działanie Gemma na podstawie własnego zbioru danych.