Google Cloud Kubernetes Engine ofron një gamë të gjerë opsionesh vendosjeje për ekzekutimin e modeleve Gemma me performancë të lartë dhe vonesë të ulët duke përdorur kornizat e preferuara të zhvillimit. Shikoni udhëzuesit e mëposhtëm të vendosjes për Hugging Face, vLLM, TensorRT-LLM në GPU dhe ekzekutimin e TPU me JetStream, plus udhëzuesit e aplikacionit dhe akordimit:
Vendos dhe shërbe
Shërbejeni Gemma-n në GPU-të me vLLM : Vendosni Gemma-n me vLLM për menaxhim të përshtatshëm të ngarkesës së modelit dhe rendiment të lartë.
Shërbejeni Gemma-n në GPU me TensorRT-LLM : Vendosni Gemma-n me NVIDIA TensorRT-LLM për të maksimizuar efikasitetin e funksionimit të modelit.
Shërbejeni Gemma-n në TPU me JetStream : Vendosni Gemma-n me JetStream në procesorët TPU për performancë të lartë dhe vonesë të ulët.
Analizoni të dhënat
- Analizoni të dhënat në GKE duke përdorur BigQuery, Cloud Run dhe Gemma : Ndërtoni një tubacion të analizës së të dhënave me BigQuery dhe Gemma.
Akordim i imët
- Përmirësoni modelet e hapura të Gemma duke përdorur GPU të shumëfishta : Personalizoni sjelljen e Gemma bazuar në të dhënat tuaja.