Esegui Gemma con Kubernetes Engine

Google Cloud Kubernetes Engine offre un'ampia gamma di opzioni di deployment per l'esecuzione dei modelli Gemma con prestazioni elevate e bassa latenza utilizzando i framework di sviluppo preferiti. Consulta le seguenti guide al deployment per Hugging Face, vLLM, TensorRT-LLM su GPU ed esecuzione TPU con JetStream, oltre alle guide all'applicazione e all'ottimizzazione:

Esegui il deployment e gestisci

Analizza i dati

Ottimizza