Google Cloud Kubernetes Engine offre un'ampia gamma di opzioni di deployment per l'esecuzione dei modelli Gemma con prestazioni elevate e bassa latenza utilizzando i framework di sviluppo preferiti. Consulta le seguenti guide al deployment per Hugging Face, vLLM, TensorRT-LLM su GPU ed esecuzione TPU con JetStream, oltre alle guide all'applicazione e all'ottimizzazione:
Esegui il deployment e gestisci
Erogare Gemma su GPU con vLLM: esegui il deployment di Gemma con vLLM per una gestione comoda del caricamento dei modelli e un'elevata velocità effettiva.
Erogare Gemma su GPU con TensorRT-LLM: esegui il deployment di Gemma con NVIDIA TensorRT-LLM per massimizzare l'efficienza operativa del modello.
Erogare Gemma su TPU con JetStream: esegui il deployment di Gemma con JetStream sui processori TPU per prestazioni elevate e bassa latenza.
Analizza i dati
- Analizza i dati su GKE utilizzando BigQuery, Cloud Run e Gemma: crea una pipeline di analisi dei dati con BigQuery e Gemma.
Ottimizza
- Ottimizza i modelli open di Gemma utilizzando più GPU: personalizza il comportamento di Gemma in base al tuo set di dati.