গুগল ক্লাউড কুবারনেটিস ইঞ্জিন পছন্দের ডেভেলপমেন্ট ফ্রেমওয়ার্ক ব্যবহার করে উচ্চ পারফরম্যান্স ও কম ল্যাটেন্সিতে জেমা মডেল চালানোর জন্য বিস্তৃত ডেপ্লয়মেন্ট অপশন প্রদান করে। জিপিইউ-তে হাগিং ফেস, ভিএলএলএম, টেনসরআরটি-এলএলএম এবং জেটস্ট্রিম সহ টিপিইউ এক্সিকিউশনের জন্য নিম্নলিখিত ডেপ্লয়মেন্ট গাইডগুলো দেখুন, সাথে অ্যাপ্লিকেশন এবং টিউনিং গাইডও রয়েছে:
মোতায়েন করুন এবং পরিবেশন করুন
vLLM দিয়ে GPU-তে Gemma পরিবেশন করুন : সুবিধাজনক মডেল লোড ম্যানেজমেন্ট এবং উচ্চ-থ্রুপুটের জন্য vLLM দিয়ে Gemma ডেপ্লয় করুন।
TensorRT-LLM দিয়ে GPU-তে Gemma পরিবেশন করুন : মডেলের কার্যক্ষমতা সর্বোচ্চ করতে NVIDIA TensorRT-LLM-এর সাথে Gemma স্থাপন করুন।
JetStream-এর সাহায্যে TPU-তে Gemma পরিবেশন করুন : উচ্চ কর্মক্ষমতা ও কম লেটেন্সির জন্য JetStream-সহ Gemma-কে TPU প্রসেসরে স্থাপন করুন।
ডেটা বিশ্লেষণ করুন
- BigQuery, Cloud Run, এবং Gemma ব্যবহার করে GKE-তে ডেটা বিশ্লেষণ করুন : BigQuery এবং Gemma দিয়ে একটি ডেটা বিশ্লেষণ পাইপলাইন তৈরি করুন।
সূক্ষ্মভাবে সমন্বয় করুন
- একাধিক জিপিইউ ব্যবহার করে জেমা ওপেন মডেলগুলোকে সূক্ষ্মভাবে সমন্বয় করুন : আপনার নিজস্ব ডেটাসেটের ওপর ভিত্তি করে জেমার আচরণ কাস্টমাইজ করুন।