توفّر Gemini API مجموعة متنوعة من آليات التحسين لمساعدتك في تحقيق التوازن بين السرعة والتكلفة والموثوقية استنادًا إلى احتياجات عبء العمل المحدّدة. سواء كنت بصدد إنشاء برامج حوارية في الوقت الفعلي أو تنفيذ عمليات مكثّفة لمعالجة البيانات بلا إنترنت، يمكن أن يساعدك اختيار النموذج المناسب في خفض التكاليف أو تحسين الأداء بشكل كبير.
| الميزة | خطة "الرزمة العادية" | التعبير | الأولوية | مجمّعة | التخزين المؤقت |
|---|---|---|---|---|---|
| الأسعار | السعر الكامل | خصم بنسبة% 50 | 75% إلى% 100 أكثر من المعتاد | خصم بنسبة% 50 | خصم بنسبة 90% + مساحة تخزين الرموز المميزة بالتناسب مع المدة |
| وقت الاستجابة | من ثوانٍ إلى دقائق | الدقائق (المدة المستهدَفة من دقيقة واحدة إلى 15 دقيقة) | ثوانٍ | ما يصل إلى 24 ساعة | تقليل الوقت حتى أول رمز مميّز |
| الموثوقية | مرتفع / مرتفع إلى حد ما | أفضل جودة ممكنة (يمكن التضحية بها) | عالية (غير قابلة للتقشير) | عالية (لمعدّل نقل البيانات) | لا ينطبق |
| الواجهة | متزامن | متزامن | متزامن | غير متزامن | الحالة المحفوظة |
| أفضل حالة استخدام | سير العمل العام للتطبيقات | السلاسل المتسلسلة غير العاجلة | تطبيقات الإنتاج المخصّصة للمستخدمين | مجموعات البيانات الضخمة وعمليات التقييم غير الإلكترونية | طلبات البحث المتكرّرة على الملف نفسه |
مستويات خدمة الاستدلال (متزامنة)
يمكنك التبديل بين حركة الزيارات المتزامنة المحسّنة من حيث الموثوقية وتلك المحسّنة من حيث التكلفة من خلال تمرير المَعلمة service_tier في طلبات الإنشاء العادية.
الاستدلال العادي (تلقائي)
الفئة العادية هي الخيار التلقائي لإنشاء المحتوى التسلسلي. توفّر هذه الخدمة أوقات استجابة عادية بدون رسوم إضافية أو انتظار طويل في قائمة الانتظار.
- الموثوقية: مستوى الأهمية العادي
- السعر: التسعير العادي
- الأفضل للاستخدامات: معظم التطبيقات التفاعلية اليومية
الاستنتاج ذو الأولوية (المحسّن لوقت الاستجابة)
توجّه معالجة الأولوية طلباتك إلى قوائم انتظار الحوسبة ذات الأهمية القصوى. هذه الزيارات غير قابلة للتجاهل (لا يمكن أن تتجاوزها أي فئات أخرى) وتوفّر أعلى مستوى من الموثوقية. في حال تجاوزت حدود "الأولوية الديناميكية"، سيخفض النظام مستوى الطلب إلى "المعالجة العادية" بدلاً من عرض رسالة خطأ.
- الموثوقية: أعلى مستوى أهمية
- السعر: من 75% إلى 100% أعلى من الأسعار العادية
- الأفضل للاستخدامات التالية: روبوتات الدردشة المخصّصة للعملاء، ورصد عمليات الاحتيال في الوقت الفعلي، وCopilot للعمليات التجارية المهمة
الاستنتاج المرن (محسّن من حيث التكلفة)
توفّر Flex inference خصمًا بنسبة% 50 مقارنةً بالأسعار العادية من خلال الاستفادة من سعة الحوسبة المتاحة في أوقات خارج الذروة. تتم معالجة الطلبات بشكل متزامن، ما يعني أنّه ليس عليك إعادة كتابة الرمز البرمجي لإدارة عناصر الدُفعات. بما أنّ هذه الزيارات "قابلة للتخفيض"، قد يتم إيقاف الطلبات بشكل استباقي إذا شهد النظام ارتفاعات معتادة في عدد الزيارات.
- الموثوقية: مستوى الأهمية غير مضمون وقابل للتخفيض
- السعر:% 50 من السعر العادي (يتم تحصيل الرسوم لكل رمز مميز).
- الأفضل في الحالات التالية: مهام سير العمل المتعدّدة الخطوات التي تستخدم الذكاء الاصطناعي الوكيل والتي يعتمد فيها طلب N+1 على نتيجة الطلب N، وتعديلات نظام إدارة علاقات العملاء في الخلفية، والتقييمات غير المباشرة
واجهة برمجة التطبيقات للمعالجة المجمّعة (مجمّعة وغير متزامنة)
تم تصميم واجهة Batch API لمعالجة كميات كبيرة من الطلبات بشكل غير متزامن بتكلفة تبلغ% 50 من التكلفة العادية. يمكنك إرسال الطلبات كقواميس مضمّنة أو باستخدام ملف إدخال JSONL (يصل حجمه إلى 2 غيغابايت). وتعالج الطلبات باستخدام قوائم انتظار معدل النقل في الخلفية، مع استهداف وقت معالجة يبلغ 24 ساعة.
- الموثوقية: يمكن تجاهل الرسائل، ولكن مع إعادة المحاولة تلقائيًا كل 24 ساعة ونظام قائمة الانتظار
- السعر:% 50 من السعر العادي
- الأفضل للاستخدامات التالية: المعالجة المسبقة لمجموعات البيانات الكبيرة، وتشغيل حزم اختبارية للانحدار الدوري، وإنشاء أعداد كبيرة من الصور أو عمليات التضمين
التخزين المؤقت للسياق (توفير الوقت في إدخال البيانات)
يتم استخدام التخزين المؤقت للسياق عندما تتم الإشارة إلى سياق أولي كبير بشكل متكرر من خلال طلبات أقصر.
- التخزين المؤقت الضمني: يتم تفعيله تلقائيًا على Gemini 2.5 والإصدارات الأحدث. يوفّر النظام في التكاليف إذا كان طلبك يتطابق مع ذاكرات تخزين مؤقت حالية استنادًا إلى البادئات الشائعة للطلبات.
- التخزين المؤقت الصريح: يمكنك إنشاء عنصر تخزين مؤقت يدويًا باستخدام مدة بقاء (TTL) محدّدة. بعد إنشائها، يمكنك الرجوع إلى الرموز المميزة المخزّنة مؤقتًا لإجراء الطلبات اللاحقة لتجنُّب تمرير حمولة المجموعة نفسها بشكل متكرّر.
- السعر: يتم تحصيل الرسوم استنادًا إلى عدد الرموز المميزة لذاكرة التخزين المؤقت ومدة التخزين (TTL).
- الاستخدام الأنسب: روبوتات الدردشة التي تتضمّن تعليمات نظام شاملة أو التحليل المتكرّر لملفات الفيديو الطويلة أو الاستعلامات عن مجموعات المستندات الكبيرة
تقليل تكاليف إدخال الفيديو باستخدام المعالجة المستندة إلى الوكلاء
بالنسبة إلى محتوى الفيديو الطويل، يمكن أن تقلّل المعالجة المستندة إلى الوكلاء تكاليف الرموز المميزة للإدخال بنسبة تصل إلى% 88 مع تحسين جودة الردود. بدلاً من استخراج كل إطار بمعدل إطار واحد في الثانية (المعالجة الثابتة)، يبحث النموذج بشكل ديناميكي في الفيديو، ويحمّل النص و/أو الإطارات و/أو الصوت ذي الصلة بطلبك. بالنسبة إلى المقاطع القصيرة (أقل من 5 دقائق) التي يكون فيها وقت الاستجابة مهمًا، قد توفّر المعالجة الثابتة وقتًا أسرع للحصول على الرمز المميز الأول، لأنّ الوضع التفاعلي يتطلّب عمليات استدلال داخلية ورحلات ذهاب وعودة للأدوات قبل بدء عملية الإنشاء.
لاستخدام المعالجة المستندة إلى الوكيل مع Gemini 3.8 Flash أو 3.6 Flash أو 3.5 Flash Lite،
اضبط processing: "agentic" (واجهة Interactions API) أو
media_processing: "AGENTIC" (واجهة GenerateContent API) على إدخال الفيديو. إذا كان النموذج لا يتيح المعالجة المستندة إلى الوكيل، سيُرجع خطأ.
يمكنك الاطّلاع على Agentic video understanding للحصول على أمثلة على الرموز البرمجية.