الاستدلال حسب الأولوية

الوصف: تعرَّفوا على كيفية تحسين وقت الاستجابة باستخدام مستوى الاستنتاج "الأولوية" في Interactions API

‫Gemini Priority API هو مستوى استنتاج مميز مصمّم لأحمال العمل الأساسية للمؤسسة التي تتطلب وقت استجابة أقل وموثوقية أعلى بسعر مميز. تتم معالجة الزيارات على مستوى "الأولوية" قبل الزيارات على مستوى واجهة برمجة التطبيقات العادية ومستوى "المرونة".

يتوفّر الاستنتاج على مستوى "الأولوية" في جميع نقاط نهاية Interactions API.

كيفية استخدام مستوى "الأولوية"

لاستخدام مستوى "الأولوية"، اضبطوا حقل service_tier في طلبكم على priority. المستوى التلقائي هو "عادي" إذا تم حذف الحقل.

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input="Triage this critical customer support ticket immediately.",
    service_tier='priority'
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from '@google/genai';

const ai = new GoogleGenAI({});

async function main() {
    const interaction = await ai.interactions.create({
        model: "gemini-3.7-flash",
        input: "Triage this critical customer support ticket immediately.",
        service_tier: "priority"
    });
    console.log(interaction.output_text);
}

await main();

Java

import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;

Client client = new Client();

CreateModelInteraction params =
    CreateModelInteraction.builder()
        .model(Model.of("gemini-3.7-flash"))
        .input(InteractionsInput.of("Perform a priority inference task."))
        .serviceTier(ServiceTier.PRIORITY)
        .build();

Interaction interaction =
    client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();

System.out.println(interaction.outputText().orElse(""));

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "Content-Type: application/json" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Triage this critical customer support ticket immediately.",
    "service_tier": "priority"
  }'

آلية عمل الاستنتاج على مستوى "الأولوية"

يوجّه الاستنتاج على مستوى "الأولوية" الطلبات إلى قوائم انتظار الحوسبة ذات الأهمية العالية، ما يوفّر أداءً سريعًا يمكن التنبؤ به للتطبيقات التي يتفاعل معها المستخدمون. آليته الأساسية هي الرجوع السلس من جهة الخادم إلى المعالجة العادية للزيارات التي تتجاوز الحدود الديناميكية، ما يضمن استقرار التطبيق بدلاً من تعذُّر معالجة الطلب.

الميزة الأولوية خطة "الرزمة العادية" التعبير مجمّعة
الأسعار أكثر من السعر الأساسي بنسبة %75 إلى %100 السعر الكامل خصم بنسبة% 50 خصم بنسبة% 50
وقت الاستجابة ثوانٍ من ثوانٍ إلى دقائق دقائق (الهدف من دقيقة إلى 15 دقيقة) ما يصل إلى 24 ساعة
الموثوقية عالية (غير قابلة للتقليل) عالية / متوسطة إلى عالية بأفضل جهد (قابلة للتقليل) عالية (لمعدّل نقل البيانات)
الواجهة متزامن متزامن متزامن غير متزامن

المزايا الرئيسية

  • وقت استجابة منخفض: مصمّم لأوقات الاستجابة بالثواني لأدوات الذكاء الاصطناعي التفاعلية التي يتفاعل معها المستخدمون.
  • موثوقية عالية: يتم التعامل مع الزيارات بأعلى درجة من الأهمية ولا يمكن تقليلها على الإطلاق.
  • التكيّف مع الإصدارات الأقدم: يتم تلقائيًا الرجوع إلى مستوى "الرزمة العادية" لمعالجة الارتفاعات المفاجئة في الزيارات التي تتجاوز الحدود الديناميكية بدلاً من تعذُّر معالجتها، ما يمنع انقطاع الخدمة.
  • الحد الأدنى من المشاير: يستخدم الطريقة المتزامنة نفسها create التي يستخدمها مستوى "الرزمة العادية" ومستوى "المرونة".

حالات الاستخدام

تكون المعالجة على مستوى "الأولوية" مثالية لسير العمل الأساسي للمؤسسة حيث يكون الأداء والموثوقية في غاية الأهمية.

  • تطبيقات الذكاء الاصطناعي التفاعلية: روبوتات الدردشة و"المساعدون" لخدمة العملاء حيث يدفع المستخدمون سعرًا مميزًا ويتوقعون استجابات سريعة ومتسقة.
  • محركات اتخاذ القرارات في الوقت الفعلي: الأنظمة التي تتطلب نتائج موثوقة جدًا ومنخفضة وقت الاستجابة، مثل فرز التذاكر المباشر أو رصد الاحتيال.
  • ميزات العملاء المميزين: المطوّرون الذين يحتاجون إلى ضمان أهداف أعلى لمستوى الخدمة (SLO) للعملاء الذين يدفعون.

حدود معدّل الاستخدام

يحتفظ الاستهلاك على مستوى "الأولوية" بحدود معدّل الاستخدام الخاصة به على الرغم من احتساب الاستهلاك ضمن حدود معدّل الاستخدام الإجمالية للزيارات التفاعلية. حدود معدّل الاستخدام التلقائية للاستنتاج على مستوى "الأولوية" هي 0.3 ضعف حد معدّل الاستخدام العادي لـ "الطراز / المستوى"

تسلسل منطقي للرجوع السلس

إذا تم تجاوز حدود "الأولوية" بسبب الازدحام، يتم تلقائيًا وبشكل سلس الرجوع إلى المعالجة على مستوى "الرزمة العادية" للطلبات التي تتجاوز الحد بدلاً من تعذُّر معالجتها مع ظهور الخطأ 503 أو 429. تتم فوترة الطلبات التي تم الرجوع إلى مستوى "الرزمة العادية" لمعالجتها بالسعر العادي، وليس بالسعر المميز لمستوى "الأولوية".

مسؤولية العميل

  • مراقبة الردود: على المطوّرين مراقبة x-gemini-service-tier العنوان في ردّ واجهة برمجة التطبيقات لرصد ما إذا كان يتم الرجوع بشكل متكرر إلى standard لمعالجة الطلبات.
  • إعادة المحاولات: على العملاء تنفيذ تسلسل منطقي لإعادة المحاولة أو التراجع الأسي للأخطاء العادية، مثل DEADLINE_EXCEEDED.

الأسعار

يتم تسعير الاستنتاج على مستوى "الأولوية" بنسبة %75 إلى %100 أكثر من واجهة برمجة التطبيقات العادية ويتم تحصيل الرسوم لكل رمز مميز.

الطُرز المتوافقة

تسمح الطُرز التالية بالاستنتاج على مستوى "الأولوية":

الطراز الاستنتاج على مستوى "الأولوية"
‫Gemini 3.7 Flash ✔️
Gemini 3.6 Flash ✔️
Gemini 3.5 Flash-Lite ✔️
Gemini 3.5 Flash ✔️
Gemini 3.1 Flash-Lite ✔️
‫Gemini 3.1 Pro Preview ✔️
‫Gemini 3 Flash Preview ✔️
Gemini 2.5 Pro ✔️
‎2.5 Flash ✔️
‫Gemini 2.5 Flash-Lite ✔️

الخطوات التالية