الاستدلال حسب الأولوية

الوصف: تعرَّف على كيفية تحسين وقت الاستجابة باستخدام فئة "الاستدلال حسب الأولوية" في Interactions API

‫Gemini Priority API هي فئة استنتاج مميّزة مصمَّمة لأحمال العمل الحاسمة الأهمية التي تتطلّب وقت استجابة أقل وموثوقية أعلى بسعر مميّز. تتم منح الأولوية لطلبات الفئة ذات الأولوية على طلبات واجهة برمجة التطبيقات العادية وطلبات فئة Flex.

تتوفّر ميزة "الاستنتاج ذو الأولوية" في جميع نقاط نهاية Interactions API.

كيفية استخدام ميزة "الأولوية"

لاستخدام فئة الأولوية، اضبط الحقل service_tier في طلبك على priority. فئة الخدمة التلقائية هي "عادية" إذا تم حذف الحقل.

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Triage this critical customer support ticket immediately.",
    service_tier='priority'
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from '@google/genai';

const ai = new GoogleGenAI({});

async function main() {
    const interaction = await ai.interactions.create({
        model: "gemini-3.8-flash",
        input: "Triage this critical customer support ticket immediately.",
        service_tier: "priority"
    });
    console.log(interaction.output_text);
}

await main();

جافا

import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;

Client client = new Client();

CreateModelInteraction params =
    CreateModelInteraction.builder()
        .model(Model.of("gemini-3.8-flash"))
        .input(InteractionsInput.of("Perform a priority inference task."))
        .serviceTier(ServiceTier.PRIORITY)
        .build();

Interaction interaction =
    client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();

System.out.println(interaction.outputText().orElse(""));

Go

package main

import (
    "context"
    "fmt"
    "log"

    "google.golang.org/genai"
    "google.golang.org/genai/interactions/models/interactions"
    "google.golang.org/genai/interactions/models/operations"
)

func main() {
    ctx := context.Background()
    client, err := genai.NewClient(ctx, nil)
    if err != nil {
        log.Fatal(err)
    }

    res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
        Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
            Model:       interactions.Model("gemini-3.8-flash"),
            Input:       interactions.NewInteractionsInput("Perform a priority inference task."),
            ServiceTier: interactions.ServiceTierPriority.ToPointer(),
        }),
    })
    if err != nil {
        log.Fatal(err)
    }
    if res.Interaction.OutputText != nil {
        fmt.Println(*res.Interaction.OutputText)
    }
}

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "Content-Type: application/json" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -d '{
    "model": "gemini-3.8-flash",
    "input": "Triage this critical customer support ticket immediately.",
    "service_tier": "priority"
  }'

طريقة عمل ميزة "الاستنتاج حسب الأولوية"

توجّه مسارات الاستنتاج ذات الأولوية الطلبات إلى قوائم انتظار الحوسبة ذات الأهمية العالية، ما يوفّر أداءً سريعًا يمكن توقّعه للتطبيقات التي تواجه المستخدمين. آليتها الأساسية هي الرجوع إلى المعالجة العادية من جهة الخادم بشكل سلس عند تجاوز الحدود الديناميكية لحركة البيانات، ما يضمن استقرار التطبيق بدلاً من تعذُّر تنفيذ الطلب.

الميزة الأولوية خطة "الرزمة العادية" التعبير مجمّعة
الأسعار أكثر من خطة Standard بنسبة تتراوح بين %75 و%100 السعر الكامل خصم بنسبة% 50 خصم بنسبة% 50
وقت الاستجابة ثوانٍ الثواني إلى الدقائق الدقائق (الهدف من دقيقة واحدة إلى 15 دقيقة) ما يصل إلى 24 ساعة
الموثوقية عالية (غير قابلة للإزالة) مرتفع / مرتفع إلى حد ما أفضل جودة ممكنة (يمكن التضحية بها) عالية (لمعدّل نقل البيانات)
الواجهة متزامن متزامن متزامن غير متزامن

المزايا الرئيسية

  • وقت استجابة قصير: تم تصميمها لتوفير أوقات استجابة قصيرة جدًا لأدوات الذكاء الاصطناعي التفاعلية التي يستخدمها العملاء.
  • موثوقية عالية: يتم التعامل مع الزيارات بأعلى مستوى من الأهمية، وهي غير قابلة للتجاهل.
  • التدهور التدريجي: يتم تلقائيًا خفض مستوى الزيادات الحادة في عدد الزيارات التي تتجاوز الحدود الديناميكية إلى المستوى العادي للمعالجة بدلاً من حدوث خطأ، ما يمنع انقطاع الخدمة.
  • سهولة الاستخدام: تستخدم هذه الفئة طريقة create المتزامنة نفسها التي تستخدمها الفئتان العادية وFlex.

حالات الاستخدام

تُعدّ المعالجة ذات الأولوية مثالية لسير العمل المهمة للنشاط التجاري والتي يكون فيها الأداء والموثوقية في غاية الأهمية.

  • تطبيقات الذكاء الاصطناعي التفاعلية: روبوتات الدردشة ومساعدو الذكاء الاصطناعي في خدمة العملاء حيث يدفع المستخدمون اشتراكًا مميزًا ويتوقعون الحصول على ردود سريعة ومتسقة.
  • محركات اتخاذ القرار في الوقت الفعلي: الأنظمة التي تتطلّب نتائج موثوقة للغاية وبزمن استجابة منخفض، مثل تصنيف طلبات الدعم المباشر أو رصد الاحتيال
  • ميزات العملاء المميزين: للمطوّرين الذين يحتاجون إلى ضمان تحقيق أهداف مستوى الخدمة (SLO) الأعلى للعملاء الذين يدفعون مقابل الخدمة.

حدود معدّل الاستخدام

تخضع عملية الاستهلاك ذات الأولوية لحدود المعدّل الخاصة بها، حتى إذا تم احتساب الاستهلاك ضمن حدود المعدّل الإجمالية للزيارات التفاعلية. حدود المعدّل التلقائية للاستدلال ذي الأولوية هي 0.3x حد المعدّل العادي لكل نموذج / فئة

آلية الرجوع إلى إصدار سابق بسلاسة

في حال تجاوز حدود الأولوية بسبب الازدحام، يتم تلقائيًا وبشكل سلس خفض مستوى معالجة الطلبات الزائدة إلى "المعالجة العادية" بدلاً من ظهور الخطأ 503 أو 429. يتم تحصيل رسوم من الطلبات التي تم تخفيض مستوى أولويتها وفقًا للسعر العادي، وليس السعر المميز لخدمة Priority.

مسؤولية العميل

  • مراقبة الردود: على المطوّرين مراقبة العنوان x-gemini-service-tier في ردّ واجهة برمجة التطبيقات لمعرفة ما إذا كان يتم خفض مستوى الطلبات بشكل متكرّر إلى standard.
  • عمليات إعادة المحاولة: على العملاء تنفيذ منطق إعادة المحاولة/الرقود الأسي الثنائي للأخطاء العادية، مثل DEADLINE_EXCEEDED.

الأسعار

يبلغ سعر الاستنتاج ذي الأولوية 75 إلى% 100 أكثر من واجهة برمجة التطبيقات العادية ويتم تحصيل الرسوم لكل رمز مميز.

النماذج المتوافقة

تتيح الطُرز التالية استخدام ميزة "الاستنتاج ذو الأولوية":

الطراز الاستنتاج حسب الأولوية
Gemini 3.8 Flash ✔️
Gemini 3.7 Flash ✔️
Gemini 3.6 Flash ✔️
Gemini 3.5 Flash-Lite ✔️
Gemini 3.5 Flash ✔️
Gemini 3.1 Flash-Lite ✔️
إصدار تجريبي من Gemini 3.1 Pro ✔️
معاينة Gemini 3 Flash ✔️
Gemini 2.5 Pro ✔️
Gemini 2.5 Flash ✔️
Gemini 2.5 Flash-Lite ✔️

الخطوات التالية