การอนุมานตามลำดับความสำคัญ

คำอธิบาย: ดูวิธีเพิ่มประสิทธิภาพเวลาในการตอบสนองด้วยระดับการอนุมานตามลำดับความสำคัญใน Interactions API

Gemini Priority API เป็นระดับการอนุมานแบบพรีเมียมที่ออกแบบมาสำหรับ ปริมาณงานที่สำคัญต่อธุรกิจซึ่งต้องมีเวลาในการตอบสนองที่ต่ำกว่าและความน่าเชื่อถือสูงสุด ในราคาพรีเมียม การเข้าชมระดับ Priority จะมีความสำคัญเหนือกว่าการเข้าชม API มาตรฐานและการเข้าชมระดับ Flex

การอนุมานตามลำดับความสำคัญพร้อมใช้งานในอุปกรณ์ปลายทาง Interactions API

วิธีใช้รายการสำคัญ

หากต้องการใช้ระดับความสำคัญ ให้ตั้งค่าฟิลด์ service_tier ในคำขอเป็น priority ระดับเริ่มต้นคือมาตรฐานหากละเว้นฟิลด์นี้

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Triage this critical customer support ticket immediately.",
    service_tier='priority'
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from '@google/genai';

const ai = new GoogleGenAI({});

async function main() {
    const interaction = await ai.interactions.create({
        model: "gemini-3.8-flash",
        input: "Triage this critical customer support ticket immediately.",
        service_tier: "priority"
    });
    console.log(interaction.output_text);
}

await main();

Java

import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;

Client client = new Client();

CreateModelInteraction params =
    CreateModelInteraction.builder()
        .model(Model.of("gemini-3.8-flash"))
        .input(InteractionsInput.of("Perform a priority inference task."))
        .serviceTier(ServiceTier.PRIORITY)
        .build();

Interaction interaction =
    client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();

System.out.println(interaction.outputText().orElse(""));

Go

package main

import (
    "context"
    "fmt"
    "log"

    "google.golang.org/genai"
    "google.golang.org/genai/interactions/models/interactions"
    "google.golang.org/genai/interactions/models/operations"
)

func main() {
    ctx := context.Background()
    client, err := genai.NewClient(ctx, nil)
    if err != nil {
        log.Fatal(err)
    }

    res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
        Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
            Model:       interactions.Model("gemini-3.8-flash"),
            Input:       interactions.NewInteractionsInput("Perform a priority inference task."),
            ServiceTier: interactions.ServiceTierPriority.ToPointer(),
        }),
    })
    if err != nil {
        log.Fatal(err)
    }
    if res.Interaction.OutputText != nil {
        fmt.Println(*res.Interaction.OutputText)
    }
}

REST

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "Content-Type: application/json" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -d '{
    "model": "gemini-3.8-flash",
    "input": "Triage this critical customer support ticket immediately.",
    "service_tier": "priority"
  }'

วิธีการทำงานของการอนุมานตามลำดับความสำคัญ

เส้นทางการอนุมานที่มีลำดับความสำคัญจะส่งคำขอไปยังคิวการประมวลผลที่มีความสำคัญสูง ซึ่งให้ ประสิทธิภาพที่รวดเร็วและคาดการณ์ได้สำหรับแอปพลิเคชันที่หันหน้าเข้าหาผู้ใช้ กลไกหลักของฟีเจอร์นี้คือการลดระดับฝั่งเซิร์ฟเวอร์อย่างเหมาะสมเป็นการประมวลผลมาตรฐานสำหรับการเข้าชมที่เกินขีดจำกัดแบบไดนามิก เพื่อให้มั่นใจว่าแอปพลิเคชันจะมีความเสถียรแทนที่จะทำให้คำขอไม่สำเร็จ

ฟีเจอร์ ลำดับความสำคัญ มาตรฐาน พับ กลุ่ม
การกำหนดราคา มากกว่ารุ่น Standard 75-100% ตั๋วราคาเต็ม ส่วนลด 50% ส่วนลด 50%
เวลาในการตอบสนอง วินาที วินาทีถึงนาที นาที (เป้าหมาย 1-15 นาที) สูงสุด 24 ชั่วโมง
ความน่าเชื่อถือ สูง (ไม่หลุดร่วง) สูง / สูงปานกลาง อย่างเต็มที่ (ลดภาระได้) สูง (สำหรับปริมาณงาน)
อินเทอร์เฟซ ซิงโครนัส ซิงโครนัส ซิงโครนัส อะซิงโครนัส

ประโยชน์สำคัญ

  • เวลาในการตอบสนองต่ำ: ออกแบบมาให้มีเวลาในการตอบสนองเป็นวินาทีสำหรับเครื่องมือ AI แบบอินเทอร์แอกทีฟที่ผู้ใช้ใช้งาน
  • ความน่าเชื่อถือสูง: ระบบจะถือว่าการเข้าชมมีความสำคัญสูงสุดและ ไม่สามารถลดการเข้าชมได้
  • การลดลงอย่างค่อยเป็นค่อยไป: การเพิ่มขึ้นของการรับส่งข้อมูลที่เกินขีดจำกัดแบบไดนามิกจะลดระดับเป็นระดับ Standard โดยอัตโนมัติเพื่อประมวลผลแทนที่จะล้มเหลว ซึ่งจะป้องกันไม่ให้เกิดการหยุดทำงานของบริการ
  • ราบรื่น: ใช้createวิธีการแบบซิงโครนัสเดียวกันกับแพ็กเกจมาตรฐานและแพ็กเกจ Flex

กรณีการใช้งาน

การประมวลผลที่มีลำดับความสำคัญเหมาะสำหรับเวิร์กโฟลว์ที่สำคัญต่อธุรกิจซึ่งประสิทธิภาพ และความน่าเชื่อถือเป็นสิ่งสำคัญที่สุด

  • แอปพลิเคชัน AI แบบอินเทอร์แอกทีฟ: แชทบ็อตและโคไพลอทฝ่ายบริการลูกค้าที่ผู้ใช้ จ่ายเงินในราคาพรีเมียมและคาดหวังการตอบกลับที่รวดเร็วและสม่ำเสมอ
  • เครื่องมือตัดสินใจแบบเรียลไทม์: ระบบที่ต้องการผลลัพธ์ที่มีความน่าเชื่อถือสูงและมีเวลาในการตอบสนองต่ำ เช่น การคัดกรองคำขอแจ้งปัญหาแบบเรียลไทม์หรือการตรวจจับการประพฤติมิชอบ
  • ฟีเจอร์สำหรับลูกค้าพรีเมียม: นักพัฒนาแอปที่ต้องการรับประกันเป้าหมายระดับการให้บริการ (SLO) ที่สูงขึ้นสำหรับลูกค้าที่ชำระเงิน

ขีดจำกัดอัตรา

การใช้งานที่มีลำดับความสำคัญจะมีขีดจำกัดอัตราของตัวเอง แม้ว่าการใช้งานจะนับรวมในขีดจำกัดอัตราการเข้าชมแบบอินเทอร์แอกทีฟโดยรวมก็ตาม ขีดจำกัดอัตราเริ่มต้น สำหรับการอนุมานแบบมีลำดับความสำคัญคือขีดจำกัดอัตรามาตรฐาน 0.3 เท่าสำหรับโมเดล / ระดับ

ตรรกะการดาวน์เกรดอย่างค่อยเป็นค่อยไป

หากมีการใช้งานเกินขีดจำกัดของลำดับความสำคัญเนื่องจากความหนาแน่น คำขอที่เกินมาจะลดระดับโดยอัตโนมัติและราบรื่นเป็นการประมวลผลแบบมาตรฐานแทนที่จะ ล้มเหลวพร้อมข้อผิดพลาด 503 หรือ 429 ระบบจะเรียกเก็บเงินสำหรับคำขอที่ลดระดับในอัตรามาตรฐาน ไม่ใช่ในอัตราพรีเมียมแบบลำดับความสำคัญ

ความรับผิดชอบของลูกค้า

  • การตรวจสอบการตอบกลับ: นักพัฒนาแอปควรตรวจสอบx-gemini-service-tier ส่วนหัวในการตอบกลับของ API เพื่อตรวจหาว่ามีการลดระดับคำขอเป็น standardบ่อยหรือไม่
  • การลองใหม่: ไคลเอ็นต์ต้องใช้ตรรกะการลองใหม่/Exponential Backoff สำหรับ ข้อผิดพลาดมาตรฐาน เช่น DEADLINE_EXCEEDED

ราคา

การอนุมานที่มีลำดับความสำคัญสูงกว่ามีราคาแพงกว่า API มาตรฐาน 75-100% และจะเรียกเก็บเงินต่อโทเค็น

รุ่นที่รองรับ

โมเดลต่อไปนี้รองรับการอนุมานที่มีลำดับความสำคัญ

รุ่น การอนุมานตามลำดับความสำคัญ
Gemini 3.8 Flash ✔️
Gemini 3.7 Flash ✔️
Gemini 3.6 Flash ✔️
Gemini 3.5 Flash-Lite ✔️
Gemini 3.5 Flash ✔️
Gemini 3.1 Flash-Lite ✔️
Gemini 3.1 Pro เวอร์ชันตัวอย่าง ✔️
ตัวอย่าง Gemini 3 Flash ✔️
Gemini 2.5 Pro ✔️
Gemini 2.5 Flash ✔️
Gemini 2.5 Flash-Lite ✔️

ขั้นตอนถัดไป