Gemini Priority API เป็นระดับการอนุมานแบบพรีเมียมที่ออกแบบมาสำหรับ ปริมาณงานที่สำคัญต่อธุรกิจซึ่งต้องมีเวลาในการตอบสนองที่ต่ำกว่าและความน่าเชื่อถือสูงสุด ในราคาพรีเมียม การเข้าชมระดับ Priority จะมีความสำคัญเหนือกว่าการเข้าชม API มาตรฐานและการเข้าชมระดับ Flex
การอนุมานตามลำดับความสำคัญพร้อมใช้งานในอุปกรณ์ปลายทาง Interactions API
วิธีใช้รายการสำคัญ
หากต้องการใช้ระดับความสำคัญ ให้ตั้งค่าฟิลด์ service_tier ในคำขอเป็น priority ระดับเริ่มต้นคือมาตรฐานหากละเว้นฟิลด์นี้
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Triage this critical customer support ticket immediately.",
service_tier='priority'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: "Triage this critical customer support ticket immediately.",
service_tier: "priority"
});
console.log(interaction.output_text);
}
await main();
Java
import com.google.genai.Client;
import com.google.genai.gaos.models.interactions.CreateModelInteraction;
import com.google.genai.gaos.models.interactions.Interaction;
import com.google.genai.gaos.models.interactions.InteractionsInput;
import com.google.genai.gaos.models.interactions.Model;
import com.google.genai.gaos.models.interactions.ServiceTier;
import com.google.genai.gaos.models.operations.CreateInteractionRequestBody;
Client client = new Client();
CreateModelInteraction params =
CreateModelInteraction.builder()
.model(Model.of("gemini-3.8-flash"))
.input(InteractionsInput.of("Perform a priority inference task."))
.serviceTier(ServiceTier.PRIORITY)
.build();
Interaction interaction =
client.interactions.create(CreateInteractionRequestBody.of(params)).interaction().get();
System.out.println(interaction.outputText().orElse(""));
Go
package main
import (
"context"
"fmt"
"log"
"google.golang.org/genai"
"google.golang.org/genai/interactions/models/interactions"
"google.golang.org/genai/interactions/models/operations"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
res, err := client.Interactions.Create(ctx, operations.CreateInteractionRequest{
Body: operations.NewCreateInteractionRequestBody(interactions.CreateModelInteraction{
Model: interactions.Model("gemini-3.8-flash"),
Input: interactions.NewInteractionsInput("Perform a priority inference task."),
ServiceTier: interactions.ServiceTierPriority.ToPointer(),
}),
})
if err != nil {
log.Fatal(err)
}
if res.Interaction.OutputText != nil {
fmt.Println(*res.Interaction.OutputText)
}
}
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"model": "gemini-3.8-flash",
"input": "Triage this critical customer support ticket immediately.",
"service_tier": "priority"
}'
วิธีการทำงานของการอนุมานตามลำดับความสำคัญ
เส้นทางการอนุมานที่มีลำดับความสำคัญจะส่งคำขอไปยังคิวการประมวลผลที่มีความสำคัญสูง ซึ่งให้ ประสิทธิภาพที่รวดเร็วและคาดการณ์ได้สำหรับแอปพลิเคชันที่หันหน้าเข้าหาผู้ใช้ กลไกหลักของฟีเจอร์นี้คือการลดระดับฝั่งเซิร์ฟเวอร์อย่างเหมาะสมเป็นการประมวลผลมาตรฐานสำหรับการเข้าชมที่เกินขีดจำกัดแบบไดนามิก เพื่อให้มั่นใจว่าแอปพลิเคชันจะมีความเสถียรแทนที่จะทำให้คำขอไม่สำเร็จ
| ฟีเจอร์ | ลำดับความสำคัญ | มาตรฐาน | พับ | กลุ่ม |
|---|---|---|---|---|
| การกำหนดราคา | มากกว่ารุ่น Standard 75-100% | ตั๋วราคาเต็ม | ส่วนลด 50% | ส่วนลด 50% |
| เวลาในการตอบสนอง | วินาที | วินาทีถึงนาที | นาที (เป้าหมาย 1-15 นาที) | สูงสุด 24 ชั่วโมง |
| ความน่าเชื่อถือ | สูง (ไม่หลุดร่วง) | สูง / สูงปานกลาง | อย่างเต็มที่ (ลดภาระได้) | สูง (สำหรับปริมาณงาน) |
| อินเทอร์เฟซ | ซิงโครนัส | ซิงโครนัส | ซิงโครนัส | อะซิงโครนัส |
ประโยชน์สำคัญ
- เวลาในการตอบสนองต่ำ: ออกแบบมาให้มีเวลาในการตอบสนองเป็นวินาทีสำหรับเครื่องมือ AI แบบอินเทอร์แอกทีฟที่ผู้ใช้ใช้งาน
- ความน่าเชื่อถือสูง: ระบบจะถือว่าการเข้าชมมีความสำคัญสูงสุดและ ไม่สามารถลดการเข้าชมได้
- การลดลงอย่างค่อยเป็นค่อยไป: การเพิ่มขึ้นของการรับส่งข้อมูลที่เกินขีดจำกัดแบบไดนามิกจะลดระดับเป็นระดับ Standard โดยอัตโนมัติเพื่อประมวลผลแทนที่จะล้มเหลว ซึ่งจะป้องกันไม่ให้เกิดการหยุดทำงานของบริการ
- ราบรื่น: ใช้
createวิธีการแบบซิงโครนัสเดียวกันกับแพ็กเกจมาตรฐานและแพ็กเกจ Flex
กรณีการใช้งาน
การประมวลผลที่มีลำดับความสำคัญเหมาะสำหรับเวิร์กโฟลว์ที่สำคัญต่อธุรกิจซึ่งประสิทธิภาพ และความน่าเชื่อถือเป็นสิ่งสำคัญที่สุด
- แอปพลิเคชัน AI แบบอินเทอร์แอกทีฟ: แชทบ็อตและโคไพลอทฝ่ายบริการลูกค้าที่ผู้ใช้ จ่ายเงินในราคาพรีเมียมและคาดหวังการตอบกลับที่รวดเร็วและสม่ำเสมอ
- เครื่องมือตัดสินใจแบบเรียลไทม์: ระบบที่ต้องการผลลัพธ์ที่มีความน่าเชื่อถือสูงและมีเวลาในการตอบสนองต่ำ เช่น การคัดกรองคำขอแจ้งปัญหาแบบเรียลไทม์หรือการตรวจจับการประพฤติมิชอบ
- ฟีเจอร์สำหรับลูกค้าพรีเมียม: นักพัฒนาแอปที่ต้องการรับประกันเป้าหมายระดับการให้บริการ (SLO) ที่สูงขึ้นสำหรับลูกค้าที่ชำระเงิน
ขีดจำกัดอัตรา
การใช้งานที่มีลำดับความสำคัญจะมีขีดจำกัดอัตราของตัวเอง แม้ว่าการใช้งานจะนับรวมในขีดจำกัดอัตราการเข้าชมแบบอินเทอร์แอกทีฟโดยรวมก็ตาม ขีดจำกัดอัตราเริ่มต้น สำหรับการอนุมานแบบมีลำดับความสำคัญคือขีดจำกัดอัตรามาตรฐาน 0.3 เท่าสำหรับโมเดล / ระดับ
ตรรกะการดาวน์เกรดอย่างค่อยเป็นค่อยไป
หากมีการใช้งานเกินขีดจำกัดของลำดับความสำคัญเนื่องจากความหนาแน่น คำขอที่เกินมาจะลดระดับโดยอัตโนมัติและราบรื่นเป็นการประมวลผลแบบมาตรฐานแทนที่จะ ล้มเหลวพร้อมข้อผิดพลาด 503 หรือ 429 ระบบจะเรียกเก็บเงินสำหรับคำขอที่ลดระดับในอัตรามาตรฐาน ไม่ใช่ในอัตราพรีเมียมแบบลำดับความสำคัญ
ความรับผิดชอบของลูกค้า
- การตรวจสอบการตอบกลับ: นักพัฒนาแอปควรตรวจสอบ
x-gemini-service-tierส่วนหัวในการตอบกลับของ API เพื่อตรวจหาว่ามีการลดระดับคำขอเป็นstandardบ่อยหรือไม่ - การลองใหม่: ไคลเอ็นต์ต้องใช้ตรรกะการลองใหม่/Exponential Backoff สำหรับ
ข้อผิดพลาดมาตรฐาน เช่น
DEADLINE_EXCEEDED
ราคา
การอนุมานที่มีลำดับความสำคัญสูงกว่ามีราคาแพงกว่า API มาตรฐาน 75-100% และจะเรียกเก็บเงินต่อโทเค็น
รุ่นที่รองรับ
โมเดลต่อไปนี้รองรับการอนุมานที่มีลำดับความสำคัญ
| รุ่น | การอนุมานตามลำดับความสำคัญ |
|---|---|
| Gemini 3.8 Flash | ✔️ |
| Gemini 3.7 Flash | ✔️ |
| Gemini 3.6 Flash | ✔️ |
| Gemini 3.5 Flash-Lite | ✔️ |
| Gemini 3.5 Flash | ✔️ |
| Gemini 3.1 Flash-Lite | ✔️ |
| Gemini 3.1 Pro เวอร์ชันตัวอย่าง | ✔️ |
| ตัวอย่าง Gemini 3 Flash | ✔️ |
| Gemini 2.5 Pro | ✔️ |
| Gemini 2.5 Flash | ✔️ |
| Gemini 2.5 Flash-Lite | ✔️ |
ขั้นตอนถัดไป
- Flex Inference เพื่อลดต้นทุน
- โทเค็น: ทำความเข้าใจโทเค็น