Gemini API มีกลไกการเพิ่มประสิทธิภาพที่หลากหลายเพื่อช่วยให้คุณรักษาสมดุลระหว่างความเร็ว ต้นทุน และความน่าเชื่อถือตามความต้องการของภาระงานที่เฉพาะเจาะจง ไม่ว่าคุณจะสร้างบอทสนทนาแบบเรียลไทม์หรือเรียกใช้ไปป์ไลน์การประมวลผลข้อมูลแบบออฟไลน์ที่มีปริมาณมาก การเลือกกระบวนทัศน์ที่เหมาะสมจะช่วยลดต้นทุนหรือเพิ่มประสิทธิภาพได้อย่างมาก
| ฟีเจอร์ | มาตรฐาน | พับ | ลำดับความสำคัญ | กลุ่ม | กำลังแคช |
|---|---|---|---|---|---|
| การกำหนดราคา | ราคาเต็ม | ส่วนลด 50% | มากกว่ามาตรฐาน 75% ถึง 100% | ส่วนลด 50% | ส่วนลด 90% + พื้นที่เก็บข้อมูลโทเค็นตามสัดส่วน |
| เวลาในการตอบสนอง | วินาทีถึงนาที | นาที (เป้าหมาย 1-15 นาที) | วินาที | สูงสุด 24 ชั่วโมง | เวลาที่ได้โทเค็นแรกเร็วขึ้น |
| ความน่าเชื่อถือ | สูง / สูงปานกลาง | ดีที่สุดเท่าที่ทำได้ (ลดภาระได้) | สูง (ไม่หลุดร่วง) | สูง (สำหรับปริมาณงาน) | ไม่มี |
| อินเทอร์เฟซ | แบบซิงโครนัส | แบบซิงโครนัส | แบบซิงโครนัส | แบบอะซิงโครนัส | สถานะที่บันทึกไว้ |
| กรณีการใช้งานที่ดีที่สุด | เวิร์กโฟลว์การสมัครทั่วไป | เชนแบบลำดับที่ไม่เร่งด่วน | แอปเวอร์ชันที่ใช้งานจริงและแอปที่แสดงต่อผู้ใช้ | ชุดข้อมูลขนาดใหญ่ การประเมินแบบออฟไลน์ | การค้นหาที่เกิดซ้ำในไฟล์เดียวกัน |
ระดับการให้บริการอนุมาน (ซิงโครนัส)
คุณสามารถสลับระหว่างการเข้าชมแบบซิงโครนัสที่เพิ่มประสิทธิภาพความน่าเชื่อถือกับการเข้าชมแบบซิงโครนัสที่เพิ่มประสิทธิภาพต้นทุน
ได้โดยส่งพารามิเตอร์ service_tier ในการเรียกการสร้างมาตรฐาน
การอนุมานมาตรฐาน (ค่าเริ่มต้น)
ระดับมาตรฐานเป็นตัวเลือกเริ่มต้นสำหรับการสร้างเนื้อหาแบบต่อเนื่อง ซึ่งจะช่วยให้คุณได้รับการตอบกลับตามปกติโดยไม่ต้องจ่ายค่าธรรมเนียมเพิ่มเติมหรือรอคิวนาน
- ความน่าเชื่อถือ: ความสำคัญมาตรฐาน
- ราคา: ราคามาตรฐาน
- เหมาะสำหรับ: แอปพลิเคชันแบบอินเทอร์แอกทีฟส่วนใหญ่ที่ใช้ในชีวิตประจำวัน
การอนุมานที่มีลำดับความสำคัญ (เพิ่มประสิทธิภาพเวลาในการตอบสนอง)
เส้นทางการประมวลผลลำดับความสำคัญจะกำหนดเส้นทางคำขอของคุณ ไปยังคิวการประมวลผลที่มีความสำคัญสูง การรับส่งข้อมูลนี้จะไม่มีการลดทอน (ไม่ถูกแทนที่ด้วยระดับอื่นๆ) และมีความน่าเชื่อถือสูงสุด หากคุณเกินขีดจำกัดลำดับความสำคัญแบบไดนามิก ระบบจะลดระดับคำขอเป็นการประมวลผลแบบมาตรฐานแทน ที่จะทำให้เกิดข้อผิดพลาด
- ความน่าเชื่อถือ: ความสำคัญสูงสุด
- ราคา: สูงกว่าราคามาตรฐาน 75% ถึง 100%
- เหมาะสำหรับ: แชทบอทสำหรับลูกค้า การตรวจจับการฉ้อโกงแบบเรียลไทม์ และ ผู้ช่วยแบบเรียลไทม์ที่สำคัญต่อธุรกิจ
Flex Inference (เพิ่มประสิทธิภาพด้านต้นทุน)
Flex Inferenceเสนอส่วนลด 50% เมื่อเทียบกับอัตรามาตรฐานโดยใช้ความสามารถในการประมวลผลนอกช่วงเวลาที่มีการใช้งานสูง ระบบจะประมวลผลคำขอแบบ ซิงโครนัส ซึ่งหมายความว่าคุณไม่จำเป็นต้องเขียนโค้ดใหม่เพื่อจัดการออบเจ็กต์แบบกลุ่ม เนื่องจากเป็นการเข้าชมที่ "ลดได้" ระบบอาจขัดจังหวะคำขอหากระบบ พบว่ามีการเข้าชมเพิ่มขึ้นตามปกติ
- ความน่าเชื่อถือ: ความสำคัญที่ลดลงได้แบบไม่รับประกัน
- ราคา: 50% ของราคามาตรฐาน (เรียกเก็บเงินต่อโทเค็น)
- เหมาะสำหรับ: เวิร์กโฟลว์แบบ Agent หลายขั้นตอนที่การเรียกใช้ N+1 ขึ้นอยู่กับ เอาต์พุตของการเรียกใช้ N, การอัปเดต CRM ในเบื้องหลัง และการประเมินแบบออฟไลน์
Batch API (แบบกลุ่ม แบบไม่พร้อมกัน)
Batch API ออกแบบมาเพื่อประมวลผลคำขอจำนวนมากแบบไม่พร้อมกันโดยมีต้นทุน 50% ของต้นทุนมาตรฐาน คุณส่งคำขอเป็นพจนานุกรมในบรรทัด หรือใช้ไฟล์อินพุต JSONL (สูงสุด 2 GB) ก็ได้ โดยจะประมวลผลคำขอโดยใช้คิวที่มีปริมาณงานเบื้องหลัง ที่มีเวลาตอบกลับเป้าหมาย 24 ชั่วโมง
- ความน่าเชื่อถือ: สามารถยกเลิกได้ แต่มีระบบลองใหม่และจัดคิวอัตโนมัติ 24 ชั่วโมง
- ราคา: 50% ของราคามาตรฐาน
- เหมาะสำหรับ: การประมวลผลล่วงหน้าของชุดข้อมูลขนาดใหญ่ การเรียกใช้ชุดโปรแกรมทดสอบการถดถอยเป็นระยะ และการสร้างรูปภาพหรือการฝังจำนวนมาก
การแคชบริบท (ประหยัดอินพุต)
การแคชบริบทจะใช้เมื่อคำขอที่สั้นกว่าอ้างอิงบริบทเริ่มต้นที่สำคัญซ้ำๆ
- การแคชโดยนัย: เปิดใช้โดยอัตโนมัติใน Gemini 2.5 และโมเดลที่ใหม่กว่า ระบบจะส่งต่อการประหยัดต้นทุนหากคำขอของคุณตรงกับแคชที่มีอยู่โดยอิงตาม คำนำหน้าที่ใช้กันทั่วไป
- การแคชอย่างชัดเจน: คุณสร้างออบเจ็กต์แคชด้วยตนเองได้โดยมี Time-To-Live (TTL) ที่เฉพาะเจาะจง เมื่อสร้างแล้ว คุณจะอ้างอิงโทเค็นที่แคชไว้สำหรับคำขอในภายหลังได้ เพื่อหลีกเลี่ยงการส่งเพย์โหลดคลังเดียวกันซ้ำๆ
- ราคา: เรียกเก็บเงินตามจำนวนโทเค็นแคชและระยะเวลาการจัดเก็บ (TTL)
- เหมาะสำหรับ: แชทบอทที่มีคำสั่งของระบบที่ครอบคลุม การวิเคราะห์ซ้ำๆ ของไฟล์วิดีโอขนาดยาว หรือการค้นหาในชุดเอกสารขนาดใหญ่
ลดต้นทุนอินพุตวิดีโอด้วยการประมวลผลแบบเอเจนต์
สำหรับเนื้อหาวิดีโอแบบยาว การประมวลผลแบบเอเจนต์จะช่วยลดต้นทุนโทเค็นอินพุตได้สูงสุด 88% พร้อมทั้งปรับปรุงคุณภาพการตอบกลับ แทนที่จะแยกทุกเฟรม ที่ 1 FPS (การประมวลผลแบบคงที่) โมเดลจะค้นหาวิดีโอแบบไดนามิก โดยโหลดข้อความถอดเสียงและ/หรือเฟรมและ/หรือเสียงที่เกี่ยวข้องกับพรอมต์ของคุณ สำหรับคลิปสั้นๆ (ไม่เกิน 5 นาที) ที่ความหน่วงเป็นสิ่งสำคัญ การประมวลผลแบบคงที่อาจช่วยให้เวลาในการแสดงผลโทเค็นแรก (TTFT) เร็วขึ้น เนื่องจากโหมดตัวแทนต้องมีการให้เหตุผลภายในและการส่งคำขอไปกลับของเครื่องมือก่อนที่จะเริ่มสร้าง
หากต้องการใช้การประมวลผลแบบเอเจนต์กับ Gemini 3.8 Flash, 3.6 Flash หรือ 3.5 Flash Lite
ให้ตั้งค่า processing: "agentic" (Interactions API) หรือ
media_processing: "AGENTIC" (GenerateContent API) ในอินพุตวิดีโอ หาก
โมเดลไม่รองรับการประมวลผลแบบเอเจนต์ ระบบจะแสดงข้อผิดพลาด
ดูตัวอย่างโค้ดได้ที่ การทำความเข้าใจวิดีโอแบบเอเจนต์