Gemini API מציע מגוון מנגנוני אופטימיזציה שיעזרו לכם לאזן בין מהירות, עלות ומהימנות בהתאם לצרכים הספציפיים של עומס העבודה. לא משנה אם אתם בונים בוטים לשיחות בזמן אמת או מפעילים צינורות לעיבוד נתונים אופליין כבדים, בחירה של פרדיגמה נכונה יכולה להוביל לחיסכון משמעותי בעלויות או לשיפור הביצועים.
| תכונה | רגיל | שרירים של סלע | עדיפות | Batch | שמירה במטמון |
|---|---|---|---|---|---|
| תמחור | המחיר המלא | הנחה של 50% | 75% עד 100% יותר מהרגיל | הנחה של 50% | הנחה של 90% + אחסון יחסי של טוקנים |
| זמן טעינה | שניות לדקות | דקות (יעד של 1-15 דקות) | שניות | עד 24 שעות | זמן מהיר יותר עד ליצירת הטוקן הראשון |
| אמינות | גבוהה / בינונית-גבוהה | הכי טוב שאפשר (ניתן להשמטה) | גבוהה (לא נושרת) | גבוהה (לתפוקה) | לא רלוונטי |
| ממשק | סינכרוני | סינכרוני | סינכרוני | אסינכרוני | מצב שמור |
| תרחיש השימוש הטוב ביותר | תהליכי עבודה כלליים באפליקציות | שרשראות רצופות של פעולות לא דחופות | אפליקציות שפונות למשתמשים ומוכנות לשימוש | מערכי נתונים גדולים מאוד, הערכות אופליין | שאילתות חוזרות על אותו קובץ |
רמות שירות של הסקת מסקנות (סינכרוני)
אפשר לעבור בין תנועה סינכרונית שעברה אופטימיזציה לאמינות לבין תנועה סינכרונית שעברה אופטימיזציה לעלות על ידי העברת הפרמטר service_tier בקריאות ליצירת סטנדרט.
הסקת מסקנות רגילה (ברירת מחדל)
המסלול הרגיל הוא ברירת המחדל ליצירת תוכן רציפה. הוא מספק זמני תגובה רגילים בלי תוספות או תורים ארוכים.
- אמינות: רמת קריטיות רגילה
- המחיר: המחיר הרגיל.
- הכי מתאים ל: רוב האפליקציות האינטראקטיביות לשימוש יומיומי.
הסקת מסקנות בעדיפות גבוהה (אופטימיזציה של זמן האחזור)
תעדוף: הבקשות שלכם מנותבות לתורים של מחשוב ברמת קריטיות גבוהה. התנועה הזו לא ניתנת להסרה (לעולם לא תידחק על ידי רמות אחרות) ומציעה את רמת המהימנות הגבוהה ביותר. אם חורגים ממגבלות העדיפות הדינמית, המערכת תוריד את רמת העיבוד של הבקשה לעיבוד רגיל במקום להחזיר שגיאה.
- אמינות: רמת הקריטיות הגבוהה ביותר
- מחיר: 75% עד 100% מעל המחירים הרגילים.
- הכי מתאים ל: צ'אטבוטים לשירות לקוחות, זיהוי הונאות בזמן אמת וטייסים וירטואליים שחיוניים לעסק.
היקש ברמת Flex (אופטימיזציה של עלויות)
היקש ברמת Flex מציע הנחה של 50% בהשוואה לתעריפים הרגילים, באמצעות ניצול של קיבולת משאבי מחשוב אופורטוניסטית מחוץ לשעות השיא. הבקשות מעובדות באופן סינכרוני, כלומר לא צריך לכתוב מחדש קוד כדי לנהל אובייקטים של קבוצות. מכיוון שמדובר בתנועה שניתן להפחית, יכול להיות שהבקשות יידחו אם יתרחשו במערכת עליות חדות בתנועה.
- אמינות: קריטיות לא מובטחת, ניתנת להסרה
- המחיר: 50% מהתמחור הרגיל (החיוב הוא לכל טוקן).
- הכי מתאים ל: תהליכי עבודה אג'נטיים מרובי שלבים שבהם שיחה N+1 תלויה בפלט של שיחה N, עדכונים של מערכת ה-CRM ברקע והערכות אופליין.
Batch API (בכמות גדולה, אסינכרוני)
Batch API מיועד לעיבוד של נפחים גדולים של בקשות באופן אסינכרוני, בעלות של 50% מהעלות הרגילה. אפשר לשלוח בקשות כמילונים מוטבעים או באמצעות קובץ קלט JSONL (עד 2GB). הבקשות מעובדות באמצעות תורים של נפח נתונים (throughput) ברקע, עם יעד של 24 שעות לזמן הטיפול בכל בקשה.
- מהימנות: אפשר להשליך את הנתונים, אבל יש מערכת אוטומטית לניסיון חוזר של שליחת הנתונים ולשמירתם בתור למשך 24 שעות
- המחיר: 50% מהמחיר של Standard.
- הכי מתאים ל: עיבוד מראש של מערכי נתונים גדולים, הפעלת חבילות מקרים לבדיקה רגרסיה תקופתיות ויצירת תמונות או הטמעות בכמויות גדולות.
שמירת הקשר במטמון (חיסכון בקלט)
שמירת הקשר במטמון משמשת כשבקשות קצרות יותר מפנות שוב ושוב להקשר ראשוני משמעותי.
- שמירה במטמון באופן מרומז: מופעלת אוטומטית ב-Gemini 2.5 ובמודלים חדשים יותר. המערכת מעבירה את החיסכון בעלויות אם הבקשה שלכם מגיעה למטמון קיים על סמך קידומות נפוצות של הנחיות.
- שמירה במטמון באופן מפורש: אפשר ליצור באופן ידני אובייקט מטמון עם משך חיים (TTL) ספציפי. אחרי שיוצרים את האסימונים, אפשר להפנות אליהם בבקשות הבאות כדי להימנע מהעברת אותה מטען ייעודי (payload) של קורפוס שוב ושוב.
- המחיר: החיוב מבוסס על מספר אסימוני המטמון ומשך האחסון (TTL).
- הכי מתאים ל: צ'אטבוטים עם הוראות מערכת מפורטות, ניתוח חוזר של קובצי וידאו ארוכים או שאילתות שמופנות למערכי מסמכים גדולים.
הפחתת עלויות של קלט וידאו באמצעות עיבוד מבוסס-סוכנים
בסרטונים ארוכים (LFV), עיבוד סוכני יכול להפחית את עלויות הטוקנים של הקלט בשיעור של עד 88% ולשפר את איכות התגובה. במקום לחלץ כל פריים בקצב של פריים אחד לשנייה (עיבוד סטטי), המודל מחפש באופן דינמי בסרטון, ומטעין תמליל ו/או פריים ו/או אודיו שרלוונטיים להנחיה. במקרה של קליפים קצרים (עד 5 דקות) שבהם זמן האחזור הוא קריטי, עיבוד סטטי עשוי לספק זמן מהיר יותר עד לטוקן הראשון (TTFT), כי במצב של סוכן יש נימוקים פנימיים ושימוש בכלי הלוך ושוב לפני שהיצירה מתחילה.
כדי להשתמש בעיבוד מבוסס-סוכן עם Gemini 3.8 Flash, Gemini 3.6 Flash או Gemini 3.5 Flash Lite, צריך להגדיר את processing: "agentic" (Interactions API) או את media_processing: "AGENTIC" (GenerateContent API) בקלט הווידאו. אם המודל לא תומך בעיבוד באמצעות סוכן, הוא יחזיר שגיאה.
דוגמאות קוד זמינות במאמר בנושא הבנת סרטונים באמצעות סוכנים.