Gemini API の最適化と推論

Gemini API には、特定のワークロードのニーズに基づいて速度、費用、信頼性のバランスを取るためのさまざまな最適化メカニズムが用意されています。リアルタイムの会話型ボットを構築する場合でも、大量のオフライン データ処理パイプラインを実行する場合でも、適切なパラダイムを選択することで、費用を大幅に削減したり、パフォーマンスを向上させたりできます。

機能 標準 Flex 優先度 バッチ キャッシュ
料金 正規料金 50% 割引 標準の 75 ~ 100% 増 50% 割引 90% 割引 + トークン ストレージの比例配分
レイテンシ 数秒~数分 分(1 ~ 15 分の目標) 秒 最大 24 時間 最初のトークンまでの時間の短縮
信頼性 高 / 中高 ベスト エフォート(Sheddable) 高(非脱落性) 高(スループットの場合) なし
インターフェース 同期 同期 同期 非同期 保存された状態
最適なユースケース 一般的なアプリケーション ワークフロー 緊急でないシーケンシャル チェーン 製品版のユーザー向けアプリ 大規模なデータセット、オフライン評価 同じファイルに対する繰り返しのクエリ

推論サービスティア(同期)

標準生成呼び出しで service_tier パラメータを渡すことで、信頼性最適化と費用最適化の同期トラフィックを切り替えることができます。

標準推論(デフォルト)

標準階層は、シーケンシャル コンテンツ生成のデフォルト オプションです。追加料金や長いキューイングなしで、通常の応答時間を提供します。

  • 信頼性: 標準の重大度
  • 料金: Standard の料金。
  • 最適な用途: ほとんどのインタラクティブな日常的なアプリケーション。

優先推論(レイテンシ最適化)

優先度処理では、リクエストが重要度の高いコンピューティング キューに転送されます。このトラフィックは厳密に非シェッド可能(他の階層によってプリエンプトされない)であり、最高の信頼性を提供します。動的優先度の上限を超えると、システムはエラーで失敗するのではなく、リクエストを標準処理に正常にダウングレードします。

  • 信頼性: 最も高い重要度
  • 価格: 標準レートの 75 ~ 100% 増し。
  • 最適な用途: カスタマー チャットボット、リアルタイムの不正行為検出、ビジネスに不可欠な副操縦士。

Flex 推論(費用最適化)

Flex 推論では、機会的なオフピークのコンピュート容量を利用することで、標準料金と比較して 50% の割引が適用されます。リクエストは同期的に処理されるため、バッチ オブジェクトを管理するためにコードを書き換える必要はありません。このトラフィックは「削減可能」なトラフィックであるため、システムで標準トラフィックの急増が発生した場合、リクエストがプリエンプトされることがあります。

  • 信頼性: 非保証型、削減可能な重要度
  • 料金: 標準料金の 50%(トークンごとに課金)。
  • 最適な用途: 呼び出し N+1 が呼び出し N の出力、バックグラウンド CRM の更新、オフライン評価に依存するマルチステップ Agentic Workflows。

Batch API(一括、非同期)

Batch API は、大量のリクエストを標準料金の 50% で非同期に処理するように設計されています。リクエストは、インライン辞書として送信するか、JSONL 入力ファイル(最大 2 GB)を使用して送信できます。リクエストは、目標応答時間 24 時間のバックグラウンド スループット キューを使用して処理されます。

  • 信頼性: 24 時間の自動再試行とキューイング システムを備えた、破棄可能なサービス
  • 料金: Standard の料金の 50%。
  • 最適な用途: 大規模なデータセットの前処理、定期的な回帰テストスイートの実行、大量の画像やエンベディングの生成。

コンテキスト キャッシュ保存(入力コストの削減)

コンテキスト キャッシュ保存は、初期コンテキストの実体部分が、短いリクエストで繰り返し参照される場合に使用されます。

  • 暗黙的キャッシュ保存: Gemini 2.5 以降のモデルで自動的に有効になります。リクエストが共通のプロンプト接頭辞に基づいて既存のキャッシュにヒットした場合、システムはコスト削減を渡します。
  • 明示的なキャッシュ保存: 特定の有効期間(TTL)を持つキャッシュ オブジェクトを手動で作成できます。作成後は、同じコーパス ペイロードを繰り返し渡すことを避けるため、後続のリクエストでキャッシュに保存されたトークンを参照します。
  • 料金: キャッシュ トークンの数と保存期間(TTL)に基づいて課金されます。
  • 最適な用途: 広範なシステム指示を伴う chatbot、長時間の動画ファイルの繰り返し分析、大規模なドキュメント セットに対するクエリ。

エージェント処理で動画入力のコストを削減する

長尺の動画コンテンツの場合、エージェント処理により、入力トークンの費用を最大 88% 削減しながら、レスポンスの品質を向上させることができます。モデルは、1 FPS で各フレームを抽出する(静的処理)のではなく、動画を動的に検索し、プロンプトに関連する文字起こし、フレーム、音声などを読み込みます。レイテンシが重要な短いクリップ(5 分未満)の場合、エージェント モードでは生成が開始される前に内部推論とツールとの往復が発生するため、静的処理の方がファースト トークンまでの時間(TTFT)が短くなる可能性があります。

Gemini 3.8 Flash、3.6 Flash、3.5 Flash Lite でエージェント処理を使用するには、動画入力で processing: "agentic"(Interactions API)または media_processing: "AGENTIC"(GenerateContent API)を設定します。モデルがエージェント処理をサポートしていない場合は、エラーが返されます。

コード例については、エージェント型動画理解をご覧ください。