Otimização e inferência da API Gemini

A API Gemini oferece vários mecanismos de otimização para ajudar você a equilibrar velocidade, custo e confiabilidade com base nas necessidades específicas da sua carga de trabalho. Seja para criar bots de conversa em tempo real ou executar pipelines de processamento de dados off-line pesados, escolher o paradigma certo pode reduzir significativamente os custos ou aumentar a performance.

Recurso Padrão Flex Prioridade Lote Armazenamento em cache
Preços Preço total 50% de desconto 75% a 100% a mais do que o padrão 50% de desconto 90% de desconto + armazenamento proporcional de tokens
Latência Segundos para minutos Minutos (meta de 1 a 15 minutos) Segundos Até 24 horas Tempo até o primeiro token mais rápido
Confiabilidade Alta / média-alta Melhor esforço (descartável) Alta (não descartável) Alta (para capacidade de processamento) N/A
Interface Síncrona Síncrona Síncrona Assíncrono Estado salvo
Melhor caso de uso Fluxos de trabalho gerais de aplicativos Cadeias sequenciais não urgentes Apps de produção voltados ao usuário Conjuntos de dados enormes, avaliações off-line Consultas recorrentes no mesmo arquivo

Níveis de serviço de inferência (síncronos)

É possível alternar entre o tráfego síncrono otimizado para confiabilidade e para custo transmitindo o parâmetro service_tier nas chamadas de geração padrão.

Inferência padrão (padrão)

O nível padrão é a opção padrão para geração de conteúdo sequencial. Ele oferece tempos de resposta normais sem prêmios extras ou filas pesadas.

  • Confiabilidade:gravidade padrão
  • Preço:preços padrão.
  • Ideal para:a maioria dos aplicativos interativos do dia a dia.

Inferência de prioridade (otimizada para latência)

O processamento de prioridade encaminha suas solicitações para filas de computação de alta criticidade. Esse tráfego é estritamente não descartável (nunca substituído por outros níveis) e oferece a maior confiabilidade. Se você exceder os limites de prioridade dinâmica, o sistema vai reduzir a solicitação para o processamento padrão em vez de falhar com um erro.

  • Confiabilidade:criticidade máxima
  • Preço:75% a 100% acima das taxas padrão.
  • Ideal para:chatbots de atendimento ao cliente, detecção de fraude em tempo real e copilotos essenciais para os negócios.

Inferência flexível (custo otimizado)

A inferência flexível oferece um desconto de 50% em comparação com as taxas padrão ao usar capacidade de computação oportunista e fora do pico. As solicitações são processadas de forma síncrona, ou seja, não é necessário reescrever o código para gerenciar objetos de lote. Como é um tráfego "descartável", as solicitações podem ser substituídas se o sistema passar por picos de tráfego padrão.

  • Confiabilidade:não garantida, capacidade de redução de criticidade
  • Preço:50% do preço padrão (cobrado por token).
  • Ideal para:Agentic Workflows em várias etapas em que a chamada N+1 depende da saída da chamada N, atualizações em segundo plano do CRM e avaliações off-line.

API Batch (em massa, assíncrona)

A API Batch foi projetada para processar grandes volumes de solicitações de forma assíncrona com 50% do custo padrão. É possível enviar solicitações como dicionários in-line ou usando um arquivo de entrada JSONL (até 2 GB). Ele processa solicitações usando filas de capacidade de processamento em segundo plano com um tempo de resposta de 24 horas.

  • Confiabilidade:descartável, mas com novas tentativas automatizadas e sistema de filas por 24 horas.
  • Preço:50% do preço padrão.
  • Ideal para:pré-processar conjuntos de dados enormes, executar conjuntos de testes de regressão periódicos e gerar imagens ou incorporações de alto volume.

Armazenamento em cache de contexto (economia de entrada)

O armazenamento em cache de contexto é usado quando um contexto inicial substancial é referenciado repetidamente por solicitações mais curtas.

  • Armazenamento em cache implícito:ativado automaticamente no Gemini 2.5 e em modelos mais recentes. O sistema repassa a economia de custos se sua solicitação atingir caches existentes com base em prefixos de comandos comuns.
  • Armazenamento em cache explícito:é possível criar manualmente um objeto de cache com um Time-To-Live (TTL) específico. Depois de criados, consulte os tokens armazenados em cache para solicitações subsequentes e evite transmitir o mesmo payload de corpus repetidamente.
  • Preço:cobrado com base na contagem de tokens de cache e na duração do armazenamento (TTL).
  • Ideal para:chatbots com instruções abrangentes do sistema, análise repetitiva de arquivos de vídeo longos ou consultas em grandes conjuntos de documentos.

Reduza os custos de entrada de vídeo com o processamento de agentes

Para conteúdo de vídeo mais longo, o processamento com agente pode reduzir os custos de tokens de entrada em até 88% e melhorar a qualidade da resposta. Em vez de extrair todos os frames a 1 FPS (processamento estático), o modelo busca dinamicamente no vídeo, carregando a transcrição e/ou os frames e/ou o áudio relevantes para seu comando. Para clipes curtos (menos de 5 minutos) em que a latência é essencial, o processamento estático pode fornecer um tempo até o primeiro token (TTFT) mais rápido, já que o modo de agente gera raciocínio interno e viagens de ida e volta de ferramentas antes do início da geração.

Para usar o processamento com agentes com o Gemini 3.8 Flash, 3.6 Flash ou 3.5 Flash Lite, defina processing: "agentic" (API Interactions) ou media_processing: "AGENTIC" (API GenerateContent) na entrada de vídeo. Se o modelo não for compatível com o processamento de agente, ele vai retornar um erro.

Consulte Compreensão agêntica de vídeos para ver exemplos de código.