A API Gemini oferece vários mecanismos de otimização para ajudar você a equilibrar velocidade, custo e confiabilidade com base nas necessidades específicas da sua carga de trabalho. Seja para criar bots de conversa em tempo real ou executar pipelines de processamento de dados off-line pesados, escolher o paradigma certo pode reduzir significativamente os custos ou aumentar a performance.
| Recurso | Padrão | Flex | Prioridade | Lote | Armazenamento em cache |
|---|---|---|---|---|---|
| Preços | Preço total | 50% de desconto | 75% a 100% a mais do que o padrão | 50% de desconto | 90% de desconto + armazenamento proporcional de tokens |
| Latência | Segundos para minutos | Minutos (meta de 1 a 15 minutos) | Segundos | Até 24 horas | Tempo até o primeiro token mais rápido |
| Confiabilidade | Alta / média-alta | Melhor esforço (descartável) | Alta (não descartável) | Alta (para capacidade de processamento) | N/A |
| Interface | Síncrona | Síncrona | Síncrona | Assíncrono | Estado salvo |
| Melhor caso de uso | Fluxos de trabalho gerais de aplicativos | Cadeias sequenciais não urgentes | Apps de produção voltados ao usuário | Conjuntos de dados enormes, avaliações off-line | Consultas recorrentes no mesmo arquivo |
Níveis de serviço de inferência (síncronos)
É possível alternar entre o tráfego síncrono otimizado para confiabilidade e para custo transmitindo o parâmetro service_tier nas chamadas de geração padrão.
Inferência padrão (padrão)
O nível padrão é a opção padrão para geração de conteúdo sequencial. Ele oferece tempos de resposta normais sem prêmios extras ou filas pesadas.
- Confiabilidade:gravidade padrão
- Preço:preços padrão.
- Ideal para:a maioria dos aplicativos interativos do dia a dia.
Inferência de prioridade (otimizada para latência)
O processamento de prioridade encaminha suas solicitações para filas de computação de alta criticidade. Esse tráfego é estritamente não descartável (nunca substituído por outros níveis) e oferece a maior confiabilidade. Se você exceder os limites de prioridade dinâmica, o sistema vai reduzir a solicitação para o processamento padrão em vez de falhar com um erro.
- Confiabilidade:criticidade máxima
- Preço:75% a 100% acima das taxas padrão.
- Ideal para:chatbots de atendimento ao cliente, detecção de fraude em tempo real e copilotos essenciais para os negócios.
Inferência flexível (custo otimizado)
A inferência flexível oferece um desconto de 50% em comparação com as taxas padrão ao usar capacidade de computação oportunista e fora do pico. As solicitações são processadas de forma síncrona, ou seja, não é necessário reescrever o código para gerenciar objetos de lote. Como é um tráfego "descartável", as solicitações podem ser substituídas se o sistema passar por picos de tráfego padrão.
- Confiabilidade:não garantida, capacidade de redução de criticidade
- Preço:50% do preço padrão (cobrado por token).
- Ideal para:Agentic Workflows em várias etapas em que a chamada N+1 depende da saída da chamada N, atualizações em segundo plano do CRM e avaliações off-line.
API Batch (em massa, assíncrona)
A API Batch foi projetada para processar grandes volumes de solicitações de forma assíncrona com 50% do custo padrão. É possível enviar solicitações como dicionários in-line ou usando um arquivo de entrada JSONL (até 2 GB). Ele processa solicitações usando filas de capacidade de processamento em segundo plano com um tempo de resposta de 24 horas.
- Confiabilidade:descartável, mas com novas tentativas automatizadas e sistema de filas por 24 horas.
- Preço:50% do preço padrão.
- Ideal para:pré-processar conjuntos de dados enormes, executar conjuntos de testes de regressão periódicos e gerar imagens ou incorporações de alto volume.
Armazenamento em cache de contexto (economia de entrada)
O armazenamento em cache de contexto é usado quando um contexto inicial substancial é referenciado repetidamente por solicitações mais curtas.
- Armazenamento em cache implícito:ativado automaticamente no Gemini 2.5 e em modelos mais recentes. O sistema repassa a economia de custos se sua solicitação atingir caches existentes com base em prefixos de comandos comuns.
- Armazenamento em cache explícito:é possível criar manualmente um objeto de cache com um Time-To-Live (TTL) específico. Depois de criados, consulte os tokens armazenados em cache para solicitações subsequentes e evite transmitir o mesmo payload de corpus repetidamente.
- Preço:cobrado com base na contagem de tokens de cache e na duração do armazenamento (TTL).
- Ideal para:chatbots com instruções abrangentes do sistema, análise repetitiva de arquivos de vídeo longos ou consultas em grandes conjuntos de documentos.
Reduza os custos de entrada de vídeo com o processamento de agentes
Para conteúdo de vídeo mais longo, o processamento com agente pode reduzir os custos de tokens de entrada em até 88% e melhorar a qualidade da resposta. Em vez de extrair todos os frames a 1 FPS (processamento estático), o modelo busca dinamicamente no vídeo, carregando a transcrição e/ou os frames e/ou o áudio relevantes para seu comando. Para clipes curtos (menos de 5 minutos) em que a latência é essencial, o processamento estático pode fornecer um tempo até o primeiro token (TTFT) mais rápido, já que o modo de agente gera raciocínio interno e viagens de ida e volta de ferramentas antes do início da geração.
Para usar o processamento com agentes com o Gemini 3.8 Flash, 3.6 Flash ou 3.5 Flash Lite,
defina processing: "agentic" (API Interactions) ou
media_processing: "AGENTIC" (API GenerateContent) na entrada de vídeo. Se o modelo não for compatível com o processamento de agente, ele vai retornar um erro.
Consulte Compreensão agêntica de vídeos para ver exemplos de código.