Gemini 3.6 Flash (gemini-3.6-flash) y Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite) están disponibles de forma general (DG) y listos para su uso en producción.
- Gemini 3.6 Flash: Ofrece un mejor rendimiento en tareas complejas de agentes y multimodales, a la vez que reduce el uso de tokens, a un precio más bajo que 3.5 Flash.
- Gemini 3.5 Flash-Lite: Es el modelo más rápido y de menor costo de la familia 3.5. Supera a las generaciones anteriores de Flash-Lite para la ejecución de alto rendimiento.
En esta guía, se explica qué novedades incluye cada modelo, qué cambios en la API afectan tu código y cómo realizar la migración.
Gemini 3.6 Flash
Instala la habilidad:
npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --globalAplica la habilidad:
/gemini-interactions-api migrate my app to Gemini 3.6 Flash
Gemini 3.5 Flash-Lite
Instala la habilidad:
npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --globalAplica la habilidad:
/gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite
Modelos nuevos
| Modelo | ID de modelo | Nivel de pensamiento predeterminado | Precios | Descripción |
|---|---|---|---|---|
| Gemini 3.6 Flash | gemini-3.6-flash |
medium |
$1.50 por 1 millón de tokens de entrada y $7.50 por 1 millón de tokens de salida | Equilibra la velocidad con la inteligencia para tareas de agentes y multimodales. |
| Gemini 3.5 Flash-Lite | gemini-3.5-flash-lite |
minimal |
$0.30 por 1 millón de tokens de entrada y $2.50 por 1 millón de tokens de salida | Es el modelo 3.5 más rápido y de menor costo para la ejecución de alto rendimiento. |
Ambos modelos admiten la ventana de contexto de 1 millón de tokens, 64,000 tokens de salida máximos, el pensamiento y el conjunto completo de herramientas integradas, incluido el uso de la computadora.
Para obtener especificaciones completas, consulta las páginas del modelo:
Para obtener información detallada sobre los precios, consulta la página de precios.
Guía de inicio rápido
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Write a three.js script that renders an interactive 3D robot."
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
async function main() {
const interaction = await ai.interactions.create({
model: "gemini-3.6-flash",
input: "Write a three.js script that renders an interactive 3D robot.",
});
console.log(interaction.outputText);
}
main();
REST
curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"model": "gemini-3.6-flash",
"input": {
"parts": [{"text": "Write a three.js script that renders an interactive 3D robot."}]
}
}'
Novedades de Gemini 3.6 Flash
- Reducción de tokens y turnos: Completa flujos de trabajo de varios pasos con menos pasos de razonamiento, turnos conversacionales y llamadas a herramientas que Gemini 3.5. También reduce la espiral del bucle de ejecución.
- Generación de código mejorada: Produce código listo para producción de mayor calidad con menos ediciones no deseadas y menos bucles de depuración.
- Mejor seguimiento de instrucciones: Reduce los cambios de archivos no deseados durante las tareas de diagnóstico.
- Razonamiento espacial y multimodal sólido: Mejor rendimiento en la interpretación de gráficos, la conversión de planos visuales y la generación de diseño web de varios elementos.
- Inspección programática inicial: Prefiere ejecutar secuencias de comandos de código de diagnóstico antes de realizar cambios con más frecuencia que Gemini 3.5 Flash. Esto mejora la precisión en tareas complejas, pero puede agregar pasos exploratorios adicionales en el trabajo simple de frontend.
- Compatibilidad con el uso de la computadora: Se admite como herramienta nativa para la automatización de la IU de agentes.
- Preferencia de diseño de la IU: Es mejor para crear código funcional, aunque los evaluadores humanos prefirieron los modelos anteriores para el diseño visual y el diseño. Puedes mitigar esto si proporcionas lineamientos de diseño explícitos.
- Esfuerzo de pensamiento predeterminado (medio): Usa el mismo nivel de pensamiento predeterminado
mediumque Gemini 3.5 Flash. - Precios reducidos: Menores costos de tokens de salida ($7.50 por 1 millón en comparación con $9.00 por 1 millón para 3.5 Flash). Los tokens de entrada permanecen en $1.50 por 1 millón.
Novedades de Gemini 3.5 Flash-Lite
- Latencia de ejecución de tareas reducida: Mayor capacidad de procesamiento en la familia 3.5 para el análisis de datos de gran volumen y la extracción de documentos.
- Rendimiento multimodal y de razonamiento mejorado: Sólida ruta de migración desde Gemini 2.5 Flash, con puntuaciones más altas en tareas de razonamiento como HLE (18.0% en comparación con 11.0%) y comparativas multimodales como CharXIV (74.5% en comparación con 63.7%).
- Organización de subagentes y confiabilidad de las herramientas: Mejora la confiabilidad de la ejecución de herramientas para la ejecución de código, la búsqueda y los flujos de trabajo de MCP. Aumenta el nivel de pensamiento para la planificación autónoma y las tareas complejas de subagentes.
- Comprensión de documentos mejorada: Mejora la exactitud en el análisis de documentos y la extracción de datos estructurados. Experimenta con niveles de pensamiento mínimos y altos según la complejidad del documento.
- Codificación web interactiva y procesamiento de datos tabulares: Tiene un buen rendimiento en JavaScript de frontend y procesamiento de datos tabulares mediante la planificación a través de la ejecución de código ligero.
- Chatbot y persistencia de personajes: Mejor seguimiento de instrucciones de varios turnos y coherencia de personajes en comparación con Gemini 3.1 Flash-Lite.
- Compatibilidad con el uso de la computadora: Se admite como herramienta nativa para la automatización de la IU de agentes.
Cómo elegir el modelo Flash o Flash-Lite adecuado
Usa esta tabla para seleccionar el modelo y la ruta de migración adecuados para tus cargas de trabajo.
Ambos modelos requieren que se quiten los parámetros de muestreo obsoletos (temperature, top_p, top_k) y los turnos de modelo rellenados previamente. Consulta los cambios en la API para obtener más detalles.
| Modelo | Casos de uso principales | Objetivo de migración recomendado |
|---|---|---|
Gemini 3.6 Flashgemini-3.6-flash |
Generación de código, razonamiento espacial/multimodal, flujos de trabajo de agentes de varios pasos | Gemini 3.5 Flash, Gemini 3 Flash (versión preliminar) o Gemini 3.1 Pro |
Gemini 3.5 Flash-Litegemini-3.5-flash-lite |
Ejecución autónoma de subagentes, análisis de datos de gran volumen y extracción de documentos, análisis JSON estructurado | Gemini 3.1 Flash-Lite o Gemini 2.5 Flash |
Agente de Antigravity actualizado
Debido a su rendimiento mejorado, Gemini 3.6 Flash ahora es el nuevo modelo predeterminado que potencia el agente de Antigravity en Agentes administrados de Gemini. Esto se puede cambiar si se configura un campo nuevo en la API.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
agent="antigravity-preview-05-2026",
input="Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
environment="remote",
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const client = new GoogleGenAI({});
const interaction = await client.interactions.create({
agent: "antigravity-preview-05-2026",
input: "Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
environment: "remote",
}, { timeout: 300000 });
console.log(interaction.output_text);
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"agent": "antigravity-preview-05-2026",
"input": "Read Hacker News, summarize the top 10 stories, and save the results as a PDF.",
"environment": "remote"
}'
Cambios en la API y actualizaciones de parámetros
A partir de Gemini 3.6 Flash y Gemini 3.5 Flash-Lite, los siguientes cambios en la API se aplican a estos modelos y a todas las versiones futuras del modelo de Gemini.
- Baja del parámetro de muestreo: Se dieron de baja
temperature,top_pytop_k. La API ignora estos parámetros y muestra un error en las generaciones futuras del modelo. - Validación de turnos de modelo rellenados previamente: Ya no se admite el relleno previo de turnos de modelo. Si el último turno no vacío de la solicitud es un turno
model, la API muestra un error400.
A continuación, se incluyen explicaciones detalladas y ejemplos de código para cada cambio en la API.
1. Baja del parámetro de muestreo (temperature, top_p, top_k)
Se dieron de baja y se ignoran temperature, top_p y top_k. En las generaciones futuras del modelo, proporcionar estos parámetros muestra un error HTTP 400. Quita estos parámetros de todas las solicitudes.
# ⚠️ Remove these parameters (deprecated)
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Para mejorar el determinismo, define una instrucción del sistema con reglas explícitas para tu caso de uso específico.
2. Validación de turnos de modelo rellenados previamente
No se permiten las solicitudes a la API que terminan con un turno de rol de modelo no vacío y muestran un error HTTP 400.
⚠️ Evitar
En las cargas útiles de REST sin procesar o generateContent heredadas, ya no se permite terminar con un turno de rol de modelo:
/* ❌ DO NOT: End payload contents with a 'model' role turn */
{
"contents": [
{"role": "user", "parts": [{"text": "Translate 'Hello world' to Spanish."}]},
{"role": "model", "parts": [{"text": "Translation:"}]} /* ❌ Returns error */
]
}
✅ Migración recomendada (API de Interactions)
En la API de Interactions, los turnos de modelo no se rellenan previamente de forma manual. Si tu aplicación rellenó previamente un turno de modelo para suprimir preámbulos o forzar el formato JSON, usa system_instruction o salidas estructuradas en su lugar.
# ✅ RECOMMENDED: Use system_instruction in the Interactions API to specify output format
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Translate 'Hello world' to Spanish.",
system_instruction="Output only the translation without introductory text.",
)
Lista de tareas para la migración
Gemini 3.6 Flash
Instala la habilidad:
npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --globalAplica la habilidad:
/gemini-interactions-api migrate my app to Gemini 3.6 Flash
Gemini 3.5 Flash-Lite
Instala la habilidad:
npx skills add google-gemini/gemini-skills --skill gemini-interactions-api --globalAplica la habilidad:
/gemini-interactions-api migrate my app to Gemini 3.5 Flash-Lite
Migra a gemini-3.6-flash
- Actualiza el ID del modelo: Cambia la cadena del modelo de destino a
gemini-3.6-flash. - Quita los parámetros de muestreo obsoletos:
- Quita
temperature,top_pytop_kde las configuraciones de generación. - Reemplaza
thinking_budgetpor la enumeración de cadenasthinking_levelestablecida en"medium"o"high". - Quita
candidate_count(no compatible con Gemini 3.x).
- Quita
- Aplica las reglas de validación de turnos:
- Estandariza las conversaciones de varios turnos en
previous_interaction_iddel servidor. - Quita los turnos de modelo rellenados previamente.
- Estandariza las conversaciones de varios turnos en
- Audita la llamada a función:
- Coloca los elementos multimodales dentro de la carga útil de la respuesta.
- Formatea las instrucciones intercaladas con
\n\n. - Si ves errores
Malformed_Function_Callvinculados al texto anterior a la herramienta, consulta Soluciones alternativas para los requisitos de texto anterior a la herramienta. - Solo si usas la API de generateContent: Asegúrate de que todos los objetos
FunctionResponseincluyancall_idyname.
- Requisitos de referencia de Gemini 3.x: Para obtener actualizaciones del SDK y la conservación de la firma de pensamiento, consulta la lista de tareas para la migración de Gemini 3.5.
Migra a gemini-3.5-flash-lite
- Actualiza el ID del modelo: Cambia la cadena del modelo de destino a
gemini-3.5-flash-lite. - Configura el nivel de esfuerzo de pensamiento:
- Para la extracción, el enrutamiento o la clasificación de gran volumen, deja
thinking_levelen"minimal"(predeterminado) para obtener la máxima capacidad de procesamiento. - Para subagentes autónomos con llamadas a herramientas, ejecución de código o razonamiento de varios pasos, establece
thinking_levelen"medium"o"high"para evitar la finalización prematura de la herramienta.
- Para la extracción, el enrutamiento o la clasificación de gran volumen, deja
- Quita los parámetros obsoletos y valida la llamada a función: Aplica las mismas reglas que 3.6 Flash.
- Requisitos de referencia de Gemini 3.x: Consulta la lista de tareas para la migración de Gemini 3.5.
Próximos pasos
- Revisa las especificaciones de la API en la Descripción general de los modelos.
- Explora la organización de varios agentes en la Guía de la API de Interactions.
- Prueba y define instrucciones en Google AI Studio.