La API de Gemini es el camino más rápido desde la instrucción hasta la producción con Gemini, Veo, Nano Banana y mucho más. Te permite integrar estos modelos generativos en tus aplicaciones para generar texto e imágenes, analizar entradas multimodales y compilar agentes conversacionales.
La API de Interactions es la mejor manera de compilar con la API de Gemini y los modelos y agentes de Gemini. Obtén más información en la Descripción general de la API de Interactions.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Explain how AI works in a few words"
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const interaction = await ai.interactions.create({
model: "gemini-3.6-flash",
input: "Explain how AI works in a few words",
});
console.log(interaction.output_text);
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.6-flash",
"input": "Explain how AI works in a few words"
}'
Sigue nuestra guía de introducción para obtener una clave de API y realizar tu primera llamada a la API en minutos.
Conoce los modelos
Ver todosGemini 3.1 Pro Nuevo
Nuestro modelo más inteligente, el mejor del mundo para la comprensión multimodal, todo basado en un razonamiento de estado del arte.
Gemini 3.6 Flash Nuevo
Rendimiento de clase de vanguardia que compite con modelos más grandes a una fracción del costo.
Gemini 3.5 Flash-Lite Nuevo
Modelo de alto volumen y sensible a los costos optimizado para tareas de agentes secundarios de alta capacidad de procesamiento y baja latencia.
Gemini 3 Flash
Rendimiento de clase de vanguardia que compite con modelos más grandes a una fracción del costo.
🍌 Nano Banana 2 y Nano Banana Pro
Modelos de generación y edición de imágenes de vanguardia.
Veo 3.1
Nuestro modelo de generación de videos de estado del arte, con audio nativo.
Gemini Robotics
Un modelo de lenguaje de visión (VLM) que lleva las capacidades de agente de Gemini a la robótica y permite un razonamiento avanzado en el mundo físico.
Explora las capacidades
Generación de imágenes nativa (Nano Banana)
Genera y edita imágenes altamente contextuales de forma nativa con Gemini 2.5 Flash Image.
Contexto largo
Ingresa millones de tokens en los modelos de Gemini y obtén información de imágenes, videos y documentos no estructurados.
Resultados estructurados
Restringe Gemini para que responda con JSON, un formato de datos estructurados adecuado para el procesamiento automatizado.
Llamadas a funciones
Compila flujos de trabajo de agentes conectando Gemini a APIs y herramientas externas.
Generación de video con Veo 3.1
Crea contenido de video de alta calidad a partir de instrucciones de texto o imágenes con nuestro modelo de estado del arte.
Agentes de voz con la API de Live
Compila aplicaciones y agentes de voz en tiempo real con la API de Live.
Herramientas
Conecta Gemini al mundo a través de herramientas integradas como la Búsqueda de Google, el contexto de URL, Google Maps, la ejecución de código y el uso de la computadora.
Comprensión de documentos
Procesa hasta 1,000 páginas de archivos PDF con comprensión multimodal completa o con otros tipos de archivos basados en texto.
Pensar
Explora cómo las capacidades de pensamiento mejoran el razonamiento para tareas y agentes complejos.