Gemini API는 Gemini, Veo, Nano Banana 등을 사용하여 프롬프트에서 프로덕션까지 도달하는 가장 빠른 경로를 제공합니다. 이 API를 사용하면 이러한 생성형 모델을 애플리케이션에 통합하여 텍스트와 이미지를 생성하고, 멀티모달 입력을 분석하고, 대화형 에이전트를 빌드할 수 있습니다.
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Explain how AI works in a few words"
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const interaction = await ai.interactions.create({
model: "gemini-3.7-flash",
input: "Explain how AI works in a few words",
});
console.log(interaction.output_text);
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.7-flash",
"input": "Explain how AI works in a few words"
}'
시작하기 가이드에 따라 API 키를 가져오고 몇 분 만에 첫 번째 API 호출을 실행하세요.
모델 살펴보기
모두 보기Gemini 3.1 Pro 신규
최첨단 추론을 기반으로 구축된 세계 최고 수준의 멀티모달 이해 능력을 갖춘 Google의 가장 지능적인 모델입니다.
Gemini 3.7 Flash 신규
복잡한 코딩, 에이전트형 워크플로, 안정적인 다단계 실행을 위해 구축된 Google의 최신이자 가장 강력한 Flash 모델입니다.
Gemini 3.6 Flash
일반 에이전트형 작업과 일상적인 작업 전반에서 속도와 멀티모달 기능의 균형을 맞춘 Google의 이전 세대 Flash 모델입니다.
Gemini 3.5 Flash
일상적인 대용량 워크로드에 기본 속도와 기본 성능을 제공하는 Google의 기존 Flash 모델입니다.
Gemini 3.5 Flash-Lite 신규
지연 시간이 짧고 처리량이 높은 하위 에이전트 작업에 최적화된 비용에 민감한 대용량 모델입니다.
Gemini 3.1 Flash-Lite
Gemini 3 시리즈의 성능과 품질을 갖춘 비용에 민감한 대용량 모델입니다.
Gemini 3 Flash
더 큰 모델에 필적하는 최첨단 성능을 훨씬 저렴한 비용으로 제공합니다.
🍌 Nano Banana 2 및 Nano Banana Pro
최첨단 이미지 생성 및 편집 모델입니다.
Veo 3.1
기본 오디오를 지원하는 Google의 최첨단 동영상 생성 모델입니다.
Gemini Robotics
Gemini의 에이전트형 기능을 로보틱스에 도입하고 실제 세계에서 고급 추론을 지원하는 비전 언어 모델 (VLM)입니다.
기능 살펴보기
기본 이미지 생성 (Nano Banana)
Gemini 2.5 Flash Image를 사용하여 컨텍스트가 풍부한 이미지를 기본적으로 생성하고 편집합니다.
긴 컨텍스트
Gemini 모델에 수백만 개의 토큰을 입력하고 구조화되지 않은 이미지, 동영상, 문서에서 이해를 도출합니다.
구조화된 출력
Gemini가 자동 처리에 적합한 구조화된 데이터 형식인 JSON으로 응답하도록 제한합니다.
함수 호출
Gemini를 외부 API 및 도구에 연결하여 에이전트형 워크플로를 빌드합니다.
Veo 3.1을 사용한 동영상 생성
Google의 최첨단 모델을 사용하여 텍스트 또는 이미지 프롬프트에서 고품질 동영상 콘텐츠를 만듭니다.
Live API를 사용하는 음성 에이전트
Live API를 사용하여 실시간 음성 애플리케이션과 에이전트를 빌드합니다.
도구
Google 검색, URL 컨텍스트, Google 지도, 코드 실행, 컴퓨터 사용과 같은 기본 제공 도구를 통해 Gemini를 전 세계에 연결합니다.
문서 이해
완전한 멀티모달 이해 또는 기타 텍스트 기반 파일 형식을 사용하여 최대 1,000페이지의 PDF 파일을 처리합니다.
사고
사고 기능이 복잡한 작업과 에이전트의 추론을 개선하는 방법을 알아봅니다.
Interactions API
Interactions API 는 2026년 6월부터 기본 인터페이스가 되었으며 앞으로 Gemini 모델 및 에이전트를 빌드하는 가장 좋은 방법입니다. 새 프로젝트를 시작하는 경우 Interactions API를 사용해야 합니다. 여전히 지원되지만 generateContent API는 이제 기존 API로 간주됩니다.