Gemini API เป็นเส้นทางที่เร็วที่สุดจากพรอมต์ไปสู่การใช้งานจริงด้วย Gemini, Veo, Nano Banana และอื่นๆ โดยช่วยให้คุณผสานรวมโมเดล Generative เหล่านี้เข้ากับแอปพลิเคชันเพื่อสร้างข้อความและรูปภาพ วิเคราะห์อินพุตแบบหลายรูปแบบ และสร้าง Agent ที่ใช้การสนทนา
Interactions API เป็นวิธีที่ดีที่สุดในการสร้างสรรค์ด้วย Gemini API รวมถึงโมเดลและ Agent ของ Gemini ดูข้อมูลเพิ่มเติมได้ในภาพรวม ของ Interactions API
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Explain how AI works in a few words"
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const interaction = await ai.interactions.create({
model: "gemini-3.6-flash",
input: "Explain how AI works in a few words",
});
console.log(interaction.output_text);
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "gemini-3.6-flash",
"input": "Explain how AI works in a few words"
}'
ทำตามคู่มือเริ่มต้นใช้งานเพื่อรับคีย์ API และทำการเรียก API ครั้งแรกได้ภายในไม่กี่นาที
พบกับโมเดล
ดูทั้งหมดGemini 3.1 Pro ใหม่
โมเดลที่ชาญฉลาดที่สุดของเรา ซึ่งเป็นโมเดลที่ดีที่สุดในโลกสำหรับการทำความเข้าใจข้อมูลหลายรูปแบบ โดยสร้างขึ้นจากการให้เหตุผลที่ล้ำสมัย
Gemini 3.6 Flash ใหม่
ประสิทธิภาพระดับแนวหน้าเทียบเท่าโมเดลขนาดใหญ่กว่าในราคาที่ถูกกว่ามาก
Gemini 3.5 Flash-Lite ใหม่
โมเดลที่รองรับปริมาณงานสูงและคำนึงถึงต้นทุน ซึ่งได้รับการปรับให้เหมาะกับงานของ Subagent ที่มีเวลาในการตอบสนองต่ำและการส่งข้อความปริมาณมาก
Gemini 3 Flash
ประสิทธิภาพระดับแนวหน้าเทียบเท่าโมเดลขนาดใหญ่กว่าในราคาที่ถูกกว่ามาก
🍌 Nano Banana 2 และ Nano Banana Pro
โมเดลการสร้างและแก้ไขรูปภาพที่ล้ำสมัย
Veo 3.1
โมเดลการสร้างวิดีโอที่ล้ำสมัยของเราพร้อมเสียงในตัว
Gemini Robotics
โมเดลวิสัยทัศน์และภาษา (VLM) ที่นำความสามารถด้าน Agentic AI ของ Gemini มาใช้กับหุ่นยนต์และช่วยให้สามารถให้เหตุผลขั้นสูงในโลกทางกายภาพได้
สำรวจความสามารถ
การสร้างรูปภาพในตัว (Nano Banana)
สร้างและแก้ไขรูปภาพที่มีบริบทสูงในตัวด้วย Gemini 2.5 Flash Image
บริบทแบบยาว
ป้อนโทเค็นหลายล้านรายการลงในโมเดล Gemini และรับข้อมูลเชิงลึกจากรูปภาพ วิดีโอ และเอกสารที่ไม่มีโครงสร้าง
เอาต์พุตที่มีโครงสร้าง
จำกัดให้ Gemini ตอบกลับด้วย JSON ซึ่งเป็นรูปแบบข้อมูลที่มี Structured Data ที่เหมาะสำหรับการประมวลผลอัตโนมัติ
การเรียกใช้ฟังก์ชัน
สร้างเวิร์กโฟลว์ของ Agent โดยเชื่อมต่อ Gemini กับ API และเครื่องมือภายนอก
การสร้างวิดีโอด้วย Veo 3.1
สร้างเนื้อหาวิดีโอคุณภาพสูงจากพรอมต์ข้อความหรือรูปภาพด้วยโมเดลที่ล้ำสมัยของเรา
Agent ที่ใช้เสียงพูดพร้อม Live API
สร้างแอปพลิเคชันและ Agent ที่ใช้เสียงพูดแบบเรียลไทม์ด้วย Live API
เครื่องมือ
เชื่อมต่อ Gemini กับโลกภายนอกผ่านเครื่องมือในตัว เช่น Google Search, บริบท URL, Google Maps, การดำเนินการโค้ด และการใช้คอมพิวเตอร์
การทำความเข้าใจเอกสาร
ประมวลผลไฟล์ PDF ได้สูงสุด 1,000 หน้าด้วยความสามารถในการทำความเข้าใจข้อมูลหลายรูปแบบอย่างเต็มที่หรือไฟล์ประเภทอื่นๆ ที่อิงตามข้อความ
กำลังคิด
สำรวจวิธีที่ความสามารถในการคิดช่วยปรับปรุงการให้เหตุผลสำหรับงานและ Agent ที่ซับซ้อน