Чтобы узнать больше о создании видео, ознакомьтесь с руководством по Gemini Omni Flash.
Модели Gemini могут обрабатывать видео, что позволяет разработчикам использовать их в различных областях, где раньше требовались специализированные модели. Некоторые возможности Gemini в отношении видео: описание, сегментирование и извлечение информации из видео, ответы на вопросы о видеоконтенте и ссылки на определенные временные метки в видео.
Вы можете передавать видео в Gemini следующими способами:
| Способ ввода | Максимальный размер | Рекомендуемый вариант использования |
|---|---|---|
| File API | 20 ГБ (платная версия) / 2 ГБ (бесплатная версия) | Большие файлы (от 100 МБ), длинные видео (от 10 минут), файлы, которые можно использовать повторно. |
| Регистрация облачного хранилища | 2 ГБ (на файл, без ограничений на хранилище) | Большие файлы (более 100 МБ), длинные видео (более 10 минут), постоянные файлы, которые можно использовать повторно. |
| Встроенные данные | < 100 МБ | Небольшие файлы (менее 100 МБ), короткие видео (менее 1 минуты), однократные запросы. |
| URL YouTube | Н/Д | общедоступные видео на YouTube; |
Примечание. В большинстве случаев рекомендуется использовать File API, особенно если размер файла превышает 100 МБ или если вы хотите использовать файл в нескольких запросах.
Чтобы узнать о других способах загрузки файлов, например с помощью внешних URL или файлов, хранящихся в Google Cloud, ознакомьтесь с руководством Способы загрузки файлов.
Как загрузить видеофайл
Приведенный ниже код скачивает образец видео, загружает его с помощью Files API, ждет завершения обработки, а затем использует ссылку на загруженный файл, чтобы создать краткий пересказ видео.
Python
from google import genai
client = genai.Client()
myfile = client.files.upload(file="path/to/sample.mp4")
response = client.models.generate_content(
model="gemini-3.8-flash", contents=[myfile, "Summarize this video. Then create a quiz with an answer key based on the information in this video."]
)
print(response.text)
JavaScript
import {
GoogleGenAI,
createUserContent,
createPartFromUri,
} from "@google/genai";
const ai = new GoogleGenAI({});
async function main() {
const myfile = await ai.files.upload({
file: "path/to/sample.mp4",
config: { mimeType: "video/mp4" },
});
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: createUserContent([
createPartFromUri(myfile.uri, myfile.mimeType),
"Summarize this video. Then create a quiz with an answer key based on the information in this video.",
]),
});
console.log(response.text);
}
await main();
Проложить маршрут
uploadedFile, _ := client.Files.UploadFromPath(ctx, "path/to/sample.mp4", nil)
parts := []*genai.Part{
genai.NewPartFromText("Summarize this video. Then create a quiz with an answer key based on the information in this video."),
genai.NewPartFromURI(uploadedFile.URI, uploadedFile.MIMEType),
}
contents := []*genai.Content{
genai.NewContentFromParts(parts, genai.RoleUser),
}
result, _ := client.Models.GenerateContent(
ctx,
"gemini-3.8-flash",
contents,
nil,
)
fmt.Println(result.Text())
REST
VIDEO_PATH="path/to/sample.mp4"
MIME_TYPE=$(file -b --mime-type "${VIDEO_PATH}")
NUM_BYTES=$(wc -c < "${VIDEO_PATH}")
DISPLAY_NAME=VIDEO
tmp_header_file=upload-header.tmp
echo "Starting file upload..."
curl "https://generativelanguage.googleapis.com/upload/v1beta/files" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-D ${tmp_header_file} \
-H "X-Goog-Upload-Protocol: resumable" \
-H "X-Goog-Upload-Command: start" \
-H "X-Goog-Upload-Header-Content-Length: ${NUM_BYTES}" \
-H "X-Goog-Upload-Header-Content-Type: ${MIME_TYPE}" \
-H "Content-Type: application/json" \
-d "{'file': {'display_name': '${DISPLAY_NAME}'}}" 2> /dev/null
upload_url=$(grep -i "x-goog-upload-url: " "${tmp_header_file}" | cut -d" " -f2 | tr -d "\r")
rm "${tmp_header_file}"
echo "Uploading video data..."
curl "${upload_url}" \
-H "Content-Length: ${NUM_BYTES}" \
-H "X-Goog-Upload-Offset: 0" \
-H "X-Goog-Upload-Command: upload, finalize" \
--data-binary "@${VIDEO_PATH}" 2> /dev/null > file_info.json
file_uri=$(jq -r ".file.uri" file_info.json)
echo file_uri=$file_uri
echo "File uploaded successfully. File URI: ${file_uri}"
# --- 3. Generate content using the uploaded video file ---
echo "Generating content from video..."
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"contents": [{
"parts":[
{"file_data":{"mime_type": "'"${MIME_TYPE}"'", "file_uri": "'"${file_uri}"'"}},
{"text": "Summarize this video. Then create a quiz with an answer key based on the information in this video."}]
}]
}' 2> /dev/null > response.json
jq -r ".candidates[].content.parts[].text" response.json
Чтобы оптимизировать эффективность токенов и производительность, попробуйте использовать обработку видео с помощью агентов.
Всегда используйте Files API, если общий размер запроса (включая файл, текстовый запрос, системные инструкции и т. д.) превышает 20 МБ, видео длится долго или если вы планируете использовать одно и то же видео в нескольких запросах. File API принимает видеофайлы напрямую.
Подробнее о работе с медиафайлами можно узнать в документации по Files API.
Как передавать данные о видео в коде
Вместо того чтобы загружать видеофайл с помощью File API, вы можете передавать небольшие видео непосредственно в запросе к generateContent. Этот вариант подходит для коротких видео, общий размер которых не превышает 20 МБ.
Вот пример того, как можно добавить встроенные данные о видео:
Python
from google import genai
from google.genai import types
# Only for videos of size <20Mb
video_file_name = "/path/to/your/video.mp4"
video_bytes = open(video_file_name, 'rb').read()
client = genai.Client()
response = client.models.generate_content(
model='gemini-3.8-flash',
contents=types.Content(
parts=[
types.Part(
inline_data=types.Blob(data=video_bytes, mime_type='video/mp4')
),
types.Part(text='Please summarize the video in 3 sentences.')
]
)
)
print(response.text)
JavaScript
import { GoogleGenAI } from "@google/genai";
import * as fs from "node:fs";
const ai = new GoogleGenAI({});
const base64VideoFile = fs.readFileSync("path/to/small-sample.mp4", {
encoding: "base64",
});
const contents = [
{
inlineData: {
mimeType: "video/mp4",
data: base64VideoFile,
},
},
{ text: "Please summarize the video in 3 sentences." }
];
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: contents,
});
console.log(response.text);
REST
VIDEO_PATH=/path/to/your/video.mp4
if [[ "$(base64 --version 2>&1)" = *"FreeBSD"* ]]; then
B64FLAGS="--input"
else
B64FLAGS="-w0"
fi
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"contents": [{
"parts":[
{
"inline_data": {
"mime_type":"video/mp4",
"data": "'$(base64 $B64FLAGS $VIDEO_PATH)'"
}
},
{"text": "Please summarize the video in 3 sentences."}
]
}]
}' 2> /dev/null
Передача URL YouTube
Вы можете передавать URL YouTube непосредственно в Gemini API в составе запроса следующим образом:
Python
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model='gemini-3.8-flash',
contents=types.Content(
parts=[
types.Part(
file_data=types.FileData(file_uri='https://www.youtube.com/watch?v=9hE5-98ZeCg')
),
types.Part(text='Please summarize the video in 3 sentences.')
]
)
)
print(response.text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const contents = [
{
fileData: {
fileUri: "https://www.youtube.com/watch?v=9hE5-98ZeCg",
},
},
{ text: "Please summarize the video in 3 sentences." }
];
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: contents,
});
console.log(response.text);
Проложить маршрут
package main
import (
"context"
"fmt"
"os"
"google.golang.org/genai"
)
func main() {
ctx := context.Background()
client, err := genai.NewClient(ctx, nil)
if err != nil {
log.Fatal(err)
}
parts := []*genai.Part{
genai.NewPartFromText("Please summarize the video in 3 sentences."),
genai.NewPartFromURI("https://www.youtube.com/watch?v=9hE5-98ZeCg","video/mp4"),
}
contents := []*genai.Content{
genai.NewContentFromParts(parts, genai.RoleUser),
}
result, _ := client.Models.GenerateContent(
ctx,
"gemini-3.8-flash",
contents,
nil,
)
fmt.Println(result.Text())
}
REST
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"contents": [{
"parts":[
{"text": "Please summarize the video in 3 sentences."},
{
"file_data": {
"file_uri": "https://www.youtube.com/watch?v=9hE5-98ZeCg"
}
}
]
}]
}' 2> /dev/null
Ограничения
- На бесплатном уровне можно загружать не более восьми часов видео в день.
- В платной версии ограничений по длительности видео нет.
- Для моделей, выпущенных до Gemini 2.5, можно загрузить только одно видео на запрос. В моделях Gemini 2.5 и более поздних версий можно загрузить до 10 видео на запрос.
- Вы можете загружать только видео с открытым доступом (не с ограниченным доступом или доступом по ссылке).
Агент для понимания видео
По умолчанию для видеовходов используется статическая обработка (извлечение кадров с частотой 1 кадр/с). Модели Gemini 3.8 Flash, 3.6 Flash и 3.5 Flash Lite также поддерживают агентное понимание видео, при котором модель динамически изучает временную шкалу видео, выборочно проверяет расшифровки и адаптивно регулирует частоту кадров и разрешение на лету в зависимости от запроса.
| Режим | Описание | Поддерживаемые модели |
|---|---|---|
| Статический (по умолчанию) | Извлекает кадры с фиксированной частотой (1 кадр/с) и помещает их в контекст за один проход. Хорошо подходит для коротких видео. | Все модели Gemini |
| Агентные возможности | Модель динамически перемещается по временной шкале видео, загружая только тот контент, который ей нужен для ответа на запрос. На 88% эффективнее в использовании токенов и на 7% качественнее при работе с длинным контентом. | Gemini 3.8 Flash, 3.6 Flash, 3.5 Flash Lite |
Как выбрать режим обработки
Как правило, лучше начинать с агентного режима, особенно если вы хотите повысить качество ответов или эффективность использования токенов.
- Агентные. Длинные видео или запросы, связанные с определенными моментами. Модель динамически перемещается по временной шкале, чтобы найти подходящую по контексту информацию, не заполняя окно контекста.
- Статический. Запросы, чувствительные к задержке, в коротких клипах (менее пяти минут) или случаи, когда требуется точность на уровне кадра во всем клипе.
Примечание. Для длинных видео или сложных запросов, обработка которых занимает больше времени, используйте потоковую передачу (
client.models.generate_content_stream). Это позволит поддерживать активное подключение, показывать промежуточные этапы рассуждений и избежать тайм-аутов подключения или аутентификации.
Как задать режим обработки
Python
import time
from google import genai
from google.genai import types
client = genai.Client()
video_file = client.files.upload(file="path/to/lecture.mp4")
while video_file.state.name == "PROCESSING":
time.sleep(2)
video_file = client.files.get(name=video_file.name)
response = client.models.generate_content(
model="gemini-3.8-flash",
contents=[
types.Part.from_uri(
file_uri=video_file.uri,
mime_type=video_file.mime_type,
media_processing="AGENTIC",
),
"What are the three main arguments presented?",
],
)
print(response.text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
let videoFile = await ai.files.upload({
file: "path/to/lecture.mp4",
config: { mimeType: "video/mp4" },
});
while (videoFile.state === "PROCESSING") {
await new Promise((resolve) => setTimeout(resolve, 2000));
videoFile = await ai.files.get({ name: videoFile.name });
}
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: [
{
role: "user",
parts: [
{
fileData: {
fileUri: videoFile.uri,
mimeType: videoFile.mimeType,
},
mediaProcessing: "AGENTIC",
},
{ text: "What are the three main arguments presented?" },
],
},
],
});
console.log(response.text);
Проложить маршрут
uploadedFile, _ := client.Files.UploadFromPath(ctx, "path/to/lecture.mp4", nil)
parts := []*genai.Part{
{
FileData: &genai.FileData{
FileURI: uploadedFile.URI,
MIMEType: uploadedFile.MIMEType,
},
MediaProcessing: genai.MediaProcessingAgentic,
},
genai.NewPartFromText("What are the three main arguments presented?"),
}
contents := []*genai.Content{
genai.NewContentFromParts(parts, genai.RoleUser),
}
result, _ := client.Models.GenerateContent(
ctx,
"gemini-3.8-flash",
contents,
nil,
)
fmt.Println(result.Text())
REST
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent?key=$GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"contents": [{
"parts": [
{
"file_data": {
"file_uri": "'${file_uri}'",
"mime_type": "video/mp4"
},
"media_processing": "AGENTIC"
},
{"text": "What are the three main arguments presented?"}
]
}]
}'
Примечание. Чтобы проверить, использовалась ли обработка с помощью агента, изучите
response.candidates[0].content.parts. Наличие частейtool_callиtool_responseс типом инструментаMEDIA_PROCESSINGуказывает на то, что модель динамически перемещалась по видео.
Примечание. В отличие от других инструментов на стороне сервера (например, Google Поиска или контекста URL), для работы с видео, созданным агентом, не требуется задавать
include_server_side_tool_invocations=TrueвToolConfig, чтобы вызывать инструменты и получать или передавать потоком результаты. Частиtool_callиtool_responseдля навигации по видео возвращаются автоматически, если для любой входной части задано значениеmedia_processing="AGENTIC".
Структура ответа
Если обработка с помощью агента включена, ответ будет содержать дополнительные части, в которых представлена трассировка внутренней навигации:
tool_callparts (tool_type: "MEDIA_PROCESSING") – генерируется каждый раз, когда модель запрашивает сегмент видео или аудиозапись.tool_responseчасти (tool_type: "MEDIA_PROCESSING") – результат каждой операции загрузки.
Вам не нужно обрабатывать эти части вручную или отвечать на них. Просто передайте полный ответ в качестве истории чата, и они будут обработаны автоматически.
Если в ThinkingConfig задано значение include_thoughts=True, этапы рассуждений будут представлены в виде частей thought: true, чередующихся с парами вызовов и ответов инструментов. Если отключить мысли, текст мыслей будет опущен, но части инструментов останутся.
В следующем примере показана полезная нагрузка ответа с чередующимися частями вызова инструмента и ответа:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"thought": true,
"text": "Inspecting transcript for key discussion topics..."
},
{
"thought_signature": "sig_A",
"tool_call": {
"tool_type": "MEDIA_PROCESSING"
}
},
{
"thought_signature": "sig_B",
"tool_response": {
"tool_type": "MEDIA_PROCESSING"
}
},
{
"thought": true,
"text": "Loading visual frames to verify slide content..."
},
{
"thought_signature": "sig_C",
"tool_call": {
"tool_type": "MEDIA_PROCESSING"
}
},
{
"thought_signature": "sig_D",
"tool_response": {
"tool_type": "MEDIA_PROCESSING"
}
},
{
"thought": true,
"text": "Synthesizing answer from gathered evidence..."
},
{
"text": "The three main arguments presented in the lecture are...",
"thought_signature": "sig_E"
}
]
}
}
]
}
Как использовать разные режимы обработки для разных видео
Для каждой части видео в одном запросе можно задать разные режимы обработки:
Python
from google import genai
from google.genai import types
client = genai.Client()
lecture = client.files.upload(file="path/to/long-lecture.mp4")
experiment = client.files.upload(file="path/to/short-experiment.mp4")
response = client.models.generate_content(
model="gemini-3.8-flash",
contents=[
types.Part.from_uri(
file_uri=lecture.uri,
mime_type=lecture.mime_type,
media_processing="AGENTIC", # Use agentic video understanding
),
types.Part.from_uri(
file_uri=experiment.uri,
mime_type=experiment.mime_type,
media_processing="STATIC", # Use static processing
),
"Compare the lecture content with the experiment results.",
],
)
print(response.text)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const lecture = await ai.files.upload({
file: "path/to/long-lecture.mp4",
config: { mimeType: "video/mp4" },
});
const experiment = await ai.files.upload({
file: "path/to/short-experiment.mp4",
config: { mimeType: "video/mp4" },
});
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: [
{
role: "user",
parts: [
{
fileData: {
fileUri: lecture.uri,
mimeType: lecture.mimeType,
},
mediaProcessing: "AGENTIC", // Use agentic video understanding
},
{
fileData: {
fileUri: experiment.uri,
mimeType: experiment.mimeType,
},
mediaProcessing: "STATIC", // Use static processing
},
{ text: "Compare the lecture content with the experiment results." },
],
},
],
});
console.log(response.text);
Проложить маршрут
lecturePart := &genai.Part{
FileData: &genai.FileData{
FileURI: lectureFile.URI,
MIMEType: lectureFile.MIMEType,
},
MediaProcessing: genai.MediaProcessingAgentic, // Use agentic
}
experimentPart := &genai.Part{
FileData: &genai.FileData{
FileURI: experimentFile.URI,
MIMEType: experimentFile.MIMEType,
},
MediaProcessing: genai.MediaProcessingStatic, // Use static
}
parts := []*genai.Part{
lecturePart,
experimentPart,
genai.NewPartFromText("Compare the lecture content with the experiment results."),
}
contents := []*genai.Content{
genai.NewContentFromParts(parts, genai.RoleUser),
}
result, _ := client.Models.GenerateContent(ctx, "gemini-3.8-flash", contents, nil)
fmt.Println(result.Text())
REST
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent?key=$GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"contents": [{
"parts": [
{
"file_data": {
"file_uri": "'${lecture_uri}'",
"mime_type": "video/mp4"
},
"media_processing": "AGENTIC"
},
{
"file_data": {
"file_uri": "'${experiment_uri}'",
"mime_type": "video/mp4"
},
"media_processing": "STATIC"
},
{"text": "Compare the lecture content with the experiment results."}
]
}]
}'
Используйте контекстное кеширование для длинных видео
Если видео длится более 10 минут или вы планируете отправлять несколько запросов к одному и тому же видеофайлу, используйте кеширование контекста, чтобы снизить затраты и уменьшить задержку. Кэширование контекста позволяет обработать видео один раз и использовать токены для последующих запросов. Это идеальный вариант для чат-сессий или повторного анализа длинного контента.
Указывать временные метки в контенте
Вы можете задавать вопросы о конкретных моментах видео, используя временные метки в формате MM:SS.
Python
response = client.models.generate_content(
model="gemini-3.8-flash",
contents=[
myfile,
"What are the examples given at 00:05 and 00:10 supposed to show us?",
],
)
print(response.text)
JavaScript
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: [
myfile,
"What are the examples given at 00:05 and 00:10 supposed to show us?",
],
});
console.log(response.text);
Проложить маршрут
parts := []*genai.Part{
genai.NewPartFromURI(uploadedFile.URI, uploadedFile.MIMEType),
genai.NewPartFromText("What are the examples given at 00:05 and 00:10 supposed to show us?"),
}
result, _ := client.Models.GenerateContent(
ctx,
"gemini-3.8-flash",
[]*genai.Content{genai.NewContentFromParts(parts, genai.RoleUser)},
nil,
)
fmt.Println(result.Text())
REST
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"contents": [{
"parts":[
{"file_data": {"file_uri": "'"${file_uri}"'", "mime_type": "'"${MIME_TYPE}"'"}},
{"text": "What are the examples given at 00:05 and 00:10 supposed to show us?"}
]
}]
}' 2> /dev/null
Извлечение подробной информации из видео
Модели Gemini могут анализировать видеоконтент, обрабатывая информацию из аудио- и видеопотоков. Это позволяет извлекать подробную информацию, в том числе создавать описания происходящего в видео и отвечать на вопросы о его содержании.
Для описания видео модель анализирует один кадр в секунду. Частота выборки по умолчанию подходит для большинства типов контента, но может не захватывать детали в видео с быстрым движением или быстрой сменой сцен. Для такого контента с большим количеством движения можно задать собственную частоту кадров.
Python
response = client.models.generate_content(
model="gemini-3.8-flash",
contents=[
myfile,
"Describe the key events in this video, providing both audio and visual details. Include timestamps for salient moments.",
],
)
print(response.text)
JavaScript
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: [
myfile,
"Describe the key events in this video, providing both audio and visual details. Include timestamps for salient moments.",
],
});
console.log(response.text);
Проложить маршрут
parts := []*genai.Part{
genai.NewPartFromURI(uploadedFile.URI, uploadedFile.MIMEType),
genai.NewPartFromText("Describe the key events in this video, providing both audio and visual details. " +
"Include timestamps for salient moments."),
}
result, _ := client.Models.GenerateContent(
ctx,
"gemini-3.8-flash",
[]*genai.Content{genai.NewContentFromParts(parts, genai.RoleUser)},
nil,
)
fmt.Println(result.Text())
REST
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"contents": [{
"parts":[
{"file_data": {"file_uri": "'"${file_uri}"'", "mime_type": "'"${MIME_TYPE}"'"}},
{"text": "Describe the key events in this video, providing both audio and visual details. Include timestamps for salient moments."}
]
}]
}' 2> /dev/null
Как настроить обработку видео
Вы можете настроить обработку видео в Gemini API, задав интервалы для вырезания фрагментов или указав частоту кадров. Эти параметры доступны только при обработке видео в режиме "static".
Как задать интервалы для клипов
Вы можете обрезать видео, указав videoMetadata со смещениями начала и конца.
Python
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model='models/gemini-3.8-flash',
contents=types.Content(
parts=[
types.Part(
file_data=types.FileData(file_uri='https://www.youtube.com/watch?v=XEzRZ35urlk'),
video_metadata=types.VideoMetadata(
start_offset='1250s',
end_offset='1570s'
)
),
types.Part(text='Please summarize the video in 3 sentences.')
]
)
)
JavaScript
import { GoogleGenAI } from '@google/genai';
const ai = new GoogleGenAI({});
const model = 'gemini-3.8-flash';
async function main() {
const contents = [
{
role: 'user',
parts: [
{
fileData: {
fileUri: 'https://www.youtube.com/watch?v=9hE5-98ZeCg',
mimeType: 'video/*',
},
videoMetadata: {
startOffset: '40s',
endOffset: '80s',
}
},
{
text: 'Please summarize the video in 3 sentences.',
},
],
},
];
const response = await ai.models.generateContent({
model,
contents,
});
console.log(response.text)
}
await main();
Как задать собственную частоту кадров
Вы можете задать собственную частоту кадров, передав аргумент fps в videoMetadata.
Python
from google import genai
from google.genai import types
# Only for videos of size <20Mb
video_file_name = "/path/to/your/video.mp4"
video_bytes = open(video_file_name, 'rb').read()
client = genai.Client()
response = client.models.generate_content(
model='models/gemini-3.8-flash',
contents=types.Content(
parts=[
types.Part(
inline_data=types.Blob(
data=video_bytes,
mime_type='video/mp4'),
video_metadata=types.VideoMetadata(fps=5)
),
types.Part(text='Please summarize the video in 3 sentences.')
]
)
)
JavaScript
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const myfile = await ai.files.upload({
file: "path/to/sample.mp4",
mimeType: "video/mp4",
});
const response = await ai.models.generateContent({
model: "gemini-3.8-flash",
contents: [
{
fileData: {
fileUri: myfile.uri,
mimeType: myfile.mimeType,
},
videoMetadata: {
fps: 5,
},
},
"Please summarize the video in 3 sentences.",
],
});
console.log(response.text);
По умолчанию из видео выбирается один кадр в секунду. Для длинных видео можно задать низкую частоту кадров (< 1). Это особенно полезно для видео с преимущественно статичным изображением, например лекций. Более высокая частота кадров требуется для видео, которые нужно анализировать с высокой точностью по времени, например для распознавания быстрых действий или отслеживания быстрого движения.
Поддерживаемые форматы видео
Gemini поддерживает следующие MIME-типы видеоформатов:
video/mp4video/mpegvideo/quicktimevideo/avivideo/x-flvvideo/mpgvideo/webmvideo/wmvvideo/3gpp
Технические характеристики видео
- Поддерживаемые модели и контекст. Все модели Gemini могут обрабатывать видеоданные.
- Модели с окном контекста на 1 млн токенов могут обрабатывать видео длительностью до 3 часов (при низком разрешении) или до 1 часа (при высоком разрешении).
- Режимы обработки. Gemini 3.8 Flash, 3.6 Flash, 3.5 Flash Lite и более поздние модели поддерживают два режима обработки видео:
- Статический. Кадры извлекаются с частотой 1 кадр в секунду и помещаются в контекст (по умолчанию для всех моделей). Аудио обрабатывается с битрейтом 1 кбит/с (один канал). Временные метки добавляются каждую секунду. Лучше всего подходит для коротких клипов или когда важен каждый кадр (например, при покадровом просмотре). Обратите внимание, что при частоте выборки 1 кадр в секунду быстрые последовательности действий могут быть не очень подробными.
- Агентный. Модель динамически перемещается по видео, загружая транскрипт, кадры и/или аудио по запросу. Это позволяет сократить количество токенов для длинного контента на 88 %, но может немного увеличить время до первого токена (TTFT) для коротких видео (менее пяти минут) из-за внутреннего анализа и использования инструментов перед началом генерации.
Ответы включают вызов инструмента
MEDIA_PROCESSINGи части ответа, чтобы сохранить контекст рассуждений между ходами. Лучше всего подходит для длинных видео, чтобы оптимизировать стоимость токенов и качество ответов. Поддерживается в Gemini 3.8 Flash, 3.6 Flash и 3.5 Flash Lite. Подробнее о понимании видео с помощью агентов…
- Расчет токенов (статический режим). Каждая секунда видео токенизируется следующим образом:
- Отдельные кадры (с частотой 1 кадр/с):
- Если для параметра
media_resolutionзадано значение low, каждый кадр токенизируется с помощью 66 токенов. - В противном случае кадры разбиваются на токены по 258 токенов на кадр.
- Если для параметра
- Аудио: 32 токена в секунду.
- Также включаются метаданные.
- Всего: примерно 100 токенов в секунду видео при стандартном (низком) разрешении или примерно 300 токенов в секунду видео при высоком разрешении.
- Отдельные кадры (с частотой 1 кадр/с):
- Расчет токенов (режим агента). Использование токенов зависит от сложности контента и стратегии навигации модели. Токены, сгенерированные во время исследования видео, считаются токенами размышления (
thoughts_token_count), а кадры, аудио и расшифровка, загруженные по запросу, считаются токенами запроса инструмента (tool_use_prompt_token_count). При обработке с помощью агента используется на 88% меньше токенов, чем при статической обработке длинного контента, поскольку модель загружает только расшифровку, кадры и/или аудио, необходимые для ответа на запрос (см. руководство по токенам). - Разрешение медиаконтента. В Gemini 3 реализовано точное управление обработкой мультимодального контента с помощью параметра
media_resolution. Параметрmedia_resolutionопределяет максимальное количество токенов, выделяемых для каждого входного изображения или видеокадра. Более высокое разрешение позволяет модели лучше распознавать мелкий текст и небольшие детали, но увеличивает количество используемых токенов и время ожидания. Параметрыmedia_resolutionиmedia_processingне зависят друг от друга, поэтому их можно задать для одной и той же части видео.
Подробнее о расчете токенов…
- Формат временных меток. Если вы хотите указать в запросе определенный момент видео, используйте формат
MM:SS(например,01:15для 1 минуты и 15 секунд). - Размещение запроса. Если вы хотите добавить текстовый запрос к одному видео, разместите его после видео в массиве
contents. - Тайм-ауты для длинных запросов. Для видео, которые требуют длительной обработки или сложной многоэтапной логики, используйте потоковую передачу (
client.models.generate_content_stream). Синхронные запросы без потоковой передачи, которые при высокой нагрузке вызывают повторные попытки на стороне сервера, могут превышать окна подключения или срока действия токена аутентификации, что может привести к неожиданным ошибкам401 Unauthorizedили тайм-аутам. Потоковая передача позволяет поддерживать активное подключение и получать промежуточные результаты рассуждений и выполнения вызовов инструментов.
Дальнейшие действия
- Разрешение медиафайлов. Управляйте разрешением видеокадров, чтобы найти баланс между качеством и использованием токенов.
- Токены. Узнайте, как видеоконтент токенизируется в статическом и агентском режимах обработки.
- Системные инструкции. Системные инструкции позволяют задавать поведение модели в соответствии с вашими потребностями и вариантами использования.
- Files API. Узнайте больше о том, как загружать файлы и управлять ими для использования с Gemini.
- Стратегии запросов к файлам. Gemini API поддерживает запросы с текстовыми, графическими, аудио- и видеоданными. Это называется мультимодальными запросами.
- Рекомендации по безопасности. Иногда генеративные модели ИИ выдают неожиданные результаты, например неточные, предвзятые или неприемлемые. Постобработка и оценка человеком необходимы, чтобы снизить риск причинения вреда такими результатами.