Представляем агентное понимание видео с Gemini
1 сен. 2026 г.
|Наша новая агентная функция анализа видео сокращает потребление токенов до 88%, снижает затраты до 66% и повышает качество до 7%.
Рохан Доши
Старший менеджер по продукту, Google DeepMind
Марио Лучич
Директор по исследованиям, Google DeepMind
Сегодня мы запускаем агентное понимание видео во всех наших новейших моделях: Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Эта новая возможность повышает точность, одновременно значительно сокращая использование токенов и затраты на анализ видео. Подобно агентному зрению, которое объединяет выполнение кода с нативным пониманием изображений моделями Gemini, агентное понимание видео использует нативные видеоинструменты Gemini для повышения производительности и открытия новых возможностей обработки видео, таких как поиск нужного момента с точностью до долей секунды, более точное обнаружение аномалий, точный подсчёт и многое другое.
Эта функция уже доступна для загружаемых видео и видео с YouTube через Gemini API в Google AI Studio и на платформе Gemini Enterprise Agent Platform.
Результаты тестирования
В отличие от текущей «статической» обработки, при которой модель получает видео с фиксированной частотой кадров (по умолчанию 1 кадр/с, значение можно изменить через API), агентное понимание видео объединяет базовые возможности рассуждения модели с нативными видеоинструментами, чтобы динамически искать, сканировать и изучать нужные фрагменты видео по визуальным кадрам, аудио и расшифровкам. В стандартных тестах анализа видео модели Gemini с агентным пониманием видео сокращают затраты на анализ до 66% и потребление токенов до 88%, одновременно повышая точность до 7%.
Эти преимущества эффективности особенно заметны при работе с длинными видео — от десятиминутных инструкций до 90-минутных лекций и многочасовых записей, — где статическая обработка заставляет разработчиков выбирать между высокими затратами на токены и методами, отбрасывающими важные детали.
Активация агентного понимания видео сокращает потребление токенов до 88% и повышает точность до 7% в Gemini 3.7 Flash.
Хотя эти преимущества распространяются на все три поддерживаемые модели, Gemini 3.7 Flash с агентным пониманием обеспечивает в целом наилучшее качество, а также лучшее сочетание качества и экономичности, занимая парето-фронт по соотношению точности и стоимости среди протестированных моделей для понимания видео.
Использование агентного понимания видео выводит Gemini 3.7 Flash на парето-фронт по соотношению точности и стоимости анализа видео.
Как это работает
Вместо статической обработки, при которой модель получает медиапотоки с фиксированной частотой кадров, агентное понимание видео позволяет Gemini активно и целенаправленно определять, что смотреть, с какой скоростью и через какую модальность (кадры, аудио или расшифровку), извлекая только необходимые моменты и сигналы. Ранее разработчики могли делать это вручную, но благодаря агентному пониманию видео Gemini выполняет эту задачу в рамках агентного цикла, вызывая внутренний инструмент для загрузки нужной части видеофайла и значительно сокращая трудозатраты на разработку.
Возможности и варианты использования
Агентное понимание видео меняет подход разработчиков к обработке длинных видео в самых разных требовательных сценариях.
- Поиск момента с точностью до долей секунды: выявление мгновенных изменений состояния и точных границ склеек, которые легко пропустить при частоте 1 кадр/с, что делает возможным точный автоматизированный монтаж видео.
- Поиск иголки в стоге сена в длинных видео: ответы на сложные запросы по многочасовым видео без расходования миллионов токенов.
- Обнаружение аномалий: повторная выборка интересующих временных интервалов с более высокой частотой кадров для изучения быстрых движений и едва заметных визуальных артефактов.
- Подсчёт действий и объектов: точное отслеживание повторяющихся физических движений и отдельных объектов во времени.
Экономичный анализ длинных видео
Посмотрите, как Gemini 3.7 Flash работает с агентным пониманием видео и без него в LongVideoBench — тесте понимания длинных видео. Обратите внимание на значительное сокращение количества токенов и повышение точности.
Точный анализ быстрых действий с динамической частотой кадров
Благодаря агентному пониманию видео модель 3.7 Flash может точно подсчитывать быстрые движения, сканируя видео и просматривая его повторно с разной частотой кадров по мере необходимости.
Экономичный поиск иголки в стоге сена
Используя агентное понимание видео, Gemini 3.7 может точно отвечать на сложные вопросы по содержанию видео, расходуя значительно меньше токенов по сравнению со статическим анализом.
Результаты в реальных условиях
Многие наши партнёры, получившие ранний доступ, продемонстрировали высокие результаты при тестировании агентного понимания видео. Вот что они говорят:
Начало работы
Агентное понимание видео доступно через Gemini API в Google AI Studio и на платформе Gemini Enterprise Agent Platform, которая запускает модели Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Функция использует стандартную тарификацию токенов Gemini API без дополнительной платы.
Чтобы включить её, просто установите для параметра обработки значение «agentic» в конфигурации API. Ознакомьтесь с нашим руководством для разработчиков, чтобы узнать больше о функции и о том, как начать работу.
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "Каковы 3 самых важных объявления в этом выступлении?",
},
],
)
print(interaction.output_text)
Мы также предоставляем преимущества агентного понимания видео с точки зрения эффективности и качества миллиардам пользователей продуктов Google. Вскоре функция станет доступна всем пользователям приложения Gemini в моделях Flash и Flash-Lite. В ближайшие месяцы агентное понимание видео также будет использоваться функцией YouTube «Спросить YouTube» на странице просмотра видео, используя Gemini для предоставления более качественных ответов, основанных на визуальном содержании.
Благодарим за вклад в эту работу: Серджи Каэльес, Филип Паветич, Ахмет Исчен, Сухас Йогин и команда Agentic Vision.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.