Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Представляем агентное понимание видео с Gemini

Представляем агентное понимание видео с Gemini

1 сен. 2026 г.

|

Наша новая агентная функция анализа видео сокращает потребление токенов до 88%, снижает затраты до 66% и повышает качество до 7%.


Рохан Доши

Старший менеджер по продукту, Google DeepMind

Марио Лучич

Директор по исследованиям, Google DeepMind


Текст «Агентное понимание видео» рядом с логотипом Gemini на тёмно-синем фоне

Сегодня мы запускаем агентное понимание видео во всех наших новейших моделях: Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Эта новая возможность повышает точность, одновременно значительно сокращая использование токенов и затраты на анализ видео. Подобно агентному зрению, которое объединяет выполнение кода с нативным пониманием изображений моделями Gemini, агентное понимание видео использует нативные видеоинструменты Gemini для повышения производительности и открытия новых возможностей обработки видео, таких как поиск нужного момента с точностью до долей секунды, более точное обнаружение аномалий, точный подсчёт и многое другое.

Эта функция уже доступна для загружаемых видео и видео с YouTube через Gemini API в Google AI Studio и на платформе Gemini Enterprise Agent Platform.

Результаты тестирования

В отличие от текущей «статической» обработки, при которой модель получает видео с фиксированной частотой кадров (по умолчанию 1 кадр/с, значение можно изменить через API), агентное понимание видео объединяет базовые возможности рассуждения модели с нативными видеоинструментами, чтобы динамически искать, сканировать и изучать нужные фрагменты видео по визуальным кадрам, аудио и расшифровкам. В стандартных тестах анализа видео модели Gemini с агентным пониманием видео сокращают затраты на анализ до 66% и потребление токенов до 88%, одновременно повышая точность до 7%.

Эти преимущества эффективности особенно заметны при работе с длинными видео — от десятиминутных инструкций до 90-минутных лекций и многочасовых записей, — где статическая обработка заставляет разработчиков выбирать между высокими затратами на токены и методами, отбрасывающими важные детали.

Активация агентного понимания видео сокращает потребление токенов до 88% и повышает точность до 7% в Gemini 3.7 Flash.

Графики, анализирующие эффективность использования токенов и прирост точности

Хотя эти преимущества распространяются на все три поддерживаемые модели, Gemini 3.7 Flash с агентным пониманием обеспечивает в целом наилучшее качество, а также лучшее сочетание качества и экономичности, занимая парето-фронт по соотношению точности и стоимости среди протестированных моделей для понимания видео.

Использование агентного понимания видео выводит Gemini 3.7 Flash на парето-фронт по соотношению точности и стоимости анализа видео.

График с «Стоимостью запроса» на оси x и «Точностью» на оси y

Как это работает

Вместо статической обработки, при которой модель получает медиапотоки с фиксированной частотой кадров, агентное понимание видео позволяет Gemini активно и целенаправленно определять, что смотреть, с какой скоростью и через какую модальность (кадры, аудио или расшифровку), извлекая только необходимые моменты и сигналы. Ранее разработчики могли делать это вручную, но благодаря агентному пониманию видео Gemini выполняет эту задачу в рамках агентного цикла, вызывая внутренний инструмент для загрузки нужной части видеофайла и значительно сокращая трудозатраты на разработку.

Схема процесса от запроса до результата

Возможности и варианты использования

Агентное понимание видео меняет подход разработчиков к обработке длинных видео в самых разных требовательных сценариях.

  • Поиск момента с точностью до долей секунды: выявление мгновенных изменений состояния и точных границ склеек, которые легко пропустить при частоте 1 кадр/с, что делает возможным точный автоматизированный монтаж видео.
  • Поиск иголки в стоге сена в длинных видео: ответы на сложные запросы по многочасовым видео без расходования миллионов токенов.
  • Обнаружение аномалий: повторная выборка интересующих временных интервалов с более высокой частотой кадров для изучения быстрых движений и едва заметных визуальных артефактов.
  • Подсчёт действий и объектов: точное отслеживание повторяющихся физических движений и отдельных объектов во времени.

Экономичный анализ длинных видео

Посмотрите, как Gemini 3.7 Flash работает с агентным пониманием видео и без него в LongVideoBench — тесте понимания длинных видео. Обратите внимание на значительное сокращение количества токенов и повышение точности.

Точный анализ быстрых действий с динамической частотой кадров

Благодаря агентному пониманию видео модель 3.7 Flash может точно подсчитывать быстрые движения, сканируя видео и просматривая его повторно с разной частотой кадров по мере необходимости.

Экономичный поиск иголки в стоге сена

Используя агентное понимание видео, Gemini 3.7 может точно отвечать на сложные вопросы по содержанию видео, расходуя значительно меньше токенов по сравнению со статическим анализом.

Результаты в реальных условиях

Многие наши партнёры, получившие ранний доступ, продемонстрировали высокие результаты при тестировании агентного понимания видео. Вот что они говорят:

Цитата от Ponder
Цитата от Revyl
Цитата от Mosaic
Цитата от Resemble.AI

Начало работы

Агентное понимание видео доступно через Gemini API в Google AI Studio и на платформе Gemini Enterprise Agent Platform, которая запускает модели Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Функция использует стандартную тарификацию токенов Gemini API без дополнительной платы.

Чтобы включить её, просто установите для параметра обработки значение «agentic» в конфигурации API. Ознакомьтесь с нашим руководством для разработчиков, чтобы узнать больше о функции и о том, как начать работу.

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "Каковы 3 самых важных объявления в этом выступлении?",
        },
    ],
)

print(interaction.output_text)

Мы также предоставляем преимущества агентного понимания видео с точки зрения эффективности и качества миллиардам пользователей продуктов Google. Вскоре функция станет доступна всем пользователям приложения Gemini в моделях Flash и Flash-Lite. В ближайшие месяцы агентное понимание видео также будет использоваться функцией YouTube «Спросить YouTube» на странице просмотра видео, используя Gemini для предоставления более качественных ответов, основанных на визуальном содержании.

Благодарим за вклад в эту работу: Серджи Каэльес, Филип Паветич, Ахмет Исчен, Сухас Йогин и команда Agentic Vision.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием DeepMind

Читать оригинал на DeepMind ↗

Текст и изображения принадлежат DeepMind и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости