Новый анализ видео с помощью агентов в Google Gemini сокращает расход токенов до 88%
Ключевые моменты
- Google оснащает свои модели Gemini Flash агентным анализом видео, который динамически ищет нужные фрагменты видеозаписи вместо последовательного сканирования кадров по фиксированной схеме.
- Модели самостоятельно определяют, какие части видео анализировать и каким образом. По данным Google, это позволяет экономить до 88 процентов токенов, снижать затраты на 66 процентов и повышать точность.
- Функция уже доступна через Gemini API для поиска конкретных сцен в длинных видео; позднее планируется интеграция в приложение Gemini и YouTube.
Google добавляет агентный анализ видео в несколько моделей Gemini. Вместо сканирования видео кадр за кадром с фиксированной частотой модель самостоятельно ищет релевантные фрагменты, что, по словам Google, значительно сокращает использование токенов и затраты.
Последние модели — Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite — способны обнаруживать моменты длительностью менее одной секунды, включая изменения состояния или монтажные склейки, которые могли бы остаться незамеченными при обработке одного кадра в секунду. Google утверждает, что это делает автоматический монтаж видео значительно точнее.
Система также может находить отдельные сцены в многочасовых видеозаписях, не расходуя миллионы токенов. Она выявляет аномалии, повторно анализируя подозрительные временные отрезки с более высокой частотой кадров, а также точно подсчитывает повторяющиеся движения и отдельные объекты с течением времени.

До сих пор Gemini использовала статическую обработку, по умолчанию анализируя видео с фиксированной частотой — один кадр в секунду; через API этот параметр можно было изменить. С момента запуска встроенного анализа видео в 2025 году Gemini расшифровывала аудиодорожку и анализировала кадры посекундно.
Google утверждает, что агентный вариант напрямую связывает рассуждения модели со встроенными инструментами работы с видео. Модель самостоятельно решает, какие фрагменты просматривать, с какой скоростью и в каком формате — кадры, аудио или расшифровку. Она извлекает только те моменты и сигналы, которые действительно нужны для выполнения конкретной задачи.
Теперь Gemini загружает только важные части видео
Теперь Gemini использует внутренний инструмент, чтобы извлекать лишь релевантный фрагмент видеофайла. Ранее разработчики могли вручную создавать подобный выборочный подход, но теперь модель выполняет эту работу самостоятельно.

Этот подход основан на «агентном зрении» — функции, которую Google представила для Gemini 3 Flash в январе. Она позволяла модели писать и запускать код Python для масштабирования, обрезки и аннотирования изображений, проверяя каждый результат в цикле «подумать — действовать — наблюдать» перед формированием ответа. На момент запуска функция работала не автоматически во всех случаях, однако необходимая основа уже была заложена. Когда Google представила Gemini 3 Flash в декабре, компания назвала визуальное и пространственное рассуждение для видео одной из будущих возможностей.
Преимущества с точки зрения эффективности особенно заметны при работе с длинными видео — от десятиминутных обучающих роликов до 90-минутных лекций и многочасовых записей. При статической обработке разработчикам приходилось выбирать между высокими затратами на токены и методами, отбрасывающими важные детали. В собственных тестах Google, включая LongVideoBench, Gemini 3.7 Flash с агентным анализом показывает наивысшее общее качество и лучше всего сочетает точность с экономичностью.

Без дополнительной платы через API
Функция доступна для загруженных видео и видео с YouTube через Gemini API в Google AI Studio, а также на Gemini Enterprise Agent Platform. Разработчики выбирают режим обработки «agentic» в конфигурации API и оплачивают токены по стандартным тарифам Gemini API без дополнительной платы. Подробнее об этом рассказывается в руководстве для разработчиков.
Google также планирует внедрить эти улучшения в собственные продукты. Вскоре функция должна стать доступна всем пользователям приложения Gemini на устройствах с Flash и Flash Lite. В ближайшие месяцы агентный анализ видео также будет использоваться функцией «Спросить YouTube» на странице воспроизведения, обеспечивая ответы, более тесно связанные с тем, что действительно видно в видео.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, эксклюзивный аналитический отчет «AI Radar» о передовых разработках шесть раз в год, полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.