Google запускает агентное понимание видео для моделей Gemini Flash, сокращая число видеотокенов до 88%
Видео было самым дорогим типом данных для обработки рассуждающими моделями. До сих пор модели Gemini, которой передавали 90-минутную лекцию, приходилось загружать её целиком с фиксированной частотой один кадр в секунду — независимо от того, требовалось ли «суммировать это» или «в какой момент выступающий переключается на слайд с ценами?». Такая одноэтапная архитектура вынуждает идти на невыгодный компромисс: платить за всю временную шкалу в контексте или заранее разбивать видео на части и рисковать потерять важную деталь.
На этой неделе Google запустила агентное понимание видео во всех своих моделях Flash. Вместо загрузки временной шкалы Gemini сама перемещается по видео, решая, что смотреть, с какой частотой кадров и через какую модальность. По данным Google, это позволяет сократить количество токенов до 88%, снизить стоимость до 66% и повысить точность до 7% на стандартных тестах для видео.
Можно ли это развернуть? Да, но только как функцию размещённого API. Открытых весов нет, и самостоятельно разместить решение невозможно. Функция доступна через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, работает как с загруженными файлами, так и с общедоступными URL-адресами YouTube, а оплата взимается по стандартным тарифам Gemini API за токены без дополнительной платы за функцию.
Что именно изменилось
Статическая обработка, которая по-прежнему используется по умолчанию во всех моделях Gemini, извлекает кадры с частотой 1 FPS за один проход, обрабатывает аудио с битрейтом 1 Кбит/с в одном канале и добавляет временные метки каждую секунду. Агентная обработка заменяет это циклом. Модель объединяет собственные рассуждения с нативными инструментами работы с видео, чтобы искать, сканировать и изучать нужные сегменты по кадрам, аудио и расшифровкам, загружая только то, что требуется запросу. Разработчики и раньше могли собрать такую систему вручную; изменение заключается в том, что теперь Gemini запускает этот цикл внутри себя, устраняя соответствующие накладные расходы на разработку.
По результатам оценок Google, Gemini 3.7 Flash с агентным пониманием занимает оптимальное положение на границе Парето по соотношению точности и стоимости среди протестированных моделей для анализа видео. Преимущества эффективности особенно заметны при работе с длинными материалами — от 10-минутных инструкций до многочасовых записей.
Что возвращает API
Агентная обработка добавляет в массив ответа steps два типа шагов: processing_call, когда модель запрашивает сегмент или расшифровку, и соответствующий processing_result, когда загрузка завершается. Они чередуются с шагами thought и предшествуют model_output, поэтому могут использоваться для отображения трассировки прогресса в реальном времени в вашем интерфейсе. Их наличие также позволяет проверить, действительно ли был запущен агентный режим.
Учёт токенов разделяется соответствующим образом. Рассуждения при навигации тарифицируются как токены мыслей (total_thought_tokens), а загружаемые по запросу кадры, аудио и расшифровки — как токены использования инструментов (total_tool_use_tokens).
Для включения достаточно указать одно поле в части с видео:
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)В одном запросе также можно смешивать режимы для разных видео: агентный режим — для длинной лекции, статический — для короткого ролика.
Основные выводы
- Агентный режим позволяет Gemini перемещаться по временной шкале видео вместо его загрузки с фиксированной частотой 1 FPS.
- По данным Google, количество токенов сокращается до 88%, стоимость — на 66%, а точность на тестах для видео повышается на 7%.
- Поддерживаются Gemini 3.8, 3.7, 3.6 Flash и 3.5 Flash-Lite; режим включается с помощью одного поля
processing. - Статический режим по-прежнему лучше подходит для роликов продолжительностью менее пяти минут и задач, требующих точности на уровне отдельных кадров.
- Действуют стандартные тарифы API, однако рассуждения при навигации тарифицируются как токены мыслей.
Ознакомьтесь с блогом Google, документацией Gemini API по пониманию видео, руководством для разработчиков в AI Studio и анонсом агентного зрения. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? Теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.