Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Google запускает агентное понимание видео для моделей Gemini Flash, сокращая число видеотокенов до 88%

Видео было самым дорогим типом данных для обработки рассуждающими моделями. До сих пор модели Gemini, которой передавали 90-минутную лекцию, приходилось загружать её целиком с фиксированной частотой один кадр в секунду — независимо от того, требовалось ли «суммировать это» или «в какой момент выступающий переключается на слайд с ценами?». Такая одноэтапная архитектура вынуждает идти на невыгодный компромисс: платить за всю временную шкалу в контексте или заранее разбивать видео на части и рисковать потерять важную деталь.

На этой неделе Google запустила агентное понимание видео во всех своих моделях Flash. Вместо загрузки временной шкалы Gemini сама перемещается по видео, решая, что смотреть, с какой частотой кадров и через какую модальность. По данным Google, это позволяет сократить количество токенов до 88%, снизить стоимость до 66% и повысить точность до 7% на стандартных тестах для видео.

Можно ли это развернуть? Да, но только как функцию размещённого API. Открытых весов нет, и самостоятельно разместить решение невозможно. Функция доступна через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, работает как с загруженными файлами, так и с общедоступными URL-адресами YouTube, а оплата взимается по стандартным тарифам Gemini API за токены без дополнительной платы за функцию.

Что именно изменилось

Статическая обработка, которая по-прежнему используется по умолчанию во всех моделях Gemini, извлекает кадры с частотой 1 FPS за один проход, обрабатывает аудио с битрейтом 1 Кбит/с в одном канале и добавляет временные метки каждую секунду. Агентная обработка заменяет это циклом. Модель объединяет собственные рассуждения с нативными инструментами работы с видео, чтобы искать, сканировать и изучать нужные сегменты по кадрам, аудио и расшифровкам, загружая только то, что требуется запросу. Разработчики и раньше могли собрать такую систему вручную; изменение заключается в том, что теперь Gemini запускает этот цикл внутри себя, устраняя соответствующие накладные расходы на разработку.

По результатам оценок Google, Gemini 3.7 Flash с агентным пониманием занимает оптимальное положение на границе Парето по соотношению точности и стоимости среди протестированных моделей для анализа видео. Преимущества эффективности особенно заметны при работе с длинными материалами — от 10-минутных инструкций до многочасовых записей.

Что возвращает API

Агентная обработка добавляет в массив ответа steps два типа шагов: processing_call, когда модель запрашивает сегмент или расшифровку, и соответствующий processing_result, когда загрузка завершается. Они чередуются с шагами thought и предшествуют model_output, поэтому могут использоваться для отображения трассировки прогресса в реальном времени в вашем интерфейсе. Их наличие также позволяет проверить, действительно ли был запущен агентный режим.

Учёт токенов разделяется соответствующим образом. Рассуждения при навигации тарифицируются как токены мыслей (total_thought_tokens), а загружаемые по запросу кадры, аудио и расшифровки — как токены использования инструментов (total_tool_use_tokens).

Для включения достаточно указать одно поле в части с видео:

Копировать кодСкопированоИспользовать другой браузер
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)

В одном запросе также можно смешивать режимы для разных видео: агентный режим — для длинной лекции, статический — для короткого ролика.

Основные выводы

  • Агентный режим позволяет Gemini перемещаться по временной шкале видео вместо его загрузки с фиксированной частотой 1 FPS.
  • По данным Google, количество токенов сокращается до 88%, стоимость — на 66%, а точность на тестах для видео повышается на 7%.
  • Поддерживаются Gemini 3.8, 3.7, 3.6 Flash и 3.5 Flash-Lite; режим включается с помощью одного поля processing.
  • Статический режим по-прежнему лучше подходит для роликов продолжительностью менее пяти минут и задач, требующих точности на уровне отдельных кадров.
  • Действуют стандартные тарифы API, однако рассуждения при навигации тарифицируются как токены мыслей.

Ознакомьтесь с блогом Google, документацией Gemini API по пониманию видео, руководством для разработчиков в AI Studio и анонсом агентного зрения. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? Теперь вы также можете присоединиться к нам в Telegram.

Хотите стать нашим партнёром для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости