Новий агентний аналіз відео в Google Gemini скорочує використання токенів до 88%
Ключові моменти
- Google оснащує свої моделі Gemini Flash агентним аналізом відео, який динамічно шукає потрібні фрагменти відеозапису замість послідовного сканування кадр за кадром за фіксованою схемою.
- Моделі самостійно визначають, які частини відео аналізувати і як саме. За даними Google, це заощаджує до 88 відсотків токенів, знижує витрати на 66 відсотків і підвищує точність.
- Функція вже доступна через Gemini API для пошуку конкретних сцен у довгих відео; згодом запланована інтеграція в застосунок Gemini та YouTube.
Google додає агентний аналіз відео до кількох моделей Gemini. Замість сканування відео кадр за кадром із фіксованою частотою модель самостійно шукає релевантні фрагменти, що, за словами Google, значно скорочує використання токенів і витрати.
Новітні моделі — Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite — можуть виявляти моменти тривалістю менше секунди, зокрема зміни стану або монтажні склейки, які залишилися б непоміченими за частоти один кадр на секунду. Google заявляє, що це робить автоматизований відеомонтаж набагато точнішим.
Система також може знаходити окремі сцени в багатогодинних відеозаписах, не витрачаючи мільйони токенів. Вона виявляє аномалії, повторно аналізуючи підозрілі часові відрізки з вищою частотою кадрів, а також точно підраховує повторювані рухи й окремі об’єкти в часі.

Досі Gemini використовувала статичну обробку, за замовчуванням аналізуючи відео з фіксованою частотою один кадр на секунду, яку можна було змінити через API. Від запуску нативного аналізу відео у 2025 році Gemini транскрибувала аудіодоріжку й аналізувала кадри щосекунди.
Google стверджує, що агентний варіант безпосередньо пов’язує міркування моделі з нативними інструментами роботи з відео. Модель самостійно вирішує, які фрагменти переглядати, з якою швидкістю і через який тип даних — кадри, аудіо чи транскрипт. Вона отримує лише ті моменти й сигнали, які справді потрібні для конкретного завдання.
Тепер Gemini завантажує лише важливі частини відео
Тепер Gemini використовує внутрішній інструмент, щоб отримувати лише релевантну частину відеофайлу. Раніше розробники могли вручну створювати такий вибірковий підхід, але тепер модель виконує це самостійно.

Цей підхід ґрунтується на «агентному баченні», яке Google представила для Gemini 3 Flash у січні. Ця функція давала моделі змогу писати й запускати код Python для масштабування, обрізання та анотування зображень, перевіряючи кожен результат у циклі «міркування — дія — спостереження» перед відповіддю. На момент запуску вона не працювала автоматично в кожному випадку, але необхідна основа вже була закладена. Коли Google ще в грудні оголосила про Gemini 3 Flash, компанія назвала візуальне й просторове міркування для відео однією з майбутніх можливостей.
Переваги ефективності найбільш помітні під час роботи з довгими відео — від 10-хвилинних навчальних посібників до 90-хвилинних лекцій і багатогодинних записів. За статичної обробки розробникам доводилося обирати між високими витратами токенів і методами, які відкидають важливі деталі. У власних тестах Google, зокрема LongVideoBench, Gemini 3.7 Flash з агентним аналізом демонструє найвищу загальну якість і найкраще поєднання точності та економічності.

Без додаткової плати через API
Функція доступна для завантажених відео та відео з YouTube через Gemini API у Google AI Studio, а також на Gemini Enterprise Agent Platform. Розробники встановлюють режим обробки «agentic» у конфігурації API та сплачують стандартні тарифи Gemini API за токени без додаткової плати. Докладніша інформація доступна в посібнику для розробників.
Google також планує впровадити ці покращення у власні продукти. Незабаром функція має стати доступною для всіх користувачів застосунку Gemini на пристроях із Flash і Flash Lite. У найближчі місяці агентний аналіз відео також забезпечуватиме роботу функції «Запитай YouTube» на сторінці відтворення, надаючи відповіді, тісніше пов’язані з тим, що насправді видно у відео.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові технології «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.