Google запускає агентне розуміння відео для моделей Gemini Flash, скорочуючи кількість відеотокенів до 88%
Відео було найдорожчою модальністю для аналізу. Модель Gemini, якій передавали 90-хвилинну лекцію, досі завантажувала її повністю з фіксованою частотою один кадр на секунду — незалежно від того, чи запит звучав як «підсумуй це», чи «о котрій годині доповідач переходить до слайда з цінами?». Така однопрохідна конструкція змушує йти на невигідний компроміс: оплачувати всю часову шкалу в контексті або заздалегідь розбивати відео на частини й ризикувати втратити важливу деталь.
Цього тижня Google запустила агентне розуміння відео у своїх моделях Flash. Замість завантаження всієї часової шкали Gemini переміщується нею, вирішуючи, що переглядати, з якою частотою кадрів і через яку модальність. Google повідомляє про скорочення кількості токенів до 88%, зниження вартості до 66% і підвищення точності до 7% на стандартних тестах для відео.
Чи можна це розгорнути? Так, але лише як функцію розміщеного API. Відкритих ваг немає, і самостійно розмістити її неможливо. Функція доступна через Gemini API у Google AI Studio та через Gemini Enterprise Agent Platform, працює як із завантаженими файлами, так і з загальнодоступними URL-адресами YouTube, а оплата здійснюється за стандартними тарифами Gemini API на токени без додаткової плати за функцію.
Що саме змінилося
Статична обробка, яка досі є стандартною для кожної моделі Gemini, вилучає кадри з частотою 1 FPS в один прохід, обробляє аудіо зі швидкістю 1 Кбіт/с в одному каналі та вставляє часові позначки щосекунди. Агентна обробка замінює це циклом. Модель поєднує власне міркування з нативними відеоінструментами для пошуку, сканування й перевірки потрібних сегментів у кадрах, аудіо та транскрипціях, завантажуючи лише те, що необхідно для запиту. Розробники й раніше могли зібрати таку систему вручну; зміна полягає в тому, що Gemini запускає цей цикл внутрішньо, усуваючи витрати часу на розробку.
Згідно з оцінюваннями Google, Gemini 3.7 Flash з агентним розумінням опиняється на фронті Парето за співвідношенням точності та вартості для аналізу відео серед протестованих моделей. Переваги ефективності особливо помітні для довгого контенту — від 10-хвилинних інструкцій до багатогодинних записів.
Що повертає API
Агентна обробка додає до масиву відповіді steps два типи кроків: processing_call, коли модель запитує сегмент або транскрипцію, і відповідний processing_result, коли завантаження завершено. Вони чергуються з кроками thought і передують model_output, тож можуть забезпечувати відображення перебігу виконання в реальному часі у вашому інтерфейсі. Їхня наявність також дає змогу перевірити, що агентний режим справді працював.
Облік токенів відповідно розділяється. Навігаційне міркування оплачується як токени міркування (total_thought_tokens); кадри, аудіо та транскрипції, завантажені на вимогу, оплачуються як токени використання інструментів (total_tool_use_tokens).
Увімкнення потребує одного поля у відеочастині:
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)Також можна змішувати режими для різних відео в одному запиті: агентний режим для довгої лекції, статичний — для короткого кліпу.
Основні висновки
- Агентний режим дає Gemini змогу переміщуватися часовою шкалою відео замість завантаження його з фіксованою частотою 1 FPS.
- Google повідомляє про скорочення кількості токенів до 88%, зниження вартості на 66% і підвищення точності на 7% на тестах для відео.
- Підтримується в Gemini 3.8, 3.7, 3.6 Flash і 3.5 Flash-Lite; вмикається одним полем
processing. - Статичний режим залишається кращим для кліпів тривалістю до п’яти хвилин і завдань, що потребують покадрової точності.
- Застосовуються стандартні тарифи API, але навігаційне міркування оплачується як токени міркування.
Ознайомтеся з блогом Google, документацією Gemini API щодо розуміння відео, посібником для розробників в AI Studio і оголошенням про агентне бачення. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.