Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Представляємо агентне розуміння відео з Gemini

Представляємо агентне розуміння відео з Gemini

1 вересня 2026 р.

|

Нова агентна функція для аналізу відео скорочує використання токенів до 88%, зменшує витрати до 66% і підвищує якість до 7%.


Rohan Doshi

Старший менеджер із продукту, Google DeepMind

Mario Lučić

Директор із досліджень, Google DeepMind


Текст «Агентне розуміння відео» поруч із логотипом Gemini на темно-синьому тлі

Сьогодні ми запускаємо агентне розуміння відео в усіх наших найновіших моделях: Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite. Ця нова можливість підвищує точність, водночас суттєво зменшуючи використання токенів і витрати на аналіз відео. Подібно до агентного бачення, яке поєднує виконання коду з нативним розумінням зображень моделями Gemini, агентне розуміння відео використовує нативні відеоінструменти Gemini для підвищення продуктивності та відкриття нових можливостей обробки відео, як-от пошук моментів із точністю до часток секунди, точніше виявлення аномалій, точний підрахунок тощо.

Функція вже доступна для завантажених відео та відео з YouTube через Gemini API у Google AI Studio і Gemini Enterprise Agent Platform.

Бенчмарки

На відміну від поточної «статичної» обробки, за якої модель отримує відео з фіксованою частотою кадрів (за замовчуванням 1 FPS, значення можна змінити через API), агентне розуміння відео поєднує базове міркування моделі з нативними відеоінструментами, щоб динамічно шукати, сканувати й аналізувати потрібні сегменти відео за візуальними кадрами, аудіо та транскриптами. У стандартних бенчмарках аналізу відео моделі Gemini з агентним розумінням відео знижують витрати на аналіз до 66% і використання токенів до 88%, водночас підвищуючи точність до 7%.

Ці переваги ефективності особливо помітні під час роботи з довгими відео (від 10-хвилинних інструкцій до 90-хвилинних лекцій і багатогодинних записів), де статична обробка змушує розробників обирати між високими витратами на токени та методами, які втрачають важливі деталі.

Увімкнення агентного розуміння відео знижує використання токенів до 88% і підвищує точність до 7% у Gemini 3.7 Flash.

Графіки аналізу ефективності використання токенів і підвищення точності

Хоча ці переваги охоплюють усі три підтримувані моделі, Gemini 3.7 Flash з агентним розумінням забезпечує найвищу загальну якість і найкраще поєднання якості та економічної ефективності, розміщуючи її на парето-фронті точності та вартості серед протестованих моделей для розуміння відео.

Використання агентного розуміння відео розміщує Gemini 3.7 Flash на парето-фронті точності та вартості для аналізу відео.

Графік із «Вартістю запиту» на осі x і «Точністю» на осі y

Як це працює

Замість статичної обробки, за якої модель отримує медіапотоки з фіксованою частотою кадрів, агентне розуміння відео дає Gemini змогу активно й цілеспрямовано визначати, що переглядати, із якою швидкістю та через яку модальність (кадри, аудіо чи транскрипт), завантажуючи лише потрібні моменти й сигнали. Раніше розробники могли робити це вручну, але завдяки агентному розумінню відео Gemini може виконувати це через агентний цикл, викликаючи внутрішній інструмент для завантаження потрібної частини відеофайлу, що суттєво зменшує накладні витрати на розробку.

Схема процесу від запиту до результату

Можливості та варіанти використання

Агентне розуміння відео змінює підхід розробників до обробки довгих відеоматеріалів у різноманітних складних сценаріях.

  • Пошук моментів із точністю до часток секунди: визначення миттєвих змін стану та точних меж монтажних склеювань, які легко пропустити за частоти 1 FPS, що робить можливим точний автоматизований відеомонтаж.
  • Пошук голки в копиці сіна у довгих відео: відповіді на складні запити щодо багатогодинних відео без використання мільйонів токенів.
  • Виявлення аномалій: повторне дискретизування цікавих часових інтервалів із вищою частотою кадрів для аналізу швидкого руху й малопомітних візуальних артефактів.
  • Підрахунок дій і об’єктів: точне відстеження повторюваних фізичних рухів і окремих об’єктів у часі.

Ефективний аналіз довгих відео з погляду використання токенів

Дізнайтеся, як Gemini 3.7 Flash працює з агентним розумінням відео та без нього на LongVideoBench — бенчмарку розуміння довгих відео. Зверніть увагу на значне скорочення кількості токенів і підвищення точності.

Точний аналіз швидких дій із динамічним FPS

Завдяки агентному розумінню відео 3.7 Flash може точно підраховувати швидкі рухи, скануючи та повторно переглядаючи відео з різною частотою кадрів за потреби.

Ефективний пошук голки в копиці сіна з погляду використання токенів

Використовуючи агентне розуміння відео, Gemini 3.7 може точно відповідати на складні запитання на основі вмісту відео, використовуючи значно менше токенів порівняно зі статичним аналізом.

Результати у реальних умовах

Багато наших партнерів із раннього доступу продемонстрували високі результати під час тестування агентного розуміння відео. Ось що вони кажуть:

Цитата від Ponder
Цитата від Revyl
Цитата від Mosaic
Цитата від Resemble.AI

Початок роботи

Агентне розуміння відео доступне через Gemini API у Google AI Studio і Gemini Enterprise Agent Platform та запускається в Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite. Функція використовує стандартні тарифи Gemini API на токени без додаткової плати за функцію.

Щоб увімкнути її, просто встановіть для обробки значення "agentic" у конфігурації API. Ознайомтеся з нашим посібником для розробників, щоб дізнатися більше про функцію та початок роботи з нею.

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)

print(interaction.output_text)

Ми також поширюємо переваги агентного розуміння відео з погляду ефективності та якості на мільярди користувачів продуктів Google. Незабаром функція стане доступною для всіх користувачів у застосунку Gemini в моделях Flash і Flash-Lite. У найближчі місяці агентне розуміння відео також забезпечуватиме роботу функції YouTube «Запитати YouTube» на сторінці перегляду відео, використовуючи Gemini для надання якісніших відповідей, обґрунтованих візуальним вмістом.

Висловлюємо подяку за внесок у цю роботу: Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin і команді Agentic Vision.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням DeepMind

Читати оригінал на DeepMind ↗

Текст і зображення належать DeepMind і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини