Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Представяме агентно разбиране на видео с Gemini

Представяме агентното разбиране на видео с Gemini

1 септември 2026 г.

|

Новата ни агентна функция за видеоанализ намалява потреблението на токени с до 88%, разходите с до 66% и повишава качеството с до 7%.


Rohan Doshi

Старши продуктов мениджър, Google DeepMind

Mario Lučić

Директор „Изследвания“, Google DeepMind


Текстът „Агентно разбиране на видео“ до логото на Gemini, всичко това на тъмносин фон

Днес представяме агентното разбиране на видео във всички наши най-нови модели: Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Тази нова възможност подобрява точността, като същевременно драстично намалява използването на токени и разходите за видеоанализ. Подобно на агентното зрение, което комбинира изпълнението на код с вграденото разбиране на изображения от моделите Gemini, агентното разбиране на видео използва вградените видеоинструменти на Gemini, за да подобри производителността и да отключи нови възможности за обработка на видео, като намиране на моменти с точност до части от секундата, по-точно откриване на аномалии, прецизно броене и други.

Функцията е достъпна днес за качени видеоклипове и видеоклипове от YouTube чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.

Бенчмаркове

За разлика от текущата „статична“ обработка, при която моделът приема видеото с фиксирана честота на кадрите (по подразбиране 1 кадър в секунда, с възможност за промяна чрез API), агентното разбиране на видео съчетава основните способности за разсъждение на модела с вградените видеоинструменти, за да търси, сканира и анализира динамично целеви сегменти от видеото чрез визуални кадри, аудио и транскрипции. В стандартните бенчмаркове за видеоанализ моделите Gemini с агентно разбиране на видео намаляват разходите за анализ с до 66% и потреблението на токени с до 88%, като същевременно подобряват точността с до 7%.

Тези подобрения в ефективността са особено отчетливи при дълги видеоклипове — от 10-минутни ръководства с инструкции до 90-минутни лекции и записи с продължителност няколко часа, при които статичната обработка принуждава разработчиците да избират между високи разходи за токени и техники, които пропускат важни детайли.

Активирането на агентното разбиране на видео намалява потреблението на токени с до 88% и повишава точността с до 7% при Gemini 3.7 Flash.

Графики, анализиращи ефективността на токените и подобренията в точността

Макар тези подобрения да се наблюдават и при трите поддържани модела, Gemini 3.7 Flash с агентно разбиране предлага най-високото възможно цялостно качество и най-добрата комбинация от качество и разходна ефективност, като го поставя на границата на Парето по отношение на точността и разходите сред тестваните модели за разбиране на видео.

Използването на агентно разбиране на видео поставя Gemini 3.7 Flash на границата на Парето по отношение на точността и разходите за видеоанализ.

Графика с „Разход на заявка“ по хоризонталната ос и „Точност“ по вертикалната ос

Как работи

Вместо статична обработка, при която моделът приема медийни потоци с фиксирана честота на кадрите, агентното разбиране на видео позволява на Gemini да заеме активна, целенасочена роля при определянето какво да гледа, с каква скорост и чрез какъв тип съдържание (кадри, аудио или транскрипция), като извлича само необходимите моменти и сигнали. Макар че преди разработчиците можеха да правят това ръчно, с агентното разбиране на видео Gemini може да го осъществява чрез агентен цикъл, извиквайки вътрешен инструмент за зареждане на съответната част от видеофайла, което значително намалява разходите за разработка.

Диаграма на процеса от заявка до резултат

Възможности и случаи на употреба

Агентното разбиране на видео преобразява начина, по който разработчиците могат да обработват дълги видеосъдържания в разнообразни сложни приложения.

  • Намиране на моменти с точност до части от секундата: Определяне на промени в състоянието за части от секундата и точни граници на преходите, които лесно се пропускат при 1 кадър в секунда, което прави възможно прецизното автоматизирано редактиране на видео.
  • Търсене на игла в купа сено в дълги видеоклипове: Отговаряне на сложни въпроси в рамките на видеоклипове с продължителност няколко часа, без изразходване на милиони токени.
  • Откриване на аномалии: Повторно вземане на проби от интересни времеви интервали с по-висока честота на кадрите за анализ на бързи движения и фини визуални артефакти.
  • Броене на действия и обекти: Точно проследяване на повтарящи се физически движения и отделни обекти във времето.

Ефективен по отношение на токените анализ на дълги видеоклипове

Вижте как Gemini 3.7 Flash се представя със и без агентно разбиране на видео в LongVideoBench — бенчмарк за разбиране на дълги видеоклипове. Обърнете внимание на значителното намаляване на токените и подобренията в точността.

Точен анализ на бързи действия с динамична честота на кадрите

С агентното разбиране на видео 3.7 Flash може точно да преброи бързо движение, като сканира и преглежда повторно видеото с различна честота на кадрите според необходимостта.

Ефективно по отношение на токените търсене на игла в купа сено

С помощта на агентното разбиране на видео Gemini 3.7 може точно да отговаря на сложни въпроси въз основа на съдържанието на видеото, като използва значително по-малко токени в сравнение със статичния анализ.

Резултати от реалния свят

Много от партньорите ни с ранен достъп постигнаха отлични резултати при тестването на агентното разбиране на видео. Ето какво споделят:

Цитат от Ponder
Цитат от Revyl
Цитат от Mosaic
Цитат от Resemble.AI

Първи стъпки

Агентното разбиране на видео е достъпно чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, като се предоставя за Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Използва стандартното ценообразуване на токените в Gemini API, без допълнителна такса за функцията.

За да я активирате, просто задайте обработката на „agentic“ в конфигурацията на API. Прочетете нашето ръководство за разработчици, за да научите повече за функцията и как да започнете работа.

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)

print(interaction.output_text)

Също така пренасяме подобренията в ефективността и качеството на агентното разбиране на видео до милиарди потребители чрез продуктите на Google. Скоро функцията ще бъде достъпна за всички потребители в приложението Gemini при моделите Flash и Flash-Lite. През следващите месеци агентното разбиране на видео ще захранва и функцията „Попитай YouTube’“ на страницата за гледане на видеоклипове в YouTube, като използва Gemini за предоставяне на по-качествени отговори, основани на визуалното съдържание.

Благодарим за приноса към тази работа на: Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin и екипа на Agentic Vision.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от DeepMind на

Прочетете оригинала в DeepMind ↗

Текстът и изображенията са собственост на DeepMind и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини