Представяме агентно разбиране на видео с Gemini
1 септември 2026 г.
|Новата ни агентна функция за видеоанализ намалява потреблението на токени с до 88%, разходите с до 66% и повишава качеството с до 7%.
Rohan Doshi
Старши продуктов мениджър, Google DeepMind
Mario Lučić
Директор „Изследвания“, Google DeepMind
Днес представяме агентното разбиране на видео във всички наши най-нови модели: Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Тази нова възможност подобрява точността, като същевременно драстично намалява използването на токени и разходите за видеоанализ. Подобно на агентното зрение, което комбинира изпълнението на код с вграденото разбиране на изображения от моделите Gemini, агентното разбиране на видео използва вградените видеоинструменти на Gemini, за да подобри производителността и да отключи нови възможности за обработка на видео, като намиране на моменти с точност до части от секундата, по-точно откриване на аномалии, прецизно броене и други.
Функцията е достъпна днес за качени видеоклипове и видеоклипове от YouTube чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.
Бенчмаркове
За разлика от текущата „статична“ обработка, при която моделът приема видеото с фиксирана честота на кадрите (по подразбиране 1 кадър в секунда, с възможност за промяна чрез API), агентното разбиране на видео съчетава основните способности за разсъждение на модела с вградените видеоинструменти, за да търси, сканира и анализира динамично целеви сегменти от видеото чрез визуални кадри, аудио и транскрипции. В стандартните бенчмаркове за видеоанализ моделите Gemini с агентно разбиране на видео намаляват разходите за анализ с до 66% и потреблението на токени с до 88%, като същевременно подобряват точността с до 7%.
Тези подобрения в ефективността са особено отчетливи при дълги видеоклипове — от 10-минутни ръководства с инструкции до 90-минутни лекции и записи с продължителност няколко часа, при които статичната обработка принуждава разработчиците да избират между високи разходи за токени и техники, които пропускат важни детайли.
Активирането на агентното разбиране на видео намалява потреблението на токени с до 88% и повишава точността с до 7% при Gemini 3.7 Flash.
Макар тези подобрения да се наблюдават и при трите поддържани модела, Gemini 3.7 Flash с агентно разбиране предлага най-високото възможно цялостно качество и най-добрата комбинация от качество и разходна ефективност, като го поставя на границата на Парето по отношение на точността и разходите сред тестваните модели за разбиране на видео.
Използването на агентно разбиране на видео поставя Gemini 3.7 Flash на границата на Парето по отношение на точността и разходите за видеоанализ.
Как работи
Вместо статична обработка, при която моделът приема медийни потоци с фиксирана честота на кадрите, агентното разбиране на видео позволява на Gemini да заеме активна, целенасочена роля при определянето какво да гледа, с каква скорост и чрез какъв тип съдържание (кадри, аудио или транскрипция), като извлича само необходимите моменти и сигнали. Макар че преди разработчиците можеха да правят това ръчно, с агентното разбиране на видео Gemini може да го осъществява чрез агентен цикъл, извиквайки вътрешен инструмент за зареждане на съответната част от видеофайла, което значително намалява разходите за разработка.
Възможности и случаи на употреба
Агентното разбиране на видео преобразява начина, по който разработчиците могат да обработват дълги видеосъдържания в разнообразни сложни приложения.
- Намиране на моменти с точност до части от секундата: Определяне на промени в състоянието за части от секундата и точни граници на преходите, които лесно се пропускат при 1 кадър в секунда, което прави възможно прецизното автоматизирано редактиране на видео.
- Търсене на игла в купа сено в дълги видеоклипове: Отговаряне на сложни въпроси в рамките на видеоклипове с продължителност няколко часа, без изразходване на милиони токени.
- Откриване на аномалии: Повторно вземане на проби от интересни времеви интервали с по-висока честота на кадрите за анализ на бързи движения и фини визуални артефакти.
- Броене на действия и обекти: Точно проследяване на повтарящи се физически движения и отделни обекти във времето.
Ефективен по отношение на токените анализ на дълги видеоклипове
Вижте как Gemini 3.7 Flash се представя със и без агентно разбиране на видео в LongVideoBench — бенчмарк за разбиране на дълги видеоклипове. Обърнете внимание на значителното намаляване на токените и подобренията в точността.
Точен анализ на бързи действия с динамична честота на кадрите
С агентното разбиране на видео 3.7 Flash може точно да преброи бързо движение, като сканира и преглежда повторно видеото с различна честота на кадрите според необходимостта.
Ефективно по отношение на токените търсене на игла в купа сено
С помощта на агентното разбиране на видео Gemini 3.7 може точно да отговаря на сложни въпроси въз основа на съдържанието на видеото, като използва значително по-малко токени в сравнение със статичния анализ.
Резултати от реалния свят
Много от партньорите ни с ранен достъп постигнаха отлични резултати при тестването на агентното разбиране на видео. Ето какво споделят:
Първи стъпки
Агентното разбиране на видео е достъпно чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, като се предоставя за Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Използва стандартното ценообразуване на токените в Gemini API, без допълнителна такса за функцията.
За да я активирате, просто задайте обработката на „agentic“ в конфигурацията на API. Прочетете нашето ръководство за разработчици, за да научите повече за функцията и как да започнете работа.
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
Също така пренасяме подобренията в ефективността и качеството на агентното разбиране на видео до милиарди потребители чрез продуктите на Google. Скоро функцията ще бъде достъпна за всички потребители в приложението Gemini при моделите Flash и Flash-Lite. През следващите месеци агентното разбиране на видео ще захранва и функцията „Попитай YouTube’“ на страницата за гледане на видеоклипове в YouTube, като използва Gemini за предоставяне на по-качествени отговори, основани на визуалното съдържание.
Благодарим за приноса към тази работа на: Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin и екипа на Agentic Vision.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.