Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Новият агентен видеоанализ на Google Gemini намалява използването на токени с до 88%

Новият агентен видеоанализ на Google Gemini намалява използването на токени с до 88 процента
Jonathan Kemper
2 септември 2026 г.
Google

Основни моменти

  • Google оборудва своите модели Gemini Flash с агентен видеоанализ, който динамично търси във видеозаписа, вместо да го сканира кадър по кадър по фиксиран модел.
  • Моделите автономно решават кои части от видеото да анализират и как, което според Google спестява до 88 процента токени, намалява разходите с 66 процента и подобрява точността.
  • Функцията вече е достъпна чрез Gemini API за намиране на конкретни сцени в дълги видеоклипове, а интеграцията в приложението Gemini и YouTube е планирана за по-късна дата.

Google добавя агентен видеоанализ към няколко модела Gemini. Вместо да сканира видеото кадър по кадър с фиксирана честота, моделът сам търси релевантните части, което според Google значително намалява използването на токени и разходите.

Най-новите модели, Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite, могат да улавят моменти с продължителност под една секунда, включително промени в състоянието или преходи, които биха останали незабелязани при един кадър в секунда. Google твърди, че това прави автоматизираното редактиране на видео много по-прецизно.

Системата може също да открива отделни сцени в часове видеозапис, без да изразходва милиони токени. Тя идентифицира аномалии, като пресемплира подозрителни времеви интервали с по-висока честота на кадрите, и точно преброява повтарящи се движения и отделни обекти във времето.

Две стълбовидни диаграми сравняват Gemini 3.7 Flash с и без агентна обработка върху Minerva, 1H-VideoQA и LVBench; вляво са токените на заявка, а вдясно — точността.
При 1H-VideoQA и LVBench използването на токени намалява с 88 процента, докато точността леко се повишава. | Изображение: Google

Досега Gemini разчиташе на статична обработка, като по подразбиране семплираше видеото с фиксирана честота от един кадър в секунда, която можеше да се настройва чрез API. От стартирането на вградения видеоанализ през 2025 г. Gemini транскрибира аудиопътеката и анализира кадрите на секундни интервали.

Google твърди, че агентният вариант свързва разсъжденията на модела директно с вградените инструменти за видео. Моделът сам решава кои части да разгледа, с каква скорост и чрез каква модалност — кадри, аудио или транскрипция. Той извлича само моментите и сигналите, от които действително се нуждае за конкретната задача.

Gemini вече зарежда само важните части от видеото

Gemini вече използва вътрешен инструмент, за да извлича само релевантната част от видеофайла. Преди разработчиците можеха ръчно да изградят подобен селективен подход, но сега моделът се справя сам.

Диаграма на цикъл на Gemini, състоящ се от Query, Think, Observation и Output, с инструментите get_transcript, get_frames(start, end, fps) и get_audio(start, end).
Вместо да зарежда видеото с фиксирана честота на кадрите, Gemini използва цикъл за селективно извличане на кадри, аудио или транскрипции от необходимите части. | Изображение: Google

Подходът се основава на „агентно зрение“, което Google представи за Gemini 3 Flash през януари. Тази функция позволяваше на модела да пише и изпълнява Python код за увеличаване, изрязване и анотиране на изображения, като проверяваше всеки резултат в цикъл на мислене, действие и наблюдение, преди да отговори. При стартирането тя не работеше автоматично във всички случаи, но основата вече беше налице. Когато Google обяви Gemini 3 Flash през декември, компанията посочи визуалното и пространственото разсъждение за видео като предстояща възможност.

Повишаването на ефективността се проявява най-силно при дълги видеоклипове — от 10-минутни уроци до 90-минутни лекции и многочасови записи. При статична обработка разработчиците трябваше да избират между високи разходи за токени и методи, които изхвърлят важни детайли. При собствените тестове на Google, включително LongVideoBench, Gemini 3.7 Flash с агентен анализ постига най-високо общо качество и предлага най-добрия баланс между точност и ефективност на разходите.

Диаграма на разсейване с разходите на заявка по оста X и точността по оста Y; Gemini 3.7 Flash с агентна обработка достига около 90 процента, над GPT 5.6 Terra, Claude Opus 5.0 и Grok 4.6.
При собствената оценка на Google 1H-VideoQA Gemini 3.7 Flash постига най-висока точност при най-ниска цена на заявка. | Изображение: Google

Без допълнително заплащане чрез API

Функцията е достъпна за качени видеоклипове и видеоклипове от YouTube чрез Gemini API в Google AI Studio и в Gemini Enterprise Agent Platform. Разработчиците задават режим на обработка „agentic“ в конфигурацията на API и заплащат стандартните тарифи за токени на Gemini API, без допълнителна такса. Повече подробности има в Ръководството за разработчици.

Google планира да въведе тези подобрения и в собствените си продукти. Очаква се функцията скоро да бъде достъпна за всички потребители на приложението Gemini на устройства с Flash и Flash Lite. През следващите месеци агентният видеоанализ също ще захранва функцията „Ask YouTube“ на страницата за възпроизвеждане, като предоставя отговори, по-тясно свързани с това, което действително се вижда във видеото.

Новини за изкуствения интелект без сензация – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, ексклузивния ни тримесечен доклад „AI Radar“ за водещите разработки, пълен достъп до архива и достъп до секцията за коментари.

Източник: Google

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини