Google стартира агентно разбиране на видео за моделите Gemini Flash, намалявайки видеотокените с до 88%
Видеото е най-скъпата модалност за обработка. Досега модел Gemini, на който е подадена 90-минутна лекция, обработваше цялото видео с фиксирана честота от един кадър в секунда, независимо дали въпросът беше „обобщи това“ или „в колко часа лекторът преминава към слайда с цените?“. Този еднопроходен дизайн налага лош компромис: да платите за цялата времева линия в контекста или предварително да разделите видеото на части и да рискувате да пропуснете важния детайл.
Тази седмица Google пусна агентно разбиране на видео във всички свои Flash модели. Вместо да обработва цялата времева линия, Gemini се придвижва в нея, като решава какво да гледа, с каква кадрова честота и чрез коя модалност. Google отчита до 88% по-малко токени, до 66% по-ниска цена и до 7% по-висока точност при стандартни бенчмаркове за видео.
Може ли да се внедри? Да, но само като функция на хостван API. Няма отворени тегла и нищо, което да може да хоствате самостоятелно. Функцията се предоставя чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, работи както с качени файлове, така и с публични URL адреси в YouTube, и се таксува според стандартните цени на токените в Gemini API, без допълнителна такса за функцията.
Какво всъщност се промени
Статичната обработка, която все още е по подразбиране при всеки модел Gemini, извлича кадри с честота 1 FPS в един проход, обработва аудио с 1 Kbps в един канал и добавя времеви маркери на всяка секунда. Агентната обработка заменя това с цикъл. Моделът съчетава собственото си разсъждение с нативни видео инструменти, за да търси, сканира и проверява целеви сегменти в кадрите, аудиото и транскрипциите, като зарежда само необходимото според заявката. Разработчиците и преди можеха да сглобят това ръчно; промяната е, че Gemini изпълнява цикъла вътрешно, което премахва разходите за разработка.
Според оценките на Google Gemini 3.7 Flash с агентно разбиране се намира на границата на Парето между точност и цена за видеоанализ сред тестваните модели. Ефективността се подобрява най-вече при дългоформатно съдържание — от 10-минутни ръководства до многочасови записи.
Какво връща API
Агентната обработка добавя два типа стъпки към масива за отговор steps: processing_call, когато моделът поиска сегмент или транскрипция, и съответстващ processing_result, когато зареждането приключи. Те се редуват със стъпки thought и предхождат model_output, така че могат да захранват проследяване на напредъка в реално време във вашия интерфейс. Наличието им е и начин да проверите дали агентният режим действително е работил.
Отчитането на токените се разделя по съответния начин. Разсъждението при навигацията се таксува като токени за мислене (total_thought_tokens); кадрите, аудиото и транскрипциите, заредени при поискване, се таксуват като токени за използване на инструменти (total_tool_use_tokens).
Активирането му става чрез едно поле във видеочастта:
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)Можете също да комбинирате режимите за отделните видеа в рамките на една заявка — агентен режим за дългата лекция и статичен режим за краткия клип.
Основни изводи
- Агентният режим позволява на Gemini да навигира във времевата линия на видеото, вместо да го обработва с фиксирана честота от 1 FPS.
- Google отчита до 88% по-малко токени, 66% по-ниска цена и 7% по-висока точност при бенчмаркове за видео.
- Поддържа се от Gemini 3.8, 3.7, 3.6 Flash и 3.5 Flash-Lite; активира се чрез едно поле
processing. - Статичният режим остава по-добър за клипове с продължителност под пет минути и за задачи, изискващи прецизност кадър по кадър.
- Прилагат се стандартните цени на API, но разсъждението при навигация се таксува като токени за мислене.
Разгледайте блога на Google, документацията за разбиране на видео в Gemini API, ръководството за разработчици в AI Studio и съобщението за агентното зрение. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ пускане на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.