Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Google стартира агентно разбиране на видео за моделите Gemini Flash, намалявайки видеотокените с до 88%

Видеото е най-скъпата модалност за обработка. Досега модел Gemini, на който е подадена 90-минутна лекция, обработваше цялото видео с фиксирана честота от един кадър в секунда, независимо дали въпросът беше „обобщи това“ или „в колко часа лекторът преминава към слайда с цените?“. Този еднопроходен дизайн налага лош компромис: да платите за цялата времева линия в контекста или предварително да разделите видеото на части и да рискувате да пропуснете важния детайл.

Тази седмица Google пусна агентно разбиране на видео във всички свои Flash модели. Вместо да обработва цялата времева линия, Gemini се придвижва в нея, като решава какво да гледа, с каква кадрова честота и чрез коя модалност. Google отчита до 88% по-малко токени, до 66% по-ниска цена и до 7% по-висока точност при стандартни бенчмаркове за видео.

Може ли да се внедри? Да, но само като функция на хостван API. Няма отворени тегла и нищо, което да може да хоствате самостоятелно. Функцията се предоставя чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, работи както с качени файлове, така и с публични URL адреси в YouTube, и се таксува според стандартните цени на токените в Gemini API, без допълнителна такса за функцията.

Какво всъщност се промени

Статичната обработка, която все още е по подразбиране при всеки модел Gemini, извлича кадри с честота 1 FPS в един проход, обработва аудио с 1 Kbps в един канал и добавя времеви маркери на всяка секунда. Агентната обработка заменя това с цикъл. Моделът съчетава собственото си разсъждение с нативни видео инструменти, за да търси, сканира и проверява целеви сегменти в кадрите, аудиото и транскрипциите, като зарежда само необходимото според заявката. Разработчиците и преди можеха да сглобят това ръчно; промяната е, че Gemini изпълнява цикъла вътрешно, което премахва разходите за разработка.

Според оценките на Google Gemini 3.7 Flash с агентно разбиране се намира на границата на Парето между точност и цена за видеоанализ сред тестваните модели. Ефективността се подобрява най-вече при дългоформатно съдържание — от 10-минутни ръководства до многочасови записи.

Какво връща API

Агентната обработка добавя два типа стъпки към масива за отговор steps: processing_call, когато моделът поиска сегмент или транскрипция, и съответстващ processing_result, когато зареждането приключи. Те се редуват със стъпки thought и предхождат model_output, така че могат да захранват проследяване на напредъка в реално време във вашия интерфейс. Наличието им е и начин да проверите дали агентният режим действително е работил.

Отчитането на токените се разделя по съответния начин. Разсъждението при навигацията се таксува като токени за мислене (total_thought_tokens); кадрите, аудиото и транскрипциите, заредени при поискване, се таксуват като токени за използване на инструменти (total_tool_use_tokens).

Активирането му става чрез едно поле във видеочастта:

Копиране на кодаКопираноИзползване на друг браузър
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)

Можете също да комбинирате режимите за отделните видеа в рамките на една заявка — агентен режим за дългата лекция и статичен режим за краткия клип.

Основни изводи

  • Агентният режим позволява на Gemini да навигира във времевата линия на видеото, вместо да го обработва с фиксирана честота от 1 FPS.
  • Google отчита до 88% по-малко токени, 66% по-ниска цена и 7% по-висока точност при бенчмаркове за видео.
  • Поддържа се от Gemini 3.8, 3.7, 3.6 Flash и 3.5 Flash-Lite; активира се чрез едно поле processing.
  • Статичният режим остава по-добър за клипове с продължителност под пет минути и за задачи, изискващи прецизност кадър по кадър.
  • Прилагат се стандартните цени на API, но разсъждението при навигация се таксува като токени за мислене.

Разгледайте блога на Google, документацията за разбиране на видео в Gemini API, ръководството за разработчици в AI Studio и съобщението за агентното зрение. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ пускане на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини