Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Google AI пуска Gemini Omni 1.1 Flash: 40-секундно удължаване на сцена, контрол върху първия/последния кадър и увеличаване до 4K

Google пусна Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), производствена актуализация на своя нативен мултимодален модел за генериране и редактиране на видео. Версията превръща Omni от способен генератор в модел, който може да бъде директно управляван: разширяването на сцени вече анализира до 10 секунди предходен контекст вместо само един последен кадър, първият и последният кадър могат да бъдат фиксирани за контрол върху движението на камерата, черновите се визуализират в 360p на една трета от цената на 720p, финалните видеа се увеличават до 4K, а видеоклипове могат да се подават като референции за последователност на персонажите.

Gemini Omni Flash е изграден върху три характеристики, които Google отличава от тези на предишните видео модели: нативна мултимодалност (текст, изображения, аудио и видео се обработват заедно), разговорно редактиране чрез Interactions API и познания за света, наследени от Gemini. Редактирането е състояниево — подавате previous_interaction_id и моделът прилага промяната ви, като запазва всичко, което не сте споменали, без повторно качване на предходното видео.

Готов ли е за внедряване?

Той е достъпен чрез Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, като Adobe, Figma Weave, GMI Cloud и Runway вече са посочени като производствени потребители.

Разширяването на сцени е основната промяна

Omni 1.1 анализира до 10 секунди предходен контекст при продължаване на клип. Google посочва, че предишните модели са използвали само последната секунда като референция. Разширяванията се извършват на 10-секундни стъпки до общо 40 секунди, като моделът генерира продължение от 3 до 10 секунди при всяко извикване. Някои от финалните кадри на входа се редактират, за да се осигури плавно съединяване.

Ограниченията са конкретни. Разширяването добавя съдържание само в края на клипа — не може да се добавя в началото или в средата. Качените входни видеа трябва да са с продължителност до 10 секунди, освен ако не разширявате генерирано от модела видео в многократен разговор. Не можете да добавяте нов диалог при разширяване на качено видео, в което някой говори; говоримият диалог се поддържа при многократно разширяване чрез previous_interaction_id.

Ключови кадри и видео референции

Вече можете да предоставите първи и последен кадър и да накарате модела да генерира непрекъснатото видео между тях — механизмът зад орбитите, доли-зуумите и безшевните цикли. Подканите свързват медията с роли чрез тагове: <FIRST_FRAME>, <LAST_FRAME>, <IMAGE_REF_N> и <VIDEO_REF_N>.

Видео референциите приемат максимум три клипа с продължителност до три секунди всеки и работят най-добре за визуална прилика. Аудиото във видео референция се игнорира. Разсъждаването въз основа на множество видеа не се поддържа и може да влоши резултата.

Контрол на разходите: чернова в 360p, финален резултат в 4K

Параметърът resolution в response_format приема 360p, 720p (по подразбиране), 1080p и 4k, като последните две резолюции се увеличават чрез мащабиране. Google съобщава, че предварителните прегледи в 360p се генерират до 60% по-бързо и на една трета от цената на 720p въз основа на системната пропускателна способност при 360p спрямо 720p. Това прави цикъла „чернова, след това увеличаване“ предпочитания производствен модел: евтини итерации и еднократно финално визуализиране.

Цени, произход и ограничения

Входът струва 1,50 щ.д. за 1 млн. токена (текст, изображения, видео, аудио). Изходът струва 9,00 щ.д. за 1 млн. текстови токена и 17,50 щ.д. за 1 млн. видео токена. Таксуването за видео се изчислява при 5792 токена за секунда 720p, което означава ефективна цена от ~0,10 щ.д. за секунда при стандартните тарифи.

Всяко генерирано видео съдържа воден знак SynthID — невидим за зрителите, но програмно откриваем за установяване на произхода. Сред съществените липси са: системни инструкции, температура, top_p, стоп последователности и отрицателни подкани (отрицателните указания се добавят в текста на подканата); редактирането на глас не се поддържа; аудио референциите не се поддържат; URL адреси към YouTube не могат да се използват като източник. Английският език се поддържа напълно; останалите езици не са оценявани. За резултати над 4 MB използвайте delivery="uri" и проверявайте Files API, докато файлът стане ACTIVE.

Google посочва Adobe (Firefly), Figma Weave, GMI Cloud и Runway като клиенти, които вече използват Omni Flash в производствена среда. Моделът вече е наличен и в Google Flow за абонати на AI Plus, Pro и Ultra, както и в приложението Gemini за разширяване на сцени.

Сравнение

Основни изводи

  • Разширяването на сцени вече анализира 10 секунди предходен контекст вместо една последна секунда и може да достигне общо 40 секунди.
  • Интерполацията между първия и последния кадър, заедно с таговете <VIDEO_REF_N>, осигурява контрол върху камерата и персонажите на ниво кадър.
  • Черновите в 360p се изпълняват до 60% по-бързо на една трета от цената на 720p; 1080p и 4K са резултати, увеличени чрез мащабиране.
  • Само за платени нива — ~0,10 щ.д. за секунда 720p видео, без безплатно ниво и без резервирана пропускателна способност.

Вижте съобщението в блога на Google, документацията за Gemini API Omni, цените на Gemini API и ръководството за бърз старт на Omni. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини