Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Google AI випускає Gemini Omni 1.1 Flash: продовження сцени на 40 секунд, керування першим і останнім кадрами та масштабування до 4K

Google випустила Gemini Omni 1.1 Flash (gemini-omni-1.1-flash) — виробниче оновлення своєї нативної мультимодальної моделі генерації та редагування відео. Цей реліз перетворює Omni з потужного генератора на керований інструмент: розширення сцени тепер аналізує до 10 секунд попереднього контексту замість одного фінального кадру, перший і останній кадри можна фіксувати для керування рухом камери, чернетки рендеряться в 360p за третину вартості 720p, фінальні відео масштабуються до 4K, а відеокліпи можна передавати як референси для забезпечення узгодженості персонажів.

Gemini Omni Flash побудована на трьох властивостях, які Google відрізняє від попередніх відеомоделей: нативній мультимодальності (текст, зображення, аудіо та відео обробляються разом), діалоговому редагуванні через Interactions API і знаннях про світ, успадкованих від Gemini. Редагування є контекстним — ви передаєте previous_interaction_id, а модель застосовує вашу зміну, зберігаючи все, про що ви не згадували, без повторного завантаження попереднього відео.

Чи придатна вона для розгортання?

Вона доступна через Gemini API у Google AI Studio та на Gemini Enterprise Agent Platform; серед уже названих виробничих користувачів — Adobe, Figma Weave, GMI Cloud і Runway.

Розширення сцени — головна зміна

Omni 1.1 аналізує до 10 секунд попереднього контексту під час продовження кліпу. Google зазначає, що попередні моделі використовували лише останню секунду. Розширення виконуються з кроком у 10 секунд до загальної тривалості 40 секунд, а модель генерує продовження тривалістю від 3 до 10 секунд за один виклик. Деякі фінальні кадри вхідного відео редагуються, щоб зробити стикування безперервним.

Обмеження є конкретними. Розширення додається лише в кінець кліпу — без додавання на початок і без вставок у середину кліпу. Завантажені вхідні відео мають бути тривалістю не більше 10 секунд, якщо тільки ви не розширюєте відео, згенероване моделлю, у режимі багатокрокової взаємодії. Під час розширення завантаженого відео, у якому хтось говорить, не можна додавати нові діалоги; усне мовлення підтримується під час багатокрокового розширення через previous_interaction_id.

Ключові кадри та відеореференси

Тепер можна вказати перший і останній кадри, а модель згенерує безперервне відео між ними — саме цей механізм лежить в основі обертів, наїздів із трансфокацією та безшовних циклів. У запитах медіа прив’язуються до ролей за допомогою тегів: <FIRST_FRAME>, <LAST_FRAME>, <IMAGE_REF_N> і <VIDEO_REF_N>.

Відеореференси підтримують не більше трьох кліпів тривалістю до трьох секунд кожен і найкраще підходять для збереження схожості. Аудіо всередині відеореференсу ігнорується. Обробка взаємозв’язків між кількома відео не підтримується й може погіршити результат.

Контроль витрат: чернетка в 360p, фінальний результат у 4K

Параметр resolution у response_format підтримує значення 360p, 720p (за замовчуванням), 1080p і 4k, причому два найвищі значення отримуються шляхом масштабування. Google повідомляє, що попередні перегляди в 360p генеруються до 60% швидше та за третину вартості 720p — на основі системної пропускної здатності для 360p порівняно з 720p. Це робить цикл «чернетка — масштабування» передбачуваним виробничим підходом: дешево ітерувати, а потім виконати один фінальний рендер.

Ціни, походження та обмеження

Вхідні дані коштують 1,50 долара за 1 млн токенів (текст, зображення, відео, аудіо). Вихідні дані коштують 9,00 долара за 1 млн текстових токенів і 17,50 долара за 1 млн відеотокенів. Тарифікація відео здійснюється з розрахунку 5 792 токени за секунду відео у 720p, що за стандартними тарифами становить приблизно 0,10 долара за секунду.

Кожне згенероване відео містить водяний знак SynthID — невидимий для глядачів, але програмно виявлюваний для підтвердження походження. Серед помітних прогалин: відсутні системні інструкції, temperature, top_p, стоп-послідовності та негативні підказки (негативні вказівки слід додавати до тексту запиту); редагування голосу не підтримується; аудіореференси не підтримуються; URL-адреси YouTube не можна використовувати як джерело. Англійська мова підтримується повністю; інші мови не оцінювалися. Для результатів розміром понад 4 МБ використовуйте delivery="uri" і опитуйте Files API, доки файл не набуде статусу ACTIVE.

Google називає Adobe (Firefly), Figma Weave, GMI Cloud і Runway клієнтами, які вже використовують Omni Flash у виробництві. Модель також доступна в Google Flow для передплатників AI Plus, Pro та Ultra, а розширення сцени — у застосунку Gemini.

Порівняння

Основні висновки

  • Розширення сцени тепер аналізує 10 секунд попереднього контексту замість однієї фінальної секунди й може досягати загальної тривалості 40 секунд.
  • Інтерполяція між першим і останнім кадрами разом із тегами <VIDEO_REF_N> забезпечують покадровий контроль камери та персонажів.
  • Чернетки в 360p виконуються до 60% швидше за третину вартості 720p; 1080p і 4K є масштабованими вихідними даними.
  • Лише платний рівень — приблизно 0,10 долара за секунду відео у 720p, без безкоштовного рівня та без зарезервованої пропускної здатності.

Ознайомтеся з оголошенням у блозі Google, документацією Gemini API Omni, тарифами Gemini API і посібником швидкого старту Omni. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Зачекайте! ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини