Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Google AI выпускает Gemini Omni 1.1 Flash: продление сцены на 40 секунд, управление первым и последним кадрами и масштабирование до 4K

Google выпустила Gemini Omni 1.1 Flash (gemini-omni-1.1-flash) — обновление для промышленной эксплуатации своей нативной мультимодальной модели генерации и редактирования видео. Этот релиз переводит Omni из категории способных генераторов в категорию управляемых: теперь расширение сцены анализирует до 10 секунд предыдущего контекста вместо одного последнего кадра, первый и последний кадры можно зафиксировать для управления движением камеры, черновики рендерятся в разрешении 360p за треть стоимости 720p, финальные версии масштабируются до 4K, а видеоклипы можно передавать в качестве референсов для сохранения согласованности персонажей.

Gemini Omni Flash построена на трех свойствах, которые Google отличает от предыдущих видеомоделей: нативная мультимодальность (текст, изображения, аудио и видео обрабатываются вместе), диалоговое редактирование через Interactions API и знания о мире, унаследованные от Gemini. Редактирование является состояниевым: вы передаете previous_interaction_id, после чего модель применяет изменение, сохраняя все, о чем вы не упоминали, без повторной загрузки предыдущего видео.

Готова ли она к развертыванию?

Она доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform; среди уже названных пользователей в промышленной эксплуатации — Adobe, Figma Weave, GMI Cloud и Runway.

Расширение сцены — главное изменение

Omni 1.1 анализирует до 10 секунд предыдущего контекста при продолжении клипа. Google заявляет, что предыдущие модели использовали только последний кадр. Расширения выполняются с шагом в 10 секунд до совокупной продолжительности 40 секунд, а за один вызов модель генерирует продолжение длительностью от 3 до 10 секунд. Некоторые последние кадры входного видео редактируются, чтобы сделать стык непрерывным.

Ограничения определены конкретно. Расширение добавляется только в конец клипа — нельзя добавить его в начало или вставить в середину. Загружаемые исходные видео должны быть длительностью не более 10 секунд, за исключением случаев, когда в многошаговом режиме расширяется видео, сгенерированное моделью. При расширении загруженного видео, в котором кто-то говорит, нельзя добавлять новый диалог; устная речь поддерживается при многошаговом расширении через previous_interaction_id.

Ключевые кадры и видеореференсы

Теперь можно задать первый и последний кадры, а модель сгенерирует непрерывное видео между ними — именно этот механизм лежит в основе орбитальных движений, наездов с изменением фокусного расстояния и бесшовных циклов. В промптах медиаданные связываются с ролями с помощью тегов: <FIRST_FRAME>, <LAST_FRAME>, <IMAGE_REF_N> и <VIDEO_REF_N>.

Видеореференсы поддерживают не более трех клипов длительностью до трех секунд каждый и лучше всего подходят для сохранения внешнего сходства. Аудио внутри видеореференса игнорируется. Анализ нескольких видео не поддерживается и может ухудшить результат.

Контроль затрат: черновик в 360p, финальная версия в 4K

Параметр resolution в response_format поддерживает значения 360p, 720p (по умолчанию), 1080p и 4k, причем два последних разрешения получают масштабированное изображение. По данным Google, превью в 360p генерируются до 60% быстрее и стоят в три раза дешевле, чем видео в 720p, исходя из системной пропускной способности для 360p и 720p. Это делает цикл «сначала черновик, затем масштабирование» рекомендуемым производственным подходом: дешево итерировать, а рендерить один раз.

Стоимость, происхождение и ограничения

Ввод стоит 1,50 доллара за 1 млн токенов (текст, изображения, видео, аудио). Вывод стоит 9,00 долларов за 1 млн текстовых токенов и 17,50 доллара за 1 млн видеотокенов. Тарификация видео рассчитывается из расчета 5 792 токена в секунду для 720p, что при стандартных расценках составляет примерно 0,10 доллара за секунду.

Каждое сгенерированное видео содержит водяной знак SynthID — невидимый для зрителей и программно обнаруживаемый для подтверждения происхождения. Среди заметных ограничений: отсутствие системных инструкций, температуры, top_p, стоп-последовательностей и негативных промптов (негативные указания следует включать в текст промпта); редактирование голоса не поддерживается; аудиореференсы не поддерживаются; URL-адреса YouTube нельзя использовать в качестве источника. Английский язык поддерживается полностью; другие языки не оценивались. Для результатов размером более 4 МБ используйте delivery="uri" и опрашивайте Files API, пока файл не перейдет в состояние ACTIVE.

Google называет Adobe (Firefly), Figma Weave, GMI Cloud и Runway клиентами, уже использующими Omni Flash в промышленной эксплуатации. Модель также доступна в Google Flow для подписчиков тарифов AI Plus, Pro и Ultra, а расширение сцены — в приложении Gemini.

Сравнение

Главные выводы

  • Теперь расширение сцены анализирует 10 секунд предыдущего контекста вместо одной последней секунды и позволяет наращивать общую длительность до 40 секунд.
  • Интерполяция между первым и последним кадрами вместе с тегами <VIDEO_REF_N> обеспечивает покадровый контроль камеры и персонажей.
  • Черновики в 360p создаются до 60% быстрее и стоят в три раза дешевле 720p; 1080p и 4K являются масштабированными результатами.
  • Доступно только на платном тарифе — около 0,10 доллара за секунду видео в 720p, без бесплатного тарифа и выделенной пропускной способности.

Ознакомьтесь с объявлением в блоге Google, документацией Gemini API Omni, расценками Gemini API и руководством по быстрому запуску Omni. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости