Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Стек видеопроизводства теперь помещается на одном столе: LTX-2.5 запускается как ускоренная NVIDIA мировая модель с открытыми весами

Производство видео меняется: короткие ролики для соцсетей, рекламные креативы и предварительная визуализация фильмов переходят из облака на локальные GPU. LTX сегодня выпустила LTX-2.5 — модель мира с открытыми весами для генерации видео, приложений реального времени и физического ИИ, созданную именно для такого перехода. LTX оптимизировала модель для локального запуска на NVIDIA RTX GPU и NVIDIA DGX Spark, снизив требования к VRAM, чтобы передовая модель мира работала на оборудовании, которое у создателей уже есть. Этот релиз открывает месячную серию NVIDIA о локальном ИИ, стартовавшую в тот же день, что и открытая агентная модель Nemotron 3.5 Lightning. Сигнал от обоих релизов таков: открытые модели с локальным ускорением становятся стандартной производственной инфраструктурой.

Что меняет локальная генерация для создателей

LTX-2.5 дает создателям то, что раньше было доступно только за дверями студии: настоящую согласованность. Нативная многокадровая генерация создает целую последовательность как единое связное произведение, сохраняя внешний вид персонажа от кадра к кадру и устраняя сбои, из-за которых прежние открытые модели были непригодны для кампаний. Более мощная языковая основа Gemma 4 и новый декодер, сокращающий количество артефактов в динамичных сценах, приближают результат к готовому для постпродакшена. Всё это работает на потребительском NVIDIA RTX GPU прямо внутри ComfyUI. Один человек за рабочим столом может закрепить фирменного персонажа или характерный стиль с помощью быстрой тонкой настройки LoRA. Никакой студии. Никакого облака. Никакой утечки интеллектуальной собственности с устройства.

В этом и заключается настоящий сдвиг: весь производственный стек теперь помещается на одном настольном компьютере. То, что раньше требовало команды, съемочного дня, фермы для рендеринга и облачного счета, теперь выполняется на RTX-карте, уже установленной в компьютере. Дополнительные ролики не требуют платы за каждую генерацию или учета кредитов. Это меняет подход создателей к работе: можно широко экспериментировать, выбирать из десятка направлений вместо ставки на одну безопасную идею и позволить GPU за ночь пакетно сгенерировать контент на неделю. Утром вас будет ждать папка, полная вариантов.

Для создателей коротких видео и рекламных команд, которым постоянно нужно обновлять контент, это переломный момент. Рекламная усталость обычно наступает за 7–10 дней, поэтому узким местом были не идеи, а стоимость и время, необходимые для производства достаточного их количества. Локальная генерация устраняет это ограничение: создавайте варианты по одному брифу, тестируйте десять первых фраз, адаптируйте контент для пяти рынков и обновляйте креатив до того, как наступит усталость. Теперь отдельные создатели и небольшие команды могут сравниться по объему выпуска с целой студией, имея один RTX GPU на рабочем столе.

Скорость: цифры за историей

Всё это не имеет значения, если генерация не происходит быстро, — но она происходит быстро. В опубликованном LTX тесте image-to-video 10-секундный ролик создается за 6,8 секунды локально на 2x NVIDIA GB200 и за 23,7 секунды через API LTX. Самые быстрые закрытые альтернативы из списка — Omni Flash, Grok 1.5 и Veo 3.1 — показывают результат за 52–70 секунд. Более медленные системы требуют значительно больше времени: Seedance 2.0 — 196 секунд, FLUX 3 — 259, Seedance 2.5 — 317, а Kling 3.0 Pro — 398. При локальном запуске LTX-2.5 генерирует видео быстрее, чем длится сам ролик: в 7,6 раза быстрее ближайшей закрытой альтернативы и примерно в 58 раз быстрее самой медленной. Благодаря такому разрыву ночная пакетная генерация и быстрая итерация A/B-тестов становятся практической, а не теоретической возможностью.

Импульс локального ИИ от NVIDIA

В течение августа NVIDIA рассказывает о моделях, приложениях и инструментах экосистемы локального ИИ. Nemotron 3.5 Lightning, также выпущенная сегодня, представляет собой открытую модель на 30 млрд параметров с архитектурой mixture-of-experts для постоянно работающих агентов. Вместе с ней вышла NeMo Switchyard — библиотека с открытым исходным кодом, которая направляет каждый этап рабочего процесса агента к наиболее подходящей модели. Общая идея — свобода выбора оборудования: открытые модели экосистемы NVIDIA масштабируются от ПК с RTX до рабочих станций, дата-центров и облака. LTX-2.5 напрямую вписывается в эту концепцию как ускоряемая NVIDIA модель мира для создателей, разработчиков и команд, работающих с робототехникой.

Что такое LTX-2.5?

Если большие языковые модели (LLM) учатся предсказывать следующее слово, то модели мира учатся предсказывать следующий момент. Они создают окружения, моделируют их поведение и позволяют пользователям действовать внутри них. Эта основа поддерживает кинопроизводство, рекламу, игры, симуляции, а также работу роботов на складах и фабриках. LTX описывает семейство LTX как наиболее часто используемую открытую модель мира: число загрузок превысило 33 миллиона. LTX-2.5 позиционируется как самый функциональный на данный момент релиз семейства. Открытые веса дают командам полный контроль над оборудованием, настройкой и интеллектуальной собственностью.

Что нового в архитектуре

LTX перестроила почти каждый этап конвейера генерации, а не просто добавила функции в старое ядро:

  • Новый диффузионный видеодекодер: сокращает количество визуальных артефактов в динамичных сценах, сохраняя высокий коэффициент сжатия LTX и соответствие исходному видеоматериалу.
  • Нативная многокадровая генерация: создает всю последовательность как единый результат, сохраняя согласованность персонажа, сцены и голоса между монтажными склейками. Специальная языковая основа Gemma 4 и отдельный улучшатель промптов повышают понимание сложных запросов с несколькими объектами.
  • Рендеринг Diffusion Fidelity: формирует движение и структуру в латентном пространстве с 8-кратным временным сжатием, а затем создает высококачественные ключевые кадры для фиксации визуальных деталей. Количество ключевых кадров адаптируется к сложности сцены и доступному вычислительному бюджету.
  • Чекпойнт для физического ИИ: предварительно обученный чекпойнт, настроенный для робототехники, дает командам основу для тонкой настройки на доменных данных, отличающихся от кинематографического видео.
  • Усиленная дистиллированная модель: обеспечивает такое же качество при меньшей стоимости и более высокой скорости вывода для развертывания в производственных объемах.

Для кого предназначена LTX-2.5

  • Киностудии и видеостудии: согласованность между кадрами и более чистый декодер делают последовательности пригодными для реального производства. Такие студии, как Asteria, уже создают оригинальные фильмы и видео с помощью LTX.
  • Создатели коротких видео и рекламные команды: локальная генерация без платы за каждый ролик превращает A/B-тестирование в стратегию: пакетно создавайте варианты за ночь, еженедельно обновляйте креативы и адаптируйте их для разных рынков без производственного бюджета.
  • Разработчики приложений реального времени: Reactor запускает LTX-2.5 на своей инфраструктуре с низкой задержкой для интерактивных аватаров, живых миров и робототехнических задач реального времени.
  • Команды, работающие с робототехникой и физическим ИИ: чекпойнт для физического ИИ предоставляет основу для тонкой настройки на некинематографических доменных данных. Markov Robotics использует LTX для разработки решений, позволяющих физическим системам воспринимать окружающий мир и перемещаться в нем.

Доступность и лицензирование

LTX-2.5 поставляется с открытыми весами на Hugging Face, нативно доступна в ComfyUI и предоставляется через API LTX для управляемой генерации. Она работает на всем спектре оборудования — от GPU в дата-центрах до Mac — и бесплатна для организаций с годовым регулярным доходом менее 10 млн долларов. Код опубликован на GitHub, вместе с документацией.

Главные выводы

  • LTX-2.5 — модель мира с открытыми весами для видео, приложений реального времени и робототехники.
  • При локальном запуске 10-секундный ролик генерируется за 6,8 секунды, тогда как закрытым конкурентам требуется от 52 до 398 секунд.
  • Оптимизация NVIDIA снижает требования к VRAM для локального запуска на RTX GPU и DGX Spark.
  • Нативная многокадровая генерация с основой Gemma 4 сохраняет согласованность персонажей, делая локально возможным создание результатов уровня рекламных кампаний.
  • Веса доступны бесплатно на Hugging Face для компаний с ARR менее 10 млн долларов, а поддержка ComfyUI доступна с первого дня.

Благодарим команду NVIDIA за экспертные материалы и ресурсы для этой статьи. Эта статья спонсирована NVIDIA.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости