Стек для відеопродакшену тепер уміщується на одному столі: LTX-2.5 запускається як прискорена NVIDIA світова модель із відкритими вагами
Виробництво відео змінюється, оскільки створення соціальних роликів, рекламних матеріалів і попередня візуалізація фільмів переходять із хмари на локальні GPU. LTX сьогодні випустила LTX-2.5 — світову модель із відкритими вагами для генерації відео, застосунків реального часу та фізичного ШІ, створену саме для такого переходу. LTX оптимізувала модель для локального запуску на NVIDIA RTX GPU і NVIDIA DGX Spark, зменшивши вимоги до VRAM, щоб передова світова модель працювала на обладнанні, яке творці вже мають. Цей реліз є центральною частиною місячної серії про локальний ШІ від NVIDIA, започаткованої того ж дня, що й відкрита агентна модель Nemotron 3.5 Lightning. Сигнал від обох релізів очевидний: відкриті моделі, прискорені локально, стають стандартною виробничою інфраструктурою.
Що змінює локальна генерація для творців
LTX-2.5 дає творцям те, що раніше було доступне лише за дверима студії: справжню узгодженість. Нативна генерація кількох кадрів створює цілу послідовність як єдиний цілісний фрагмент, зберігаючи вигляд персонажа від кадру до кадру та усуваючи мерехтіння, через яке попередні відкриті моделі були непридатними для кампаній. Додайте чіткішу мовну основу Gemma 4 і новий декодер, який зменшує кількість артефактів у сценах із високою динамікою, — і результат майже готовий до постпродакшну. Усе це працює на споживчому NVIDIA RTX GPU, безпосередньо всередині ComfyUI. Одна людина за столом може за допомогою швидкого донавчання LoRA зафіксувати фірмового персонажа або впізнаваний стиль. Без студії. Без хмари. Без виходу інтелектуальної власності за межі пристрою.
У цьому й полягає справжня зміна: весь виробничий стек тепер уміщується на одному настільному комп’ютері. Те, на що раніше були потрібні команда, знімальний день, рендер-ферма та рахунок за хмарні ресурси, тепер відбувається на RTX-карті, яка вже встановлена в комп’ютері. Додаткові кліпи не потребують плати за кожну генерацію чи кредитів із погодинною тарифікацією. Це докорінно змінює робочий процес творців: можна широко експериментувати, випробовувати десяток напрямів замість того, щоб робити ставку на одну безпечну ідею, і дозволити GPU пакетно генерувати тижневий обсяг контенту за ніч. Вранці ви прокидаєтеся й бачите папку, повну варіантів.
Для творців коротких відео та рекламних команд, яким постійно потрібні оновлення, це трансформаційна зміна. Втома від реклами зазвичай настає протягом 7–10 днів, тож вузьким місцем були не ідеї, а вартість і час, необхідні для створення достатньої їх кількості. Локальна генерація усуває цю проблему: створюйте варіації одного брифу, тестуйте десять перших фраз, локалізуйте матеріали для п’яти ринків і оновлюйте креативи до того, як настане втома від реклами. Тепер незалежні творці та невеликі команди можуть зрівнятися за обсягом результату з цілою студією, маючи один RTX GPU на столі.
Швидкість: цифри за цією історією
Усе це не має значення, якщо генерація не є швидкою, — але вона швидка. У опублікованому LTX тесті image-to-video 10-секундний кліп займає 6,8 секунди локально на 2x NVIDIA GB200 і 23,7 секунди через API LTX. Найшвидші закриті альтернативи з переліку — Omni Flash, Grok 1.5 і Veo 3.1 — показують результат за 52–70 секунд. Повільніші системи потребують значно більше часу: Seedance 2.0 — 196 секунд, FLUX 3 — 259, Seedance 2.5 — 317, а Kling 3.0 Pro — 398. Локально LTX-2.5 генерує відео швидше, ніж триває сам кліп: у 7,6 раза швидше за найближчу закриту альтернативу й приблизно у 58 разів швидше за найповільнішу. Такий розрив робить нічну пакетну генерацію та швидкі A/B-тести практичними, а не теоретичними.
Динаміка локального ШІ від NVIDIA
Протягом серпня NVIDIA привертає увагу до моделей, застосунків та інструментів у екосистемі локального ШІ. Nemotron 3.5 Lightning, також випущена сьогодні, є відкритою моделлю суміші експертів із 30 млрд параметрів для агентів, що працюють постійно; разом із нею представлено NeMo Switchyard — бібліотеку з відкритим кодом, яка спрямовує кожен етап робочого процесу агента до найбільш відповідної моделі. Спільна тема — вибір обладнання: відкриті моделі екосистеми NVIDIA масштабуються від ПК із RTX до робочих станцій, дата-центрів і хмари. LTX-2.5 безпосередньо вписується в цю історію як світова модель із прискоренням NVIDIA для творців, розробників і команд робототехніки.
Що таке LTX-2.5?
Як великі мовні моделі (LLM) навчаються передбачати наступне слово, так світові моделі навчаються передбачати наступну мить. Вони генерують середовища, моделюють їхню поведінку та дають користувачам змогу діяти всередині них. Ця основа підтримує кіновиробництво, рекламу, ігри, симуляції, а також роботу роботів на складах і фабриках. LTX описує сімейство LTX як найбільш використовувану відкриту світову модель — її завантажили понад 33 мільйони разів — і позиціонує LTX-2.5 як найпотужніший на сьогодні реліз. Відкриті ваги дають командам повний контроль над обладнанням, кастомізацією та інтелектуальною власністю.
Що нового в архітектурі
LTX перебудувала майже кожен етап конвеєра генерації, а не просто додала функції до старого ядра:
- Новий дифузійний відеодекодер: Зменшує кількість візуальних артефактів у сценах із високою динамікою, зберігаючи високий коефіцієнт стиснення LTX і відповідність наявному відеоматеріалу.
- Нативна генерація кількох кадрів: Рендерить повну послідовність як єдиний результат, зберігаючи узгодженість персонажа, сцени та голосу між монтажними склейками. Кастомна мовна основа Gemma 4 і спеціальний покращувач промптів підвищують розуміння складних промптів із кількома об’єктами.
- Рендеринг із точністю дифузії: Формує рух і структуру в латентному просторі, стисненому в часі у 8 разів, а потім генерує високоточні ключові кадри для фіксації візуальних деталей. Кількість ключових кадрів адаптується до складності сцени та доступного обчислювального бюджету.
- Контрольна точка фізичного ШІ: Попередньо навчена контрольна точка, оптимізована для робототехніки, дає командам основу для донавчання на даних із доменів, відмінних від кінематографічного відео.
- Потужніша дистильована модель: Забезпечує таку саму якість за нижчої вартості та швидшого запуску для розгортання у виробничих масштабах.
Для кого призначена LTX-2.5
- Кіно- та відеостудії: Узгодженість між кількома кадрами та чистіший декодер роблять послідовності придатними для реального виробництва. Студії на кшталт Asteria вже створюють оригінальні фільми та відео за допомогою LTX.
- Творці коротких відео та рекламні команди: Локальна генерація без плати за кожен кліп перетворює A/B-тестування на стратегію: пакетно створюйте варіації за ніч, щотижня оновлюйте креативи та локалізуйте їх для різних ринків без виробничого бюджету.
- Розробники застосунків реального часу: Reactor запускає LTX-2.5 на своїй інфраструктурі з низькою затримкою для роботи інтерактивних аватарів, живих світів і завдань робототехніки в реальному часі.
- Команди робототехніки та фізичного ШІ: Контрольна точка фізичного ШІ надає основу для донавчання на даних із некінематографічних доменів. Markov Robotics використовує LTX для розробки систем сприйняття фізичними системами навколишнього світу та їхнього переміщення в ньому.
Доступність і ліцензування
LTX-2.5 доступна як модель із відкритими вагами на Hugging Face, нативно в ComfyUI, а також через API LTX для керованої генерації. Вона працює на всьому — від GPU дата-центрів до Mac — і є безкоштовною для організацій із річним регулярним доходом менше ніж 10 млн доларів. Код доступний на GitHub, разом із документацією.
Ключові висновки
- LTX-2.5 — це світова модель із відкритими вагами для відео, застосунків реального часу та робототехніки.
- Локальна генерація створює 10-секундний кліп за 6,8 секунди, тоді як закритим конкурентам потрібно від 52 до 398 секунд.
- Оптимізація NVIDIA зменшує вимоги до VRAM для локального запуску на RTX GPU та DGX Spark.
- Нативна генерація кількох кадрів із мовною основою Gemma 4 зберігає узгодженість персонажів, роблячи локально можливим створення результатів рівня рекламних кампаній.
- Ваги безкоштовні на Hugging Face для організацій із річним регулярним доходом менше ніж 10 млн доларів; підтримка ComfyUI доступна з першого дня.
Дякуємо команді NVIDIA за експертні матеріали та ресурси для цієї статті. Цю статтю підготовлено за підтримки NVIDIA.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.