Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Стекът за видеопродукция вече се побира на едно бюро: LTX-2.5 стартира като ускорен от NVIDIA световен модел с отворени тегла

Производството на видео се променя, тъй като клиповете за социалните мрежи, рекламното съдържание и предварителната визуализация на филми преминават от облака към локални графични процесори. LTX представи днес LTX-2.5 — модел на света с отворени тегла за генериране на видео, приложения в реално време и физически изкуствен интелект, създаден именно за тази промяна. LTX оптимизира модела за локално изпълнение върху NVIDIA RTX GPU и NVIDIA DGX Spark, като намали изискванията за VRAM, така че водещ модел на света да работи върху хардуер, който създателите вече притежават. Представянето е част от едномесечната поредица на NVIDIA за локален изкуствен интелект, стартирала в същия ден с отворения агентен модел Nemotron 3.5 Lightning. Посланието и на двата модела е ясно: отворените модели, ускорени локално, се превръщат в стандартна производствена инфраструктура.

Какво променя локалното генериране за създателите

LTX-2.5 дава на създателите нещо, което досега беше скрито зад вратите на студиото: реална последователност. Вграденото генериране на множество кадри визуализира цяла последователност като едно свързано произведение, запазвайки визията на героя от кадър до кадър и отстранявайки дефектите, които правеха по-ранните отворени модели неизползваеми за кампании. Добавете по-мощна езикова основа Gemma 4 и нов декодер, който намалява артефактите при кадри с много движение, и резултатът вече е почти готов за постпродукция. Всичко работи върху потребителски NVIDIA RTX GPU, директно в ComfyUI. Един човек, работещ на бюро, може да фиксира брандиран герой или характерен стил с бързо фино настройване чрез LoRA. Без студио. Без облак. Без интелектуалната собственост да напуска машината.

Това е истинската промяна: целият производствен стек вече се побира на един настолен компютър. Това, което преди изискваше екип, снимачен ден, ферма за визуализация и облачна сметка, сега се случва върху RTX картата, която вече е в машината. Допълнителните клипове не носят такси за всяко генериране или измервани кредити. Това променя начина, по който работят създателите: да експериментират широко, да преследват дузина посоки, вместо да залагат на една сигурна идея, и да оставят GPU да генерира пакетно съдържание за цяла седмица през нощта. Събуждате се пред папка, пълна с възможности.

За създателите на кратко съдържание и рекламните екипи, които непрекъснато обновяват материалите си, това е трансформиращо. Рекламната умора обикновено настъпва в рамките на 7 до 10 дни, така че пречката никога не са били идеите, а разходите и времето, необходими за създаването на достатъчно от тях. Локалното генериране премахва тази пречка: създавайте варианти по една и съща задача, тествайте десет начални послания, локализирайте за пет пазара и обновявайте рекламното съдържание, преди да настъпи умората. Самостоятелните създатели и малките екипи вече могат да достигнат обема на продукцията на цяло студио с един RTX GPU на бюрото.

Скорост: числата зад историята

Всичко това няма значение, ако генерирането не е бързо — а то е. В публикувания от LTX тест за преобразуване на изображение във видео 10-секунден клип отнема 6,8 секунди локално, при работа с 2x NVIDIA GB200 и 23,7 секунди чрез LTX API. Най-бързите затворени алтернативи в списъка — Omni Flash, Grok 1.5 и Veo 3.1 — постигат резултати за 52 до 70 секунди. По-бавните системи се нуждаят от значително повече време: Seedance 2.0 — 196, FLUX 3 — 259, Seedance 2.5 — 317, а Kling 3.0 Pro — 398 секунди. Локално LTX-2.5 генерира по-бързо от самата продължителност на клипа — 7,6 пъти по-бързо от най-близката затворена алтернатива и приблизително 58 пъти по-бързо от най-бавната. Тази разлика прави пакетното генериране през нощта и бързата A/B итерация практични, а не теоретични.

Импулсът на NVIDIA за локален изкуствен интелект

През целия август NVIDIA акцентира върху модели, приложения и инструменти в екосистемата на локалния изкуствен интелект. Nemotron 3.5 Lightning, представен също днес, е отворен модел с 30 милиарда параметъра и смес от експерти за постоянно активни агенти, към който се присъединява NeMo Switchyard — библиотека с отворен код, която насочва всяка стъпка от работния процес на агента към най-подходящия модел. Общата нишка е изборът на хардуер: отворените модели в екосистемата на NVIDIA се мащабират от RTX компютри до работни станции, центрове за данни и облака. LTX-2.5 се вписва директно в тази история като модел на света, ускорен от NVIDIA, за създатели, разработчици и екипи по роботика.

Какво представлява LTX-2.5?

Докато големите езикови модели (LLM) се учат да предсказват следващата дума, моделите на света се учат да предсказват следващия момент. Те генерират среди, симулират поведението им и позволяват на потребителите да действат в тях. Тази основа поддържа филми, реклама, игри, симулации и роботи в складове и фабрики. LTX описва семейството LTX като най-използвания отворен модел на света, с над 33 милиона изтегляния, и представя LTX-2.5 като най-способното си издание досега. Отворените тегла дават на екипите пълен контрол върху хардуера, персонализацията и интелектуалната собственост.

Какво е новото в архитектурата

LTX преработи почти всеки етап от производствения процес, вместо просто да добави функции към по-старо ядро:

  • Нов дифузионен видео декодер: Намалява визуалните артефакти в сцени с много движение, като същевременно запазва високия коефициент на компресия на LTX и остава верен на съществуващия видеоматериал.
  • Вградено генериране на множество кадри: Визуализира цяла последователност като един резултат, като запазва последователността на героя, сцената и гласа между отделните преходи. Персонализирана езикова основа Gemma 4 и специален подобрител на подсказките подобряват разбирането на сложни подсказки с множество обекти.
  • Diffusion Fidelity Rendering: Изгражда движението и структурата в латентно пространство с 8-кратно времево компресиране, след което генерира висококачествени ключови кадри, които закрепват визуалните детайли. Броят на ключовите кадри се адаптира към сложността на сцената и наличния изчислителен ресурс.
  • Контролна точка за физически изкуствен интелект: Предварително обучена контролна точка, настроена за роботика, дава на екипите основа за фино настройване върху специфични за дадена област данни, различни от кинематографично видео.
  • По-мощен дестилиран модел: Осигурява същото качество при по-ниска цена и по-бързо изпълнение за внедряване в производствен мащаб.

За кого е предназначен LTX-2.5

  • Филмови и видеостудиа: Последователността при множество кадри и по-чистият декодер правят последователностите използваеми в реални продукции. Студиа като Asteria вече създават оригинални филми и видеа с LTX.
  • Създатели на кратко съдържание и рекламни екипи: Локалното генериране без такси за всеки клип превръща A/B тестването в стратегия: пакетно създавайте варианти през нощта, обновявайте рекламното съдържание всяка седмица и го локализирайте за различни пазари, без бюджет за продукция.
  • Разработчици на приложения в реално време: Reactor използва LTX-2.5 в своята инфраструктура с ниска латентност, за да захранва интерактивни аватари, живи светове и роботизирани работни натоварвания в реално време.
  • Екипи по роботика и физически изкуствен интелект: Контролната точка за физически изкуствен интелект осигурява основа за фино настройване върху специфични за дадена област данни, различни от кинематографичните. Markov Robotics използва LTX, за да разработва начина, по който физическите системи възприемат света и се движат в него.

Наличност и лицензиране

LTX-2.5 се предлага с отворени тегла в Hugging Face, директно в ComfyUI и чрез LTX API за управлявано генериране. Работи на всичко — от GPU в центрове за данни до Mac — и е безплатен за организации с годишни повтарящи се приходи под 10 милиона долара. Кодът е наличен в GitHub, заедно с документация.

Основни изводи

  • LTX-2.5 е модел на света с отворени тегла за видео, приложения в реално време и роботика.
  • Локалното генериране достига 6,8 секунди за 10-секунден клип в сравнение с 52 до 398 секунди при затворените конкуренти.
  • Оптимизацията за NVIDIA намалява изискванията за VRAM при локално изпълнение върху RTX GPU и DGX Spark.
  • Вграденото генериране на множество кадри с основа Gemma 4 запазва последователността на героите, правейки възможно локалното създаване на съдържание с качество за кампании.
  • Теглата са безплатни в Hugging Face за организации с под 10 милиона долара годишни повтарящи се приходи, с поддръжка на ComfyUI още от първия ден.

Благодарим на екипа на NVIDIA за лидерството в областта на идеите и ресурсите за тази статия. Тази статия е спонсорирана от NVIDIA.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини