Sakhanda Wire
NVDA $224.09 +3.03% MSFT $492.43 -2.26% GOOGL $343.54 -0.08% META $578.85 -3.38% AMZN $267.28 -1.83%
← До новин

Dyna Robotics представила Dyna-2: модель дій у світі, попередньо навчену на 1 мільйоні годин людського відео

Dyna Robotics випустила Dyna-2 — модель світової дії для маніпуляцій роботів. Її попередньо навчали на понад одному мільйоні годин відео від першої особи, знятого людьми. Це приблизно 170 років безперервного досвіду неспання. Навчання роботів було обмежене даними з позначеними діями, які телеоперація має цілеспрямовано створювати. Dyna-2 перевіряє, чи можуть звичайні людські відео замінити такі дані. Дослідницька команда створила ієрархію даних від 1 000 до 1 000 000 годин і виміряла, що саме масштабується. Отримано три результати: закон масштабування на людських даних, перше перенесення цього закону на невидимі раніше роботизовані дані та докази того, що передбачення відео забезпечує це перенесення.

Чи можна її розгорнути?

Так, але як систему, що працює під керуванням постачальника, а не як ваги для завантаження. Dyna Robotics не оголошувала про публічний чекпойнт, API чи ліцензію для Dyna-2. Сьогодні розгортання означає придбання роботизованої комірки Dyna, а не самостійний запуск моделі.

  • Які компанії: Роботи Dyna-1 уже працюють у готелях, ресторанах і пральнях, згідно з оголошенням компанії від 10 серпня 2026 року. Це вказує на операторів сфери послуг середнього масштабу та підприємства з кількома майданчиками, де виконуються повторювані маніпуляційні операції на стаціонарних об’єктах. Система не підходить для індивідуальних розробників або дослідницьких лабораторій, які хочуть виконувати інференс локально.
  • Галузі: Готельний бізнес, комерційні пральні, громадське харчування, легке складання та комплектування, а також прибирання об’єктів.
  • Застосування: 14 завдань післянавчання чітко відповідають реальній роботі: очищення лотків для сміття, комплектування аптечок, складання контейнерів, набір їжі ложкою, зав’язування мотузок, підготовка вішаків і цілеспрямоване діставання напоїв із холодильника.

Що таке Dyna-2

Dyna-2 — це модель світової дії (WAM): одна генеративна модель, яка спільно або окремо прибирає шум із майбутнього відео та майбутнього фрагмента дій на основі відеодифузійної архітектури. Її попередньо навчали на понад одному мільйоні годин відео від першої особи, знятого людьми, що приблизно відповідає 170 рокам безперервного досвіду неспання.

Архітектурно це суміш трансформерів. Відео й дії токенізуються окремо та отримують власні стеки шарів DiT, які взаємно звертаються один до одного. Пропріоцепція подається безпосередньо до трансформера дій. Для відеотокенів використовується каузальне маскування; токени дій застосовують двонапрямлену самоувагу та звертаються до контекстних відеотокенів. Відеотокени використовують перехресну увагу до тексту, але текст безпосередньо не впливає на токени дій.

Навчання використовує зіставлення потоків. Відеовтрата та втрата дій мають спільний стрижень як два окремі маргінальні поля швидкості. Оскільки мережа дій ніколи не отримує зашумлений латент майбутнього відео як аргумент, політика під час інференсу залишається реактивною — вона ні генерує, ні враховує передбачене майбутнє відео. Трансформер дій навмисно зроблено мілкішим і під’єднано до відеопотоку на ранньому етапі, що, за словами команди, покращує затримку в реальному часі без втрати продуктивності.

Три результати масштабування

Dyna Robotics виокремила вкладені підмножини обсягом рівно 1 000, 10 000, 100 000 і 1 000 000 годин, зберігаючи однакові пропорції з кожного джерела. Більший бюджет лише додає дані, тому відмінності між кривими не можна пояснити зміщенням розподілу. Фіксований, відокремлений набір валідації на 100 годин використовується для оцінювання кожного рівня.

  1. Закон масштабування справджується для людських даних до одного мільйона годин: усі чотири метрики монотонно покращуються та відповідають степеневим законам: MSE на відкладених даних = 0.0691·D^-0.0184 (R²=0.919), accuracy@0.5 = 0.357·D^+0.0203 (R²=0.865). На всій ієрархії accuracy@0.1 зростає на 51%, тоді як MSE — на 12%.
  2. Цей закон переноситься на роботизовані дані, яких модель не бачила: ті самі чекпойнти оцінювалися в режимі zero-shot на 39 завданнях на двох стаціонарних бімануальних платформах YAM — 12 внутрішніх і 27 із xdof ABC. Zero-shot MSE дій = 0.306·D^-0.0713 (R²=0.884). Команда повідомляє про перелом між 10 000 і 100 000 годин.
  3. Мета має значення, а відео є окремою віссю: спільне усунення шуму перевершило навчання лише на діях у 39 із 39 завдань на кожному масштабі дій. Якщо зафіксувати дані з позначеними діями на рівні 50 000 годин і додати години, що містять лише відео, zero-shot MSE роботів знижується з 0.340 до 0.120. Важливо, що похибка на відкладених людських даних не покращується — перевага відео полягає саме в узагальненні між різними втіленнями.

Результати на роботах

Кожен рівень післянавчали на 14 завданнях, використовуючи не більш як 10 годин роботизованих даних на завдання, на трьох типах роботів: руки YAM із 6 ступенями свободи з паралельними захватами, ті самі руки з вправними кистями WUJI-2 із 20 ступенями свободи та прототип напівгуманоїдного робота. Післянавчання використовувало лише роботизовані дані — без узгодження людина–робот і без спільного навчання.

Середній нормалізований бал зріс із 20% → 28% → 45% → 53% на всій ієрархії; на рівні одного мільйона годин модель була найкращою у 9 із 14 завдань. Поворот ключа в сейфі — пороговий випадок: 0% до 100 000 годин, а потім 90%. Відкручування кришки пляшки було післянавчено приблизно на 10 хвилинах демонстрацій, але показник усе одно зріс до 50%.

Порівняно з Dyna-1 — виробничою VLA-моделлю компанії, ініціалізованою з Qwen3-VL-4B, — рання версія Dyna-2 досягла коефіцієнта успішності 1,55× і оцінки 1,12×, усереднених за 7 завданнями та 3 чекпойнтами. На невідомих майданчиках клієнтів Dyna-2 відповідала виробничим критеріям у 87% випадків проти 46% у Dyna-1, хоча в лабораторії обидві моделі проходять перевірку майже у 100% випадків. Конвеєр дистиляції також скорочує вибірку відео з 10 203 мс до 110 мс на одному H100.

Інтерактивне пояснення

АНІМУВАТИ ІЄРАРХІЮ</button> <div class="card" style="margin-top:14px"> <div class="cardhd">Відкладені людські дані · рівень <span id="r1lbl">1k</span> годин</div> <div class="mgrid"> <div class="metric"><div class="mlab">Відкладена MSE ↓</div><div class="mval" id="m1a">0.062</div><div class="mbar"><div class="mfill" id="f1a"></div></div><div class="mnote">D<sup>-0.0184</sup> · R²=0.919</div></div> <div class="metric"><div class="mlab">Відкладена L1 ↓</div><div class="mval" id="m1b">0.140</div><div class="mbar"><div class="mfill" id="f1b"></div></div><div class="mnote">D<sup>-0.0132</sup> · R²=0.879</div></div> <div class="metric"><div class="mlab">Точність @0.1 ↑</div><div class="mval" id="m1c">0.017</div><div class="mbar"><div class="mfill" id="f1c"></div></div><div class="mnote">D<sup>+0.0606</sup> · R²=0.926</div></div> <div class="metric"><div class="mlab">Точність @0.5 ↑</div><div class="mval" id="m1d">0.40</div><div class="mbar"><div class="mfill" id="f1d"></div></div><div class="mnote">D<sup>+0.0203</sup> · R²=0.865</div></div> </div> <div class="callout">На всій ієрархії <b>accuracy@0.1 зростає на 51%</b>, тоді як MSE покращується на 12%. Точність за жорстким порогом — показник рухової точності — найбільше виграє від масштабування.</div> </div> </div> <!-- 03 HUMAN TO ROBOT --> <div class="panel" id="p2"> <p class="lead">Ті самі чекпойнти оцінювалися на <b>39 роботизованих завданнях</b> на двох стаціонарних бімануальних платформах YAM — 12 внутрішніх і 27 із xdof ABC — із <b>нульовою кількістю роботизованих траєкторій у попередньому навчанні</b>. Потім кожен рівень післянавчали на 14 завданнях, використовуючи не більш як 10 годин роботизованих даних на завдання, лише на роботизованих даних, без узгодження людина–робот.</p> <div class="ladder" id="lad2"></div> <button class="play" id="play2"> АНІМУВАТИ ІЄРАРХІЮ</button> <div class="card" style="margin-top:14px"> <div class="cardhd">Zero-shot на невидимих роботизованих даних · рівень <span id="r2lbl">1k</span> годин</div> <div class="mgrid" style="grid-template-columns:repeat(2,1fr)"> <div class="metric"><div class="mlab">Zero-shot MSE дій ↓</div><div class="mval" id="m2a">0.180</div><div class="mbar"><div class="mfill" id="f2a"></div></div><div class="mnote">D<sup>-0.0713</sup> · R²=0.884</div></div> <div class="metric"><div class="mlab">Zero-shot accuracy@0.5 ↑</div><div class="mval" id="m2b">0.067</div><div class="mbar"><div class="mfill" id="f2b"></div></div><div class="mnote">D<sup>+0.139</sup> · R²=0.918</div></div> </div> </div> <div class="card"> <div class="cardhd">Післянавчання на фізичному роботі · 14 завдань, 3 типи роботів</div> <div class="brow"><div class="blab">Середній нормалізований</div><div class="btrack"><div class="bfill" id="b2m" style="background:#E8B84B"></div></div><div class="bnum" id="n2m">20%</div></div> <div class="brow"><div class="blab">Поворот ключа в сейфі</div><div class="btrack"><div class="bfill" id="b2l" style="background:#8A8F94"></div></div><div class="bnum" id="n2l">0%</div></div> <div class="brow"><div class="blab">Відкручування кришки пляшки</div><div class="btrack"><div class="bfill" id="b2b" style="background:#8A8F94"></div></div><div class="bnum" id="n2b">10%</div></div> <div class="brow"><div class="blab">Діставання напою</div><div class="btrack"><div class="bfill" id="b2d" style="background:#8A8F94"></div></div><div class="bnum" id="n2d">58%</div></div> <div class="callout"><b>Поворот ключа в сейфі</b> — пороговий випадок: жоден чекпойнт до 100 000 годин не зміг повернути ключ. На рівні одного мільйона годин ключ повертався у 90% випадків. <b>Відкручування кришки пляшки</b> було післянавчено приблизно на 10 хвилинах роботизованих демонстрацій на двох вправних кистях із 20 ступенями свободи.</div> </div> </div> <!-- 04 VIDEO AXIS --> <div class="panel" id="p3"> <p class="lead">Зафіксуйте людські дані з позначеними діями на рівні <b>50 000 годин</b> і додавайте лише дані для передбачення відео без позначок дій. Помилка роботів у режимі zero-shot продовжує знижуватися. Помилка на відкладених <i>людських</i> даних не покращується — виграш від відео полягає саме в <b>узагальненні між різними втіленнями</b>.</p> <div class="ladder" id="lad3"></div> <button class="play" id="play3"> АНІМУВАТИ ВІДЕООСЬ</button> <div class="card" style="margin-top:14px"> <div class="cardhd">Додані години лише відео · дані дій зафіксовано на рівні 50 тис. год</div> <div class="metric" style="margin-bottom:14px"><div class="mlab">Zero-shot MSE дій робота ↓</div><div class="mval" id="m3a">0.340</div><div class="mbar"><div class="mfill" id="f3a"></div></div><div class="mnote">0 → 50 тис. годин відео змінюють показник 0.340 → 0.120</div></div> <div class="brow"><div class="blab">Робот (невидимий)</div><div class="btrack"><div class="bfill" id="b3r" style="background:#E8B84B"></div></div><div class="bnum" id="n3r">100%</div></div> <div class="brow"><div class="blab">Людина (у межах домену)</div><div class="btrack"><div class="bfill" id="b3h" style="background:#8A8F94"></div></div><div class="bnum" id="n3h">100%</div></div> <div class="legend"><span><span class="dot" style="background:#E8B84B"></span>Помилка робота, % від власної бази кожного домену без відео (менше = краще)</span><span><span class="dot" style="background:#8A8F94"></span>Помилка людини, та сама нормалізація</span></div> <div class="callout">За 50 тис. годин відео показник для роботів падає до <b>34%</b> від базового рівня без відео, тоді як показник для людей становить <b>104%</b> — дещо гірше. Повторення експерименту з 250 тис. годин дій і 0 → 750 тис. годин відео змінює MSE з 0.10 до 0.084.</div> </div> <div class="card"> <div class="cardhd">Абляція цілі · zero-shot на всіх 39 роботизованих завданнях</div> <p class="lead" style="margin-bottom:12px;font-size:11.5px">Спільне усунення шуму перевершило навчання лише на діях у <b>39 із 39 завдань на кожному масштабі дій</b>. Навчання лише на діях сильно перенавчається зі зростанням обсягу даних. Лише схема спільного навчання з відео продовжує покращуватися зі збільшенням даних дій.</p> </div> </div> <!-- 05 WAM VS VLA --> <div class="panel" id="p4"> <p class="lead">Ранню версію Dyna-2 порівняли з <b>Dyna-1</b> — виробничою VLA-моделлю Dyna, ініціалізованою з Qwen3-VL-4B, за однакових даних попереднього навчання, даних післянавчання та гіперпараметрів, використовуючи по три різні чекпойнти попереднього навчання. Dyna Robotics називає це <b>нижньою межею</b> для WAM: конвеєр налаштовували під VLA.</p> <button class="play" id="play4"> ЗАПУСТИТИ ПОРІВНЯННЯ</button> <div class="card" style="margin-top:14px"> <div class="cardhd">Усереднено за 7 завданнями × 3 чекпойнтами · VLA нормалізовано до 1,00×</div> <div class="brow"><div class="blab">Успішність VLA</div><div class="btrack"><div class="bfill" id="b4a" style="background:#4A4F54"></div></div><div class="bnum" id="n4a">1.00×</div></div> <div class="brow"><div class="blab">Успішність WAM</div><div class="btrack"><div class="bfill" id="b4b" style="background:#E8B84B"></div></div><div class="bnum" id="n4b">1.55×</div></div> <div class="brow"><div class="blab">Оцінка VLA</div><div class="btrack"><div class="bfill" id="b4c" style="background:#4A4F54"></div></div><div class="bnum" id="n4c">1.00×</div></div> <div class="brow"><div class="blab">Оцінка WAM</div><div class="btrack"><div class="bfill" id="b4d" style="background:#E8B84B"></div></div><div class="bnum" id="n4d">1.12×</div></div> <div class="callout">У прямому порівнянні, зафіксувавши крок чекпойнта та завдання, рання Dyna-2 перемогла у <b>65%</b> випадків, Dyna-1 — у 29%, ще 6% завершилися нічиєю.</div> </div> <div class="card"> <div class="cardhd">Zero-shot на реальних майданчиках клієнтів · виробничі критерії проходження</div> <div class="brow"><div class="blab">Dyna-1 у лабораторії</div><div class="btrack"><div class="bfill" id="b5a" style="background:#4A4F54"></div></div><div class="bnum" id="n5a">100%</div></div> <div class="brow"><div class="blab">Dyna-2 у лабораторії</div><div class="btrack"><div class="bfill" id="b5b" style="background:#4A4F54"></div></div><div class="bnum" id="n5b">100%</div></div> <div class="brow"><div class="blab">Dyna-1 на майданчику</div><div class="btrack"><div class="bfill" id="b5c" style="background:#8A8F94"></div></div><div class="bnum" id="n5c">46%</div></div> <div class="brow"><div class="blab">Dyna-2 на майданчику</div><div class="btrack"><div class="bfill" id="b5d" style="background:#E8B84B"></div></div><div class="bnum" id="n5d">87%</div></div> <div class="callout">Обидві моделі проходять перевірку майже у 100% випадків у лабораторії. На майданчиках клієнтів, яких вони не бачили, розрив становить <b>41 пункт</b> за однакового бюджету післянавчання. Оцінювання проводили оператори на місцях, які не брали участі в розробленні моделей.</div> </div> <div class="card"> <div class="cardhd">Однокрокова генерація відео · один H100</div> <div class="brow"><div class="blab">Учитель, 100 NFE</div><div class="btrack"><div class="bfill" id="b6a" style="background:#4A4F54"></div></div><div class="bnum" id="n6a">10203 мс</div></div> <div class="brow"><div class="blab">Дистильована модель, 1 NFE</div><div class="btrack"><div class="bfill" id="b6b" style="background:#E8B84B"></div></div><div class="bnum" id="n6b">110 мс</div></div> <div class="callout">Приблизно <b>у 90 разів швидше</b> для трисекундного відео маніпуляції з трьома ракурсами. Однокрокова модель зберігає FVD на рівні 121, а мерехтіння — 1,94 проти 2,37 для реально записаного відео; рух становить 75% від реального, але все ще поступається повній моделі-учителю.</div> </div> </div> <div class="src"> Усі наведені вище показники взято з технічного звіту Dyna Robotics, <a href="https://www.dyna.co/dyna-2" target="_blank" rel="noopener">Dyna-2: Закон масштабування на 1 мільйон годин для моделей світової дії</a> (серпень 2026 року). Інтерактивне пояснення створено <a href="https://www.marktechpost.com" target="_blank" rel="noopener">Marktechpost</a>. Жодне значення не оцінювалося й не інтерполювалося. </div> </div> <script> (function(){ var LAD=['1k','10k','100k','1M']; var D={ h:{mse:[0.062,0.057,0.056,0.054],l1:[0.140,0.131,0.129,0.127],a1:[0.017,0.021,0.024,0.026],a5:[0.40,0.44,0.45,0.47]}, r:{mse:[0.180,0.174,0.124,0.117],a5:[0.067,0.074,0.136,0.159]}, p:{mean:[20,28,45,53],lock:[0,0,0,90],cap:[10,10,40,50],drink:[58,75,83,83]} }; var VID=['0','1k','10k','50k']; var V={mse:[0.340,0.245,0.170,0.120],robot:[100,72,50,34],human:[100,101,103,104]}; function $(id){return document.getElementById(id);} function pct(v,lo,hi){var p=(v-lo)/(hi-lo)*100;return Math.max(3,Math.min(100,p));} function inv(v,lo,hi){return pct(hi-v+lo,lo,hi);} // tabs var tabs=document.querySelectorAll('.tab'); for(var i=0;i<tabs.length;i++){ tabs[i].addEventListener('click',function(){ for(var j=0;j<tabs.length;j++){tabs[j].classList.remove('on');document.getElementById('p'+j).classList.remove('on');} this.classList.add('on');$('p'+this.getAttribute('data-p')).classList.add('on'); setTimeout(resize,60); }); } // architecture toggle var vidIds=['gVidT','gVidIn','gVidArrow','gVidOut','gTrunk']; function setArch(train){ for(var i=0;i<vidIds.length;i++){ var el=$(vidIds[i]); if(!el) continue; el.setAttribute('class', train?'lit':'dim'); } $('tTrain').classList.toggle('on',train); $('tInfer').classList.toggle('on',!train); $('archHd').textContent = train ? 'Навчання — спільне усунення шуму з відео та дій' : 'Інференс — реактивна політика, відеогілка не використовується'; $('outNote').textContent = train ? 'зіставлення потоків · передбачення швидкості' : 'майбутнє відео не генерується й не враховується'; $('archNote').innerHTML = train ? '<b>Навчання.</b> Відеовтрата та втрата дій мають спільний стрижень і налаштовуються як два окремі маргінальні поля швидкості в межах зіставлення потоків.' : '<b>Інференс.</b> Мережа дій ніколи не отримує зашумлений латент відео як аргумент. Вона все одно звертається до <b>контекстних</b> відеотокенів, тому політика залишається реактивною та працює в реальному часі.'; setTimeout(resize,60); } $('tTrain').addEventListener('click',function(){setArch(true);}); $('tInfer').addEventListener('click',function(){setArch(false);}); // ladder builders function buildLadder(host,labels,onPick){ var h=$(host); h.innerHTML=''; labels.forEach(function(l,i){ var b=document.createElement('button'); b.className='rung'+(i===0?' on':''); b.textContent=l; b.addEventListener('click',function(){ var kids=h.querySelectorAll('.rung'); for(var k=0;k<kids.length;k++)kids[k].classList.remove('on'); b.classList.add('on'); onPick(i); }); h.appendChild(b); }); } function selectRung(host,i){ var kids=$(host).querySelectorAll('.rung'); for(var k=0;k<kids.length;k++)kids[k].classList.toggle('on',k===i); } // panel 1 function render1(i){ $('r1lbl').textContent=LAD[i]; $('m1a').textContent=D.h.mse[i].toFixed(3); $('f1a').style.width=inv(D.h.mse[i],0.050,0.064)+'%'; $('m1b').textContent=D.h.l1[i].toFixed(3); $('f1b').style.width=inv(D.h.l1[i],0.124,0.142)+'%'; $('m1c').textContent=D.h.a1[i].toFixed(3); $('f1c').style.width=pct(D.h.a1[i],0.014,0.028)+'%'; $('m1d').textContent=D.h.a5[i].toFixed(2); $('f1d').style.width=pct(D.h.a5[i],0.38,0.48)+'%'; ['m1a','m1b','m1c','m1d'].forEach(function(id){$(id).classList.toggle('good',i===3);}); } buildLadder('lad1',LAD,render1); render1(0); // panel 2 function render2(i){ $('r2lbl').textContent=LAD[i]; $('m2a').textContent=D.r.mse[i].toFixed(3); $('f2a').style.width=inv(D.r.mse[i],0.110,0.190)+'%'; $('m2b').textContent=D.r.a5[i].toFixed(3); $('f2b').style.width=pct(D.r.a5[i],0.050,0.170)+'%'; ['m2a','m2b'].forEach(function(id){$(id).classList.toggle('good',i===3);}); $('b2m').style.width=D.p.mean[i]+'%'; $('n2m').textContent=D.p.mean[i]+'%'; $('b2l').style.width=Math.max(1,D.p.lock[i])+'%'; $('n2l').textContent=D.p.lock[i]+'%'; $('b2b').style.width=D.p.cap[i]+'%'; $('n2b').textContent=D.p.cap[i]+'%'; $('b2d').style.width=D.p.drink[i]+'%'; $('n2d').textContent=D.p.drink[i]+'%'; var hot=(i===3)?'#E8B84B':'#8A8F94'; $('b2l').style.background=hot; $('b2b').style.background=(i>=2)?'#E8B84B':'#8A8F94'; $('b2d').style.background=(i>=2)?'#E8B84B':'#8A8F94'; } buildLadder('lad2',LAD,render2); render2(0); // panel 3 function render3(i){ $('m3a').textContent=V.mse[i].toFixed(3); $('f3a').style.width=inv(V.mse[i],0.100,0.350)+'%'; $('m3a').classList.toggle('good',i===3); $('b3r').style.width=V.robot[i]+'%'; $('n3r').textContent=V.robot[i]+'%'; $('b3h').style.width=V.human[i]+'%'; $('n3h').textContent=V.human[i]+'%'; } buildLadder('lad3',VID,render3); render3(0); // panel 4/5 comparison function render4(on){ $('b4a').style.width=on?'50%':'0'; $('b4b').style.width=on?'77.5%':'0'; $('b4c').style.width=on?'50%':'0'; $('b4d').style.width=on?'56%':'0'; $('b5a').style.width=on?'100%':'0'; $('b5b').style.width=on?'100%':'0'; $('b5c').style.width=on?'46%':'0'; $('b5d').style.width=on?'87%':'0'; $('b6a').style.width=on?'100%':'0'; $('b6b').style.width=on?'1.1%':'0'; } render4(true); // autoplay helpers function autoplay(host,render,btn,n){ var busy=false; $(btn).addEventListener('click',function(){ if(busy)return; busy=true; var i=0; selectRung(host,0); render(0); var t=setInterval(function(){ i++; if(i>=n){clearInterval(t);busy=false;return;} selectRung(host,i); render(i); },900); }); } autoplay('lad1',render1,'play1',4); autoplay('lad2',render2,'play2',4); autoplay('lad3',render3,'play3',4); $('play4').addEventListener('click',function(){render4(false);setTimeout(function(){render4(true);},260);}); // resize function resize(){ try{ var h=document.body.offsetHeight+40; if(window.parent&&window.parent!==window){ window.parent.postMessage({mtpFrame:'dyna2',height:h},'*'); } }catch(e){} } window.addEventListener('load',function(){resize();setTimeout(resize,400);}); window.addEventListener('resize',resize); setTimeout(resize,120); })(); </script> </body> </html> ">

Основні висновки

  • Dyna-2 — це модель світової дії, попередньо навчена на понад 1 млн годин відео від першої особи, знятого людьми.
  • Закони масштабування справджуються на відкладених людських даних у чотирьох порядках величини.
  • Уперше цей закон переноситься в режимі zero-shot на роботизовані дані, яких не було в попередньому навчанні.
  • Спільне навчання на відео, а не дані дій, забезпечує узагальнення між різними втіленнями.
  • Немає ваг і API: сьогодні розгортання означає роботизовану комірку Dyna, якою керує постачальник.

Прочитайте повний технічний звіт: Dyna-2: Закон масштабування на 1 мільйон годин для моделей світової дії і оголошення. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини