Dyna Robotics выпустила Dyna-2 — модель мира и действий для манипуляций роботами. Она была предварительно обучена более чем на одном миллионе часов видео от первого лица, снятого людьми. Это примерно 170 лет непрерывного бодрствования. Обучение роботов ограничивалось данными с разметкой действий, которые необходимо целенаправленно создавать с помощью телеуправления. Dyna-2 проверяет, могут ли обычные видео с участием людей заменить такие данные. Исследовательская команда подготовила шкалу данных от 1 000 до 1 000 000 часов и измерила эффект масштабирования. Получены три результата: закон масштабирования для данных о людях, первый перенос этого закона на ранее не виденные данные о роботах и свидетельства того, что именно предсказание видео обеспечивает этот перенос.
Можно ли использовать её в реальных условиях?
Да, но как систему, эксплуатируемую поставщиком, а не как загружаемые веса. Dyna Robotics не объявляла о выпуске публичного чекпойнта, API или лицензии для Dyna-2. Сегодня развертывание означает покупку роботизированной ячейки Dyna, а не самостоятельный запуск модели.
- Какие компании: роботы Dyna-1 уже работают в гостиницах, ресторанах и прачечных, согласно объявлению компании от 10 августа 2026 года. Это указывает на операторов сервисных предприятий среднего сегмента и многоплощадочные компании с повторяющимися задачами по манипуляциям со стационарными объектами. Решение не предназначено для индивидуальных разработчиков или исследовательских лабораторий, которым нужен локальный инференс.
- Отрасли: гостиничный бизнес, коммерческие прачечные, общественное питание, лёгкая сборка и комплектация, уборка объектов.
- Применения: 14 задач постобучения напрямую соответствуют реальной работе: очистка подносов от мусора, комплектация аптечек, сборка контейнеров, раскладывание еды, завязывание верёвок, подготовка вешалок и целевой поиск напитков в холодильнике.
Что такое Dyna-2
Dyna-2 — это модель мира и действий (world-action model, WAM): одна генеративная модель, которая на основе архитектуры видеодиффузии совместно или раздельно очищает от шума будущее видео и будущий фрагмент действий. Она была предварительно обучена более чем на одном миллионе часов видео от первого лица, снятого людьми, что примерно соответствует 170 годам непрерывного бодрствования.
Архитектурно это смесь трансформеров. Видео и действия токенизируются отдельно и получают собственные стеки слоёв DiT, которые обращаются друг к другу. Проприоцепция напрямую поступает в трансформер действий. Для видеотокенов используется каузальная маскировка; токены действий используют двунаправленное самовнимание и обращаются к видеотокенам контекста. Видеотокены выполняют перекрёстное внимание к тексту, но текст напрямую не влияет на токены действий.
В обучении используется сопоставление потоков (flow matching). Потери для видео и действий используют общий ствол как два отдельных маргинальных поля скоростей. Поскольку сеть действий никогда не получает зашумлённое скрытое представление видео в качестве аргумента, политика при инференсе остаётся реактивной — она не генерирует предсказанное будущее видео и не обращается к нему. Трансформер действий намеренно сделан более мелким и подключается к видеопотоку на раннем этапе, что, по словам команды, повышает задержку в режиме реального времени без потери производительности.
Три результата масштабирования
Dyna Robotics выделила вложенные подмножества объёмом ровно 1 000, 10 000, 100 000 и 1 000 000 часов, сохранив одинаковые пропорции от каждого источника. Больший бюджет лишь добавляет данные, поэтому различия между кривыми нельзя объяснить сдвигом распределения. Для оценки каждого уровня используется фиксированный независимый набор валидации объёмом 100 часов.
- Закон масштабирования сохраняется для данных о людях вплоть до одного миллиона часов: все четыре метрики улучшаются монотонно и соответствуют степенным законам: MSE на отложенных данных = 0.0691·D^-0.0184 (R²=0.919), accuracy@0.5 = 0.357·D^+0.0203 (R²=0.865). На всей шкале accuracy@0.1 растёт на 51%, тогда как MSE улучшается на 12%.
- Этот закон переносится на данные о роботах, которые модель никогда не видела: те же чекпойнты оценивались в режиме zero-shot на 39 задачах на двух стационарных бимануальных платформах YAM — 12 внутренних задачах и 27 задачах из xdof ABC. MSE действий в режиме zero-shot = 0.306·D^-0.0713 (R²=0.884). Команда сообщает о переломе кривой между 10 000 и 100 000 часами.
- Целевая функция имеет значение, а видео представляет собой отдельную ось масштабирования: совместное очищение от шума превзошло обучение только по действиям на 39 из 39 задач при каждом масштабе действий. При фиксированном объёме данных с разметкой действий в 50 000 часов добавление часов только видео снижает MSE робота в режиме zero-shot с 0.340 до 0.120. Примечательно, что ошибка на отложенных человеческих данных не уменьшается — преимущество видео заключается именно в обобщении между различными воплощениями.
Результаты на роботах
Каждый уровень был дообучен на 14 задачах, используя не более 10 часов данных робота на задачу, для трёх типов воплощений: 6-степенные руки YAM с захватами с параллельными губками, те же руки с 20-степенными ловкими кистями WUJI-2 и прототипом полуантропоморфного робота. На этапе дообучения использовались только данные роботов — без выравнивания человек–робот и без совместного обучения.
Средний нормализованный показатель вырос с 20% → 28% → 45% → 53% по всей шкале; при объёме в один миллион часов был достигнут лучший результат в 9 из 14 задач. Поворот ключа в запираемом ящике — пороговый случай: показатель составлял 0% вплоть до 100 000 часов, а затем достиг 90%. Откручивание крышки бутылки обучалось примерно на 10 минутах демонстраций, но показатель всё равно вырос до 50%.
По сравнению с Dyna-1 — производственной VLA-моделью компании, инициализированной из Qwen3-VL-4B, — ранняя версия Dyna-2 достигла коэффициента успешности 1.55× и оценки 1.12×; показатели рассчитаны по 7 задачам и 3 чекпойнтам. На ранее не виденных площадках клиентов Dyna-2 соответствовала производственным критериям в 87% случаев против 46% у Dyna-1, хотя внутри компании обе модели показывают почти 100% успешных запусков. Кроме того, конвейер дистилляции сокращает время сэмплирования видео с 10 203 мс до 110 мс на одном H100.
Интерактивное объяснение
АНИМИРОВАТЬ ШКАЛУ</button>
<div class="card" style="margin-top:14px">
<div class="cardhd">Отложенные данные о людях · уровень <span id="r1lbl">1k</span> часов</div>
<div class="mgrid">
<div class="metric"><div class="mlab">Отложенная MSE ↓</div><div class="mval" id="m1a">0.062</div><div class="mbar"><div class="mfill" id="f1a"></div></div><div class="mnote">D<sup>-0.0184</sup> · R²=0.919</div></div>
<div class="metric"><div class="mlab">Отложенная L1 ↓</div><div class="mval" id="m1b">0.140</div><div class="mbar"><div class="mfill" id="f1b"></div></div><div class="mnote">D<sup>-0.0132</sup> · R²=0.879</div></div>
<div class="metric"><div class="mlab">Точность @0.1 ↑</div><div class="mval" id="m1c">0.017</div><div class="mbar"><div class="mfill" id="f1c"></div></div><div class="mnote">D<sup>+0.0606</sup> · R²=0.926</div></div>
<div class="metric"><div class="mlab">Точность @0.5 ↑</div><div class="mval" id="m1d">0.40</div><div class="mbar"><div class="mfill" id="f1d"></div></div><div class="mnote">D<sup>+0.0203</sup> · R²=0.865</div></div>
</div>
<div class="callout">На всей шкале <b>accuracy@0.1 растёт на 51%</b>, тогда как MSE улучшается на 12%. Точность при строгом пороге — показатель точности движений — сильнее всего выигрывает от масштабирования.</div>
</div>
</div>
<!-- 03 ОТ ЧЕЛОВЕКА К РОБОТУ -->
<div class="panel" id="p2">
<p class="lead">Те же чекпойнты оценивались на <b>39 роботизированных задачах</b> на двух стационарных бимануальных платформах YAM — 12 внутренних и 27 из xdof ABC — при <b>нулевом количестве траекторий роботов в предварительном обучении</b>. Затем каждый уровень дообучался на 14 задачах, используя не более 10 часов данных робота на задачу; применялись только данные робота, без выравнивания человек–робот.</p>
<div class="ladder" id="lad2"></div>
<button class="play" id="play2"> АНИМИРОВАТЬ ШКАЛУ</button>
<div class="card" style="margin-top:14px">
<div class="cardhd">Zero-shot на ранее не виденных данных роботов · уровень <span id="r2lbl">1k</span> часов</div>
<div class="mgrid" style="grid-template-columns:repeat(2,1fr)">
<div class="metric"><div class="mlab">MSE действий zero-shot ↓</div><div class="mval" id="m2a">0.180</div><div class="mbar"><div class="mfill" id="f2a"></div></div><div class="mnote">D<sup>-0.0713</sup> · R²=0.884</div></div>
<div class="metric"><div class="mlab">Точность zero-shot@0.5 ↑</div><div class="mval" id="m2b">0.067</div><div class="mbar"><div class="mfill" id="f2b"></div></div><div class="mnote">D<sup>+0.139</sup> · R²=0.918</div></div>
</div>
</div>
<div class="card">
<div class="cardhd">Дообучение на физическом роботе · 14 задач, 3 воплощения</div>
<div class="brow"><div class="blab">Средний нормализованный показатель</div><div class="btrack"><div class="bfill" id="b2m" style="background:#E8B84B"></div></div><div class="bnum" id="n2m">20%</div></div>
<div class="brow"><div class="blab">Поворот ключа в ящике</div><div class="btrack"><div class="bfill" id="b2l" style="background:#8A8F94"></div></div><div class="bnum" id="n2l">0%</div></div>
<div class="brow"><div class="blab">Откручивание крышки бутылки</div><div class="btrack"><div class="bfill" id="b2b" style="background:#8A8F94"></div></div><div class="bnum" id="n2b">10%</div></div>
<div class="brow"><div class="blab">Поиск напитка</div><div class="btrack"><div class="bfill" id="b2d" style="background:#8A8F94"></div></div><div class="bnum" id="n2d">58%</div></div>
<div class="callout"><b>Поворот ключа в запираемом ящике</b> — пороговый случай: ни один чекпойнт вплоть до 100 000 часов не смог повернуть ключ. При одном миллионе часов ключ поворачивался в 90% случаев. <b>Откручивание крышки бутылки</b> обучалось примерно на 10 минутах демонстраций робота с использованием двух ловких кистей с 20 степенями свободы.</div>
</div>
</div>
<!-- 04 ОСЬ ВИДЕО -->
<div class="panel" id="p3">
<p class="lead">Зафиксируем данные людей с разметкой действий на уровне <b>50 000 часов</b> и добавим только данные для предсказания видео без разметки действий. Ошибка робота в режиме zero-shot продолжает снижаться. Ошибка на отложенных <i>человеческих</i> данных не улучшается — преимущество видео заключается именно в <b>обобщении между различными воплощениями</b>.</p>
<div class="ladder" id="lad3"></div>
<button class="play" id="play3"> АНИМИРОВАТЬ ОСЬ ВИДЕО</button>
<div class="card" style="margin-top:14px">
<div class="cardhd">Добавленные часы только видео · данные действий зафиксированы на уровне 50 тыс. часов</div>
<div class="metric" style="margin-bottom:14px"><div class="mlab">MSE действий робота zero-shot ↓</div><div class="mval" id="m3a">0.340</div><div class="mbar"><div class="mfill" id="f3a"></div></div><div class="mnote">От 0 до 50 тыс. часов видео: MSE снижается с 0.340 до 0.120</div></div>
<div class="brow"><div class="blab">Робот (не виден ранее)</div><div class="btrack"><div class="bfill" id="b3r" style="background:#E8B84B"></div></div><div class="bnum" id="n3r">100%</div></div>
<div class="brow"><div class="blab">Человек (внутри домена)</div><div class="btrack"><div class="bfill" id="b3h" style="background:#8A8F94"></div></div><div class="bnum" id="n3h">100%</div></div>
<div class="legend"><span><span class="dot" style="background:#E8B84B"></span>Ошибка робота, % от собственного показателя без видео в каждом домене (меньше = лучше)</span><span><span class="dot" style="background:#8A8F94"></span>Ошибка человека, та же нормализация</span></div>
<div class="callout">При 50 тыс. часов видео показатель робота снижается до <b>34%</b> от исходного уровня без видео, тогда как показатель человека составляет <b>104%</b> — немного хуже. Повторение эксперимента при 250 тыс. часов действий и добавлении от 0 до 750 тыс. часов видео снижает MSE с 0.10 до 0.084.</div>
</div>
<div class="card">
<div class="cardhd">Абляция целевой функции · zero-shot на всех 39 роботизированных задачах</div>
<p class="lead" style="margin-bottom:12px;font-size:11.5px">Совместное очищение от шума превзошло обучение только по действиям на <b>39 из 39 задач при каждом масштабе действий</b>. Обучение только по действиям сильно переобучается по мере роста объёма данных. Лишь схема совместного обучения с видео продолжает улучшаться при масштабировании данных действий.</p>
</div>
</div>
<!-- 05 WAM ПРОТИВ VLA -->
<div class="panel" id="p4">
<p class="lead">Ранняя версия Dyna-2 сравнивалась с <b>Dyna-1</b> — производственной VLA-моделью Dyna, инициализированной из Qwen3-VL-4B, при одинаковых данных предварительного и постобучения и гиперпараметрах; для каждой модели использовались три разных чекпойнта предварительного обучения. Dyna Robotics рассматривает этот результат как <b>нижнюю оценку</b> возможностей WAM: конвейер был настроен под VLA.</p>
<button class="play" id="play4"> ЗАПУСТИТЬ СРАВНЕНИЕ</button>
<div class="card" style="margin-top:14px">
<div class="cardhd">Объединённые результаты по 7 задачам × 3 чекпойнтам · VLA нормализована до 1.00×</div>
<div class="brow"><div class="blab">Успешность VLA</div><div class="btrack"><div class="bfill" id="b4a" style="background:#4A4F54"></div></div><div class="bnum" id="n4a">1.00×</div></div>
<div class="brow"><div class="blab">Успешность WAM</div><div class="btrack"><div class="bfill" id="b4b" style="background:#E8B84B"></div></div><div class="bnum" id="n4b">1.55×</div></div>
<div class="brow"><div class="blab">Оценка VLA</div><div class="btrack"><div class="bfill" id="b4c" style="background:#4A4F54"></div></div><div class="bnum" id="n4c">1.00×</div></div>
<div class="brow"><div class="blab">Оценка WAM</div><div class="btrack"><div class="bfill" id="b4d" style="background:#E8B84B"></div></div><div class="bnum" id="n4d">1.12×</div></div>
<div class="callout">В очном сравнении при фиксированных чекпойнте и задаче ранняя Dyna-2 победила в <b>65%</b> случаев, Dyna-1 — в 29%, ещё 6% завершились вничью.</div>
</div>
<div class="card">
<div class="cardhd">Zero-shot на реальных площадках клиентов · производственные критерии прохождения</div>
<div class="brow"><div class="blab">Dyna-1 внутри компании</div><div class="btrack"><div class="bfill" id="b5a" style="background:#4A4F54"></div></div><div class="bnum" id="n5a">100%</div></div>
<div class="brow"><div class="blab">Dyna-2 внутри компании</div><div class="btrack"><div class="bfill" id="b5b" style="background:#4A4F54"></div></div><div class="bnum" id="n5b">100%</div></div>
<div class="brow"><div class="blab">Dyna-1 на площадке</div><div class="btrack"><div class="bfill" id="b5c" style="background:#8A8F94"></div></div><div class="bnum" id="n5c">46%</div></div>
<div class="brow"><div class="blab">Dyna-2 на площадке</div><div class="btrack"><div class="bfill" id="b5d" style="background:#E8B84B"></div></div><div class="bnum" id="n5d">87%</div></div>
<div class="callout">Внутри компании обе модели проходят проверку почти в 100% случаев. На площадках клиентов, которых они ранее не видели, разрыв составляет <b>41 процентный пункт</b> при одинаковом бюджете постобучения. Оценку проводили операторы на площадках, не участвовавшие в разработке моделей.</div>
</div>
<div class="card">
<div class="cardhd">Одношаговая генерация видео · один H100</div>
<div class="brow"><div class="blab">Учитель, 100 NFE</div><div class="btrack"><div class="bfill" id="b6a" style="background:#4A4F54"></div></div><div class="bnum" id="n6a">10203ms</div></div>
<div class="brow"><div class="blab">Дистиллированная модель, 1 NFE</div><div class="btrack"><div class="bfill" id="b6b" style="background:#E8B84B"></div></div><div class="bnum" id="n6b">110ms</div></div>
<div class="callout">Примерно <b>в 90 раз быстрее</b> для трёхсекундного видео манипуляции с трёх ракурсов. Одношаговая модель сохраняет FVD на уровне 121 и мерцание на уровне 1.94 против 2.37 у реально записанного материала; движение составляет 75% от реального уровня, но всё ещё уступает полной модели-учителю.</div>
</div>
</div>
<div class="src">
Все приведённые выше показатели взяты из технического отчёта Dyna Robotics, <a href="https://www.dyna.co/dyna-2" target="_blank" rel="noopener">Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models</a> (август 2026 года). Интерактивное объяснение создано <a href="https://www.marktechpost.com" target="_blank" rel="noopener">Marktechpost</a>. Ни одно значение не оценивалось и не интерполировалось.
</div>
</div>
<script>
(function(){
var LAD=['1k','10k','100k','1M'];
var D={
h:{mse:[0.062,0.057,0.056,0.054],l1:[0.140,0.131,0.129,0.127],a1:[0.017,0.021,0.024,0.026],a5:[0.40,0.44,0.45,0.47]},
r:{mse:[0.180,0.174,0.124,0.117],a5:[0.067,0.074,0.136,0.159]},
p:{mean:[20,28,45,53],lock:[0,0,0,90],cap:[10,10,40,50],drink:[58,75,83,83]}
};
var VID=['0','1k','10k','50k'];
var V={mse:[0.340,0.245,0.170,0.120],robot:[100,72,50,34],human:[100,101,103,104]};
function $(id){return document.getElementById(id);}
function pct(v,lo,hi){var p=(v-lo)/(hi-lo)*100;return Math.max(3,Math.min(100,p));}
function inv(v,lo,hi){return pct(hi-v+lo,lo,hi);}
// вкладки
var tabs=document.querySelectorAll('.tab');
for(var i=0;i<tabs.length;i++){
tabs[i].addEventListener('click',function(){
for(var j=0;j<tabs.length;j++){tabs[j].classList.remove('on');document.getElementById('p'+j).classList.remove('on');}
this.classList.add('on');$('p'+this.getAttribute('data-p')).classList.add('on');
setTimeout(resize,60);
});
}
// переключатель архитектуры
var vidIds=['gVidT','gVidIn','gVidArrow','gVidOut','gTrunk'];
function setArch(train){
for(var i=0;i<vidIds.length;i++){
var el=$(vidIds[i]); if(!el) continue;
el.setAttribute('class', train?'lit':'dim');
}
$('tTrain').classList.toggle('on',train);
$('tInfer').classList.toggle('on',!train);
$('archHd').textContent = train ? 'Обучение — совместное очищение видео и действий' : 'Инференс — реактивная политика, видеоветвь не используется';
$('outNote').textContent = train ? 'сопоставление потоков · предсказание скорости' : 'будущее видео не генерируется и не используется';
$('archNote').innerHTML = train
? '<b>Обучение.</b> Потери для видео и действий используют общий ствол и подгоняются как два отдельных маргинальных поля скоростей в рамках сопоставления потоков.'
: '<b>Инференс.</b> Сеть действий никогда не получает зашумлённое скрытое представление видео в качестве аргумента. Она по-прежнему обращается к токенам <b>контекстного</b> видео, поэтому политика остаётся реактивной и работает в реальном времени.';
setTimeout(resize,60);
}
$('tTrain').addEventListener('click',function(){setArch(true);});
$('tInfer').addEventListener('click',function(){setArch(false);});
// построители шкал
function buildLadder(host,labels,onPick){
var h=$(host); h.innerHTML='';
labels.forEach(function(l,i){
var b=document.createElement('button');
b.className='rung'+(i===0?' on':''); b.textContent=l;
b.addEventListener('click',function(){
var kids=h.querySelectorAll('.rung');
for(var k=0;k<kids.length;k++)kids[k].classList.remove('on');
b.classList.add('on'); onPick(i);
});
h.appendChild(b);
});
}
function selectRung(host,i){
var kids=$(host).querySelectorAll('.rung');
for(var k=0;k<kids.length;k++)kids[k].classList.toggle('on',k===i);
}
// панель 1
function render1(i){
$('r1lbl').textContent=LAD[i];
$('m1a').textContent=D.h.mse[i].toFixed(3); $('f1a').style.width=inv(D.h.mse[i],0.050,0.064)+'%';
$('m1b').textContent=D.h.l1[i].toFixed(3); $('f1b').style.width=inv(D.h.l1[i],0.124,0.142)+'%';
$('m1c').textContent=D.h.a1[i].toFixed(3); $('f1c').style.width=pct(D.h.a1[i],0.014,0.028)+'%';
$('m1d').textContent=D.h.a5[i].toFixed(2); $('f1d').style.width=pct(D.h.a5[i],0.38,0.48)+'%';
['m1a','m1b','m1c','m1d'].forEach(function(id){$(id).classList.toggle('good',i===3);});
}
buildLadder('lad1',LAD,render1); render1(0);
// панель 2
function render2(i){
$('r2lbl').textContent=LAD[i];
$('m2a').textContent=D.r.mse[i].toFixed(3); $('f2a').style.width=inv(D.r.mse[i],0.110,0.190)+'%';
$('m2b').textContent=D.r.a5[i].toFixed(3); $('f2b').style.width=pct(D.r.a5[i],0.050,0.170)+'%';
['m2a','m2b'].forEach(function(id){$(id).classList.toggle('good',i===3);});
$('b2m').style.width=D.p.mean[i]+'%'; $('n2m').textContent=D.p.mean[i]+'%';
$('b2l').style.width=Math.max(1,D.p.lock[i])+'%'; $('n2l').textContent=D.p.lock[i]+'%';
$('b2b').style.width=D.p.cap[i]+'%'; $('n2b').textContent=D.p.cap[i]+'%';
$('b2d').style.width=D.p.drink[i]+'%'; $('n2d').textContent=D.p.drink[i]+'%';
var hot=(i===3)?'#E8B84B':'#8A8F94';
$('b2l').style.background=hot; $('b2b').style.background=(i>=2)?'#E8B84B':'#8A8F94';
$('b2d').style.background=(i>=2)?'#E8B84B':'#8A8F94';
}
buildLadder('lad2',LAD,render2); render2(0);
// панель 3
function render3(i){
$('m3a').textContent=V.mse[i].toFixed(3); $('f3a').style.width=inv(V.mse[i],0.100,0.350)+'%';
$('m3a').classList.toggle('good',i===3);
$('b3r').style.width=V.robot[i]+'%'; $('n3r').textContent=V.robot[i]+'%';
$('b3h').style.width=V.human[i]+'%'; $('n3h').textContent=V.human[i]+'%';
}
buildLadder('lad3',VID,render3); render3(0);
// сравнение панелей 4/5
function render4(on){
$('b4a').style.width=on?'50%':'0'; $('b4b').style.width=on?'77.5%':'0';
$('b4c').style.width=on?'50%':'0'; $('b4d').style.width=on?'56%':'0';
$('b5a').style.width=on?'100%':'0'; $('b5b').style.width=on?'100%':'0';
$('b5c').style.width=on?'46%':'0'; $('b5d').style.width=on?'87%':'0';
$('b6a').style.width=on?'100%':'0'; $('b6b').style.width=on?'1.1%':'0';
}
render4(true);
// вспомогательные функции автозапуска
function autoplay(host,render,btn,n){
var busy=false;
$(btn).addEventListener('click',function(){
if(busy)return; busy=true; var i=0;
selectRung(host,0); render(0);
var t=setInterval(function(){
i++; if(i>=n){clearInterval(t);busy=false;return;}
selectRung(host,i); render(i);
},900);
});
}
autoplay('lad1',render1,'play1',4);
autoplay('lad2',render2,'play2',4);
autoplay('lad3',render3,'play3',4);
$('play4').addEventListener('click',function(){render4(false);setTimeout(function(){render4(true);},260);});
// изменение размера
function resize(){
try{
var h=document.body.offsetHeight+40;
if(window.parent&&window.parent!==window){
window.parent.postMessage({mtpFrame:'dyna2',height:h},'*');
}
}catch(e){}
}
window.addEventListener('load',function(){resize();setTimeout(resize,400);});
window.addEventListener('resize',resize);
setTimeout(resize,120);
})();
</script>
</body>
</html>
">
Ключевые выводы
- Dyna-2 — модель мира и действий, предварительно обученная на более чем 1 млн часов видео от первого лица, снятого людьми.
- Законы масштабирования сохраняются на отложенных данных о людях в диапазоне четырёх порядков величины.
- Впервые этот закон переносится в режиме zero-shot на данные роботов, не встречавшиеся при предварительном обучении.
- Именно совместное обучение с видео, а не данные действий, обеспечивает обобщение между различными воплощениями.
- Ни весов, ни API: сегодня развертывание означает использование роботизированной ячейки Dyna, эксплуатируемой поставщиком.
Читайте полный технический отчёт: Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models и объявление. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.