Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Black Forest Labs выпустила FLUX 3 Action: 7B-модель действий в мире с открытыми весами, превзошедшая RoboLab-120

Black Forest Labs (BFL), лаборатория, стоящая за моделями изображений FLUX, выпустила FLUX 3 Action. Это модель действий мира (WAM) с 7 млрд параметров и открытыми весами для управления роботами. Модель считывает кадры с камеры, состояние робота и текстовую инструкцию. Затем она одновременно предсказывает будущие видеокадры и следующий фрагмент действий. В рейтинге RoboLab-120 она занимает первое место с результатом успешного выполнения задач 42,92%.

Можно ли её развернуть? Да, при определённых условиях. Политике DROID требуется около 32 ГБ видеопамяти в BF16 на H200. Она работает на картах с 24 ГБ памяти при квантовании FP8 и выгрузке текстового энкодера. Лицензия FLUX Kommunity разрешает некоммерческое использование.

На какой компромисс нацелена FLUX 3 Action

Открытые политики для роботов обычно требуют сделать выбор. WAM, такие как Cosmos 3 Nano от NVIDIA, лидируют в RoboLab с результатом 36,8%, но предсказание видео требует больших вычислительных затрат. VLA, такие как π0.5, работают быстро, но достигают лишь 28,0%. На B200 в BFL измерили, что Cosmos 3 Nano (FP8) требует примерно в 4,7 раза больше времени на обработку, чем π0.5 (BF16), на каждую секунду движения робота.

FLUX 3 Action сохраняет совместное предсказание видео и действий. Вместо этого BFL сокращает разрыв в скорости за счёт уменьшения базовой модели и дистилляции.

Архитектура и обучение

FLUX 3 Action создана на основе мультимодальной базовой модели FLUX 3. Для предварительного обучения использовались данные изображений, видео и аудио, причём на видео пришлось более 95% обучающих токенов. Текст, видео и состояние робота кодируются в токены. Будущие токены базовой модели декодируются в видеокадры, а токены действий — в действия робота.

На этапе промежуточного обучения данные предварительного обучения (36,95% образцов) смешивались с видео, согласованным с действиями (63,05%). Данные действий включали игровые записи, видео с рук людей от первого лица, ручные захваты и телеприсутствие для 14 типов роботов. В большинстве робототехнических данных используется общее 50-мерное пространство действий концевого эффектора под названием EE50.

Предварительное обучение здесь имеет большое значение. Без него обучение только на DROID давало результат менее 1% в RoboLab. С предварительным обучением тот же протокол достиг 11,6%.

Результаты тестирования

RoboLab-120 включает 120 задач на столе в Isaac Sim, по 10 испытаний каждой задачи на установке Franka в стиле DROID.

МодельТипПараметрыRoboLab-120
FLUX 3 ActionWAM7B42,92%
Cosmos3-Nano-PolicyWAM16B36,8%
π0.5VLA3,3B28,0%
DreamZeroWAM14B25,7%
GR00T N1.6VLA3B7,2%

Это преимущество в 6,1 процентного пункта при на 56% меньшем числе параметров по сравнению с Cosmos 3 Nano. Показатель 42,92% — это значение в рейтинге. Средний результат BFL по нескольким с00ядам для контрольной точки FP8 с дистилляцией guidance составляет 42,24% ± 0,36.

Результаты на реальном оборудовании показывают ту же тенденцию. Positronic Robotics провела слепое тестирование на манипуляторе Franka с 10 задачами DROID и 3 попытками для каждой. FLUX 3 Action успешно выполнила 28 из 30 попыток (93,3%). Cosmos 3 Nano получила результат 27/30, DreamZero — 20/30, а π0.5 — 13/30.

3 контрольные точки, 3 уровня скорости

BFL выпускает политику DROID в 3 вариантах, каждый в BF16 и FP8:

  • Базовая: 4 шага семплирования с раздельным guidance (CFG видео — 4, CFG действий — 1).
  • С дистилляцией guidance: второй проход guidance удалён, скорость увеличена в 1,8–2 раза, а результат — на 0,6–1,08 п.п. выше.
  • С дистилляцией шагов: 1 шаг семплирования, скорость увеличена в 3,15–4 раза, при этом успешность снижается на 3,51–4,32 п.п.

По сравнению с Cosmos 3 Nano в FP8 базовая контрольная точка и контрольная точка с дистилляцией guidance работают в 1,52–3,95 раза быстрее на потребительских, рабочих станциях и серверных GPU.

Каждый вызов выдаёт 32 действия с частотой 15 Гц, то есть 2,13 секунды движения. π0.5 выдаёт 1,0 секунды на вызов. Поэтому BFL указывает скорость как коэффициент работы в реальном времени, а не задержку одного вызова. В FP8 контрольная точка с дистилляцией шагов превосходит π0.5 в 1,34–2,28 раза на GPU рабочих станций и серверов. На RTX 5090 она работает медленнее, чем π0.5.

Сочетание быстрой политики с рассуждающей моделью

BFL также протестировала гибридное управление с GPT 6 Astra, следуя методике Su et al. (2026). Рассуждающая модель может выполнить, отредактировать или заменить действия, предсказанные политикой. Связка FLUX 3 Action и низкой интенсивности рассуждений решила 90% эпизодов при стоимости $8.77 и времени 8m 08s на один успешный результат. Одна Astra при максимальной интенсивности решила 100% задач, но стоимость составила $13.47, а время на один успешный результат — 16m 23s.

Дообучение, LeRobot и Jetson

Команды, занимающиеся ИИ, могут дообучать FLUX 3 Action на собственных демонстрациях. BFL опубликовала рецепт для DROID и рецепт LoRA для SO-101. В документации показано, как навык захвата и перемещения объектов для SO-101 был изучен примерно на 200 демонстрациях. Совместно с NVIDIA BFL нативно интегрировала модель в Hugging Face LeRobot; также поддерживается периферийное развертывание на NVIDIA Jetson. В документации также приведены примеры игры и моделирования дронов.

Копировать кодСкопированоИспользовать другой браузер
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors

repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)

Модель выдаёт целевые значения для сочленений без встроенных ограничений скорости, усилия или рабочего пространства. Ваше приложение должно обеспечивать соблюдение этих ограничений.

Основные выводы

  • WAM с 7 млрд параметров занимает первое место в RoboLab-120 с результатом 42,92%.
  • Опережает Cosmos 3 Nano на 6,1 п.п. при на 56% меньшем числе параметров.
  • В FP8 работает до 3,95 раза быстрее Cosmos 3 Nano.
  • Планирует 2,13 с движения за вызов против 1,0 с у π0.5.
  • Веса, код и рецепты выпускаются по лицензии FLUX Kommunity.

Ознакомьтесь с полным техническим отчётом, весами модели, репозиторием на GitHub и документацией. Вся благодарность исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости