Black Forest Labs выпустила FLUX 3 Action: 7B-модель действий в мире с открытыми весами, превзошедшая RoboLab-120
Black Forest Labs (BFL), лаборатория, стоящая за моделями изображений FLUX, выпустила FLUX 3 Action. Это модель действий мира (WAM) с 7 млрд параметров и открытыми весами для управления роботами. Модель считывает кадры с камеры, состояние робота и текстовую инструкцию. Затем она одновременно предсказывает будущие видеокадры и следующий фрагмент действий. В рейтинге RoboLab-120 она занимает первое место с результатом успешного выполнения задач 42,92%.
Можно ли её развернуть? Да, при определённых условиях. Политике DROID требуется около 32 ГБ видеопамяти в BF16 на H200. Она работает на картах с 24 ГБ памяти при квантовании FP8 и выгрузке текстового энкодера. Лицензия FLUX Kommunity разрешает некоммерческое использование.
На какой компромисс нацелена FLUX 3 Action
Открытые политики для роботов обычно требуют сделать выбор. WAM, такие как Cosmos 3 Nano от NVIDIA, лидируют в RoboLab с результатом 36,8%, но предсказание видео требует больших вычислительных затрат. VLA, такие как π0.5, работают быстро, но достигают лишь 28,0%. На B200 в BFL измерили, что Cosmos 3 Nano (FP8) требует примерно в 4,7 раза больше времени на обработку, чем π0.5 (BF16), на каждую секунду движения робота.
FLUX 3 Action сохраняет совместное предсказание видео и действий. Вместо этого BFL сокращает разрыв в скорости за счёт уменьшения базовой модели и дистилляции.
Архитектура и обучение
FLUX 3 Action создана на основе мультимодальной базовой модели FLUX 3. Для предварительного обучения использовались данные изображений, видео и аудио, причём на видео пришлось более 95% обучающих токенов. Текст, видео и состояние робота кодируются в токены. Будущие токены базовой модели декодируются в видеокадры, а токены действий — в действия робота.
На этапе промежуточного обучения данные предварительного обучения (36,95% образцов) смешивались с видео, согласованным с действиями (63,05%). Данные действий включали игровые записи, видео с рук людей от первого лица, ручные захваты и телеприсутствие для 14 типов роботов. В большинстве робототехнических данных используется общее 50-мерное пространство действий концевого эффектора под названием EE50.
Предварительное обучение здесь имеет большое значение. Без него обучение только на DROID давало результат менее 1% в RoboLab. С предварительным обучением тот же протокол достиг 11,6%.
Результаты тестирования
RoboLab-120 включает 120 задач на столе в Isaac Sim, по 10 испытаний каждой задачи на установке Franka в стиле DROID.
| Модель | Тип | Параметры | RoboLab-120 |
|---|---|---|---|
| FLUX 3 Action | WAM | 7B | 42,92% |
| Cosmos3-Nano-Policy | WAM | 16B | 36,8% |
| π0.5 | VLA | 3,3B | 28,0% |
| DreamZero | WAM | 14B | 25,7% |
| GR00T N1.6 | VLA | 3B | 7,2% |
Это преимущество в 6,1 процентного пункта при на 56% меньшем числе параметров по сравнению с Cosmos 3 Nano. Показатель 42,92% — это значение в рейтинге. Средний результат BFL по нескольким с00ядам для контрольной точки FP8 с дистилляцией guidance составляет 42,24% ± 0,36.
Результаты на реальном оборудовании показывают ту же тенденцию. Positronic Robotics провела слепое тестирование на манипуляторе Franka с 10 задачами DROID и 3 попытками для каждой. FLUX 3 Action успешно выполнила 28 из 30 попыток (93,3%). Cosmos 3 Nano получила результат 27/30, DreamZero — 20/30, а π0.5 — 13/30.
3 контрольные точки, 3 уровня скорости
BFL выпускает политику DROID в 3 вариантах, каждый в BF16 и FP8:
- Базовая: 4 шага семплирования с раздельным guidance (CFG видео — 4, CFG действий — 1).
- С дистилляцией guidance: второй проход guidance удалён, скорость увеличена в 1,8–2 раза, а результат — на 0,6–1,08 п.п. выше.
- С дистилляцией шагов: 1 шаг семплирования, скорость увеличена в 3,15–4 раза, при этом успешность снижается на 3,51–4,32 п.п.
По сравнению с Cosmos 3 Nano в FP8 базовая контрольная точка и контрольная точка с дистилляцией guidance работают в 1,52–3,95 раза быстрее на потребительских, рабочих станциях и серверных GPU.
Каждый вызов выдаёт 32 действия с частотой 15 Гц, то есть 2,13 секунды движения. π0.5 выдаёт 1,0 секунды на вызов. Поэтому BFL указывает скорость как коэффициент работы в реальном времени, а не задержку одного вызова. В FP8 контрольная точка с дистилляцией шагов превосходит π0.5 в 1,34–2,28 раза на GPU рабочих станций и серверов. На RTX 5090 она работает медленнее, чем π0.5.
Сочетание быстрой политики с рассуждающей моделью
BFL также протестировала гибридное управление с GPT 6 Astra, следуя методике Su et al. (2026). Рассуждающая модель может выполнить, отредактировать или заменить действия, предсказанные политикой. Связка FLUX 3 Action и низкой интенсивности рассуждений решила 90% эпизодов при стоимости $8.77 и времени 8m 08s на один успешный результат. Одна Astra при максимальной интенсивности решила 100% задач, но стоимость составила $13.47, а время на один успешный результат — 16m 23s.
Дообучение, LeRobot и Jetson
Команды, занимающиеся ИИ, могут дообучать FLUX 3 Action на собственных демонстрациях. BFL опубликовала рецепт для DROID и рецепт LoRA для SO-101. В документации показано, как навык захвата и перемещения объектов для SO-101 был изучен примерно на 200 демонстрациях. Совместно с NVIDIA BFL нативно интегрировала модель в Hugging Face LeRobot; также поддерживается периферийное развертывание на NVIDIA Jetson. В документации также приведены примеры игры и моделирования дронов.
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors
repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)Модель выдаёт целевые значения для сочленений без встроенных ограничений скорости, усилия или рабочего пространства. Ваше приложение должно обеспечивать соблюдение этих ограничений.
Основные выводы
- WAM с 7 млрд параметров занимает первое место в RoboLab-120 с результатом 42,92%.
- Опережает Cosmos 3 Nano на 6,1 п.п. при на 56% меньшем числе параметров.
- В FP8 работает до 3,95 раза быстрее Cosmos 3 Nano.
- Планирует 2,13 с движения за вызов против 1,0 с у π0.5.
- Веса, код и рецепты выпускаются по лицензии FLUX Kommunity.
Ознакомьтесь с полным техническим отчётом, весами модели, репозиторием на GitHub и документацией. Вся благодарность исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.