Black Forest Labs пуска FLUX 3 Action: 7B модел за действия в света с отворени тегла, който надминава RoboLab-120
Black Forest Labs (BFL), лабораторията зад моделите за изображения FLUX, пусна FLUX 3 Action. Това е World Action Model (WAM) с 7B параметъра и отворени тегла за управление на роботи. Моделът прочита кадри от камерата, състоянието на робота и текстова инструкция. След това заедно предсказва бъдещи видео кадри и следващия пакет от действия. В класацията RoboLab-120 заема първо място с 42,92% успеваемост на задачите.
Може ли да бъде внедрен? Да, при определени условия. Политиката DROID се нуждае от около 32 GB графична памет в BF16 на H200. Тя работи на карти с 24 GB чрез FP8 квантизация и изнасяне на текстовия енкодер. Лицензът FLUX Kommunity позволява некомерсиална употреба.
Компромисът, към който е насочен FLUX 3 Action
Отворените политики за роботи обикновено налагат избор. WAM моделите като Cosmos 3 Nano на NVIDIA водят в RoboLab с 36,8%, но предсказването на видео е скъпо. VLA моделите като π0.5 са бързи, но достигат само 28,0%. На B200 BFL измери, че Cosmos 3 Nano (FP8) се нуждае от около 4,7 пъти повече време за обработка от π0.5 (BF16) за всяка секунда движение на робота.
FLUX 3 Action запазва съвместното предсказване на видео и действия. Вместо това BFL намалява разликата в скоростта чрез по-малък гръбнак и дестилация.
Архитектура и обучение
FLUX 3 Action е разработен върху мултимодалния гръбнак FLUX 3. Предварителното обучение използва данни за изображения, видео и аудио, като видеото представлява над 95% от обучаващите токени. Текстът, видеото и състоянието на робота се кодират в токени. Бъдещите токени на гръбнака се декодират във видео кадри, а токените за действия — в действия на робота.
Междинното обучение смесва данни от предварителното обучение (36,95% от извадките) с видео, съобразено с действията (63,05%). Данните за действията обхващат записи на игри, егоцентрично видео на човешки ръце, ръчни грайфери и телеоперация при 14 различни въплъщения. Повечето данни за роботи използват споделено 50-мерно пространство за действията на крайния ефектор, наречено EE50.
Предварителното обучение е от голямо значение тук. Без него обучението само с DROID остава под 1% в RoboLab. С предварително обучение същият протокол достига 11,6%.
Резултати от бенчмарка
RoboLab-120 включва 120 задачи върху маса в Isaac Sim, с по 10 опита за всяка задача на DROID-подобна конфигурация с Franka.
| Модел | Тип | Параметри | RoboLab-120 |
|---|---|---|---|
| FLUX 3 Action | WAM | 7B | 42,92% |
| Cosmos3-Nano-Policy | WAM | 16B | 36,8% |
| π0.5 | VLA | 3.3B | 28,0% |
| DreamZero | WAM | 14B | 25,7% |
| GR00T N1.6 | VLA | 3B | 7,2% |
Това е преднина от 6,1 процентни пункта с 56% по-малко параметри в сравнение с Cosmos 3 Nano. Стойността от 42,92% е тази в класацията. Средната стойност на BFL при използване на няколко семена за FP8 чекпойнта с дестилация на насочването е 42,24% ± 0,36.
Резултатите от реален хардуер следват същата тенденция. Positronic Robotics проведе сляпа оценка върху роботизирана ръка Franka с 10 DROID задачи и по 3 опита за всяка. FLUX 3 Action изпълни успешно 28 от 30 опита (93,3%). Cosmos 3 Nano постигна 27/30, DreamZero — 20/30, а π0.5 — 13/30.
3 чекпойнта, 3 нива на скорост
BFL предлага политиката DROID в 3 конфигурации, всяка от които в BF16 и FP8:
- Базова: 4 стъпки на семплиране с разделено насочване (видео CFG 4, действие CFG 1).
- С дестилация на насочването: премахва втория проход за насочване, работи от 1,8 до 2 пъти по-бързо и постига с 0,6 до 1,08 пр. п. по-висока успеваемост.
- С дестилация на стъпките: 1 стъпка на семплиране, от 3,15 до 4 пъти по-бързо, със спад от 3,51 до 4,32 пр. п. в успеваемостта.
Спрямо Cosmos 3 Nano във FP8 базовият чекпойнт и този с дестилация на насочването работят от 1,52 до 3,95 пъти по-бързо при потребителски, работни и центрови графични процесори.
Всяко извикване генерира 32 действия при 15 Hz, или 2,13 секунди движение. π0.5 генерира 1,0 секунда при едно извикване. Затова BFL отчита скоростта като коефициент на работа в реално време, а не като латентност на едно извикване. Във FP8 чекпойнтът с дестилация на стъпките превъзхожда π0.5 от 1,34 до 2,28 пъти при работни и центрови графични процесори. На RTX 5090 той е по-бавен от π0.5.
Комбиниране на бърза политика с разсъждаващ модел
BFL също така тества хибридно управление с GPT 6 Astra, следвайки конфигурацията на Su et al. (2026). Разсъждаващият модел може да изпълнява, редактира или заменя предсказаните от политиката действия. С FLUX 3 Action и ниско ниво на усилие за разсъждение хибридната система решава 90% от епизодите при цена от $8.77 и 8m 08s за успех. Самостоятелният Astra при максимално усилие решава 100%, но струва $13.47 и 16m 23s за успех.
Дообучаване, LeRobot и Jetson
Екипите по изкуствен интелект могат да дообучат FLUX 3 Action със собствени демонстрации. BFL публикува конфигурация за DROID и конфигурация за SO-101 LoRA. Документацията показва умение за вземане и поставяне със SO-101, научено от около 200 демонстрации. С NVIDIA BFL интегрира модела в Hugging Face LeRobot, като той поддържа и внедряване на периферни устройства с NVIDIA Jetson. Документацията включва също примери за играене на игри и симулирани дронове.
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors
repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)Моделът извежда целеви стойности за ставите без вградени ограничения за скорост, сила или работно пространство. Вашето приложение трябва да налага тези ограничения.
Основни изводи
- WAM моделът с 7B параметъра заема първо място в RoboLab-120 с 42,92%.
- Води пред Cosmos 3 Nano с 6,1 пр. п. при 56% по-малко параметри.
- До 3,95 пъти по-бърз от Cosmos 3 Nano във FP8.
- Планира 2,13 секунди движение при едно извикване спрямо 1,0 секунда за π0.5.
- Теглата, кодът и конфигурациите се разпространяват под лиценза FLUX Kommunity.
Разгледайте пълния технически доклад, теглата на модела, GitHub хранилището и документацията. Всички заслуги принадлежат на изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, пускане на продукт, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.