Black Forest Labs випустила FLUX 3 Action: 7B-модель дій у світі з відкритими вагами, що перевершує RoboLab-120
Black Forest Labs (BFL), лабораторія, що стоїть за моделями зображень FLUX, випустила FLUX 3 Action. Це модель світових дій (WAM) із 7B параметрів і відкритими вагами для керування роботами. Модель аналізує кадри з камери, стан робота й текстову інструкцію. Потім вона одночасно прогнозує майбутні відеокадри та наступний фрагмент дій. У рейтингу RoboLab-120 вона посідає перше місце з показником успішності виконання завдань 42.92%.
Чи можна її розгорнути? Так, але з певними умовами. Для політики DROID потрібно близько 32 ГБ пам’яті GPU у BF16 на H200. Вона працює на картах із 24 ГБ завдяки квантуванню FP8 і вивантаженню текстового енкодера. Ліцензія FLUX Kommunity дозволяє некомерційне використання.
Компроміс, на який націлена FLUX 3 Action
Відкриті політики для роботів зазвичай змушують робити вибір. WAM-моделі, як-от Cosmos 3 Nano від NVIDIA, очолюють RoboLab із результатом 36.8%, але прогнозування відео є дорогим. VLA-моделі, як-от π0.5, працюють швидко, але досягають лише 28.0%. На B200 компанія BFL виміряла, що Cosmos 3 Nano (FP8) потребує приблизно у 4.7 раза більше часу обробки, ніж π0.5 (BF16), на секунду руху робота.
FLUX 3 Action зберігає спільне прогнозування відео та дій. Натомість BFL скорочує розрив у швидкості завдяки меншій базовій моделі та дистиляції.
Архітектура та навчання
FLUX 3 Action походить від мультимодальної базової моделі FLUX 3. Для попереднього навчання використовувалися дані зображень, відео й аудіо, причому на відео припадало понад 95% навчальних токенів. Текст, відео та стан робота кодуються в токени. Майбутні токени базової моделі декодуються у відеокадри, а її токени дій — у дії робота.
На етапі проміжного навчання дані попереднього навчання (36.95% зразків) поєднувалися з відео, узгодженим із діями (63.05%). Дані про дії охоплювали записи ігор, відео з перспективи людини, зняті від першої особи, ручні захвати та телеоперацію для 14 конфігурацій роботів. У більшості роботизованих даних використовується спільний 50-вимірний простір дій кінцевого ефектора під назвою EE50.
Попереднє навчання тут має велике значення. Без нього навчання лише на DROID залишалося нижче 1% у RoboLab. Із попереднім навчанням той самий протокол досяг 11.6%.
Результати тестування
RoboLab-120 містить 120 настільних завдань в Isaac Sim, по 10 випробувань кожного на установці типу DROID із роботом Franka.
| Модель | Тип | Параметри | RoboLab-120 |
|---|---|---|---|
| FLUX 3 Action | WAM | 7B | 42.92% |
| Cosmos3-Nano-Policy | WAM | 16B | 36.8% |
| π0.5 | VLA | 3.3B | 28.0% |
| DreamZero | WAM | 14B | 25.7% |
| GR00T N1.6 | VLA | 3B | 7.2% |
Це перевага у 6.1 відсоткового пункту та на 56% менше параметрів, ніж у Cosmos 3 Nano. Показник 42.92% — це значення в рейтингу. Середній результат BFL для кількох початкових значень у контрольній точці FP8, дистильованій із guidance, становить 42.24% ± 0.36.
Результати на реальному обладнанні демонструють ту саму картину. Positronic Robotics провела сліпе оцінювання на маніпуляторі Franka із 10 завданнями DROID і 3 спробами для кожного. FLUX 3 Action виконала 28 із 30 спроб (93.3%). Cosmos 3 Nano отримала результат 27/30, DreamZero — 20/30, а π0.5 — 13/30.
3 контрольні версії, 3 показники швидкості
BFL постачає політику DROID у 3 варіантах, кожен у BF16 і FP8:
- Базова: 4 кроки семплювання з розділеним guidance (CFG відео 4, CFG дій 1).
- Дистильована guidance: відмовляється від другого проходу guidance, працює у 1.8–2 рази швидше та набирає на 0.6–1.08 в.п. більше.
- Дистильована за кроками: 1 крок семплювання, у 3.15–4 рази швидша, із падінням успішності на 3.51–4.32 в.п.
Порівняно з Cosmos 3 Nano у FP8 базова та дистильована guidance контрольні версії працюють у 1.52–3.95 раза швидше на споживчих, робочих і серверних GPU.
Кожен виклик генерує 32 дії з частотою 15 Гц, тобто 2.13 секунди руху. π0.5 генерує 1.0 секунди за виклик. Тому BFL повідомляє про швидкість як про коефіцієнт реального часу, а не затримку одного виклику. У FP8 контрольна версія, дистильована за кроками, перевершує π0.5 у 1.34–2.28 раза на робочих і серверних GPU. На RTX 5090 вона повільніша за π0.5.
Поєднання швидкої політики з моделлю міркування
BFL також протестувала гібридне керування з GPT 6 Astra, дотримуючись підходу Su та співавторів (2026). Модель міркування може виконувати, редагувати або замінювати дії, спрогнозовані політикою. У поєднанні з FLUX 3 Action і низьким рівнем зусиль на міркування гібридна система розв’язала 90% епізодів за $8.77 і 8 хв 08 с на один успішний результат. Чиста Astra з максимальним рівнем зусиль розв’язала 100% епізодів, але вартість становила $13.47 і 16 хв 23 с на один успішний результат.
Дообучення, LeRobot і Jetson
Команди розробників ШІ можуть донавчати FLUX 3 Action на власних демонстраціях. BFL опублікувала рецепт для DROID і рецепт LoRA для SO-101. У документації показано навичку захоплення та переміщення об’єкта для SO-101, навчену приблизно на 200 демонстраціях. Спільно з NVIDIA компанія BFL нативно інтегрувала модель у Hugging Face LeRobot, а також забезпечила підтримку розгортання на периферійних пристроях NVIDIA Jetson. У документації також наведено приклади гри та симуляції дронів.
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors
repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)Модель генерує цільові значення для суглобів без вбудованих обмежень швидкості, сили чи робочого простору. Ваша програма має забезпечувати дотримання цих обмежень.
Основні висновки
- WAM із 7B параметрів посідає перше місце в RoboLab-120 із результатом 42.92%.
- Випереджає Cosmos 3 Nano на 6.1 в.п., маючи на 56% менше параметрів.
- До 3.95 раза швидша за Cosmos 3 Nano у FP8.
- Планує 2.13 с руху за виклик проти 1.0 с у π0.5.
- Ваги, код і рецепти поширюються за ліцензією FLUX Kommunity.
Ознайомтеся з повним технічним звітом, вагами моделі, репозиторієм GitHub і документацією. Уся подяка — досліднику цього проєкту. Також не соромтеся стежити за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.