Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Black Forest Labs випустила FLUX 3 Action: 7B-модель дій у світі з відкритими вагами, що перевершує RoboLab-120

Black Forest Labs (BFL), лабораторія, що стоїть за моделями зображень FLUX, випустила FLUX 3 Action. Це модель світових дій (WAM) із 7B параметрів і відкритими вагами для керування роботами. Модель аналізує кадри з камери, стан робота й текстову інструкцію. Потім вона одночасно прогнозує майбутні відеокадри та наступний фрагмент дій. У рейтингу RoboLab-120 вона посідає перше місце з показником успішності виконання завдань 42.92%.

Чи можна її розгорнути? Так, але з певними умовами. Для політики DROID потрібно близько 32 ГБ пам’яті GPU у BF16 на H200. Вона працює на картах із 24 ГБ завдяки квантуванню FP8 і вивантаженню текстового енкодера. Ліцензія FLUX Kommunity дозволяє некомерційне використання.

Компроміс, на який націлена FLUX 3 Action

Відкриті політики для роботів зазвичай змушують робити вибір. WAM-моделі, як-от Cosmos 3 Nano від NVIDIA, очолюють RoboLab із результатом 36.8%, але прогнозування відео є дорогим. VLA-моделі, як-от π0.5, працюють швидко, але досягають лише 28.0%. На B200 компанія BFL виміряла, що Cosmos 3 Nano (FP8) потребує приблизно у 4.7 раза більше часу обробки, ніж π0.5 (BF16), на секунду руху робота.

FLUX 3 Action зберігає спільне прогнозування відео та дій. Натомість BFL скорочує розрив у швидкості завдяки меншій базовій моделі та дистиляції.

Архітектура та навчання

FLUX 3 Action походить від мультимодальної базової моделі FLUX 3. Для попереднього навчання використовувалися дані зображень, відео й аудіо, причому на відео припадало понад 95% навчальних токенів. Текст, відео та стан робота кодуються в токени. Майбутні токени базової моделі декодуються у відеокадри, а її токени дій — у дії робота.

На етапі проміжного навчання дані попереднього навчання (36.95% зразків) поєднувалися з відео, узгодженим із діями (63.05%). Дані про дії охоплювали записи ігор, відео з перспективи людини, зняті від першої особи, ручні захвати та телеоперацію для 14 конфігурацій роботів. У більшості роботизованих даних використовується спільний 50-вимірний простір дій кінцевого ефектора під назвою EE50.

Попереднє навчання тут має велике значення. Без нього навчання лише на DROID залишалося нижче 1% у RoboLab. Із попереднім навчанням той самий протокол досяг 11.6%.

Результати тестування

RoboLab-120 містить 120 настільних завдань в Isaac Sim, по 10 випробувань кожного на установці типу DROID із роботом Franka.

МодельТипПараметриRoboLab-120
FLUX 3 ActionWAM7B42.92%
Cosmos3-Nano-PolicyWAM16B36.8%
π0.5VLA3.3B28.0%
DreamZeroWAM14B25.7%
GR00T N1.6VLA3B7.2%

Це перевага у 6.1 відсоткового пункту та на 56% менше параметрів, ніж у Cosmos 3 Nano. Показник 42.92% — це значення в рейтингу. Середній результат BFL для кількох початкових значень у контрольній точці FP8, дистильованій із guidance, становить 42.24% ± 0.36.

Результати на реальному обладнанні демонструють ту саму картину. Positronic Robotics провела сліпе оцінювання на маніпуляторі Franka із 10 завданнями DROID і 3 спробами для кожного. FLUX 3 Action виконала 28 із 30 спроб (93.3%). Cosmos 3 Nano отримала результат 27/30, DreamZero — 20/30, а π0.5 — 13/30.

3 контрольні версії, 3 показники швидкості

BFL постачає політику DROID у 3 варіантах, кожен у BF16 і FP8:

  • Базова: 4 кроки семплювання з розділеним guidance (CFG відео 4, CFG дій 1).
  • Дистильована guidance: відмовляється від другого проходу guidance, працює у 1.8–2 рази швидше та набирає на 0.6–1.08 в.п. більше.
  • Дистильована за кроками: 1 крок семплювання, у 3.15–4 рази швидша, із падінням успішності на 3.51–4.32 в.п.

Порівняно з Cosmos 3 Nano у FP8 базова та дистильована guidance контрольні версії працюють у 1.52–3.95 раза швидше на споживчих, робочих і серверних GPU.

Кожен виклик генерує 32 дії з частотою 15 Гц, тобто 2.13 секунди руху. π0.5 генерує 1.0 секунди за виклик. Тому BFL повідомляє про швидкість як про коефіцієнт реального часу, а не затримку одного виклику. У FP8 контрольна версія, дистильована за кроками, перевершує π0.5 у 1.34–2.28 раза на робочих і серверних GPU. На RTX 5090 вона повільніша за π0.5.

Поєднання швидкої політики з моделлю міркування

BFL також протестувала гібридне керування з GPT 6 Astra, дотримуючись підходу Su та співавторів (2026). Модель міркування може виконувати, редагувати або замінювати дії, спрогнозовані політикою. У поєднанні з FLUX 3 Action і низьким рівнем зусиль на міркування гібридна система розв’язала 90% епізодів за $8.77 і 8 хв 08 с на один успішний результат. Чиста Astra з максимальним рівнем зусиль розв’язала 100% епізодів, але вартість становила $13.47 і 16 хв 23 с на один успішний результат.

Дообучення, LeRobot і Jetson

Команди розробників ШІ можуть донавчати FLUX 3 Action на власних демонстраціях. BFL опублікувала рецепт для DROID і рецепт LoRA для SO-101. У документації показано навичку захоплення та переміщення об’єкта для SO-101, навчену приблизно на 200 демонстраціях. Спільно з NVIDIA компанія BFL нативно інтегрувала модель у Hugging Face LeRobot, а також забезпечила підтримку розгортання на периферійних пристроях NVIDIA Jetson. У документації також наведено приклади гри та симуляції дронів.

Копіювати кодСкопійованоВикористайте інший браузер
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors

repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)

Модель генерує цільові значення для суглобів без вбудованих обмежень швидкості, сили чи робочого простору. Ваша програма має забезпечувати дотримання цих обмежень.

Основні висновки

  • WAM із 7B параметрів посідає перше місце в RoboLab-120 із результатом 42.92%.
  • Випереджає Cosmos 3 Nano на 6.1 в.п., маючи на 56% менше параметрів.
  • До 3.95 раза швидша за Cosmos 3 Nano у FP8.
  • Планує 2.13 с руху за виклик проти 1.0 с у π0.5.
  • Ваги, код і рецепти поширюються за ліцензією FLUX Kommunity.

Ознайомтеся з повним технічним звітом, вагами моделі, репозиторієм GitHub і документацією. Уся подяка — досліднику цього проєкту. Також не соромтеся стежити за нами у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини