Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Black Forest Labs пуска FLUX 3 Action: 7B модел за действия в света с отворени тегла, който надминава RoboLab-120

Black Forest Labs (BFL), лабораторията зад моделите за изображения FLUX, пусна FLUX 3 Action. Това е World Action Model (WAM) с 7B параметъра и отворени тегла за управление на роботи. Моделът прочита кадри от камерата, състоянието на робота и текстова инструкция. След това заедно предсказва бъдещи видео кадри и следващия пакет от действия. В класацията RoboLab-120 заема първо място с 42,92% успеваемост на задачите.

Може ли да бъде внедрен? Да, при определени условия. Политиката DROID се нуждае от около 32 GB графична памет в BF16 на H200. Тя работи на карти с 24 GB чрез FP8 квантизация и изнасяне на текстовия енкодер. Лицензът FLUX Kommunity позволява некомерсиална употреба.

Компромисът, към който е насочен FLUX 3 Action

Отворените политики за роботи обикновено налагат избор. WAM моделите като Cosmos 3 Nano на NVIDIA водят в RoboLab с 36,8%, но предсказването на видео е скъпо. VLA моделите като π0.5 са бързи, но достигат само 28,0%. На B200 BFL измери, че Cosmos 3 Nano (FP8) се нуждае от около 4,7 пъти повече време за обработка от π0.5 (BF16) за всяка секунда движение на робота.

FLUX 3 Action запазва съвместното предсказване на видео и действия. Вместо това BFL намалява разликата в скоростта чрез по-малък гръбнак и дестилация.

Архитектура и обучение

FLUX 3 Action е разработен върху мултимодалния гръбнак FLUX 3. Предварителното обучение използва данни за изображения, видео и аудио, като видеото представлява над 95% от обучаващите токени. Текстът, видеото и състоянието на робота се кодират в токени. Бъдещите токени на гръбнака се декодират във видео кадри, а токените за действия — в действия на робота.

Междинното обучение смесва данни от предварителното обучение (36,95% от извадките) с видео, съобразено с действията (63,05%). Данните за действията обхващат записи на игри, егоцентрично видео на човешки ръце, ръчни грайфери и телеоперация при 14 различни въплъщения. Повечето данни за роботи използват споделено 50-мерно пространство за действията на крайния ефектор, наречено EE50.

Предварителното обучение е от голямо значение тук. Без него обучението само с DROID остава под 1% в RoboLab. С предварително обучение същият протокол достига 11,6%.

Резултати от бенчмарка

RoboLab-120 включва 120 задачи върху маса в Isaac Sim, с по 10 опита за всяка задача на DROID-подобна конфигурация с Franka.

МоделТипПараметриRoboLab-120
FLUX 3 ActionWAM7B42,92%
Cosmos3-Nano-PolicyWAM16B36,8%
π0.5VLA3.3B28,0%
DreamZeroWAM14B25,7%
GR00T N1.6VLA3B7,2%

Това е преднина от 6,1 процентни пункта с 56% по-малко параметри в сравнение с Cosmos 3 Nano. Стойността от 42,92% е тази в класацията. Средната стойност на BFL при използване на няколко семена за FP8 чекпойнта с дестилация на насочването е 42,24% ± 0,36.

Резултатите от реален хардуер следват същата тенденция. Positronic Robotics проведе сляпа оценка върху роботизирана ръка Franka с 10 DROID задачи и по 3 опита за всяка. FLUX 3 Action изпълни успешно 28 от 30 опита (93,3%). Cosmos 3 Nano постигна 27/30, DreamZero — 20/30, а π0.5 — 13/30.

3 чекпойнта, 3 нива на скорост

BFL предлага политиката DROID в 3 конфигурации, всяка от които в BF16 и FP8:

  • Базова: 4 стъпки на семплиране с разделено насочване (видео CFG 4, действие CFG 1).
  • С дестилация на насочването: премахва втория проход за насочване, работи от 1,8 до 2 пъти по-бързо и постига с 0,6 до 1,08 пр. п. по-висока успеваемост.
  • С дестилация на стъпките: 1 стъпка на семплиране, от 3,15 до 4 пъти по-бързо, със спад от 3,51 до 4,32 пр. п. в успеваемостта.

Спрямо Cosmos 3 Nano във FP8 базовият чекпойнт и този с дестилация на насочването работят от 1,52 до 3,95 пъти по-бързо при потребителски, работни и центрови графични процесори.

Всяко извикване генерира 32 действия при 15 Hz, или 2,13 секунди движение. π0.5 генерира 1,0 секунда при едно извикване. Затова BFL отчита скоростта като коефициент на работа в реално време, а не като латентност на едно извикване. Във FP8 чекпойнтът с дестилация на стъпките превъзхожда π0.5 от 1,34 до 2,28 пъти при работни и центрови графични процесори. На RTX 5090 той е по-бавен от π0.5.

Комбиниране на бърза политика с разсъждаващ модел

BFL също така тества хибридно управление с GPT 6 Astra, следвайки конфигурацията на Su et al. (2026). Разсъждаващият модел може да изпълнява, редактира или заменя предсказаните от политиката действия. С FLUX 3 Action и ниско ниво на усилие за разсъждение хибридната система решава 90% от епизодите при цена от $8.77 и 8m 08s за успех. Самостоятелният Astra при максимално усилие решава 100%, но струва $13.47 и 16m 23s за успех.

Дообучаване, LeRobot и Jetson

Екипите по изкуствен интелект могат да дообучат FLUX 3 Action със собствени демонстрации. BFL публикува конфигурация за DROID и конфигурация за SO-101 LoRA. Документацията показва умение за вземане и поставяне със SO-101, научено от около 200 демонстрации. С NVIDIA BFL интегрира модела в Hugging Face LeRobot, като той поддържа и внедряване на периферни устройства с NVIDIA Jetson. Документацията включва също примери за играене на игри и симулирани дронове.

Копиране на кодаКопираноИзползвайте друг браузър
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors

repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)

Моделът извежда целеви стойности за ставите без вградени ограничения за скорост, сила или работно пространство. Вашето приложение трябва да налага тези ограничения.

Основни изводи

  • WAM моделът с 7B параметъра заема първо място в RoboLab-120 с 42,92%.
  • Води пред Cosmos 3 Nano с 6,1 пр. п. при 56% по-малко параметри.
  • До 3,95 пъти по-бърз от Cosmos 3 Nano във FP8.
  • Планира 2,13 секунди движение при едно извикване спрямо 1,0 секунда за π0.5.
  • Теглата, кодът и конфигурациите се разпространяват под лиценза FLUX Kommunity.

Разгледайте пълния технически доклад, теглата на модела, GitHub хранилището и документацията. Всички заслуги принадлежат на изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, пускане на продукт, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини