Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Изследователи от UC Berkeley представиха CUA-Lite — отворена платформа, обединяваща пясъчници, данни, оценяване и RL за агенти, използващи компютър

Екип от изследователи от UC Berkeley представи CUA-Lite — отворена платформа за агенти за използване на компютри (CUA). Аргументът зад нея е по-скоро инфраструктурен, отколкото свързан с моделите: обучението и сравнителният анализ на CUA изискват четири компонента: агенти, среди, траектории и рамка за тяхното оценяване и обучение, а и четирите понастоящем са фрагментирани в отделни хранилища с несъвместими интерфейси. CUA-Lite ги обединява зад едно пространство от действия, една схема за данни и една команда за настолни компютри, браузъри и мобилни устройства.

Може ли да се внедри? Да. Стекът се инсталира с uv sync --all-extras на Python 3.12, а леките му пясъчници работят на всеки Docker хост без /dev/kvm, така че облачни инстанции, CI изпълнители и вложени контейнери също функционират.

Цената на виртуалната машина и как Lite.OSWorld я премахва

Най-конкретният принос е Lite.OSWorld. OSWorld предоставя достоверен Ubuntu десктоп, но се доставя като пълна QEMU/KVM виртуална машина за всяка задача, което изисква вложена виртуализация, недостъпна в повечето управлявани инфраструктури. CUA-Lite възпроизвежда същия набор от задачи и същите оценители в GNOME десктоп в обикновен Docker контейнер.

ЗадачаOSWorldLite.OSWorld
Среда за изпълнениеQEMU/KVM виртуална машинаDocker контейнер
Изискване към хоста/dev/kvm, вложена виртуализацияВсеки Docker хост
Памет4.1 GB0.9 GB
Студен старт29.9 s23.8 s
Паралелностбазова стойност~4.6× повече инстанции
Набор от задачиOSWorldИдентичен

Достоверността е очевидното предизвикателство, когато замените виртуална машина с контейнер, и екипът го адресира директно: при 13 модела резултатите на Lite.OSWorld съвпадат с тези на OSWorld VM, така че резултат или обучаващ сигнал, получен в контейнера, се пренася обратно към реалния бенчмарк. Същата база вече поддържа семейство от пясъчници: Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld, като последният се разширява до приблизително 40 приложения, включително Blender, QGIS и VS Code. Общо платформата заявява над 30 хиляди проверими задачи.

Една схема за данни, един адаптер за всеки модел

Вторият слой на CUA-Lite е LiteSample — единна схема за контролирано обучение, споделена между всички среди, агенти и типове задачи, предоставяна като обикновени parquet файлове плюс изображения. Над десет съществуващи набора от данни за CUA са предварително обработени в този формат и публикувани безплатно в Hugging Face, включително Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey и Multimodal-Mind2Web. Наред с тези корпуси са публикувани и нови набори от данни с траектории, генерирани чрез прокарване на водещ учителски модел през пясъчниците с цел дестилация в по-малки ученически модели.

Тъй като различните семейства модели очакват различна структура, рамката предоставя адаптер за всеки модел, който преобразува единния LiteSample във формата за обучение на съответния модел, включително обединяване на историята, така че няколко стъпки да споделят един проход напред.

Оценяване, SFT и RL с една команда

Агентите и средите се срещат в lite.gym: входящи екранни снимки, изходящи действия, с едно пространство от действия за всяка платформа. Вградени са над 10 агента — GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и други, а са интегрирани над 15 бенчмарка, обхващащи разпознаване на елементи (ScreenSpot-Pro, OSWorld-G), настолни среди (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), браузъри (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) и мобилни устройства (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Смяната на --model-id и --env-id в scripts/rollout.py е целият интерфейс.

Същият цикъл се използва и за обучение. За SFT README описва финото дообучаване на Qwen3-VL-2B-Instruct върху настолни траектории от Lite.ScaleCUA, което повишава средната възвръщаемост на епизод от 0.138 до 0.237 в оценъчния дял lite.osworld от 332 задачи — една отчетена конфигурация с два графични процесора, а не независимо възпроизведен резултат. За RL траекториите, оценени в средата, задвижват актуализации по GRPO върху Slime, с разработен пример за MobileGym, обхващащ 416 мобилни задачи в 28 приложения.

Интерактивно обяснение

Основни изводи

  • CUA-Lite обединява агенти, среди, траектории и обучение под едно пространство от действия и една схема LiteSample.
  • Lite.OSWorld изпълнява задачите на OSWorld без виртуална машина в Docker при 0.9 GB спрямо 4.1 GB, с приблизително 4.6 пъти повече паралелни десктопи.
  • Резултатите в контейнера съвпадат с тези на OSWorld VM при 13 модела, така че обучаващият сигнал се пренася към реалния бенчмарк.
  • Над 30 хиляди проверими задачи, над 15 бенчмарка, над 10 агента и над 20 набора от данни, публикувани безплатно в Hugging Face.
  • Може да се внедри на всеки Docker хост, но хранилището все още не предоставя изричен лиценз — проверете условията, преди да го използвате с търговска цел.

Разгледайте страницата на проекта, хранилището в GitHub и наборите от данни в Hugging Face. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хиляди членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и др.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини