Дослідники UC Berkeley представили CUA-Lite — відкриту платформу, що об’єднує пісочниці, дані, оцінювання та RL для агентів, які працюють із комп’ютером
Команда дослідників з UC Berkeley випустила CUA-Lite — відкриту платформу для агентів використання комп’ютера (CUA). Її основна ідея має інфраструктурний, а не орієнтований на моделі характер: для навчання й бенчмаркінгу CUA потрібні чотири складові: агенти, середовища, трейси та фреймворк для їх оцінювання й навчання, і всі чотири наразі розподілені між окремими репозиторіями з несумісними інтерфейсами. CUA-Lite об’єднує їх за одним простором дій, однією схемою даних і однією командою для настільних комп’ютерів, браузерів і мобільних пристроїв.
Чи придатна вона для розгортання? Так. Стек встановлюється за допомогою uv sync --all-extras на Python 3.12, а його легковагові пісочниці працюють на будь-якому Docker-хості без /dev/kvm, тож хмарні інстанси, CI-раннери та вкладені контейнери також підтримуються.
Витрати на VM і те, як Lite.OSWorld їх усуває
Найконкретніший внесок — це Lite.OSWorld. OSWorld надає повноцінний робочий стіл Ubuntu, але постачається як повна віртуальна машина QEMU/KVM для кожного завдання, що потребує вкладеної віртуалізації, яку більшість керованої інфраструктури не надає. CUA-Lite відтворює той самий набір завдань і ті самі оцінювачі на робочому столі GNOME всередині звичайного Docker-контейнера.
| Завдання | OSWorld | Lite.OSWorld |
|---|---|---|
| Середовище виконання | ВМ QEMU/KVM | Docker-контейнер |
| Вимоги до хоста | /dev/kvm, вкладена віртуалізація | Будь-який Docker-хост |
| Пам’ять | 4.1 ГБ | 0.9 ГБ |
| Холодний запуск | 29.9 с | 23.8 с |
| Паралелізм | базовий рівень | приблизно у 4,6 раза більше інстансів |
| Набір завдань | OSWorld | Ідентичний |
Точність відтворення є очевидним питанням, коли ви замінюєте ВМ контейнером, і команда безпосередньо його розглядає: для 13 моделей показники Lite.OSWorld збігаються з показниками ВМ OSWorld, тож оцінка або навчальний сигнал, отримані в контейнері, переносяться назад до реального бенчмарку. Та сама база тепер підтримує сімейство пісочниць: Lite.ScaleCUA, Lite.CUAGym і Lite.CUAWorld, остання з яких розширюється приблизно до 40 застосунків, зокрема Blender, QGIS і VS Code. Загалом платформа заявляє про понад 30 тисяч завдань, які можна перевірити.
Одна схема для даних, один адаптер для кожної моделі
Другий рівень CUA-Lite — це LiteSample, єдина схема навчання з учителем, спільна для всіх середовищ, агентів і типів завдань, що постачається у вигляді звичайних parquet-файлів і зображень. Понад десять наявних наборів даних CUA було попередньо оброблено в цьому форматі й безкоштовно опубліковано на Hugging Face, зокрема Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey і Multimodal-Mind2Web. Поряд із цими корпусами доступні нові набори даних розгортань, згенеровані шляхом запуску передової моделі-вчителя в пісочницях, для дистиляції у менші моделі-учні.
Оскільки різні сімейства моделей очікують різної допоміжної інфраструктури, фреймворк постачається з адаптером для кожної моделі, який упаковує уніфікований LiteSample у власний формат навчання кожної моделі, зокрема підтримуючи об’єднання історії, щоб кілька кроків використовували один прямий прохід.
Оцінювання, SFT і RL за допомогою однієї команди
Агенти й середовища взаємодіють у lite.gym: на вході — знімки екрана, на виході — дії, з одним простором дій для кожної платформи. Вбудовано понад 10 агентів — GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI та інші, а також інтегровано понад 15 бенчмарків, що охоплюють визначення елементів (ScreenSpot-Pro, OSWorld-G), настільні системи (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), браузери (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) і мобільні пристрої (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Заміна --model-id і --env-id у scripts/rollout.py — це весь інтерфейс.
Той самий цикл використовується для навчання. Для SFT у README описано донавчання Qwen3-VL-2B-Instruct на траєкторіях настільних систем із Lite.ScaleCUA, що підвищило середню винагороду за епізод із 0.138 до 0.237 на розділі оцінювання lite.osworld із 332 завдань; це одна заявлена конфігурація на двох GPU, а не незалежно відтворений результат. Для RL розгортання, оцінені в середовищі, забезпечують оновлення GRPO поверх Slime, а робочий приклад із MobileGym охоплює 416 мобільних завдань у 28 застосунках.
Інтерактивне пояснення
Ключові висновки
- CUA-Lite об’єднує агентів, середовища, трейси й навчання за одним простором дій і однією схемою
LiteSample. - Lite.OSWorld запускає завдання OSWorld без ВМ у Docker, використовуючи 0,9 ГБ замість 4,1 ГБ, що дає приблизно у 4,6 раза більше паралельних робочих столів.
- Показники в контейнері збігаються з показниками ВМ OSWorld для 13 моделей, тож навчальний сигнал переноситься на реальний бенчмарк.
- Понад 30 тисяч завдань, які можна перевірити, понад 15 бенчмарків, понад 10 агентів і понад 20 наборів даних безкоштовно опубліковано на Hugging Face.
- Розгортається на будь-якому Docker-хості, але репозиторій наразі не містить явної ліцензії — перевірте умови перед комерційним використанням.
Перегляньте сторінку проєкту, репозиторій GitHub і набори даних на Hugging Face. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.