Исследователи UC Berkeley выпустили CUA-Lite — открытую платформу, объединяющую песочницы, данные, оценивание и RL для агентов, работающих с компьютером
Команда исследователей из Калифорнийского университета в Беркли представила CUA-Lite — открытую платформу для агентов, взаимодействующих с компьютером (CUA). Основная идея проекта связана скорее с инфраструктурой, чем с моделями: для обучения и тестирования CUA необходимы четыре компонента: агенты, среды, трассировки и фреймворк для их оценки и обучения, однако сейчас все четыре компонента распределены по отдельным репозиториям с несовместимыми интерфейсами. CUA-Lite объединяет их, предлагая единое пространство действий, единую схему данных и единую команду для настольных компьютеров, браузеров и мобильных устройств.
Можно ли развернуть систему? Да. Стек устанавливается с помощью uv sync --all-extras на Python 3.12, а его облегчённые песочницы работают на любом Docker-хосте без /dev/kvm, поэтому подходят облачные инстансы, CI-раннеры и вложенные контейнеры.
Налог на использование виртуальных машин и то, как Lite.OSWorld его устраняет
Наиболее ощутимый вклад проекта — Lite.OSWorld. OSWorld предоставляет полноценный рабочий стол Ubuntu, но запускает для каждой задачи полноценную виртуальную машину QEMU/KVM, требующую вложенной виртуализации, которую большинство управляемых инфраструктур не предоставляет. CUA-Lite воспроизводит тот же набор задач и те же оценщики на рабочем столе GNOME внутри обычного Docker-контейнера.
| Задача | OSWorld | Lite.OSWorld |
|---|---|---|
| Среда выполнения | ВМ QEMU/KVM | Docker-контейнер |
| Требования к хосту | /dev/kvm, вложенная виртуализация | Любой Docker-хост |
| Память | 4.1 ГБ | 0.9 ГБ |
| Холодный запуск | 29.9 с | 23.8 с |
| Параллелизм | базовый уровень | примерно в 4,6 раза больше инстансов |
| Набор задач | OSWorld | Идентичный |
Очевидная проблема при замене виртуальной машины контейнером — точность воспроизведения, и команда рассматривает её напрямую: для 13 моделей показатели Lite.OSWorld совпадают с показателями виртуальной машины OSWorld, поэтому результат или обучающий сигнал, полученный в контейнере, переносится на реальный бенчмарк. Та же базовая платформа теперь поддерживает семейство песочниц: Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld, последняя из которых расширяется примерно до 40 приложений, включая Blender, QGIS и VS Code. Всего платформа заявляет более 30 тысяч проверяемых задач.
Единая схема данных и отдельный адаптер для каждой модели
Второй уровень CUA-Lite — это LiteSample, единая схема обучения с учителем, общая для всех сред, агентов и типов задач, представленная в виде обычных parquet-файлов и изображений. Более десяти существующих наборов данных для CUA были предварительно обработаны в этом формате и бесплатно опубликованы на Hugging Face, включая Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey и Multimodal-Mind2Web. Наряду с этими корпусами доступны новые наборы данных с трассировками, созданные посредством запуска передовой модели-учителя в песочницах для последующей дистилляции в более компактные модели-ученики.
Поскольку для семейств моделей требуется разная вспомогательная инфраструктура, фреймворк предоставляет адаптер для каждой модели, который преобразует унифицированный LiteSample в собственный формат обучения модели, включая объединение истории, благодаря чему несколько шагов используют один прямой проход.
Оценка, SFT и RL одной командой
Агенты и среды взаимодействуют в lite.gym: на вход подаются снимки экрана, на выходе — действия, при этом для каждой платформы предусмотрено собственное пространство действий. В систему встроено более 10 агентов — GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и другие, — а также интегрировано более 15 бенчмарков, охватывающих распознавание элементов интерфейса (ScreenSpot-Pro, OSWorld-G), настольные системы (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), браузеры (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) и мобильные устройства (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Для смены конфигурации достаточно изменить --model-id и --env-id в scripts/rollout.py.
Тот же цикл используется для обучения. Для SFT в README описана тонкая настройка Qwen3-VL-2B-Instruct на траекториях работы с настольными системами из Lite.ScaleCUA, что повышает среднюю награду за эпизод с 0.138 до 0.237 на наборе оценки lite.osworld из 332 задач; это единственная представленная конфигурация на двух GPU, а не независимо воспроизведённый результат. Для RL результаты запусков, оценённые в среде, используются для обновления GRPO поверх Slime; приведён рабочий пример для MobileGym, охватывающий 416 мобильных задач в 28 приложениях.
Интерактивное объяснение
Ключевые выводы
- CUA-Lite объединяет агентов, среды, трассировки и обучение в рамках единого пространства действий и единой схемы
LiteSample. - Lite.OSWorld запускает задачи OSWorld в Docker без виртуальной машины, используя 0,9 ГБ вместо 4,1 ГБ и обеспечивая примерно в 4,6 раза больше параллельных рабочих столов.
- Показатели контейнера совпадают с показателями виртуальной машины OSWorld для 13 моделей, поэтому обучающий сигнал переносится на реальный бенчмарк.
- Более 30 тысяч проверяемых задач, более 15 бенчмарков, более 10 агентов и более 20 наборов данных опубликованы бесплатно на Hugging Face.
- Система разворачивается на любом Docker-хосте, однако в репозитории пока нет явно указанной лицензии — перед коммерческим использованием необходимо проверить условия.
Посетите страницу проекта, репозиторий на GitHub и наборы данных на Hugging Face. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Подождите! вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.