Qwen-Drive 1.0 пояснює, чому гальмує, але не чекайте, що пояснення відповідатиме маневру
Основні моменти
- Qwen-Drive від Alibaba виконує просторове сприйняття, відповідає на запитання про дорожній рух і планує маршрути в межах однієї моделі ШІ.
- Два модулі для 3D-картографування та планування маршруту розширюють базову мовну модель, даючи ШІ змогу працювати і як система керування автомобілем, і як асистент у салоні без втрати наявних знань.
- Повторне навчання знизило частку випадків, коли автомобіль з’їжджав із дороги, з 24 до 12 відсотків у симуляціях. Але пояснення моделі не завжди відповідають її рішенням під час керування.
Qwen-Drive 1.0 виконує три завдання в межах однієї моделі ШІ: просторове сприйняття навколишнього середовища, відповіді на запитання про дорожній рух і планування маршруту. Дослідники підтверджують, що текстово-візуальна модель не починає автоматично розуміти тривимірний простір лише тому, що вміє описувати зображення.
Наявні моделі керування автомобілем беруть універсальну текстово-візуальну модель і донавчають її на даних про водіння, переважно на парах запитань і відповідей про дорожні ситуації. Згідно зі статтею, такий підхід має дві слабкі сторони. Модель, навченa переважно на запитаннях і відповідях про дорожній рух, усе ще не може надійно визначати відстані, положення та вільний простір. А якщо її надто спеціалізувати на даних про водіння, вона втрачає широкі загальні знання, отримані під час початкового навчання, через те, що дослідники називають «катастрофічним забуванням». Саме такі знання найважливіші в рідкісних і несподіваних дорожніх ситуаціях. Модель, створена дослідницьким підрозділом Alibaba, має розв’язати обидві проблеми.
Окремий модуль перевіряє, чи справді модель розуміє простір
Qwen-Drive-1.0 побудована на Qwen3.5-4B, випущеній у лютому, і доповнена двома компонентами. Перший створює карту оточення з висоти пташиного польоту, виявляючи об’єкти у 3D-просторі, визначаючи зайняті ділянки та відтворюючи конфігурацію дороги. Дослідники кажуть, що він також слугує вимірювальним інструментом, який показує, скільки просторової інформації модель насправді отримує із зображень.

Другий компонент, Planning Expert, використовує внутрішні дані моделі для планування майбутнього руху автомобіля. Коли дослідники навчали лише доданий компонент, залишивши візуально-мовну модель без змін, просторові показники залишалися низькими. Це підтвердило, що модель, здатна детально описувати зображення, не починає автоматично розуміти тривимірний простір. Показники суттєво покращилися лише після того, як команда також навчила саму візуально-мовну модель виконувати просторові завдання. Отже, здатність просторово розуміти дорожні сцени потрібно цілеспрямовано формувати.

Навчання починається з модуля сприйняття, потім поєднуються сприйняття та відповіді на запитання, після чого додається планування маршруту. На завершальному етапі поведінка моделі вдосконалюється за допомогою навчання з підкріпленням. Для візуально-мовного компонента команда об’єднала 24 загальнодоступні набори даних дорожніх сцен. Ці набори мали різну структуру й іноді містили помилки. Модель ШІ стандартизувала запитання та відповіді й узгодила їх із початковими даними. Команда також створила власні приклади, що пояснюють, чому автомобіль має ухвалити конкретне рішення, наприклад який об’єкт спричиняє гальмування.
Одна модель і для салону, і для системи керування
У сучасних автомобілях інформаційно-розважальна система та система керування об’єднуються в одному обчислювальному блоці замість роботи на двох окремих контролерах. Автори стверджують, що модель, яка обмінює загальні можливості на суто вищу ефективність керування, тут не допоможе, адже для салону все одно знадобилася б власна модель і додаткові обчислювальні ресурси для таких завдань, як діалог або відкриті запитання.

Згідно зі статтею, Qwen-Drive 1.0 значно краще за незмінену базову модель Qwen3.5-4B відповідає на запитання про дорожні сцени. Найбільша різниця проявляється, коли моделі потрібно пояснити причинно-наслідковий зв’язок, наприклад чому автомобіль має загальмувати або повернути. Загальні знання також зберігаються: модель майже не втрачає результатів у тестах, не пов’язаних із водінням, і навіть трохи краще виконує деякі просторові завдання.
Від симуляції до дороги
Для планування руху команда протестувала модель на кількох рівнях складності — від простих прогнозів до симулятора, де помилки накопичуються з часом. У симуляторі версія, повторно навчена за допомогою винагород, знизила частку випадків з’їзду автомобіля з дороги з 24 до 12 відсотків. Вона також їхала обережніше й загалом долала меншу відстань.

Однак пояснення моделі не завжди точно визначають справжню причину ситуації. Червоне світло вдалині та дитина, яка виходить на дорогу, потребують дуже різного часу реакції, але модель може їх плутати. Запланований маневр також не завжди відповідає міркуванням, наведеним моделлю заздалегідь. Деякі результати ґрунтуються на тестових процедурах, які автори розробили або відтворили самостійно, тому окремі показники мало говорять про те, як система впоралася б із хаотичним реальним водінням.

Команда Qwen виміряла цей пробіл у просторовому розумінні за допомогою власного тесту HopChain. У ньому візуально-мовні моделі неправильно класифікували об’єкти та плутали просторові взаємозв’язки, навіть добре виконуючи тести на відповідність зображень і тексту. Катастрофічне забування також є знайомою проблемою. Коли Google DeepMind створила PaLM-E у 2023 році — модель для роботи з мовою, зображеннями та керуванням роботами — менші варіанти втратили значну частину мовних здібностей після навчання робототехніки. Найбільша версія, що мала 562 мільярди параметрів, майже нічого не втратила.
Поєднання мовної моделі з функцією керування автомобілем створює нову поверхню для атак. Дослідники з Каліфорнійського університету в Санта-Крусі розмістили знак із написом у полі зору камери та змусили систему керування DriveLM звернути в бік пішоходів, які переходили дорогу, хоча вона правильно їх виявила. Тим часом дослідження зміщуються в бік World Action Models, які також прогнозують, як середовище змінюється у відповідь на власні дії агента.
Команда Qwen безкоштовно випускає модель для дослідницької спільноти на платформах Hugging Face, ModelScope і GitHub.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, доступ до повного архіву та розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.