Qwen-Drive 1.0 объясняет, почему тормозит, но не ждите, что объяснение будет соответствовать манёвру
Главное
- Qwen-Drive 1.0 от Alibaba объединяет в одной ИИ-модели пространственное восприятие, ответы на вопросы о дорожном движении и планирование маршрута.
- Два модуля для 3D-картографирования и планирования маршрута расширяют базовую языковую модель, позволяя ИИ работать и как система управления автомобилем, и как бортовой помощник без потери уже имеющихся знаний.
- Повторное обучение снизило долю случаев съезда автомобиля с дороги в симуляциях с 24 до 12 процентов. Но объяснения модели не всегда соответствуют принимаемым ею решениям при вождении.
Qwen-Drive 1.0 выполняет три задачи в одной ИИ-модели: воспринимает пространство вокруг автомобиля, отвечает на вопросы о дорожном движении и планирует маршрут. Исследователи подтверждают, что текстово-изобразительная модель не начинает автоматически понимать трёхмерное пространство лишь потому, что умеет описывать изображения.
Существующие модели для вождения берут универсальную текстово-изобразительную модель и дообучают её на данных о вождении, главным образом на парах вопросов и ответов о дорожных ситуациях. Согласно статье, у такого подхода есть два недостатка. Модель, обученная преимущественно на вопросах и ответах о дорожном движении, по-прежнему не может надёжно определять расстояния, положения объектов и свободное пространство. А если она становится слишком специализированной на данных о вождении, то теряет обширные общие знания, полученные во время исходного обучения, из-за явления, которое исследователи называют «катастрофическим забыванием». Именно такие знания особенно важны в редких и неожиданных дорожных ситуациях. Модель, созданная исследовательским подразделением Alibaba, призвана решить обе проблемы.
Отдельный модуль проверяет, действительно ли модель понимает пространство
Qwen-Drive-1.0 построена на базе выпущенной в феврале Qwen3.5-4B и дополнена двумя компонентами. Первый создаёт вид сверху на окружающую обстановку, обнаруживая объекты в 3D-пространстве, определяя занятые области и восстанавливая схему дороги. По словам исследователей, он также служит измерительным инструментом, показывающим, какой объём пространственной информации модель действительно извлекает из изображений.

Второй компонент, Planning Expert, использует внутренние данные модели для планирования будущего движения автомобиля. Когда исследователи обучали только добавленный компонент, оставляя визуально-языковую модель без изменений, пространственная точность оставалась низкой. Это подтвердило, что модель, способная подробно описывать изображения, не начинает автоматически понимать трёхмерное пространство. Показатели значительно улучшились лишь после того, как команда также обучила саму визуально-языковую модель пространственным задачам, то есть способность пространственно понимать дорожные сцены необходимо формировать целенаправленно.

Обучение начинается с модуля восприятия, затем объединяются восприятие и ответы на вопросы, после чего добавляется планирование маршрута. На заключительном этапе поведение модели совершенствуется с помощью обучения с подкреплением. Для визуально-языкового компонента команда объединила 24 общедоступных набора данных с дорожными сценами. Эти наборы имели разную структуру и иногда содержали ошибки. ИИ-модель стандартизировала вопросы и ответы и согласовала их с исходными данными. Команда также создала собственные примеры, объясняющие, почему автомобиль должен принять конкретное решение, например какой объект вызывает торможение.
Одна модель и для бортовой системы, и для управления автомобилем
В современных автомобилях информационно-развлекательная система и система управления движением объединяются в одном вычислительном блоке вместо работы на двух отдельных контроллерах. Авторы утверждают, что модель, жертвующая универсальными возможностями ради исключительно высоких показателей вождения, здесь не помогает, поскольку бортовой системе всё равно потребовалась бы собственная модель и дополнительные вычислительные ресурсы для таких задач, как диалог или ответы на открытые вопросы.

Согласно статье, Qwen-Drive 1.0 значительно превосходит неизменённую базовую модель Qwen3.5-4B в ответах на вопросы о дорожных сценах. Самый большой разрыв наблюдается, когда модели нужно объяснить причинно-следственную связь, например почему автомобиль должен затормозить или повернуть. Общие знания также сохраняются: модель почти не показывает ухудшения результатов в тестах, не связанных с вождением, и даже немного превосходит исходную версию в некоторых пространственных задачах.
От симуляции к дороге
Для планирования вождения команда протестировала модель на нескольких уровнях сложности — от простых предсказаний до симулятора, где ошибки накапливаются со временем. В симуляторе версия, дообученная с использованием вознаграждений, снизила долю случаев съезда автомобиля с дороги с 24 до 12 процентов. При этом автомобиль стал ехать осторожнее и в целом преодолел меньшее расстояние.

Однако объяснения модели не всегда точно указывают истинную причину ситуации. Красный свет вдали и ребёнок, выходящий на дорогу, требуют совершенно разного времени реакции, но модель может их смешивать. Запланированный манёвр также не всегда соответствует рассуждениям, которые модель приводила заранее. Некоторые результаты основаны на тестовых процедурах, разработанных или самостоятельно восстановленных авторами, поэтому отдельные показатели мало говорят о том, как система справлялась бы с хаотичным реальным дорожным движением.

Команда Qwen измерила этот пробел в пространственном понимании с помощью собственного теста HopChain. В нём визуально-языковые модели неправильно классифицировали объекты и путали пространственные отношения, даже показывая хорошие результаты в тестах на соответствие изображений и текста. Катастрофическое забывание также является известной проблемой. Когда Google DeepMind создала PaLM-E в 2023 году — модель для работы с языком, изображениями и управлением роботами, — меньшие варианты потеряли значительную часть языковых способностей после обучения на задачах управления роботами. Крупнейшая версия с 562 миллиардами параметров почти ничего не потеряла.
Объединение языковой модели с функцией управления автомобилем создаёт новую поверхность для атак. Исследователи из Калифорнийского университета в Санта-Крузе разместили знак с надписью в поле зрения камеры и обманом заставили систему управления DriveLM свернуть в сторону переходящих дорогу пешеходов, хотя она правильно их обнаружила. Тем временем исследования смещаются в сторону мировых моделей действий, которые также предсказывают, как окружающая среда изменится в ответ на действия самого агента.
Команда Qwen бесплатно предоставляет модель исследовательскому сообществу на платформах Hugging Face, ModelScope и GitHub.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь доступ ко всему архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.