Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Qwen-Drive 1.0 объясняет, почему тормозит, но не ждите, что объяснение будет соответствовать манёвру

Qwen-Drive 1.0 объясняет, почему тормозит, но не ждите, что объяснение будет соответствовать манёвру
Джонатан Кемпер
7 сентября 2026
Qwen

Главное

  • Qwen-Drive 1.0 от Alibaba объединяет в одной ИИ-модели пространственное восприятие, ответы на вопросы о дорожном движении и планирование маршрута.
  • Два модуля для 3D-картографирования и планирования маршрута расширяют базовую языковую модель, позволяя ИИ работать и как система управления автомобилем, и как бортовой помощник без потери уже имеющихся знаний.
  • Повторное обучение снизило долю случаев съезда автомобиля с дороги в симуляциях с 24 до 12 процентов. Но объяснения модели не всегда соответствуют принимаемым ею решениям при вождении.

Qwen-Drive 1.0 выполняет три задачи в одной ИИ-модели: воспринимает пространство вокруг автомобиля, отвечает на вопросы о дорожном движении и планирует маршрут. Исследователи подтверждают, что текстово-изобразительная модель не начинает автоматически понимать трёхмерное пространство лишь потому, что умеет описывать изображения.

Существующие модели для вождения берут универсальную текстово-изобразительную модель и дообучают её на данных о вождении, главным образом на парах вопросов и ответов о дорожных ситуациях. Согласно статье, у такого подхода есть два недостатка. Модель, обученная преимущественно на вопросах и ответах о дорожном движении, по-прежнему не может надёжно определять расстояния, положения объектов и свободное пространство. А если она становится слишком специализированной на данных о вождении, то теряет обширные общие знания, полученные во время исходного обучения, из-за явления, которое исследователи называют «катастрофическим забыванием». Именно такие знания особенно важны в редких и неожиданных дорожных ситуациях. Модель, созданная исследовательским подразделением Alibaba, призвана решить обе проблемы.

Отдельный модуль проверяет, действительно ли модель понимает пространство

Qwen-Drive-1.0 построена на базе выпущенной в феврале Qwen3.5-4B и дополнена двумя компонентами. Первый создаёт вид сверху на окружающую обстановку, обнаруживая объекты в 3D-пространстве, определяя занятые области и восстанавливая схему дороги. По словам исследователей, он также служит измерительным инструментом, показывающим, какой объём пространственной информации модель действительно извлекает из изображений.

Схема архитектуры Qwen-Drive-1.0 с визуальным кодировщиком, языковой моделью Qwen3.5, внешней головкой BEV-восприятия для 3D-детектирования, определения занятости пространства и сегментации карты, а также экспертом по планированию для вывода траектории.
Все функции вождения выполняются общей языковой моделью. Два дополнительных модуля используют её промежуточные результаты: один строит 3D-модель окружающей среды, а другой планирует маршрут автомобиля на ближайшие несколько секунд. | Изображение: Qwen

Второй компонент, Planning Expert, использует внутренние данные модели для планирования будущего движения автомобиля. Когда исследователи обучали только добавленный компонент, оставляя визуально-языковую модель без изменений, пространственная точность оставалась низкой. Это подтвердило, что модель, способная подробно описывать изображения, не начинает автоматически понимать трёхмерное пространство. Показатели значительно улучшились лишь после того, как команда также обучила саму визуально-языковую модель пространственным задачам, то есть способность пространственно понимать дорожные сцены необходимо формировать целенаправленно.

Четыре ряда сцен с изображениями с камер разных ракурсов, 3D-детектированием объектов на виде сверху, семантическими картами занятости пространства и сегментацией карты BEV; в каждом случае сравниваются предсказание модели и эталонная разметка.
Модель восстанавливает вид сверху каждой сцены по изображениям с камер, показывая автомобили, пешеходов и дорожную разметку. Справа предсказание сопоставлено с реальной ситуацией. | Изображение: Qwen

Обучение начинается с модуля восприятия, затем объединяются восприятие и ответы на вопросы, после чего добавляется планирование маршрута. На заключительном этапе поведение модели совершенствуется с помощью обучения с подкреплением. Для визуально-языкового компонента команда объединила 24 общедоступных набора данных с дорожными сценами. Эти наборы имели разную структуру и иногда содержали ошибки. ИИ-модель стандартизировала вопросы и ответы и согласовала их с исходными данными. Команда также создала собственные примеры, объясняющие, почему автомобиль должен принять конкретное решение, например какой объект вызывает торможение.

Одна модель и для бортовой системы, и для управления автомобилем

В современных автомобилях информационно-развлекательная система и система управления движением объединяются в одном вычислительном блоке вместо работы на двух отдельных контроллерах. Авторы утверждают, что модель, жертвующая универсальными возможностями ради исключительно высоких показателей вождения, здесь не помогает, поскольку бортовой системе всё равно потребовалась бы собственная модель и дополнительные вычислительные ресурсы для таких задач, как диалог или ответы на открытые вопросы.

Две радиальные диаграммы, сравнивающие Qwen-Drive-1.0 с такими моделями, как Qwen3.5-4B, MiMo-Embodied-7B и InternVL3.5-8B, по тестам на визуальные вопросы о вождении, общие визуальные вопросы, 3D-восприятие и планирование движения.
В собственных тестах Qwen модель Qwen-Drive 1.0 превосходит специализированные модели в большинстве категорий, связанных с вождением и восприятием. | Изображение: Qwen

Согласно статье, Qwen-Drive 1.0 значительно превосходит неизменённую базовую модель Qwen3.5-4B в ответах на вопросы о дорожных сценах. Самый большой разрыв наблюдается, когда модели нужно объяснить причинно-следственную связь, например почему автомобиль должен затормозить или повернуть. Общие знания также сохраняются: модель почти не показывает ухудшения результатов в тестах, не связанных с вождением, и даже немного превосходит исходную версию в некоторых пространственных задачах.

От симуляции к дороге

Для планирования вождения команда протестировала модель на нескольких уровнях сложности — от простых предсказаний до симулятора, где ошибки накапливаются со временем. В симуляторе версия, дообученная с использованием вознаграждений, снизила долю случаев съезда автомобиля с дороги с 24 до 12 процентов. При этом автомобиль стал ехать осторожнее и в целом преодолел меньшее расстояние.

Три сцены вождения в разомкнутом цикле с наложенным текстом рассуждений и предсказанными траекториями в верхней части, а также восемь временных шагов в замкнутом цикле из двух запусков AlpaSim с изображениями с камер и графиками траекторий в нижней части.
В каждом сценарии модель объясняет своё решение при вождении, например торможение перед животным на дороге или остановку на красный свет. Синяя линия показывает запланированный маршрут. | Изображение: Qwen

Однако объяснения модели не всегда точно указывают истинную причину ситуации. Красный свет вдали и ребёнок, выходящий на дорогу, требуют совершенно разного времени реакции, но модель может их смешивать. Запланированный манёвр также не всегда соответствует рассуждениям, которые модель приводила заранее. Некоторые результаты основаны на тестовых процедурах, разработанных или самостоятельно восстановленных авторами, поэтому отдельные показатели мало говорят о том, как система справлялась бы с хаотичным реальным дорожным движением.

Четыре ряда сцен с изображениями с камер незнакомых конфигураций из WOD-E2E и PAI-AV, демонстрирующие результаты 3D-детектирования, определения занятости пространства и сегментации карты без сравнения с эталонной разметкой.
Модель обнаруживает значительно меньше объектов при обработке видео с других автомобилей с иными конфигурациями камер. Подходящих обучающих данных для таких конфигураций по-прежнему не хватает. | Изображение: Qwen

Команда Qwen измерила этот пробел в пространственном понимании с помощью собственного теста HopChain. В нём визуально-языковые модели неправильно классифицировали объекты и путали пространственные отношения, даже показывая хорошие результаты в тестах на соответствие изображений и текста. Катастрофическое забывание также является известной проблемой. Когда Google DeepMind создала PaLM-E в 2023 году — модель для работы с языком, изображениями и управлением роботами, — меньшие варианты потеряли значительную часть языковых способностей после обучения на задачах управления роботами. Крупнейшая версия с 562 миллиардами параметров почти ничего не потеряла.

Объединение языковой модели с функцией управления автомобилем создаёт новую поверхность для атак. Исследователи из Калифорнийского университета в Санта-Крузе разместили знак с надписью в поле зрения камеры и обманом заставили систему управления DriveLM свернуть в сторону переходящих дорогу пешеходов, хотя она правильно их обнаружила. Тем временем исследования смещаются в сторону мировых моделей действий, которые также предсказывают, как окружающая среда изменится в ответ на действия самого агента.

Команда Qwen бесплатно предоставляет модель исследовательскому сообществу на платформах Hugging Face, ModelScope и GitHub.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, иметь доступ ко всему архиву и разделу комментариев.

Источник: Arxiv

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости