Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Qwen-Drive 1.0 ви казва защо спира, но не очаквайте обяснението да съвпада с маневрата

Qwen-Drive 1.0 ви казва защо спира, но не очаквайте обяснението да съвпада с маневрата
Джонатан Кемпър
7 септември 2026 г.
Qwen

Основни моменти

  • Qwen-Drive 1.0 на Alibaba обработва пространственото възприятие, въпросите за трафика и планирането на маршрута в един AI модел.
  • Два модула за 3D картографиране и планиране на маршрута разширяват базовия езиков модел, позволявайки на AI да работи едновременно като система за управление и асистент в купето, без да губи съществуващите си знания.
  • Допълнителното обучение намали дела на случаите, в които автомобилът излиза от пътя, от 24 процента на 12 процента в симулации. Обясненията на модела обаче не винаги съвпадат с решенията му при шофиране.

Qwen-Drive 1.0 изпълнява три задачи в един AI модел: пространствено възприятие на средата, отговаряне на въпроси за трафика и планиране на маршрута. Изследователите потвърждават, че текстово-изображенският модел не разбира автоматично триизмерното пространство само защото може да описва изображения.

Съществуващите модели за шофиране вземат общ текстово-изображенски модел и го дообучават с данни за шофиране, предимно двойки въпроси и отговори за пътни ситуации. Според статията този подход има две слабости. Модел, обучен основно с въпроси и отговори за трафика, все още не може надеждно да открива разстояния, позиции и свободни пространства. А ако стане прекалено специализиран в данните за шофиране, той губи широките общи знания от първоначалното си обучение чрез това, което изследователите наричат „катастрофално забравяне“ — именно знанията, които са най-важни в редки и неочаквани пътни ситуации. Моделът, създаден от изследователския отдел на Alibaba, трябва да реши и двата проблема.

Отделен модул проверява дали моделът действително разбира пространството

Qwen-Drive-1.0 е изграден върху Qwen3.5-4B, пуснат през февруари, и добавя два допълнителни компонента. Първият създава карта на околността, видяна от птичи поглед, като открива обекти в 3D пространството, определя кои области са заети и проследява структурата на пътя. Изследователите казват, че той служи и като измервателен инструмент, който показва колко пространствена информация моделът действително извлича от изображенията.

Архитектурна диаграма на Qwen-Drive-1.0, показваща Vision Encoder, езиковия модел Qwen3.5, външната BEV Perception Head за 3D откриване, заетост и сегментиране на картата, както и Planning Expert за извеждане на траектория.
Всички функции за шофиране преминават през общ езиков модел. Два добавени модула използват междинните му резултати: единият изгражда 3D модел на средата, а другият планира маршрута на автомобила за следващите няколко секунди. | Изображение: Qwen

Вторият компонент, Planning Expert, използва вътрешни данни от модела, за да планира бъдещото движение на автомобила. Когато изследователите обучили само добавения компонент, без да променят зрително-езиковия модел, пространствената точност останала ниска, потвърждавайки, че модел, способен да описва изображения в детайли, не разбира автоматично триизмерното пространство. Едва когато екипът обучил и самия зрително-езиков модел със задачи за пространствено разбиране, ефективността се подобрила значително, което означава, че способността за пространствено разбиране на пътните сцени трябва да бъде изградена целенасочено.

Четири реда със сцени, съдържащи изображения от камери с различни гледни точки, 3D откриване на обекти от птичи поглед, семантични карти на заетостта и BEV сегментиране на картата, като във всеки случай прогнозата на модела се сравнява с еталонната истина.
Моделът възстановява изглед отгоре на всяка сцена от изображенията на камерите, показвайки превозни средства, пешеходци и пътна маркировка. Вдясно прогнозата е показана до действителната ситуация. | Изображение: Qwen

Обучението започва с модула за възприятие, след което комбинира възприятие и отговаряне на въпроси, а накрая добавя планиране на маршрута. Последната стъпка усъвършенства поведението на модела чрез обучение с подсилване. За зрително-езиковия компонент екипът комбинирал 24 публично достъпни набора от данни с пътни сцени. Тези набори имали различни структури и понякога съдържали грешки. AI модел стандартизирал въпросите и отговорите и ги съгласувал с първоначалните данни. Екипът също така създал собствени примери, обясняващи защо автомобилът трябва да вземе конкретно решение при шофиране, например кой обект задейства спирането.

Един модел и за купето, и за системата за управление

В съвременните автомобили информационно-развлекателната система и системата за управление се обединяват в един изчислителен блок, вместо да работят на два отделни контролера. Авторите твърдят, че модел, разменящ общите си способности за чиста ефективност при шофиране, не е полезен в този случай, тъй като купето все пак ще се нуждае от собствен модел и допълнителни изчислителни ресурси за задачи като диалог или въпроси с отворен отговор.

Две радарни диаграми, сравняващи Qwen-Drive-1.0 с модели като Qwen3.5-4B, MiMo-Embodied-7B и InternVL3.5-8B в категориите Driving VQA, General VQA, 3D Perception и Motion Planning.
В собствените тестове на Qwen Qwen-Drive 1.0 превъзхожда специализираните модели в повечето категории за шофиране и възприятие. | Изображение: Qwen

Според статията Qwen-Drive 1.0 се представя значително по-добре от немодифицирания базов модел Qwen3.5-4B при въпроси за пътни сцени. Най-голямата разлика се проявява, когато моделът трябва да обясни причина и следствие, например защо автомобилът трябва да спре или да завие. Общите знания също се запазват: моделът показва почти никакъв спад на тестове извън шофирането и дори постига малко по-висок резултат при някои пространствени задачи.

От симулацията към пътя

За планирането на шофирането екипът тествал модела на няколко нива на трудност — от прости прогнози до симулатор, в който грешките се натрупват с времето. В симулатора версията, дообучена с награди, намалила дела на случаите, в които автомобилът излиза от пътя, от 24 на 12 процента. Тя също така шофирала по-предпазливо и изминала по-малко разстояние като цяло.

Три сцени на шофиране в отворен контур с текстови разсъждения и прогнозирани траектории отгоре, както и осем времеви стъпки в затворен контур от две изпълнения на AlpaSim с изображения от камери и графики на траекториите отдолу.
Във всеки сценарий моделът обяснява решението си при шофиране, например спиране заради животно на пътя или спиране на червен светофар. Синята линия показва планирания маршрут. | Изображение: Qwen

Обясненията на модела обаче не винаги посочват точно действителната причина за дадена ситуация. Червен светофар в далечината и дете, което стъпва на пътя, изискват много различно време за реакция, а моделът може да ги смеси. Планираната маневра също не винаги съвпада с разсъжденията, които моделът е дал предварително. Някои резултати се основават на тестови процедури, разработени или възстановени от самите автори, така че отделните показатели не казват много за това как системата би се справила с хаотичното шофиране в реалния свят.

Четири реда със сцени и изображения от камери с непознати конфигурации в WOD-E2E и PAI-AV, показващи резултати от 3D откриване, заетост и сегментиране на картата без сравнение с еталонната истина.
Моделът открива значително по-малко обекти, когато обработва записи от други превозни средства с различни конфигурации на камерите. Подходящи данни за обучение за тези конфигурации все още липсват. | Изображение: Qwen

Екипът на Qwen измерил самата тази празнина в пространственото разбиране чрез своя тест HopChain. Тук зрително-езиковите модели класифицирали неправилно обекти и обърквали пространствените отношения, дори когато получавали добри резултати на тестове за изображения и текст. Катастрофалното забравяне също е познат проблем. Когато Google DeepMind създаде PaLM-E през 2023 г., модел за език, изображения и управление на роботи, по-малките варианти загубили голяма част от езиковите си способности след обучение с роботи. Най-голямата версия, със 562 милиарда параметъра, загубила почти нищо.

Съчетаването на езиков модел с функция за шофиране отваря нова повърхност за атаки. Изследователи от UC Santa Cruz поставили знак с надпис в зрителното поле на камерата и подмамили системата за шофиране DriveLM да завие към пресичащи пешеходци, въпреки че тя ги била открила правилно. Междувременно изследванията се насочват към World Action Models, които също предсказват как средата се променя в отговор на собствените действия на агента.

Екипът на Qwen предоставя модела безплатно на изследователската общност чрез Hugging Face, ModelScope и GitHub.

AI новини без сензацията — подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен AI бюлетин и нашия ексклузивен тримесечен доклад „AI Radar“ за водещите технологии, както и пълен достъп до архива и секцията за коментари.

Източник: Arxiv

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини