Qwen-Drive 1.0 ви казва защо спира, но не очаквайте обяснението да съвпада с маневрата
Основни моменти
- Qwen-Drive 1.0 на Alibaba обработва пространственото възприятие, въпросите за трафика и планирането на маршрута в един AI модел.
- Два модула за 3D картографиране и планиране на маршрута разширяват базовия езиков модел, позволявайки на AI да работи едновременно като система за управление и асистент в купето, без да губи съществуващите си знания.
- Допълнителното обучение намали дела на случаите, в които автомобилът излиза от пътя, от 24 процента на 12 процента в симулации. Обясненията на модела обаче не винаги съвпадат с решенията му при шофиране.
Qwen-Drive 1.0 изпълнява три задачи в един AI модел: пространствено възприятие на средата, отговаряне на въпроси за трафика и планиране на маршрута. Изследователите потвърждават, че текстово-изображенският модел не разбира автоматично триизмерното пространство само защото може да описва изображения.
Съществуващите модели за шофиране вземат общ текстово-изображенски модел и го дообучават с данни за шофиране, предимно двойки въпроси и отговори за пътни ситуации. Според статията този подход има две слабости. Модел, обучен основно с въпроси и отговори за трафика, все още не може надеждно да открива разстояния, позиции и свободни пространства. А ако стане прекалено специализиран в данните за шофиране, той губи широките общи знания от първоначалното си обучение чрез това, което изследователите наричат „катастрофално забравяне“ — именно знанията, които са най-важни в редки и неочаквани пътни ситуации. Моделът, създаден от изследователския отдел на Alibaba, трябва да реши и двата проблема.
Отделен модул проверява дали моделът действително разбира пространството
Qwen-Drive-1.0 е изграден върху Qwen3.5-4B, пуснат през февруари, и добавя два допълнителни компонента. Първият създава карта на околността, видяна от птичи поглед, като открива обекти в 3D пространството, определя кои области са заети и проследява структурата на пътя. Изследователите казват, че той служи и като измервателен инструмент, който показва колко пространствена информация моделът действително извлича от изображенията.

Вторият компонент, Planning Expert, използва вътрешни данни от модела, за да планира бъдещото движение на автомобила. Когато изследователите обучили само добавения компонент, без да променят зрително-езиковия модел, пространствената точност останала ниска, потвърждавайки, че модел, способен да описва изображения в детайли, не разбира автоматично триизмерното пространство. Едва когато екипът обучил и самия зрително-езиков модел със задачи за пространствено разбиране, ефективността се подобрила значително, което означава, че способността за пространствено разбиране на пътните сцени трябва да бъде изградена целенасочено.

Обучението започва с модула за възприятие, след което комбинира възприятие и отговаряне на въпроси, а накрая добавя планиране на маршрута. Последната стъпка усъвършенства поведението на модела чрез обучение с подсилване. За зрително-езиковия компонент екипът комбинирал 24 публично достъпни набора от данни с пътни сцени. Тези набори имали различни структури и понякога съдържали грешки. AI модел стандартизирал въпросите и отговорите и ги съгласувал с първоначалните данни. Екипът също така създал собствени примери, обясняващи защо автомобилът трябва да вземе конкретно решение при шофиране, например кой обект задейства спирането.
Един модел и за купето, и за системата за управление
В съвременните автомобили информационно-развлекателната система и системата за управление се обединяват в един изчислителен блок, вместо да работят на два отделни контролера. Авторите твърдят, че модел, разменящ общите си способности за чиста ефективност при шофиране, не е полезен в този случай, тъй като купето все пак ще се нуждае от собствен модел и допълнителни изчислителни ресурси за задачи като диалог или въпроси с отворен отговор.

Според статията Qwen-Drive 1.0 се представя значително по-добре от немодифицирания базов модел Qwen3.5-4B при въпроси за пътни сцени. Най-голямата разлика се проявява, когато моделът трябва да обясни причина и следствие, например защо автомобилът трябва да спре или да завие. Общите знания също се запазват: моделът показва почти никакъв спад на тестове извън шофирането и дори постига малко по-висок резултат при някои пространствени задачи.
От симулацията към пътя
За планирането на шофирането екипът тествал модела на няколко нива на трудност — от прости прогнози до симулатор, в който грешките се натрупват с времето. В симулатора версията, дообучена с награди, намалила дела на случаите, в които автомобилът излиза от пътя, от 24 на 12 процента. Тя също така шофирала по-предпазливо и изминала по-малко разстояние като цяло.

Обясненията на модела обаче не винаги посочват точно действителната причина за дадена ситуация. Червен светофар в далечината и дете, което стъпва на пътя, изискват много различно време за реакция, а моделът може да ги смеси. Планираната маневра също не винаги съвпада с разсъжденията, които моделът е дал предварително. Някои резултати се основават на тестови процедури, разработени или възстановени от самите автори, така че отделните показатели не казват много за това как системата би се справила с хаотичното шофиране в реалния свят.

Екипът на Qwen измерил самата тази празнина в пространственото разбиране чрез своя тест HopChain. Тук зрително-езиковите модели класифицирали неправилно обекти и обърквали пространствените отношения, дори когато получавали добри резултати на тестове за изображения и текст. Катастрофалното забравяне също е познат проблем. Когато Google DeepMind създаде PaLM-E през 2023 г., модел за език, изображения и управление на роботи, по-малките варианти загубили голяма част от езиковите си способности след обучение с роботи. Най-голямата версия, със 562 милиарда параметъра, загубила почти нищо.
Съчетаването на езиков модел с функция за шофиране отваря нова повърхност за атаки. Изследователи от UC Santa Cruz поставили знак с надпис в зрителното поле на камерата и подмамили системата за шофиране DriveLM да завие към пресичащи пешеходци, въпреки че тя ги била открила правилно. Междувременно изследванията се насочват към World Action Models, които също предсказват как средата се променя в отговор на собствените действия на агента.
Екипът на Qwen предоставя модела безплатно на изследователската общност чрез Hugging Face, ModelScope и GitHub.
AI новини без сензацията — подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен AI бюлетин и нашия ексклузивен тримесечен доклад „AI Radar“ за водещите технологии, както и пълен достъп до архива и секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.