Нов бенчмарк потвърждава: моделите на ИИ все още се справят зле с визуалното възприятие
Основни моменти
- Moonshot AI представи PerceptionBench — тест, който оценява визуалното възприятие на мултимодални модели независимо от логическото разсъждение и външните знания.
- Тестът оценява основни визуални способности въз основа на грешки от реалния свят. Всички водещи модели, включително GPT-5.6 Sol, Kimi K3 и Claude Fable 5, показаха значителни слабости при оценяването.
- Авторите заключават, че много от предполагаемите логически грешки всъщност са причинени от неправилно визуално възприятие. Това потвърждава по-ранни проучвания, показващи, че дори най-добрите модели се провалят при базови визуални задачи.
PerceptionBench на Moonshot AI проверява доколко добре мултимодалните AI модели действително могат да „виждат“, отделно от логическото разсъждение. Нито един водещ модел не достига 60 процента точност, а GPT-5.6 Sol води с малка преднина. Много от предполагаемите грешки при разсъждение всъщност възникват още на етапа на разчитане на изображението.
Екипът зад китайския AI асистент Kimi представи PerceptionBench — бенчмарк, който изолира и проверява визуалното възприятие на мултимодалните езикови модели. За разлика от стандартните методи за тестване, PerceptionBench разделя зрението на десет атомарни подумения, вместо да обединява възприятието, знанията и разсъждението в една задача. На всеки въпрос може да се отговори само чрез разглеждане на изображението, без да са необходими разсъждение или външни знания.
Категории, изградени от реални грешки, а не от теория
Авторите обясняват подхода си, като посочват, че съществуващите бенчмаркове улавят само тесен спектър от грешки на възприятието. 42-та бенчмарка с отворен код, които са анализирали, показват малко припокриване в профилите си на грешки, така че всеки от тях обхваща различен набор от визуални слабости. Нито един тест или малка група от тестове не е била достатъчна за цялостното обхващане на визуалното възприятие.
Вместо предварително да определят категориите, авторите изграждат своята таксономия от действителни грешки на моделите и проследяват всяка от тях до най-ранната неуспешна стъпка в съществуващите бенчмаркове. Резултатът е десет „области на уменията“: визуални отношения, броене, атрибути, дълбочина и 3D, локализация, сравнение, финозърнесто разпознаване, интегриране на контекста, OCR и халюцинации.

От вътрешен набор от над 17 000 проверени въпроса Moonshot AI публикува 3 000 задачи. Шейсет процента са извлечени от приписани на моделите грешки, а 40 процента са преформулирани с помощта на разширени изображения. На пръв поглед задачите изглеждат тривиални: да се определи къде се намира символ на циферблат на часовник, да се преброят цветята в червена кутия или да се реши коя от две чаши за моливи показва комбинация от сиво и розово, а не плътно розов цвят с анимационен дизайн.
Нито един модел не надхвърля 60 процента
Сред 16-те водещи модела, които са тествани, най-високата обща точност е 59,7 процента — резултат на GPT-5.6 Sol. Следват Kimi K3 с 58,5 процента, Claude Fable 5 с 57,2 процента и Gemini 3.1 Pro с 56,2 процента. GPT-5.5 постига 55,8 процента. Моделите с отворен код като Qwen3.5-397B-A17B (47,5 процента) и GLM-4.6V (32,5 процента) изостават значително.

Резултатите по категории са по-показателни от общото класиране. Модели с почти идентични общи резултати се разминават рязко в отделните категории. Средно „халюцинациите“ са най-слабото умение при всички модели. GPT-5.6 Sol постига там само 26,9 процента, въпреки че заема първо място като цяло, докато по-слабият Gemini 3.5 Flash е сред най-добрите с 50,6 процента. Този подтест проверява дали моделите измислят обекти, които не съществуват, когато правилният отговор е просто „нула“.

Много „грешки при разсъждение“ всъщност са провали на възприятието
Авторите твърдят, че много от провалите на мултимодалните модели, които обикновено се приписват на „грешки при разсъждение“, всъщност възникват на ниво възприятие. Когато моделът се провали при многостъпкова задача, първата стъпка — правилното разчитане на изображението — често вече е била изпълнена неправилно.
PerceptionBench разделя тези въпроси на под въпроси, свързани единствено с възприятието, което позволява да се установи точно коя визуална способност не функционира. Наборът от данни и кодът за оценяване са достъпни в GitHub на MoonshotAI/PerceptionBench.
Добре известен проблем с малък напредък
Moonshot AI разработва модела с отворен код Kimi K3, който е съкратил разликата с Claude Fable 5 и GPT-5.6 Sol до няколко пункта при общите бенчмаркове. K3 все още изостава значително в специализирани области като офанзивната киберсигурност и сложната математика. При визуалното възприятие K3 вече се представя наравно със западните си конкуренти.
Същият изследователски екип вече представи WorldVQA — бенчмарк, който отделя разпознаването на обекти от разсъждението. Най-добрият модел там, Gemini 3 Pro, не успя да достигне 50 процента, като постигна 47,4 процента, а всички модели систематично надценяваха собствената си увереност.
Отделно проучване на китайски институции, с участието на Moonshot AI, използва бенчмарка BabyVision, за да покаже, че водещите модели се провалят при базови визуални задачи, свързани с развитието в ранна детска възраст, като проследяване на линии или броене на скрити блокчета. Gemini 3 Pro постига 49,7 процента при тези задачи, докато хората достигат 94,1 процента. Изследователите обясняват тази разлика с пречка при вербализацията, при която визуалната информация се превежда на езика и губи точността си.
AI новини без сензацията — подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен AI бюлетин и нашия ексклузивен водещ доклад „AI Radar“ шест пъти годишно, както и пълен достъп до архива и секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.