Новий бенчмарк підтверджує: моделі ШІ досі погано справляються з візуальним сприйняттям
Основні тези
- Moonshot AI представила PerceptionBench — тест, який оцінює візуальне сприйняття мультимодальних моделей незалежно від логічного мислення та зовнішніх знань.
- Тест оцінює базові візуальні здібності на основі помилок у реальному світі. Усі провідні моделі, зокрема GPT-5.6 Sol, Kimi K3 і Claude Fable 5, продемонстрували значні слабкі місця під час оцінювання.
- Автори доходять висновку, що багато так званих логічних помилок насправді спричинені хибним візуальним сприйняттям. Це підтверджує попередні дослідження, які показали, що навіть найкращі моделі не справляються з базовими візуальними завданнями.
PerceptionBench від Moonshot AI перевіряє, наскільки добре мультимодальні моделі ШІ насправді «бачать», окремо від логічного мислення. Жодна передова модель не досягає точності 60 відсотків, а GPT-5.6 Sol випереджає інших із невеликим відривом. Багато передбачуваних помилок у міркуваннях насправді виникають уже на етапі зчитування зображення.
Команда, яка створила китайського AI-асистента Kimi, представила PerceptionBench — бенчмарк, що виокремлює та перевіряє візуальне сприйняття мультимодальних мовних моделей. На відміну від стандартних методів тестування, PerceptionBench розкладає зір на десять базових навичок, а не об’єднує сприйняття, знання та міркування в одному завданні. На кожне запитання можна відповісти, просто подивившись на зображення; міркування чи зовнішні знання не потрібні.
Категорії, сформовані на основі реальних помилок, а не теорії
Автори пояснюють свій підхід, зазначаючи, що наявні бенчмарки охоплюють лише вузький спектр помилок сприйняття. Проаналізовані ними 42 бенчмарки з відкритим кодом мають незначний перетин профілів помилок, тому кожен із них охоплює окремий набір візуальних слабких місць. Жодного одного тесту чи невеликої групи тестів було недостатньо, щоб охопити візуальне сприйняття в цілому.
Замість того щоб заздалегідь визначати категорії, автори побудували свою таксономію на основі реальних помилок моделей і простежили кожну з них до найпершого невдалого кроку в наявних бенчмарках. У результаті сформувалося десять «сфер навичок»: візуальні зв’язки, підрахунок, атрибути, глибина та 3D, локалізація, порівняння, дрібнозернисте розпізнавання, інтеграція контексту, OCR і галюцинації.

Із внутрішнього набору, що містить понад 17 000 перевірених запитань, Moonshot AI публікує 3 000 завдань. Шістдесят відсотків із них створено на основі зафіксованих помилок моделей, а 40 відсотків переформульовано за допомогою доповнених зображень. На перший погляд завдання здаються простими: визначити, де на циферблаті розташований символ, порахувати квіти всередині червоної коробки або вирішити, на якому з двох стаканчиків для олівців зображено сіро-рожеве поєднання, а на якому — суцільний рожевий колір із мультяшним дизайном.
Жодна модель не подолала позначку 60 відсотків
Серед 16 протестованих передових моделей найвищу загальну точність — 59,7 відсотка — показала GPT-5.6 Sol. Далі йдуть Kimi K3 із 58,5 відсотка, Claude Fable 5 із 57,2 відсотка та Gemini 3.1 Pro із 56,2 відсотка. GPT-5.5 отримала 55,8 відсотка. Моделі з відкритим кодом, як-от Qwen3.5-397B-A17B (47,5 відсотка) і GLM-4.6V (32,5 відсотка), значно відстають.

Результати за окремими категоріями показовіші за загальний рейтинг. Моделі з майже однаковими сукупними балами різко відрізняються в окремих категоріях. У середньому «галюцинації» — найслабша навичка всіх моделей. GPT-5.6 Sol набрала тут лише 26,9 відсотка, попри перше місце в загальному рейтингу, тоді як слабша Gemini 3.5 Flash увійшла до числа найкращих із результатом 50,6 відсотка. Цей субтест перевіряє, чи вигадують моделі об’єкти, яких не існує, коли правильною відповіддю є просто «нуль».

Багато «помилок у міркуваннях» насправді є збоями сприйняття
Автори стверджують, що багато збоїв мультимодальних моделей, які зазвичай списують на «помилки в міркуваннях», насправді виникають на рівні сприйняття. Коли модель неправильно виконує багатокрокове завдання, перший крок — правильне зчитування зображення — часто вже виявляється помилковим.
PerceptionBench розкладає такі запитання на підзапитання, що стосуються лише сприйняття, завдяки чому можна точно визначити, яка конкретна візуальна здатність дає збій. Набір даних і код оцінювання доступні на GitHub за адресою MoonshotAI/PerceptionBench.
Добре відома проблема, у розв’язанні якої мало прогресу
Moonshot AI розробляє модель із відкритим кодом Kimi K3, яка скоротила відставання від Claude Fable 5 і GPT-5.6 Sol до кількох пунктів у загальних бенчмарках. K3 досі значно відстає в спеціалізованих сферах, як-от наступальна кібербезпека і складна математика. У візуальному сприйнятті K3 тепер демонструє результати на рівні своїх західних конкурентів.
Та сама дослідницька команда раніше випустила WorldVQA — бенчмарк, що відокремлює розпізнавання об’єктів від міркувань. Найкраща модель у ньому, Gemini 3 Pro, не досягла 50 відсотків, набравши 47,4 відсотка, а всі моделі систематично завищували власну впевненість.
В окремому дослідженні китайських установ за участю Moonshot AI використали бенчмарк BabyVision, щоб показати: передові моделі не справляються з базовими візуальними завданнями, пов’язаними з розвитком дітей раннього віку, як-от обведення ліній або підрахунок прихованих блоків. Gemini 3 Pro набрала в цих завданнях 49,7 відсотка, тоді як люди — 94,1 відсотка. Дослідники пояснюють цей розрив вузьким місцем вербалізації, через яке візуальна інформація перетворюється на мову та втрачає точність.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ та ексклюзивний передовий звіт «AI Radar» шість разів на рік, мати повний доступ до архіву й розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.