Sakhanda Wire
NVDA $225.16 -0.06% MSFT $495.40 -0.30% GOOGL $345.90 -0.13% META $589.85 -0.86% AMZN $262.65 -0.94%
← До новин

Новий бенчмарк підтверджує: моделі ШІ досі погано справляються з візуальним сприйняттям

Новий бенчмарк підтверджує, що моделі ШІ досі погано сприймають візуальну інформацію
Джонатан Кемпер
15 серпня 2026 року
Nano Banana Pro за запитом THE DECODER

Основні тези

  • Moonshot AI представила PerceptionBench — тест, який оцінює візуальне сприйняття мультимодальних моделей незалежно від логічного мислення та зовнішніх знань.
  • Тест оцінює базові візуальні здібності на основі помилок у реальному світі. Усі провідні моделі, зокрема GPT-5.6 Sol, Kimi K3 і Claude Fable 5, продемонстрували значні слабкі місця під час оцінювання.
  • Автори доходять висновку, що багато так званих логічних помилок насправді спричинені хибним візуальним сприйняттям. Це підтверджує попередні дослідження, які показали, що навіть найкращі моделі не справляються з базовими візуальними завданнями.

PerceptionBench від Moonshot AI перевіряє, наскільки добре мультимодальні моделі ШІ насправді «бачать», окремо від логічного мислення. Жодна передова модель не досягає точності 60 відсотків, а GPT-5.6 Sol випереджає інших із невеликим відривом. Багато передбачуваних помилок у міркуваннях насправді виникають уже на етапі зчитування зображення.

Команда, яка створила китайського AI-асистента Kimi, представила PerceptionBench — бенчмарк, що виокремлює та перевіряє візуальне сприйняття мультимодальних мовних моделей. На відміну від стандартних методів тестування, PerceptionBench розкладає зір на десять базових навичок, а не об’єднує сприйняття, знання та міркування в одному завданні. На кожне запитання можна відповісти, просто подивившись на зображення; міркування чи зовнішні знання не потрібні.

Категорії, сформовані на основі реальних помилок, а не теорії

Автори пояснюють свій підхід, зазначаючи, що наявні бенчмарки охоплюють лише вузький спектр помилок сприйняття. Проаналізовані ними 42 бенчмарки з відкритим кодом мають незначний перетин профілів помилок, тому кожен із них охоплює окремий набір візуальних слабких місць. Жодного одного тесту чи невеликої групи тестів було недостатньо, щоб охопити візуальне сприйняття в цілому.

Замість того щоб заздалегідь визначати категорії, автори побудували свою таксономію на основі реальних помилок моделей і простежили кожну з них до найпершого невдалого кроку в наявних бенчмарках. У результаті сформувалося десять «сфер навичок»: візуальні зв’язки, підрахунок, атрибути, глибина та 3D, локалізація, порівняння, дрібнозернисте розпізнавання, інтеграція контексту, OCR і галюцинації.

Чотири приклади показують, як PerceptionBench розкладає багатокрокові завдання на окремі запитання щодо сприйняття, перевіряючи моделі на підрахунку, просторовому мисленні та візуальному розпізнаванні.
Чотири приклади показують, як багатокрокові завдання можна розкласти на окремі запитання щодо сприйняття. | Зображення: Moonshot AI

Із внутрішнього набору, що містить понад 17 000 перевірених запитань, Moonshot AI публікує 3 000 завдань. Шістдесят відсотків із них створено на основі зафіксованих помилок моделей, а 40 відсотків переформульовано за допомогою доповнених зображень. На перший погляд завдання здаються простими: визначити, де на циферблаті розташований символ, порахувати квіти всередині червоної коробки або вирішити, на якому з двох стаканчиків для олівців зображено сіро-рожеве поєднання, а на якому — суцільний рожевий колір із мультяшним дизайном.

Жодна модель не подолала позначку 60 відсотків

Серед 16 протестованих передових моделей найвищу загальну точність — 59,7 відсотка — показала GPT-5.6 Sol. Далі йдуть Kimi K3 із 58,5 відсотка, Claude Fable 5 із 57,2 відсотка та Gemini 3.1 Pro із 56,2 відсотка. GPT-5.5 отримала 55,8 відсотка. Моделі з відкритим кодом, як-от Qwen3.5-397B-A17B (47,5 відсотка) і GLM-4.6V (32,5 відсотка), значно відстають.

Стовпчикова діаграма показує загальну точність 16 мультимодальних моделей у PerceptionBench. GPT-5.6 Sol лідирує з результатом 59,7 відсотка, за нею йдуть Kimi K3 із 58,5 і Claude Fable 5 із 57,2 відсотка. GLM-4.6V посідає останнє місце з результатом 32,5 відсотка.
Жодна модель не подолала позначку 60 відсотків, а розрив між першими п’ятьма системами становить трохи менше чотирьох відсоткових пунктів. | Зображення: Moonshot

Результати за окремими категоріями показовіші за загальний рейтинг. Моделі з майже однаковими сукупними балами різко відрізняються в окремих категоріях. У середньому «галюцинації» — найслабша навичка всіх моделей. GPT-5.6 Sol набрала тут лише 26,9 відсотка, попри перше місце в загальному рейтингу, тоді як слабша Gemini 3.5 Flash увійшла до числа найкращих із результатом 50,6 відсотка. Цей субтест перевіряє, чи вигадують моделі об’єкти, яких не існує, коли правильною відповіддю є просто «нуль».

Теплова карта відображає 21 тип помилок у 42 оцінених бенчмарках. Інтенсивність кольору вказує на частку кожного типу помилок у бенчмарку; пікові значення становлять 0,99 для глибини та 3D у DA-2K, 0,93 для візуального підрахунку в CountBench і 0,87 для візуальної локалізації у ScreenSpotV2.
Кожен бенчмарк охоплює лише вузький набір можливих помилок сприйняття. Десять категорій PerceptionBench виділено червоним. | Зображення: Moonshot AI

Багато «помилок у міркуваннях» насправді є збоями сприйняття

Автори стверджують, що багато збоїв мультимодальних моделей, які зазвичай списують на «помилки в міркуваннях», насправді виникають на рівні сприйняття. Коли модель неправильно виконує багатокрокове завдання, перший крок — правильне зчитування зображення — часто вже виявляється помилковим.

PerceptionBench розкладає такі запитання на підзапитання, що стосуються лише сприйняття, завдяки чому можна точно визначити, яка конкретна візуальна здатність дає збій. Набір даних і код оцінювання доступні на GitHub за адресою MoonshotAI/PerceptionBench.

Добре відома проблема, у розв’язанні якої мало прогресу

Moonshot AI розробляє модель із відкритим кодом Kimi K3, яка скоротила відставання від Claude Fable 5 і GPT-5.6 Sol до кількох пунктів у загальних бенчмарках. K3 досі значно відстає в спеціалізованих сферах, як-от наступальна кібербезпека і складна математика. У візуальному сприйнятті K3 тепер демонструє результати на рівні своїх західних конкурентів.

Та сама дослідницька команда раніше випустила WorldVQA — бенчмарк, що відокремлює розпізнавання об’єктів від міркувань. Найкраща модель у ньому, Gemini 3 Pro, не досягла 50 відсотків, набравши 47,4 відсотка, а всі моделі систематично завищували власну впевненість.

В окремому дослідженні китайських установ за участю Moonshot AI використали бенчмарк BabyVision, щоб показати: передові моделі не справляються з базовими візуальними завданнями, пов’язаними з розвитком дітей раннього віку, як-от обведення ліній або підрахунок прихованих блоків. Gemini 3 Pro набрала в цих завданнях 49,7 відсотка, тоді як люди — 94,1 відсотка. Дослідники пояснюють цей розрив вузьким місцем вербалізації, через яке візуальна інформація перетворюється на мову та втрачає точність.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ та ексклюзивний передовий звіт «AI Radar» шість разів на рік, мати повний доступ до архіву й розділу коментарів.

Джерело: Moonshot AI

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини