Sakhanda Wire
NVDA $225.16 -0.06% MSFT $495.40 -0.30% GOOGL $345.90 -0.13% META $589.85 -0.86% AMZN $262.65 -0.94%
← К новостям

Новый бенчмарк подтверждает: модели ИИ по-прежнему плохо справляются с визуальным восприятием

Новый бенчмарк подтверждает, что ИИ-модели по-прежнему плохо справляются с визуальным восприятием
Джонатан Кемпер
15 авг. 2026 г.
Nano Banana Pro по запросу THE DECODER

Ключевые моменты

  • Moonshot AI представила PerceptionBench — тест, который оценивает визуальное восприятие мультимодальных моделей независимо от логического мышления и внешних знаний.
  • Тест оценивает базовые визуальные способности на основе ошибок, возникающих в реальном мире. Все ведущие модели, включая GPT-5.6 Sol, Kimi K3 и Claude Fable 5, продемонстрировали значительные слабости в ходе оценки.
  • Авторы делают вывод, что многие предполагаемые логические ошибки на самом деле вызваны ошибками визуального восприятия. Это подтверждает более ранние исследования, показывающие, что даже лучшие модели не справляются с базовыми визуальными задачами.

PerceptionBench от Moonshot AI проверяет, насколько хорошо мультимодальные модели ИИ действительно могут «видеть», отдельно от логического мышления. Ни одна передовая модель не достигает точности в 60 процентов, а GPT-5.6 Sol лидирует с небольшим отрывом. Многие предполагаемые ошибки рассуждения на самом деле происходят уже на этапе чтения изображения.

Команда, стоящая за китайским ИИ-ассистентом Kimi, представила PerceptionBench — бенчмарк, который изолированно проверяет визуальное восприятие мультимодальных языковых моделей. В отличие от стандартных методов тестирования, PerceptionBench разбивает зрение на десять базовых навыков, вместо того чтобы объединять восприятие, знания и рассуждение в одну задачу. На каждый вопрос можно ответить, просто посмотрев на изображение, без рассуждений и внешних знаний.

Категории, основанные на реальных ошибках, а не на теории

Авторы объясняют свой подход тем, что существующие бенчмарки охватывают лишь узкий спектр ошибок восприятия. Проанализированные ими 42 бенчмарка с открытым исходным кодом демонстрируют небольшое пересечение профилей ошибок, поэтому каждый из них охватывает отдельное подмножество визуальных слабостей. Ни одного теста или небольшой группы тестов оказалось недостаточно для полноценной оценки визуального восприятия.

Вместо того чтобы заранее определять категории, авторы построили свою таксономию на основе фактических ошибок моделей и проследили каждую из них до самого раннего этапа сбоя в существующих бенчмарках. В результате получилось десять «областей навыков»: визуальные отношения, подсчёт, атрибуты, глубина и 3D, локализация, сравнение, детальное распознавание, интеграция контекста, OCR и галлюцинации.

Четыре тематических примера показывают, как PerceptionBench разбивает многоэтапные задачи на отдельные вопросы восприятия, проверяя модели на подсчёте, пространственном мышлении и визуальном распознавании.
Четыре тематических примера показывают, как многоэтапные задачи можно разбить на отдельные вопросы восприятия. | Изображение: Moonshot AI

Из внутреннего набора, включающего более 17 000 проверенных вопросов, Moonshot AI публикует 3 000 задач. Шестьдесят процентов из них были созданы на основе зафиксированных ошибок моделей, а 40 процентов — переформулированы с использованием дополненных изображений. На первый взгляд задачи кажутся тривиальными: определить, где находится символ на циферблате часов, посчитать цветы внутри красной коробки или решить, какая из двух подставок для карандашей демонстрирует сочетание серого и розового цветов, а какая — сплошной розовый цвет с мультяшным рисунком.

Ни одна модель не преодолела отметку в 60 процентов

Среди 16 протестированных передовых моделей наивысшая общая точность составила 59,7 процента — этот результат показала GPT-5.6 Sol. Далее следуют Kimi K3 с 58,5 процента, Claude Fable 5 с 57,2 процента и Gemini 3.1 Pro с 56,2 процента. GPT-5.5 набрала 55,8 процента. Модели с открытым исходным кодом, такие как Qwen3.5-397B-A17B (47,5 процента) и GLM-4.6V (32,5 процента), значительно отстают.

Столбчатая диаграмма, показывающая общую точность 16 мультимодальных моделей на PerceptionBench. GPT-5.6 Sol лидирует с результатом 59,7 процента, за ней следуют Kimi K3 с 58,5 и Claude Fable 5 с 57,2 процента. GLM-4.6V занимает последнее место с результатом 32,5 процента.
Ни одна модель не преодолела отметку в 60 процентов, а разрыв между пятью ведущими системами составляет чуть менее четырёх процентных пунктов. | Изображение: Moonshot

Результаты по отдельным категориям более показательны, чем общий рейтинг. Модели с почти одинаковыми совокупными баллами резко различаются в отдельных категориях. В среднем «галлюцинации» оказались самым слабым навыком у всех моделей. GPT-5.6 Sol набрала там лишь 26,9 процента, несмотря на первое место в общем зачёте, тогда как более слабая Gemini 3.5 Flash вошла в число лучших с результатом 50,6 процента. Этот подтест проверяет, придумывают ли модели несуществующие объекты, когда правильный ответ — просто «ноль».

Тепловая карта, отображающая 21 тип ошибок в 42 оцениваемых бенчмарках. Интенсивность цвета показывает долю каждого типа ошибок в рамках бенчмарка; пиковые значения составляют 0,99 для глубины и 3D в DA-2K, 0,93 для визуального подсчёта в CountBench и 0,87 для визуальной локализации в ScreenSpotV2.
Каждый бенчмарк охватывает лишь узкое подмножество возможных ошибок восприятия. Десять категорий PerceptionBench выделены красным. | Изображение: Moonshot AI

Многие «ошибки рассуждения» на самом деле являются сбоями восприятия

Авторы утверждают, что многие сбои мультимодальных моделей, которые обычно списывают на «ошибки рассуждения», на самом деле происходят на уровне восприятия. Когда модель неверно выполняет многоэтапную задачу, первый шаг — правильное чтение изображения — часто уже оказывается ошибочным.

PerceptionBench разбивает такие вопросы на подвопросы, касающиеся только восприятия, что позволяет точно определить, какая именно визуальная способность дала сбой. Датасет и код оценки доступны на GitHub: MoonshotAI/PerceptionBench.

Хорошо известная проблема, в решении которой почти нет прогресса

Moonshot AI разрабатывает модель с открытым исходным кодом Kimi K3, которая сократила отставание от Claude Fable 5 и GPT-5.6 Sol до нескольких пунктов в общих бенчмарках. K3 по-прежнему значительно отстаёт в специализированных областях, таких как наступательная кибербезопасность и сложная математика. В области визуального восприятия K3 теперь демонстрирует результаты на уровне западных конкурентов.

Та же исследовательская команда ранее выпустила WorldVQA — бенчмарк, отделяющий распознавание объектов от рассуждения. Лучшая модель в нём, Gemini 3 Pro, не достигла 50 процентов, набрав 47,4 процента, а все модели систематически переоценивали собственную уверенность.

В отдельном исследовании китайских учреждений при участии Moonshot AI использовался бенчмарк BabyVision, чтобы показать, что передовые модели не справляются с базовыми визуальными задачами, связанными с развитием в раннем детстве, такими как обведение линий или подсчёт скрытых блоков. Gemini 3 Pro набрала в этих задачах 49,7 процента, тогда как люди — 94,1 процента. Исследователи объясняют этот разрыв узким местом вербализации, при котором визуальная информация преобразуется в язык и теряет точность.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Moonshot AI

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости