Модели ИИ проваливают эти тесты на интеллект. А вы справитесь лучше?
Головоломки и игры занимают центральное место в развитии ИИ с самого начала. Подобно тому как мы, люди, любим проверять свою сообразительность с помощью кроссвордов или логических задач, разработчики могут оценивать прогресс моделей с помощью игровой полосы препятствий. Термин «машинное обучение» получил широкое распространение благодаря статье компьютерного специалиста IBM Артура Сэмюэла, опубликованной в 1959 году и посвящённой алгоритму, который научился играть в шашки. Шахматы и китайская настольная игра го также хорошо известны как испытательные полигоны для ИИ.
Если оценивать ИИ исключительно по его способности решать головоломки, он заметно и быстро совершенствуется. В конце 2024 года команда учёных из Колумбийского университета показала, что даже лучшие модели могли решить лишь 18% печально известных головоломок New York Times Connections; к началу 2025 года некоторые модели научились решать их почти идеально и практически каждый раз.
Но головоломки не просто демонстрируют неуклонный прогресс возможностей ИИ. Наблюдая за тем, где модели преуспевают и терпят неудачу, а также где мы, люди, всё ещё их превосходим, можно получить полезное представление о сильных и слабых сторонах этой технологии. Несмотря на достигнутый прогресс, современные модели всё ещё ошибаются: тонкие изменения в классических загадках часто сбивают их с толку, а визуальные головоломки представляют собой особенно слабое место.
Здесь у вас будет возможность проверить свою сообразительность на головоломках, которые в тот или иной момент ставили модели в тупик. Некоторые могут оказаться для вас такими же сложными, как и для ИИ; другие настолько просты, что заставят вас усомниться, действительно ли ИИ вообще обладает интеллектом. Каждая из них демонстрирует по меньшей мере одно различие между машинным и человеческим мышлением. Если вы успешно пройдёте испытание, то докажете, что способны решать головоломки лучше ИИ — по крайней мере пока.
Пространственное мышление
Начнём с области, в которой у людей есть огромное преимущество: пространственного мышления. Если вы когда-либо проходили тест на IQ, возможно, вам встречалась задача на мысленное вращение. В таких головоломках нужно определить, изображают ли разные картинки одни и те же объекты, показанные под разными углами. Хотя современные языковые модели обычно умеют анализировать визуальные данные, с такими головоломками они всё ещё справляются крайне плохо. Несмотря на все разговоры о том, как мировые модели могут помочь ИИ понимать физическое окружение, большие языковые модели, похоже, по-прежнему не способны манипулировать трёхмерными объектами так, как это делают люди с развитым пространственным мышлением — архитекторы и инженеры-механики.
Мысленное вращение
Инструкции: Выберите ответ, в котором объект из задания показан под другим углом. В каждом случае есть только один правильный ответ!
Память и способность к адаптации
Передовые большие языковые модели обладают необычайной памятью: во время обучения они усвоили огромное количество фактов и могут достоверно воспроизводить многие из них. Это даёт им преимущество перед людьми в викторинах, но может стать и недостатком. Когда головоломка очень похожа на задачу, которую модель видела во время обучения, она может не заметить ключевых различий и выдать заученный ответ.
Это подтвердило исследование 2024 года, в котором исследователи из Google и Иллинойсского университета в Урбане-Шампейне обучали и тестировали модели на слегка изменённых вариантах классического типа головоломок под названием «Рыцари и лжецы». В этих задачах одни персонажи всегда говорят правду, а другие всегда лгут, и нужно определить, кто есть кто. Тот же принцип может лежать в основе теста SimpleBench. Эти вопросы напоминают более сложные задачи, с которыми модели, вероятно, сталкивались во время обучения. Люди замечают подвох, а даже самые продвинутые модели попадаются.
Рыцари и лжецы
Инструкции: Чтобы решить эти головоломки, вам нужно знать только одно: рыцари всегда говорят правду, а лжецы всегда лгут. Определите, кто есть кто, исходя из высказываний каждого персонажа.
SimpleBench
Инструкции: Внимательно прочитайте эти задачи SimpleBench — и вы без труда сможете определить ответы.
Абстрактное и визуальное мышление
ИИ не просто путается в визуальных задачах в трёхмерном пространстве — его могут поставить в тупик и двухмерные задачи. Это существенно влияет на результаты моделей в самом известном бенчмарке, основанном на головоломках, — ARC-AGI. Эти задачи требуют вывести абстрактные, общие правила из набора примеров. Модели лучше справляются с головоломками ARC, когда получают каждую сетку не как изображение, а как строку чисел, кодирующую цвет каждой ячейки.
Исследования показывают, что даже когда модели правильно отвечают на вопросы ARC-AGI, они часто делают это с помощью причудливых и неприменимых в общем случае правил, тогда как люди опираются на простые визуальные концепции. Несмотря на эти недостатки, за последний год модели значительно улучшили результаты в ARC-AGI, однако некоторые головоломки — например, опубликованная здесь — всё ещё ставят их в тупик.
ARC-AGI
Инструкции: Изучите три пары сеток, показанные ниже, чтобы понять правило, определяющее, как сетки слева преобразуются в сетки справа. Затем возьмите маркеры или цветные карандаши и заполните четвёртую сетку, следуя этому правилу. (Решение будет одинаковым независимо от ориентации сеток.)
Интуиция
В ловушки попадаются не только модели ИИ. У нас, людей, есть собственные особенности мышления, многие из которых не свойственны ИИ. Психологи разработали наборы задач, противоположные феномену SimpleBench: отвечая на эти вопросы, люди часто дают первое пришедшее в голову решение, тогда как модели отвечают обдуманно. Некоторые задачи используют ошибки в том, как мы интуитивно выполняем математические действия; другие сформулированы так, чтобы подсказывать очевидные ответы, которые рассыпаются при внимательном прочтении вопроса.
Молниеносный раунд
Инструкции: Отвечайте на вопросы ниже как можно быстрее.
Возрастающая сложность
В некоторых случаях способность большой языковой модели решить головоломку зависит от масштаба задачи. Исследователи Apple обнаружили, что большие языковые модели могут безупречно решать простые варианты задачи о Ханойской башне, в которой нужно по одному перемещать стопку дисков, ни разу не положив больший диск на меньший, а также головоломки о переправе через реку, где группе людей нужно пересечь реку в соответствии с определёнными правилами. Но лишь до определённого момента: когда число дисков или людей достигало шести и более, модели начинали давать сбои.
В другом исследовании учёные из Вашингтонского университета, Стэнфордского университета и Института Аллена по искусственному интеллекту заметили, что большие языковые модели испытывают аналогичные трудности с логическими таблицами, где требуется вывести характеристики группы людей из списка подсказок. Статья Apple стала вирусной, но комментаторы задались вопросом, свидетельствуют ли результаты об уникальном ограничении логического мышления моделей или же лишь о том, что ошибки естественным образом накапливаются по мере усложнения задачи.
Переправа через реку
Инструкции: Используя описанный сценарий, спланируйте необходимые переправы, чтобы перевезти всех на другой берег реки.
Логическая таблица
Инструкции: Используя список подсказок, определите, кто живёт в каждом доме и какой музыкальный стиль нравится каждому человеку. Возможен только один вариант решения. Возможно, вам будет полезно заполнить таблицу ниже, чтобы отслеживать свои выводы.
Грейс Хакинс — репортёр по вопросам ИИ в MIT Technology Review. У неё есть докторская степень по нейронаукам.
Авторы и источники:
Мысленное вращение: CC BY 4.0. Stogiannidis, Ilias, Steven McDonagh, Sotirios A. Tsaftaris. Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models (copyright 2025); иллюстрации Джона Макнилла. Рыцари и лжецы: предоставлено Дэном Макинноном. Simplebench: CC BY 4.0. SimpleBench Team. The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models (copyright 2024). ARC-AGI: предоставлено ARC Prize Foundation. Молниеносный раунд: CC BY 4.0. Hagendorff, Thilo, Sarah Fabi, Michal Kosinski. Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT. Nat Comput Sci 3, 833–838 (copyright 2023). Переправа через реку: адаптировано из Propositiones ad Acuendos Juvenes, Алкуина Йоркского (ок. 800 г. н. э.). Логическая таблица: Apache License 2.0. Lin, Bill Y., Ronan Le Bras, Kyle Richardson, et al. ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning (copyright 2025)
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.