Sakhanda Wire
NVDA $209.66 -1.59% MSFT $496.37 +0.95% GOOGL $342.00 -1.43% META $576.14 +1.07% AMZN $260.28 -0.30%
← До новин

Моделі ШІ провалюють ці тести на інтелект. А ви впораєтеся краще?

Головоломки та ігри були в центрі розвитку ШІ від самого початку. Так само як ми, люди, любимо випробовувати свою кмітливість у кросвордах чи логічних головоломках, розробники можуть перевіряти, наскільки просунулися моделі, за допомогою ігрового марафону. Термін «машинне навчання» набув популярності завдяки статті 1959 року комп’ютерного науковця IBM Артура Семюела про алгоритм, який навчився грати в шашки. Шахи та китайська настільна гра ґо також є відомими тестовими майданчиками для ШІ. 

Якщо оцінювати ШІ суто за його здібностями до розв’язання головоломок, він значно й швидко вдосконалюється. Наприкінці 2024 року команда науковців із Колумбійського університету показала, що навіть найкращі моделі могли розв’язати лише 18% сумнозвісних головоломок New York Times Connections; на початку 2025 року деякі моделі вже могли майже щоразу розв’язувати їх бездоганно. 

Але головоломки не лише демонструють невпинний розвиток можливостей ШІ. Спостерігаючи, де моделі досягають успіху, а де зазнають невдач — і де ми, люди, досі їх перевершуємо, — можна отримати корисне уявлення про сильні та слабкі сторони цієї технології. Попри прогрес, сучасні моделі все ще помиляються: незначні зміни в класичних загадках часто збивають їх із пантелику, а візуальні головоломки є особливо слабким місцем. 

Тут ви матимете змогу випробувати свою кмітливість на головоломках, які свого часу ставили моделі в глухий кут. Деякі можуть виявитися для вас такими ж складними, як і для ШІ; інші настільки прості, що ви почнете сумніватися, чи справді ШІ взагалі розумний. Кожна з них висвітлює принаймні одну відмінність між машинним і людським мисленням. Якщо ви успішно пройдете тест, то доведете, що можете перевершити ШІ в розв’язанні головоломок — принаймні поки що. 


Просторове мислення

Почнімо зі сфери, де люди мають величезну перевагу: просторового мислення. Якщо ви коли-небудь проходили тест на IQ, то, можливо, розв’язували завдання на уявне обертання. У таких головоломках потрібно визначити, чи зображують різні картинки ті самі об’єкти під різними кутами. Хоча сучасні мовні моделі зазвичай уміють аналізувати візуальні дані, у таких головоломках вони й досі зазнають нищівних невдач. Попри всі розмови про те, як моделі світу можуть допомогти ШІ розуміти фізичне середовище, великі мовні моделі, здається, досі не здатні маніпулювати тривимірними об’єктами так, як це роблять люди з розвиненим просторовим мисленням — архітектори та інженери-механіки.

Уявне обертання

Інструкції: Виберіть відповідь, яка показує об’єкт із завдання, але під іншим кутом. У кожному випадку є лише одна правильна відповідь!


Пам’ять і здатність до адаптації

Передові великі мовні моделі мають надзвичайну пам’ять: під час навчання вони опрацювали величезний обсяг фактів і можуть достовірно відтворити багато з них. Це дає їм перевагу над людьми у вікторинах, але водночас може бути й недоліком. Коли головоломка дуже схожа на ту, яку модель бачила під час навчання, вона може не помітити ключових відмінностей і відповісти тим, що запам’ятала. 

Це підтвердилося у дослідженні 2024 року, під час якого дослідники з Google та Іллінойського університету в Урбана-Шампейні навчали й тестували моделі на незначних варіаціях класичного типу головоломок під назвою «Лицарі та брехуни». У таких завданнях одні персонажі завжди говорять правду, а інші завжди брешуть, і потрібно визначити, хто є хто. Той самий принцип може діяти й у тесті SimpleBench. Ці запитання схожі на складніші задачі, з якими моделі, ймовірно, стикалися під час навчання. Люди помічають підступ, але навіть найкращі моделі спотикаються.

Лицарі та брехуни

Інструкції: Єдине, що потрібно знати для розв’язання цих головоломок: лицарі завжди говорять правду, а брехуни завжди брешуть. На основі того, що говорить кожен персонаж, визначте, хто є хто.

SimpleBench

Інструкції: Уважно прочитайте ці завдання SimpleBench — і ви зможете дуже швидко знайти відповіді.


Абстрактне та візуальне мислення

ШІ плутається не лише у візуальних завданнях у 3D — його можуть спантеличити й двовимірні задачі. Це значною мірою пояснює, наскільки добре моделі справляються з найвідомішим бенчмарком на основі головоломок ARC-AGI. Ці завдання вимагають вивести абстрактні, загальні правила з набору прикладів. Моделі краще розв’язують головоломки ARC, коли отримують кожну сітку не як зображення, а як рядок чисел, що кодує колір кожної клітинки. 

Дослідження свідчать, що навіть коли моделі правильно відповідають на запитання ARC-AGI, вони часто роблять це за допомогою химерних правил, які не узагальнюються, тоді як люди спираються на прості візуальні концепції. Попри ці недоліки, за останній рік моделі стали досить добре розв’язувати ARC-AGI, але деякі головоломки — зокрема надрукована тут — досі ставлять їх у глухий кут.

ARC-AGI

Інструкції: Вивчіть три пари сіток нижче, щоб визначити правило, за яким сітки ліворуч перетворюються на сітки праворуч. Потім візьміть фломастери або кольорові олівці й заповніть четверту сітку відповідно до цього правила. (Розв’язання буде однаковим незалежно від орієнтації сіток.)


Інтуїція

У пастки потрапляють не лише моделі ШІ. Ми, люди, також маємо власні когнітивні слабкості, багатьох із яких ШІ не поділяє. Психологи розробили набори задач, протилежні феномену SimpleBench: у цих запитаннях люди часто дають імпульсивні відповіді, тоді як моделі відповідають обдумано. Деякі задачі використовують помилки в тому, як ми інтуїтивно виконуємо математичні дії; інші сформульовані так, щоб підказувати очевидні відповіді, які розсипаються, якщо уважно прочитати запитання. 

Бліц-тур

Інструкції: Відповідайте на наведені нижче запитання якомога швидше.


Зростання складності

У деяких випадках те, чи може велика мовна модель розв’язати головоломку, залежить від її масштабу. Дослідники Apple виявили, що великі мовні моделі можуть бездоганно розв’язувати прості варіанти задачі про Ханойську вежу, яка передбачає переміщення стопки дисків по одному, ніколи не кладучи більший диск на менший, а також задачі про переправу через річку, у яких група людей має перетнути річку за певними правилами. Але лише до певної межі: коли кількість дисків або людей досягала шести й більше, моделі починали давати збої.

В іншому дослідженні науковці з Вашингтонського університету, Стенфордського університету та Інституту штучного інтелекту Аллена помітили, що великі мовні моделі так само не справляються з логічними сітками — головоломками, у яких потрібно визначити характеристики групи людей на основі переліку підказок. Стаття Apple стала вірусною, але оглядачі поставили під сумнів, чи свідчать результати про унікальне обмеження міркувань великих мовних моделей, чи лише про те, що помилки є нормальним явищем у міру зростання складності.

Річка

Інструкції: Використовуючи описаний сценарій, сплануйте необхідні переправи, щоб перевезти всіх через річку. 

Логічна сітка

Інструкції: Використовуючи перелік підказок, визначте, хто живе в кожному будинку та який стиль музики подобається кожній людині. Існує лише одне можливе рішення. Для відстеження своїх висновків вам може бути корисно заповнити наведену нижче сітку.



Ґрейс Гакінс — журналістка, яка пише про ШІ в MIT Technology Review. Вона має докторський ступінь із нейронаук.


Учасники:

Уявне обертання: CC BY 4.0. Стогіаннідіс, Іліас, Стівен Макдонах, Сотіріос А. Цафтаріс. Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models (авторське право 2025); ілюстрації Джона Макнілла. Лицарі та брехуни: Надано Деном Маккінноном. Simplebench: CC BY 4.0. Команда SimpleBench. The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models (авторське право 2024). ARC-AGI: Надано ARC Prize Foundation. Бліц-тур: CC BY 4.0. Хагендорфф, Тіло, Сара Фабі, Міхал Косінскі. Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT. Nat Comput Sci 3, 833–838 (авторське право 2023). Річка: Адаптовано з Propositiones ad Acuendos Juvenes, Алкуїн Йоркський (бл. 800 р. н. е.). Логічна сітка: Apache License 2.0. Лін, Білл Я., Ронан Ле Бра, Кайл Річардсон та ін. ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning (авторське право 2025)

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини