Моделите на ИИ се провалят на тези тестове за интелигентност. А вие ще се справите ли по-добре?
Пъзелите и игрите са в основата на развитието на ИИ още от самото начало. Точно както ние, хората, обичаме да изпитваме ума си с кръстословици или логически пъзели, разработчиците могат да проверяват докъде са стигнали моделите с поредица от игрови изпитания. Терминът „машинно обучение“ е популяризиран в статия от 1959 г. на компютърния учен от IBM Артър Самюъл, посветена на алгоритъм, който се е научил да играе дама. Шахът и китайската настолна игра го също са известни тестови среди за ИИ.
Ако съдим единствено по уменията му да решава пъзели, ИИ се подобрява много — и то бързо. В края на 2024 г. екип от учени от Колумбийския университет показа, че дори най-добрите модели успяват да решат само 18% от прословутите пъзели Connections на New York Times; до началото на 2025 г. някои модели вече можеха да ги решават почти безпогрешно всеки път.
Но пъзелите правят повече от това просто да подчертават неудържимия напредък на възможностите на ИИ. Наблюдението къде моделите успяват и къде се провалят — и къде ние, хората, все още ги превъзхождаме — може да ни даде полезен поглед към силните и слабите страни на технологията. Въпреки напредъка днешните модели все още се препъват: Незначителни промени в класически гатанки често ги объркват, а визуалните пъзели са особено слабо място.
Тук ще имате възможност да изпитате ума си с пъзели, които в един или друг момент са затруднявали моделите. Някои може да са толкова сложни за вас, колкото са били и за ИИ; други са толкова прости, че ще ви накарат да се усъмните дали ИИ изобщо е интелигентен. Всеки от тях подчертава поне един начин, по който машинното и човешкото познание се различават. Ако преминете теста без грешка, ще сте доказали, че можете да надхитрите ИИ в решаването на пъзели — поне засега.
Пространствено мислене
Нека започнем с област, в която хората имат огромно предимство: пространственото мислене. Ако някога сте решавали тест за интелигентност, вероятно сте попадали на задача за мислено завъртане. Тези пъзели ви карат да определите дали различни изображения представят едни и същи обекти, видени от различни ъгли. Макар че днешните езикови модели обикновено могат да анализират визуални входни данни, те все още се провалят напълно при тези пъзели. Въпреки всички разговори за това как моделите на света могат да помогнат на ИИ да разбира физическата среда, големите езикови модели все още не изглежда да могат да манипулират триизмерни обекти по начина, по който го правят хората с пространствено мислене — например архитектите и машинните инженери.
Мислено завъртане
Инструкции: Изберете отговора, който показва обекта от условието, но видян от различен ъгъл. Във всеки случай има само един верен отговор!
Памет и адаптивност
Граничните големи езикови модели имат изключителна памет; по време на обучението си те са били изложени на огромно количество факти и могат вярно да възпроизвеждат много от тях. Това е предимство, когато се състезават с хората в познавателни въпроси, но може да бъде и недостатък. Когато даден пъзел много прилича на такъв, който моделът е виждал по време на обучението, той може да пропусне ключовите разлики и да отговори с онова, което е запомнил.
Това се потвърждава от проучване от 2024 г., в което изследователи от Google и Университета на Илинойс в Ърбана-Шампейн обучават и тестват модели с леки вариации на класически тип пъзел, наречен „Рицари и лъжци“. В тези задачи някои герои винаги казват истината, а други винаги лъжат, и трябва да разберете кой кой е. Същият принцип може да стои в основата и на тест, наречен SimpleBench. Тези въпроси приличат на по-сложни задачи, с които моделите вероятно са се сблъсквали по време на обучението си. Хората забелязват уловката, но дори най-добрите модели се препъват.
Рицари и лъжци
Инструкции: Единственото, което трябва да знаете, за да решите тези пъзели, е, че рицарите винаги казват истината, а лъжците винаги лъжат. Определете кой какъв е въз основа на казаното от всеки герой.
SimpleBench
Инструкции: Прочетете внимателно тези задачи от SimpleBench и би трябвало да успеете да откриете отговорите за нула време.
Абстрактно и визуално мислене
ИИ не се препъва само във визуални задачи в три измерения — и две измерения могат да го затруднят. Това е основен фактор за представянето на моделите на най-известния базиран на пъзели бенчмарк, ARC-AGI. Тези задачи изискват да изведете абстрактни, общи правила от набор примери. Моделите се справят по-добре със задачите на ARC, когато получават всяка решетка не като изображение, а като низ от числа, който кодира цвета на всяка клетка.
Изследванията показват, че дори когато моделите отговарят правилно на въпросите на ARC-AGI, те често го правят с помощта на сложни и неприложими в общия случай правила, докато хората се опират на прости визуални концепции. Въпреки тези недостатъци моделите значително са подобрили представянето си на ARC-AGI през последната година, но някои пъзели — като публикувания тук — все още ги затрудняват.
ARC-AGI
Инструкции: Проучете трите двойки решетки, показани по-долу, за да разберете правилото, което определя как тези отляво се преобразуват в тези отдясно. След това вземете маркери или цветни моливи и попълнете четвъртата решетка, като използвате това правило. (Решението е едно и също, независимо от ориентацията на решетките.)
Интуиция
Не само моделите на ИИ попадат в капани. Ние, хората, имаме свои когнитивни слабости, много от които ИИ не споделя. Психолозите са разработили комплекти от задачи, които обръщат явлението SimpleBench: При тези въпроси хората често дават импулсивни отговори, докато моделите отговарят обмислено. Някои от задачите се възползват от грешки в начина, по който интуитивно правим сметки; други са формулирани така, че да подскажат очевидни отговори, които се оказват погрешни, ако въпросът бъде прочетен внимателно.
Светкавичен рунд
Инструкции: Отговорете на въпросите по-долу възможно най-бързо.
Нарастваща сложност
В някои случаи това дали един голям езиков модел може да реши даден пъзел зависи от мащаба. Проучване на изследователи от Apple установи, че големите езикови модели могат безупречно да решават прости варианти на задачата „Ханойските кули“, която включва преместване на купчина дискове един по един, без никога да се поставя по-голям диск върху по-малък, както и пъзели за преминаване на река, при които група хора трябва да прекоси река при определени правила. Но само до определен момент: Когато броят на дисковете или хората достигне шест или повече, моделите започват да се затрудняват.
В друго проучване изследователи от Университета на Вашингтон, Станфордския университет и Allen Institute for AI установяват, че големите езикови модели изпитват подобни затруднения и с логически решетки — задачи, при които трябва да се изведат характеристиките на група хора от списък с подсказки. Статията на Apple стана вирусна, но коментатори поставиха под въпрос дали резултатите разкриват уникално ограничение на разсъждението при големите езикови модели — или просто показват, че е нормално да се допускат грешки, когато сложността се натрупва.
Реката
Инструкции: Използвайте предоставения сценарий, за да планирате необходимите пътувания, с които всички да преминат от другата страна на реката.
Логическа решетка
Инструкции: Използвайте списъка с подсказки, за да определите кой в коя къща живее и какъв музикален стил харесва всеки човек. Има само едно възможно решение. Може да ви е полезно да попълвате решетката по-долу, за да следите изводите си.
Грейс Хъкинс е репортер, отразяващ ИИ, в MIT Technology Review. Тя има докторска степен по невронауки.
Авторски права и заслуги:
Мислено завъртане: CC BY 4.0. Стогианидис, Илиас, Стивън Макдона, Сотириос А. Цафтарис. Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models (авторски права 2025); илюстрации от Джон Макнийл. Рицари и лъжци: С любезното съдействие на Дан Макинън. Simplebench: CC BY 4.0. Екипът на SimpleBench. The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models (авторски права 2024). ARC-AGI: С любезното съдействие на ARC Prize Foundation. Светкавичен рунд: CC BY 4.0. Хагендорф, Тило, Сара Фаби, Михал Косински. Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT. Nat Comput Sci 3, 833–838 (авторски права 2023). Реката: Адаптирано от Propositiones ad Acuendos Juvenes, Алкуин от Йорк (ок. 800 г. сл. н. е.). Логическа решетка: Apache License 2.0. Лин, Бил Й., Ронан Льо Бра, Кайл Ричардсън и др. ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning (авторски права 2025)
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.