Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Уменията, които носят най-високи оценки, са тези, които ИИ най-добре може да имитира

Уменията, които носят най-високи оценки, са тези, които AI може най-добре да имитира
Томислав Безмалинович
30 авг. 2026 г.
Nano Banana Pro по поръчка на THE DECODER

Основни моменти

  • Експеримент в университета „Бокони“ с над 1000 първокурсници показва, че GPT-4o значително е повишил оценките им по бизнес задача.
  • Кратък урок по причинно-следствено мислене не е подобрил традиционните оценки, но е насочил студентите към по-разнообразни и необичайни решения.
  • Остава без отговор въпросът дали използването на AI е подобрило и реалното обучение. Не е имало последващ тест без ChatGPT.

ChatGPT значително е подобрил работата на студентите, докато учебната интервенция е насърчила по-разнообразни и необичайни решения. Дали AI подобрява и обучението, остава открит въпрос.

Какво прави една студентска работа добра и кои нейни части могат да бъдат подобрени от AI? Рандомизирано изследване с 1053 първокурсници в университета „Бокони“ установи, че GPT-4o е помогнал на студентите да получат значително по-високи оценки по бизнес задача. Кратък урок по причинно-следствено мислене не е повишил традиционните оценки, но е насочил студентите към по-разнообразни решения и по-задълбочено мислене за причините, допусканията и начина, по който предложенията им действително биха работили.

GPT-4o осигури значителен тласък на оценяваното представяне

През ноември 2025 г. 13 групи от въвеждащ курс по управление бяха разпределени на случаен принцип в четири групи: контролна, урок по причинно-следствено мислене, достъп до GPT-4o или комбинация от двете. Студентите трябваше да напишат маркетингови препоръки за университетския магазин за сувенири в рамките на до 180 думи. Урокът обхващаше последователна причинно-следствена логика, възможност за опровержение и начина, по който предложено действие може да доведе до желания резултат.

Студентите с GPT-4o са получили почти с цяла точка по-висока оценка по петстепенна скала. Отговорите им съдържали средно около две идеи повече, били по-логично последователни и по-точно съвпадали с препоръките на трима експерти в областта. Дори след като изследователите взели предвид качеството на аргументацията, броя на идеите, разнообразието на идеите и характеристиките на текста, измеримото предимство на GPT-4o останало. Авторите отдават това на по-високото качество на съдържанието, а не на по-големите познания на студентите.

Урокът по причинно-следствено мислене не е повишил традиционните оценки. Работите на тези студенти всъщност получили малко по-ниски средни оценки, но те по-често обяснявали защо дадено действие би трябвало да работи и при какви условия може да се провали. Те също така генерирали по-разнообразни идеи, които се различавали от написаното от техните колеги.

Комбинирането на урока с GPT-4o не е добавило допълнителен тласък към традиционните оценки. По отношение на показателите за причинно-следствено мислене двата подхода се допълвали, а по-голямото разнообразие на идеите в групата с урока се запазило.

Достъпът до ChatGPT и обучението по критично мислене са имали допълващи се ефекти върху работата на студентите. ChatGPT сам по себе си е подобрил главно традиционните оценки, докато учебната интервенция е насърчила причинно-следственото мислене и разнообразието на идеите. | Изображение: OpenAI
Достъпът до ChatGPT и обучението по критично мислене са имали допълващи се ефекти върху работата на студентите. ChatGPT сам по себе си е подобрил главно традиционните оценки, докато учебната интервенция е насърчила причинно-следственото мислене и разнообразието на идеите. | Изображение: OpenAI

Критериите за оценяване са предпочитали конвенционалните отговори

Повече идеи, по-последователни аргументи и по-голямо разнообразие на идеите в рамките на един отговор са били свързани с по-високи оценки. Но по-силната възможност за опровержение, по-подробните обяснения как предложените действия биха работили и по-голямото отклонение от идеите на останалите студенти са били свързани с по-ниски оценки.

Това не означава, че оригиналността е била санкционирана във всички случаи. При тази задача традиционната оценка е възнаграждавала главно добре структурирани отговори, които са оставали в рамките на очакваното пространство от решения. Авторите заключават, че разнообразието и оригиналността трябва изрично да бъдат включени в критериите за оценяване, ако се очаква да имат значение.

Но настоящите системи за оценяване измерват изпипаността, структурата и пълнотата, а не обучението и разбирането. Това улеснява използването на AI като инструмент за измама.

Какво не показва изследването

Не е имало последващ тест, при който студентите да трябва да демонстрират какво действително са разбрали или запомнили без ChatGPT. Авторите изрично признават, че остава неясно дали предимството на GPT се дължи на знания, които студентите действително са придобили, или просто отразява по-добър резултат с помощта на AI. Изследването показва подобрено представяне по тази задача, оценено с оценка, а не подобрено обучение.

Експериментът е разглеждал само първокурсници от един университет, работещи по ограничена маркетингова задача. Рандомизацията е била извършена между 13 учебни групи, а не индивидуално сред всичките 1053 студенти.

Основната оценка на представянето е дошла от оценители, които не са знаели към коя група принадлежи всеки текст. Няколко допълнителни показателя, като причинно-следственото мислене и разнообразието на идеите, са били оценени с помощта на модели от OpenAI и Anthropic.

OpenAI предоставя технологията, която се изследва, и е участвала в изследването. Няколко от авторите работят в OpenAI или са били служители на компанията по време на изследването.

Други изследвания питат какво остава след изчезването на AI

Досегашните изследвания ясно показват, че важното не е дали студентите използват AI, а дали той подпомага собственото им мислене или го замества. Когато го замества, студентите страдат.

Изследване, обхващащо над 500 000 оценки на студенти в САЩ, установи, че след появата на ChatGPT най-високите оценки са се увеличили най-много в курсове с голям дял писмени и програмни задачи и значителен обем домашна работа. Контролирани експерименти установиха, че след премахването на AI участниците са се представили по-зле от контролната група. Спадът е бил най-голям сред тези, които основно са използвали GPT, за да получават директни отговори.

30-месечно изследване на над 26 000 студенти в Китай показало сходна тенденция за по-дълъг период. Домашната работа ставала по-добра и се изпълнявала по-бързо с AI, но резултатите от изпитите спаднали. На последващи приемни изпити резултатите били с 18 до 24 процента по-ниски в дългосрочен план. Студентите, които въпреки достъпа до AI отделяли приблизително същото време за домашна работа като тези, които не използвали AI, не показали сравним спад.

Въпреки нарастващия обем доказателства OpenAI представя резултатите главно като предизвикателство за системите за оценяване: ако AI може да създава изпипана работа, подобна на тази на експерт, само крайният продукт казва по-малко за това какво действително разбират студентите. Авторите призовават да се „възнаграждават студентите за създаването на работа, която отразява оригиналност, разсъждение и разглеждане на множество подходи, а не само най-конвенционалните или изпипани отговори“. Това може да е вярно, но промяната на системата за оценяване вероятно означава промяна и на цялата образователна система.

AI новини без сензацията – подбрани от хора

Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен шест пъти годишно доклад за водещите разработки „AI Radar“, достъп до целия архив и достъп до секцията за коментари.

Източник: OpenAI

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини