Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Навички, за які ставлять найвищі оцінки, — ті, які ШІ найкраще може імітувати

Навички, які приносять найвищі оцінки, — це ті, які ШІ найкраще вміє підробляти
Томіслав Безмалінович
30 серпня 2026 року
Nano Banana Pro за запитом THE DECODER

Ключові моменти

  • Експеримент у Бокконському університеті за участю понад 1 000 першокурсників показав, що GPT-4o значно підвищив оцінки за завдання з бізнесу.
  • Короткий урок із причинно-наслідкового мислення не покращив традиційні оцінки, але спонукав студентів до більш різноманітних і незвичних рішень.
  • Чи покращило використання ШІ також фактичне навчання — залишається без відповіді. Подальшого тестування без ChatGPT не проводили.

ChatGPT значно покращив студентські роботи, тоді як навчальне втручання сприяло появі більш різноманітних і незвичних рішень. Чи покращує ШІ також навчання — залишається відкритим питанням.

Що робить студентську роботу якісною і які її складові може покращити ШІ? Рандомізований експеримент за участю 1 053 першокурсників Бокконського університету показав, що GPT-4o допоміг студентам отримати значно кращі оцінки за завдання з бізнесу. Короткий урок із причинно-наслідкового мислення не підвищив традиційні оцінки, але спонукав студентів до більш різноманітних рішень і глибшого осмислення причин, припущень та того, як їхні пропозиції працюватимуть на практиці.

GPT-4o суттєво підвищив результати оцінювання

У листопаді 2025 року 13 груп вступного курсу з менеджменту випадковим чином розподілили на чотири групи: контрольну, групу з уроком причинно-наслідкового мислення, групу з доступом до GPT-4o та групу, яка отримала обидва втручання. Студенти мали написати маркетингові рекомендації для університетського магазину сувенірної продукції обсягом до 180 слів. Урок охоплював послідовну причинно-наслідкову логіку, можливість спростування та те, як запропонована дія може привести до бажаного результату.

Студенти з доступом до GPT-4o отримали майже на цілий бал більше за п’ятибальною шкалою. У їхніх відповідях у середньому було приблизно на дві ідеї більше, вони були логічно послідовнішими та більше відповідали рекомендаціям трьох експертів у цій галузі. Навіть після того, як дослідники врахували якість аргументації, кількість ідей, різноманітність ідей і властивості тексту, вимірювана перевага GPT-4o збереглася. Автори пояснюють це вищою якістю змісту, а не більшими знаннями студентів.

Урок із причинно-наслідкового мислення не підвищив традиційні оцінки. Роботи цих студентів фактично отримали дещо нижчі оцінки в середньому, але вони частіше пояснювали, чому запропонована дія має спрацювати і за яких умов вона може зазнати невдачі. Вони також генерували більш різноманітні ідеї, які відрізнялися від написаного їхніми однолітками.

Поєднання уроку з GPT-4o не дало додаткового підвищення традиційних оцінок. Щодо показників причинно-наслідкового мислення ці два підходи доповнювали один одного, а більша різноманітність ідей у групі, яка проходила урок, збереглася.

Доступ до ChatGPT і навчання критичного мислення мали взаємодоповнювальний вплив на студентські роботи. ChatGPT сам по собі переважно покращував традиційні оцінки, тоді як навчальне втручання сприяло причинно-наслідковому мисленню та різноманітності ідей. | Зображення: OpenAI
Доступ до ChatGPT і навчання критичного мислення мали взаємодоповнювальний вплив на студентські роботи. ChatGPT сам по собі переважно покращував традиційні оцінки, тоді як навчальне втручання сприяло причинно-наслідковому мисленню та різноманітності ідей. | Зображення: OpenAI

Критерії оцінювання віддавали перевагу традиційним відповідям

Більша кількість ідей, послідовніші аргументи та більша різноманітність ідей у межах однієї відповіді — усе це корелювало з вищими оцінками. Натомість краща можливість спростування, докладніші пояснення того, як працюватимуть запропоновані дії, і більша відмінність від ідей інших студентів корелювали з нижчими оцінками.

Це не означає, що оригінальність карали в усіх випадках. У цьому завданні традиційна оцінка переважно винагороджувала добре структуровані відповіді, які залишалися в межах очікуваного простору рішень. Автори роблять висновок, що різноманітність і оригінальність потрібно явно закладати в критерії оцінювання, якщо вони мають враховуватися.

Однак сучасні системи оцінювання вимірюють відшліфованість, структуру та повноту, але не навчання й розуміння. Це полегшує використання ШІ як інструменту для списування.

Чого дослідження не показує

Подальшого тестування, під час якого студенти мали б продемонструвати, що саме вони зрозуміли або запам’ятали без ChatGPT, не проводили. Автори прямо визнають, що залишається незрозумілим, чи була перевага GPT зумовлена знаннями, які студенти справді здобули, чи просто відображала кращий результат за допомогою ШІ. Дослідження показує покращення оцінки за це завдання, а не покращення навчання.

Експеримент охоплював лише першокурсників одного університету, які виконували вузьке маркетингове завдання. Рандомізацію проводили між 13 навчальними групами, а не індивідуально серед усіх 1 053 студентів.

Основний показник успішності визначали люди-оцінювачі, які не знали, до якої групи належав кожен текст. Кілька додаткових показників, як-от причинно-наслідкове мислення та різноманітність ідей, оцінювали за допомогою моделей OpenAI та Anthropic.

OpenAI надає технологію, яка досліджується, і брала участь у дослідженні. Кілька авторів працюють в OpenAI або працювали там під час проведення дослідження.

Інші дослідження з’ясовують, що залишається після зникнення ШІ

Наявні дослідження чітко свідчать, що важливо не те, чи використовують студенти ШІ, а те, чи підтримує він їхнє власне мислення, чи замінює його. Коли ШІ його замінює, студенти потерпають.

Дослідження, що охопило понад 500 000 оцінок студентів американських коледжів, показало: після запуску ChatGPT найвищі оцінки найбільше зросли на курсах із великим обсягом письмових і програмувальних завдань та значною часткою домашньої роботи. Контрольовані експерименти показали, що після вилучення ШІ учасники виконували завдання гірше за контрольну групу. Найбільше падіння спостерігалося серед тих, хто переважно використовував GPT для отримання прямих відповідей.

Дослідження тривалістю 30 місяців за участю понад 26 000 студентів у Китаї показало подібну картину протягом тривалішого періоду. Домашні завдання з ШІ виконувалися краще й швидше, але результати іспитів погіршилися. На подальших вступних іспитах результати в довгостроковій перспективі були на 18–24 відсотки нижчими. У студентів, які, попри доступ до ШІ, витрачали на домашні завдання приблизно стільки ж часу, скільки й ті, хто не користувався ним, подібного погіршення не спостерігалося.

Попри дедалі більший масив доказів, OpenAI розглядає результати переважно як виклик для систем оцінювання: якщо ШІ може створювати відшліфовані роботи, схожі на експертні, сам кінцевий продукт менше свідчить про те, що студенти насправді розуміють. Автори виступають за «винагороду студентів за створення робіт, які відображають оригінальність, аргументованість і розгляд кількох підходів, а не лише найбільш традиційних або відшліфованих відповідей». Це може бути правдою, але зміна системи оцінювання, ймовірно, означатиме одночасну зміну всієї системи освіти.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку новин ШІ, наш ексклюзивний щорічний звіт про передові розробки «AI Radar», доступ до повного архіву та розділу коментарів.

Джерело: OpenAI

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини