Навыки, за которые ставят самые высокие оценки, — те, которые ИИ лучше всего может имитировать
Ключевые моменты
- Эксперимент в Университете Боккони с участием более 1 000 первокурсников показал, что GPT-4o значительно повысил оценки за задание по бизнесу.
- Краткий урок по причинно-следственному мышлению не улучшил традиционные оценки, но подтолкнул студентов к более разнообразным и необычным решениям.
- Улучшило ли использование ИИ фактическое обучение — по-прежнему неизвестно. Последующего тестирования без ChatGPT не проводилось.
ChatGPT значительно улучшил работы студентов, тогда как педагогическое вмешательство способствовало появлению более разнообразных и необычных решений. Улучшает ли ИИ также обучение — открытый вопрос.
Что делает студенческую работу хорошей и какие ее составляющие может улучшить ИИ? Рандомизированный эксперимент с участием 1 053 первокурсников Университета Боккони показал, что GPT-4o помог студентам получить значительно более высокие оценки за задание по бизнесу. Краткий урок по причинно-следственному мышлению не повысил традиционные оценки, но подтолкнул студентов к более разнообразным решениям и более глубокому осмыслению причин, предположений и того, как именно будут работать их предложения.
GPT-4o значительно повысил результаты, учитываемые при выставлении оценок
В ноябре 2025 года 13 групп вводного курса по менеджменту были случайным образом разделены на четыре группы: контрольную, группу с уроком по причинно-следственному мышлению, группу с доступом к GPT-4o и группу, получившую и то и другое. Студенты должны были написать маркетинговые рекомендации для университетского магазина сувениров объемом до 180 слов. На уроке рассматривались логика причинно-следственных связей, фальсифицируемость и то, каким образом предлагаемое действие может привести к желаемому результату.
Студенты с доступом к GPT-4o получили почти на один балл больше по пятибалльной шкале. В их ответах в среднем было примерно на две идеи больше, они были более логичными и в большей степени соответствовали рекомендациям трех профильных экспертов. Даже после того как исследователи учли качество аргументации, количество идей, разнообразие идей и свойства текста, измеримое преимущество GPT-4o сохранилось. Авторы объясняют это более высоким качеством содержания, а не более глубокими знаниями студентов.
Урок по причинно-следственному мышлению не повысил традиционные оценки. Работы этих студентов в среднем получили даже немного более низкие баллы, однако они чаще объясняли, почему предлагаемое действие должно сработать и при каких условиях оно может оказаться неэффективным. Кроме того, они генерировали более разнообразные идеи, отличавшиеся от написанного их сверстниками.
Сочетание урока с GPT-4o не дало дополнительного повышения традиционных оценок. Что касается показателей причинно-следственного мышления, два подхода дополняли друг друга, а более высокое разнообразие идей в группе с уроком сохранилось.

Критерии оценивания отдавали предпочтение традиционным ответам
Большее количество идей, более связные аргументы и большее разнообразие идей в рамках одного ответа — все это коррелировало с более высокими оценками. Однако более высокая фальсифицируемость, подробные объяснения того, как будут работать предлагаемые действия, и большее отличие от идей других студентов коррелировали с более низкими оценками.
Это не означает, что оригинальность повсеместно наказывалась. В рамках этого задания традиционная оценка в основном поощряла хорошо структурированные ответы, остававшиеся в пределах ожидаемого пространства решений. Авторы делают вывод, что разнообразие и оригинальность необходимо явно включать в критерии оценивания, если им предполагается придавать значение.
Однако современные системы оценивания измеряют качество оформления, структуру и полноту, но не обучение и понимание. Это упрощает использование ИИ в качестве инструмента для списывания.
Чего не показывает исследование
Последующего тестирования, в котором студенты должны были бы без ChatGPT продемонстрировать, что именно они поняли или запомнили, не проводилось. Авторы прямо признают, что остается неясным, было ли преимущество GPT связано со знаниями, которые студенты действительно приобрели, или же просто отражало более качественный результат при помощи ИИ. Исследование показывает улучшение результатов, учитываемых при выставлении оценки за это задание, но не улучшение обучения.
В эксперименте участвовали только первокурсники одного университета, выполнявшие узкое маркетинговое задание. Рандомизация проводилась по 13 учебным группам, а не индивидуально среди всех 1 053 студентов.
Основной показатель успеваемости определяли люди-оценщики, не знавшие, к какой группе относился каждый текст. Несколько дополнительных показателей, таких как причинно-следственное мышление и разнообразие идей, оценивались с использованием моделей OpenAI и Anthropic.
OpenAI предоставляет изучаемую технологию и участвовала в исследовании. Несколько авторов работают в OpenAI или работали там во время проведения исследования.
Другие исследования выясняют, что остается после исчезновения ИИ
Проведенные на данный момент исследования ясно показывают, что важно не то, используют ли студенты ИИ, а то, поддерживает ли он их собственное мышление или заменяет его. Когда ИИ его заменяет, студенты страдают.
Исследование, охватившее более 500 000 оценок американских студентов, показало, что после запуска ChatGPT количество высших оценок сильнее всего выросло на курсах с большим объемом письменных и программных заданий и значительной долей домашних работ. Контролируемые эксперименты показали, что после отключения ИИ участники справлялись хуже контрольной группы. Падение было наиболее заметным среди тех, кто в основном использовал GPT для получения готовых ответов.
Исследование продолжительностью 30 месяцев, в котором участвовали более 26 000 студентов в Китае, показало аналогичную картину на более длительном отрезке времени. С ИИ домашние задания выполнялись лучше и быстрее, но результаты экзаменов снижались. На последующих вступительных экзаменах результаты в долгосрочной перспективе были на 18–24 процента ниже. У студентов, которые, несмотря на доступ к ИИ, тратили на домашние задания примерно столько же времени, сколько и не пользовавшиеся им, сопоставимого снижения не наблюдалось.
Несмотря на растущий объем свидетельств, OpenAI в основном представляет результаты как вызов для систем оценивания: если ИИ способен создавать безупречные работы, напоминающие работы экспертов, один лишь итоговый продукт меньше говорит о том, что студенты действительно понимают. Авторы выступают за «поощрение студентов за создание работ, отражающих оригинальность, рассуждение и рассмотрение нескольких подходов, а не только наиболее традиционных или безупречно оформленных ответов». Возможно, это так, но изменение системы оценивания, скорее всего, означает необходимость менять вместе с ней всю систему образования.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.