Дети осваивают язык лучше ИИ — а мы всё ещё не знаем почему
Насколько мы можем судить, люди разговаривают друг с другом по меньшей мере 100 000 лет. И за всё это время в мире было лишь одно существо, способное выучить человеческий язык до совершенства: человеческий ребёнок.
Теперь их два.
Спустя четыре коротких года после выхода ChatGPT многие из нас уже воспринимают как должное возможность естественно разговаривать с телефонами или компьютерами. Большие языковые модели вроде Claude, DeepSeek и моделей GPT от OpenAI достаточно бегло и гибко владеют языком, чтобы убедительно выдавать себя за людей. Но стоит заглянуть за вычислительную завесу — и обнаруживается подвох: чтобы научить компьютер пользоваться человеческим языком, по-прежнему требуется нечеловеческий объём данных. LLM легко может переработать в сто тысяч раз больше слов, чем человек воспринимает в процессе освоения родного языка, — и гораздо больше, чем дети могут услышать к своему первому дню рождения, когда они обычно начинают овладевать языком.
«Прогресс в последнее время поразителен, — говорит Майкл К. Фрэнк, когнитивный учёный из Стэнфордского университета, о LLM. — Но нам всё ещё приходится вырубать лес и перерабатывать всю совокупность человеческих знаний, чтобы заново создать то достижение, которое происходит в наших гостиных за один год».
Эта огромная пропасть между детьми и машинами называется разрывом в эффективности использования данных. И она ставит перед когнитивными учёными интригующий вопрос, а перед создателями ИИ — серьёзную задачу: как детям удаётся по-прежнему превосходить самые лингвистически совершенные машины из когда-либо созданных?
Поиск ответов важен и для исследований ИИ, и для когнитивной науки. На протяжении последнего десятилетия языковые модели в основном совершенствовались за счёт увеличения масштаба. Открытая по весам LLM Llama 3.1 от Meta, выпущенная два года назад, переработала 15 триллионов токенов (похожих на слова фрагментов языка) на этапе предварительного обучения — основном этапе обучения модели, который проходит до её дообучения для конкретной задачи, например работы чат-ботом. По словам Итана Готлиба Уилкокса, когнитивного учёного и лингвиста из Джорджтаунского университета, передовые модели могут проходить предварительное обучение на объёме данных, в десять раз превышающем этот. Но интернета, на котором можно обучаться, не бесконечно много, и в конце концов — возможно, уже в 2030-х годах — запасы легкодоступных данных могут иссякнуть.
Дети показывают, что учиться большему, используя меньше, возможно. Намного меньше. Ребёнок младшего подросткового возраста, выросший в языково насыщенной семье, мог услышать около 100 миллионов слов. Если добавить к этому чтение и письмо, к 20 годам количество слов можно увеличить примерно до 300 миллионов.
Разницу в масштабе можно по-настоящему лишь передать с помощью аналогий. «Claude видел столько языка, сколько целый город воспринимает за одно поколение», — говорит Уилкокс. Если распечатать на бумаге все слова, использованные для обучения современной LLM, получится стопка, которая достанет выше Международной космической станции. А 100 миллионов слов, услышанных ребёнком младшего подросткового возраста, образовали бы стопку высотой всего 20 метров. И нам может быть достаточно гораздо меньшего объёма.
Восстановив по обратной инженерии то, как дети учатся, учёные надеются создавать более эффективные в отношении данных модели ИИ, которые могут пригодиться для самых разных задач — от эффективного обучения ИИ на видео до создания чат-ботов для языковых меньшинств. Проверка гипотез о человеческом обучении на машинных моделях также может помочь разрешить давние вопросы о языке и развивающемся детском сознании. Рождаемся ли мы с языковым инстинктом или ребёнок в принципе способен выучить язык исключительно из опыта? Является ли способ обработки языка причудой нашей биологии или хотя бы отчасти отражает универсальные ограничения того, как языки могут использоваться и усваиваться?
Основные элементы
Большинство из нас понимает, насколько сложен язык, лишь когда пытается выучить новый уже после детства. Прошедшее совершённое время, раскатистые звуки р и носовые гласные, родительный падеж, фразовые глаголы, грамматически мужские столы и женские ложки — многое из этого становится орудием лингвистической пытки для взрослого ученика. Однако родной язык обычно усваивается без усилий. Как правило, малыши начинают произносить грамматически правильные предложения, услышав около 10 миллионов слов, а в верхней оценке — 30 миллионов.
«Это просто настоящее чудо, — говорит Фрэнк. — Если обучить GPT-2 на 30 миллионах слов, получится генератор бессмыслицы, а не ребёнок».
Как именно младенцам это удаётся, остаётся загадкой. Исследователи много знают о том, чему дети учатся и как используют язык на разных этапах развития, но многое нам всё ещё неизвестно. Возможно, самый живучий вопрос заключается в том, почему младенцы вообще способны учить язык. Синтаксис человеческого языка — правила объединения слов в предложения — включает рекурсивные, вложенные структуры, позволяющие выражать практически бесконечное количество идей с помощью конечного набора слов и частей слов. Казалось бы, это должно стать проблемой для младенцев. Они лишь плещутся на мелководье бездонного океана языка. И всё же каким-то образом этого достаточно. По капле они угадывают глубины.
Одно из решений предложил в 1950-х годах лингвист из Массачусетского технологического института Ноам Хомский: младенцы рождаются с врождённым знанием грамматики. Хомский возражал против противоположной точки зрения, отстаиваемой психологом Б. Ф. Скиннером, согласно которой усвоение языка полностью определяется средой. Скиннер считал, что язык выучивается посредством обусловливания и подкрепления — так же как собака учится садиться или подавать лапу за лакомство. Хомский возразил, сославшись на «бедность стимула» — идею о том, что язык, особенно синтаксис, слишком сложен, а знакомство детей с ним слишком «скудно», чтобы они могли усвоить его исключительно из опыта. «По сути, его главный аргумент состоял в том, что язык нельзя выучить, опираясь лишь на статистику, — говорит Ричард Футрелл, лингвист и когнитивный учёный из Калифорнийского университета в Ирвайне. — Вместо этого Хомский предположил, что язык основан на наборе логических правил, и утверждал, что детям необходимо врождённое знание этих правил, чтобы вывести грамматику своего языка из обрывков речи».
«Это просто настоящее чудо … Если обучить GPT-2 на 30 миллионах слов, получится генератор бессмыслицы, а не ребёнок».
Майкл К. Фрэнк, когнитивный учёный, Стэнфордский университет
Хомскийанский взгляд на язык десятилетиями господствовал в американской лингвистике под названием порождающей грамматики. Он также оказал большое влияние на информатику в 1950-х и 1960-х годах, когда ИИ переживал первый бум, а границы между лингвистикой и обработкой естественного языка растворились в потоке военного финансирования: Пентагону нужны были компьютеры, способные понимать английский и переводить с русского.
Несмотря на ранние успехи простых нейронных сетей, которые учатся распознавать и воспроизводить статистические закономерности, исследователи ИИ в США в основном приняли основанный на правилах подход, на который повлияли теории Хомского. Они пытались научить компьютеры языку, напрямую кодируя правила в программах: меньше погружения в языковую среду, больше уроков грамматики. Этот подход, являвшийся частью более широкой тенденции под названием символического ИИ, господствовал десятилетиями. Он также в значительной степени не смог привести к созданию моделей, действительно способных обрабатывать человеческий язык в больших масштабах. Интерес к обработке естественного языка охладел во время «зимы ИИ», начавшейся в 1970-х.
После этого нейронные сети начали возвращаться. Но лишь в 2010-х годах, когда компьютерное оборудование стало дешёвым и мощным, а интернет — огромным, их производительность начала привлекать внимание. К 2018–2019 годам модели BERT и GPT-2, построенные на новой архитектуре — трансформере — и обученные на миллиардах токенов, дали специалистам понять, что обучение языка на гигантском избытке данных может работать. В 2022 году, после стремительного успеха чат-бота ChatGPT от OpenAI, это стало очевидно всем.
LLM — не мозг. Это мощные статистические обучающиеся системы — наивные машины, изучающие закономерности и лишённые биологических особенностей, сформировавшихся в ходе эволюции и встроенных в человеческую кору. Иными словами, это именно тот тип системы, который лингвист-порожденец два десятилетия назад счёл бы неспособным выучить язык. И всё же вот они — пишут правдоподобные сонеты и проходят грамматические тесты.
«Независимо от того, насколько скептически вы относитесь к ИИ, больше всего всех впечатлило то, что эти системы учат синтаксис, — говорит Элисон Гопник, психолог по вопросам развития из Калифорнийского университета в Беркли. — Я не думала, что так и окажется. И, думаю, большинство людей не считали, что можно просто посмотреть на статистику большой выборки языка и вывести грамматику».
Но что насчёт обучения на небольшой выборке языка — скажем, детского размера? Возможно ли создать модель младенческого масштаба, которая будет чем-то большим, чем генератор бессмыслицы?
Детская речь
Алекс Варштадт, лингвист и специалист по анализу данных из Калифорнийского университета в Сан-Диего, вспоминает годы выхода BERT и GPT-2 как время головокружительных перемен. В 2019 году он всё ещё был аспирантом-лингвистом в Нью-Йоркском университете и наблюдал, как его область меняется на глазах. Сам факт, что языковые модели могли выучить английский, перерабатывая тексты, бросал вызов господствовавшим хомскианским представлениям. Но многие лингвисты по-прежнему сомневались, что LLM могут рассказать что-либо о том, как люди усваивают язык.
«Мне всегда возражали по одному конкретному вопросу. Речь шла о размере наборов данных модели, — говорит Варштадт. — Не было периода, когда люди обучали языковые модели в человеческом масштабе и мы были бы ими впечатлены».
Но Варштадт видел в LLM перспективу: научная модель не обязана быть совершенной, чтобы приносить пользу, а LLM явно представляли собой мощные симуляции человеческого использования языка. Если встроить в модели гипотезы о том, как учатся дети, и измерять их эффективность — насколько близко они подошли к устранению разрыва в данных, — смогут ли учёные проверить свои идеи? В августе 2022 года Варштадт опубликовал ветку в Twitter, где изложил аргумент в пользу того, что нейронные сети могут быть полезными моделями усвоения языка. После обмена мнениями в комментариях с исследователем ИИ Лешем Хошеном Варштадт выдвинул идею, которая впоследствии превратилась в BabyLM — ежегодный конкурс, организованный Варштадтом, Хошеном и несколькими другими исследователями и посвящённый обучению моделей на небольших наборах данных.
Это было четыре года назад. С тех пор BabyLM обзавёлся семинарами и вдохновил на создание ответвлений, включая конкурс моделей-младенцев, обученных на китайском языке. Основное соревнование предлагает исследователям обучать языковые модели на «правдоподобном с точки зрения развития» корпусе всего из 100 миллионов слов (для трека масштаба малыша — 10 миллионов), собранных из книг для детей, диалогов, субтитров к фильмам, Simple English Wikipedia, обычной Wikipedia и настоящих расшифровок речи, обращённой к детям. По словам Уилкокса из Джорджтаунского университета, одного из организаторов, модели оцениваются с помощью тех же грамматических тестов, которые психолингвисты используют для людей.
Один из видов заданий заключается в том, чтобы предъявлять испытуемым — людям или машинам — предложения и искать признаки замешательства или удивления при наличии неграмматичных элементов. Например, в тесте могут сравниваться предложения Ключи от шкафа лежат на столе и Ключи от шкафа лежит на столе. «Увидев слово „лежит“, человек скажет: Что? Там не должно быть „лежит“, — говорит Уилкокс. Для человека это удивление можно измерить, отслеживая движения глаз. Для языковых моделей исследователи используют показатель, называемый неожиданностью, который оценивает, насколько маловероятным модель считает предложение или его часть.
Конкурс уже поставил под сомнение некоторые предположения, например эффективность обучения по учебному плану. Такое обучение начинается с простых данных и постепенно переходит к более сложным входным данным — примерно как разговор с ребёнком постепенно становится более sophisticated. По словам Варштадта, именно этот подход с большим отрывом был самым популярным в первом раунде BabyLM. Но он сработал не так хорошо, как ожидалось.
«Привлекательность этого подхода просто трудно преодолеть, понимаете. [Обучение по учебному плану] действительно хорошо согласуется с тем, как, по нашим представлениям, учатся люди, — говорит Аарон Мюллер, специалист по информатике из Бостонского университета и один из организаторов BabyLM. — Но, похоже, этим трансформерам совсем не нужно упорядочивать данные определённым образом, чтобы учиться эффективно».
Возможно, несколько иронично, но лучшие модели BabyLM вовсе не вдохновлены младенцами. Победитель 2024 года, GPT-BERT, — это трансформер, частично обученный предсказывать следующий токен в последовательности, как современные LLM, а частично — работать подобно BERT, «модели языка с маскированием», которая заполняет пропуски в последовательностях токенов по принципу игры Mad Libs. Впечатляет, что после предварительного обучения примерно на 100 миллионах слов GPT-BERT смог превзойти Meta Llama 2 70B — LLM, предварительно обученную примерно на в 15 000 раз большем объёме данных, — в одном из тестов BabyLM.
И всё же модели BabyLM не находятся на одном уровне с LLM. Многие вообще не способны генерировать текст, а GPT-BERT даже рядом с современной коммерческой моделью выглядел бы неуклюже. В конечном счёте, хотя эти модели и имеют «детский» размер, учатся они не очень по-детски. Дети — не бестелесные компьютерные программы, чьё единственное «взаимодействие» с миром происходит через письменный текст. Они воспринимают мир своими органами чувств — особенно зрением и слухом. Некоторые исследователи считают, что для сокращения разрыва в данных машинам нужно начать учиться глазами и ушами детей.
Воспринять всё
Когда около 15 лет назад Майкл Фрэнк основал свою лабораторию в Стэнфорде, учёные ещё толком не знали, как младенцы воспринимают мир. Психологи развития только начинали заглядывать в жизнь младенцев с помощью камер, закреплённых на голове.
«Ранние исследования показали, что опыт детей радикально отличается от того, каким мы его представляли, — говорит Фрэнк. — Он гораздо более сфокусирован: у них короткие ручки, поэтому предметы находятся прямо перед ними. И живут они в лесу из коленей».
Фрэнк с воодушевлением хотел использовать записи с камер на голове для обучения моделей машинного обучения и проверки гипотез о том, как дети учат язык, но ему требовалось больше данных. Поэтому он и четверо его коллег набрали трёх младенцев — всех детей матерей-психологов, понимавших, на что они идут, — чтобы те носили камеры на голове ради науки. Проект под названием SAYCam записывал по два часа жизни каждого ребёнка в неделю в период от шести месяцев до двух с половиной лет.
«[Семьи] согласились предоставить это видео, и это было крайне важно, — говорит Фрэнк. — Мы опубликовали его, и люди начали обучать на нём модели».
Одним из таких людей был Бренден Лейк, когнитивный учёный и исследователь ИИ из Принстонского университета. В 2024 году, когда он работал в Нью-Йоркском университете, он вместе с коллегами представил модель, обученную на 61 часе необработанных данных SAYCam, которая научилась распознавать предметы и связывать их со словами. Многие теории психологии развития предполагают, что детям нужны определённые предубеждения, помогающие выделять отдельные элементы необработанного сенсорного опыта и связывать их с фрагментами языка. Например, считается, что младенцы предполагают: новое слово вроде «туфля» относится ко всему предмету, а не к его части (например, шнурку), говорит Лейк. Однако созданная его командой модель смогла научиться распознавать предметы на видеозаписях и связывать их со словами без каких-либо подобных предубеждений. «Оказывается, можно сделать настоящий первый шаг в изучении языка, используя гораздо меньше данных, чем предполагали многие теории, — говорит Лейк. — Но после завершения [обучения] у нас всё равно не получается двухлетний ребёнок».
Но, возможно, неудивительно, что такие модели не способны воспроизвести детские способности, работая всего с несколькими десятками часов видеозаписей, собранных из коротких фрагментов, снятых на протяжении нескольких лет жизни ребёнка. Возможно, их недостатки просто указывают на нехватку реалистичных данных. В конце концов, младенцы не могут носить камеру на голове 24 часа в сутки, 7 дней в неделю; такие проекты, как SAYCam и его преемник BabyView, записывают в лучшем случае несколько часов в неделю. Поэтому исследователям приходится выбирать между работой с крошечным фрагментом жизни одного ребёнка и более крупными наборами данных, собранными из записей многих детей. В любом случае обучающие данные модели по-прежнему сильно отличаются от реального опыта ребёнка.
Возможно, ситуация меняется. Ури Хассон, нейробиолог и психолог из Принстонского университета, последние пять лет посвятил проекту по записи первых 1000 дней жизни 17 детей. Участвующие семьи оборудовали камеры и микрофоны во всех жилых помещениях своих домов (кроме спален и ванных комнат) и записывали по 12 часов в день почти каждый день. По словам Хассона, получившийся набор данных, впервые описанный в недавнем препринте, имеет такой масштаб, что без новых инструментов ИИ для расшифровки и анализа видео работать с ним было бы просто невозможно. «Впервые у нас есть входные данные, — говорит он. — Это действительно лишь начало».
Недостающие ингредиенты
Пока обучение моделей на видео оказалось сложной задачей. В то время как текстовые модели после поглощения огромных обучающих наборов данных становятся полностью беглыми, мультимодальные модели, обученные на видео с детьми, до этого ещё очень далеки. Например, модель Лейка научилась простым словам вроде «мяч» и «кошка». По словам Варштадта, участникам BabyLM не удалось добиться успеха, дополнив текст визуальными данными. Гопник считает, что проблема может заключаться в том, что дети не просто сидят и смотрят, как проходит мир. «Дети активно исследуют окружающее, а это значит, что они сами активно выбирают свои данные, — говорит она. — Дети постоянно экспериментируют». Возможно, именно этого и не хватает.
Исследования группы Гопник, включая изучение того, как школьники исследуют игру, вдохновлённую Minecraft, показывают, что детская игра на самом деле является эффективным способом изучения причин и следствий. Дети ищут опыт и предпринимают действия, которые максимизируют их «расширение возможностей», то есть способность предсказуемо влиять на мир.
В отличие от моделей, дети осознают, чего они не знают, и стремятся восполнить пробелы в своих знаниях, говорит Элизабет Бонавиц, когнитивный учёный, изучающий развитие, из Гарварда. По её словам, социальная жизнь детей также помогает им учиться. Её исследования показали, что дети по-разному интерпретируют информацию, когда знают, что взрослый пытается чему-то их научить. «Дети рассуждают не только о сообщаемых им свидетельствах, — говорит Бонавиц. — Они рассуждают об учителе, о знаниях учителя и о том, почему учитель сообщает им эту конкретную информацию».
Это сильно отличается от того, как учатся модели: пассивно и изолированно. Возможно, если бы модели создавались так, чтобы искать информацию для заполнения собственных слепых зон, экспериментировать с языком и наблюдать, как другие носители языка реагируют на их лепет, а также рассуждать о неком смоделированном социальном мире, они учились бы лучше. В прошлом году BabyLM открыл конкурс для моделей, способных учиться, взаимодействуя с другими моделями. Но социальные модели не превзошли стандартные.
Среди ведущих промышленных лабораторий Meta, похоже, больше других заинтересована в том, чтобы черпать вдохновение у детей — особенно для обучения моделей на видео. Два исследователя Meta участвовали в мультимодальной ветви BabyLM, а учёные Meta вместе с академическими исследователями, включая Фрэнка, недавно объявили о создании теста и конкурса по обучению моделей на записях с детских камер. Фрэнк также говорит, что исследовательский стартап в скрытом режиме под названием Flapping Airplanes заинтересовался его работой. Ни Meta, ни Google DeepMind, OpenAI или Flapping Airplanes не согласились дать интервью.
По словам Гопник, пока передовые лаборатории не стремятся заимствовать приёмы у детей. Она считает, что уроки психологии развития усвоит следующее поколение ИИ — то, что придёт на смену трансформеру.
Возможно, самая заманчивая причина сократить разрыв в данных заключается в том, что это поможет нам лучше понять самих себя.
В целом сообщество машинного обучения меньше интересуется имитацией мозга, чем созданием чего-то работающего, говорит Мюллер. Но он считает, что осведомлённость о разрыве в эффективности использования данных и интерес к нему растут. Один из примеров — тест NanoGPT Slowrun, запущенный Q Labs в марте 2026 года. «У них очень похожие цели с BabyLM, — говорит Мюллер. — Но они отказались от мотивации, связанной с изучением человеческого языка, и сосредоточились именно на эффективности использования данных».
Одна из причин, по которой Варштадт хочет сократить разрыв в данных, — демократизировать ИИ, чтобы университеты и другие организации, не располагающие ресурсами для гипермасштабирования, могли обучать хорошие модели и сохранять актуальность в исследованиях ИИ. У Дэвида Сэмюэла, исследователя машинного обучения из Университета Осло и одного из создателей GPT-BERT, есть более личная причина заниматься этой проблемой. Он чех и работает в Норвегии, а доступных для обучения LLM данных на чешском и норвежском гораздо меньше, чем на английском. По словам Сэмюэла, для таких языков меньшинств, как саамский, может быть доступно всего несколько десятков миллионов токенов — примерно столько же, сколько воспринимает ребёнок ясельного возраста. «Вопрос заключался в следующем, — говорит он, — как создавать языковые модели, столь же способные, как английские, для языков с небольшим объёмом данных?»

Но, пожалуй, самая заманчивая причина сократить разрыв в данных заключается в том, что это поможет нам лучше понять самих себя.
Бонавиц говорит, что поначалу скептически относилась к тому, что большие языковые модели могут раскрыть что-либо о когнитивных процессах. В конце концов, LLM и мозг очень различны. Мозг воплощён в теле. Наши нейроны — не аккуратные строки кода, а живые клетки. И наш мозг растёт и меняется по мере того, как мы учимся и стареем, — LLM проходят предварительное обучение один раз и больше никогда. Но, несмотря на различия между двумя системами, говорит Бонавиц, «я в некотором смысле пересматриваю свои убеждения». Её убедила идея изучать модели так, как сравнительные психологи могли бы изучать сознание животных, чтобы пролить свет на наше собственное.
Такие исследователи, как Варштадт, Фрэнк, Уилкокс, Лейк и Хассон, уже используют языковые модели в качестве своего рода лингвистических лабораторных крыс — несовершенных, но информативных заменителей реальных пользователей языка, особенно для вопросов, связанных с обучением, языком и обработкой информации, а не с чем-то специфичным для нашего мозга или биологии. Когда модели делают с языком то, что мы считали невозможным, это бросает вызов старым предположениям. Исследователи могут встраивать в модели гипотезы об изучении языка — например, моделируя разные степени двуязычия или лишая модели контакта с определёнными грамматическими формами, — и проверять эти гипотезы способом, невозможным при работе с реальными детьми. Футрелл сравнивает ситуацию с обучением пришельца языку, после чего можно вскрыть его мозг и посмотреть, что произошло.
Хотя другие животные и общаются, разговаривают только люди. Теперь существует нечто, не являющееся ни животным, ни человеком, что тоже умеет говорить. LLM открывают возможность для сравнительных исследований, даже если модели и сознание радикально различаются. «Последние 100 000 лет или столько, сколько существует человеческий язык, люди были единственными существами во Вселенной, использующими язык. Теперь появилась ещё одна лингвистическая сущность, — говорит Варштадт. — Наконец у нас есть модель — не в смысле языковой модели, а в смысле модельного организма».
Элиз Куттс — научный писатель, живущая в Австрии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.