ИИ для науки нуждается в рассуждениях, а не только в данных
Каждые несколько десятилетий кто-нибудь объявляет, что наука подошла к концу. В 1903 году почитаемый физик Альберт Майкельсон написал, что «все факты физической науки уже открыты». В 1980-х годах Стивен Хокинг предсказал, что теоретическая физика может завершиться к концу столетия. С бурным приходом искусственного интеллекта это ощущение вновь витает в воздухе — на этот раз в сопровождении Нобелевской премии.
В 2024 году Демис Хассабис и Джон Джампер из Google DeepMind получили часть Нобелевской премии по химии за свою нейросеть AlphaFold, которая предсказывает трехмерные структуры белков, обучаясь на тысячах экспериментально измеренных форм. Эта дьявольски сложная задача на протяжении полувека сопротивлялась систематическим попыткам ее решить; казалось, AlphaFold раз и навсегда справилась с ней, и мир зациклился на обещаниях, которые сулил этот подход. Хассабис и его команда назвали AlphaFold «образцом того, как ИИ может ускорить развитие всей науки до цифровой скорости». Волна стартапов, создающих базовые модели для биологии, химии и поиска новых материалов, привлекла миллиарды долларов благодаря успеху DeepMind. AlphaFold продемонстрировала, что сочетание ИИ и достаточного объема данных способно привести к революционным открытиям (даже если мы не понимаем лежащих в их основе механизмов), и вновь показалось, будто путь через остальную науку уже проложен перед нами.
Безусловно, ИИ принесет науке чрезвычайные изменения, но становится все яснее, что AlphaFold и подобные ему системы могут оказаться не лучшим образцом для этой метаморфозы. Хотя это выдающееся достижение, условия, благодаря которым появились такие системы, как AlphaFold, встречаются редко, а время, необходимое для создания подобных условий в других областях, будет измеряться десятилетиями, а не годами. Вместо этого ускорение науки произойдет благодаря другому подходу: ИИ-агентам.
Главным условием успеха AlphaFold было существование Protein Data Bank — базы данных примерно из 170 000 экспериментально подтвержденных структур белков, на которой команда DeepMind могла обучить свою модель. Создание Protein Data Bank было непростым: оно потребовало 53 лет международного научного сотрудничества и, согласно недавней оценке, около 21 миллиарда долларов на проведение экспериментальных работ. Проекты такого масштаба печально известны своей сложностью финансирования, практически невозможной координацией и огромными сроками реализации; в результате они часто оказывались безуспешными.
Но даже в областях, где есть необходимая сплоченность и ресурсы, а соответствующие данные не становятся недоступными из-за коммерческой собственности, существует еще один недостаточно обсуждаемый барьер: научная невозможность получения сопоставимых данных. В случае структур белков ключевой экспериментальный метод — белковая кристаллография — является необычайно воспроизводимым и надежным инструментом, настолько, что на него опирались более 25 Нобелевских премий. Но в большинстве экспериментальных наук результаты чаще различаются, чем совпадают. Клеточные линии изменяются. В химических веществах присутствуют следовые загрязнители. Влажность в лаборатории меняется. Создание измеренных наборов данных, достаточно согласованных, точных, прецизионных и масштабируемых для обучения современной нейросети в биологии или большинстве областей химии, потребует новых методов измерений и новых стандартизированных подходов — и ни те, ни другие не будут готовы в ближайшее время.
Конечно, есть несколько областей, где эти требования выполняются: прогнозирование погоды, значительная часть геномики, весьма ограниченные области химии. В них вскоре могут произойти прорывы в стиле AlphaFold, если они уже не произошли. Государственная поддержка создания и координации таких наборов данных будет иметь решающее значение, как утверждала Национальная комиссия США по биотехнологиям развивающихся технологий. Но для большинства нерешенных вопросов науки нам потребуется иной план — по крайней мере в краткосрочной перспективе. К счастью, нечто более тихое и скромное уже начало демонстрировать свой потенциал.
Ученые всегда рассуждали в условиях неопределенности. Биологи, работающие над поиском новых мишеней для лекарств, никогда не располагали идеальными наборами данных. Вместо этого они объединяют расчеты докинга и известные структуры, учитывают молекулярную динамику, проводят несколько анализов связывания и используют свое суждение, взвешивая каждый метод с учетом его конкретных сильных сторон и возможных ошибок. Искусство науки заключается не в каком-то одном инструменте, а в синтезе результатов, полученных с помощью множества инструментов, и их пересмотре по мере поступления новых свидетельств. Именно так на самом деле ведется большая часть исследовательской работы. Но до самого недавнего времени ни одно программное обеспечение не могло делать этого.
Теперь это могут делать агенты. Проще говоря, агент — это механизм рассуждения на основе ИИ, получивший доступ к инструментам — цифровым или физическим — и возможность ими пользоваться. За последние несколько лет фундаментальный архитектурный сдвиг в ИИ способствовал быстрому распространению этих программ, работающих на базе больших языковых моделей, значительно сократив потребность в научно специализированных наборах данных. Для науки этот технологический прогресс означает фундаментальное изменение: он позволил создавать цифровые инструменты, способные имитировать итеративный, во многом зависящий от обстоятельств процесс реального исследования. В то время как такие инструменты, как AlphaFold, применяют мощный подход к ограниченному вопросу, агенты по своей природе являются универсалами. Они не представляют собой новый способ заниматься наукой — вместо этого они цифровым образом моделируют человеческий процесс открытий.
Рассмотрим AI Co-Scientist от Google, о котором было объявлено в мае. Исследователи предоставили ему одностраничное описание и цель: выяснить, как устойчивость к антибиотикам распространяется между видами бактерий, что является ключевым фактором инфекций, устойчивых к лекарствам. Система создала несколько субагентов. Один выдвигал гипотезы на основе научной литературы. Другой разбирал их на части, подобно рецензенту. Третий проводил турниры, чтобы ранжировать наиболее сильных кандидатов. Четвертый дорабатывал победившую гипотезу. Агент пришел к выводу, что гены устойчивости перемещаются на бактериальных вирусах, используя тот вирус, который способен доставить их в нового хозяина. Гипотеза оказалась верной. Исследователи из Имперского колледжа Лондона потратили десять лет, чтобы прийти к тому же выводу в ходе кропотливой работы в лаборатории; их статья, ранее не известная Co-Scientist, все еще проходила рецензирование.
Такие агенты, как Co-Scientist, пока остаются новыми инструментами, и до того, как они станут повсеместной частью научного процесса, предстоит преодолеть серьезные трудности: они по-прежнему склонны к галлюцинациям, их суждения непоследовательны, а ограничения памяти и входных данных не позволяют им работать автономно достаточно долго. Но эти технические барьеры исчезнут, и по мере этого мы начнем замечать кумулятивное влияние научных агентов на надежность, согласованность и скорость, с которыми ведется научная работа.
Возможно, наиболее примечательно то, что агенты предлагают структурное решение «кризиса воспроизводимости» в науке — широко распространенной проблемы, связанной с неспособностью исследователей воспроизводить результаты друг друга. На протяжении десятилетий научное сообщество призывало исследователей делиться исходными данными и точным кодом, стремясь стандартизировать экспериментальные процессы. Но исследователи долго сопротивлялись этой утомительной административной работе, которая выполняется уже после завершения самой интересной части научного процесса. Агенты, напротив, автоматически записывают каждое свое действие, создавая точную летопись метода, приведшего к результатам, и обеспечивая возможность их точного воспроизведения.
Вторым последствием станет усиление научной памяти. Передача знаний между исследователями — процесс, печально известный своей непрозрачностью; если она не осуществляется в течение многих лет обучения и наблюдений, аспирантам приходится просматривать беспорядочные лабораторные журналы, которые десятилетиями вели их предшественники, в поисках деталей, способных определить успех или провал их протокола. Однако по мере того, как агенты будут играть все большую роль в научном процессе, вся научная история лаборатории будет записываться в централизованном стандартизированном хранилище институциональных знаний.
Но самым важным влиянием агентов станет скорость. В любой области, когда проверка идеи занимает меньше времени, чем спор о ней на совещании, люди перестают обсуждать и просто проводят проверку. Агент, способный прочитать тысячу статей за час, разработать 500 молекул и к утру извлечь уроки из неудачных испытаний, снизит стоимость экспериментов и фундаментально изменит темп научной работы. Он также даст исследователям свободу заниматься смелыми, странными вопросами, на которые они прежде никогда не решились бы потратить свое время, открывая научные двери, которые мы пока даже не можем себе представить.
Хотя образец AlphaFold, несомненно, станет ключом к невероятным открытиям, сам по себе он не приведет нас к концу науки. Напротив, переход к агентному ИИ представляет собой гораздо более редкий уровень прорыва: инструмент, который одновременно охватывает все области науки. Исторически инструменты такого масштаба появлялись лишь несколько раз: исчисление, статистический вывод, спектроскопия, компьютер. Каждый из них открывал целый мир задач, о существовании которых никто не задумывался, а эти задачи, в свою очередь, заново определяли свои области. С появлением агентов нас ожидает еще одна подобная трансформация.
Эрик Шмидт был генеральным директором Google с 2001 по 2011 год. В 2024 году он вместе со своей женой Венди основал Schmidt Sciences — благотворительную организацию, финансирующую нестандартные направления исследований в науке и технологиях.
Сухас Махеш руководит направлением ИИ для науки в Центре ИИ организации Schmidt Sciences. Он специализируется на применении ИИ для поиска новых материалов.
Дополнительное исследование провела Майя Левин, научный сотрудник и руководитель научного направления в офисе Эрика Шмидта.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.