Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Внутри Basecamp Research — ИИ-стартапа, превращающего эволюцию в данные для обучения

Внутри Basecamp Research — стартапа, превращающего эволюцию в обучающие данные
Максимилиан Шрайбер
23 сент. 2026
Basecamp Research / GPT-Image-2 по запросу THE DECODER

Ключевые моменты

  • Лондонская компания Basecamp Research привлекла от инвесторов, включая Nvidia и Anthology Fund компании Anthropic, 140 млн долларов для создания ИИ-моделей, предназначенных для разработки лекарств и клеточной терапии.
  • Модели под названием EDEN обучаются на ДНК микроорганизмов, собранных в образцах окружающей среды по всему миру. Basecamp использует их для разработки новых антибиотиков и биологических инструментов, которые вводят гены в заданные участки организма.
  • Первые лабораторные исследования и эксперименты на мышах показывают, что отдельные кандидаты в лекарства действуют против бактерий с множественной лекарственной устойчивостью. Клинические испытания на людях ещё должны доказать безопасность и эффективность этих методов лечения.

Basecamp Research привлекла 140 млн долларов от инвесторов, включая Nvidia и Anthology Fund компании Anthropic. Лондонская компания обучает ИИ-модели на генетическом материале из тропических лесов, океанов и горячих источников, чтобы разрабатывать антибиотики и инструменты для клеточной терапии. В интервью THE DECODER технический директор Филип Лоренц объясняет, почему биология представляет для ИИ гораздо более масштабную проблему, чем язык, и почему высокие показатели на бумаге не гарантируют получение эффективных молекул.

По словам компании, раунд возглавил инвестор S32. В нём также приняли участие Nvidia, Anthology Fund компании Anthropic, Фонд инноваций НАТО и Redalpine, а также другие инвесторы.

Основанная в 2020 году, Basecamp планирует использовать привлечённые средства для дальнейшей разработки своих биологических ИИ-моделей под названием EDEN и продвижения собственных кандидатов в терапии к стадии клинической разработки. Сначала компания сосредоточится на клеточной терапии. Такие методы лечения генетически модифицируют клетки пациента, чтобы, например, они могли бороться с раком. Basecamp хочет осуществлять это изменение непосредственно внутри организма.

Для этого компания обращается к микроорганизмам из мест обитания, которые исследователи почти не изучали. Предполагается, что модели будут учиться на закономерностях их геномов, которые можно использовать в медицине.

«С учётом сложности биологии нам просто нужны данные на порядки большего масштаба», — говорит THE DECODER технический директор Basecamp Филип Лоренц. По его словам, важнее всего сочетать такой масштабный сбор данных с небольшими целевыми экспериментами.

До превращения всего этого в лечение ещё предстоит проделать большую работу. Пока у Basecamp есть лабораторные результаты и данные экспериментов на мышах. Они не показывают, сможет ли этот подход обеспечить безопасные и эффективные методы лечения для людей.

Почему общедоступные геномные базы не могут стать основой биологического ИИ

Недавно The Wall Street Journal сообщила, что фармацевтические компании вкладывают миллиарды в ИИ, однако убедительных свидетельств заметного повышения показателей успеха клинической разработки по-прежнему мало. Лоренц не считает это поводом сомневаться в технологии. Масштабирование очень быстро принесло большие преимущества языковым моделям. По его словам, биология тоже развивается, но важнейшие нерешённые вопросы, например ускорение клинических испытаний, значительно сложнее. Как проблема биология «намного, намного, намного сложнее и гораздо масштабнее».

Данные также принципиально отличаются. Языковые модели учатся на огромных коллекциях текстов, тогда как фармацевтические компании часто работают с небольшими изолированными наборами данных отдельных исследований.

Чтобы показать масштаб разрыва, Лоренц использует оценку Epoch AI. Согласно ей, верхняя граница числа всех существующих слов составляет примерно пять квадриллионов токенов. Basecamp оценивает количество нуклеотидов на Земле в 10 в степени 37. «Если взять стопку карт, например покерных, из 10 в степени 37 карт, эта стопка окружила бы наблюдаемую Вселенную миллион раз», — говорит Лоренц. По его словам, набор данных такого размера не нужен, но он должен быть гораздо больше существующего сегодня.

Общедоступные геномные базы также дают неполное представление о природе. Согласно исследовательской статье Basecamp о базе данных BaseData, около 68 процентов объёма последовательностей в Sequence Read Archive приходится всего на пять видов. На долю человека приходится около 54 процентов.

Basecamp Research работает с исследователями в десятках стран, собирая образцы на местах. | Изображение: Basecamp Research

Для медицинских исследований такая концентрация понятна. Однако для модели, которая должна обучаться как можно большему числу различных биологических процессов, Basecamp считает её ограничением, поскольку многие другие формы жизни почти не представлены в данных. «Если бы вы обучали LLM только на газетных статьях 1975 года, это была бы очень, очень плохая модель», — сказал Лоренц в исследовании Microsoft, облачного партнёра компании. «Именно в таком положении сейчас находится биология».

Поэтому Basecamp собирает собственные образцы вместе с местными исследовательскими партнёрами — из почвы тропических лесов, вулканического грунта и глубоководных районов у берегов Антарктиды. Согласно последнему объявлению о финансировании, сеть теперь охватывает более 30 стран и все семь континентов. Microsoft насчитывает 208 участвующих организаций в 31 стране.

На момент интервью набор данных содержал около 15 триллионов токенов, согласно Лоренцу. Это уже сопоставимо с текстовыми наборами данных, использованными для обучения таких моделей, как Claude или GPT. Однако здесь токеном является отдельный строительный блок ДНК. ИИ не обрабатывает слова, как это делает чат-бот. Он обрабатывает строки символов, описывающие генетический материал.

По данным Microsoft, первое поколение EDEN обучалось на 9,7 триллиона строительных блоков ДНК более чем миллиона недавно секвенированных видов. Basecamp проводила обучение совместно с исследователями Microsoft в Azure, а вычислительные ресурсы, как сообщается, соответствовали уровню GPT-4. Однако OpenAI никогда официально не раскрывала эту цифру.

В течение следующих полутора лет объём набора данных должен увеличиться примерно в сто раз, превысив один квадриллион токенов. Основой для этого станет Атлас триллиона генов, о котором было объявлено в марте. Basecamp, Anthropic, Nvidia, PacBio и Ultima Genomics планируют собрать генетические данные в масштабе одного триллиона генов.

В последнем объявлении о финансировании Basecamp уже называет Атлас триллиона генов основой обучения своих моделей EDEN. Компания не сообщает, насколько продвинулось запланированное расширение.

Бактериальные войны дают основу для новых лекарств

Лоренц видит в эволюции, которая управляет всеми биологическими процессами, связь между образцами окружающей среды и медициной. Будь то адаптация бактерии в горячем источнике к высокой температуре или распространение раковой клетки — в обоих случаях действуют сходные факторы отбора. Геномы человека, млекопитающих и почти всех позвоночных в значительной степени секвенированы, тогда как остальное биоразнообразие почти не описано. Многие лекарства также изначально были получены из растений, бактерий и грибов.

В качестве конкретного примера он приводит конкурирующие микроорганизмы. По его словам, некоторые из наиболее мощных терапевтических молекул возникают в результате «биологической войны» между организмами. Когда один вид бактерий пытается доминировать в экосистеме, он иногда вырабатывает вещества, подавляющие или уничтожающие конкурирующие виды, обеспечивая себе пищу и среду обитания. Это происходит миллиарды раз в бесчисленных местах на Земле, особенно там, где мало питательных веществ. В медицине такие вещества могут использоваться как антибиотики.

В исследовании Microsoft Лоренц приводит в качестве другого примера фаги. Эти вирусы заражают бактерии и вводят свою ДНК в клетки. Такая борьба породила инструменты, которые можно использовать для редактирования генов.

Basecamp хочет учиться на широком спектре подобных решений, выработанных эволюцией. Модели должны не просто заново открывать известные соединения. Они предназначены для разработки новых кандидатов на основе изученных закономерностей.

Для этого компания фиксирует химические, физические и экологические условия на каждом участке наряду с генетическим материалом. Она также сосредотачивается на длинных непрерывных фрагментах ДНК. Они показывают, какие гены расположены рядом и могут работать вместе. Короткие изолированные фрагменты часто лишаются этого контекста.

На этом рисунке из статьи 2024 года сравнивается разнообразие белков, представленное в общедоступных базах данных и в коллекциях Basecamp на тот момент. | Изображение: Vince, Gowers, and McGibbon, GEN Biotechnology, CC BY 4.0

Разработанный ИИ антибиотик успешно прошёл первое испытание на животных

Лоренц видит в разработанных EDEN антибиотиках первое подтверждение медицинской ценности системы. «Мы задаём модели патоген, а затем она разрабатывает антибиотик, который его уничтожает», — говорит он.

В исследовательской статье о семействе моделей EDEN, которая ещё не прошла экспертную оценку, авторы сообщают о небольшом отобранном наборе антимикробных пептидов — коротких цепочек белка, способных атаковать бактерии. Согласно статье, 97 процентов протестированных кандидатов продемонстрировали активность в лаборатории.

Этот показатель относится только к протестированной выборке, а не ко всему, что может разработать модель. Однако Basecamp утверждает, что не ограничилась экспериментами в пробирке.

В объявлении компании от июня описываются испытания кандидата под названием EDEN-7. На мышах, заражённых бактериями с множественной лекарственной устойчивостью, он, как сообщается, действовал примерно так же хорошо, как антибиотик крайнего резерва — препарат, предназначенный для трудноизлечимых инфекций.

По данным Basecamp, модель сгенерировала кандидата напрямую, без раундов доработки перед испытанием. Работа проводилась совместно с исследователями Пенсильванского университета под руководством Сесара де ла Фуэнте.

Лоренц придаёт большое значение переходу от разработки к эксперименту. По его словам, Basecamp занимается не только сбором данных и обучением моделей. Важно, работают ли молекулы на самом деле.

Помимо антибиотиков и описанных ниже инструментов для вставки генов, Basecamp также поручила EDEN создать синтетический микробиом кишечника примерно из 9000 видов бактерий, сообщает Microsoft. Для проверки результатов команда привлекла исследовательницу микробиома из Калифорнийского университета в Беркли Джилл Банфилд, которая установила строгие критерии и теперь является соавтором соответствующей статьи. «Полезно спросить скептически настроенного человека, а не только ИИ», — сказал Лоренц.

Ставка Basecamp на терапию основана на вставке генов внутри организма

В собственной терапевтической работе Basecamp пока использует EDEN иначе. Предполагается, что модель будет разрабатывать биологические инструменты, вставляющие более крупные фрагменты ДНК в выбранные участки генома человека.

К ним относятся крупные сериновые рекомбиназы — ферменты, способные повторно соединять ДНК. Basecamp хочет разработать их таким образом, чтобы они вставляли полезную с терапевтической точки зрения генетическую информацию в клетки в точно заданных местах.

Этот подход направлен на решение ключевой проблемы генной терапии. Многие наследственные заболевания связаны с разными мутациями у разных пациентов. Вместо исправления каждой из них ферменты будут вставлять здоровую копию гена независимо от конкретной мутации. Эти инструменты для вставки происходят из того же конфликта между фагами и бактериями, и перед работой в геноме человека их необходимо перепрограммировать.

В статье об EDEN авторы сообщают о нескольких работающих кандидатах в ферменты для каждого изученного участка-мишени, связанного с заболеванием. Половина сгенерированных сериновых рекомбиназ была активна в клетках человека.

Одним из возможных применений являются CAR-T-клетки — генетически модифицированные иммунные клетки, предназначенные для распознавания и атаки раковых клеток. В объявлении от января Basecamp сообщила, что первичные человеческие T-клетки, модифицированные таким образом, то есть иммунные клетки, непосредственно взятые у доноров, уничтожили в лаборатории более 90 процентов опухолевых клеток.

Благодаря новому финансированию компания хочет превратить этот подход в лечение, действующее непосредственно внутри организма. Согласно объявлению о финансировании, это упростило бы сложное производство клеточной терапии, которое сейчас может стоить сотни тысяч долларов на одного пациента.

Однако генетическое редактирование, работающее в лаборатории, не объясняет, как необходимые компоненты безопасно доставить к нужным клеткам внутри организма. Сооснователь Arc Institute Патрик Хсу поднял этот вопрос в публикации Financial Times от мая 2025 года. Он назвал нерешёнными проблемами доставку, возможные токсические эффекты и защитные реакции клеток.

В долгосрочной перспективе принцип, лежащий в основе разработки антибиотиков, должен распространиться на заболевания в целом. «Наша цель — сделать биологию программируемой. Вы задаёте модели заболевание, а на выходе получаете молекулу, которая будет ему противодействовать», — сказал Лоренц Microsoft. Он признаёт, что компания ещё далека от этой цели. «Эти молекулы великолепны, они активны, они работают. Но прежде чем они попадут в клинику, ещё многое должно произойти».

Опубликованный Basecamp на своём сайте портфель терапевтических разработок показывает, насколько долгий путь ещё предстоит пройти. По состоянию на сентябрь 2026 года ни одна из шести программ не вышла за пределы оптимизации ведущих кандидатов — этапа, на котором перспективные кандидаты дорабатываются. Далее следуют доклинические исследования, необходимые перед подачей заявки на испытания на людях, а затем клинические испытания.

Опубликованный портфель терапевтических разработок Basecamp показывает, что ни одна из шести программ пока не вышла из стадии оптимизации ведущих кандидатов. | Изображение: Basecamp Research

Четыре программы находятся на этапе оптимизации ведущих кандидатов. Среди них — CAR-T-терапия in vivo для лечения рака крови и неназванного аутоиммунного заболевания, генная терапия печени для наследственного нарушения обмена веществ — фенилкетонурии (ФКУ), — а также антимикробные пептиды против устойчивых патогенов. Все программы клеточной и генной терапии используют крупные сериновые рекомбиназы. CAR-T-терапия солидных опухолей и пептиды для лечения диабета пока находятся на ранней стадии исследований.

В обзоре не говорится, какая программа первой перейдёт к испытаниям на людях и когда это произойдёт. Сначала Basecamp не ответила на вопросы THE DECODER по этому поводу, а также о доклинических результатах, их независимой проверке и сравнительных данных с другими ИИ-системами. Компания сообщила, что ответит позднее.

Почему треть графических процессоров Basecamp используется для обучения с подкреплением

Для Лоренца данные природы являются основой, а не заменой медицинских экспериментов. В своей лаборатории в Бостоне Basecamp, среди прочего, получает данные в экспериментах с T-клетками — разновидностью иммунных клеток человека.

Эти эксперименты не дают миллиарды токенов. Обычно они позволяют получить от нескольких сотен до нескольких тысяч точек данных. Взамен они отвечают на узкие вопросы, например работает ли генетическое изменение в определённом типе клеток.

Basecamp хочет использовать эти результаты, чтобы направлять уже широко обученную модель на конкретные задачи. Это включает дополнительные раунды обучения на выбранных примерах, а также обучение с подкреплением, при котором модель корректируется на основе оценок её результатов.

«Сейчас треть наших графических процессоров зарезервирована для экспериментов с обучением с подкреплением», — говорит Лоренц, имея в виду графические процессоры, на которых компания обучает свои модели.

Он не сообщает, какой измеримый прирост дали эти эксперименты. Однако распределение вычислительных ресурсов Basecamp показывает, что компания делает ставку не только на подачу всё большего объёма данных на этапе предварительного обучения. Обучение с подкреплением обеспечило значительную часть недавнего роста производительности языковых моделей, таких как GPT-6.

Basecamp также хочет расширить сами данные. По словам Лоренца, первое семейство моделей EDEN было чистой ДНК-моделью. ДНК кодирует белки, которые, в свою очередь, сворачиваются в структуры. Это означает, что ДНК-модель уже улавливает множество сигналов, для получения которых в противном случае потребовались бы отдельные модели белков или структур. Следующее поколение должно решать более сложные, более клинические задачи — например упомянутые ранее оценки безопасности и токсикологии — и обрабатывать другие типы данных, помимо последовательностей ДНК. Какие именно, Лоренц не уточняет.

Более высокие показатели на тестах не означают получение лучших молекул

«Чем больше данных мы собираем, тем сильнее я думаю, что нам нужно собирать ещё больше данных», — говорит Лоренц. Пока Basecamp ежегодно увеличивала свой набор данных примерно в десять раз. По словам Лоренца, с каждым новым запуском обучения команда видит «рост производительности, но никогда не выходит на плато».

Качество данных также имеет значение, считает Лоренц. Basecamp уделяет много внимания обработке образцов — от выделения и секвенирования до сборки. В течение последних шести месяцев компания обучала идентичные архитектуры моделей в одинаковых условиях на собственных и общедоступных данных. Собственные данные дали более крутой график масштабирования. Для небольших моделей разрыв был небольшим, а с увеличением моделей он рос.

Лоренц измеряет это с помощью перплексии, которая показывает, насколько хорошо модель предсказывает следующие символы в последовательности. Чем ниже показатель, тем лучше. По его словам, чтобы достичь перплексии, равной двум, данные Basecamp позволяют сэкономить от нескольких сотен тысяч до миллионов часов работы графических процессоров. Для перплексии 1,5 экстраполяция указывает на разницу в миллиарды часов работы графических процессоров. Это прогноз, а не измеренный результат.

По словам Лоренца, основные принципы законов масштабирования, известных по языковым моделям, действуют и в биологии. Однако конкретные соотношения различаются в зависимости от типа модели — например, между моделями ДНК и белков.

В то же время он предупреждает, что не следует полагаться только на технические показатели. Basecamp сравнила несколько архитектур моделей, включая StripedHyena — архитектуру, лежащую в основе модели Evo Arc Institute, — и Llama. StripedHyena иногда достигала более низкой перплексии, но Llama лучше справлялась с последующими биологическими задачами.

Именно поэтому Basecamp выбрала Llama, говорит Лоренц. Компания также регулярно проверяет контрольные точки обучения, чтобы выяснить, насколько хорошо модели справляются с биологическими задачами. В качестве примера способности, которая отчётливо проявляется только по мере увеличения моделей, он приводит прогнозирование возможных иммунных реакций на молекулу. В самой маленькой версии EDEN эта способность выражена слабее. Конкретных цифр он не сообщил.

«Чтобы не давать преувеличенных обещаний относительно того, что ИИ может или не может, нужно просто проводить эксперименты и выяснять, что он делает», — говорит Лоренц. Команду часто удивляет, какие свойства возникают при масштабировании.

Синтетические обучающие данные пока имеют более низкий приоритет. По словам Лоренца, они лишь добавляют больше точек в уже известных областях пространства последовательностей и не открывают новых. Basecamp в первую очередь хочет охватить биоразнообразие, с которым никто раньше не сталкивался. Во внутренних тестах модели, обученные на синтетических данных, иногда создавали работающие белки, но никогда не демонстрировали настоящего обобщения на новые задачи.

Чат-боты становятся входом в биологические модели

Работа с биологическими моделями не должна оставаться задачей только для специалистов. Basecamp сделала отдельные функции EDEN для разработки антибиотиков и выбора потенциальных мишеней для вакцин доступными через Claude и Claude Science.

Исследователи могут описать свою задачу обычным языком. Затем Claude обращается к EDEN, чтобы, например, предложить кандидатов для дальнейшего изучения. Для вакцин первый вопрос заключается в том, какие части патогена могут служить мишенями для защитного иммунного ответа.

Лоренц говорит, что Basecamp не будет открыто публиковать модели. Он ссылается на соображения безопасности и соглашения с партнёрами, предоставляющими данные, и считает эти причины тесно связанными. Многие партнёры предпочитают модель, коммерческое использование которой приносит им долю дохода, открытому исходному коду, использование которого невозможно отследить. Arc Institute, напротив, открыто выпустил свою модель Evo и исключил данные о патогенах из обучения.

Помимо прочих мер Basecamp также удаляет определённые данные о вирусах из обучающих материалов и проверяет сгенерированные последовательности по базам данных известных патогенов. Эти меры призваны снизить риск неправомерного использования. Однако это не доказывает, что они полностью предотвращают появление проблемных результатов.

Кому должны принадлежать деньги за данные природы, пока остаётся предметом споров

Стратегия работы с данными также зависит от того, готовы ли страны и местные учреждения сотрудничать с Basecamp. По словам Лоренца, компания не начинает сбор образцов без предварительного информированного согласия землевладельцев, а также местных и национальных властей.

«Каждый токен, на котором предварительно обучалась EDEN, мы можем отследить до точного географического местоположения и конкретного согласия, которое нам было предоставлено», — говорит он.

Партнёрам не следует ждать до тех пор, пока лекарство, возможно, выйдет на рынок спустя годы, чтобы получить выгоду. Лоренц указывает на наём местных учёных и инвестиции в технологии секвенирования и лаборатории, призванные создать местную «биоэкономику». В статье о BaseData также описываются лицензионные выплаты, распределяемые в соответствии с долей каждого партнёра в использованных для обучения данных.

Согласно этой статье, к концу 2024 года Basecamp осуществила выплаты 52 получателям в 19 странах. В самом быстром случае между сбором образцов и первой выплатой прошло девять месяцев.

Лоренц, который во время работы в академической сфере сотрудничал с открытыми базами данных, не видит в этой модели альтернативу общедоступным данным, а рассматривает её как параллельную систему. По его словам, согласие и распределение выгод создают доверие, а это даёт партнёрам стимул масштабировать сбор данных до уровня, необходимого Basecamp для её моделей.

Достаточна ли эта доля, остаётся спорным вопросом. В 2025 году Financial Times сообщила, что выплаты составляют один процент выручки. Исследователь Джим Томас сказал изданию, что ценит возможность отслеживать данные, но раскритиковал размер выплат. По его мнению, данные также повышают стоимость компании, а сообщества, из которых они происходят, не получают справедливой доли.

Орелли Дингом из министерства окружающей среды Камеруна также заявила, что более высокие доли были бы справедливыми. Основатели Basecamp указали изданию на договорные гарантии и заявили, что долгосрочные партнёрства отвечают собственным деловым интересам компании.

Теперь у Basecamp есть ещё 140 млн долларов для следующего этапа медицинской разработки. Проведённые до сих пор эксперименты показывают, что EDEN может разрабатывать биологически активных кандидатов. Предстоящие исследования должны показать, превращаются ли эти кандидаты в безопасные и эффективные методы лечения, которые проще производить.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать без рекламы, получать еженедельную рассылку об ИИ, наш эксклюзивный обзор передовых разработок «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Basecamp Research / модели EDEN | BioRxiv / статья о BaseData | Microsoft / исследование Basecamp | PR Newswire / Атлас триллиона генов | GEN Biotechnology / разнообразие белков | BioRxiv / семейство моделей EDEN | PR Newswire / EDEN в Claude Science | PR Newswire / модели для вставки генов | Financial Times / проблемы генной терапии

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости