Всередині Basecamp Research — ШІ-стартапу, що перетворює еволюцію на дані для навчання
Ключові моменти
- Лондонська компанія Basecamp Research залучила від інвесторів, зокрема Nvidia та Anthology Fund компанії Anthropic, 140 мільйонів доларів для створення AI-моделей для розробки ліків і клітинних терапій.
- Моделі під назвою EDEN навчаються на ДНК мікроорганізмів, зібраних у зразках довкілля по всьому світу. Basecamp використовує їх для розробки нових антибіотиків і біологічних інструментів, які вставляють гени у визначені ділянки всередині організму.
- Початкові лабораторні роботи та дослідження на мишах показують, що окремі кандидати в ліки діють проти мультирезистентних бактерій. Клінічні випробування на людях ще мають довести безпечність та ефективність терапій.
Basecamp Research залучила 140 мільйонів доларів від інвесторів, зокрема Nvidia та Anthology Fund компанії Anthropic. Лондонська компанія навчає AI-моделі на генетичному матеріалі з тропічних лісів, океанів і гарячих джерел, щоб розробляти антибіотики та інструменти для клітинної терапії. В інтерв’ю THE DECODER технічний директор Філіп Лоренц пояснює, чому біологія є значно складнішою проблемою для AI, ніж мова, і чому високі показники на папері не гарантують створення ефективних молекул.
За даними компанії, раунд очолила S32. Серед інших учасників — Nvidia, Anthology Fund компанії Anthropic, NATO Innovation Fund і Redalpine.
Заснована у 2020 році, Basecamp планує використати ці кошти для подальшої розробки своїх біологічних AI-моделей під назвою EDEN та просування власних кандидатів у терапії до етапу клінічної розробки. Першими будуть клітинні терапії. Такі методи лікування генетично модифікують клітини пацієнта, щоб вони, наприклад, могли боротися з раком. Basecamp хоче здійснювати цю зміну безпосередньо всередині організму.
Для цього компанія звертається до мікроорганізмів із середовищ, які дослідники майже не вивчали. Моделі мають навчитися розпізнавати у їхніх геномах закономірності, які можна застосувати в медицині.
«З огляду на складність біології нам просто потрібно на порядки більше даних», — розповідає THE DECODER технічний директор Basecamp Філіп Лоренц. За його словами, найважливіше — поєднати цей масштабний збір даних із меншими цілеспрямованими експериментами.
До перетворення всього цього на метод лікування ще належить виконати чимало роботи. Наразі Basecamp має лабораторні результати та дані досліджень на мишах. Це не показує, чи здатен її підхід створювати безпечні та ефективні терапії для людей.
Чому публічні геномні бази даних не можуть стати основою біологічного AI
Нещодавно The Wall Street Journal повідомила, що фармацевтичні компанії вкладають мільярди в AI, але переконливих доказів помітно вищих показників успішності клінічної розробки досі мало. Лоренц не вважає це підставою сумніватися в технології. За його словами, масштабування дуже швидко принесло мовним моделям значні переваги. Біологія також прогресує, але великі відкриті питання, як-от прискорення клінічних випробувань, є набагато складнішими. Як проблема біологія «набагато, набагато, набагато складніша і масштабніша».
Дані також принципово відрізняються. Мовні моделі навчаються на величезних масивах текстів, тоді як фармацевтичні компанії часто працюють із невеликими ізольованими наборами даних окремих досліджень.
Лоренц використовує оцінку Epoch AI, щоб показати масштаб розриву. Вона визначає верхню межу всіх наявних слів приблизно у п’ять квадрильйонів токенів. Basecamp оцінює кількість нуклеотидів на Землі як 10 у степені 37. «Якби ви склали стос карт, наприклад покерних, із 10 у степені 37 карт, цей стос оточив би спостережуваний Всесвіт мільйон разів», — каже Лоренц. За його словами, набір даних такого розміру не потрібен, але потрібен набагато більший, ніж існує сьогодні.
Публічні геномні бази даних також дають неповну картину природи. Згідно з дослідницькою статтею Basecamp про її базу BaseData, близько 68 відсотків обсягу послідовностей у Sequence Read Archive припадає лише на п’ять видів. На самих людей припадає близько 54 відсотків.

Для медичних досліджень така концентрація має сенс. Однак для моделі, яка має вивчити якомога більше різних біологічних процесів, Basecamp вважає це обмеженням, оскільки багато інших форм життя майже не представлені в даних. «Якби ви навчали LLM лише на газетних статтях 1975 року, це була б дуже, дуже погана модель», — сказав Лоренц у тематичному дослідженні Microsoft, хмарного партнера компанії. «Саме в такому становищі ми перебуваємо в біології».
Тому Basecamp збирає власні зразки разом із місцевими дослідницькими партнерами: із ґрунту тропічних лісів, вулканічних порід і глибоководних районів біля Антарктиди. Згідно з останнім оголошенням про фінансування, мережа тепер охоплює понад 30 країн і всі сім континентів. Microsoft зазначає, що в ній беруть участь 208 організацій із 31 країни.
На момент інтерв’ю набір даних містив близько 15 трильйонів токенів, за словами Лоренца. Це вже приблизно той самий діапазон, що й текстові набори даних, на яких навчають моделі на кшталт Claude або GPT. Однак тут токеном є один будівельний блок ДНК. AI не обробляє слова, як чатбот. Він обробляє послідовності символів, що описують генетичний матеріал.
За даними Microsoft, перше покоління EDEN навчалося на 9,7 трильйона будівельних блоків ДНК більш ніж мільйона нещодавно секвенованих видів. Basecamp проводила навчання разом із дослідниками Microsoft в Azure, а обчислювальні ресурси, як повідомляється, відповідали ресурсам GPT-4. Втім, OpenAI ніколи офіційно не розкривала цю цифру.
Протягом наступних півтора року набір даних має зрости приблизно у сто разів і перевищити один квадрильйон токенів. Основою для цього є Trillion Gene Atlas, оголошений у березні. У його межах Basecamp, Anthropic, Nvidia, PacBio та Ultima Genomics планують зібрати генетичні дані масштабу одного трильйона генів.
В останньому оголошенні про фінансування Basecamp уже називає Trillion Gene Atlas навчальною основою для своїх моделей EDEN. Компанія не повідомляє, наскільки просунулося заплановане розширення.
Бактеріальні перегони озброєнь дають основу для нових ліків
Лоренц вважає еволюцію, яка визначає всі біологічні процеси, зв’язком між зразками довкілля та медициною. Чи то бактерія в гарячому джерелі адаптується до тепла, чи то ракова клітина поширюється — подібні фактори добору діють в обох випадках. Геноми людей, ссавців і майже всіх хребетних значною мірою секвеновані, тоді як решта біорізноманіття майже не каталогізована. Багато ліків також спочатку походили від рослин, бактерій і грибів.
Як конкретний приклад він наводить мікроорганізми-конкуренти. За його словами, деякі з найпотужніших терапевтичних молекул виникають унаслідок «біологічної війни» між організмами. Коли вид бактерій намагається домінувати в екосистемі, він іноді виробляє речовини, які пригнічують або знищують конкуруючі види, забезпечуючи собі їжу та середовище існування. Це відбувається мільярди разів у незліченних місцях на Землі, особливо там, де бракує поживних речовин. У медицині такі речовини можуть бути корисними як антибіотики.
У тематичному дослідженні Microsoft Лоренц називає ще один приклад — фаги. Ці віруси заражають бактерії та вводять свою ДНК у клітини. Саме ця взаємодія створила інструменти, які можна використовувати для редагування генів.
Basecamp хоче навчатися на широкому спектрі таких еволюційних рішень. Моделі мають не просто повторно відкривати відомі сполуки. Вони повинні розробляти нових кандидатів на основі вивчених закономірностей.
Для цього компанія фіксує хімічні, фізичні та екологічні умови на кожній локації разом із генетичним матеріалом. Вона також зосереджується на довгих безперервних ділянках ДНК. Вони показують, які гени розташовані поруч і можуть працювати разом. Короткі ізольовані фрагменти часто втрачають цей контекст.

Розроблений AI антибіотик успішно пройшов перше випробування на тваринах
Лоренц вважає розроблені EDEN антибіотики першим доказом медичної цінності системи. «Ми задаємо моделі патоген, а потім вона розробляє антибіотик, який його знищує», — каже він.
У дослідницькій статті про сімейство моделей EDEN, яка ще не пройшла рецензування, автори описують невеликий підібраний набір антимікробних пептидів — коротких білкових ланцюгів, здатних атакувати бактерії. Згідно зі статтею, 97 відсотків протестованих кандидатів проявили активність у лабораторії.
Цей показник стосується лише протестованої вибірки, а не всього, що може розробити модель. Однак Basecamp стверджує, що не обмежилася експериментами в пробірці.
Оголошення компанії в червні описує випробування кандидата під назвою EDEN-7. У мишей, інфікованих мультирезистентними бактеріями, він, як повідомляється, діяв приблизно так само добре, як антибіотик крайньої необхідності — препарат, призначений для важковиліковних інфекцій.
За даними Basecamp, модель безпосередньо створила кандидата без жодних етапів доопрацювання перед випробуванням. Роботу виконували разом із дослідниками Пенсильванського університету під керівництвом Сезара де ла Фуенте.
Лоренц надає великого значення цьому переходу від розробки до експерименту. За його словами, Basecamp займається не лише збором даних і навчанням моделей. Важливо, чи справді молекули працюють.
Окрім антибіотиків та описаних нижче інструментів вставки, Basecamp також попросила EDEN створити синтетичний мікробіом кишечника приблизно з 9 000 видів бактерій, повідомляє Microsoft. Для перевірки результатів команда залучила дослідницю мікробіому з Каліфорнійського університету в Берклі Джилл Банфілд, яка встановила суворі критерії і тепер є співавторкою відповідної статті. «Корисно запитати скептично налаштовану людину, а не покладатися лише на AI», — сказав Лоренц.
Ставка Basecamp на терапії ґрунтується на вставці генів усередині організму
Для власних терапевтичних розробок Basecamp наразі використовує EDEN інакше. Модель має розробляти біологічні інструменти, які вставляють більші ділянки ДНК у вибрані місця людського геному.
До них належать великі серинові рекомбінази — ферменти, здатні повторно з’єднувати ДНК. Basecamp хоче розробити їх так, щоб вони вставляли терапевтично корисну генетичну інформацію в клітини у визначених місцях.
Цей підхід спрямований на вирішення ключової проблеми генної терапії. Багато спадкових захворювань спричинені різними мутаціями залежно від пацієнта. Замість виправлення кожної з них ферменти вставляли б здорову копію гена незалежно від конкретної мутації. Ці інструменти вставки походять із того самого конфлікту між фагами та бактеріями, і перед роботою в людському геномі їх потрібно перепрограмувати.
У статті про EDEN автори повідомляють про кількох функціональних кандидатів-ферментів для кожної дослідженої ділянки-мішені, що має значення для захворювань. Половина створених серинових рекомбіназ була активною в клітинах людини.
Одним із можливих застосувань є CAR-T-клітини — генетично модифіковані імунні клітини, призначені для розпізнавання та атаки ракових клітин. В оголошенні від січня Basecamp заявила, що первинні людські T-клітини, модифіковані таким способом, тобто імунні клітини, безпосередньо взяті від донорів, знищили в лабораторії понад 90 відсотків пухлинних клітин.
Завдяки новому фінансуванню компанія хоче розвинути цей підхід у метод лікування, який працюватиме безпосередньо всередині організму. Це спростило б складне виробництво клітинних терапій, яке нині може коштувати сотні тисяч доларів на одного пацієнта, згідно з оголошенням про фінансування.
Однак генетична модифікація, яка працює в лабораторії, не відповідає на питання, як необхідні компоненти безпечно доставити до потрібних клітин в організмі. Співзасновник Arc Institute Патрік Хсу порушив це питання у матеріалі Financial Times від травня 2025 року. Він назвав відкритими проблемами доставку, можливі токсичні ефекти та захисні реакції клітин.
У довгостроковій перспективі принцип, що лежить в основі розробки антибіотиків, має поширитися на захворювання загалом. «Наше завдання — зробити біологію програмованою. Ви задаєте хворобу, а на виході отримуєте молекулу, яка її подолає», — сказав Лоренц Microsoft. Він визнає, що компанія все ще далека від цієї мети. «Ці молекули чудові, вони активні, вони працюють. Але щоб вони потрапили в клініку, має відбутися ще багато чого».
Опублікований Basecamp на своєму сайті портфель терапій показує, наскільки довгий цей шлях. Станом на вересень 2026 року жодна з шести програм не просунулася далі оптимізації провідних кандидатів — етапу, на якому перспективні кандидати вдосконалюють. Наступними є доклінічні дослідження, необхідні перед поданням заявки на випробування на людях, а потім — клінічні випробування.

Чотири програми перебувають на етапі оптимізації провідних кандидатів. Серед них — CAR-T-терапії in vivo для лікування раку крові та неназваного автоімунного захворювання, генна терапія печінки для спадкового метаболічного розладу фенілкетонурії (ФКУ) та антимікробні пептиди проти стійких патогенів. Усі програми клітинної та генної терапії спираються на великі серинові рекомбінази. CAR-T-терапія солідних пухлин і пептиди для лікування діабету все ще перебувають на ранній стадії досліджень.
В огляді не зазначено, яка програма першою перейде до випробувань на людях і коли це станеться. Спочатку Basecamp не відповіла на запитання THE DECODER щодо цього, а також щодо доклінічних результатів, їхньої незалежної перевірки та порівняльних даних з іншими AI-системами. Компанія заявила, що відповість пізніше.
Чому третина GPU Basecamp спрямована на навчання з підкріпленням
Для Лоренца дані природи є основою, а не заміною медичних експериментів. У своїй лабораторії в Бостоні Basecamp, серед іншого, отримує дані з експериментів із T-клітинами — різновидом людських імунних клітин.
Ці експерименти не створюють мільярди токенів. Зазвичай вони дають від сотень до тисяч точок даних. Натомість вони відповідають на вузькі питання, наприклад чи працює генетична зміна у певному типі клітин.
Basecamp хоче використовувати ці результати, щоб спрямовувати вже широко навчену модель на конкретні завдання. Це передбачає додаткові раунди навчання на вибраних прикладах, а також навчання з підкріпленням, під час якого модель коригується на основі оцінок її результатів.
«Наразі третина наших GPU зарезервована для експериментів із навчанням з підкріпленням», — каже Лоренц, маючи на увазі графічні процесори, на яких компанія навчає свої моделі.
Він не повідомляє, які вимірювані покращення дали ці експерименти. Але розподіл обчислювальних ресурсів Basecamp показує, що компанія робить ставку не лише на постійне збільшення обсягу даних для попереднього навчання. Навчання з підкріпленням забезпечило значну частину нещодавніх приростів продуктивності мовних моделей на кшталт GPT-6.
Basecamp також хоче розширити самі дані. За словами Лоренца, перше сімейство моделей EDEN було суто моделлю ДНК. ДНК кодує білки, які, своєю чергою, згортаються у структури. Це означає, що модель ДНК уже вловлює багато сигналів, для отримання яких інакше знадобилися б окремі моделі білків або структур. Наступне покоління має працювати зі складнішими, більш клінічними завданнями, як-от згадані раніше оцінки безпечності та токсикології, а також обробляти інші види даних, окрім послідовностей ДНК. Лоренц не уточнює, які саме.
Кращі результати тестів не означають кращих молекул
«Що більше даних [ми] збираємо, то більше я думаю, що нам потрібно збирати ще більше даних», — каже Лоренц. Досі Basecamp щороку приблизно вдесятеро збільшувала свій набір даних. За його словами, з кожним новим запуском навчання команда бачить «зростання продуктивності, але ніколи — плато продуктивності».
Якість даних також має значення, вважає Лоренц. Basecamp приділяє багато уваги обробці зразків — від екстракції до секвенування та складання послідовностей. Протягом останніх шести місяців компанія навчала ідентичні архітектури моделей за однакових умов: на власних даних і на публічних даних. Її власні дані забезпечили крутішу криву масштабування. Для малих моделей розрив був невеликим, але зі збільшенням моделей він зростав.
Лоренц вимірює це за допомогою перплексії, яка відстежує, наскільки добре модель передбачає наступні символи в послідовності. Нижчий показник кращий. За його словами, щоб досягти перплексії два, дані Basecamp заощаджують від кількох сотень тисяч до мільйонів годин роботи GPU. Для перплексії 1,5 екстраполяція вказує на різницю в мільярди годин роботи GPU. Це прогноз, а не виміряний результат.
За словами Лоренца, основні принципи законів масштабування, відомих із мовних моделей, діють і в біології. Однак конкретні співвідношення відрізняються залежно від типу моделі, наприклад між моделями ДНК і білків.
Водночас він застерігає від опори лише на технічні показники. Basecamp порівняла кілька архітектур моделей, зокрема StripedHyena — архітектуру, що лежить в основі моделі Evo Arc Institute, — і Llama. StripedHyena іноді досягала нижчої перплексії, але Llama краще виконувала подальші біологічні завдання.
Саме тому Basecamp обрала Llama, каже Лоренц. Компанія також регулярно перевіряє контрольні точки навчання, щоб оцінити, наскільки добре моделі виконують біологічні завдання. Як приклад здатності, яка чітко проявляється лише зі збільшенням моделей, він наводить передбачення можливих імунних реакцій на молекулу. У найменшій версії EDEN ця здатність слабша. Конкретних цифр він не надав.
«Щоб не перебільшувати можливості AI чи його обмеження, потрібно просто проводити експерименти й з’ясовувати, що він робить», — каже Лоренц. За його словами, команда часто сама дивується, які властивості виникають із масштабуванням.
Синтетичні навчальні дані наразі мають нижчий пріоритет. За словами Лоренца, вони лише додають більше точок у вже відомих ділянках простору послідовностей і не відкривають нових. Basecamp передусім хоче охопити біорізноманіття, якого ще ніхто не бачив. Під час внутрішніх тестів моделі, навчені на синтетичних даних, іноді створювали функціональні білки, але так і не досягали справжнього узагальнення на нові завдання.
Чатботи стають входом до біологічних моделей
Робота з біологічними моделями більше не має бути завданням лише для фахівців. Basecamp зробила окремі функції EDEN для розробки антибіотиків і вибору потенційних мішеней для вакцин доступними через Claude та Claude Science.
Дослідники можуть описати своє завдання звичайною мовою. Потім Claude звертається до EDEN, щоб, наприклад, запропонувати кандидатів для подальшого вивчення. Для вакцин перше питання полягає в тому, які частини патогену можуть слугувати мішенями для захисної імунної відповіді.
Лоренц каже, що Basecamp не випускатиме моделі у відкритий доступ. Він посилається на проблеми безпеки та угоди з партнерами, які надають дані, і вважає ці питання тісно пов’язаними. Багато партнерів віддають перевагу моделі, комерційне використання якої приносить їм частку доходу, а не моделі з відкритим кодом, використання якої ніхто не може відстежити. Натомість Arc Institute відкрив свою модель Evo і не включав дані про патогени в навчання.
Серед інших заходів Basecamp також вилучає певні дані про віруси зі своїх навчальних матеріалів і перевіряє створені послідовності за базами даних відомих патогенів. Ці заходи мають знизити ризик зловживань. Однак це не доводить, що вони повністю запобігають появі небезпечних результатів.
Хто отримує гроші за дані природи, досі є предметом дискусій
Стратегія роботи з даними також залежить від готовності країн і місцевих установ співпрацювати з Basecamp. За словами Лоренца, компанія не починає збір зразків без попередньої поінформованої згоди землевласників, а також місцевих і національних органів влади.
«Кожен окремий токен, на якому попередньо навчалася EDEN, ми можемо простежити до точної географічної локації та конкретної згоди, яку нам надали», — каже він.
Партнери не повинні чекати роками, поки препарат, можливо, вийде на ринок, щоб отримати вигоду. Лоренц вказує на наймання місцевих науковців та інвестиції в технології секвенування й лабораторії, покликані розбудувати місцеву «біоекономіку». У статті про BaseData також описано ліцензійні виплати, розподілені відповідно до частки кожного партнера в навчальних даних.
Згідно з цією статтею, до кінця 2024 року Basecamp здійснила виплати 52 отримувачам у 19 країнах. У найшвидшому випадку між збором зразків і першою виплатою минуло дев’ять місяців.
Лоренц, який під час академічної роботи користувався відкритими базами даних, не вважає цю модель альтернативою публічним даним, а радше паралельною системою. За його словами, згода та розподіл вигод формують довіру, а це дає партнерам підстави масштабувати збір даних до рівня, необхідного Basecamp для її моделей.
Чи достатньою є ця частка, залишається спірним. У 2025 році Financial Times повідомила, що виплати становлять один відсоток доходу. Дослідник Джим Томас сказав виданню, що цінує можливість відстежувати дані, але критикує розмір виплат. За його словами, дані також підвищують вартість компанії, а спільноти, з яких вони походять, не отримують справедливої частки.
Ореллі Дінгом із міністерства довкілля Камеруну також заявила, що справедливими були б більші частки. Засновники Basecamp вказали виданню на договірні гарантії та заявили, що довгострокові партнерства відповідають власним бізнес-інтересам компанії.
Тепер Basecamp має ще 140 мільйонів доларів для наступного етапу медичної розробки. Досі її експерименти показують, що EDEN може створювати біологічно активних кандидатів. Майбутні дослідження мають показати, чи перетворяться ці кандидати на безпечні, ефективні та простіші у виробництві методи лікування.
Новини AI без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про AI, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.