Отвътре в Basecamp Research, AI стартъпа, който превръща еволюцията в данни за обучение
Основни моменти
- Базираната в Лондон Basecamp Research е набрала 140 милиона долара от инвеститори, сред които Nvidia и Anthology Fund на Anthropic, за разработване на AI модели за създаване на лекарства и клетъчни терапии.
- Моделите, наречени EDEN, се обучават върху ДНК от микроорганизми, събрани в проби от околната среда по целия свят. Basecamp ги използва за проектиране на нови антибиотици и биологични инструменти, които вмъкват гени на целеви места в организма.
- Ранни лабораторни изследвания и проучвания върху мишки показват, че отделни лекарствени кандидати действат срещу мултирезистентни бактерии. Клиничните изпитвания върху хора все още трябва да докажат, че терапиите са безопасни и ефективни.
Basecamp Research е набрала 140 милиона долара от инвеститори, сред които Nvidia и Anthology Fund на Anthropic. Лондонската компания обучава AI модели върху генетичен материал от дъждовни гори, океани и горещи извори, за да проектира антибиотици и инструменти за клетъчни терапии. В интервю за THE DECODER техническият директор Филип Лоренц обяснява защо биологията е много по-голям проблем за AI от езика и защо добрите резултати на хартия не гарантират добри молекули.
Според компанията инвестиционният фонд S32 е ръководил инвестиционния кръг. В него са участвали още Nvidia, Anthology Fund на Anthropic, NATO Innovation Fund и Redalpine.
Основана през 2020 г., Basecamp планира да използва средствата, за да продължи разработването на биологичните си AI модели, наречени EDEN, и да придвижи собствените си терапевтични кандидати към клинична разработка. На първо място са клетъчните терапии. При тези лечения клетките на пациента се модифицират генетично, за да могат например да се борят с рака. Basecamp иска да извършва тази промяна директно в организма.
За да постигне това, компанията се обръща към микроорганизми от местообитания, които изследователите почти не са проучвали. Очаква се моделите да научат от геномите им закономерности, които могат да се използват в медицината.
„Като се има предвид сложността на биологията, просто се нуждаем от порядъци повече данни“, казва Филип Лоренц, технически директор на Basecamp, пред THE DECODER. Според него най-важното е това огромно събиране на данни да се комбинира с по-малки, целенасочени експерименти.
Преди всичко това да се превърне в лечение, предстои още много работа по разработването. Засега Basecamp разполага с лабораторни резултати и данни от мишки. Това не показва дали подходът ѝ може да създаде безопасни и ефективни терапии за хора.
Защо публичните геномни бази данни не могат да поддържат биологичния AI
Wall Street Journal наскоро съобщи, че фармацевтичните компании влагат милиарди в AI, но солидни доказателства за осезаемо по-високи нива на успех при клиничната разработка все още липсват. Лоренц не вижда в това причина да се съмняваме в технологията. Според него мащабирането много бързо е довело до големи подобрения при езиковите модели. Биологията също напредва, казва той, но големите нерешени въпроси, като ускоряването на клиничните изпитвания, са много по-трудни. Като проблем биологията е „много, много, много по-сложна и много по-голяма“.
Данните също са фундаментално различни. Езиковите модели се обучават върху огромни колекции от текстове, докато фармацевтичните компании често работят с малки, изолирани набори от данни от отделни проучвания.
Лоренц използва оценка на Epoch AI, за да покаже колко голяма е разликата. Според нея горната граница на всички съществуващи думи е приблизително пет квадрилиона токена. Basecamp изчислява броя на нуклеотидите на Земята на 10 на степен 37. „Ако вземете купчина карти, като покер карти, състояща се от 10 на степен 37 карти, тази купчина ще обиколи наблюдаемата вселена милион пъти“, казва Лоренц. Не е необходимо наборът от данни да е толкова голям, казва той, но трябва да е много по-голям от съществуващите днес.
Публичните геномни бази данни също представят непълна картина на природата. Според научната статия на Basecamp за базата данни BaseData около 68 процента от обема на последователностите в Sequence Read Archive идва само от пет вида. Само хората представляват около 54 процента.

Този фокус има смисъл за медицинските изследвания. За модел, който трябва да научи колкото се може повече различни биологични процеси, обаче Basecamp го смята за ограничение, тъй като много други форми на живот почти не присъстват в данните. „Ако обучите LLM само върху статии от вестници от 1975 г., той ще бъде наистина, наистина лош модел“, казва Лоренц в казус на Microsoft, облачния партньор на компанията. „Точно там се намираме в биологията.“
Затова Basecamp събира собствени проби с местни изследователски партньори — от почва в дъждовни гори, вулканична почва и дълбокото море край Антарктида. Според последното съобщение за финансиране мрежата вече обхваща повече от 30 държави и всичките седем континента. Microsoft посочва, че участващите организации са 208 в 31 държави.
Към момента на интервюто наборът от данни съдържаше около 15 трилиона токена, според Лоренц. Това вече го поставя в същия диапазон като текстовите набори от данни, използвани за обучение на модели като Claude или GPT. Тук обаче токенът е единичен градивен елемент на ДНК. AI не обработва думи като чатбот. Той обработва низове от символи, които описват генетичен материал.
Според Microsoft първото поколение EDEN е обучено върху 9,7 трилиона градивни елемента на ДНК от повече от милион новосеквенирани вида. Basecamp е провела обучението с изследователи на Microsoft в Azure, като според съобщенията изчислителният ресурс е бил сравним с този на GPT-4. OpenAI обаче никога не е разкривала официално тази цифра.
През следващата година и половина наборът от данни трябва да нарасне приблизително сто пъти, като надхвърли един квадрилион токена. Рамката за това е Trillion Gene Atlas, обявен през март, чрез който Basecamp, Anthropic, Nvidia, PacBio и Ultima Genomics планират да съберат генетични данни в мащаба на един трилион гена.
В последното си съобщение за финансиране Basecamp вече нарича Trillion Gene Atlas основата за обучение на своите модели EDEN. Компанията не посочва докъде е стигнало планираното разширяване.
Бактериалните надпревари във въоръжаването предлагат модел за нови лекарства
Лоренц вижда еволюцията, която движи всички биологични процеси, като връзката между пробите от околната среда и медицината. Независимо дали бактерия в горещ извор се адаптира към топлината, или ракова клетка се разпространява, действат сходни селективни фактори. Геномите на хората, бозайниците и почти всички гръбначни са до голяма степен секвенирани, докато останалото биоразнообразие почти не е каталогизирано. Много лекарства първоначално също са произлезли от растения, бактерии и гъби.
Той посочва конкуриращите се микроорганизми като конкретен пример. Някои от най-мощните терапевтични молекули произлизат от „биологична война“ между организми, казва той. Когато един бактериален вид се опитва да доминира над дадена екосистема, той понякога развива вещества, които потискат или убиват конкурентни видове, като така си осигурява храна и местообитание. Това се случва милиарди пъти на безброй места по Земята, особено там, където хранителните вещества са оскъдни. В медицината такива вещества могат да се използват като антибиотици.
В казуса на Microsoft Лоренц посочва фагите като друг пример. Тези вируси заразяват бактерии и инжектират ДНК в клетките. Тази взаимна надпревара е създала инструменти, които могат да се използват за редактиране на гени.
Basecamp иска да се учи от широк спектър от тези еволюирали решения. Моделите не трябва просто да преоткриват известни съединения. Те трябва да проектират нови кандидати въз основа на научените закономерности.
За тази цел компанията записва химичните, физичните и екологичните условия на всяко място заедно с генетичния материал. Тя също така се фокусира върху дълги, непрекъснати участъци от ДНК. Те показват кои гени се намират един до друг и биха могли да работят съвместно. Кратките, изолирани фрагменти често губят този контекст.

Антибиотик, проектиран от AI, преминава първия си тест върху животни
Лоренц вижда антибиотичните проекти на EDEN като ранно доказателство за медицинска стойност. „Подаваме на модела патоген и той проектира антибиотик, който го убива“, казва той.
В научна статия за семейството модели EDEN, която все още не е рецензирана, авторите докладват за малък, подбран набор от антимикробни пептиди — къси протеинови вериги, които могат да атакуват бактерии. Според статията 97 процента от тестваните кандидати са показали активност в лабораторията.
Този процент се отнася само за тестваната селекция, а не за всичко, което моделът би могъл да проектира. Basecamp обаче заявява, че не е спряла до експериментите в епруветка.
Съобщение на компанията от юни описва тестове с кандидат, наречен EDEN-7. При мишки, заразени с мултирезистентни бактерии, той според съобщенията е действал приблизително толкова добре, колкото антибиотик от последна инстанция — вид лекарство, запазено за трудно лечими инфекции.
Според Basecamp моделът е генерирал кандидата директно, без етапи на доработване преди теста. Работата е извършена с изследователи от Университета на Пенсилвания, ръководени от Сесар де ла Фуенте.
Лоренц отдава голямо значение на тази стъпка от проектирането до експеримента. Basecamp не се занимава само със събиране на данни и обучение на модели, казва той. Важното е дали молекулите действително работят.
Освен антибиотици и описаните по-долу инструменти за вмъкване, Basecamp е използвала EDEN и за генериране на синтетичен чревен микробиом от около 9000 бактериални вида, според Microsoft. За да провери резултатите, екипът е привлякъл изследователката на микробиома от UC Berkeley Джил Банфийлд, която е поставила строги критерии и сега е съавтор на свързаната статия. „Добре е да попитате скептичен човек, а не само AI“, казва Лоренц.
Залогът на Basecamp в терапиите се основава на вмъкване на гени в организма
Засега Basecamp използва EDEN по различен начин за собствената си терапевтична работа. Очаква се моделът да проектира биологични инструменти, които вмъкват по-големи участъци ДНК на избрани места в човешкия геном.
Те включват големи серинови рекомбинази — ензими, които могат да съединяват отново ДНК. Basecamp иска да ги проектира така, че да вмъкват генетична информация с терапевтична стойност в клетките на точно определени места.
Подходът е насочен към основен проблем при генната терапия. Много наследствени заболявания произтичат от различни мутации в зависимост от пациента. Вместо да се коригира всяка мутация поотделно, ензимите биха вмъкнали здраво копие на гена независимо от конкретната мутация. Тези инструменти за вмъкване произлизат от същия конфликт между фаги и бактерии и трябва да бъдат препрограмирани, преди да могат да работят в човешкия геном.
В статията за EDEN авторите съобщават за няколко работещи ензимни кандидата за всеки изследван регион, свързан с дадено заболяване. Половината от генерираните серинови рекомбинази са били активни в човешки клетки.
Една възможна употреба са CAR-T клетките — генетично модифицирани имунни клетки, предназначени да разпознават и атакуват ракови клетки. В съобщение от януари Basecamp заявява, че първични човешки Т-клетки, модифицирани по този начин, тоест имунни клетки, взети директно от донори, са унищожили повече от 90 процента от туморните клетки в лабораторията.
С новото финансиране компанията иска да развие подхода до лечение, което действа директно в организма. Това би опростило сложното производство на клетъчни терапии, което понастоящем може да струва стотици хиляди долари на пациент, според съобщението за финансирането.
Генетична редакция, която работи в лабораторията, обаче не дава отговор на въпроса как необходимите компоненти ще достигнат безопасно до правилните клетки в организма. Съоснователят на Arc Institute Патрик Хсу повдига този въпрос в публикация на Financial Times от май 2025 г. Той посочва доставянето, възможните токсични ефекти и защитните реакции на клетките като нерешени предизвикателства.
В дългосрочен план принципът зад антибиотичните проекти трябва да се разшири до заболяванията като цяло. „Амбицията ни е да направим биологията програмируема. Подавате на модела заболяване и получавате молекула, която ще го адресира“, казва Лоренц пред Microsoft. Той признава, че компанията все още е далеч от тази цел. „Тези молекули са страхотни, активни са, работят. Но за да влязат в клиниката, трябва да се случат още много неща.“
Публикуваният на уебсайта на Basecamp терапевтичен портфейл показва колко дълъг е пътят. Към септември 2026 г. нито една от шестте програми не е преминала етапа на оптимизация на водещите кандидати — етапа, в който обещаващите кандидати се усъвършенстват. Следват предклинични проучвания, които са необходими преди подаване на заявление за изпитвания върху хора, а след тях — клинични изпитвания.

Четири програми са на етап оптимизация на водещите кандидати. Те включват in vivo CAR-T клетъчни терапии за рак на кръвта и за неназовано автоимунно заболяване, генна терапия на черния дроб за наследственото метаболитно заболяване фенилкетонурия (PKU) и антимикробни пептиди срещу резистентни патогени. Всички програми за клетъчна и генна терапия разчитат на големи серинови рекомбинази. CAR-T терапия за солидни тумори и пептиди за диабет все още са на ранен етап на изследване.
Обзорът не посочва коя програма ще започне първа изпитвания върху хора или кога. Basecamp първоначално не отговори на въпросите на THE DECODER по този въпрос, нито на въпросите за предклиничните си резултати, независимата им проверка и сравнителните данни с други AI системи. Компанията заяви, че ще отговори по-късно.
Защо една трета от графичните процесори на Basecamp се използват за обучение с подсилване
За Лоренц данните от природата са основа, а не заместител на медицинските експерименти. В лабораторията си в Бостън Basecamp генерира данни от експерименти с Т-клетки — вид човешки имунни клетки — наред с друга работа.
Тези експерименти не създават милиарди токени. Обикновено дават стотици до хиляди точки данни. В замяна отговарят на тесни въпроси, например дали дадена генетична промяна работи в конкретен клетъчен тип.
Basecamp иска да използва тези резултати, за да насочва вече широко обучен модел към конкретни задачи. Това включва допълнителни етапи на обучение с подбрани примери, както и обучение с подсилване, при което моделът се коригира въз основа на оценки на резултатите му.
„В момента една трета от графичните ни процесори е резервирана за експерименти с обучение с подсилване“, казва Лоренц, имайки предвид графичните процесори, върху които компанията обучава моделите си.
Той не посочва какви измерими подобрения са донесли тези експерименти досега. Но начинът, по който Basecamp разпределя изчислителния си ресурс, показва, че компанията не залага единствено на подаването на все повече данни към предварителното обучение. Обучението с подсилване е довело до голяма част от скорошните подобрения в представянето на езикови модели като GPT-6.
Basecamp иска също да разшири самите данни. Според Лоренц първото семейство модели EDEN е било чист ДНК модел. ДНК кодира протеини, които на свой ред се нагъват в структури. Това означава, че ДНК моделът вече улавя много сигнали, за чието улавяне иначе биха били необходими отделни протеинови модели или модели на структури. Следващото поколение трябва да обработва по-сложни, по-клинични задачи, като споменатите по-рано оценки на безопасността и токсикологията, и да обработва други видове данни извън ДНК последователностите. Лоренц не казва кои са те.
По-добрите резултати от бенчмаркове не означават по-добри молекули
„Колкото повече данни събираме, толкова повече мисля, че трябва да събираме още повече данни“, казва Лоренц. Досега Basecamp е увеличавала набора си от данни приблизително десет пъти годишно. С всеки нов цикъл на обучение екипът вижда „подобрения в представянето, но никога плато на представянето“, казва той.
Качеството на данните също има значение, според Лоренц. Basecamp полага големи усилия за обработката на пробите — от извличането през секвенирането до сглобяването. През последните шест месеца компанията е обучавала идентични архитектури на модели при иначе идентични условия върху свои и публични данни. Собствените ѝ данни са дали по-стръмна крива на мащабиране. Разликата е била малка при малките модели и е нараствала с увеличаването на моделите.
Лоренц измерва това с перплексия — показател, който проследява доколко добре моделът предсказва следващите символи в дадена последователност. По-ниската стойност е по-добра. За достигането на перплексия от две данните на Basecamp спестяват от няколкостотин хиляди до милиони часове работа на графични процесори, казва той. При перплексия от 1,5 екстраполацията сочи разлика от милиарди часове работа на графични процесори. Тази цифра е прогноза, а не измерен резултат.
Основните принципи на законите за мащабирането, познати от езиковите модели, се прилагат и в биологията, казва Лоренц. Конкретните съотношения обаче се различават според типа модел, например между ДНК и протеиновите модели.
В същото време той предупреждава да не се разчита единствено на технически показатели. Basecamp е сравнила няколко архитектури на модели, включително StripedHyena — архитектурата зад модела Evo на Arc Institute — и Llama. Понякога StripedHyena е достигала по-ниска перплексия, но Llama се е представяла по-добре при последвалите биологични задачи.
Затова Basecamp е избрала Llama, казва Лоренц. Компанията също така редовно проверява междинните етапи на обучението, за да види колко добре моделите се справят с биологични задачи. Като пример за способност, която се проявява ясно едва с увеличаването на моделите, той посочва предсказването на възможни имунни реакции към дадена молекула. Тя е по-слаба в най-малкия вариант на EDEN. Той не споделя конкретни числа.
„Без да обещаваме прекалено много за това какво AI може или не може да направи, просто провеждаме експериментите и разбираме какво прави“, казва Лоренц. Екипът често сам се изненадва от свойствата, които се появяват с мащабирането.
Засега синтетичните обучаващи данни са с по-нисък приоритет. Според Лоренц те само добавят повече точки в области от пространството на последователностите, които вече са известни, и не отварят нови области. Основната цел на Basecamp е да улови неизвестно досега биоразнообразие. При вътрешни тестове моделите, обучени върху синтетични данни, понякога са генерирали работещи протеини, но никога не са постигали реално обобщаване към нови задачи.
Чатботовете се превръщат във входна врата към биологичните модели
Използването на биологични модели вече не трябва да бъде задача само за специалисти. Basecamp е направила избрани функции на EDEN за проектиране на антибиотици и избор на потенциални мишени за ваксини достъпни чрез Claude и Claude Science.
Изследователите могат да опишат задачата си на разбираем език. След това Claude използва EDEN, за да предложи кандидати за допълнително проучване например. При ваксините първият въпрос е кои части от патогена могат да служат като мишени за защитен имунен отговор.
Лоренц казва, че Basecamp няма да пусне моделите публично. Той посочва опасения за сигурността и споразуменията с партньорите, предоставящи данни, и вижда тясна връзка между двете. Много партньори предпочитат модел, чиято търговска употреба им носи дял, пред модел с отворен код, чието използване никой не може да проследи. За разлика от тях Arc Institute пусна своя модел Evo открито и изключи данните за патогени от обучението.
Сред другите мерки Basecamp премахва определени данни за вируси от обучаващия материал и проверява генерираните последователности спрямо бази данни на известни патогени. Тези мерки имат за цел да намалят риска от злоупотреба. Те обаче не доказват, че напълно предотвратяват проблемни резултати.
Кой получава заплащане за данните от природата все още подлежи на дебат
Стратегията за данните зависи и от това дали държавите и местните институции са готови да работят с Basecamp. Компанията не започва вземане на проби без предварително информирано съгласие от собствениците на земята и от местните и националните власти, казва Лоренц.
„Можем да проследим всеки един токен, върху който EDEN е бил предварително обучен, до точното географско местоположение и действителното съгласие, което сме получили“, казва той.
Партньорите не би трябвало да чакат години, докато дадено лекарство евентуално достигне пазара, за да получат полза. Лоренц посочва наемането на местни учени и инвестициите в технологии за секвениране и лаборатории, предназначени да изградят местна „биоикономика“. В статията за BaseData също се описват лицензионни плащания, разпределени според дела на всеки партньор в използваните за обучението данни.
Според тази статия до края на 2024 г. Basecamp е извършила плащания към 52 бенефициенти в 19 държави. В най-бързия случай между вземането на пробата и първото плащане са изминали девет месеца.
Лоренц, който е работил с отворени бази данни по времето, когато е бил в академичните среди, не вижда този модел като алтернатива на публичните данни, а като паралелна система. Съгласието и споделянето на ползите изграждат доверие, казва той, а това дава на партньорите причина да разширят събирането на данни до мащаба, необходим на Basecamp за нейните модели.
Дали този дял е достатъчен, е спорно. Financial Times съобщи през 2025 г., че плащанията възлизат на един процент от приходите. Изследователят Джим Томас е заявил пред изданието, че оценява възможността данните да бъдат проследени, но критикува размера на плащанията. Според него данните повишават и стойността на компанията, а общностите, от които произлизат, не получават справедлив дял от това.
Орелѝ Дингом от Министерството на околната среда на Камерун също е заявила, че по-високите дялове биха били справедливи. Основателите на Basecamp са насочили изданието към договорните гаранции и са заявили, че дългосрочните партньорства са в собствения бизнес интерес на компанията.
Basecamp вече разполага с още 140 милиона долара за следващата стъпка в медицинската си разработка. Досегашните ѝ експерименти показват, че EDEN може да проектира биологично активни кандидати. Предстоящите изследвания ще трябва да покажат дали тези кандидати ще се превърнат в безопасни, ефективни и по-лесни за производство лечения.
AI новини без сензации – подбрани от хора
Абонирайте се за THE DECODER за четене без реклами, седмичен AI бюлетин, нашия ексклузивен шест пъти годишно доклад за новостите „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.