Языковая модель мухи (FLM) встраивает полный коннектом плодовой мушки в замороженную LLM на 1,2 млрд параметров, а собственные контрольные эксперименты показывают, что такая схема не помогает
Модель языка мухи (FLM) — это общедоступный чат-бот, который объединяет полный сохранённый коннектом плодовой мушки MaleCNS v1.0 с замороженной базовой моделью LiquidAI LFM2.5-1.2B-Instruct. Разработчик , создавший FLM, называет её первой в мире моделью языка мухи, построенной на архитектуре под названием GPF (Generative Pre-trained Fly — генеративная предварительно обученная муха). В отчёте не используется обозначение GPF, прямо отрицается утверждение о том, что это первая языковая модель на основе коннектома, а также сообщается, что контрольная модель с сопоставимым числом параметров, но без графа мухи, показывает немного лучший результат.
Возможность развертывания: Да, локально. Репозиторий nftechie/flm распространяется по лицензии MIT и работает на Python 3.12 (macOS или Linux, MPS, CUDA или CPU) без ключа API.
Что было фактически создано
Система представляет собой вычислитель резервуара, подключённый к языковой модели. В ней участвуют все 166 700 сохранённых узлов и 25 582 938 направленных рёбер графа MaleCNS. Граф, базовая модель, а также случайные входные и выходные проекции зафиксированы. Обучается только считывающий слой с 278 528 параметрами — около 0,0238% от 1 170 340 608 параметров базовой модели.
На каждом токене фиксированная гауссовская проекция сжимает 2 048-мерное токенное представление до 128 каналов. Каждый узел резервуара получает один канал со случайным знаком. Затем весь граф обновляется по формуле x = tanh(W(0.6x + 0.4Bc)), где W содержит нормализованные по входящим связям значения анатомических контактов. Состояния объединяются в 128 блоков, проходят через две обучаемые матрицы без смещений (U размером 128 на 128 и V размером 2 048 на 128), а затем проецируются через зафиксированную выходную матрицу словаря как ограниченная поправка, добавляемая к логитам базовой модели. Среднеквадратичная величина поправки по координатам словаря ограничена значением 0,25.
Результаты
На недавно зафиксированном наборе из 32 диалогов повседневного общения SmolTalk (1 236 целевых токенов) три запуска обучения с разными начальными значениями дали следующие результаты:
| Условие | NLL (натов/токен) |
|---|---|
| Замороженная базовая модель | 1.381995 |
| Считывающий слой мухи | 1.359816 ± 0.000110 |
| Считывающий слой с прямым входом | 1.359328 ± 0.000108 |
| Перемаркированный, без переобучения | 1.381265 ± 0.000802 |
| Без рёбер | 1.381995 |
Считывающий слой мухи улучшил результат базовой модели на 0,0222 натов на токен (перплексия снизилась с 3,98 до 3,90). Однако контрольная модель с прямым входом, которая подаёт ту же 128-канальную токенную проекцию непосредственно на идентичный считывающий слой без графа, показала лучший результат во всех 3 запусках — на 0,000488 натов на токен. Парный бутстрэп-интервал (+0,00000502 до +0,00104) не подтверждает прирост, специфичный для модели мухи.
Важны ещё два контрольных эксперимента. Установка W в ноль полностью устраняет поправку, воспроизводя потери базовой модели для каждого токена, поэтому участие графа подтверждается. Перемаркировка идентификаторов узлов без переобучения возвращает NLL почти к исходному уровню, что показывает зависимость считывающего слоя от выученного соответствия интерфейсов, а не превосходство топологии мухи над случайным соединением.
Исследовательский отчёт также доказывает, что рекуррентная система сокращает различия начальных состояний не более чем в 0,6 раза за токен. Через 10 токенов эта граница составляет 0,00605, а через 20 — 0,0000366. Подключение 166 700 клеток не обеспечивает долговременную память. Контекст по-прежнему поступает от базовой модели.
Предыдущие работы и утверждение о «первенстве»
Исследовательский отчёт ссылается на ngxson/fly-hf — более ранний прототип, в котором в качестве резервуара использовалась подмножество из 49 393 клеток центрального мозга MaleCNS, обучавшаяся на TinyStories без предварительно обученной базовой модели; в отчёте прямо говорится, что авторы не претендуют на создание первой языковой модели на основе коннектома. Отличие FLM заключается в масштабе (используется полный сохранённый граф) и архитектуре с замороженной базовой моделью, благодаря чему источник языковой компетенции остаётся идентифицируемым.
Интерактивное объяснение
Основные выводы
- Полный коннектом мухи из 166 700 узлов управляет замороженной моделью LFM2.5-1.2B; обучаются только 278 528 параметров.
- Считывающий слой мухи снижает NLL на 0,0222 натов на токен, однако контрольная модель без графа превосходит его в каждом запуске.
- Отключение связей полностью обнуляет поправку, а перемаркировка нарушает её работу. Граф участвует в процессе, но не обеспечивает лучшего результата.
- Состояние забывается со скоростью 0,6 за токен, поэтому коннектом не добавляет долговременной памяти.
- Код под лицензией MIT запускается локально на Python 3.12; артефакты исследования остаются закрытыми, поэтому результаты пока нельзя независимо воспроизвести.
Ознакомьтесь с исследовательской статьёй, репозиторием GitHub и демонстрацией в реальном времени. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.