Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Языковая модель мухи (FLM) встраивает полный коннектом плодовой мушки в замороженную LLM на 1,2 млрд параметров, а собственные контрольные эксперименты показывают, что такая схема не помогает

Модель языка мухи (FLM) — это общедоступный чат-бот, который объединяет полный сохранённый коннектом плодовой мушки MaleCNS v1.0 с замороженной базовой моделью LiquidAI LFM2.5-1.2B-Instruct. Разработчик , создавший FLM, называет её первой в мире моделью языка мухи, построенной на архитектуре под названием GPF (Generative Pre-trained Fly — генеративная предварительно обученная муха). В отчёте не используется обозначение GPF, прямо отрицается утверждение о том, что это первая языковая модель на основе коннектома, а также сообщается, что контрольная модель с сопоставимым числом параметров, но без графа мухи, показывает немного лучший результат.

Возможность развертывания: Да, локально. Репозиторий nftechie/flm распространяется по лицензии MIT и работает на Python 3.12 (macOS или Linux, MPS, CUDA или CPU) без ключа API.

Что было фактически создано

Система представляет собой вычислитель резервуара, подключённый к языковой модели. В ней участвуют все 166 700 сохранённых узлов и 25 582 938 направленных рёбер графа MaleCNS. Граф, базовая модель, а также случайные входные и выходные проекции зафиксированы. Обучается только считывающий слой с 278 528 параметрами — около 0,0238% от 1 170 340 608 параметров базовой модели.

На каждом токене фиксированная гауссовская проекция сжимает 2 048-мерное токенное представление до 128 каналов. Каждый узел резервуара получает один канал со случайным знаком. Затем весь граф обновляется по формуле x = tanh(W(0.6x + 0.4Bc)), где W содержит нормализованные по входящим связям значения анатомических контактов. Состояния объединяются в 128 блоков, проходят через две обучаемые матрицы без смещений (U размером 128 на 128 и V размером 2 048 на 128), а затем проецируются через зафиксированную выходную матрицу словаря как ограниченная поправка, добавляемая к логитам базовой модели. Среднеквадратичная величина поправки по координатам словаря ограничена значением 0,25.

Результаты

На недавно зафиксированном наборе из 32 диалогов повседневного общения SmolTalk (1 236 целевых токенов) три запуска обучения с разными начальными значениями дали следующие результаты:

УсловиеNLL (натов/токен)
Замороженная базовая модель1.381995
Считывающий слой мухи1.359816 ± 0.000110
Считывающий слой с прямым входом1.359328 ± 0.000108
Перемаркированный, без переобучения1.381265 ± 0.000802
Без рёбер1.381995

Считывающий слой мухи улучшил результат базовой модели на 0,0222 натов на токен (перплексия снизилась с 3,98 до 3,90). Однако контрольная модель с прямым входом, которая подаёт ту же 128-канальную токенную проекцию непосредственно на идентичный считывающий слой без графа, показала лучший результат во всех 3 запусках — на 0,000488 натов на токен. Парный бутстрэп-интервал (+0,00000502 до +0,00104) не подтверждает прирост, специфичный для модели мухи.

Важны ещё два контрольных эксперимента. Установка W в ноль полностью устраняет поправку, воспроизводя потери базовой модели для каждого токена, поэтому участие графа подтверждается. Перемаркировка идентификаторов узлов без переобучения возвращает NLL почти к исходному уровню, что показывает зависимость считывающего слоя от выученного соответствия интерфейсов, а не превосходство топологии мухи над случайным соединением.

Исследовательский отчёт также доказывает, что рекуррентная система сокращает различия начальных состояний не более чем в 0,6 раза за токен. Через 10 токенов эта граница составляет 0,00605, а через 20 — 0,0000366. Подключение 166 700 клеток не обеспечивает долговременную память. Контекст по-прежнему поступает от базовой модели.

Предыдущие работы и утверждение о «первенстве»

Исследовательский отчёт ссылается на ngxson/fly-hf — более ранний прототип, в котором в качестве резервуара использовалась подмножество из 49 393 клеток центрального мозга MaleCNS, обучавшаяся на TinyStories без предварительно обученной базовой модели; в отчёте прямо говорится, что авторы не претендуют на создание первой языковой модели на основе коннектома. Отличие FLM заключается в масштабе (используется полный сохранённый граф) и архитектуре с замороженной базовой моделью, благодаря чему источник языковой компетенции остаётся идентифицируемым.

Интерактивное объяснение

Основные выводы

  • Полный коннектом мухи из 166 700 узлов управляет замороженной моделью LFM2.5-1.2B; обучаются только 278 528 параметров.
  • Считывающий слой мухи снижает NLL на 0,0222 натов на токен, однако контрольная модель без графа превосходит его в каждом запуске.
  • Отключение связей полностью обнуляет поправку, а перемаркировка нарушает её работу. Граф участвует в процессе, но не обеспечивает лучшего результата.
  • Состояние забывается со скоростью 0,6 за токен, поэтому коннектом не добавляет долговременной памяти.
  • Код под лицензией MIT запускается локально на Python 3.12; артефакты исследования остаются закрытыми, поэтому результаты пока нельзя независимо воспроизвести.

Ознакомьтесь с исследовательской статьёй, репозиторием GitHub и демонстрацией в реальном времени. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости