Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Мовна модель мухи (FLM) підключає повну конектому плодової мушки до замороженої LLM на 1,2 млрд параметрів, а власні контрольні експерименти показують, що така схема не допомагає

Мовна модель мухи (FLM) — це загальнодоступний чат-бот, який поєднує повний збережений конектом плодовоï мушки MaleCNS v1.0 із замороженою базовою моделлю LiquidAI LFM2.5-1.2B-Instruct. Розробник , який створив FLM, називає її першою у світі мовною моделлю мухи, побудованою на архітектурі під назвою GPF (Generative Pre-trained Fly — генеративна попередньо навчена модель мухи). У звіті не використовується позначення GPF, прямо заперечується твердження про те, що це перша мовна модель на основі конектому, а також зазначається, що контрольна модель із такою самою кількістю параметрів, але без графа мухи, працює дещо краще.

Можливість розгортання: Так, локально. Репозиторій nftechie/flm ліцензований за MIT і працює на Python 3.12 (macOS або Linux, MPS, CUDA чи CPU) без ключа API.

Що насправді було створено

Система являє собою резервуарний комп’ютер, приєднаний до мовної моделі. У ній беруть участь усі 166 700 збережених вузлів і 25 582 938 напрямлених ребер графа MaleCNS. Граф, базова модель, а також випадкові вхідні й вихідні проєкції є фіксованими. Навчається лише зчитувальний модуль із 278 528 параметрів — це приблизно 0,0238% від 1 170 340 608 параметрів базової моделі.

Для кожного токена фіксована гаусівська проєкція стискає 2048-вимірне токенне представлення до 128 каналів. Кожен вузол резервуара отримує один канал із випадковим знаком. Потім увесь граф оновлюється за формулою x = tanh(W(0.6x + 0.4Bc)), де W містить нормалізовані за вхідними даними підрахунки анатомічних контактів. Стани об’єднуються у 128 бінів, проходять через дві навчені матриці без зміщення (U розміром 128 на 128, V розміром 2 048 на 128), а потім проєктуються через заморожену вихідну матрицю словника як обмежений залишковий компонент, що додається до логітів базової моделі. Залишковий компонент обмежується середньоквадратичним значенням 0,25 за координатами словника.

Результати

На щойно зафіксованому наборі з 32 повсякденних діалогів SmolTalk (1 236 цільових токенів) три початкові значення для навчання дали такі результати:

УмоваNLL (нат/токен)
Заморожена базова модель1.381995
Зчитувальний модуль мухи1.359816 ± 0.000110
Зчитувальний модуль із прямим входом1.359328 ± 0.000108
Перейменовані мітки, без повторного навчання1.381265 ± 0.000802
Без ребер1.381995

Зчитувальний модуль мухи покращив результат базової моделі на 0,0222 ната на токен (перплексивність знизилася з 3,98 до 3,90). Однак контрольна модель із прямим входом, яка подає ту саму 128-канальну токенну проєкцію безпосередньо до ідентичного зчитувального модуля без графа, показала кращий результат у всіх 3 початкових значеннях — на 0,000488 ната на токен. Парний бутстреп-інтервал (+0,00000502 до +0,00104) не підтверджує специфічного виграшу від використання мухи.

Важливими є ще два контрольні тести. Встановлення W у нуль точно усуває залишковий компонент, відтворюючи втрати базової моделі для кожного токена, тож участь графа можна перевірити. Перейменування ідентичностей вузлів без повторного навчання повертає NLL майже до базового рівня, що показує: зчитувальний модуль залежить від вивченого узгодження інтерфейсу, а не від того, що топологія мухи перевершує випадкове з’єднання.

Дослідницький звіт також доводить, що рекурентна система стискає відмінності початкових станів щонайбільше у 0,6 раза за токен. Після 10 токенів ця межа становить 0,00605, а після 20 — 0,0000366. Додавання 166 700 клітин не забезпечує тривалої пам’яті. Контекст і надалі надходить від базової моделі.

Попередні роботи та твердження про «першість»

Дослідницький звіт посилається на ngxson/fly-hf — попередній прототип, який використовував підмножину центрального мозку MaleCNS із 49 393 клітин як резервуар, навчений на TinyStories без попередньо навченої базової моделі, — і прямо зазначає, що не претендує на статус першої мовної моделі на основі конектому. Відмінність FLM полягає у масштабі (повний збережений граф) і дизайні із замороженою базовою моделлю, завдяки якому джерело мовної компетентності залишається ідентифікованим.

Інтерактивне пояснення

Основні висновки

  • Повний конектом мухи зі 166 700 вузлами керує замороженою LFM2.5-1.2B; навчаються лише 278 528 параметрів.
  • Зчитувальний модуль мухи зменшує NLL на 0,0222 ната на токен, але контрольна модель без графа перевершує його в кожному початковому значенні.
  • Від’єднання точно обнуляє залишковий компонент, а перейменування вузлів порушує його роботу. Граф бере участь, але не забезпечує кращого результату.
  • Стан забувається зі швидкістю 0,6 за токен, тому конектом не додає довготривалої пам’яті.
  • Код із ліцензією MIT працює локально на Python 3.12; артефакти дослідження залишаються приватними, тому результати поки що неможливо незалежно відтворити.

Ознайомтеся з науковою статтею, репозиторієм на GitHub і демонстрацією в реальному часі. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини