Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Езиковият модел на плодовата мушица (FLM) окабелява пълния конектом на плодовата мушица във фиксиран 1,2-милиарден LLM, а собствените му контролни експерименти показват, че окабеляването не помага

Езиковият модел за мухи (FLM) е публичен чатбот, който съчетава пълния запазен конектом на плодовата мушица MaleCNS v1.0 с фиксиран LiquidAI LFM2.5-1.2B-Instruct гръбнак. Разработчикът , създал FLM, го нарича първия в света езиков модел за мухи, изграден върху архитектура, наречена GPF (Generative Pre-trained Fly). Той не използва обозначението GPF, изрично отрича да е първият езиков модел, базиран на конектом, и съобщава, че контролен модел със същия брой параметри, но без графа на мухата, се представя малко по-добре.

Може да се внедри: Да, локално. Хранилището nftechie/flm е лицензирано под MIT и работи с Python 3.12 (macOS или Linux, MPS, CUDA или CPU), без API ключ.

Какво всъщност е изградено

Системата представлява резервоарен компютър, свързан към езиков модел. Участват всичките 166 700 запазени възела и 25 582 938 насочени ребра на графа MaleCNS. Графът, гръбнакът и случайните входни и изходни проекции са фиксирани. Обучава се само изходен слой с 278 528 параметъра, което е около 0,0238% от 1 170 340 608 параметъра на гръбнака.

При всеки токен фиксирана гаусова проекция компресира 2 048-мерното токеново вграждане до 128 канала. Всеки възел на резервоара получава един канал със случаен знак. След това целият граф се актуализира чрез x = tanh(W(0.6x + 0.4Bc)), където W съдържа нормализирани спрямо входа анатомични броеве на контактите. Състоянията се обединяват в 128 групи, прекарват се през две обучени матрици без отместване (U с размери 128 на 128, V с размери 2 048 на 128) и се проектират през фиксираната глава на речника като ограничен остатък, добавен към логитите на гръбнака. Остатъкът е ограничен до RMS от 0,25 по координатите на речника.

Резултатите

При новозамразен набор от 32 диалога от ежедневни разговори в SmolTalk (1 236 целеви токена) три семена за напасване дадоха следните резултати:

УсловиеNLL (нат/токен)
Фиксиран гръбнак1.381995
Изходен слой на мухата1.359816 ± 0.000110
Изходен слой с директен вход1.359328 ± 0.000108
Преномериран, без повторно напасване1.381265 ± 0.000802
Без ребра1.381995

Изходният слой на мухата подобри резултата на гръбнака с 0,0222 ната на токен (перплексия от 3,98 до 3,90). Но контролният модел с директен вход, който подава същата 128-канална токенова проекция директно към идентичен изходен слой без граф, се представи по-добре и при трите семена с 0,000488 ната на токен. Интервалът от сдвоения бутстреп (+0,00000502 до +0,00104) не потвърждава специфично предимство на мухата.

Важни са и още два контрола. Задаването на W на нула премахва остатъка напълно, възпроизвеждайки загубите на гръбнака за всеки токен, така че участието на графа може да бъде проверено. Преномерирането на идентичностите на възлите без повторно обучение връща NLL близо до базовото ниво, което показва, че изходният слой зависи от наученото съответствие на интерфейса, а не че топологията на мухата превъзхожда случайно свързване.

Изследователският доклад също доказва, че рекурентността свива разликите в началните състояния най-много с 0,6 на токен. След 10 токена тази граница е 0,00605, а след 20 е 0,0000366. Добавянето на 166 700 клетки не осигурява дълга памет. Контекстът все още идва от гръбнака.

Предишна работа и твърдението за „първи“

Изследователският доклад цитира ngxson/fly-hf, по-ранен прототип, който използва подмножество от 49 393 клетки на централния мозък от MaleCNS като резервоар, обучаван върху TinyStories без предварително обучен гръбнак, и ясно посочва, че не претендира да е първият езиков модел, базиран на конектом. Отличителните черти на FLM са мащабът (пълният запазен граф) и дизайнът с фиксиран гръбнак, който позволява източникът на езиковата компетентност да бъде идентифициран.

Интерактивно обяснение

Основни изводи

  • Пълният конектом на мухата с 166 700 възела управлява фиксиран LFM2.5-1.2B; обучават се само 278 528 параметъра.
  • Изходният слой на мухата намалява NLL с 0,0222 ната на токен, но контролният модел без граф го превъзхожда при всяко семе.
  • Прекъсването на връзките премахва остатъка напълно; преномерирането го нарушава. Графът участва, но не печели.
  • Състоянието се забравя с 0,6 на токен, така че конектомът не добавя дългосрочна памет.
  • MIT кодът работи локално с Python 3.12; артефактите от изследването остават частни, така че резултатите все още не могат да бъдат независимо възпроизведени.

Разгледайте научната статия, хранилището в GitHub и демото на живо. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини