Запознайте се с FreeToken: edge-нативен енджин за обслужване на MoE, който стартира 753 млрд. GLM-5.2 на един GPU за работна станция
Граничните модели с отворени тегла се доставят по-бързо, отколкото се променят хардуерните предположения около тях. Kimi-K3, GLM-5.2 и DeepSeek-V4-Flash намаляват разликата в способностите спрямо собственически системи, но публикуването на параметрите определя само кой може да получи даден модел — не кой може да си позволи да го използва. Обслужването им все още предполага GPU клъстери от клас център за данни, а с нарастването на търсенето на инференция за агентни натоварванията тези разходи се стоварват най-силно върху отделните разработчици и малките екипи. Междувременно повече от сто милиона потребителски машини вече разполагат с дискретни GPU. Екип изследователи от UC Berkeley и UT Austin предлага FreeToken. Изследователският екип твърди, че липсващият елемент не е хардуерът, а системата за обслужване: тя третира персоналния компютър като единна, еластична платформа за инференция, а не като малък GPU, и постоянно разпределя изчисленията и състоянието на модела върху наличните GPU, CPU, памет и честотна лента на междусистемната връзка. Резултатът е 35B модел с интерактивна скорост на лаптоп GPU с 8 GB, 284B на геймърски настолен компютър и 753B GLM-5.2 на една работна станция.
Може ли да бъде внедрен?
Да, FreeToken е Apache-2.0 в GitHub, публикуван е в PyPI като freetoken v0.1.2 (uv pip install "freetoken[accel]") и се предлага като настолно приложение с инсталация с едно кликване за Windows и Linux на flashml.ai. CLI интерфейсът е предназначен за Linux x86_64 с NVIDIA GPU и драйвер r580+ (CUDA 13). ft serve предоставя съвместими с OpenAI и Anthropic крайни точки на порт 1919, а ft launch claude свързва Claude Code, Codex, OpenCode или OpenClaw с вашата собствена машина.
За кого е подходящ: самостоятелни разработчици, стартъпи и малки и средни инженерни екипи, чиито сметки за токени на агентите вече надхвърлят цената на собствен GPU; предприятията трябва да го разглеждат като път за изолирани или регулирани натоварвания, а не като заместител на център за данни. Най-силно индустриално приложение: здравеопазване и право (данните никога не напускат машината), отбрана, финанси и научноизследователска и развойна дейност с интензивно използване на интелектуална собственост. Типични приложения: локални кодиращи агенти, частичен преглед на код, офлайн анализ на договори, генериране на синтетични данни, пакетни оценки.
Проблемът, към който е насочен
Смесването на експерти прави локалната инференция на гранични модели аритметично осъществима. DeepSeek-V4-Flash активира 6 от 256 маршрутизирани експерти във всеки от 43-те слоя, така че само 13B от неговите 284B параметри участват във всеки отделен токен. Разредеността обаче не намалява набора от експерти — при FP4 пълният набор е приблизително 140 GB, така че неактивните експерти стоят в хост паметта и се включват в пътя на изпълнение при нужда.
Изследователският екип изолира три режима на отказ в съществуващите енджини (llama.cpp, KTransformers, Ollama, MoE-Infinity):
- Предварителното попълване унищожава разредеността: Хиляди токени на слой се насочват към почти целия набор от експерти, така че един проход на предварително попълване прехвърля целия набор през PCIe — около две секунди на RTX 5090, пет на настолни компютри с PCIe 4.0 и десет или повече при връзките x8, характерни за лаптопите.
- Статичното разполагане пропуска трафика при декодиране: llama.cpp задава местоположението на MoE тензорите при зареждане; KTransformers фиксира „горещо“ подмножество. Маршрутизирането се променя при всеки токен, така че повечето оценки на експерти се извършват от CPU, докато GPU и PCIe връзката бездействат.
- Потребителските CPU не могат да поемат остатъка: Двуканалната DDR5 осигурява 80–90 GB/s спрямо 1–1,8 TB/s, които RTX 4090 или 5090 извлича от вградената памет.
Три механизма
- Изпълнение, адаптивно към честотната лента (политиката q*): Тъй като DMA трансферите и изпълнението на експертите от CPU четат от една и съща подсистема на хост паметта, наситената PCIe връзка оставя остатъчна честотна лента от
B_H − B_P. FreeToken разделя пропуските на кеша m за всяка стъпка по съответния начин:q* ≈ m × B_P / B_Hексперти се зареждат в GPU кеша, останалите се изчисляват на място от CPU, а двете частични суми се обединяват точно — без приближения и без промяна на маршрутизатора. И двете честотни ленти се профилират на внедрената машина (ft bench bw), което е важно: измереното съотношение B_P:B_H е 52.7:77.3 на сървър с RTX 5090, но 11.8:47.5 на лаптоп с 4060. - Кеширане с отчитане на семантиката: По време на предварителното попълване двойното буфериране на целия слой прехвърля слой l+1, докато GPU изчислява слой l. Контролните точки на рекурентното състояние са закрепени към границите на специални токени — блокове за мислене, извиквания на инструменти, резултати от инструменти — точно там, където агентните среди съкращават контекста, така че при редакция се извършва предварително попълване само на новия суфикс. По време на декодиране споделен LRU кеш на експерти, обхващащ всички MoE слоеве, следва маршрутизатора вместо разположение, замразено при зареждане.
- Еластично управление на паметта: В безопасни точки на планировчика кешът на GPU експертите се изгражда наново при преразгледан бюджет на VRAM, без рестартиране на енджина или повторно зареждане на хост пула. Експертите се четат от диска директно в крайното си разположение в хоста, след което се фиксират; не е необходимо загряване на GPU, тъй като първата заявка се обслужва със студен кеш.
Резултати
На RTX 5090 FreeToken поддържа 77–83 токена/сек. на Qwen3.6-35B-A3B (BF16) и 22–25 токена/сек. на DeepSeek-V4-Flash (MXFP4) — 1,5–2,3 пъти повече от най-силния базов резултат, като скоростта при декодиране остава в рамките на 12% от едноходовата скорост при три агентни натоварвания. Най-лошият TTFT остава под 44 s във всяка клетка; llama.cpp достига 232 s, Ollama — 179 s, а KTransformers — 946 s на някое място в матрицата, отвъд момента, в който клиентите на агентите прекратяват изчакването.
При еднакъв капацитет на кеша (37% от пула на Qwen3.6) глобалният LRU пропуска 16% от четенията на експерти по време на декодиране спрямо 41% за KTransformers и 62% за llama.cpp. На лаптоп с RTX 4060 и 8 GB версията NVFP4 обслужва 35B при 39,3 токена/сек. — над медианната скорост на декодиране от 33 токена/сек., измерена за Codex в производствени трасета. На един RTX PRO 6000 GLM-5.2 (753B, 40B активни) работи при 14,9 токена/сек. спрямо 7,3 за llama.cpp.
Проверка на данните
| Твърдение | Тяхното число | Независима проверка | Присъда и източник |
|---|---|---|---|
| Декодиране, Qwen3.6-35B-A3B BF16, RTX 5090 | 77–83 токена/сек. | Не е намерена | САМОРЕПОРТИРАНОФигура 3 в статията |
| Декодиране, DeepSeek-V4-Flash MXFP4, RTX 5090 | 22–25 токена/сек. | Не е намерена | САМОРЕПОРТИРАНОФигура 3 в статията |
| Ускорение на декодирането спрямо най-силния базов резултат | 1,5–2,3× | Изчислява се точно от Фигура 3 | САМОРЕПОРТИРАНО§5.2 в статията |
| Стабилност на декодирането при агентни натоварвания | в рамките на 12% от W1 | Не е намерена | САМОРЕПОРТИРАНО§5.2 в статията |
| Най-лош TTFT спрямо базовите системи | <44 s спрямо 232 / 179 / 946 s | Не е намерена | САМОРЕПОРТИРАНО§5.2 в статията |
| Лаптопът с 4060 „надхвърля медианата на Codex от 33 токена/сек.“ | 39,3 спрямо 33 | 33,9 на TraceLab е нормализиран; чистата медиана на декодиране на Codex е 57,1, а претеглената средна — 61,0 | ПОДВЕЖДАЩОarXiv:2606.30560 |
| Лаптопът е „92% от скоростта на RTX 4090“ | 39,3 / 42,9 | Аритметиката е вярна, но 39,3 е NVFP4, а 42,9 е BF16 | ПОДВЕЖДАЩОФигура 5 в статията |
| GLM-5.2 753B на един RTX PRO 6000 | 14,9 спрямо 7,3 за llama.cpp | Не е намерена | САМОРЕПОРТИРАНО§5.3 в статията |
| Преднина при различен хардуер, пет потребителски системи | 1,3–2,1× | Изчислява се точно от Фигура 5 | САМОРЕПОРТИРАНОФигура 5 в статията |
| Процент пропуски на експерти при декодиране при равен капацитет | 16% / 39% | Не е намерено; трасето е възпроизвеждане, а не обслужване в реално време | САМОРЕПОРТИРАНОФигура 4b в статията |
| Предварително попълване на блок от 8 192 токена; наказание от припокриването | 1,19–1,22 s; 19/25/26% | Не е намерено | САМОРЕПОРТИРАНОФигура 4a в статията |
| Формулировката „753B на един работен GPU“ | 1 GPU | Вярно за VRAM; хостът използва 512 GiB и 192 GB DRAM | ПОДВЕЖДАЩОТаблица 1 в статията |
| Базовите системи работят с 6 нишки на CPU на наети сървъри | 6 нишки | Основният принос на KTransformers са AMX ядрaта за многоядрени CPU | ПОДВЕЖДАЩО§5.1 в статията |
| „Поддържа повече от 20 MoE модела“ | 20+ | Публичният models.md изброява около 17 проверени MoE контролни точки | САМОРЕПОРТИРАНОдокументация на хранилището |
| Лиценз и разпространение | Apache-2.0, PyPI v0.1.2 | Файлът LICENSE и JSON API на PyPI потвърждават и двете | ПРОВЕРЕНОGitHub, PyPI |
| База от инсталирани дискретни GPU за потребители (според Steam) | ~72% NVIDIA; 4060 Laptop 3,81% | Съвпада с проучването на Valve от юни 2026 г. според множество издания | ПРОВЕРЕНОValve, юли 2026 г. |
| Вътрешна аритметика в резюмето и §5 | всички съотношения | Всяко публикувано съотношение се преизчислява от Фигури 3 и 5; нула грешки | ПРОВЕРЕНОпреизчислено |
- Статията е аритметично коректна — всяко публикувано съотношение се преизчислява от собствените ѝ фигури.
- Все още няма независимо възпроизвеждане; 9 от 16 твърдения по необходимост са саморепортирани, а не укрити.
- Най-същественият сигнал: 39,3 токена/сек. надхвърля нормализираните 33,9 на Codex, но не и чистата му медиана на декодиране от 57,1.
- Заглавията за „един GPU“ тихомълком изискват 192–512 GB хост DRAM.
- Базовата конфигурация на KTransformers работи с 6 нишки на CPU, под многоядрената AMX конфигурация, за която е предназначен.
Основни изводи
- FreeToken разделя пропуските в MoE кеша между зареждане през PCIe и изпълнение на CPU, използвайки измерени честотни ленти, а не фиксирано правило за разтоварване.
- Изходът на експертите остава битово идентичен — без промени в маршрутизатора, без заместване на експерти и без намаляване на точността.
- 1,5–2,3× по-висока пропускателна способност при декодиране спрямо llama.cpp, Ollama и KTransformers, с крайно TTFT под 44 s.
- 35B при 39,3 токена/сек. на лаптоп GPU с 8 GB; 753B GLM-5.2 на един GPU за работна станция.
- Apache-2.0, в PyPI и като настолно приложение за Windows/Linux — може да бъде внедрен още този следобед.
Разгледайте СТАТИЯТА, GITHUB ХРАНИЛИЩЕТО и ПРОЕКТА. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.