Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← Към новините

Запознайте се с FreeToken: edge-нативен енджин за обслужване на MoE, който стартира 753 млрд. GLM-5.2 на един GPU за работна станция

Граничните модели с отворени тегла се доставят по-бързо, отколкото се променят хардуерните предположения около тях. Kimi-K3, GLM-5.2 и DeepSeek-V4-Flash намаляват разликата в способностите спрямо собственически системи, но публикуването на параметрите определя само кой може да получи даден модел — не кой може да си позволи да го използва. Обслужването им все още предполага GPU клъстери от клас център за данни, а с нарастването на търсенето на инференция за агентни натоварванията тези разходи се стоварват най-силно върху отделните разработчици и малките екипи. Междувременно повече от сто милиона потребителски машини вече разполагат с дискретни GPU. Екип изследователи от UC Berkeley и UT Austin предлага FreeToken. Изследователският екип твърди, че липсващият елемент не е хардуерът, а системата за обслужване: тя третира персоналния компютър като единна, еластична платформа за инференция, а не като малък GPU, и постоянно разпределя изчисленията и състоянието на модела върху наличните GPU, CPU, памет и честотна лента на междусистемната връзка. Резултатът е 35B модел с интерактивна скорост на лаптоп GPU с 8 GB, 284B на геймърски настолен компютър и 753B GLM-5.2 на една работна станция.

Може ли да бъде внедрен?

Да, FreeToken е Apache-2.0 в GitHub, публикуван е в PyPI като freetoken v0.1.2 (uv pip install "freetoken[accel]") и се предлага като настолно приложение с инсталация с едно кликване за Windows и Linux на flashml.ai. CLI интерфейсът е предназначен за Linux x86_64 с NVIDIA GPU и драйвер r580+ (CUDA 13). ft serve предоставя съвместими с OpenAI и Anthropic крайни точки на порт 1919, а ft launch claude свързва Claude Code, Codex, OpenCode или OpenClaw с вашата собствена машина.

За кого е подходящ: самостоятелни разработчици, стартъпи и малки и средни инженерни екипи, чиито сметки за токени на агентите вече надхвърлят цената на собствен GPU; предприятията трябва да го разглеждат като път за изолирани или регулирани натоварвания, а не като заместител на център за данни. Най-силно индустриално приложение: здравеопазване и право (данните никога не напускат машината), отбрана, финанси и научноизследователска и развойна дейност с интензивно използване на интелектуална собственост. Типични приложения: локални кодиращи агенти, частичен преглед на код, офлайн анализ на договори, генериране на синтетични данни, пакетни оценки.

Проблемът, към който е насочен

Смесването на експерти прави локалната инференция на гранични модели аритметично осъществима. DeepSeek-V4-Flash активира 6 от 256 маршрутизирани експерти във всеки от 43-те слоя, така че само 13B от неговите 284B параметри участват във всеки отделен токен. Разредеността обаче не намалява набора от експерти — при FP4 пълният набор е приблизително 140 GB, така че неактивните експерти стоят в хост паметта и се включват в пътя на изпълнение при нужда.

Изследователският екип изолира три режима на отказ в съществуващите енджини (llama.cpp, KTransformers, Ollama, MoE-Infinity):

  • Предварителното попълване унищожава разредеността: Хиляди токени на слой се насочват към почти целия набор от експерти, така че един проход на предварително попълване прехвърля целия набор през PCIe — около две секунди на RTX 5090, пет на настолни компютри с PCIe 4.0 и десет или повече при връзките x8, характерни за лаптопите.
  • Статичното разполагане пропуска трафика при декодиране: llama.cpp задава местоположението на MoE тензорите при зареждане; KTransformers фиксира „горещо“ подмножество. Маршрутизирането се променя при всеки токен, така че повечето оценки на експерти се извършват от CPU, докато GPU и PCIe връзката бездействат.
  • Потребителските CPU не могат да поемат остатъка: Двуканалната DDR5 осигурява 80–90 GB/s спрямо 1–1,8 TB/s, които RTX 4090 или 5090 извлича от вградената памет.

Три механизма

  • Изпълнение, адаптивно към честотната лента (политиката q*): Тъй като DMA трансферите и изпълнението на експертите от CPU четат от една и съща подсистема на хост паметта, наситената PCIe връзка оставя остатъчна честотна лента от B_H − B_P. FreeToken разделя пропуските на кеша m за всяка стъпка по съответния начин: q* ≈ m × B_P / B_H експерти се зареждат в GPU кеша, останалите се изчисляват на място от CPU, а двете частични суми се обединяват точно — без приближения и без промяна на маршрутизатора. И двете честотни ленти се профилират на внедрената машина (ft bench bw), което е важно: измереното съотношение B_P:B_H е 52.7:77.3 на сървър с RTX 5090, но 11.8:47.5 на лаптоп с 4060.
  • Кеширане с отчитане на семантиката: По време на предварителното попълване двойното буфериране на целия слой прехвърля слой l+1, докато GPU изчислява слой l. Контролните точки на рекурентното състояние са закрепени към границите на специални токени — блокове за мислене, извиквания на инструменти, резултати от инструменти — точно там, където агентните среди съкращават контекста, така че при редакция се извършва предварително попълване само на новия суфикс. По време на декодиране споделен LRU кеш на експерти, обхващащ всички MoE слоеве, следва маршрутизатора вместо разположение, замразено при зареждане.
  • Еластично управление на паметта: В безопасни точки на планировчика кешът на GPU експертите се изгражда наново при преразгледан бюджет на VRAM, без рестартиране на енджина или повторно зареждане на хост пула. Експертите се четат от диска директно в крайното си разположение в хоста, след което се фиксират; не е необходимо загряване на GPU, тъй като първата заявка се обслужва със студен кеш.

Резултати

На RTX 5090 FreeToken поддържа 77–83 токена/сек. на Qwen3.6-35B-A3B (BF16) и 22–25 токена/сек. на DeepSeek-V4-Flash (MXFP4) — 1,5–2,3 пъти повече от най-силния базов резултат, като скоростта при декодиране остава в рамките на 12% от едноходовата скорост при три агентни натоварвания. Най-лошият TTFT остава под 44 s във всяка клетка; llama.cpp достига 232 s, Ollama — 179 s, а KTransformers — 946 s на някое място в матрицата, отвъд момента, в който клиентите на агентите прекратяват изчакването.

При еднакъв капацитет на кеша (37% от пула на Qwen3.6) глобалният LRU пропуска 16% от четенията на експерти по време на декодиране спрямо 41% за KTransformers и 62% за llama.cpp. На лаптоп с RTX 4060 и 8 GB версията NVFP4 обслужва 35B при 39,3 токена/сек. — над медианната скорост на декодиране от 33 токена/сек., измерена за Codex в производствени трасета. На един RTX PRO 6000 GLM-5.2 (753B, 40B активни) работи при 14,9 токена/сек. спрямо 7,3 за llama.cpp.

Проверка на данните

Проверка на реалността · FlashML FreeToken ИНФЛАЦИОНЕН РЕЗУЛТАТ 59/100
Към 23 август 2026 г. · режим по подразбиране · одитирано: arXiv:2608.16157, GitHub хранилище, flashml.ai
3Проверени
9Саморепортирани
4Подвеждащи
0Опровергани
0Ненамерени
Формула на резултата: 8 × подвеждащи + 15 × опровергани + 3 × саморепортирани, с таван 100. Резултатът се определя от колоната със саморепортирани твърдения, а не от нечестност — кодът е публикуван шест дни преди този одит, така че все още няма независимо възпроизвеждане.
Таблица с твърдения · 16 твърдения
ТвърдениеТяхното числоНезависима проверкаПрисъда и източник
Декодиране, Qwen3.6-35B-A3B BF16, RTX 509077–83 токена/сек.Не е намеренаСАМОРЕПОРТИРАНОФигура 3 в статията
Декодиране, DeepSeek-V4-Flash MXFP4, RTX 509022–25 токена/сек.Не е намеренаСАМОРЕПОРТИРАНОФигура 3 в статията
Ускорение на декодирането спрямо най-силния базов резултат1,5–2,3×Изчислява се точно от Фигура 3САМОРЕПОРТИРАНО§5.2 в статията
Стабилност на декодирането при агентни натоварванияв рамките на 12% от W1Не е намеренаСАМОРЕПОРТИРАНО§5.2 в статията
Най-лош TTFT спрямо базовите системи<44 s спрямо 232 / 179 / 946 sНе е намеренаСАМОРЕПОРТИРАНО§5.2 в статията
Лаптопът с 4060 „надхвърля медианата на Codex от 33 токена/сек.“39,3 спрямо 3333,9 на TraceLab е нормализиран; чистата медиана на декодиране на Codex е 57,1, а претеглената средна — 61,0ПОДВЕЖДАЩОarXiv:2606.30560
Лаптопът е „92% от скоростта на RTX 4090“39,3 / 42,9Аритметиката е вярна, но 39,3 е NVFP4, а 42,9 е BF16ПОДВЕЖДАЩОФигура 5 в статията
GLM-5.2 753B на един RTX PRO 600014,9 спрямо 7,3 за llama.cppНе е намеренаСАМОРЕПОРТИРАНО§5.3 в статията
Преднина при различен хардуер, пет потребителски системи1,3–2,1×Изчислява се точно от Фигура 5САМОРЕПОРТИРАНОФигура 5 в статията
Процент пропуски на експерти при декодиране при равен капацитет16% / 39%Не е намерено; трасето е възпроизвеждане, а не обслужване в реално времеСАМОРЕПОРТИРАНОФигура 4b в статията
Предварително попълване на блок от 8 192 токена; наказание от припокриването1,19–1,22 s; 19/25/26%Не е намереноСАМОРЕПОРТИРАНОФигура 4a в статията
Формулировката „753B на един работен GPU“1 GPUВярно за VRAM; хостът използва 512 GiB и 192 GB DRAMПОДВЕЖДАЩОТаблица 1 в статията
Базовите системи работят с 6 нишки на CPU на наети сървъри6 нишкиОсновният принос на KTransformers са AMX ядрaта за многоядрени CPUПОДВЕЖДАЩО§5.1 в статията
„Поддържа повече от 20 MoE модела“20+Публичният models.md изброява около 17 проверени MoE контролни точкиСАМОРЕПОРТИРАНОдокументация на хранилището
Лиценз и разпространениеApache-2.0, PyPI v0.1.2Файлът LICENSE и JSON API на PyPI потвърждават и дветеПРОВЕРЕНОGitHub, PyPI
База от инсталирани дискретни GPU за потребители (според Steam)~72% NVIDIA; 4060 Laptop 3,81%Съвпада с проучването на Valve от юни 2026 г. според множество изданияПРОВЕРЕНОValve, юли 2026 г.
Вътрешна аритметика в резюмето и §5всички съотношенияВсяко публикувано съотношение се преизчислява от Фигури 3 и 5; нула грешкиПРОВЕРЕНОпреизчислено
Обяснение на сигналите
Игри с знаменателя — сравнението с Codex смесва два показателяFreeToken отчита пропускателната способност при декодиране и TTFT отделно, така че неговите 39,3 токена/сек. са чиста скорост на декодиране. 33,9 токена/сек. на TraceLab е нормализирана скорост, която включва TTFT на всяка стъпка в декодирането; същата статия посочва чиста медиана на декодиране за Codex от 57,1 токена/сек. При сравнение на еднаква основа 39,3 не надхвърля Codex — това е приблизително две трети от неговата стойност.
Игри с знаменателя — „92% от скоростта на RTX 4090“ сравнява 4-битова с 16-битова точностСтойността от 39,3 токена/сек. за лаптопа е от версията NVFP4; стойността от 42,9 токена/сек. за RTX 4090 е при BF16. Това е посочено в надписа към Фигура 5, но текстът представя съотношението без уточнение за точността.
Игри с знаменателя — „един GPU“ пропуска изискването за хостНивото за 753B GLM-5.2 използва 512 GiB DDR5 на Xeon Platinum 8559C; „геймърският настолен компютър“ за 284B разполага със 192 GB. Един GPU е точно описание. Една машина на потребителска цена не е това, което описват тези конфигурации.
Несъответствие в настройките — базовите системи са ограничени до 6 нишки на CPUТова е посочено и е защитимо: статията ограничава наетите двусокетни сървъри, за да имитира периферни хостове, и валидира резултатите на две реални периферни машини с пълен брой нишки. KTransformers обаче е изграден около AMX-оптимизирано изпълнение на експерти от многоядрени CPU, затова колоната му трябва да се чете като „KTransformers на хост от периферен клас“, а не като неговия максимум.
Баланс — аритметиката е чистаВсяко съотношение в резюмето и резултатите се преизчислява правилно: 1,81 / 1,87 / 2,10 / 2,25× за Qwen3.6, 1,92 / 1,84 / 1,52 / 1,65× за DeepSeek-V4-Flash, 2,04× за GLM-5.2. Няма завишено закръгляване и необясними разлики между фигурите и текста.
Основни изводи
  • Статията е аритметично коректна — всяко публикувано съотношение се преизчислява от собствените ѝ фигури.
  • Все още няма независимо възпроизвеждане; 9 от 16 твърдения по необходимост са саморепортирани, а не укрити.
  • Най-същественият сигнал: 39,3 токена/сек. надхвърля нормализираните 33,9 на Codex, но не и чистата му медиана на декодиране от 57,1.
  • Заглавията за „един GPU“ тихомълком изискват 192–512 GB хост DRAM.
  • Базовата конфигурация на KTransformers работи с 6 нишки на CPU, под многоядрената AMX конфигурация, за която е предназначен.
Проверка на реалността от Marktechpost · проверено на 23 август 2026 г.

Основни изводи

  • FreeToken разделя пропуските в MoE кеша между зареждане през PCIe и изпълнение на CPU, използвайки измерени честотни ленти, а не фиксирано правило за разтоварване.
  • Изходът на експертите остава битово идентичен — без промени в маршрутизатора, без заместване на експерти и без намаляване на точността.
  • 1,5–2,3× по-висока пропускателна способност при декодиране спрямо llama.cpp, Ollama и KTransformers, с крайно TTFT под 44 s.
  • 35B при 39,3 токена/сек. на лаптоп GPU с 8 GB; 753B GLM-5.2 на един GPU за работна станция.
  • Apache-2.0, в PyPI и като настолно приложение за Windows/Linux — може да бъде внедрен още този следобед.

Разгледайте СТАТИЯТА, GITHUB ХРАНИЛИЩЕТО и ПРОЕКТА. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини