Знайомтеся з FreeToken: edge-нативний рушій обслуговування MoE, який запускає 753 млрд параметрів GLM-5.2 на одному GPU робочої станції
Передові моделі з відкритими вагами виходять швидше, ніж змінюються апаратні припущення щодо них. Kimi-K3, GLM-5.2 і DeepSeek-V4-Flash скорочують розрив у можливостях із пропрієтарними системами, але випуск параметрів визначає лише те, хто може отримати модель, — а не те, хто може дозволити собі її запуск. Їхнє обслуговування й досі передбачає кластери GPU рівня дата-центрів, а зі зростанням попиту на інференс через агентні робочі навантаження ці витрати найсильніше б’ють по індивідуальних розробниках і невеликих командах. Водночас понад сто мільйонів споживчих машин уже мають дискретні GPU. Команда дослідників із Каліфорнійського університету в Берклі та Техаського університету в Остіні пропонує FreeToken. Дослідницька команда стверджує, що бракує не апаратного забезпечення, а системи обслуговування: вона розглядає персональний комп’ютер як уніфіковану, еластичну платформу інференсу, а не як невеликий GPU, і безперервно розподіляє обчислення та стан моделі між доступними GPU, CPU, пам’яттю та пропускною здатністю інтерконекту конкретної машини. Результат — модель на 35B із інтерактивною швидкістю на ноутбучному GPU з 8 ГБ пам’яті, модель на 284B на ігровому настільному ПК і GLM-5.2 на 753B на одній робочій станції.
Чи придатна вона до розгортання?
Так, FreeToken доступна за ліцензією Apache-2.0 на GitHub, опублікована на PyPI як freetoken v0.1.2 (uv pip install "freetoken[accel]") і випускається як десктопний застосунок для Windows і Linux з установленням в один клік на flashml.ai. CLI орієнтований на Linux x86_64 із GPU NVIDIA та драйвером r580+ (CUDA 13). ft serve відкриває сумісні з OpenAI та Anthropic кінцеві точки на порту 1919, а ft launch claude підключає Claude Code, Codex, OpenCode або OpenClaw до вашої власної машини.
Кому це підходить: індивідуальним розробникам, стартапам і інженерним командам малого та середнього бізнесу, чиї рахунки за токени агентів уже перевищують вартість GPU, яким вони володіють; підприємствам варто розглядати це як шлях для ізольованих або регульованих робочих навантажень, а не як заміну дата-центру. Найкраще підходить для таких галузей: охорона здоров’я та юриспруденція (дані ніколи не залишають машину), оборона, фінанси та науково-дослідні розробки з великим обсягом інтелектуальної власності. Типові застосування: локальні агенти програмування, приватний аналіз коду, офлайн-аналіз контрактів, генерація синтетичних даних, пакетне оцінювання.
Розрив, на який вона націлена
Архітектура Mixture-of-Experts робить локальний інференс передових моделей арифметично можливим. DeepSeek-V4-Flash активує 6 із 256 маршрутизованих експертів у кожному з 43 шарів, тож лише 13B із її 284B параметрів беруть участь в обробці одного токена. Розрідженість, однак, не зменшує пул експертів — у форматі FP4 повний набір займає приблизно 140 ГБ, тому неактивні експерти перебувають у хост-пам’яті й за потреби входять до шляху виконання.
Дослідницька команда виокремлює три режими відмови в наявних рушіях (llama.cpp, KTransformers, Ollama, MoE-Infinity):
- Prefill знищує розрідженість: тисячі токенів на шар спрямовуються майже до всього набору експертів, тому під час проходу prefill увесь пул передається через PCIe — близько двох секунд на RTX 5090, п’яти на настільних ПК із PCIe 4.0 і десяти або більше на з’єднаннях x8, поширених у ноутбуках.
- Статичне розміщення не враховує трафік decode: llama.cpp призначає тензори MoE під час завантаження; KTransformers фіксує «гарячу» підмножину. Маршрутизація змінюється з кожним токеном, тому більшість обчислень експертів припадає на CPU, тоді як GPU та канал PCIe простоюють.
- Споживчі CPU не можуть обробити залишок: двоканальна DDR5 забезпечує 80–90 ГБ/с проти 1–1,8 ТБ/с, які RTX 4090 або 5090 отримує з вбудованої пам’яті.
Три механізми
- Виконання з адаптацією до пропускної здатності (політика q*): оскільки передавання DMA та виконання експертів на CPU читають із тієї самої підсистеми хост-пам’яті, насичений канал PCIe залишає залишкову пропускну здатність
B_H − B_P. FreeToken відповідно розподіляє кожен крок із m промахами кешу: приблизноq* ≈ m × B_P / B_Hекспертів завантажуються в кеш GPU, решта обчислюється безпосередньо на CPU, а дві часткові суми об’єднуються точно — без апроксимації та без модифікації маршрутизатора. Обидві пропускні здатності профілюються на розгорнутій машині (ft bench bw), що має значення: виміряне співвідношення B_P:B_H становить 52,7:77,3 на сервері з RTX 5090, але 11,8:47,5 на ноутбуці з 4060. - Кешування з урахуванням семантики: під час prefill повношарова подвійна буферизація передає шар l+1, поки GPU обчислює шар l. Контрольні точки рекурентного стану прив’язані до меж спеціальних токенів — блоків міркувань, викликів інструментів і результатів роботи інструментів — саме там, де агентські оболонки обрізають контекст, тому після редагування повторно заповнюється лише новий суфікс. Під час decode спільний LRU-кеш експертів, що охоплює всі шари MoE, слідує за маршрутизатором, а не за розміщенням, зафіксованим під час завантаження.
- Еластичне керування пам’яттю: у безпечних точках планувальника кеш експертів GPU перебудовується відповідно до оновленого бюджету VRAM без перезапуску рушія чи повторного завантаження пулу хост-пам’яті. Експерти зчитуються з диска безпосередньо в остаточне розміщення на хості, після чого закріплюються; прогрів GPU не потрібен, оскільки перший запит обслуговується з холодним кешем.
Результати
На RTX 5090 FreeToken забезпечує стабільні 77–83 ток./с на Qwen3.6-35B-A3B (BF16) і 22–25 ток./с на DeepSeek-V4-Flash (MXFP4) — у 1,5–2,3 раза швидше за найсильніший базовий показник, причому швидкість decode у трьох агентських робочих навантаженнях залишається в межах 12% від показника для одного запиту. У кожній комірці найгірший TTFT залишається нижчим за 44 с; llama.cpp сягає 232 с, Ollama — 179 с, а KTransformers — 946 с у різних конфігураціях, що перевищує час очікування клієнтів агентів.
За однакової місткості кешу (37% пулу Qwen3.6) глобальний LRU пропускає 16% читань експертів під час decode проти 41% у KTransformers і 62% у llama.cpp. На ноутбуці з RTX 4060 і 8 ГБ пам’яті збірка NVFP4 обслуговує модель на 35B зі швидкістю 39,3 ток./с — вище за медіанну швидкість decode Codex у 33 ток./с, виміряну у виробничих трасуваннях. На одному RTX PRO 6000 GLM-5.2 (753B, 40B активних) працює зі швидкістю 14,9 ток./с проти 7,3 у llama.cpp.
Перевірка даних
| Твердження | Їхнє число | Незалежна перевірка | Вердикт і джерело |
|---|---|---|---|
| Decode, Qwen3.6-35B-A3B BF16, RTX 5090 | 77–83 ток./с | Не знайдено | ВЛАСНІ ДАНІРис. 3 статті |
| Decode, DeepSeek-V4-Flash MXFP4, RTX 5090 | 22–25 ток./с | Не знайдено | ВЛАСНІ ДАНІРис. 3 статті |
| Прискорення decode порівняно з найсильнішим базовим показником | 1,5–2,3× | Точно перераховується з рис. 3 | ВЛАСНІ ДАНІ§5.2 статті |
| Стабільність decode у різних агентських робочих навантаженнях | у межах 12% від W1 | Не знайдено | ВЛАСНІ ДАНІ§5.2 статті |
| Найгірший TTFT порівняно з базовими показниками | <44 с проти 232 / 179 / 946 с | Не знайдено | ВЛАСНІ ДАНІ§5.2 статті |
| Ноутбук із 4060 «перевищує медіану Codex у 33 ток./с» | 39,3 проти 33 | 33,9 TraceLab є нормалізованим показником; чиста медіана decode Codex — 57,1, зважене середнє — 61,0 | ОМАНЛИВЕarXiv:2606.30560 |
| Ноутбук забезпечує «92% швидкості RTX 4090» | 39,3 / 42,9 | Арифметично правильно, але 39,3 — це NVFP4, а 42,9 — BF16 | ОМАНЛИВЕРис. 5 статті |
| GLM-5.2 на 753B на одній RTX PRO 6000 | 14,9 проти 7,3 у llama.cpp | Не знайдено | ВЛАСНІ ДАНІ§5.3 статті |
| Перевага на різному обладнанні, п’ять споживчих систем | 1,3–2,1× | Точно перераховується з рис. 5 | ВЛАСНІ ДАНІРис. 5 статті |
| Частота промахів експертів під час decode за однакової місткості | 16% / 39% | Не знайдено; це повторне відтворення трасування, а не обслуговування наживо | ВЛАСНІ ДАНІРис. 4b статті |
| Фрагмент prefill на 8 192 токенів; штраф за перекриття | 1,19–1,22 с; 19/25/26% | Не знайдено | ВЛАСНІ ДАНІРис. 4a статті |
| Формулювання «753B на одному робочому GPU» | 1 GPU | Правда для VRAM; на хості використовуються 512 ГіБ і 192 ГБ DRAM | ОМАНЛИВЕТабл. 1 статті |
| Базові моделі працюють із 6 потоками CPU на орендованих серверах | 6 потоків | Головний внесок KTransformers — багатоядерні AMX-ядра CPU | ОМАНЛИВЕ§5.1 статті |
| «Підтримує понад 20 моделей MoE» | 20+ | У відкритому документі models.md перелічено приблизно 17 перевірених контрольних точок MoE | ВЛАСНІ ДАНІдокументація репозиторію |
| Ліцензія та дистрибуція | Apache-2.0, PyPI v0.1.2 | Файл LICENSE і JSON API PyPI це підтверджують | ПЕРЕВІРЕНОGitHub, PyPI |
| База встановлених споживчих дискретних GPU (за даними Steam) | приблизно 72% NVIDIA; 4060 Laptop 3,81% | Відповідає опитуванню Valve за червень 2026 року згідно з кількома виданнями | ПЕРЕВІРЕНОValve, липень 2026 |
| Внутрішня арифметика в анотації та §5 | усі співвідношення | Кожне опубліковане співвідношення перераховується за рисунками 3 і 5; нуль помилок | ПЕРЕВІРЕНОперераховано |
- Стаття арифметично точна — кожне опубліковане співвідношення перераховується за наведеними в ній рисунками.
- Поки що нічого не відтворено незалежно; 9 із 16 тверджень вимушено є власними даними, а не результатом ухиляння.
- Найсуттєвіша проблема: 39,3 ток./с перевищує нормалізований показник Codex у 33,9, але не його чисту медіану decode у 57,1.
- Заголовки про «один GPU» непомітно передбачають 192–512 ГБ оперативної пам’яті хоста.
- Базовий запуск KTransformers виконується на 6 потоках CPU — менше, ніж багатоядерна AMX-конфігурація, на яку він розрахований.
Головні висновки
- FreeToken розподіляє промахи кешу MoE між завантаженням через PCIe та виконанням на CPU, використовуючи виміряну пропускну здатність, а не фіксоване правило вивантаження.
- Результат роботи експертів залишається побітово точним — без змін маршрутизатора, заміни експертів чи послаблення точності.
- У 1,5–2,3 раза вища пропускна здатність decode порівняно з llama.cpp, Ollama та KTransformers, а хвостовий TTFT — менше 44 с.
- Модель на 35B зі швидкістю 39,3 ток./с на ноутбучному GPU з 8 ГБ пам’яті; GLM-5.2 на 753B — на одному GPU робочої станції.
- Apache-2.0, доступна на PyPI і як десктопний застосунок для Windows/Linux — розгорнути можна вже цього дня.
Ознайомтеся з СТАТТЕЮ, РЕПОЗИТОРІЄМ НА GITHUB і ПРОЄКТОМ. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібне партнерство з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.