Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← До новин

Знайомтеся з FreeToken: edge-нативний рушій обслуговування MoE, який запускає 753 млрд параметрів GLM-5.2 на одному GPU робочої станції

Передові моделі з відкритими вагами виходять швидше, ніж змінюються апаратні припущення щодо них. Kimi-K3, GLM-5.2 і DeepSeek-V4-Flash скорочують розрив у можливостях із пропрієтарними системами, але випуск параметрів визначає лише те, хто може отримати модель, — а не те, хто може дозволити собі її запуск. Їхнє обслуговування й досі передбачає кластери GPU рівня дата-центрів, а зі зростанням попиту на інференс через агентні робочі навантаження ці витрати найсильніше б’ють по індивідуальних розробниках і невеликих командах. Водночас понад сто мільйонів споживчих машин уже мають дискретні GPU. Команда дослідників із Каліфорнійського університету в Берклі та Техаського університету в Остіні пропонує FreeToken. Дослідницька команда стверджує, що бракує не апаратного забезпечення, а системи обслуговування: вона розглядає персональний комп’ютер як уніфіковану, еластичну платформу інференсу, а не як невеликий GPU, і безперервно розподіляє обчислення та стан моделі між доступними GPU, CPU, пам’яттю та пропускною здатністю інтерконекту конкретної машини. Результат — модель на 35B із інтерактивною швидкістю на ноутбучному GPU з 8 ГБ пам’яті, модель на 284B на ігровому настільному ПК і GLM-5.2 на 753B на одній робочій станції.

Чи придатна вона до розгортання?

Так, FreeToken доступна за ліцензією Apache-2.0 на GitHub, опублікована на PyPI як freetoken v0.1.2 (uv pip install "freetoken[accel]") і випускається як десктопний застосунок для Windows і Linux з установленням в один клік на flashml.ai. CLI орієнтований на Linux x86_64 із GPU NVIDIA та драйвером r580+ (CUDA 13). ft serve відкриває сумісні з OpenAI та Anthropic кінцеві точки на порту 1919, а ft launch claude підключає Claude Code, Codex, OpenCode або OpenClaw до вашої власної машини.

Кому це підходить: індивідуальним розробникам, стартапам і інженерним командам малого та середнього бізнесу, чиї рахунки за токени агентів уже перевищують вартість GPU, яким вони володіють; підприємствам варто розглядати це як шлях для ізольованих або регульованих робочих навантажень, а не як заміну дата-центру. Найкраще підходить для таких галузей: охорона здоров’я та юриспруденція (дані ніколи не залишають машину), оборона, фінанси та науково-дослідні розробки з великим обсягом інтелектуальної власності. Типові застосування: локальні агенти програмування, приватний аналіз коду, офлайн-аналіз контрактів, генерація синтетичних даних, пакетне оцінювання.

Розрив, на який вона націлена

Архітектура Mixture-of-Experts робить локальний інференс передових моделей арифметично можливим. DeepSeek-V4-Flash активує 6 із 256 маршрутизованих експертів у кожному з 43 шарів, тож лише 13B із її 284B параметрів беруть участь в обробці одного токена. Розрідженість, однак, не зменшує пул експертів — у форматі FP4 повний набір займає приблизно 140 ГБ, тому неактивні експерти перебувають у хост-пам’яті й за потреби входять до шляху виконання.

Дослідницька команда виокремлює три режими відмови в наявних рушіях (llama.cpp, KTransformers, Ollama, MoE-Infinity):

  • Prefill знищує розрідженість: тисячі токенів на шар спрямовуються майже до всього набору експертів, тому під час проходу prefill увесь пул передається через PCIe — близько двох секунд на RTX 5090, п’яти на настільних ПК із PCIe 4.0 і десяти або більше на з’єднаннях x8, поширених у ноутбуках.
  • Статичне розміщення не враховує трафік decode: llama.cpp призначає тензори MoE під час завантаження; KTransformers фіксує «гарячу» підмножину. Маршрутизація змінюється з кожним токеном, тому більшість обчислень експертів припадає на CPU, тоді як GPU та канал PCIe простоюють.
  • Споживчі CPU не можуть обробити залишок: двоканальна DDR5 забезпечує 80–90 ГБ/с проти 1–1,8 ТБ/с, які RTX 4090 або 5090 отримує з вбудованої пам’яті.

Три механізми

  • Виконання з адаптацією до пропускної здатності (політика q*): оскільки передавання DMA та виконання експертів на CPU читають із тієї самої підсистеми хост-пам’яті, насичений канал PCIe залишає залишкову пропускну здатність B_H − B_P. FreeToken відповідно розподіляє кожен крок із m промахами кешу: приблизно q* ≈ m × B_P / B_H експертів завантажуються в кеш GPU, решта обчислюється безпосередньо на CPU, а дві часткові суми об’єднуються точно — без апроксимації та без модифікації маршрутизатора. Обидві пропускні здатності профілюються на розгорнутій машині (ft bench bw), що має значення: виміряне співвідношення B_P:B_H становить 52,7:77,3 на сервері з RTX 5090, але 11,8:47,5 на ноутбуці з 4060.
  • Кешування з урахуванням семантики: під час prefill повношарова подвійна буферизація передає шар l+1, поки GPU обчислює шар l. Контрольні точки рекурентного стану прив’язані до меж спеціальних токенів — блоків міркувань, викликів інструментів і результатів роботи інструментів — саме там, де агентські оболонки обрізають контекст, тому після редагування повторно заповнюється лише новий суфікс. Під час decode спільний LRU-кеш експертів, що охоплює всі шари MoE, слідує за маршрутизатором, а не за розміщенням, зафіксованим під час завантаження.
  • Еластичне керування пам’яттю: у безпечних точках планувальника кеш експертів GPU перебудовується відповідно до оновленого бюджету VRAM без перезапуску рушія чи повторного завантаження пулу хост-пам’яті. Експерти зчитуються з диска безпосередньо в остаточне розміщення на хості, після чого закріплюються; прогрів GPU не потрібен, оскільки перший запит обслуговується з холодним кешем.

Результати

На RTX 5090 FreeToken забезпечує стабільні 77–83 ток./с на Qwen3.6-35B-A3B (BF16) і 22–25 ток./с на DeepSeek-V4-Flash (MXFP4) — у 1,5–2,3 раза швидше за найсильніший базовий показник, причому швидкість decode у трьох агентських робочих навантаженнях залишається в межах 12% від показника для одного запиту. У кожній комірці найгірший TTFT залишається нижчим за 44 с; llama.cpp сягає 232 с, Ollama — 179 с, а KTransformers — 946 с у різних конфігураціях, що перевищує час очікування клієнтів агентів.

За однакової місткості кешу (37% пулу Qwen3.6) глобальний LRU пропускає 16% читань експертів під час decode проти 41% у KTransformers і 62% у llama.cpp. На ноутбуці з RTX 4060 і 8 ГБ пам’яті збірка NVFP4 обслуговує модель на 35B зі швидкістю 39,3 ток./с — вище за медіанну швидкість decode Codex у 33 ток./с, виміряну у виробничих трасуваннях. На одному RTX PRO 6000 GLM-5.2 (753B, 40B активних) працює зі швидкістю 14,9 ток./с проти 7,3 у llama.cpp.

Перевірка даних

Перевірка реальності · FlashML FreeToken ОЦІНКА ЗАВИЩЕННЯ 59/100
Станом на 23 серпня 2026 року · режим за замовчуванням · перевірено: arXiv:2608.16157, репозиторій GitHub, flashml.ai
3Перевірено
9Власні дані
4Оманливі
0Спростовані
0Не знайдено
Формула оцінки: 8 × оманливі + 15 × спростовані + 3 × власні дані, максимум 100. Оцінка визначається стовпцем власних даних, а не нечесністю — код було оприлюднено за шість днів до цієї перевірки, тож незалежного відтворення поки немає.
Таблиця тверджень · 16 тверджень
ТвердженняЇхнє числоНезалежна перевіркаВердикт і джерело
Decode, Qwen3.6-35B-A3B BF16, RTX 509077–83 ток./сНе знайденоВЛАСНІ ДАНІРис. 3 статті
Decode, DeepSeek-V4-Flash MXFP4, RTX 509022–25 ток./сНе знайденоВЛАСНІ ДАНІРис. 3 статті
Прискорення decode порівняно з найсильнішим базовим показником1,5–2,3×Точно перераховується з рис. 3ВЛАСНІ ДАНІ§5.2 статті
Стабільність decode у різних агентських робочих навантаженняху межах 12% від W1Не знайденоВЛАСНІ ДАНІ§5.2 статті
Найгірший TTFT порівняно з базовими показниками<44 с проти 232 / 179 / 946 сНе знайденоВЛАСНІ ДАНІ§5.2 статті
Ноутбук із 4060 «перевищує медіану Codex у 33 ток./с»39,3 проти 3333,9 TraceLab є нормалізованим показником; чиста медіана decode Codex — 57,1, зважене середнє — 61,0ОМАНЛИВЕarXiv:2606.30560
Ноутбук забезпечує «92% швидкості RTX 4090»39,3 / 42,9Арифметично правильно, але 39,3 — це NVFP4, а 42,9 — BF16ОМАНЛИВЕРис. 5 статті
GLM-5.2 на 753B на одній RTX PRO 600014,9 проти 7,3 у llama.cppНе знайденоВЛАСНІ ДАНІ§5.3 статті
Перевага на різному обладнанні, п’ять споживчих систем1,3–2,1×Точно перераховується з рис. 5ВЛАСНІ ДАНІРис. 5 статті
Частота промахів експертів під час decode за однакової місткості16% / 39%Не знайдено; це повторне відтворення трасування, а не обслуговування наживоВЛАСНІ ДАНІРис. 4b статті
Фрагмент prefill на 8 192 токенів; штраф за перекриття1,19–1,22 с; 19/25/26%Не знайденоВЛАСНІ ДАНІРис. 4a статті
Формулювання «753B на одному робочому GPU»1 GPUПравда для VRAM; на хості використовуються 512 ГіБ і 192 ГБ DRAMОМАНЛИВЕТабл. 1 статті
Базові моделі працюють із 6 потоками CPU на орендованих серверах6 потоківГоловний внесок KTransformers — багатоядерні AMX-ядра CPUОМАНЛИВЕ§5.1 статті
«Підтримує понад 20 моделей MoE»20+У відкритому документі models.md перелічено приблизно 17 перевірених контрольних точок MoEВЛАСНІ ДАНІдокументація репозиторію
Ліцензія та дистрибуціяApache-2.0, PyPI v0.1.2Файл LICENSE і JSON API PyPI це підтверджуютьПЕРЕВІРЕНОGitHub, PyPI
База встановлених споживчих дискретних GPU (за даними Steam)приблизно 72% NVIDIA; 4060 Laptop 3,81%Відповідає опитуванню Valve за червень 2026 року згідно з кількома виданнямиПЕРЕВІРЕНОValve, липень 2026
Внутрішня арифметика в анотації та §5усі співвідношенняКожне опубліковане співвідношення перераховується за рисунками 3 і 5; нуль помилокПЕРЕВІРЕНОперераховано
Пояснення позначок
Ігри зі знаменником — порівняння з Codex змішує два показникиFreeToken подає пропускну здатність decode і TTFT окремо, тому його показник 39,3 ток./с є чистою швидкістю decode. Показник TraceLab у 33,9 ток./с є нормалізованою швидкістю, яка враховує TTFT кожного кроку в decode; у тій самій статті чиста медіана decode Codex становить 57,1 ток./с. За коректного порівняння 39,3 не перевищує показник Codex — це приблизно дві третини від нього.
Ігри зі знаменником — «92% швидкості RTX 4090» порівнює 4-бітний формат із 16-бітнимПоказник ноутбука 39,3 ток./с отримано для збірки NVFP4; показник RTX 4090 у 42,9 ток./с — для BF16. Це зазначено в підписі до рисунка 5, але в тексті співвідношення наведено без застереження щодо точності.
Ігри зі знаменником — «один GPU» замовчує вимоги до хост-системиРівень GLM-5.2 на 753B працює з 512 ГіБ DDR5 на Xeon Platinum 8559C; «ігровий настільний ПК» для моделі на 284B має 192 ГБ. Один GPU — точне твердження. Одна машина за споживчою ціною — ні, саме такі конфігурації тут описано.
Невідповідність налаштувань — базові моделі обмежено 6 потоками CPUЦе розкрито й можна обґрунтувати: стаття обмежує орендовані двосокетні сервери, щоб імітувати периферійні хости, і перевіряє систему на двох реальних периферійних машинах із повною кількістю потоків. Але KTransformers створено навколо оптимізованого для AMX виконання експертів на багатоядерному CPU, тож його стовпець слід читати як «KTransformers на периферійному хості», а не як верхню межу можливостей.
Компенсувальний фактор — арифметика чистаКожне співвідношення в анотації та результатах перераховується правильно: 1,81 / 1,87 / 2,10 / 2,25× для Qwen3.6, 1,92 / 1,84 / 1,52 / 1,65× для DeepSeek-V4-Flash, 2,04× для GLM-5.2. Немає завищеного округлення чи незрозумілих розбіжностей між рисунками та текстом.
Головні висновки
  • Стаття арифметично точна — кожне опубліковане співвідношення перераховується за наведеними в ній рисунками.
  • Поки що нічого не відтворено незалежно; 9 із 16 тверджень вимушено є власними даними, а не результатом ухиляння.
  • Найсуттєвіша проблема: 39,3 ток./с перевищує нормалізований показник Codex у 33,9, але не його чисту медіану decode у 57,1.
  • Заголовки про «один GPU» непомітно передбачають 192–512 ГБ оперативної пам’яті хоста.
  • Базовий запуск KTransformers виконується на 6 потоках CPU — менше, ніж багатоядерна AMX-конфігурація, на яку він розрахований.
Перевірка реальності від Marktechpost · перевірено 23 серпня 2026 року

Головні висновки

  • FreeToken розподіляє промахи кешу MoE між завантаженням через PCIe та виконанням на CPU, використовуючи виміряну пропускну здатність, а не фіксоване правило вивантаження.
  • Результат роботи експертів залишається побітово точним — без змін маршрутизатора, заміни експертів чи послаблення точності.
  • У 1,5–2,3 раза вища пропускна здатність decode порівняно з llama.cpp, Ollama та KTransformers, а хвостовий TTFT — менше 44 с.
  • Модель на 35B зі швидкістю 39,3 ток./с на ноутбучному GPU з 8 ГБ пам’яті; GLM-5.2 на 753B — на одному GPU робочої станції.
  • Apache-2.0, доступна на PyPI і як десктопний застосунок для Windows/Linux — розгорнути можна вже цього дня.

Ознайомтеся з СТАТТЕЮ, РЕПОЗИТОРІЄМ НА GITHUB і ПРОЄКТОМ. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібне партнерство з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини