Познакомьтесь с FreeToken: нативный для edge-среды движок обслуживания MoE, запускающий 753 млрд параметров GLM-5.2 на одном GPU рабочей станции
Передовые модели с открытыми весами выходят быстрее, чем меняются аппаратные предположения, лежащие в их основе. Kimi-K3, GLM-5.2 и DeepSeek-V4-Flash сокращают разрыв в возможностях с проприетарными системами, однако публикация параметров определяет лишь, кто может получить модель, — но не кто может позволить себе её запуск. Их обслуживание по-прежнему предполагает GPU-кластеры уровня дата-центров, а по мере роста спроса на инференс из-за агентных нагрузок эти расходы сильнее всего ложатся на отдельных разработчиков и небольшие команды. Тем временем более ста миллионов пользовательских компьютеров уже оснащены дискретными GPU. Команда исследователей из UC Berkeley и UT Austin предлагает FreeToken. Исследователи утверждают, что недостающим элементом является не аппаратное обеспечение, а система обслуживания: она рассматривает персональный компьютер как единую эластичную платформу инференса, а не как небольшой GPU, и непрерывно распределяет вычисления и состояние модели между теми GPU, CPU, памятью и пропускной способностью межсоединений, которыми фактически располагает машина. В результате модель на 35B работает с интерактивной скоростью на ноутбучном GPU с 8 ГБ памяти, модель на 284B — на игровом настольном компьютере, а GLM-5.2 на 753B — на одной рабочей станции.
Можно ли это развернуть?
Да, FreeToken распространяется по лицензии Apache-2.0 на GitHub, опубликован на PyPI как freetoken v0.1.2 (uv pip install "freetoken[accel]") и поставляется в виде настольного приложения для Windows и Linux, устанавливаемого в один клик, на сайте flashml.ai. CLI ориентирован на Linux x86_64 с GPU NVIDIA и драйвером r580+ (CUDA 13). Команда ft serve предоставляет совместимые с OpenAI и Anthropic конечные точки на порту 1919, а ft launch claude подключает Claude Code, Codex, OpenCode или OpenClaw к вашему собственному компьютеру.
Кому это подходит: индивидуальным разработчикам, стартапам и инженерным командам малого и среднего бизнеса, чьи расходы на токены для агентов уже превышают стоимость собственного GPU; предприятиям следует рассматривать это как вариант для изолированных от сети или регулируемых нагрузок, а не как замену дата-центру. Наиболее подходящие отрасли: здравоохранение и юриспруденция (данные никогда не покидают машину), оборона, финансы и наукоёмкие исследования и разработки, связанные с интеллектуальной собственностью. Типичные применения: локальные агенты для программирования, приватный анализ кода, автономный анализ контрактов, генерация синтетических данных, пакетная оценка моделей.
Какую проблему это решает
Архитектура Mixture-of-Experts делает локальный инференс передовых моделей арифметически осуществимым. DeepSeek-V4-Flash активирует 6 из 256 маршрутизируемых экспертов в каждом из 43 слоёв, поэтому в обработке любого отдельного токена участвуют лишь 13B из 284B параметров. Однако разреженность не уменьшает пул экспертов: при FP4 полный набор занимает примерно 140 ГБ, поэтому неактивные эксперты хранятся в оперативной памяти хоста и по мере необходимости включаются в процесс выполнения.
Исследовательская команда выделяет три режима отказа существующих движков (llama.cpp, KTransformers, Ollama, MoE-Infinity):
- Предварительное заполнение уничтожает разреженность: тысячи токенов на слой направляются почти ко всему набору экспертов, поэтому проход предварительного заполнения передаёт весь пул через PCIe — около двух секунд на RTX 5090, пять секунд на настольных компьютерах с PCIe 4.0 и десять или более секунд на распространённых в ноутбуках соединениях x8.
- Статическое размещение не учитывает трафик декодирования: llama.cpp распределяет тензоры MoE во время загрузки; KTransformers фиксирует «горячее» подмножество. Маршрутизация меняется с каждым токеном, поэтому большинство вычислений экспертов выполняется на CPU, пока GPU и канал PCIe простаивают.
- Потребительские CPU не могут обработать остаток: двухканальная DDR5 обеспечивает 80–90 ГБ/с против 1–1,8 ТБ/с, которые RTX 4090 или 5090 получает из встроенной памяти.
Три механизма
- Адаптивное к пропускной способности выполнение (политика q*): поскольку передача DMA и выполнение экспертов на CPU используют одну и ту же подсистему оперативной памяти хоста, насыщенный канал PCIe оставляет остаточную пропускную способность
B_H − B_P. FreeToken соответствующим образом распределяет каждый шаг с m промахами кэша:q* ≈ m × B_P / B_Hэкспертов загружаются в кэш GPU, остальные вычисляются непосредственно на CPU, а две частичные суммы объединяются точно — без приближений и изменений маршрутизатора. Обе пропускные способности профилируются на развернутой машине (ft bench bw), что важно: измеренное соотношение B_P:B_H составляет 52,7:77,3 на сервере с RTX 5090, но 11,8:47,5 на ноутбуке с 4060. - Кэширование с учётом семантики: во время предварительного заполнения полное двойное буферизование слоя передаёт слой l+1, пока GPU вычисляет слой l. Контрольные точки рекуррентного состояния привязываются к границам специальных токенов — блокам рассуждений, вызовам инструментов и результатам работы инструментов, — то есть именно к местам, где агентские оболочки обрезают контекст, поэтому после редактирования предварительно заполняется только новый суффикс. Во время декодирования общий кэш экспертов LRU, охватывающий все слои MoE, следует за маршрутизатором, а не использует размещение, зафиксированное во время загрузки.
- Эластичное управление памятью: в безопасных точках планировщика кэш экспертов GPU перестраивается в соответствии с пересмотренным бюджетом VRAM без перезапуска движка или повторной загрузки пула хоста. Эксперты считываются с диска непосредственно в их конечную структуру размещения на хосте, после чего закрепляются; прогрев GPU не требуется, поскольку первый запрос обслуживается с холодным кэшем.
Результаты
На RTX 5090 FreeToken обеспечивает стабильные 77–83 ток/с на Qwen3.6-35B-A3B (BF16) и 22–25 ток/с на DeepSeek-V4-Flash (MXFP4) — в 1,5–2,3 раза быстрее самого сильного базового решения; при этом скорость декодирования во всех трёх агентных нагрузках остаётся в пределах 12% от показателя для одного диалога. Худшее время до первого токена (TTFT) во всех случаях не превышает 44 с; llama.cpp достигает 232 с, Ollama — 179 с, а KTransformers — 946 с в отдельных конфигурациях, что уже превышает время ожидания клиентов-агентов.
При одинаковой ёмкости кэша (37% пула Qwen3.6) глобальный LRU даёт промахи при чтении экспертов во время декодирования в 16% случаев против 41% у KTransformers и 62% у llama.cpp. На ноутбуке с RTX 4060 и 8 ГБ памяти сборка NVFP4 обслуживает модель на 35B со скоростью 39,3 ток/с — выше медианной скорости декодирования Codex в 33 ток/с, измеренной в производственных трассировках. На одной RTX PRO 6000 GLM-5.2 (753B, 40B активных параметров) работает со скоростью 14,9 ток/с против 7,3 у llama.cpp.
Проверка данных
| Утверждение | Их число | Независимая проверка | Вердикт и источник |
|---|---|---|---|
| Декодирование, Qwen3.6-35B-A3B BF16, RTX 5090 | 77–83 ток/с | Ничего не найдено | САМООТЧЁТРис. 3 статьи |
| Декодирование, DeepSeek-V4-Flash MXFP4, RTX 5090 | 22–25 ток/с | Ничего не найдено | САМООТЧЁТРис. 3 статьи |
| Ускорение декодирования по сравнению с самым сильным базовым решением | 1,5–2,3× | Точно пересчитывается по рис. 3 | САМООТЧЁТ§5.2 статьи |
| Стабильность декодирования в агентных нагрузках | в пределах 12% от W1 | Ничего не найдено | САМООТЧЁТ§5.2 статьи |
| Худшее TTFT по сравнению с базовыми решениями | <44 с против 232 / 179 / 946 с | Ничего не найдено | САМООТЧЁТ§5.2 статьи |
| Ноутбук 4060 «превышает медианные 33 ток/с Codex» | 39,3 против 33 | Показатель TraceLab 33,9 — нормализованный; чистая медиана декодирования Codex — 57,1, средневзвешенный показатель — 61,0 | ВВОДИТ В ЗАБЛУЖДЕНИЕarXiv:2606.30560 |
| Ноутбук показывает «92% скорости RTX 4090» | 39,3 / 42,9 | Арифметика верна, но 39,3 — это NVFP4, а 42,9 — BF16 | ВВОДИТ В ЗАБЛУЖДЕНИЕРис. 5 статьи |
| GLM-5.2 на 753B на одной RTX PRO 6000 | 14,9 против 7,3 у llama.cpp | Ничего не найдено | САМООТЧЁТ§5.3 статьи |
| Преимущество на пяти потребительских системах с разным оборудованием | 1,3–2,1× | Точно пересчитывается по рис. 5 | САМООТЧЁТРис. 5 статьи |
| Доля промахов экспертов при декодировании и одинаковой ёмкости | 16% / 39% | Ничего не найдено; это повторное воспроизведение трассировки, а не обслуживание в реальном времени | САМООТЧЁТРис. 4b статьи |
| Фрагмент предварительного заполнения на 8 192 токена; штраф за перекрытие | 1,19–1,22 с; 19/25/26% | Ничего не найдено | САМООТЧЁТРис. 4a статьи |
| Формулировка «753B на одном GPU рабочей станции» | 1 GPU | Верно для VRAM; хосты используют 512 ГиБ и 192 ГБ DRAM | ВВОДИТ В ЗАБЛУЖДЕНИЕТабл. 1 статьи |
| Базовые решения работают на 6 потоках CPU на арендованных серверах | 6 потоков | Ключевой вклад KTransformers — многопоточные ядра AMX для CPU | ВВОДИТ В ЗАБЛУЖДЕНИЕ§5.1 статьи |
| «Поддерживает более 20 моделей MoE» | 20+ | В общедоступном файле models.md перечислено около 17 проверенных контрольных точек MoE | САМООТЧЁТдокументация репозитория |
| Лицензия и распространение | Apache-2.0, PyPI v0.1.2 | Файл LICENSE и JSON API PyPI подтверждают это | ПРОВЕРЕНОGitHub, PyPI |
| База установленных дискретных GPU у пользователей (по данным Steam) | около 72% NVIDIA; 4060 Laptop — 3,81% | Соответствует опросу Valve за июнь 2026 года по данным нескольких изданий | ПРОВЕРЕНОValve, июль 2026 |
| Внутренняя арифметика в аннотации и §5 | все соотношения | Каждое опубликованное соотношение пересчитывается по рис. 3 и 5; ошибок нет | ПРОВЕРЕНОпересчитано |
- Статья арифметически точна — каждое опубликованное соотношение пересчитывается по собственным рисункам.
- Пока ничего не воспроизведено независимо; 9 из 16 утверждений вынужденно являются самоотчётами, а не попыткой уклониться от проверки.
- Самый существенный флаг: 39,3 ток/с превышает нормализованный показатель Codex в 33,9, но не его чистую медиану декодирования в 57,1.
- Заголовки про «один GPU» негласно требуют 192–512 ГБ оперативной памяти хоста.
- Базовый запуск KTransformers использует 6 потоков CPU — меньше, чем многопоточная конфигурация AMX, на которую он рассчитан.
Основные выводы
- FreeToken распределяет промахи кэша MoE между загрузкой через PCIe и выполнением на CPU, используя измеренные значения пропускной способности, а не фиксированное правило выгрузки.
- Выход экспертов остаётся побитово идентичным — без изменений маршрутизатора, замены экспертов и ослабления точности.
- Пропускная способность декодирования в 1,5–2,3 раза выше, чем у llama.cpp, Ollama и KTransformers, а хвостовое TTFT составляет менее 44 с.
- Модель на 35B работает со скоростью 39,3 ток/с на ноутбучном GPU с 8 ГБ памяти; GLM-5.2 на 753B — на одном GPU рабочей станции.
- Apache-2.0, доступен на PyPI и в виде настольного приложения для Windows/Linux — развернуть можно уже сегодня.
Ознакомьтесь с СТАТЬЁЙ, РЕПОЗИТОРИЕМ GITHUB и ПРОЕКТОМ. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? Теперь вы можете присоединиться к нам и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.