Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← К новостям

Познакомьтесь с FreeToken: нативный для edge-среды движок обслуживания MoE, запускающий 753 млрд параметров GLM-5.2 на одном GPU рабочей станции

Передовые модели с открытыми весами выходят быстрее, чем меняются аппаратные предположения, лежащие в их основе. Kimi-K3, GLM-5.2 и DeepSeek-V4-Flash сокращают разрыв в возможностях с проприетарными системами, однако публикация параметров определяет лишь, кто может получить модель, — но не кто может позволить себе её запуск. Их обслуживание по-прежнему предполагает GPU-кластеры уровня дата-центров, а по мере роста спроса на инференс из-за агентных нагрузок эти расходы сильнее всего ложатся на отдельных разработчиков и небольшие команды. Тем временем более ста миллионов пользовательских компьютеров уже оснащены дискретными GPU. Команда исследователей из UC Berkeley и UT Austin предлагает FreeToken. Исследователи утверждают, что недостающим элементом является не аппаратное обеспечение, а система обслуживания: она рассматривает персональный компьютер как единую эластичную платформу инференса, а не как небольшой GPU, и непрерывно распределяет вычисления и состояние модели между теми GPU, CPU, памятью и пропускной способностью межсоединений, которыми фактически располагает машина. В результате модель на 35B работает с интерактивной скоростью на ноутбучном GPU с 8 ГБ памяти, модель на 284B — на игровом настольном компьютере, а GLM-5.2 на 753B — на одной рабочей станции.

Можно ли это развернуть?

Да, FreeToken распространяется по лицензии Apache-2.0 на GitHub, опубликован на PyPI как freetoken v0.1.2 (uv pip install "freetoken[accel]") и поставляется в виде настольного приложения для Windows и Linux, устанавливаемого в один клик, на сайте flashml.ai. CLI ориентирован на Linux x86_64 с GPU NVIDIA и драйвером r580+ (CUDA 13). Команда ft serve предоставляет совместимые с OpenAI и Anthropic конечные точки на порту 1919, а ft launch claude подключает Claude Code, Codex, OpenCode или OpenClaw к вашему собственному компьютеру.

Кому это подходит: индивидуальным разработчикам, стартапам и инженерным командам малого и среднего бизнеса, чьи расходы на токены для агентов уже превышают стоимость собственного GPU; предприятиям следует рассматривать это как вариант для изолированных от сети или регулируемых нагрузок, а не как замену дата-центру. Наиболее подходящие отрасли: здравоохранение и юриспруденция (данные никогда не покидают машину), оборона, финансы и наукоёмкие исследования и разработки, связанные с интеллектуальной собственностью. Типичные применения: локальные агенты для программирования, приватный анализ кода, автономный анализ контрактов, генерация синтетических данных, пакетная оценка моделей.

Какую проблему это решает

Архитектура Mixture-of-Experts делает локальный инференс передовых моделей арифметически осуществимым. DeepSeek-V4-Flash активирует 6 из 256 маршрутизируемых экспертов в каждом из 43 слоёв, поэтому в обработке любого отдельного токена участвуют лишь 13B из 284B параметров. Однако разреженность не уменьшает пул экспертов: при FP4 полный набор занимает примерно 140 ГБ, поэтому неактивные эксперты хранятся в оперативной памяти хоста и по мере необходимости включаются в процесс выполнения.

Исследовательская команда выделяет три режима отказа существующих движков (llama.cpp, KTransformers, Ollama, MoE-Infinity):

  • Предварительное заполнение уничтожает разреженность: тысячи токенов на слой направляются почти ко всему набору экспертов, поэтому проход предварительного заполнения передаёт весь пул через PCIe — около двух секунд на RTX 5090, пять секунд на настольных компьютерах с PCIe 4.0 и десять или более секунд на распространённых в ноутбуках соединениях x8.
  • Статическое размещение не учитывает трафик декодирования: llama.cpp распределяет тензоры MoE во время загрузки; KTransformers фиксирует «горячее» подмножество. Маршрутизация меняется с каждым токеном, поэтому большинство вычислений экспертов выполняется на CPU, пока GPU и канал PCIe простаивают.
  • Потребительские CPU не могут обработать остаток: двухканальная DDR5 обеспечивает 80–90 ГБ/с против 1–1,8 ТБ/с, которые RTX 4090 или 5090 получает из встроенной памяти.

Три механизма

  • Адаптивное к пропускной способности выполнение (политика q*): поскольку передача DMA и выполнение экспертов на CPU используют одну и ту же подсистему оперативной памяти хоста, насыщенный канал PCIe оставляет остаточную пропускную способность B_H − B_P. FreeToken соответствующим образом распределяет каждый шаг с m промахами кэша: q* ≈ m × B_P / B_H экспертов загружаются в кэш GPU, остальные вычисляются непосредственно на CPU, а две частичные суммы объединяются точно — без приближений и изменений маршрутизатора. Обе пропускные способности профилируются на развернутой машине (ft bench bw), что важно: измеренное соотношение B_P:B_H составляет 52,7:77,3 на сервере с RTX 5090, но 11,8:47,5 на ноутбуке с 4060.
  • Кэширование с учётом семантики: во время предварительного заполнения полное двойное буферизование слоя передаёт слой l+1, пока GPU вычисляет слой l. Контрольные точки рекуррентного состояния привязываются к границам специальных токенов — блокам рассуждений, вызовам инструментов и результатам работы инструментов, — то есть именно к местам, где агентские оболочки обрезают контекст, поэтому после редактирования предварительно заполняется только новый суффикс. Во время декодирования общий кэш экспертов LRU, охватывающий все слои MoE, следует за маршрутизатором, а не использует размещение, зафиксированное во время загрузки.
  • Эластичное управление памятью: в безопасных точках планировщика кэш экспертов GPU перестраивается в соответствии с пересмотренным бюджетом VRAM без перезапуска движка или повторной загрузки пула хоста. Эксперты считываются с диска непосредственно в их конечную структуру размещения на хосте, после чего закрепляются; прогрев GPU не требуется, поскольку первый запрос обслуживается с холодным кэшем.

Результаты

На RTX 5090 FreeToken обеспечивает стабильные 77–83 ток/с на Qwen3.6-35B-A3B (BF16) и 22–25 ток/с на DeepSeek-V4-Flash (MXFP4) — в 1,5–2,3 раза быстрее самого сильного базового решения; при этом скорость декодирования во всех трёх агентных нагрузках остаётся в пределах 12% от показателя для одного диалога. Худшее время до первого токена (TTFT) во всех случаях не превышает 44 с; llama.cpp достигает 232 с, Ollama — 179 с, а KTransformers — 946 с в отдельных конфигурациях, что уже превышает время ожидания клиентов-агентов.

При одинаковой ёмкости кэша (37% пула Qwen3.6) глобальный LRU даёт промахи при чтении экспертов во время декодирования в 16% случаев против 41% у KTransformers и 62% у llama.cpp. На ноутбуке с RTX 4060 и 8 ГБ памяти сборка NVFP4 обслуживает модель на 35B со скоростью 39,3 ток/с — выше медианной скорости декодирования Codex в 33 ток/с, измеренной в производственных трассировках. На одной RTX PRO 6000 GLM-5.2 (753B, 40B активных параметров) работает со скоростью 14,9 ток/с против 7,3 у llama.cpp.

Проверка данных

Проверка реальности · FlashML FreeToken ОЦЕНКА ИНФЛЯЦИИ 59/100
По состоянию на 23 августа 2026 г. · режим по умолчанию · проверены: arXiv:2608.16157, репозиторий GitHub, flashml.ai
3Проверено
9Самоотчёт
4Вводит в заблуждение
0Опровергнуто
0Не найдено
Формула оценки: 8 × вводящие в заблуждение + 15 × опровергнутые + 3 × самоотчёт, максимум 100. Оценка обусловлена столбцом самоотчёта, а не нечестностью — код стал общедоступным за шесть дней до этой проверки, поэтому независимого воспроизведения пока нет.
Таблица утверждений · 16 утверждений
УтверждениеИх числоНезависимая проверкаВердикт и источник
Декодирование, Qwen3.6-35B-A3B BF16, RTX 509077–83 ток/сНичего не найденоСАМООТЧЁТРис. 3 статьи
Декодирование, DeepSeek-V4-Flash MXFP4, RTX 509022–25 ток/сНичего не найденоСАМООТЧЁТРис. 3 статьи
Ускорение декодирования по сравнению с самым сильным базовым решением1,5–2,3×Точно пересчитывается по рис. 3САМООТЧЁТ§5.2 статьи
Стабильность декодирования в агентных нагрузкахв пределах 12% от W1Ничего не найденоСАМООТЧЁТ§5.2 статьи
Худшее TTFT по сравнению с базовыми решениями<44 с против 232 / 179 / 946 сНичего не найденоСАМООТЧЁТ§5.2 статьи
Ноутбук 4060 «превышает медианные 33 ток/с Codex»39,3 против 33Показатель TraceLab 33,9 — нормализованный; чистая медиана декодирования Codex — 57,1, средневзвешенный показатель — 61,0ВВОДИТ В ЗАБЛУЖДЕНИЕarXiv:2606.30560
Ноутбук показывает «92% скорости RTX 4090»39,3 / 42,9Арифметика верна, но 39,3 — это NVFP4, а 42,9 — BF16ВВОДИТ В ЗАБЛУЖДЕНИЕРис. 5 статьи
GLM-5.2 на 753B на одной RTX PRO 600014,9 против 7,3 у llama.cppНичего не найденоСАМООТЧЁТ§5.3 статьи
Преимущество на пяти потребительских системах с разным оборудованием1,3–2,1×Точно пересчитывается по рис. 5САМООТЧЁТРис. 5 статьи
Доля промахов экспертов при декодировании и одинаковой ёмкости16% / 39%Ничего не найдено; это повторное воспроизведение трассировки, а не обслуживание в реальном времениСАМООТЧЁТРис. 4b статьи
Фрагмент предварительного заполнения на 8 192 токена; штраф за перекрытие1,19–1,22 с; 19/25/26%Ничего не найденоСАМООТЧЁТРис. 4a статьи
Формулировка «753B на одном GPU рабочей станции»1 GPUВерно для VRAM; хосты используют 512 ГиБ и 192 ГБ DRAMВВОДИТ В ЗАБЛУЖДЕНИЕТабл. 1 статьи
Базовые решения работают на 6 потоках CPU на арендованных серверах6 потоковКлючевой вклад KTransformers — многопоточные ядра AMX для CPUВВОДИТ В ЗАБЛУЖДЕНИЕ§5.1 статьи
«Поддерживает более 20 моделей MoE»20+В общедоступном файле models.md перечислено около 17 проверенных контрольных точек MoEСАМООТЧЁТдокументация репозитория
Лицензия и распространениеApache-2.0, PyPI v0.1.2Файл LICENSE и JSON API PyPI подтверждают этоПРОВЕРЕНОGitHub, PyPI
База установленных дискретных GPU у пользователей (по данным Steam)около 72% NVIDIA; 4060 Laptop — 3,81%Соответствует опросу Valve за июнь 2026 года по данным нескольких изданийПРОВЕРЕНОValve, июль 2026
Внутренняя арифметика в аннотации и §5все соотношенияКаждое опубликованное соотношение пересчитывается по рис. 3 и 5; ошибок нетПРОВЕРЕНОпересчитано
Объяснение флагов
Игры со знаменателем — сравнение с Codex смешивает две метрикиFreeToken отдельно сообщает пропускную способность декодирования и TTFT, поэтому показатель 39,3 ток/с — это чистая скорость декодирования. Показатель TraceLab 33,9 ток/с — нормализованная скорость, включающая TTFT каждого шага в декодирование; в той же статье чистая медиана декодирования Codex составляет 57,1 ток/с. При корректном сравнении 39,3 не превышает показатель Codex — это примерно две трети от него.
Игры со знаменателем — «92% скорости RTX 4090» сравнивает 4-битный и 16-битный режимыПоказатель ноутбука 39,3 ток/с относится к сборке NVFP4; показатель RTX 4090 в 42,9 ток/с — к BF16. Это раскрыто в подписи к рис. 5, однако в тексте соотношение приводится без уточнения о точности.
Игры со знаменателем — «один GPU» скрывает требования к хостуУровень GLM-5.2 на 753B использует 512 ГиБ DDR5 на Xeon Platinum 8559C; «игровой настольный компьютер» с моделью на 284B оснащён 192 ГБ. Один GPU — точное утверждение. Но эти конфигурации не описывают одну машину по потребительской цене.
Несоответствие настроек — базовые решения ограничены 6 потоками CPUЭто раскрыто и обосновано: статья ограничивает арендованные двухсокетные серверы, имитируя периферийные хосты, и проверяет систему на двух реальных периферийных машинах с полным числом потоков. Однако KTransformers построен вокруг оптимизированного для AMX многопоточного выполнения экспертов на CPU, поэтому его столбец следует читать как «KTransformers на хосте периферийного класса», а не как предел его возможностей.
Противовес — арифметика чистаяКаждое соотношение в аннотации и разделе с результатами пересчитывается корректно: 1,81 / 1,87 / 2,10 / 2,25× для Qwen3.6, 1,92 / 1,84 / 1,52 / 1,65× для DeepSeek-V4-Flash, 2,04× для GLM-5.2. Нет завышенного округления или необъяснимых расхождений между рисунками и текстом.
Ключевые выводы
  • Статья арифметически точна — каждое опубликованное соотношение пересчитывается по собственным рисункам.
  • Пока ничего не воспроизведено независимо; 9 из 16 утверждений вынужденно являются самоотчётами, а не попыткой уклониться от проверки.
  • Самый существенный флаг: 39,3 ток/с превышает нормализованный показатель Codex в 33,9, но не его чистую медиану декодирования в 57,1.
  • Заголовки про «один GPU» негласно требуют 192–512 ГБ оперативной памяти хоста.
  • Базовый запуск KTransformers использует 6 потоков CPU — меньше, чем многопоточная конфигурация AMX, на которую он рассчитан.
Проверка реальности от Marktechpost · проверено 23 августа 2026 г.

Основные выводы

  • FreeToken распределяет промахи кэша MoE между загрузкой через PCIe и выполнением на CPU, используя измеренные значения пропускной способности, а не фиксированное правило выгрузки.
  • Выход экспертов остаётся побитово идентичным — без изменений маршрутизатора, замены экспертов и ослабления точности.
  • Пропускная способность декодирования в 1,5–2,3 раза выше, чем у llama.cpp, Ollama и KTransformers, а хвостовое TTFT составляет менее 44 с.
  • Модель на 35B работает со скоростью 39,3 ток/с на ноутбучном GPU с 8 ГБ памяти; GLM-5.2 на 753B — на одном GPU рабочей станции.
  • Apache-2.0, доступен на PyPI и в виде настольного приложения для Windows/Linux — развернуть можно уже сегодня.

Ознакомьтесь с СТАТЬЁЙ, РЕПОЗИТОРИЕМ GITHUB и ПРОЕКТОМ. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? Теперь вы можете присоединиться к нам и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости