Nous Research добавила настройку локальных моделей в один клик в Hermes Desktop
Сложность локального запуска модели с открытыми весами никогда не заключалась в самой модели. Сложность была во всём, что происходило до этого: нужно было изучить характеристики VRAM, угадать, какая квантизация подойдёт, настроить длину контекста и количество слоёв на GPU, а затем при загрузке обнаружить, что файл на три гигабайта слишком велик. Nous Research объединила эту последовательность действий в один клик внутри Hermes Desktop. Новый простой процесс настройки определяет ваше оборудование, выбирает подходящую модель, загружает веса и настраивает среду выполнения инференса.
Можно ли это развернуть? Да. Hermes Desktop — бесплатная сборка Hermes Agent с открытым исходным кодом и лицензией MIT, работающая на macOS 12+, Windows 10/11 и любом дистрибутиве Linux; для локальных моделей учётная запись не требуется.
Что именно вышло
Анонс сформулирован узко и конкретно: теперь Hermes Desktop настраивает локальные модели одним кликом — определяет ваше оборудование, выбирает модель, загружает её и настраивает среду выполнения. Этот процесс автоматически появляется при первом запуске, а позднее его можно открыть в разделе Настройки → Провайдеры → Локальные модели.
В основе Hermes самостоятельно управляет движком инференса. Согласно документации по локальным моделям, он загружает официальную сборку llama.cpp, соответствующую вашему оборудованию, — это несколько сотен мегабайт, — проверяет её и поддерживает в актуальном состоянии. Поддерживаются CUDA, Metal, Vulkan, HIP и CPU. Зафиксированный тег релиза находится в блоке local_runtime файла config.yaml, который десктопный интерфейс создаёт за вас, а пользователи без графического интерфейса могут задать вручную.
Как Hermes оценивает модели с учётом вашего компьютера
Перед загрузкой каждая модель из каталога проверяется на совместимость с конкретно вашим компьютером. Для каждой строки отображается оценка соответствия объёму памяти: зелёный означает, что модель полностью работает в памяти GPU, янтарный — что часть данных размещается в системной оперативной памяти и работа будет медленнее, красный — что модель слишком велика для этого компьютера. В строках также указаны начальное и максимальное окна контекста, а также размер сборки, выбранной для вашего оборудования.
Выбор квантизации следует одному правилу: Hermes выбирает сборку с наилучшим качеством, которая полностью работает на вашем GPU, а компьютеры с меньшим объёмом памяти получают более компактную сборку той же модели. Нижний предел установлен на уровне 4 бит. Ниже этого значения Nous считает потерю качества слишком существенной, поэтому компьютер, который не может запустить 4-битную сборку без использования дополнительной памяти, не сможет запустить и эту модель. Модели, которые не подходят, остаются видимыми с указанием причины, чтобы вы могли точно понять, что даст вам больший объём VRAM.
Правила работы с памятью, на которых всё держится
Локальный инференс зависит от размещения данных в памяти, а Hermes не предоставляет для этого никаких настроек. Модели запускаются с окном контекста, которое полностью помещается в память GPU, и постепенно увеличивают его до собственного максимального значения по мере необходимости в рамках диалога. Для каждой рекомендуемой модели гарантировано окно размером не менее 64K.
Интереснее всего устроен порядок выгрузки. Когда модель превышает объём памяти GPU, Hermes размещает избыточные данные в системной оперативной памяти в порядке, который наносит наименьший ущерб: сначала веса экспертов и никогда — кэш внимания. Это снижает пропускную способность, но позволяет сохранить гарантированный контекст. Сжатие диалога включается только после достижения моделью максимального окна, поэтому сначала всегда происходит расширение контекста и лишь затем — суммирование. Неактивные модели выгружаются через 15 минут и загружаются заново при следующем сообщении.
Ключевые выводы
- Настройка в один клик определяет ваше оборудование, выбирает подходящую модель, загружает её и подключает среду выполнения.
- Hermes управляет встроенной сборкой llama.cpp; размер контекста, количество слоёв на GPU и квантизация никогда не отображаются пользователю.
- Каждая модель из каталога проверяется на совместимость с вашим компьютером до загрузки: зелёная, янтарная или красная.
- Для рекомендуемых моделей гарантируется окно контекста размером не менее 64K благодаря упорядоченной выгрузке в оперативную память.
Ознакомьтесь с документацией по локальным моделям, репозиторием на GitHub и страницей загрузки десктопной версии. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.