Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Nous Research добавя настройка на локални модели с едно кликване в Hermes Desktop

Трудната част при локалното стартиране на модел с отворени тегла никога не е била самият модел. Тя беше всичко преди това: да прочетете спецификациите на VRAM, да прецените коя квантизация ще пасне, да зададете дължината на контекста и броя GPU слоеве, а след това при зареждането да разберете, че файлът е с три гигабайта прекалено голям. Nous Research е свела тази последователност до едно кликване в Hermes Desktop. Новият лесен процес за настройка разчита хардуера ви, избира модел, който ще работи на него, изтегля теглата и конфигурира средата за инференция вместо вас.

Може ли да бъде внедрен? Да. Hermes Desktop е безплатната версия с лиценз MIT на агента с отворен код Hermes Agent, работи на macOS 12+, Windows 10/11 и всяка Linux дистрибуция и изобщо не изисква акаунт за локални модели.

Какво всъщност беше пуснато

Съобщението е конкретно и се фокусира върху една функционалност: Hermes Desktop вече настройва локални модели с едно кликване, като разчита хардуера ви, избира модел, изтегля го и конфигурира средата за изпълнение. Процесът се появява автоматично при първото стартиране и по-късно е достъпен от Settings → Providers → Local Models.

В основата си Hermes сам управлява инференционния енджин. Според документацията за локалните модели той изтегля официална версия на llama.cpp, съобразена с хардуера ви и с размер от няколкостотин мегабайта, проверява я и я поддържа актуална. Поддържаните бекендове включват CUDA, Metal, Vulkan, HIP и CPU. Фиксираният таг на версията се намира в блока local_runtime на config.yaml, който настолният интерфейс създава вместо вас, а потребителите на headless системи могат да го зададат ръчно.

Как Hermes съобразява моделите с машината ви

Всеки модел от каталога се оценява спрямо конкретната ви машина, преди да изтеглите каквото и да е. Всеки ред съдържа оценка за съвместимост с паметта: зелено означава, че моделът работи изцяло в GPU паметта, кехлибарено — че се прехвърля в системната RAM памет и е по-бавен, а червено — че е прекалено голям за тази машина. Редовете показват също началния и максималния размер на контекстния прозорец, както и размера за изтегляне на версията, избрана за вашия хардуер.

Изборът на квантизация следва едно правило: Hermes избира версията с най-високо качество, която работи изцяло на GPU, а машините с по-малко памет получават по-компактна версия на същия модел. Има твърд минимум от 4 бита. Под тази граница Nous счита загубата на качество за прекалено голяма, така че машина, която не може да стартира 4-битовата версия без прехвърляне в системната памет, просто не може да стартира този модел. Моделите, които не са съвместими, остават видими с посочена причина, за да можете да видите точно какво бихте спечелили от повече VRAM.

Правилата за паметта, които правят всичко това възможно

Локалният инференс зависи изцяло от разпределението на паметта, а Hermes не показва никакви настройки за него. Моделите започват с контекстен прозорец, който се побира изцяло в GPU паметта ви, и се разширяват към естествения си максимум, когато разговорът има нужда от повече пространство. На всеки препоръчан модел е гарантиран прозорец от поне 64K.

Интересният дизайнерски избор е редът на прехвърляне. Когато моделът надхвърли паметта на GPU, Hermes поставя излишъка в системната RAM памет по реда, който нанася най-малко вреда: първо теглата на експертите и никога кеша на вниманието. Така се жертва пропускателната способност, за да се защити гаранцията за контекста. Компресирането на разговора се активира едва когато моделът достигне максималния си прозорец, така че разрастването винаги предхожда обобщаването. Неактивните модели се разтоварват след 15 минути и се зареждат отново при следващото съобщение.

Основни изводи

  • Настройката с едно кликване разчита хардуера ви, избира подходящ модел, изтегля го и конфигурира средата за изпълнение.
  • Hermes управлява включена версия на llama.cpp; размерът на контекста, GPU слоевете и квантизацията никога не се показват.
  • Всеки модел от каталога се проверява спрямо машината ви преди изтегляне: зелено, кехлибарено или червено.
  • На препоръчаните модели е гарантиран контекстен прозорец от поне 64K, защитен чрез подредено прехвърляне в RAM.

Разгледайте документацията за локалните модели, хранилището в GitHub и страницата за изтегляне на настолното приложение. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово издание ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини