Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Nous Research додала налаштування локальних моделей одним кліком у Hermes Desktop

Складність локального запуску моделі з відкритими вагами ніколи не полягала в самій моделі. Уся проблема була в тому, що потрібно було зробити до цього: вивчити характеристики VRAM, здогадатися, яке квантування підійде, налаштувати довжину контексту й кількість шарів на GPU, а потім під час завантаження з’ясувати, що файл на три гігабайти завеликий. Nous Research звела цю послідовність до одного кліку в Hermes Desktop. Новий простий процес налаштування зчитує характеристики вашого обладнання, обирає модель, яка на ньому запускається, завантажує ваги й налаштовує для вас середовище виконання.

Чи можна це розгорнути? Так. Hermes Desktop — це безкоштовна збірка Hermes Agent із відкритим кодом, ліцензована за MIT, яка працює на macOS 12+, Windows 10/11 і будь-якому дистрибутиві Linux та взагалі не потребує облікового запису для локальних моделей.

Що саме було випущено

Анонс вузький і конкретний: Hermes Desktop тепер налаштовує локальні моделі одним кліком, зчитуючи характеристики вашого обладнання, обираючи модель, завантажуючи її та налаштовуючи середовище виконання. Цей процес автоматично з’являється під час першого запуску, а згодом доступний у розділі Settings → Providers → Local Models.

Під капотом Hermes самостійно керує рушієм виконання. Згідно з документацією щодо локальних моделей, він завантажує офіційну збірку llama.cpp, підібрану для вашого обладнання, обсягом у кілька сотень мегабайт, перевіряє її та підтримує в актуальному стані. Підтримувані бекенди охоплюють CUDA, Metal, Vulkan, HIP і CPU. Закріплений тег релізу міститься в блоці local_runtime файлу config.yaml, який десктопний інтерфейс записує за вас, а користувачі без графічного інтерфейсу можуть задати вручну.

Як Hermes оцінює моделі відповідно до вашого комп’ютера

Кожна модель із каталогу перевіряється на сумісність із вашим конкретним комп’ютером ще до того, як ви щось завантажите. Кожен рядок містить оцінку відповідності пам’яті: зелений означає, що модель повністю працює в пам’яті GPU, жовтий — що частина даних переміщується до системної RAM і робота буде повільнішою, червоний — що модель завелика для цього комп’ютера. У рядках також указано початкове й максимальне вікно контексту, а також розмір завантаження збірки, обраної для вашого обладнання.

Вибір квантування ґрунтується на одному правилі: Hermes обирає найякіснішу збірку, яка повністю працює на вашому GPU, а комп’ютери з меншим обсягом пам’яті отримують компактнішу збірку тієї самої моделі. Існує жорсткий мінімум у 4 біти. Нижче цього порога Nous вважає втрату якості надто значною, тому комп’ютер, який не може запустити 4-бітну збірку без переміщення даних у RAM, просто не може запустити цю модель. Моделі, які не відповідають вимогам, залишаються видимими із зазначеною причиною, тож ви можете точно побачити, що дасть більший обсяг VRAM.

Правила роботи з пам’яттю, завдяки яким усе працює

Локальний запуск залежить від розміщення даних у пам’яті, а Hermes не надає для цього жодних параметрів. Моделі починають роботу з вікном контексту, яке повністю вміщується у ваш GPU, і поступово збільшують його до власного максимального розміру, коли розмові потрібно більше місця. Для кожної рекомендованої моделі гарантовано вікно щонайменше 64K.

Порядок переміщення даних — цікаве конструктивне рішення. Коли модель перевищує обсяг пам’яті GPU, Hermes розміщує надлишок у системній RAM у порядку, який найменше шкодить продуктивності: спочатку ваги експертів, але ніколи кеш уваги. Так система жертвує пропускною здатністю, щоб гарантувати розмір контексту. Стиснення розмови вмикається лише після того, як модель досягає максимального вікна, тож збільшення контексту завжди передує узагальненню. Неактивні моделі вивантажуються через 15 хвилин і завантажуються знову після наступного повідомлення.

Ключові висновки

  • Налаштування одним кліком зчитує характеристики вашого обладнання, обирає відповідну модель, завантажує її та підключає середовище виконання.
  • Hermes керує вбудованою збіркою llama.cpp; розмір контексту, кількість шарів GPU та квантування ніколи не відкриваються користувачеві.
  • Кожна модель із каталогу перевіряється на відповідність вашому комп’ютеру до завантаження: зелена, жовта або червона.
  • Для рекомендованих моделей гарантовано вікно контексту щонайменше 64K, захищене завдяки впорядкованому переміщенню даних у RAM.

Перегляньте документацію щодо локальних моделей, репозиторій GitHub і сторінку завантаження десктопної версії. Також не соромтеся стежити за нами у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини