NVIDIA випускає Personal AI Router (PAIR): віртуальний маршрутизатор інференсу з відкритим кодом, що розподіляє локальні запити до ШІ між вузлами RTX, DGX Spark і Mac
Мультиагентні робочі процеси змінили підхід до локального інференсу. Головний агент розкладає завдання на складові та запускає субагентів. Те, що виглядало як один запит користувача, перетворюється на десятки незалежних викликів моделі. Якщо спрямувати їх до одного локального рушія, ці виклики конкурують за ті самі слоти виконання. Черга зростає, тоді як робоча станція, ноутбук або DGX Spark у тій самій мережі простоює.
NVIDIA Personal AI Router (PAIR) призначений саме для усунення цього вузького місця. Представлений цього тижня PAIR є віртуальним маршрутизатором інференсу. Він виявляє сумісні комп’ютери в домашній мережі та розподіляє незалежні запити на інференс між ними. Це не новий рушій інференсу. Ollama або LM Studio як і раніше запускає модель на тому вузлі, який обирає PAIR.
Чи готовий він до розгортання? Так. PAIR уже доступний як публічна бета-версія (v0.1.1) із підписаними інсталяторами для Windows, macOS і Linux, а повний вихідний код розміщено на GitHub за ліцензією Apache 2.0. Він працює повністю в локальній мережі, а інтернет потрібен лише для завантаження моделей.
Без нового API
Найважливіше проєктне рішення полягає в тому, що PAIR не запроваджує кластерного API. Він проксує сумісні з Ollama та LM Studio інтерфейси, якими агенти вже вміють користуватися, перебираючи на себе стандартний порт, який використовує кожен рушій. Якщо певний інструмент прослуховує інший порт, порт проксі можна налаштувати в параметрах рушія PAIR. Репозиторій також надає кінцеві точки проксі, сумісні з OpenAI.
Наслідок: наявні інструменти для запуску агентів не потребують жодних змін. Агент визначає, яку роботу потрібно виконати. PAIR визначає, де її буде виконано.
Виявлення, сполучення та передавання даних
PAIR використовує mDNS для автоматичного пошуку систем поблизу. Якщо виявлення не працює, вузол можна додати за IP-адресою. Довіра встановлюється за допомогою шестизначного PIN-коду, який відображається на комп’ютері, що надсилає запрошення, і вводиться на запрошеному комп’ютері. Увесь обмін даними між вузлами блокується, доки це сполучення не буде завершено. Після сполучення трафік між вузлами захищається за допомогою mTLS із використанням згенерованих сертифікатів.
На кожному вузлі працює Ollama або LM Studio. PAIR може встановити рушій і розпочати завантаження моделей на сполучених системах, усуваючи більшість труднощів із налаштуванням між комп’ютерами.
Як планувальник обирає вузол
Вузол стає доступним для запиту лише тоді, коли потрібний рушій увімкнено, а точна запитувана модель присутня. Моделі не обов’язково мають бути однаковими в усьому кластері: різні системи можуть містити різні моделі, а PAIR спрямовує запити відповідно до розташування моделі. Завантаження одного й того самого тегу на більшу кількість вузлів просто розширює пул доступних вузлів.
Для кожного запиту планувальник оцінює п’ять сигналів. Чи перебуває вузол у мережі та чи готовий він до роботи. Чи ввімкнено підтримуваний рушій. Чи присутня точна модель. Яке поточне навантаження на завдання вузла та рушія. Яке поточне використання GPU.
Це паралельність на рівні робочих навантажень, і межа тут чітко визначена. PAIR призначає кожен запит одному доступному вузлу, де він залишається протягом усього свого життєвого циклу. Він не об’єднує VRAM, не поєднує GPU в один потужніший прискорювач і не розподіляє один запит між кількома комп’ютерами.
Цифри демонстрації та застереження щодо них
У демонстрації NVIDIA поєднує PAIR із Hermes Desktop, який створює робоче навантаження з п’яти субагентів на синтетичній домашній скриньці вхідних повідомлень. Ollama запускає Qwen 3.6 35B A3B на кожному вибраному вузлі.
На одному ноутбуці RTX Spark виконання робочого навантаження тривало в середньому 18 хвилин. На кластері PAIR із трьох пристроїв — ноутбука RTX Spark, DGX Spark і RTX 5090 — середній час становив 8 хвилин 48 секунд.
Підтримуване обладнання та вимоги
PAIR підтримує графічні процесори GeForce RTX 20 Series і новіші, робочі станції RTX PRO на базі архітектури Turing і новіших, DGX Spark, а також чипи Apple M4 і новіші. Вузли на Windows, Linux і macOS можна об’єднувати між собою на платформах x64 та arm64, хоча Windows на ARM є експериментальною. У перевірених конфігураціях указано 8 ГБ оперативної пам’яті або більше та рекомендовано 20 ГБ дискового простору. Інші дистрибутиви Linux збираються з вихідного коду.
Головні висновки
- PAIR спрямовує кожен незалежний запит на один вузол; він ніколи не об’єднує VRAM і не розподіляє модель між вузлами.
- Він проксує наявні кінцеві точки Ollama та LM Studio, тому інструменти для запуску агентів не потребують змін.
- Доступність визначається готовністю вузла, увімкненим рушієм, наявністю точної моделі, навантаженням завдань і використанням GPU.
- У неофіційній демонстрації NVIDIA із п’ятьма субагентами час скоротився з 18 хвилин на одному ноутбуці до 8:48 на трьох пристроях.
- Apache 2.0 і бета-версія: наразі доступна одна політика планування, яка не враховує обсяг VRAM, клас GPU та прогрітість моделі.
Перегляньте сторінку продукту NVIDIA PAIR, технічний блог NVIDIA, репозиторій GitHub, посібник і розділ поширених запитань. Також підписуйтеся на нас у Твіттері і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.