NVIDIA выпускает Personal AI Router (PAIR): виртуальный маршрутизатор инференса с открытым исходным кодом, распределяющий локальные запросы к ИИ между узлами RTX, DGX Spark и Mac
Мультиагентные рабочие процессы изменили подход к локальному выводу. Главный агент разбивает задачу на части и запускает субагентов. То, что выглядело как один запрос пользователя, превращается в десятки независимых вызовов модели. Направленные на один локальный движок, эти вызовы конкурируют за одни и те же слоты выполнения. Очередь растёт, пока рабочая станция, ноутбук или DGX Spark в той же сети простаивает.
NVIDIA Personal AI Router (PAIR) предназначен именно для устранения этого узкого места. Представленный на этой неделе PAIR представляет собой виртуальный маршрутизатор вывода. Он обнаруживает совместимые машины в домашней сети и распределяет независимые запросы на вывод между ними. Это не новый движок вывода. Ollama или LM Studio по-прежнему выполняет модель на том узле, который выбирает PAIR.
Можно ли его развернуть? Да. Сегодня PAIR доступен в виде публичной бета-версии (v0.1.1) с подписанными установщиками для Windows, macOS и Linux, а полный исходный код опубликован на GitHub по лицензии Apache 2.0. Он полностью работает в локальной сети, а интернет нужен только для загрузки моделей.
Без нового API
Наиболее важное проектное решение заключается в том, что PAIR не вводит кластерный API. Он проксирует совместимые с Ollama и LM Studio интерфейсы, с которыми агенты уже умеют работать, занимая порт по умолчанию, используемый каждым движком. Если исполняющая система прослушивает другой порт, порт прокси можно настроить в параметрах движка PAIR. Репозиторий также предоставляет совместимые с OpenAI конечные точки прокси.
Следствие: существующие исполняющие системы агентов не требуют изменений. Агент решает, какую работу запросить. PAIR решает, где её выполнить.
Обнаружение, сопряжение и передача данных
PAIR автоматически использует mDNS для поиска систем поблизости. Если обнаружение не работает, узел можно добавить по IP-адресу. Доверие устанавливается с помощью шестизначного PIN-кода, отображаемого на приглашающей машине и вводимого на приглашённой. Перед завершением сопряжения вся связь между узлами блокируется. После сопряжения трафик между узлами защищается с помощью mTLS и сгенерированных сертификатов.
На каждом узле работает Ollama или LM Studio. PAIR может установить движок и начать загрузку моделей на сопряжённых системах, устраняя большую часть работы по настройке между машинами.
Как планировщик выбирает узел
Узел становится доступным для запроса только тогда, когда необходимый движок включён и на нём присутствует точно запрошенная модель. Модели не обязаны быть одинаковыми во всём кластере: разные системы могут хранить разные модели, а PAIR распределяет запросы в зависимости от расположения модели. Загрузка одного и того же тега на большем количестве узлов просто расширяет пул доступных узлов.
Для каждого запроса планировщик учитывает пять сигналов. Находится ли узел в сети и готов ли он к работе. Включён ли поддерживаемый движок. Присутствует ли точная модель. Какова текущая нагрузка на задания узла и движка. Какова текущая загрузка GPU.
Это параллелизм на уровне рабочих нагрузок, и его границы чётко определены. PAIR назначает каждый запрос одному доступному узлу, где он остаётся на протяжении всего времени выполнения. Он не объединяет видеопамять, не объединяет GPU в один более крупный ускоритель и не распределяет один запрос между несколькими машинами.
Цифры демонстрации и их оговорки
В демонстрации NVIDIA PAIR используется вместе с Hermes Desktop, который создаёт рабочую нагрузку из пяти субагентов на основе синтетического домашнего почтового ящика. Ollama выполняет Qwen 3.6 35B A3B на каждом выбранном узле.
На одном ноутбуке RTX Spark выполнение рабочей нагрузки занимало в среднем 18 минут. В кластере PAIR из трёх устройств — ноутбука RTX Spark, DGX Spark и RTX 5090 — среднее время составило 8 минут 48 секунд.
Поддерживаемое оборудование и требования
PAIR поддерживает графические процессоры GeForce RTX 20-й серии и новее, рабочие станции RTX PRO на базе архитектуры Turing и более новых, DGX Spark, а также чипы Apple M4 и новее. Узлы под управлением Windows, Linux и macOS можно объединять друг с другом на архитектурах x64 и arm64, хотя Windows на ARM является экспериментальной. В проверенных конфигурациях указано 8 ГБ оперативной памяти или больше, а рекомендуемый объём диска составляет 20 ГБ. Другие дистрибутивы Linux собираются из исходного кода.
Основные выводы
- PAIR направляет каждый независимый запрос на один узел; он никогда не объединяет видеопамять и не распределяет модель по узлам.
- Он проксирует существующие конечные точки Ollama и LM Studio, поэтому исполняющие системы агентов не требуют изменений.
- Доступность узла зависит от его готовности, включённого движка, наличия точной модели, нагрузки на задания и загрузки GPU.
- В неофициальной демонстрации NVIDIA с пятью субагентами время выполнения сократилось с 18 минут на одном ноутбуке до 8:48 на трёх устройствах.
- Apache 2.0 и бета-версия: сегодня используется одна политика планирования, не учитывающая объём видеопамяти, класс GPU и прогретость модели.
Посетите страницу продукта NVIDIA PAIR, технический блог NVIDIA, репозиторий GitHub, практическое руководство и раздел часто задаваемых вопросов. Также вы можете подписаться на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.