Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

NVIDIA пуска Personal AI Router (PAIR): виртуален рутер за инференс с отворен код, който разпределя локалните AI заявки между възли с RTX, DGX Spark и Mac

Многоагентните работни процеси промениха облика на локалното инфериране. Главният агент разбива задачата на части и създава подагенти. Това, което изглеждаше като една потребителска заявка, се превръща в десетки независими извиквания към модела. Насочени към един локален енджин, тези извиквания се конкурират за едни и същи слотове за изпълнение. Опашката се увеличава, докато работна станция, лаптоп или DGX Spark в същата мрежа бездейства.

NVIDIA Personal AI Router (PAIR) е насочен точно към това ограничение. Обявен тази седмица, PAIR е виртуален рутер за инфериране. Той открива съвместими машини в домашна мрежа и разпределя независимите заявки за инфериране между тях. Това не е нов енджин за инфериране. Ollama или LM Studio все още изпълнява модела на избрания от PAIR възел.

Може ли да бъде внедрен? Да. PAIR се предлага днес като публична бета версия (v0.1.1) с подписани инсталатори за Windows, macOS и Linux, а пълният изходен код е в GitHub под лиценз Apache 2.0. Той работи изцяло в локалната мрежа, като интернет е необходим единствено за изтегляне на модели.

Без нов API

Най-важното дизайнерско решение е, че PAIR не въвежда клъстерен API. Той проксира съвместимите с Ollama и LM Studio интерфейси, които агентите вече използват, като поема стандартния порт, използван от всеки енджин. Ако даден инструмент слуша на друг адрес, прокси портът може да бъде конфигуриран в настройките на енджина на PAIR. Хранилището също така предоставя съвместими с OpenAI прокси крайни точки.

Следствието е, че съществуващите инструменти за агенти не се нуждаят от промени. Агентът решава каква работа да заяви. PAIR решава къде да бъде изпълнена.

Откриване, сдвояване и пренос

PAIR използва mDNS за автоматично откриване на близки системи. Когато откриването е неуспешно, възел може да бъде добавен чрез IP адрес. Доверието се установява чрез шестцифрен PIN код, показан на канещата машина и въведен на поканената. Цялата комуникация между възлите е блокирана, докато сдвояването не приключи. След това трафикът между сдвоените възли е защитен с mTLS чрез генерирани сертификати.

Всеки възел работи с Ollama или LM Studio. PAIR може да инсталира енджин и да стартира изтеглянето на модели на сдвоените системи, като премахва по-голямата част от работата по настройването между машините.

Как планировчикът избира възел

Възелът става допустим за дадена заявка само когато необходимият енджин е активиран и точният заявен модел е наличен. Не е необходимо моделите да са идентични в целия клъстер; различните системи могат да съхраняват различни модели, а PAIR маршрутизира според местоположението на модела. Зареждането на един и същ таг на повече възли просто разширява набора от допустими възли.

За всяка заявка планировчикът оценява пет сигнала. Онлайн и готов ли е възелът. Активиран ли е поддържан енджин. Наличен ли е точният модел. Какво е текущото натоварване със задачи на възела и енджина. Какво е текущото използване на графичния процесор.

Това е едновременност на ниво работно натоварване и границата е ясно определена. PAIR присвоява всяка заявка на един допустим възел, където тя остава през целия си жизнен цикъл. Той не обединява VRAM, не слива графични процесори в един по-голям ускорител и не разделя една заявка между машини.

Данните от демонстрацията и техните уговорки

Демонстрацията на NVIDIA комбинира PAIR с Hermes Desktop, който създава работно натоварване с пет подагента върху синтетична домашна входяща поща. Ollama изпълнява Qwen 3.6 35B A3B на всеки избран възел.

На един лаптоп RTX Spark работното натоварване отнема средно 18 минути. В трисистемен PAIR клъстер, състоящ се от лаптоп RTX Spark, DGX Spark и RTX 5090, средното време е 8 минути и 48 секунди.

Поддържан хардуер и изисквания

PAIR поддържа графични процесори GeForce RTX 20 Series и по-нови, работни станции RTX PRO с графични процесори от поколението Turing нататък, DGX Spark и силиций Apple M4 или по-нов. Възли с Windows, Linux и macOS могат да се сдвояват помежду си, на x64 и arm64, въпреки че Windows на ARM е експериментален. Валидираните конфигурации посочват 8 GB RAM или повече и препоръчителни 20 GB дисково пространство. Други дистрибуции на Linux се компилират от изходния код.

Основни изводи

  • PAIR насочва всяка независима заявка към един възел; той никога не обединява VRAM и не разделя модела.
  • Той проксира съществуващите крайни точки на Ollama и LM Studio, така че инструментите за агенти не се нуждаят от промени.
  • Допустимостта зависи от готовността на възела, активирания енджин, наличието на точния модел, натоварването със задачи и използването на графичния процесор.
  • Демонстрацията на NVIDIA с пет подагента премина неофициално от 18 минути на един лаптоп до 8:48 на три устройства.
  • Apache 2.0 и бета версия: днес е налична една политика за планиране, която не отчита VRAM, класа на графичния процесор и това дали моделът е зареден в паметта.

Разгледайте продуктовата страница на NVIDIA PAIR, техническия блог на NVIDIA, хранилището в GitHub, ръководството и ЧЗВ. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини