Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Microsoft публикува TauGrid с отворен код: Kubernetes-нативен стек за AI натоварвания с GPU

Платформените екипи, които изпълняват AI върху Kubernetes, рядко управляват само един компонент. Те използват система за поставяне на задачи в опашка, разпределена среда за изпълнение, проверки на състоянието на GPU възлите, табла и слой от скриптове за подаване, който свързва всичко това. Инженерният екип на Azure Kubernetes Service публикува TauGrid като проект с отворен код, който обединява тази конфигурация в една-единствена Helm инсталация.

Може ли да бъде внедрен? Да, TauGrid е лицензиран под MIT, а образите на контейнерите и Helm диаграмите са публикувани като публични OCI артефакти в Microsoft Container Registry. Предварителните изисквания са клъстер Kubernetes 1.30+ с GPU възли, kubectl и Helm 3.0 или по-нова версия.

Какво представлява TauGrid

TauGrid е самостоятелно хоствана платформа за изпълнение на AI натоварвания върху Kubernetes. Тя комбинира пет неща, които платформените екипи обикновено интегрират ръчно: CLI инструмента tau, поставяне на натоварванията в опашка и допускането им чрез Kueue, оркестрация на Ray клъстери чрез KubeRay, наблюдение на състоянието на GPU на ниво възел и наблюдение на клъстера и натоварванията.

Разпределението на отговорностите е основният замисъл. Платформените екипи управляват работните пространства, опашките, изчислителните профили, хранилището, идентичността и наблюдението. Изследователите работят от хранилище и чрез CLI инструмента и подават натоварвания, без да конфигурират Kubernetes директно. Кодът е написан предимно на Go.

Как една задача преминава през системата

Натоварването се описва във файл tau.yaml. Публикуваният от Microsoft пример за GPU обучение изпълнява задача на PyTorch върху един A100:

Копиране на кодаКопираноИзползвайте друг браузър
schema_version: 1
name: aks-gpu-quickstart
run:
  entrypoint: train.py
  workload_kind: rayjob
compute:
  gpus: 1
  workers: 1
  cpus: 16
  memory: 64Gi
runtime:
  image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
  pip:
    - torch>=2.4.0

При изпълнение на tau run TauGrid разрешава политиката на платформата, генерира Kubernetes Job или KubeRay RayJob и го подава чрез Kueue. Шестте етапа, описани от Microsoft, са подаване, поставяне в опашка, изпълнение, наблюдение, възстановяване и събиране на доказателства. Възстановяването обхваща повторен опит, продължаване от контролна точка и диагностика на повреди. Записите с доказателства съхраняват метаданни за натоварването, конфигурация, журнали, метрики, контролни точки и история на изпълнението, което прави изпълнението възпроизводимо и одитируемо по-късно.

Когато няколко екипа споделят един клъстер, задачите им попадат в споделена Kueue ClusterQueue. Kueue допуска всяка задача въз основа на квотата и приоритета, а Kubernetes я разпределя върху изправни GPU.

Интерактивно обяснение

Обхват на инсталацията

Инсталацията се извършва чрез Helm диаграма, изтеглена директно от MCR:

Копиране на кодаКопираноИзползвайте друг браузър
helm install taugrid \
  oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid \
  --version 0.4.2 \
  --namespace tau-system \
  --create-namespace

Собствените образи се публикуват в mcr.microsoft.com/aks/ai-runtime/ за Tau, TauGrid Portal и основния контролер tau. Microsoft препоръчва фиксиране на версиирани тагове или неизменяеми дайджести вместо latest. CLI инструментът се инсталира от GitHub Releases под Linux и macOS, като за Windows amd64 има инсталатор на PowerShell; инсталаторът проверява контролната сума на изданието и не променя PATH.

Два оперативни детайла са важни за всеки, който оценява решението извън Azure. Първо, по подразбиране TauGrid не изпраща телеметрия към Microsoft, а отдалеченият експорт остава изключен, освен ако операторът не конфигурира дестинация. Второ, някои интеграции все още са специфични за Azure, по-специално наблюдението чрез Azure Data Explorer. Заявеното намерение е да се поддържат облачни и локални Kubernetes инсталации без зависимост от Azure, като приносите в тази посока са добре дошли.

Основни изводи

  • Microsoft публикува TauGrid като проект с отворен код на 28 август 2026 г. под лиценза MIT в Azure/taugrid.
  • Една Helm инсталация обединява CLI инструмента tau, поставянето в опашка чрез Kueue, оркестрацията чрез KubeRay, наблюдението на състоянието на GPU и наблюдението на системата.
  • В момента може да бъде внедрен във всеки клъстер Kubernetes 1.30+ с GPU възли, kubectl и Helm 3.0+.
  • Записите с доказателства съхраняват конфигурация, журнали, метрики и контролни точки, така че изпълненията да остават възпроизводими и одитируеми.
  • По подразбиране няма телеметрия, но наблюдението чрез Azure Data Explorer засега остава специфично за Azure.

Вижте блога на инженерния екип на AKS и Azure/taugrid в GitHub. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хиляди членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини