Microsoft публикува TauGrid с отворен код: Kubernetes-нативен стек за AI натоварвания с GPU
Платформените екипи, които изпълняват AI върху Kubernetes, рядко управляват само един компонент. Те използват система за поставяне на задачи в опашка, разпределена среда за изпълнение, проверки на състоянието на GPU възлите, табла и слой от скриптове за подаване, който свързва всичко това. Инженерният екип на Azure Kubernetes Service публикува TauGrid като проект с отворен код, който обединява тази конфигурация в една-единствена Helm инсталация.
Може ли да бъде внедрен? Да, TauGrid е лицензиран под MIT, а образите на контейнерите и Helm диаграмите са публикувани като публични OCI артефакти в Microsoft Container Registry. Предварителните изисквания са клъстер Kubernetes 1.30+ с GPU възли, kubectl и Helm 3.0 или по-нова версия.
Какво представлява TauGrid
TauGrid е самостоятелно хоствана платформа за изпълнение на AI натоварвания върху Kubernetes. Тя комбинира пет неща, които платформените екипи обикновено интегрират ръчно: CLI инструмента tau, поставяне на натоварванията в опашка и допускането им чрез Kueue, оркестрация на Ray клъстери чрез KubeRay, наблюдение на състоянието на GPU на ниво възел и наблюдение на клъстера и натоварванията.
Разпределението на отговорностите е основният замисъл. Платформените екипи управляват работните пространства, опашките, изчислителните профили, хранилището, идентичността и наблюдението. Изследователите работят от хранилище и чрез CLI инструмента и подават натоварвания, без да конфигурират Kubernetes директно. Кодът е написан предимно на Go.
Как една задача преминава през системата
Натоварването се описва във файл tau.yaml. Публикуваният от Microsoft пример за GPU обучение изпълнява задача на PyTorch върху един A100:
schema_version: 1
name: aks-gpu-quickstart
run:
entrypoint: train.py
workload_kind: rayjob
compute:
gpus: 1
workers: 1
cpus: 16
memory: 64Gi
runtime:
image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
pip:
- torch>=2.4.0При изпълнение на tau run TauGrid разрешава политиката на платформата, генерира Kubernetes Job или KubeRay RayJob и го подава чрез Kueue. Шестте етапа, описани от Microsoft, са подаване, поставяне в опашка, изпълнение, наблюдение, възстановяване и събиране на доказателства. Възстановяването обхваща повторен опит, продължаване от контролна точка и диагностика на повреди. Записите с доказателства съхраняват метаданни за натоварването, конфигурация, журнали, метрики, контролни точки и история на изпълнението, което прави изпълнението възпроизводимо и одитируемо по-късно.
Когато няколко екипа споделят един клъстер, задачите им попадат в споделена Kueue ClusterQueue. Kueue допуска всяка задача въз основа на квотата и приоритета, а Kubernetes я разпределя върху изправни GPU.
Интерактивно обяснение
Обхват на инсталацията
Инсталацията се извършва чрез Helm диаграма, изтеглена директно от MCR:
helm install taugrid \
oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid \
--version 0.4.2 \
--namespace tau-system \
--create-namespaceСобствените образи се публикуват в mcr.microsoft.com/aks/ai-runtime/ за Tau, TauGrid Portal и основния контролер tau. Microsoft препоръчва фиксиране на версиирани тагове или неизменяеми дайджести вместо latest. CLI инструментът се инсталира от GitHub Releases под Linux и macOS, като за Windows amd64 има инсталатор на PowerShell; инсталаторът проверява контролната сума на изданието и не променя PATH.
Два оперативни детайла са важни за всеки, който оценява решението извън Azure. Първо, по подразбиране TauGrid не изпраща телеметрия към Microsoft, а отдалеченият експорт остава изключен, освен ако операторът не конфигурира дестинация. Второ, някои интеграции все още са специфични за Azure, по-специално наблюдението чрез Azure Data Explorer. Заявеното намерение е да се поддържат облачни и локални Kubernetes инсталации без зависимост от Azure, като приносите в тази посока са добре дошли.
Основни изводи
- Microsoft публикува TauGrid като проект с отворен код на 28 август 2026 г. под лиценза MIT в Azure/taugrid.
- Една Helm инсталация обединява CLI инструмента
tau, поставянето в опашка чрез Kueue, оркестрацията чрез KubeRay, наблюдението на състоянието на GPU и наблюдението на системата. - В момента може да бъде внедрен във всеки клъстер Kubernetes 1.30+ с GPU възли, kubectl и Helm 3.0+.
- Записите с доказателства съхраняват конфигурация, журнали, метрики и контролни точки, така че изпълненията да остават възпроизводими и одитируеми.
- По подразбиране няма телеметрия, но наблюдението чрез Azure Data Explorer засега остава специфично за Azure.
Вижте блога на инженерния екип на AKS и Azure/taugrid в GitHub. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хиляди членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.