Microsoft відкрила вихідний код TauGrid: Kubernetes-нативний стек для ШІ-навантажень на GPU
Команди платформи, які запускають ШІ на Kubernetes, рідко обмежуються чимось одним. Вони використовують систему постановки в чергу, розподілене середовище виконання, перевірки стану GPU-вузлів, інформаційні панелі та рівень скриптів для надсилання, який об’єднує все це. Інженерна команда Azure Kubernetes Service відкрила код TauGrid, зводячи цю роботу зі складання до одного встановлення Helm.
Чи можна його розгорнути? Так, TauGrid ліцензовано за MIT, а образи контейнерів і діаграми Helm опубліковано як загальнодоступні артефакти OCI у Microsoft Container Registry. Необхідні умови — кластер Kubernetes версії 1.30 або новішої з GPU-вузлами, kubectl і Helm версії 3.0 або новішої.
Що таке TauGrid
TauGrid — це платформа для самостійного розгортання робочих навантажень ШІ на Kubernetes. Вона поєднує п’ять компонентів, які команди платформи зазвичай інтегрують вручну: CLI tau, постановку робочих навантажень у чергу та допуск до виконання через Kueue, оркестрацію кластерів Ray через KubeRay, моніторинг стану GPU на рівні вузлів, а також спостережуваність кластерів і робочих навантажень.
Розподіл відповідальності є ключовим елементом дизайну. Команди платформи відповідають за робочі простори, черги, профілі обчислень, сховище, ідентифікацію та спостережуваність. Дослідники працюють із репозиторієм і CLI та надсилають робочі навантаження, не налаштовуючи Kubernetes безпосередньо. Кодова база написана переважно мовою Go.
Як завдання проходить через систему
Робоче навантаження описується у файлі tau.yaml. Опублікований Microsoft приклад навчання на GPU запускає завдання PyTorch на одному A100:
schema_version: 1
name: aks-gpu-quickstart
run:
entrypoint: train.py
workload_kind: rayjob
compute:
gpus: 1
workers: 1
cpus: 16
memory: 64Gi
runtime:
image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
pip:
- torch>=2.4.0Після виконання tau run TauGrid визначає політики платформи, формує Kubernetes Job або KubeRay RayJob і надсилає його через Kueue. Шість етапів, які документує Microsoft, — це надсилання, постановка в чергу, виконання, моніторинг, відновлення та фіксація результатів. Відновлення охоплює повторну спробу, продовження з контрольної точки та діагностику збоїв. Записи результатів містять метадані робочого навантаження, конфігурацію, журнали, метрики, контрольні точки та історію виконання, завдяки чому запуск можна відтворити й перевірити пізніше.
Коли кілька команд спільно використовують кластер, їхні завдання потрапляють до спільної ClusterQueue Kueue. Kueue допускає кожне з них до виконання на основі квоти та пріоритету, а Kubernetes розміщує його на справних GPU.
Інтерактивне пояснення
Обсяг встановлення
Встановлення виконується за допомогою діаграми Helm, яку безпосередньо отримують із MCR:
helm install taugrid \
oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid \
--version 0.4.2 \
--namespace tau-system \
--create-namespaceОфіційні образи постачаються в mcr.microsoft.com/aks/ai-runtime/ для Tau, TauGrid Portal і основного контролера tau. Microsoft рекомендує фіксувати версійні теги або незмінні дайджести замість latest. CLI встановлюється з GitHub Releases у Linux і macOS, а для Windows amd64 доступний інсталятор PowerShell; інсталятор перевіряє контрольну суму релізу й не змінює PATH.
Для всіх, хто оцінює це рішення за межами Azure, важливі дві операційні деталі. По-перше, TauGrid за замовчуванням не надсилає Microsoft жодних телеметричних даних, а віддалений експорт залишається вимкненим, якщо оператор не налаштує пункт призначення. По-друге, деякі інтеграції все ще специфічні для Azure, зокрема спостережуваність через Azure Data Explorer. Заявлена мета — підтримка хмарного та локального Kubernetes без залежності від Azure, і внески в цьому напрямі вітаються.
Ключові висновки
- Microsoft відкрила код TauGrid 28 серпня 2026 року за ліцензією MIT у репозиторії Azure/taugrid.
- Одне встановлення Helm об’єднує CLI
tau, постановку в чергу Kueue, оркестрацію KubeRay, моніторинг стану GPU та спостережуваність. - Вже зараз можна розгорнути на будь-якому кластері Kubernetes версії 1.30 або новішої з GPU-вузлами, kubectl і Helm версії 3.0 або новішої.
- Записи результатів містять конфігурацію, журнали, метрики та контрольні точки, тому запуски залишаються відтворюваними й придатними для аудиту.
- Телеметрія за замовчуванням не збирається, але спостережуваність через Azure Data Explorer наразі залишається специфічною для Azure.
Ознайомтеся з блогом інженерної команди AKS та Azure/taugrid на GitHub. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.