Microsoft открыла исходный код TauGrid: Kubernetes-нативный стек для ИИ-нагрузок на GPU
Команды платформ, запускающие ИИ на Kubernetes, редко ограничиваются чем-то одним. Они используют систему постановки в очередь, распределённую среду выполнения, проверки состояния GPU-узлов, панели мониторинга и слой скриптов отправки, объединяющий всё это. Инженерная команда Azure Kubernetes Service открыла исходный код TauGrid, объединив всю эту сборку в одну установку Helm.
Можно ли его развернуть? Да, TauGrid распространяется по лицензии MIT, а образы контейнеров и чарты Helm опубликованы как общедоступные артефакты OCI в реестре контейнеров Microsoft. Необходимые условия — кластер Kubernetes версии 1.30 или выше с GPU-узлами, kubectl и Helm версии 3.0 или новее.
Что такое TauGrid
TauGrid — это самостоятельно размещаемая платформа для запуска ИИ-нагрузок в Kubernetes. Она объединяет пять компонентов, которые команды платформ обычно интегрируют вручную: CLI tau, постановку нагрузок в очередь и допуск через Kueue, оркестрацию кластеров Ray через KubeRay, мониторинг состояния GPU на уровне узлов, а также наблюдаемость кластера и нагрузок.
Разделение ответственности — ключевой элемент дизайна. Команды платформ управляют рабочими пространствами, очередями, профилями вычислительных ресурсов, хранилищем, идентификацией и наблюдаемостью. Исследователи работают из репозитория и через CLI, отправляя нагрузки без непосредственной настройки Kubernetes. Кодовая база написана преимущественно на Go.
Как задание проходит через систему
Описание нагрузки содержится в файле tau.yaml. Опубликованный Microsoft пример обучения на GPU запускает задание PyTorch на одном A100:
schema_version: 1
name: aks-gpu-quickstart
run:
entrypoint: train.py
workload_kind: rayjob
compute:
gpus: 1
workers: 1
cpus: 16
memory: 64Gi
runtime:
image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
pip:
- torch>=2.4.0При выполнении tau run TauGrid применяет политики платформы, создаёт Kubernetes Job или KubeRay RayJob и отправляет его через Kueue. Шесть этапов, описанных Microsoft, — это отправка, постановка в очередь, выполнение, мониторинг, восстановление и фиксация результатов. Восстановление включает повторную попытку, продолжение работы с контрольной точки и диагностику сбоев. Записи результатов содержат метаданные нагрузки, конфигурацию, журналы, метрики, контрольные точки и историю выполнения, благодаря чему запуск впоследствии можно воспроизвести и проверить.
Когда несколько команд используют общий кластер, их задания попадают в общую ClusterQueue Kueue. Kueue допускает каждое из них к выполнению с учётом квоты и приоритета, а Kubernetes размещает его на исправных GPU.
Интерактивное объяснение
Состав установки
Установка выполняется с помощью чарта Helm, загружаемого непосредственно из MCR:
helm install taugrid \
oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid \
--version 0.4.2 \
--namespace tau-system \
--create-namespaceОфициальные образы публикуются в mcr.microsoft.com/aks/ai-runtime/ для Tau, портала TauGrid и основного контроллера tau. Microsoft рекомендует фиксировать версии тегов или использовать неизменяемые дайджесты вместо latest. CLI устанавливается из релизов GitHub в Linux и macOS, а для Windows amd64 доступен установщик PowerShell; установщик проверяет контрольную сумму релиза и не изменяет PATH.
Тем, кто оценивает это решение за пределами Azure, важно учитывать две эксплуатационные детали. Во-первых, TauGrid по умолчанию не отправляет телеметрию в Microsoft, а удалённый экспорт остаётся отключённым, если оператор не настроит место назначения. Во-вторых, некоторые интеграции пока специфичны для Azure, в частности наблюдаемость через Azure Data Explorer. Заявленная цель — поддержка облачного и локального Kubernetes без зависимости от Azure, и вклад в это направление приветствуется.
Ключевые выводы
- Microsoft открыл исходный код TauGrid 28 августа 2026 года по лицензии MIT в репозитории Azure/taugrid.
- Одна установка Helm объединяет CLI
tau, постановку в очередь Kueue, оркестрацию KubeRay, мониторинг состояния GPU и наблюдаемость. - Уже сейчас можно развернуть решение в любом кластере Kubernetes версии 1.30 или выше с GPU-узлами, kubectl и Helm версии 3.0 или новее.
- Записи результатов содержат конфигурацию, журналы, метрики и контрольные точки, поэтому запуски остаются воспроизводимыми и проверяемыми.
- По умолчанию телеметрия не отправляется, однако наблюдаемость через Azure Data Explorer пока остаётся специфичной для Azure.
Ознакомьтесь с блогом инженерной команды AKS и репозиторием Azure/taugrid на GitHub. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.