Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Microsoft открыла исходный код TauGrid: Kubernetes-нативный стек для ИИ-нагрузок на GPU

Команды платформ, запускающие ИИ на Kubernetes, редко ограничиваются чем-то одним. Они используют систему постановки в очередь, распределённую среду выполнения, проверки состояния GPU-узлов, панели мониторинга и слой скриптов отправки, объединяющий всё это. Инженерная команда Azure Kubernetes Service открыла исходный код TauGrid, объединив всю эту сборку в одну установку Helm.

Можно ли его развернуть? Да, TauGrid распространяется по лицензии MIT, а образы контейнеров и чарты Helm опубликованы как общедоступные артефакты OCI в реестре контейнеров Microsoft. Необходимые условия — кластер Kubernetes версии 1.30 или выше с GPU-узлами, kubectl и Helm версии 3.0 или новее.

Что такое TauGrid

TauGrid — это самостоятельно размещаемая платформа для запуска ИИ-нагрузок в Kubernetes. Она объединяет пять компонентов, которые команды платформ обычно интегрируют вручную: CLI tau, постановку нагрузок в очередь и допуск через Kueue, оркестрацию кластеров Ray через KubeRay, мониторинг состояния GPU на уровне узлов, а также наблюдаемость кластера и нагрузок.

Разделение ответственности — ключевой элемент дизайна. Команды платформ управляют рабочими пространствами, очередями, профилями вычислительных ресурсов, хранилищем, идентификацией и наблюдаемостью. Исследователи работают из репозитория и через CLI, отправляя нагрузки без непосредственной настройки Kubernetes. Кодовая база написана преимущественно на Go.

Как задание проходит через систему

Описание нагрузки содержится в файле tau.yaml. Опубликованный Microsoft пример обучения на GPU запускает задание PyTorch на одном A100:

Копировать кодСкопированоИспользовать другой браузер
schema_version: 1
name: aks-gpu-quickstart
run:
  entrypoint: train.py
  workload_kind: rayjob
compute:
  gpus: 1
  workers: 1
  cpus: 16
  memory: 64Gi
runtime:
  image: mcr.microsoft.com/aks/ai-runtime/ray:py3.12-ray2.56.0-cuda13.0
  pip:
    - torch>=2.4.0

При выполнении tau run TauGrid применяет политики платформы, создаёт Kubernetes Job или KubeRay RayJob и отправляет его через Kueue. Шесть этапов, описанных Microsoft, — это отправка, постановка в очередь, выполнение, мониторинг, восстановление и фиксация результатов. Восстановление включает повторную попытку, продолжение работы с контрольной точки и диагностику сбоев. Записи результатов содержат метаданные нагрузки, конфигурацию, журналы, метрики, контрольные точки и историю выполнения, благодаря чему запуск впоследствии можно воспроизвести и проверить.

Когда несколько команд используют общий кластер, их задания попадают в общую ClusterQueue Kueue. Kueue допускает каждое из них к выполнению с учётом квоты и приоритета, а Kubernetes размещает его на исправных GPU.

Интерактивное объяснение

Состав установки

Установка выполняется с помощью чарта Helm, загружаемого непосредственно из MCR:

Копировать кодСкопированоИспользовать другой браузер
helm install taugrid \
  oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid \
  --version 0.4.2 \
  --namespace tau-system \
  --create-namespace

Официальные образы публикуются в mcr.microsoft.com/aks/ai-runtime/ для Tau, портала TauGrid и основного контроллера tau. Microsoft рекомендует фиксировать версии тегов или использовать неизменяемые дайджесты вместо latest. CLI устанавливается из релизов GitHub в Linux и macOS, а для Windows amd64 доступен установщик PowerShell; установщик проверяет контрольную сумму релиза и не изменяет PATH.

Тем, кто оценивает это решение за пределами Azure, важно учитывать две эксплуатационные детали. Во-первых, TauGrid по умолчанию не отправляет телеметрию в Microsoft, а удалённый экспорт остаётся отключённым, если оператор не настроит место назначения. Во-вторых, некоторые интеграции пока специфичны для Azure, в частности наблюдаемость через Azure Data Explorer. Заявленная цель — поддержка облачного и локального Kubernetes без зависимости от Azure, и вклад в это направление приветствуется.

Ключевые выводы

  • Microsoft открыл исходный код TauGrid 28 августа 2026 года по лицензии MIT в репозитории Azure/taugrid.
  • Одна установка Helm объединяет CLI tau, постановку в очередь Kueue, оркестрацию KubeRay, мониторинг состояния GPU и наблюдаемость.
  • Уже сейчас можно развернуть решение в любом кластере Kubernetes версии 1.30 или выше с GPU-узлами, kubectl и Helm версии 3.0 или новее.
  • Записи результатов содержат конфигурацию, журналы, метрики и контрольные точки, поэтому запуски остаются воспроизводимыми и проверяемыми.
  • По умолчанию телеметрия не отправляется, однако наблюдаемость через Azure Data Explorer пока остаётся специфичной для Azure.

Ознакомьтесь с блогом инженерной команды AKS и репозиторием Azure/taugrid на GitHub. Вся благодарность принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости