Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Meta AI представляет MetaRoCE: RDMA-транспорт, созданный с нуля для Ethernet в масштабе ИИ

Обучение и обслуживание передовых моделей теперь в такой же степени является сетевой задачей, как и вычислительной. Коллективные операции, такие как all-reduce и all-to-all, синхронизируют тысячи ускорителей во время обучения, а самая медленная передача задаёт темп всей задаче. Даже небольшие сетевые задержки напрямую приводят к простою значительных вычислительных ресурсов.

На этой неделе Meta представила MetaRoCE. Он описывается как разработанный с нуля протокол транспорта RDMA, созданный специально для ИИ-нагрузок в обычных сетях Ethernet. Архитектура отходит от ключевого допущения стандартного RoCE. Стандартный RoCE ожидает, что сеть доставит каждый кадр по порядку, используя PFC и препятствуя распылению пакетов, которое обеспечивает производительность в многоплоскостных сетях и сетях крупного масштаба. MetaRoCE, напротив, рассматривает сеть как допускающую потери и переносит упорядочивание, выбор маршрута и восстановление на NIC. Meta публикует спецификацию, эталонную программную реализацию и набор тестов на соответствие через Open Compute Project (OCP)

Можно ли его внедрить?

Пока нет: артефакты, возможно, выйдут в октябре 2026 года. Meta может представить спецификацию MetaRoCE, оптимизированную для DPDK эталонную программную реализацию и производственную платформу проверки соответствия на глобальном саммите OCP 2026 года. Поддержка на аппаратном уровне находится на ранней стадии: Meta доказала работоспособность решения на программируемых NIC AMD Pensando, а другие поставщики уже работают над дополнительными реализациями. На данный момент это решение по архитектуре сети, а не по закупке оборудования

Проблема: сеть видит пакеты, а NIC — намерение

Meta масштабировала кластеры до сотен тысяч GPU в нескольких дата-центрах и регионах. При таком масштабе сеть находится на критическом пути каждого шага обучения. Коллективные операции, такие как all-reduce и all-to-all, синхронизируют тысячи ускорителей, а самая медленная передача задаёт темп всей задаче.

Ограничением является стандартный RoCE. Он ожидает, что сеть доставит каждый кадр по порядку, опирается на PFC и препятствует распылению пакетов, которое обеспечивает производительность в многоплоскостных сетях и сетях крупного масштаба. MetaRoCE переворачивает этот подход: интеллектуальные функции перемещаются на конечное устройство, а сеть разбивается на множество мелкозернистых логических путей, каждый из которых обладает собственной телеметрией в реальном времени — RTT для каждого пути, состоянием ECN и уровнем утилизации.

Это непосредственно развивает работу Meta 2024 года по RoCE в крупномасштабных системах и её более широкую эволюцию инфраструктуры.

Шесть важных проектных решений

  • Доставка не по порядку используется по умолчанию: Пакеты распыляются по множеству путей и намеренно прибывают не по порядку. Каждый пакет содержит собственный адрес назначения, поэтому данные записываются непосредственно в конечную область памяти по мере поступления — без буфера переупорядочивания и блокировки начала очереди. Отправления содержат информацию для сопоставления с опубликованным буфером приёма, поэтому Send корректно доставляется даже тогда, когда предшествующие ему сообщения ещё не прибыли.
  • Многопутевая передача является встроенной функцией: Каждый путь использует отдельный порт UDP-источника в качестве энтропии ECMP, который NIC может в любой момент изменить, чтобы перенаправить трафик с проблемного маршрута. Поскольку каждый путь сохраняет собственное окно и оценку времени прохождения туда и обратно, транспорт может отличать перегрузку от отказа и явно перераспределять нагрузку.
  • Устойчивость к потерям вместо работы без потерь: MetaRoCE рассматривает сеть как допускающую потери — без PFC и кадров паузы. Пропуск в битовом векторе выборочного подтверждения размером 256 бит для конкретного пути является свидетельством потери, а не изменения порядка, поэтому запускается повторная передача ровно отсутствующего пакета по тому пути, на котором он был потерян.
  • Управление перегрузкой выполняется с обеих сторон: Управляемый отправителем алгоритм AIMD на основе ECN объединяется с подсказками о справедливой доле скорости, формируемыми получателем. В каждом подтверждении получатель возвращает долю входящей полосы пропускания, выделенную этому отправителю, поэтому отправители напрямую приближаются к нужной скорости, а не ищут её методом проб. Incast устраняется за один-два RTT.
  • Независимость от топологии: MetaRoCE запрашивает от сети две функции, уже имеющиеся в каждом коммутаторе: маркировку ECN и ECMP. Ему не требуются обрезка пакетов, телеметрия внутри сети, управление потоками на основе кредитов или распыление на стороне коммутатора — поэтому он также работает в облаках поставщиков, конфигурацию которых вы не контролируете.
  • Количество состояний соединений перестаёт резко расти: Традиционный RDMA получает больше упорядочивания или пропускной способности за счёт открытия большего числа пар очередей — десятков на пару узлов, каждая из которых имеет окно перегрузки и не учитывает остальные. MetaRoCE разделяет эти функции: одно соединение поддерживает множество независимых упорядоченных потоков сверху и множество путей снизу под управлением одного контроллера перегрузки.

Показатели

Meta реализовала MetaRoCE на программируемых NIC AMD Pensando. На кластере из 64 узлов с GPU AMD, выполнявшем коллективные операции RCCL, решение напрямую сравнивалось с RoCEv2 в операциях all-reduce и all-to-all и показало более высокую пропускную способность и меньшее время завершения потоков.

Результат по устойчивости является ключевым: MetaRoCE сохраняет около 86% пропускной способности при потере 1% пакетов и продолжает обеспечивать полезную полосу пропускания даже при уровне потерь 10%, плавно сходясь к рабочему состоянию вместо отказа. Проверка в многоплоскостной конфигурации с 4 и 8 плоскостями и до 4 000 одновременных соединений подтвердила, что пропускная способность масштабируется линейно с числом плоскостей, а моделирование отказов плоскостей показало перераспределение трафика без участия приложения или вмешательства оператора.

Открытость заложена в архитектуру

MetaRoCE переносит философию поддержки нескольких поставщиков, которую инициатива OCP Ethernet Scalable Unified Network (ESUN) сформировала для сетевой инфраструктуры, на уровень транспорта. Поставляются три артефакта: полная спецификация через OCP, набор тестов на соответствие, позволяющий поставщикам подтвердить соответствие своих реализаций, и libsoftmetaroce в качестве эталонной поведенческой модели для разработки кремния. Meta доказала работоспособность решения на оборудовании AMD Pensando, а другие поставщики уже работают над дополнительными реализациями.

Встраивание объясняющего материала

Основные выводы

  • MetaRoCE — разработанный с нуля транспорт RDMA, рассматривающий Ethernet как сеть, допускающую потери: без PFC и кадров паузы.
  • Пакеты распыляются по путям и записываются непосредственно в память; без буфера переупорядочивания и блокировки начала очереди.
  • Сохраняет около 86% пропускной способности при потере 1% пакетов на кластере из 64 узлов с GPU AMD, выполняющем операции RCCL.
  • От коммутаторов требуются только ECN и ECMP, поэтому решение работает в сетях, которые вы не контролируете.
  • Спецификация, набор тестов на соответствие и libsoftmetaroce будут представлены на глобальном саммите OCP в октябре.

Ознакомьтесь с ТЕХНИЧЕСКИМИ ПОДРОБНОСТЯМИ здесь.

Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости