Meta AI представляет MetaRoCE: RDMA-транспорт, созданный с нуля для Ethernet в масштабе ИИ
Обучение и обслуживание передовых моделей теперь в такой же степени является сетевой задачей, как и вычислительной. Коллективные операции, такие как all-reduce и all-to-all, синхронизируют тысячи ускорителей во время обучения, а самая медленная передача задаёт темп всей задаче. Даже небольшие сетевые задержки напрямую приводят к простою значительных вычислительных ресурсов.
На этой неделе Meta представила MetaRoCE. Он описывается как разработанный с нуля протокол транспорта RDMA, созданный специально для ИИ-нагрузок в обычных сетях Ethernet. Архитектура отходит от ключевого допущения стандартного RoCE. Стандартный RoCE ожидает, что сеть доставит каждый кадр по порядку, используя PFC и препятствуя распылению пакетов, которое обеспечивает производительность в многоплоскостных сетях и сетях крупного масштаба. MetaRoCE, напротив, рассматривает сеть как допускающую потери и переносит упорядочивание, выбор маршрута и восстановление на NIC. Meta публикует спецификацию, эталонную программную реализацию и набор тестов на соответствие через Open Compute Project (OCP)
Можно ли его внедрить?
Пока нет: артефакты, возможно, выйдут в октябре 2026 года. Meta может представить спецификацию MetaRoCE, оптимизированную для DPDK эталонную программную реализацию и производственную платформу проверки соответствия на глобальном саммите OCP 2026 года. Поддержка на аппаратном уровне находится на ранней стадии: Meta доказала работоспособность решения на программируемых NIC AMD Pensando, а другие поставщики уже работают над дополнительными реализациями. На данный момент это решение по архитектуре сети, а не по закупке оборудования
Проблема: сеть видит пакеты, а NIC — намерение
Meta масштабировала кластеры до сотен тысяч GPU в нескольких дата-центрах и регионах. При таком масштабе сеть находится на критическом пути каждого шага обучения. Коллективные операции, такие как all-reduce и all-to-all, синхронизируют тысячи ускорителей, а самая медленная передача задаёт темп всей задаче.
Ограничением является стандартный RoCE. Он ожидает, что сеть доставит каждый кадр по порядку, опирается на PFC и препятствует распылению пакетов, которое обеспечивает производительность в многоплоскостных сетях и сетях крупного масштаба. MetaRoCE переворачивает этот подход: интеллектуальные функции перемещаются на конечное устройство, а сеть разбивается на множество мелкозернистых логических путей, каждый из которых обладает собственной телеметрией в реальном времени — RTT для каждого пути, состоянием ECN и уровнем утилизации.
Это непосредственно развивает работу Meta 2024 года по RoCE в крупномасштабных системах и её более широкую эволюцию инфраструктуры.
Шесть важных проектных решений
- Доставка не по порядку используется по умолчанию: Пакеты распыляются по множеству путей и намеренно прибывают не по порядку. Каждый пакет содержит собственный адрес назначения, поэтому данные записываются непосредственно в конечную область памяти по мере поступления — без буфера переупорядочивания и блокировки начала очереди. Отправления содержат информацию для сопоставления с опубликованным буфером приёма, поэтому Send корректно доставляется даже тогда, когда предшествующие ему сообщения ещё не прибыли.
- Многопутевая передача является встроенной функцией: Каждый путь использует отдельный порт UDP-источника в качестве энтропии ECMP, который NIC может в любой момент изменить, чтобы перенаправить трафик с проблемного маршрута. Поскольку каждый путь сохраняет собственное окно и оценку времени прохождения туда и обратно, транспорт может отличать перегрузку от отказа и явно перераспределять нагрузку.
- Устойчивость к потерям вместо работы без потерь: MetaRoCE рассматривает сеть как допускающую потери — без PFC и кадров паузы. Пропуск в битовом векторе выборочного подтверждения размером 256 бит для конкретного пути является свидетельством потери, а не изменения порядка, поэтому запускается повторная передача ровно отсутствующего пакета по тому пути, на котором он был потерян.
- Управление перегрузкой выполняется с обеих сторон: Управляемый отправителем алгоритм AIMD на основе ECN объединяется с подсказками о справедливой доле скорости, формируемыми получателем. В каждом подтверждении получатель возвращает долю входящей полосы пропускания, выделенную этому отправителю, поэтому отправители напрямую приближаются к нужной скорости, а не ищут её методом проб. Incast устраняется за один-два RTT.
- Независимость от топологии: MetaRoCE запрашивает от сети две функции, уже имеющиеся в каждом коммутаторе: маркировку ECN и ECMP. Ему не требуются обрезка пакетов, телеметрия внутри сети, управление потоками на основе кредитов или распыление на стороне коммутатора — поэтому он также работает в облаках поставщиков, конфигурацию которых вы не контролируете.
- Количество состояний соединений перестаёт резко расти: Традиционный RDMA получает больше упорядочивания или пропускной способности за счёт открытия большего числа пар очередей — десятков на пару узлов, каждая из которых имеет окно перегрузки и не учитывает остальные. MetaRoCE разделяет эти функции: одно соединение поддерживает множество независимых упорядоченных потоков сверху и множество путей снизу под управлением одного контроллера перегрузки.
Показатели
Meta реализовала MetaRoCE на программируемых NIC AMD Pensando. На кластере из 64 узлов с GPU AMD, выполнявшем коллективные операции RCCL, решение напрямую сравнивалось с RoCEv2 в операциях all-reduce и all-to-all и показало более высокую пропускную способность и меньшее время завершения потоков.
Результат по устойчивости является ключевым: MetaRoCE сохраняет около 86% пропускной способности при потере 1% пакетов и продолжает обеспечивать полезную полосу пропускания даже при уровне потерь 10%, плавно сходясь к рабочему состоянию вместо отказа. Проверка в многоплоскостной конфигурации с 4 и 8 плоскостями и до 4 000 одновременных соединений подтвердила, что пропускная способность масштабируется линейно с числом плоскостей, а моделирование отказов плоскостей показало перераспределение трафика без участия приложения или вмешательства оператора.
Открытость заложена в архитектуру
MetaRoCE переносит философию поддержки нескольких поставщиков, которую инициатива OCP Ethernet Scalable Unified Network (ESUN) сформировала для сетевой инфраструктуры, на уровень транспорта. Поставляются три артефакта: полная спецификация через OCP, набор тестов на соответствие, позволяющий поставщикам подтвердить соответствие своих реализаций, и libsoftmetaroce в качестве эталонной поведенческой модели для разработки кремния. Meta доказала работоспособность решения на оборудовании AMD Pensando, а другие поставщики уже работают над дополнительными реализациями.
Встраивание объясняющего материала
Основные выводы
- MetaRoCE — разработанный с нуля транспорт RDMA, рассматривающий Ethernet как сеть, допускающую потери: без PFC и кадров паузы.
- Пакеты распыляются по путям и записываются непосредственно в память; без буфера переупорядочивания и блокировки начала очереди.
- Сохраняет около 86% пропускной способности при потере 1% пакетов на кластере из 64 узлов с GPU AMD, выполняющем операции RCCL.
- От коммутаторов требуются только ECN и ECMP, поэтому решение работает в сетях, которые вы не контролируете.
- Спецификация, набор тестов на соответствие и
libsoftmetaroceбудут представлены на глобальном саммите OCP в октябре.
Ознакомьтесь с ТЕХНИЧЕСКИМИ ПОДРОБНОСТЯМИ здесь.
Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? Теперь вы также можете присоединиться к нам в Telegram.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.