Meta AI представя MetaRoCE: RDMA транспорт, създаден от нулата за Ethernet в мащаба на AI
Обучението и обслужването на най-съвременни модели вече е толкова мрежов проблем, колкото и изчислителен. Колективни операции като all-reduce и all-to-all синхронизират хиляди ускорители по време на обучението, а най-бавният трансфер определя темпото на цялата задача. Дори малки количества мрежово триене директно оставят значителен изчислителен капацитет неизползван.
Тази седмица Meta представи MetaRoCE. Той е описан като изцяло нов транспортен протокол за RDMA, създаден специално за AI натоварвания върху стандартен Ethernet. Дизайнът се разминава със стандартния RoCE по отношение на основното му предположение. Стандартният RoCE очаква мрежата да доставя всеки кадър по ред, разчитайки на PFC и възпирайки разпръскването на пакети, което осигурява производителност в многопланови и широкомащабни мрежи. Вместо това MetaRoCE третира инфраструктурата като ненадеждна и прехвърля подреждането, избора на път и възстановяването към NIC. Meta публикува спецификацията, референтна софтуерна реализация и тестов пакет за съответствие чрез Open Compute Project (OCP)
Може ли да бъде внедрен?
Все още не — артефактите вероятно ще бъдат публикувани през октомври 2026 г. Meta може да публикува спецификацията на MetaRoCE, софтуерна референтна реализация, оптимизирана за DPDK, и своята производствена рамка за съответствие на глобалната среща на OCP през 2026 г. Хардуерната поддръжка е в начален етап: Meta го е доказала върху програмируеми NIC устройства AMD Pensando, а други производители работят по допълнителни реализации. Засега това е решение за архитектурата на мрежовата инфраструктура, а не за закупуване
Проблемът: инфраструктурата вижда пакети, а NIC вижда намерението
Meta разшири клъстерите си до стотици хиляди графични процесори в множество центрове за данни и региони. При такъв мащаб мрежата е в критичния път на всяка стъпка от обучението. Колективни операции като all-reduce и all-to-all синхронизират хиляди ускорители, а най-бавният трансфер определя темпото на цялата задача.
Стандартният RoCE е ограничението. Той очаква мрежата да доставя всеки кадър по ред, разчита на PFC и възпира разпръскването на пакети, което осигурява производителност в многопланови и широкомащабни мрежи. MetaRoCE обръща това: интелигентността се премества към крайната точка, а мрежата се разделя на множество детайлни логически пътища, всеки със собствена телеметрия в реално време — RTT за всеки път, състояние на ECN и използване.
Това се основава пряко на работата на Meta от 2024 г. по RoCE в голям мащаб и на нейното по-широко развитие на инфраструктурата.
Шест важни проектни решения
- Доставката извън реда е стандартна: Пакетите се разпръскват по множество пътища и по замисъл пристигат извън ред. Всеки пакет съдържа собственото си местоназначение, така че данните се записват директно на крайната си позиция в паметта при пристигането — без буфер за пренареждане и без блокиране на началото на опашката. Изпращанията съдържат съпоставянето с публикуван буфер за получаване, така че едно Send пристига правилно, дори когато предходните съобщения все още не са пристигнали.
- Многопътността е вградена: Всеки път използва различен UDP изходен порт като своя ECMP ентропия, който NIC може да променя по всяко време, за да пренасочи трафика от проблемен маршрут. Тъй като всеки път поддържа собствен прозорец и оценка на времето за двупосочно пътуване, транспортът може да разграничава претоварване от повреда и изрично да балансира натоварването.
- Толерантността към загуби заменя липсата на загуби: MetaRoCE третира инфраструктурата като ненадеждна — без PFC и без кадри за пауза. Празнина във вектора от битове за селективно потвърждение с дължина 256 бита на даден път е доказателство за загуба, а не за пренареждане, така че задейства повторното предаване точно на липсващия пакет по пътя, на който е бил изгубен.
- Контролът на претоварването се извършва от двата края: AIMD, базиран на ECN и управляван от изпращача, се комбинира с подсказки за справедливо разпределена скорост, управлявани от получателя. При всяко потвърждение получателят връща дела от входящата честотна лента, който е разпределил за този изпращач, така че изпращачите директно достигат правилната скорост, вместо да я търсят. Претоварването при множество изпращачи се разрешава за един или два периода на двупосочно пътуване.
- Независимост от топологията: MetaRoCE изисква от инфраструктурата две неща, които всеки комутатор вече има: маркиране с ECN и ECMP. Не са необходими съкращаване на пакети, телеметрия в мрежата, управление на потока на базата на кредити или разпръскване от страна на комутатора — което означава, че работи и през облаци на производители, чиято конфигурация не контролирате.
- Състоянието на връзките спира да се разраства неконтролируемо: Традиционният RDMA получава повече подреждане или честотна лента чрез отваряне на повече двойки опашки — десетки за всяка двойка възли — всяка със собствен прозорец за претоварване, който не отчита останалите. MetaRoCE разделя двете: една връзка пренася множество независими подредени потоци отгоре и множество пътища отдолу, под управлението на един контролер на претоварването.
Числата
Meta реализира MetaRoCE върху програмируеми NIC устройства AMD Pensando. В 64-възлов GPU клъстер на AMD, изпълняващ колективни операции на RCCL, той беше сравнен директно с RoCEv2 при all-reduce и all-to-all и постигна по-висока пропускателна способност и по-кратко време за завършване на потоците.
Резултатът по отношение на устойчивостта е основното послание: MetaRoCE поддържа около 86% пропускателна способност при 1% загуба на пакети и продължава да осигурява полезна честотна лента дори при нива на загуба от 10%, като се сближава плавно, вместо да се срине. Валидирането в многопланова среда при топологии с 4 и 8 равнини и до 4000 едновременни връзки потвърди, че пропускателната способност се мащабира линейно с броя на равнините, а симулираните откази на равнини показаха преразпределение на трафика без намеса на приложението или оператора.
Отворен по замисъл
MetaRoCE разширява философията за поддръжка от множество производители, която инициативата на OCP за Ethernet Scalable Unified Network (ESUN) установи за мрежовата инфраструктура, към транспортния слой. Публикуват се три артефакта: пълната спецификация чрез OCP, пакет за съответствие, който позволява на производителите да докажат, че реализациите им съвпадат, и libsoftmetaroce като авторитетен поведенчески модел за разработка на силициеви чипове. Meta го е доказала върху хардуер AMD Pensando, а други производители работят по допълнителни реализации.
Вграждане на обяснението
Основни изводи
- MetaRoCE е изцяло нов транспорт за RDMA, който третира Ethernet като ненадежден — без PFC и без кадри за пауза.
- Пакетите се разпръскват по множество пътища и се записват директно в паметта; няма буфер за пренареждане и блокиране на началото на опашката.
- Поддържа около 86% пропускателна способност при 1% загуба в 64-възлов AMD GPU клъстер, изпълняващ RCCL.
- Изисква от комутаторите само ECN и ECMP, така че работи в инфраструктури, които не контролирате.
- Спецификацията, пакетът за съответствие и
libsoftmetaroceще бъдат публикувани на глобалната среща на OCP през октомври.
Разгледайте ТЕХНИЧЕСКИТЕ ПОДРОБНОСТИ тук.
Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.