Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Meta AI представляє MetaRoCE: RDMA-транспорт, створений з нуля для Ethernet у масштабі ШІ

Навчання та обслуговування передових моделей тепер є мережевою проблемою не меншою мірою, ніж обчислювальною. Колективні операції, такі як all-reduce і all-to-all, синхронізують тисячі прискорювачів під час навчання, а найповільніша передача визначає темп усієї роботи. Навіть незначні мережеві затримки безпосередньо залишають значну частину обчислювальних потужностей незадіяною.

Цього тижня Meta представила MetaRoCE. Його описують як розроблений з нуля транспортний протокол RDMA, спеціально створений для робочих навантажень ШІ у мережах Ethernet на стандартному обладнанні. Концепція порушує ключове припущення стандартного RoCE. Стандартний RoCE очікує, що мережа доставлятиме кожен кадр у правильному порядку, покладаючись на PFC і перешкоджаючи розподіленню пакетів між шляхами, яке забезпечує продуктивність у багатоплощинних і великомасштабних мережах. MetaRoCE натомість розглядає фабрику як мережу з можливими втратами та переносить упорядкування, вибір шляхів і відновлення на NIC. Meta передає специфікацію, еталонну програмну реалізацію та набір тестів на відповідність через Open Compute Project (OCP)

Чи готове це до розгортання?

Ще ні, артефакти, можливо, будуть випущені в жовтні 2026 року. Meta може випустити специфікацію MetaRoCE, програмну еталонну реалізацію, оптимізовану для DPDK, і виробничу систему перевірки відповідності на глобальному саміті OCP 2026 року. Підтримка апаратного забезпечення перебуває на ранній стадії: Meta довела працездатність рішення на програмованих NIC AMD Pensando, а інші постачальники вже працюють над додатковими реалізаціями. Наразі це рішення щодо архітектури фабрики, а не щодо закупівель

Проблема: фабрика бачить пакети, а NIC — намір

Meta масштабувала кластери до сотень тисяч GPU у кількох дата-центрах і регіонах. За такого масштабу мережа є критично важливою частиною кожного кроку навчання. Колективні операції, такі як all-reduce і all-to-all, синхронізують тисячі прискорювачів, а найповільніша передача визначає темп усієї роботи.

Обмеженням є стандартний RoCE. Він очікує, що мережа доставлятиме кожен кадр у правильному порядку, покладається на PFC і перешкоджає розподіленню пакетів між шляхами, яке забезпечує продуктивність у багатоплощинних і великомасштабних мережах. MetaRoCE перевертає цей підхід: інтелект переміщується на кінцевий пристрій, а мережа розкладається на безліч дрібнозернистих логічних шляхів, кожен із власною телеметрією в реальному часі — RTT для кожного шляху, станом ECN і рівнем використання.

Це безпосередньо розвиває роботу Meta 2024 року над RoCE у великому масштабі та її ширшу еволюцію інфраструктури.

Шість важливих конструктивних рішень

  • Доставка не в порядку є стандартною: Пакети розподіляються між багатьма шляхами й навмисно прибувають не в порядку. Кожен пакет містить власну адресу призначення, тому дані одразу записуються у фінальне місце в пам’яті під час надходження — без буфера перестановки та блокування початку черги. Передачі містять відповідність буферу отримання, для якого вже опубліковано запит, тому Send коректно приземляється навіть тоді, коли попередні повідомлення ще не надійшли.
  • Багатошляховість є вбудованою: Кожен шлях використовує окремий порт UDP-джерела як джерело ентропії ECMP, який NIC може змінити будь-коли, щоб перемістити трафік із проблемного маршруту. Оскільки кожен шлях має власне вікно та оцінку часу проходження в обидва боки, транспорт може відрізнити перевантаження від відмови й явно перерозподілити навантаження.
  • Стійкість до втрат замінює безвтратність: MetaRoCE розглядає фабрику як мережу з можливими втратами — без PFC і кадрів призупинення. Пропуск у 256-бітному бітовому векторі вибіркового підтвердження шляху є ознакою втрати, а не зміни порядку, тому він запускає повторну передачу саме відсутнього пакета шляхом, на якому його було втрачено.
  • Керування перевантаженням працює з обох кінців: AIMD на основі ECN, керований відправником, поєднується з підказками щодо справедливого розподілу швидкості, які надсилає отримувач. У кожному підтвердженні отримувач повертає частку вхідної пропускної здатності, виділену цьому відправнику, тож відправники безпосередньо наближаються до правильної швидкості, а не шукають її. Incast вирішується за один-два оберти туди й назад.
  • Незалежність від топології: MetaRoCE запитує у фабрики лише дві функції, які вже має кожен комутатор: маркування ECN і ECMP. Йому не потрібні обрізання пакетів, телеметрія в мережі, керування потоком на основі кредитів або розподілення пакетів на стороні комутатора — а це означає, що він також працює у хмарних мережах постачальників, конфігурацію яких ви не контролюєте.
  • Стан з’єднань більше не вибухає: Традиційний RDMA отримує більше впорядкування або пропускної здатності, відкриваючи більше пар черг — десятки на пару вузлів, кожна з вікном перевантаження, яке не враховує решту. MetaRoCE розділяє ці два аспекти: одне з’єднання передає безліч незалежних упорядкованих потоків на верхньому рівні та безліч шляхів на нижньому, використовуючи один контролер перевантаження.

Показники

Meta реалізувала MetaRoCE на програмованих NIC AMD Pensando. У 64-вузловому кластері GPU AMD, що виконував колективні операції RCCL, рішення безпосередньо порівняли з RoCEv2 на операціях all-reduce і all-to-all, отримавши вищу пропускну здатність і менший час завершення потоків.

Результат щодо стійкості є ключовим: MetaRoCE зберігає близько 86% пропускної здатності за 1% втрат пакетів і продовжує забезпечувати корисну пропускну здатність навіть за рівня втрат 10%, плавно збіжуючись, а не руйнуючись. Перевірка багатоплощинної роботи в топологіях із 4 і 8 площинами та до 4000 одночасних з’єднань підтвердила, що пропускна здатність масштабується лінійно з кількістю площин, а змодельовані відмови площин показали перерозподіл трафіку без участі застосунку чи втручання оператора.

Відкритість за задумом

MetaRoCE розширює філософію підтримки кількох постачальників, яку ініціатива OCP Ethernet Scalable Unified Network (ESUN) започаткувала для фабрики, поширюючи її на транспортний рівень. Буде випущено три артефакти: повну специфікацію через OCP, набір тестів на відповідність, який дає змогу постачальникам довести відповідність своїх реалізацій, і libsoftmetaroce як авторитетну поведінкову модель для розробки кремнію. Meta довела працездатність рішення на обладнанні AMD Pensando, а інші постачальники вже працюють над додатковими реалізаціями.

Вбудований пояснювальний матеріал

Основні висновки

  • MetaRoCE — це розроблений з нуля транспорт RDMA, який розглядає Ethernet як мережу з можливими втратами — без PFC і кадрів призупинення.
  • Пакети розподіляються між шляхами й одразу записуються в пам’ять; без буфера перестановки та блокування початку черги.
  • Зберігає близько 86% пропускної здатності за 1% втрат у 64-вузловому кластері GPU AMD, що працює з RCCL.
  • Потребує від комутаторів лише ECN і ECMP, тому працює у фабриках, які ви не контролюєте.
  • Специфікація, набір тестів на відповідність і libsoftmetaroce будуть представлені на глобальному саміті OCP у жовтні.

Ознайомтеся з ТЕХНІЧНИМИ ДЕТАЛЯМИ тут.

Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини