Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Reflection AI представила Beam: MoE-модель із відкритими вагами на 501 млрд параметрів, 23 млрд з яких активні, для програмування та агентних задач

Reflection AI представила Beam, свою першу модель із відкритими вагами. Beam — це розріджена модель Mixture-of-Experts (MoE) із загалом 501 млрд параметрів і 23 млрд активних параметрів на токен, створена для програмування, міркувань і агентних завдань. За словами команди Reflection AI, Beam безпосередньо конкурує з більшими відкритими моделями, такими як GLM 5.2, використовуючи в 3–4 рази менше обчислювальних ресурсів для інференсу на бенчмарках міркувань.

Чи можна розгорнути її вже сьогодні? Поки що — ні, для самостійного хостингу модель ще недоступна. Beam перебуває на фінальному етапі red teaming. Ранній доступ надається через список очікування на платформі Reflection.

Що таке Reflection Beam?

Beam — це універсальна агентна модель, яку Reflection AI навчила з нуля. Вона орієнтована на корпоративне програмування та агентні завдання. Reflection позиціонує Beam як модель, що розширює західний фронтир моделей із відкритими вагами. Дослідницька команда відверто визнає наявний розрив. Kimi K3 залишається попереду за сукупними можливостями, тому головна перевага Beam — ефективність під час інференсу.

Користувачі отримують параметр зусиль на міркування. Нижчі значення сприяють коротким відповідям. Вищі налаштування дають змогу довше міркувати над складними завданнями. Команди можуть співвідносити рівень зусиль зі складністю завдання та обчислювальним бюджетом.

Як навчали Beam на етапі попереднього навчання

Beam пройшла попереднє навчання на 23,8 трлн токенів із вебу, публічних джерел і пропрієтарних ліцензованих наборів даних. Команда Reflection заявляє, що під час відбору було вилучено близько 95% токенів із необробленого інтернету. Водночас було збережено приблизно 1,8 трлн високоякісних токенів, які звичайні фільтри відсіяли б.

Архітектура чергує локальну та глобальну увагу з дрібнозернистими експертами, що маршрутизуються. Балансування навантаження ґрунтується на балансуванні без допоміжних втрат із DeepSeek-V3, доповненому косинусним спаданням оновлень зміщень експертів. Наприкінці попереднього навчання навантаження на найзавантаженішого експерта становило лише 1,04 від середнього. У всіх 52 шарах норми залишкових зв’язків утримувалися в межах завдяки масштабуванню на основі глибини, SandwichNorm, керуванню увагою та накопиченню залишкових значень у FP32.

Попереднє навчання завершили менш ніж за 4 тижні на 6 144 графічних процесорах NVIDIA GB300 NVL72. Наприкінці коефіцієнт корисної роботи досяг 92,3%, а всього було виконано 9 напівавтоматичних перемотувань. Під час проміжного навчання ефективний контекст розширили до 1 млн токенів.

Підсилене навчання з великими обчислювальними ресурсами

Підсилене навчання є центральною віссю масштабування Beam. Процес тривав 4 тижні на 10,5 тис. графічних процесорах NVIDIA GB300, за цей час було створено понад 100 млн траєкторій. Максимальний контекст траєкторії становив 256 тис. токенів. Для навчання та оцінювання було використано близько 1,3 млрд пісочниць у майже 1 млн середовищ для програмування, агентних завдань і STEM.

Reflection навчала модель за допомогою повністю асинхронних градієнтів політики. Кожен токен позначається версією політики, яка його створила. Нові алгоритми забезпечували стабільне навчання навіть за відставання на один день — на 107 версій ваг позаду поточної політики. Команда повідомляє, що зі збільшенням обчислювальних ресурсів для підсиленого навчання плато не спостерігалося.

Показники інфраструктури заслуговують на увагу. Система в середньому підтримувала 110 тис. одночасних траєкторій. Нові ваги надходили до парку інференсу в середньому приблизно за 12 секунд. 71 інцидент під час інференсу було оброблено без зупинки навчання.

Керований штраф за довжину навчив Beam розв’язувати завдання, використовуючи менше токенів. Навички роботи з вебом також покращилися без включення завдань із вебпереглядом до суміші для підсиленого навчання, що свідчить про перенесення навичок між агентними сферами.

Безпека та вирівнювання

Reflection навчила окремого вчителя безпеки та вирівнювання на основі контрольної точки після попереднього навчання. Цього вчителя було об’єднано з учителем підсиленого навчання за допомогою дистиляції за політикою на основі кількох учителів. Для навчання безпеки використовувалося деліберативне вирівнювання. Результати оцінювання безпеки з’являться в технічному звіті.

Бенчмарки (за даними Reflection)

У SWE-bench Verified Beam набирає 80,9 бала проти 70,7 у Nemotron 3 Ultra. У Terminal Bench v2.1 Beam набирає 80,1 бала, майже зрівнявшись із GLM 5.2 (81,0). Попереду там DeepSeek V4.1 Flash (90,6) і Kimi K3 (88,3). Ці показники наведені в таблиці Reflection, яка містить оцінки конкурентів із Artificial Analysis і DataCurve.

Beam проти найближчих конкурентів із відкритими вагами

ХарактеристикаReflection BeamGLM-5.2Nemotron 3 UltraDeepSeek V4.1 FlashKimi K3
РозробникReflection AI (США)Z.ai (Китай)NVIDIA (США)DeepSeek (Китай)Moonshot AI (Китай)
Загальна кількість параметрів501B~753B550B552B backbone + 196B Engram2.8T
Активні параметри23B~40B55B8B prefill / 16B decode104B
Контекст1M (ефективний)1MДо 1M1M1M
Вхідні даніТекстТекстТекстТекст + зображенняТекст + зображення
ЛіцензіяApache 2.0 (запланована)MITOpenMDW-1.1MITЛіцензія Kimi K3
ВагиПізніше в жовтні 2026 рокуДоступніДоступніДоступніДоступні
Terminal Bench v2.1*80.181.056.490.688.3
ДжерелоReflectionHugging FaceNVIDIAHugging FaceHugging Face

*Оцінки, опубліковані в анонсі Beam від Reflection. Характеристики перевірено 5 жовтня 2026 року.

Beam — найменша модель у цьому переліку за загальною кількістю параметрів. Її показник у 23B активних параметрів нижчий, ніж у GLM-5.2, Nemotron 3 Ultra та Kimi K3. Apache 2.0 і MIT — стандартні дозвільні ліцензії. Спеціальна ліцензія Kimi K3 додає вимоги щодо зазначення авторства для дуже великих продуктів.

Головні висновки

  • Beam — це MoE-модель із 501B параметрів і 23B активних параметрів, яка працює лише з текстом і має ефективний контекст у 1M токенів.
  • Попереднє навчання виконувалося на 23,8T токенів із використанням 6 144 графічних процесорів NVIDIA GB300 менш ніж за 4 тижні.
  • Підсилене навчання охопило понад 100M траєкторій на 10,5 тис. графічних процесорах GB300 протягом 4 тижнів.
  • Reflection повідомляє про результат 80,9 у SWE-bench Verified і 80,1 у Terminal Bench v2.1.
  • Випуск ваг за ліцензією Apache 2.0 заплановано на кінець цього місяця.

Ознайомтеся з технічними деталями та раннім доступом.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини