Reflection AI представила Beam: MoE-модель с открытыми весами на 501 млрд параметров, из которых 23 млрд активны, для программирования и агентных задач
Reflection AI представила Beam — свою первую модель с открытыми весами. Beam — разреженная модель Mixture-of-Experts (MoE) с 501 млрд параметров в общей сложности и 23 млрд активных параметров на токен, созданная для задач программирования, рассуждений и работы агентов. По словам команды Reflection AI, Beam напрямую конкурирует с более крупными открытыми моделями, такими как GLM 5.2, используя в 3–4 раза меньше вычислительных ресурсов при инференсе на бенчмарках рассуждений.
Можно ли развернуть её уже сегодня? Пока нет — самостоятельный хостинг ещё недоступен. Beam находится на финальном этапе red teaming. Ранний доступ осуществляется через лист ожидания на платформе Reflection.
Что такое Reflection Beam?
Beam — универсальная агентная модель, обученная с нуля компанией Reflection AI. Она ориентирована на корпоративные задачи программирования и работу агентов. Reflection позиционирует Beam как шаг вперёд для западного направления моделей с открытыми весами. Исследовательская команда открыто говорит о существующем разрыве. Kimi K3 сохраняет лидерство по чистым возможностям, поэтому главное преимущество Beam — эффективность при инференсе.
Пользователи получают параметр интенсивности рассуждений. Низкие значения предпочтительны для коротких ответов. Более высокие значения позволяют дольше рассуждать над сложными задачами. Команды могут сопоставлять интенсивность с трудностью задачи и доступным вычислительным бюджетом.
Как обучалась Beam на этапе предобучения
Beam была предобучена на 23,8 трлн токенов из интернета, общедоступных источников и проприетарных лицензированных наборов данных. Команда Reflection заявляет, что её очистка удалила около 95% токенов из исходного интернет-корпуса. При этом были сохранены примерно 1,8 трлн высококачественных токенов, которые обычные фильтры отсеяли бы.
Архитектура сочетает локальное и глобальное внимание с экспертами, маршрутизация которых выполняется с высокой точностью. Балансировка нагрузки основана на балансировке без вспомогательных потерь из DeepSeek-V3 с добавлением косинусного затухания обновлений смещений экспертов. К концу предобучения наиболее загруженный эксперт достиг нагрузки всего в 1,04 раза выше средней. Во всех 52 слоях нормы остаточных связей оставались ограниченными благодаря масштабированию с учётом глубины, SandwichNorm, управлению вниманием и накоплению остаточных связей в FP32.
Предобучение завершилось менее чем за 4 недели на 6 144 GPU NVIDIA GB300 NVL72. К концу показатель goodput достиг 92,3%; за это время было выполнено 9 полуавтоматических откатов. В ходе промежуточного обучения эффективный контекст был расширен до 1 млн токенов.
Обучение с подкреплением на больших вычислительных ресурсах
Обучение с подкреплением (RL) — центральная ось масштабирования Beam. Обучение продолжалось 4 недели с использованием 10,5 тыс. GPU NVIDIA GB300, за это время было создано более 100 млн траекторий. Максимальный контекст одной траектории составлял 256 тыс. токенов. На обучение и оценивание пришлось около 1,3 млрд песочниц в почти 1 млн сред для программирования, работы агентов и задач STEM.
Reflection обучала модель с использованием полностью асинхронных градиентов политики. Каждый токен помечался версией политики, которая его создала. Новые алгоритмы сохраняли стабильность обучения даже при отставании в одни сутки — на 107 версий весов от текущей политики. Команда сообщает, что по мере увеличения вычислительных ресурсов для RL плато достигнуто не было.
Показатели инфраструктуры заслуживают внимания. Система в среднем поддерживала 110 тыс. параллельных траекторий. Новые веса поступали на кластер инференса в среднем примерно за 12 секунд. 71 инцидент с инференсом был обработан без остановки обучения.
Управляемый штраф за длину научил Beam решать задачи с меньшим количеством токенов. Навыки работы с веб-страницами также улучшились, хотя задачи с веб-навигацией не входили в набор RL, что указывает на перенос навыков между агентными областями.
Безопасность и выравнивание
Reflection обучила отдельную модель-учителя безопасности и выравнивания на основе предобученного чекпойнта. Затем эта модель-учитель была объединена с RL-учителем с помощью дистилляции по политике от нескольких учителей. Для обучения безопасности использовалось дедуктивное выравнивание. Результаты оценки безопасности будут опубликованы в техническом отчёте.
Бенчмарки (по данным Reflection)
В SWE-bench Verified Beam набирает 80,9 балла против 70,7 у Nemotron 3 Ultra. В Terminal Bench v2.1 Beam получает 80,1 балла, почти столько же, сколько GLM 5.2 с результатом 81,0. Там лидируют DeepSeek V4.1 Flash (90,6) и Kimi K3 (88,3). Эти значения взяты из таблицы Reflection, где результаты конкурирующих моделей указаны со ссылкой на Artificial Analysis и DataCurve.
Beam и ближайшие конкуренты с открытыми весами
| Характеристика | Reflection Beam | GLM-5.2 | Nemotron 3 Ultra | DeepSeek V4.1 Flash | Kimi K3 |
|---|---|---|---|---|---|
| Разработчик | Reflection AI (США) | Z.ai (Китай) | NVIDIA (США) | DeepSeek (Китай) | Moonshot AI (Китай) |
| Всего параметров | 501 млрд | ~753 млрд | 550 млрд | 552 млрд в базовой модели + 196 млрд Engram | 2,8 трлн |
| Активные параметры | 23 млрд | ~40 млрд | 55 млрд | 8 млрд при предварительном заполнении / 16 млрд при декодировании | 104 млрд |
| Контекст | 1 млн (эффективный) | 1 млн | До 1 млн | 1 млн | 1 млн |
| Входные данные | Текст | Текст | Текст | Текст + изображение | Текст + изображение |
| Лицензия | Apache 2.0 (планируется) | MIT | OpenMDW-1.1 | MIT | Лицензия Kimi K3 |
| Весы | Позже в октябре 2026 года | Доступны | Доступны | Доступны | Доступны |
| Terminal Bench v2.1* | 80,1 | 81,0 | 56,4 | 90,6 | 88,3 |
| Источник | Reflection | Hugging Face | NVIDIA | Hugging Face | Hugging Face |
*Результаты опубликованы в анонсе Beam от Reflection. Спецификации проверены 5 октября 2026 года.
Beam — самая маленькая модель в этом сравнении по общему числу параметров. Её показатель в 23 млрд активных параметров ниже, чем у GLM-5.2, Nemotron 3 Ultra и Kimi K3. Apache 2.0 и MIT — стандартные разрешительные лицензии. Собственная лицензия Kimi K3 добавляет требования об указании авторства для очень крупных продуктов.
Основные выводы
- Beam — MoE-модель с 501 млрд параметров, из которых 23 млрд активны; она работает только с текстом и имеет эффективный контекст в 1 млн токенов.
- Предобучение использовало 23,8 трлн токенов и 6 144 GPU NVIDIA GB300 и завершилось менее чем за 4 недели.
- RL включало более 100 млн траекторий на 10,5 тыс. GPU GB300 в течение 4 недель.
- Reflection сообщает о результатах 80,9 в SWE-bench Verified и 80,1 в Terminal Bench v2.1.
- Выпуск весов по лицензии Apache 2.0 запланирован на конец этого месяца.
Подробнее см. технические детали и ранний доступ.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.