Sakhanda Wire
NVDA $238.90 +2.12% MSFT $525.18 +1.48% GOOGL $346.47 +0.86% META $741.90 +1.90% AMZN $251.40 -0.05%
← К новостям

Reflection AI представила Beam: MoE-модель с открытыми весами на 501 млрд параметров, из которых 23 млрд активны, для программирования и агентных задач

Reflection AI представила Beam — свою первую модель с открытыми весами. Beam — разреженная модель Mixture-of-Experts (MoE) с 501 млрд параметров в общей сложности и 23 млрд активных параметров на токен, созданная для задач программирования, рассуждений и работы агентов. По словам команды Reflection AI, Beam напрямую конкурирует с более крупными открытыми моделями, такими как GLM 5.2, используя в 3–4 раза меньше вычислительных ресурсов при инференсе на бенчмарках рассуждений.

Можно ли развернуть её уже сегодня? Пока нет — самостоятельный хостинг ещё недоступен. Beam находится на финальном этапе red teaming. Ранний доступ осуществляется через лист ожидания на платформе Reflection.

Что такое Reflection Beam?

Beam — универсальная агентная модель, обученная с нуля компанией Reflection AI. Она ориентирована на корпоративные задачи программирования и работу агентов. Reflection позиционирует Beam как шаг вперёд для западного направления моделей с открытыми весами. Исследовательская команда открыто говорит о существующем разрыве. Kimi K3 сохраняет лидерство по чистым возможностям, поэтому главное преимущество Beam — эффективность при инференсе.

Пользователи получают параметр интенсивности рассуждений. Низкие значения предпочтительны для коротких ответов. Более высокие значения позволяют дольше рассуждать над сложными задачами. Команды могут сопоставлять интенсивность с трудностью задачи и доступным вычислительным бюджетом.

Как обучалась Beam на этапе предобучения

Beam была предобучена на 23,8 трлн токенов из интернета, общедоступных источников и проприетарных лицензированных наборов данных. Команда Reflection заявляет, что её очистка удалила около 95% токенов из исходного интернет-корпуса. При этом были сохранены примерно 1,8 трлн высококачественных токенов, которые обычные фильтры отсеяли бы.

Архитектура сочетает локальное и глобальное внимание с экспертами, маршрутизация которых выполняется с высокой точностью. Балансировка нагрузки основана на балансировке без вспомогательных потерь из DeepSeek-V3 с добавлением косинусного затухания обновлений смещений экспертов. К концу предобучения наиболее загруженный эксперт достиг нагрузки всего в 1,04 раза выше средней. Во всех 52 слоях нормы остаточных связей оставались ограниченными благодаря масштабированию с учётом глубины, SandwichNorm, управлению вниманием и накоплению остаточных связей в FP32.

Предобучение завершилось менее чем за 4 недели на 6 144 GPU NVIDIA GB300 NVL72. К концу показатель goodput достиг 92,3%; за это время было выполнено 9 полуавтоматических откатов. В ходе промежуточного обучения эффективный контекст был расширен до 1 млн токенов.

Обучение с подкреплением на больших вычислительных ресурсах

Обучение с подкреплением (RL) — центральная ось масштабирования Beam. Обучение продолжалось 4 недели с использованием 10,5 тыс. GPU NVIDIA GB300, за это время было создано более 100 млн траекторий. Максимальный контекст одной траектории составлял 256 тыс. токенов. На обучение и оценивание пришлось около 1,3 млрд песочниц в почти 1 млн сред для программирования, работы агентов и задач STEM.

Reflection обучала модель с использованием полностью асинхронных градиентов политики. Каждый токен помечался версией политики, которая его создала. Новые алгоритмы сохраняли стабильность обучения даже при отставании в одни сутки — на 107 версий весов от текущей политики. Команда сообщает, что по мере увеличения вычислительных ресурсов для RL плато достигнуто не было.

Показатели инфраструктуры заслуживают внимания. Система в среднем поддерживала 110 тыс. параллельных траекторий. Новые веса поступали на кластер инференса в среднем примерно за 12 секунд. 71 инцидент с инференсом был обработан без остановки обучения.

Управляемый штраф за длину научил Beam решать задачи с меньшим количеством токенов. Навыки работы с веб-страницами также улучшились, хотя задачи с веб-навигацией не входили в набор RL, что указывает на перенос навыков между агентными областями.

Безопасность и выравнивание

Reflection обучила отдельную модель-учителя безопасности и выравнивания на основе предобученного чекпойнта. Затем эта модель-учитель была объединена с RL-учителем с помощью дистилляции по политике от нескольких учителей. Для обучения безопасности использовалось дедуктивное выравнивание. Результаты оценки безопасности будут опубликованы в техническом отчёте.

Бенчмарки (по данным Reflection)

В SWE-bench Verified Beam набирает 80,9 балла против 70,7 у Nemotron 3 Ultra. В Terminal Bench v2.1 Beam получает 80,1 балла, почти столько же, сколько GLM 5.2 с результатом 81,0. Там лидируют DeepSeek V4.1 Flash (90,6) и Kimi K3 (88,3). Эти значения взяты из таблицы Reflection, где результаты конкурирующих моделей указаны со ссылкой на Artificial Analysis и DataCurve.

Beam и ближайшие конкуренты с открытыми весами

ХарактеристикаReflection BeamGLM-5.2Nemotron 3 UltraDeepSeek V4.1 FlashKimi K3
РазработчикReflection AI (США)Z.ai (Китай)NVIDIA (США)DeepSeek (Китай)Moonshot AI (Китай)
Всего параметров501 млрд~753 млрд550 млрд552 млрд в базовой модели + 196 млрд Engram2,8 трлн
Активные параметры23 млрд~40 млрд55 млрд8 млрд при предварительном заполнении / 16 млрд при декодировании104 млрд
Контекст1 млн (эффективный)1 млнДо 1 млн1 млн1 млн
Входные данныеТекстТекстТекстТекст + изображениеТекст + изображение
ЛицензияApache 2.0 (планируется)MITOpenMDW-1.1MITЛицензия Kimi K3
ВесыПозже в октябре 2026 годаДоступныДоступныДоступныДоступны
Terminal Bench v2.1*80,181,056,490,688,3
ИсточникReflectionHugging FaceNVIDIAHugging FaceHugging Face

*Результаты опубликованы в анонсе Beam от Reflection. Спецификации проверены 5 октября 2026 года.

Beam — самая маленькая модель в этом сравнении по общему числу параметров. Её показатель в 23 млрд активных параметров ниже, чем у GLM-5.2, Nemotron 3 Ultra и Kimi K3. Apache 2.0 и MIT — стандартные разрешительные лицензии. Собственная лицензия Kimi K3 добавляет требования об указании авторства для очень крупных продуктов.

Основные выводы

  • Beam — MoE-модель с 501 млрд параметров, из которых 23 млрд активны; она работает только с текстом и имеет эффективный контекст в 1 млн токенов.
  • Предобучение использовало 23,8 трлн токенов и 6 144 GPU NVIDIA GB300 и завершилось менее чем за 4 недели.
  • RL включало более 100 млн траекторий на 10,5 тыс. GPU GB300 в течение 4 недель.
  • Reflection сообщает о результатах 80,9 в SWE-bench Verified и 80,1 в Terminal Bench v2.1.
  • Выпуск весов по лицензии Apache 2.0 запланирован на конец этого месяца.

Подробнее см. технические детали и ранний доступ.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости