Sakhanda Wire
NVDA $238.90 +2.12% MSFT $525.18 +1.48% GOOGL $346.47 +0.86% META $741.90 +1.90% AMZN $251.40 -0.05%
← Към новините

Reflection AI представи Beam: MoE модел с отворени тегла с 501 млрд. параметъра, от които 23 млрд. активни, за програмиране и задачи с ИИ агенти

Reflection AI представи Beam, първия си модел с отворени тегла. Beam е разреден модел от смес от експерти (MoE) с общо 501 млрд. параметъра и 23 млрд. активни параметъра на токен, създаден за програмиране, разсъждение и агентни работни натоварвания. Според екипа на Reflection AI Beam се конкурира директно с по-големи модели с отворени тегла като GLM 5.2, като използва 3 до 4 пъти по-малко изчислителни ресурси за инференция при бенчмаркове за разсъждение.

Може ли да бъде внедрен днес? Все още не за самостоятелно хостване. Beam е в последния етап на тестване от външни екипи за сигурност. Ранният достъп се осъществява чрез списък с чакащи в платформата на Reflection.

Какво представлява Reflection Beam?

Beam е универсален агентен модел, обучен от нулата от Reflection AI. Той е насочен към корпоративно програмиране и агентни работни натоварвания. Reflection представя Beam като напредък на западната граница при моделите с отворени тегла. Изследователският екип откровено признава разликата. Kimi K3 остава начело по сурови възможности, затова основното предимство на Beam е ефективността по време на инференция.

Потребителите получават параметър за усилието при разсъждение. По-ниските настройки насърчават кратки отговори. По-високите настройки позволяват по-продължително разсъждение при сложни задачи. Екипите могат да съобразят усилието със сложността на задачата и изчислителния бюджет.

Как е предварително обучен Beam

Beam е предварително обучен върху 23,8 трилиона токена от интернет, публични източници и лицензирани собствени набори от данни. Екипът на Reflection заявява, че при подбора са премахнати около 95% от суровите интернет токени. Същевременно са запазени приблизително 1,8 трилиона висококачествени токена, които конвенционалните филтри биха отхвърлили.

Архитектурата редува локално и глобално внимание с експерти, маршрутизирани с фина грануларност. Балансирането на натоварването се основава на балансирането без спомагателна загуба от DeepSeek-V3, като добавя косинусно затихване на актуализациите на експертните отмествания. Най-натовареният експерт е достигнал едва 1,04 пъти средното натоварване в края на предварителното обучение. Във всичките 52 слоя нормите на остатъците са останали ограничени чрез мащабиране според дълбочината, SandwichNorm, затваряне на вниманието и натрупване на остатъците с FP32.

Предварителното обучение е завършило за по-малко от 4 седмици върху 6144 графични процесора NVIDIA GB300 NVL72. В края коефициентът на полезна производителност е достигнал 92,3%, с 9 полуавтоматични връщания към предишни състояния. По време на междинното обучение ефективният контекст е разширен до 1 млн. токена.

Подсилващо обучение с висока изчислителна интензивност

Подсилващото обучение е основната ос за мащабиране на Beam. Обучението е използвало 10,5 хил. графични процесора NVIDIA GB300 в продължение на 4 седмици и е генерирало над 100 милиона траектории. Максималният контекст на една траектория е бил 256 хил. токена. Обучението и оценяването са използвали около 1,3 милиарда пясъчници в близо 1 милион среди за програмиране, агентни задачи и STEM.

Reflection е обучил модела с напълно асинхронни градиенти на политиката. Всеки токен е обозначен с версията на политиката, която го е генерирала. Нови алгоритми са запазили стабилността на обучението дори при еднодневно изоставане, тоест 107 версии на теглата зад текущата политика. Екипът съобщава, че не е наблюдавано плато с увеличаването на изчислителните ресурси за подсилващо обучение.

Показателите за инфраструктурата са впечатляващи. Системата е поддържала средно 110 хил. едновременни траектории. Новите тегла са достигали до флотилията за инференция за медианно време от около 12 секунди. 71 инцидента при инференцията са били обработени без спиране на обучението.

Контролируемото наказание за дължина е научило Beam да решава задачи с по-малко токени. Уменията за сърфиране също са се подобрили без задачи със сърфиране в сместа за подсилващо обучение, което предполага трансфер между различни агентни области.

Безопасност и съгласуване

Reflection е обучил отделен учител по безопасност и съгласуване от предварително обучения контролен пункт. Този учител е обединен с учителя за подсилващо обучение чрез дистилация на политика с множество учители. Обучението за безопасност е използвало делиберативно съгласуване. Резултатите от оценяването на безопасността ще бъдат публикувани в техническия доклад.

Бенчмаркове (според Reflection)

В SWE-bench Verified Beam постига 80,9 срещу 70,7 за Nemotron 3 Ultra. В Terminal Bench v2.1 Beam постига 80,1, близо до GLM 5.2 с 81,0. DeepSeek V4.1 Flash (90,6) и Kimi K3 (88,3) са начело там. Тези стойности са взети от таблицата на Reflection, която използва резултати на конкурентите от Artificial Analysis и DataCurve.

Beam спрямо най-близките конкуренти с отворени тегла

ХарактеристикаReflection BeamGLM-5.2Nemotron 3 UltraDeepSeek V4.1 FlashKimi K3
РазработчикReflection AI (САЩ)Z.ai (Китай)NVIDIA (САЩ)DeepSeek (Китай)Moonshot AI (Китай)
Общ брой параметри501 млрд.~753 млрд.550 млрд.552 млрд. основна мрежа + 196 млрд. Engram2,8 трлн.
Активни параметри23 млрд.~40 млрд.55 млрд.8 млрд. при предварително попълване / 16 млрд. при декодиране104 млрд.
Контекст1 млн. (ефективен)1 млн.До 1 млн.1 млн.1 млн.
ВходТекстТекстТекстТекст + изображениеТекст + изображение
ЛицензApache 2.0 (планиран)MITOpenMDW-1.1MITЛиценз Kimi K3
ТеглаПо-късно през октомври 2026 г.НаличниНаличниНаличниНалични
Terminal Bench v2.1*80,181,056,490,688,3
ИзточникReflectionHugging FaceNVIDIAHugging FaceHugging Face

*Резултати, публикувани в съобщението на Reflection за Beam. Спецификациите са проверени на 5 октомври 2026 г.

Beam е най-малкият модел тук по общ брой параметри. Неговите 23 млрд. активни параметъра са под стойностите на GLM-5.2, Nemotron 3 Ultra и Kimi K3. Apache 2.0 и MIT са стандартни либерални лицензи. Персонализираният лиценз на Kimi K3 добавя изисквания за посочване на авторството при много големи продукти.

Основни изводи

  • Beam е MoE модел с 501 млрд. параметъра и 23 млрд. активни параметъра, работи само с текст и има ефективен контекст от 1 млн. токена.
  • Предварителното обучение е използвало 23,8 трлн. токена върху 6144 графични процесора NVIDIA GB300 за по-малко от 4 седмици.
  • Подсилващото обучение е изпълнило над 100 млн. траектории върху 10,5 хил. графични процесора GB300 в продължение на 4 седмици.
  • Reflection съобщава резултат от 80,9 в SWE-bench Verified и 80,1 в Terminal Bench v2.1.
  • Теглата по лиценз Apache 2.0 са планирани за по-късно този месец.

Разгледайте Техническите подробности и Ранния достъп.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини