Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← Към новините

Beam на Reflection става най-способният модел с отворени тегла, разработен извън Китай

Reflection's Beam се превръща в най-способния модел с отворени тегла, създаден извън Китай
Jonathan Kemper
6 окт. 2026 г.
Reflection

Основни моменти

  • Стартиращата компания за изкуствен интелект Reflection представя Beam — първия си модел с отворени тегла, създаден за програмиране и разсъждение, с фокус върху ефективността на изчисленията, а не върху суровата производителност.
  • Beam активира само 23 милиарда от общо 501 милиарда параметъра за всеки токен и според Reflection се изравнява с GLM 5.2 по ключови бенчмаркове, като използва от три до четири пъти по-малко изчислителни ресурси.
  • Моделът е обучен с обучение чрез подсилване върху 10 500 графични процесора Nvidia в продължение на четири седмици. Той ще бъде пуснат „по-късно този месец“ под лиценза Apache 2.0.

Компанията за изкуствен интелект Reflection обяви Beam — първия си свободно достъпен модел. Вместо да преследва върхова производителност, Beam се стреми да постига силни резултати с минимални изчислителни ресурси, като го поставя в пряка конкуренция с китайските модели с отворени тегла на Deepseek и Qwen.

Reflection създаде Beam за програмиране, логическо разсъждение и агентни задачи. Моделът от типа „смес от експерти“ активира 23 милиарда от общо 501 милиарда параметъра за всеки токен, което поддържа изчислителните разходи сравнително ниски.

При сложни задачи за разсъждение Beam се изравнява с GLM 5.2, като използва от три до четири пъти по-малко изчислителни ресурси, според Reflection. Компанията се насочва към бизнеса, който използва изкуствен интелект за програмиране и автоматизирани работни процеси, но трябва да държи оперативните разходи под контрол.

При бенчмаркове за програмиране и агенти Beam също се доближава до значително по-големия Qwen3.8-Max. По-силни отворени модели като Kimi K3 все още го превъзхождат по сурова производителност, твърди компанията. Reflection заявява, че вече обучава наследник, който цели да намали оставащата разлика спрямо най-добре представящите се отворени модели.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
И при трите бенчмарка Beam постига сравними резултати, като използва много по-малко изчислителни ресурси от GLM-5.2 и Qwen 3.8, според Reflection. | Изображение: Reflection
Бенчмаркове за агентно програмиране Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

Мащабното обучение чрез подсилване стои зад способностите на Beam

Beam дължи способностите си на комбинация от стандартно широкомащабно предварително обучение и особено интензивен по отношение на изчисленията етап на обучение чрез подсилване. Reflection заявява, че по време на този етап е използвала 10 500 графични процесора Nvidia GB300 в продължение на над четири седмици, наричайки го един от най-големите тренировъчни процеси, провеждани някога от отворена лаборатория. Производителността е продължила да се подобрява до края на процеса, без да достигне плато.

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
Резултатите на Beam в бенчмарковете са продължили да се повишават през целия процес на обучение чрез подсилване, без признаци на плато дори при над 80 милиона повторения. | Изображение: Reflection

Потребителите могат също да контролират колко задълбочено Beam разсъждава върху даден проблем. Настроиваем параметър позволява да изберете дали моделът да отговори бързо или да отдели повече време за размисъл при по-трудни задачи, като така се прави компромис между изчислителните разходи и качеството на резултата.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
Измерен чрез броя генерирани токени, Beam също работи по-ефективно от GLM-5.2 и Qwen 3.8 при сходни нива на производителност. | Изображение: Reflection

Reflection е наблюдавала това, което нарича „възникващи способности“ по време на обучението. Докато е изпълнявала смес от задачи за разсъждение, софтуерно инженерство и работа с терминал в рамките на обучението чрез подсилване, компанията е забелязала, че Beam започва да се справя по-добре с уеб сърфирането, въпреки че в този набор от обучителни задачи не е имало задачи за сърфиране. При достъп до интернет моделът самостоятелно се е научил да отправя заявки към други езикови модели и да извлича документи от външни услуги.

Reflection сподели няколко демонстрации, включително карта на метрото в Ню Йорк с актуализация в реално време, малка 3D игра и бележник за дообучаване на друг модел за изкуствен интелект. Beam работи само с текст, но Reflection заявява, че може да обработва съдържание от други медийни формати, стига то да е представено като текст.

Отделен модел се грижи за безопасността и съответствието

За безопасността и съответствието Reflection е обучила втори модел и го е обединила с Beam. Насоките варират от строги правила, които моделът никога не трябва да нарушава, до стандарти за качество като фактическа точност и признаване на несигурността, наред с директен, задълбочен и проактивен стил на отговаряне. Компанията планира да публикува резултатите от тестовете за безопасност в технически доклад и да предостави като отворен код разработените от нея методи за оценяване.

Според компанията технически доклад, документация за разработчици и теглата на модела под отворения лиценз Apache 2.0 ще бъдат публикувани „по-късно този месец“. Beam все още преминава през финални тестове за безопасност, а засега ранна версия е достъпна за избрани потребители.

Бивши изследователи на DeepMind, подкрепени с 2 милиарда долара

Reflection е основана през 2024 г. от бившите изследователи на Google DeepMind Misha Laskin и Ioannis Antonoglou. Laskin е ръководил моделирането на награди за Gemini, а Antonoglou е помогнал за създаването на AlphaGo. Стартъпът стартира през март 2025 г. с 130 милиона долара начално финансиране и целта да създаде свръхинтелигентност чрез автономно програмиране. Идеята е езиковите модели да се научат да действат толкова самостоятелно, колкото AlphaGo играе го, като използват обучение чрез подсилване върху компютри.

През лятото на 2025 г. компанията пусна Asimov — агент за анализ на големи кодови бази. След това Reflection набра 2 милиарда долара при оценка от 8 милиарда долара през октомври 2025 г., като сред инвеститорите беше Nvidia, и оттогава се позиционира като западен аналог на Deepseek и Qwen. Компанията публикува теглата на моделите си, но запазва данните за обучение и работните процеси като собственост. По-скоро Reflection подписа договори за изчислителни ресурси за милиарди долари със SpaceX и доставчика на облачни услуги Nebius.

Новини за изкуствения интелект без сензации – подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен информационен бюлетин за изкуствения интелект, нашия ексклузивен годишен доклад за водещите технологии „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.

Източник: Reflection

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини