Beam на Reflection става най-способният модел с отворени тегла, разработен извън Китай
Основни моменти
- Стартиращата компания за изкуствен интелект Reflection представя Beam — първия си модел с отворени тегла, създаден за програмиране и разсъждение, с фокус върху ефективността на изчисленията, а не върху суровата производителност.
- Beam активира само 23 милиарда от общо 501 милиарда параметъра за всеки токен и според Reflection се изравнява с GLM 5.2 по ключови бенчмаркове, като използва от три до четири пъти по-малко изчислителни ресурси.
- Моделът е обучен с обучение чрез подсилване върху 10 500 графични процесора Nvidia в продължение на четири седмици. Той ще бъде пуснат „по-късно този месец“ под лиценза Apache 2.0.
Компанията за изкуствен интелект Reflection обяви Beam — първия си свободно достъпен модел. Вместо да преследва върхова производителност, Beam се стреми да постига силни резултати с минимални изчислителни ресурси, като го поставя в пряка конкуренция с китайските модели с отворени тегла на Deepseek и Qwen.
Reflection създаде Beam за програмиране, логическо разсъждение и агентни задачи. Моделът от типа „смес от експерти“ активира 23 милиарда от общо 501 милиарда параметъра за всеки токен, което поддържа изчислителните разходи сравнително ниски.
При сложни задачи за разсъждение Beam се изравнява с GLM 5.2, като използва от три до четири пъти по-малко изчислителни ресурси, според Reflection. Компанията се насочва към бизнеса, който използва изкуствен интелект за програмиране и автоматизирани работни процеси, но трябва да държи оперативните разходи под контрол.
При бенчмаркове за програмиране и агенти Beam също се доближава до значително по-големия Qwen3.8-Max. По-силни отворени модели като Kimi K3 все още го превъзхождат по сурова производителност, твърди компанията. Reflection заявява, че вече обучава наследник, който цели да намали оставащата разлика спрямо най-добре представящите се отворени модели.

| Бенчмаркове за агентно програмиране | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingual | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
Мащабното обучение чрез подсилване стои зад способностите на Beam
Beam дължи способностите си на комбинация от стандартно широкомащабно предварително обучение и особено интензивен по отношение на изчисленията етап на обучение чрез подсилване. Reflection заявява, че по време на този етап е използвала 10 500 графични процесора Nvidia GB300 в продължение на над четири седмици, наричайки го един от най-големите тренировъчни процеси, провеждани някога от отворена лаборатория. Производителността е продължила да се подобрява до края на процеса, без да достигне плато.

Потребителите могат също да контролират колко задълбочено Beam разсъждава върху даден проблем. Настроиваем параметър позволява да изберете дали моделът да отговори бързо или да отдели повече време за размисъл при по-трудни задачи, като така се прави компромис между изчислителните разходи и качеството на резултата.

Reflection е наблюдавала това, което нарича „възникващи способности“ по време на обучението. Докато е изпълнявала смес от задачи за разсъждение, софтуерно инженерство и работа с терминал в рамките на обучението чрез подсилване, компанията е забелязала, че Beam започва да се справя по-добре с уеб сърфирането, въпреки че в този набор от обучителни задачи не е имало задачи за сърфиране. При достъп до интернет моделът самостоятелно се е научил да отправя заявки към други езикови модели и да извлича документи от външни услуги.
Reflection сподели няколко демонстрации, включително карта на метрото в Ню Йорк с актуализация в реално време, малка 3D игра и бележник за дообучаване на друг модел за изкуствен интелект. Beam работи само с текст, но Reflection заявява, че може да обработва съдържание от други медийни формати, стига то да е представено като текст.
Отделен модел се грижи за безопасността и съответствието
За безопасността и съответствието Reflection е обучила втори модел и го е обединила с Beam. Насоките варират от строги правила, които моделът никога не трябва да нарушава, до стандарти за качество като фактическа точност и признаване на несигурността, наред с директен, задълбочен и проактивен стил на отговаряне. Компанията планира да публикува резултатите от тестовете за безопасност в технически доклад и да предостави като отворен код разработените от нея методи за оценяване.
Според компанията технически доклад, документация за разработчици и теглата на модела под отворения лиценз Apache 2.0 ще бъдат публикувани „по-късно този месец“. Beam все още преминава през финални тестове за безопасност, а засега ранна версия е достъпна за избрани потребители.
Бивши изследователи на DeepMind, подкрепени с 2 милиарда долара
Reflection е основана през 2024 г. от бившите изследователи на Google DeepMind Misha Laskin и Ioannis Antonoglou. Laskin е ръководил моделирането на награди за Gemini, а Antonoglou е помогнал за създаването на AlphaGo. Стартъпът стартира през март 2025 г. с 130 милиона долара начално финансиране и целта да създаде свръхинтелигентност чрез автономно програмиране. Идеята е езиковите модели да се научат да действат толкова самостоятелно, колкото AlphaGo играе го, като използват обучение чрез подсилване върху компютри.
През лятото на 2025 г. компанията пусна Asimov — агент за анализ на големи кодови бази. След това Reflection набра 2 милиарда долара при оценка от 8 милиарда долара през октомври 2025 г., като сред инвеститорите беше Nvidia, и оттогава се позиционира като западен аналог на Deepseek и Qwen. Компанията публикува теглата на моделите си, но запазва данните за обучение и работните процеси като собственост. По-скоро Reflection подписа договори за изчислителни ресурси за милиарди долари със SpaceX и доставчика на облачни услуги Nebius.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен информационен бюлетин за изкуствения интелект, нашия ексклузивен годишен доклад за водещите технологии „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.