Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← К новостям

Beam от Reflection становится самой мощной моделью с открытыми весами, созданной за пределами Китая

Отражение: Beam становится самой способной открытой моделью, созданной за пределами Китая
Jonathan Kemper
6 окт. 2026 г.
Reflection

Ключевые моменты

  • ИИ-стартап Reflection выпускает Beam — свою первую модель с открытыми весами, созданную для программирования и рассуждений с акцентом на эффективность вычислений, а не на максимальную производительность.
  • Beam активирует всего 23 млрд из 501 млрд параметров на токен и, по данным Reflection, соответствует GLM 5.2 по ключевым тестам, используя в три-четыре раза меньше вычислительных ресурсов.
  • Модель обучалась с подкреплением на 10 500 графических процессорах Nvidia в течение четырех недель. Она выйдет «позже в этом месяце» под лицензией Apache 2.0.

ИИ-компания Reflection представила Beam — свою первую свободно доступную модель. Вместо погони за максимальной производительностью Beam стремится обеспечивать высокие результаты при минимальных вычислительных затратах, напрямую конкурируя с китайскими моделями с открытыми весами от Deepseek и Qwen.

Reflection создала Beam для программирования, логических рассуждений и агентных задач. Модель на основе смеси экспертов активирует 23 млрд из 501 млрд общего числа параметров на токен, сохраняя относительно низкие вычислительные затраты.

В сложных задачах на рассуждение Beam соответствует GLM 5.2, используя в три-четыре раза меньше вычислительных ресурсов, утверждает Reflection. Компания ориентируется на бизнес, использующий ИИ для программирования и автоматизированных рабочих процессов, но стремящийся контролировать операционные расходы.

В тестах на программирование и работу агентов Beam также приближается к значительно более крупной модели Qwen3.8-Max. По словам компании, более сильные открытые модели, такие как Kimi K3, по-прежнему превосходят ее по абсолютной производительности. Reflection заявляет, что уже обучает преемника Beam, который должен сократить оставшийся разрыв с лучшими открытыми моделями.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
По данным Reflection, во всех трех тестах Beam показывает сопоставимые результаты, используя гораздо меньше вычислительных ресурсов, чем GLM-5.2 и Qwen 3.8. | Изображение: Reflection
Тесты агентного программирования Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

Масштабный этап обучения с подкреплением обеспечил возможности Beam

Beam получила свои возможности благодаря сочетанию стандартного крупномасштабного предварительного обучения и особенно ресурсоемкого этапа обучения с подкреплением. Reflection сообщает, что на этом этапе использовала 10 500 графических процессоров Nvidia GB300 на протяжении более четырех недель, называя его одним из крупнейших обучающих запусков, проведенных когда-либо открытой лабораторией. Производительность продолжала расти до конца процесса, не достигая плато.

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
Результаты Beam в тестах продолжали расти на протяжении всего обучения с подкреплением, без признаков выхода на плато даже после более чем 80 млн итераций. | Изображение: Reflection

Пользователи также могут управлять глубиной рассуждений Beam при решении задачи. Настраиваемый параметр позволяет выбрать, будет ли модель отвечать быстро или потратит больше времени на размышления при решении сложных задач, регулируя соотношение вычислительных затрат и качества результата.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
Если измерять эффективность количеством сгенерированных токенов, Beam также работает эффективнее GLM-5.2 и Qwen 3.8 при сопоставимом уровне производительности. | Изображение: Reflection

Reflection наблюдала то, что называет «возникающими способностями», в процессе обучения. При проведении обучения с подкреплением на смеси задач, связанных с рассуждением, разработкой программного обеспечения и работой в терминале, компания заметила, что Beam стала лучше работать с веб-браузингом, хотя в эту обучающую смесь задачи на работу с вебом не входили. Получив доступ к вебу, модель самостоятельно научилась отправлять запросы другим языковым моделям и извлекать документы из внешних сервисов.

Reflection представила несколько демонстраций, включая обновляемую в реальном времени карту метро Нью-Йорка, небольшую 3D-игру и блокнот для дообучения другой ИИ-модели. Beam работает только с текстом, но Reflection утверждает, что модель может обрабатывать содержимое других медиаформатов, если оно представлено в виде текста.

Отдельная модель отвечает за безопасность и согласование

Для обеспечения безопасности и согласования Reflection обучила вторую модель и объединила ее с Beam. Руководящие принципы варьируются от жестких правил, которые модель никогда не должна нарушать, до стандартов качества, таких как фактическая точность и признание неопределенности, а также прямой, подробный и проактивный стиль ответов. Компания планирует опубликовать результаты тестирования безопасности в техническом отчете и открыть исходный код разработанных ею методов оценки.

По данным компании, технический отчет, документация для разработчиков и веса модели под открытой лицензией Apache 2.0 выйдут «позже в этом месяце». Beam все еще проходит финальное тестирование безопасности, а ранняя версия пока доступна избранным пользователям.

Бывшие исследователи DeepMind, получившие поддержку в размере $2 млрд

Компания Reflection была основана в 2024 году бывшими исследователями Google DeepMind Мишей Ласкиным и Яннисом Антоглопулосом. Ласкин руководил созданием моделей вознаграждения для Gemini, а Антоглопулос помогал разрабатывать AlphaGo. Стартап запустился в марте 2025 года, получив $130 млн посевного финансирования и поставив цель создать сверхинтеллект с помощью автономного программирования. Идея заключалась в том, что языковые модели смогут научиться действовать столь же самостоятельно, как AlphaGo играет в го, используя обучение с подкреплением на компьютерах.

Летом 2025 года компания выпустила Asimov — агента для анализа больших кодовых баз. Затем в октябре 2025 года Reflection привлекла $2 млрд при оценке в $8 млрд, среди инвесторов была Nvidia, и с тех пор позиционирует себя как западный аналог Deepseek и Qwen. Компания выпускает веса своих моделей, но сохраняет обучающие данные и пайплайны закрытыми. Недавно Reflection заключила многомиллиардные соглашения на вычислительные мощности с SpaceX и облачным провайдером Nebius.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный пограничный отчет «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.

Источник: Reflection

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости