Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← До новин

Beam від Reflection стає найпотужнішою моделлю з відкритими вагами, створеною за межами Китаю

Відкритий ваговий моделлю Beam від Reflection стала найпотужнішою моделлю, створеною за межами Китаю
Джонатан Кемпер
6 жовтня 2026 року
Reflection

Ключові моменти

  • ШІ-стартап Reflection випускає Beam — свою першу модель із відкритими вагами, створену для програмування та міркування, з акцентом на ефективність обчислень, а не на максимальну продуктивність.
  • Beam активує лише 23 мільярди зі своїх 501 мільярда параметрів для кожного токена й, за даними Reflection, відповідає GLM 5.2 за ключовими бенчмарками, використовуючи втричі-вчетверо менше обчислювальних ресурсів.
  • Модель навчали з підкріпленням на 10 500 графічних процесорах Nvidia протягом чотирьох тижнів. Вона вийде «пізніше цього місяця» за ліцензією Apache 2.0.

ШІ-компанія Reflection представила Beam — свою першу модель, доступну безкоштовно. Замість гонитви за максимальною продуктивністю Beam прагне забезпечити сильні результати за мінімальних обчислювальних витрат, безпосередньо конкуруючи з китайськими моделями з відкритими вагами від Deepseek і Qwen.

Reflection створила Beam для програмування, логічного міркування та агентних завдань. Модель на основі суміші експертів активує 23 мільярди зі своїх 501 мільярда загальних параметрів для кожного токена, зберігаючи відносно низькі витрати на обчислення.

За даними Reflection, у складних завданнях на міркування Beam відповідає GLM 5.2, використовуючи втричі-вчетверо менше обчислювальних ресурсів. Компанія орієнтується на бізнеси, які використовують ШІ для програмування й автоматизованих робочих процесів, але мають контролювати операційні витрати.

У бенчмарках програмування та агентних завдань Beam також наближається до значно більшої Qwen3.8-Max. За словами компанії, потужніші відкриті моделі, як-от Kimi K3, усе ще випереджають її за абсолютною продуктивністю. Reflection повідомляє, що вже навчає наступницю Beam, яка має скоротити розрив із найпродуктивнішими відкритими моделями.

Три точкові графіки для DeepSWE v1.1, HLE і Terminal Bench 2.1 показують оцінки Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra та Muse Glimmer у бенчмарках залежно від орієнтовної вартості обчислень у PFLOP на одну спробу.
За даними Reflection, у всіх трьох бенчмарках Beam забезпечує зіставні результати, використовуючи значно менше обчислювальних ресурсів, ніж GLM-5.2 і Qwen 3.8. | Зображення: Reflection
Бенчмарки агентного програмування Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

Масштабне навчання з підкріпленням забезпечило можливості Beam

Beam отримала свої можливості завдяки поєднанню стандартного широкомасштабного попереднього навчання та особливо ресурсоємного етапу навчання з підкріпленням. Reflection повідомляє, що під час цього етапу навчання з підкріпленням використовувала 10 500 графічних процесорів Nvidia GB300 протягом понад чотирьох тижнів, називаючи його одним із найбільших навчальних запусків, проведених будь-якою відкритою лабораторією. Продуктивність продовжувала зростати до кінця процесу, не досягнувши плато.

Три лінійні графіки показують, як оцінки Beam у DeepSWE, HLE та Terminal Bench 2.1 стабільно зростають зі збільшенням кількості запусків навчання з підкріпленням — до понад 80 мільйонів.
Оцінки Beam у бенчмарках продовжували зростати протягом усього навчання з підкріпленням, без ознак виходу на плато навіть після понад 80 мільйонів запусків. | Зображення: Reflection

Користувачі також можуть контролювати, наскільки ретельно Beam міркує над проблемою. Налаштовуваний параметр дає змогу обрати, чи відповідатиме модель швидко, чи витратить більше часу на обдумування складніших завдань, забезпечуючи компроміс між обчислювальними витратами та якістю результату.

Три точкові графіки для DeepSWE v1.1, HLE та Terminal Bench 2.1 показують оцінки Beam і конкуруючих моделей у бенчмарках залежно від середньої кількості згенерованих токенів.
За кількістю згенерованих токенів Beam також працює ефективніше за GLM-5.2 і Qwen 3.8 за зіставних рівнів продуктивності. | Зображення: Reflection

Reflection спостерігала під час навчання те, що називає «виниклими можливостями». Під час навчання з підкріпленням на суміші завдань із міркування, програмної інженерії та роботи в терміналі компанія помітила, що Beam стала краще переглядати вебсторінки, хоча завдань із вебперегляду в цій навчальній суміші не було. Отримавши доступ до вебу, модель самостійно навчилася надсилати запити до інших мовних моделей і отримувати документи із зовнішніх сервісів.

Reflection поділилася кількома демонстраціями, зокрема картою метро Нью-Йорка, що оновлюється в реальному часі, невеликою 3D-грою та ноутбуком для донавчання іншої ШІ-моделі. Beam працює лише з текстом, але Reflection стверджує, що модель може обробляти вміст інших форматів, якщо його представлено як текст.

Окрема модель відповідає за безпеку та узгодження

Для забезпечення безпеки та узгодження Reflection навчила другу модель і об’єднала її з Beam. Настанови охоплюють як жорсткі правила, які модель ніколи не повинна порушувати, так і стандарти якості — наприклад, фактичну точність і визнання невизначеності, а також прямий, ґрунтовний і проактивний стиль відповідей. Компанія планує опублікувати результати тестування безпеки в технічному звіті та відкрити вихідний код розроблених нею методів оцінювання.

За даними компанії, технічний звіт, документація для розробників і ваги моделі за відкритою ліцензією Apache 2.0 вийдуть «пізніше цього місяця». Beam все ще проходить фінальне тестування безпеки, а наразі вибрані користувачі можуть скористатися ранньою версією.

Колишні дослідники DeepMind, яких підтримали 2 мільярди доларів

Компанію Reflection у 2024 році заснували колишні дослідники Google DeepMind Міша Ласкін та Іоанніс Антоноглу. Ласкін керував моделюванням винагороди для Gemini, а Антоноглу допомагав створювати AlphaGo. Стартап запустився в березні 2025 року, залучивши 130 мільйонів доларів початкового фінансування та поставивши за мету створити суперінтелект за допомогою автономного програмування. Ідея полягала в тому, що мовні моделі можуть навчитися діяти так само незалежно, як AlphaGo грає в го, використовуючи навчання з підкріпленням на комп’ютерах.

Улітку 2025 року компанія випустила Asimov — агента для аналізу великих кодових баз. Потім у жовтні 2025 року Reflection залучила 2 мільярди доларів за оцінки в 8 мільярдів доларів, серед інвесторів була Nvidia, і відтоді позиціонує себе як західного конкурента Deepseek і Qwen. Компанія відкриває ваги своїх моделей, але зберігає дані для навчання та конвеєри у власності. Нещодавно Reflection уклала багатомільярдні угоди на обчислювальні потужності зі SpaceX і хмарним провайдером Nebius.

Новини про ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний граничний звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерело: Reflection

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини