Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Cognition представила SWE-2: дообученную на базе Kimi K3 модель для написания кода, сравняющуюся с Fable 5.1 в FrontierCode при стоимости на 64% ниже

Cognition, компания, стоящая за агентом программирования Devin, выпустила SWE-2 — свою наиболее мощную на сегодняшний день модель для программирования. SWE-2 прошла постобучение с подкреплением на основе Kimi K3 — открытой модели Moonshot AI с 2,8 трлн параметров. Cognition сообщает о результате 50,0% на FrontierCode 1.1 Main, что менее чем на 1 пункт ниже Fable 5.1 при стоимости на 64% ниже. Это также первая модель Cognition с выбираемыми уровнями интенсивности рассуждений, все из которых обучались в рамках одного запуска RL.

Можно ли её развернуть? Не на собственной инфраструктуре. У SWE-2 нет открытых весов и отдельного API. Она работает только внутри Devin: сегодня в версиях Desktop и CLI, а версии Devin Web и Fusion постепенно становятся доступными.

Что такое SWE-2

SWE-2 создана на основе инфраструктуры и методики, использованных в SWE-1.7, которая прошла постобучение на базе Kimi K2.7. На этот раз Cognition масштабировала RL до диапазона в несколько триллионов параметров, используя базовую модель почти с втрое большим числом параметров. По словам Cognition, RL всё ещё позволяет добиться существенного прироста по сравнению с K3, добавляя от 5 до 6 пунктов по многим бенчмаркам.

Главное изменение — алгоритм RL, который обучает все 3 уровня интенсивности за один запуск. Для каждого уровня предусмотрен собственный штраф за стоимость, поэтому весь фронтир стоимости и производительности сдвигается одновременно.

Результаты бенчмарков

Cognition опубликовала следующую таблицу. Где это возможно, используются общедоступные результаты; в противном случае каждая модель запускается в собственной среде с максимально возможным качеством.

БенчмаркSWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 AstraSWE-1.7
FrontierCode 1.1 Main50.0%44.2%48.0%50.9%47.5%53.3%42.0%
DeepSWE 1.173.0%68.5%67.5%67.4%72.7%74.1%37.7%
Terminal-Bench 2.192.8%88.3%88.4%91.4%88.8%89.9%81.5%
Terminal-Bench 427.3%21.5%20.3%55.8%37.3%57.9%7.6%

SWE-2 лидирует в Terminal-Bench 2.1 и превосходит свою базовую модель K3 в каждой строке. Cognition утверждает, что модель отстаёт от GPT-6 Astra всего на несколько пунктов при четверти стоимости. Очевидное слабое место — Terminal-Bench 4, где SWE-2 уступает Fable 5.1 и GPT-6 Astra примерно на 30 пунктов. FrontierCode — собственный бенчмарк Cognition, а все показатели конкурирующих моделей получены в ходе оценки Cognition.

Поведение модели: меньше обходных путей

SWE-1.7 была склонна чрезмерно исследовать пространство решений на простых задачах. SWE-2 решает эту проблему благодаря тому, что Cognition называет сфокусированным исследованием. На FrontierCode 1.1 Main модель SWE-2 medium набирает больше баллов, чем SWE-1.7, при этом совершая на 58% меньше шагов и обходясь на 81% дешевле. Среднее число шагов за один запуск снижается со 127 (SWE-1.7) до 53 (medium), 80 (high) и 98 (max). SWE-2 medium вносит первое существенное изменение после медианных 18 шагов против 48 у SWE-1.7.

Команда Cognition также сообщает о 3 поведенческих особенностях: более полном сквозном тестовом покрытии, находчивости при блокировке инструмента и дисциплине проверки. При возникновении сомнений модель заново выводит заключения, а не просто повторно их утверждает.

Как проходило обучение

Штрафы за стоимость с учётом фронтира Парето: Вознаграждение равно R = S минус lambda, умноженное на C, где S — бинарный успех, а C объединяет стоимость вывода в долларах США и время выполнения. Cognition доказывает, что только линейный штраф позволяет цели RL зависеть исключительно от средней стоимости и доли решённых задач. Значение lambda для каждого уровня интенсивности устанавливается равным локальному наклону кривой Парето базовой модели. Благодаря этому линия изо-вознаграждения касается фронтира, и вознаграждение может расти только за счёт сдвига фронтира вверх.

Взвешенная по длине базовая линия вознаграждения: Cognition раскрывает базовую линию, используемую начиная с SWE-1.6. Поскольку величина градиента тесно коррелирует с длиной выполнения, групповая базовая линия взвешивается по числу токенов: сумма (R x L), делённая на сумму (L). В абляционных исследованиях это снижало расхождение KL между выводом и обучением и стабилизировало обучение без дополнительных вычислительных затрат.

Обслуживание запусков и численные методы: отложенная префиллом система группирует близкие по времени запросы, повышая TPM на GPU и TPS на запрос на 10–20%. Спекулятивное декодирование DSpark ускоряет запуски: черновая модель дообучается с помощью SpecForge для увеличения длины принимаемых последовательностей на 15%, а затем обучается онлайн одновременно с политикой. Ядра NVFP4 и FP8 с обучением с учётом квантования снижают потребление памяти и удерживают расхождение между обучением и выводом ниже уровней SWE-1.7.

Данные: Cognition утроила число сред RL, добавила надстройки для следования инструкциям и создала замкнутый цикл, в котором более ранние контрольные точки SWE-2 используются для исправления ложноположительных и ложноотрицательных результатов верификаторов.

Проверка надёжности

Cognition повторно провела 2 оценки из своего исследования надёжности моделей с открытым исходным кодом. В 145 политически чувствительных вопросах о Китае SWE-2 успешно прошла 98,0% проверок в целом: 99,8% на английском языке, 95,2% на упрощённом китайском и 99,1% на традиционном китайском. В контекстно-зависимом тесте на уязвимости с различными формулировками для клиентов ни одна формулировка не вызвала статистически значимого изменения ни для одной модели.

Интерактивное объяснение

Главные выводы

  • SWE-2 набирает 50,0% на FrontierCode 1.1 Main, отставая от Fable 5.1 менее чем на 1 пункт при стоимости на 64% ниже
  • Прошла постобучение на базе Kimi K3 с 2,8 трлн параметров; RL добавляет от 5 до 6 пунктов по большинству бенчмарков
  • Первая модель Cognition с уровнями интенсивности, все из которых обучались в рамках 1 запуска RL с использованием штрафов за стоимость, согласованных с наклоном
  • SWE-2 medium сокращает число шагов на 58%, а стоимость — на 81% по сравнению с SWE-1.7 на FrontierCode
  • Нет открытых весов и API: только Devin, бесплатно для платных тарифов до 10 октября 2026 года

Ознакомьтесь с техническими подробностями. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости