Cognition представила SWE-2: дообученную на базе Kimi K3 модель для написания кода, сравняющуюся с Fable 5.1 в FrontierCode при стоимости на 64% ниже
Cognition, компания, стоящая за агентом программирования Devin, выпустила SWE-2 — свою наиболее мощную на сегодняшний день модель для программирования. SWE-2 прошла постобучение с подкреплением на основе Kimi K3 — открытой модели Moonshot AI с 2,8 трлн параметров. Cognition сообщает о результате 50,0% на FrontierCode 1.1 Main, что менее чем на 1 пункт ниже Fable 5.1 при стоимости на 64% ниже. Это также первая модель Cognition с выбираемыми уровнями интенсивности рассуждений, все из которых обучались в рамках одного запуска RL.
Можно ли её развернуть? Не на собственной инфраструктуре. У SWE-2 нет открытых весов и отдельного API. Она работает только внутри Devin: сегодня в версиях Desktop и CLI, а версии Devin Web и Fusion постепенно становятся доступными.
Что такое SWE-2
SWE-2 создана на основе инфраструктуры и методики, использованных в SWE-1.7, которая прошла постобучение на базе Kimi K2.7. На этот раз Cognition масштабировала RL до диапазона в несколько триллионов параметров, используя базовую модель почти с втрое большим числом параметров. По словам Cognition, RL всё ещё позволяет добиться существенного прироста по сравнению с K3, добавляя от 5 до 6 пунктов по многим бенчмаркам.
Главное изменение — алгоритм RL, который обучает все 3 уровня интенсивности за один запуск. Для каждого уровня предусмотрен собственный штраф за стоимость, поэтому весь фронтир стоимости и производительности сдвигается одновременно.
Результаты бенчмарков
Cognition опубликовала следующую таблицу. Где это возможно, используются общедоступные результаты; в противном случае каждая модель запускается в собственной среде с максимально возможным качеством.
| Бенчмарк | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
SWE-2 лидирует в Terminal-Bench 2.1 и превосходит свою базовую модель K3 в каждой строке. Cognition утверждает, что модель отстаёт от GPT-6 Astra всего на несколько пунктов при четверти стоимости. Очевидное слабое место — Terminal-Bench 4, где SWE-2 уступает Fable 5.1 и GPT-6 Astra примерно на 30 пунктов. FrontierCode — собственный бенчмарк Cognition, а все показатели конкурирующих моделей получены в ходе оценки Cognition.
Поведение модели: меньше обходных путей
SWE-1.7 была склонна чрезмерно исследовать пространство решений на простых задачах. SWE-2 решает эту проблему благодаря тому, что Cognition называет сфокусированным исследованием. На FrontierCode 1.1 Main модель SWE-2 medium набирает больше баллов, чем SWE-1.7, при этом совершая на 58% меньше шагов и обходясь на 81% дешевле. Среднее число шагов за один запуск снижается со 127 (SWE-1.7) до 53 (medium), 80 (high) и 98 (max). SWE-2 medium вносит первое существенное изменение после медианных 18 шагов против 48 у SWE-1.7.
Команда Cognition также сообщает о 3 поведенческих особенностях: более полном сквозном тестовом покрытии, находчивости при блокировке инструмента и дисциплине проверки. При возникновении сомнений модель заново выводит заключения, а не просто повторно их утверждает.
Как проходило обучение
Штрафы за стоимость с учётом фронтира Парето: Вознаграждение равно R = S минус lambda, умноженное на C, где S — бинарный успех, а C объединяет стоимость вывода в долларах США и время выполнения. Cognition доказывает, что только линейный штраф позволяет цели RL зависеть исключительно от средней стоимости и доли решённых задач. Значение lambda для каждого уровня интенсивности устанавливается равным локальному наклону кривой Парето базовой модели. Благодаря этому линия изо-вознаграждения касается фронтира, и вознаграждение может расти только за счёт сдвига фронтира вверх.
Взвешенная по длине базовая линия вознаграждения: Cognition раскрывает базовую линию, используемую начиная с SWE-1.6. Поскольку величина градиента тесно коррелирует с длиной выполнения, групповая базовая линия взвешивается по числу токенов: сумма (R x L), делённая на сумму (L). В абляционных исследованиях это снижало расхождение KL между выводом и обучением и стабилизировало обучение без дополнительных вычислительных затрат.
Обслуживание запусков и численные методы: отложенная префиллом система группирует близкие по времени запросы, повышая TPM на GPU и TPS на запрос на 10–20%. Спекулятивное декодирование DSpark ускоряет запуски: черновая модель дообучается с помощью SpecForge для увеличения длины принимаемых последовательностей на 15%, а затем обучается онлайн одновременно с политикой. Ядра NVFP4 и FP8 с обучением с учётом квантования снижают потребление памяти и удерживают расхождение между обучением и выводом ниже уровней SWE-1.7.
Данные: Cognition утроила число сред RL, добавила надстройки для следования инструкциям и создала замкнутый цикл, в котором более ранние контрольные точки SWE-2 используются для исправления ложноположительных и ложноотрицательных результатов верификаторов.
Проверка надёжности
Cognition повторно провела 2 оценки из своего исследования надёжности моделей с открытым исходным кодом. В 145 политически чувствительных вопросах о Китае SWE-2 успешно прошла 98,0% проверок в целом: 99,8% на английском языке, 95,2% на упрощённом китайском и 99,1% на традиционном китайском. В контекстно-зависимом тесте на уязвимости с различными формулировками для клиентов ни одна формулировка не вызвала статистически значимого изменения ни для одной модели.
Интерактивное объяснение
Главные выводы
- SWE-2 набирает 50,0% на FrontierCode 1.1 Main, отставая от Fable 5.1 менее чем на 1 пункт при стоимости на 64% ниже
- Прошла постобучение на базе Kimi K3 с 2,8 трлн параметров; RL добавляет от 5 до 6 пунктов по большинству бенчмарков
- Первая модель Cognition с уровнями интенсивности, все из которых обучались в рамках 1 запуска RL с использованием штрафов за стоимость, согласованных с наклоном
- SWE-2 medium сокращает число шагов на 58%, а стоимость — на 81% по сравнению с SWE-1.7 на FrontierCode
- Нет открытых весов и API: только Devin, бесплатно для платных тарифов до 10 октября 2026 года
Ознакомьтесь с техническими подробностями. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.