Cognition представила SWE-2: донавчену на базі Kimi K3 модель для написання коду, що відповідає Fable 5.1 у FrontierCode за вартості на 64% нижчої
Cognition, компанія, що стоїть за програмним агентом Devin, випустила SWE-2 — свою найпотужнішу на сьогодні модель для програмування. SWE-2 донавчено за допомогою навчання з підкріпленням на основі Kimi K3 — відкритої моделі Moonshot AI із 2,8 трлн параметрів. Cognition повідомляє, що модель набрала 50,0% у FrontierCode 1.1 Main, поступившись Fable 5.1 менш ніж на 1 пункт за вартості на 64% нижчої. Це також перша модель Cognition із вибором рівня зусиль міркування, причому всі рівні було навчено в межах одного запуску RL.
Чи можна її розгорнути? Не на власній інфраструктурі. SWE-2 не має відкритих ваг і окремого API. Вона працює лише всередині Devin: сьогодні — у версіях Desktop і CLI, а Devin Web і Fusion поступово стають доступними.
Що таке SWE-2
SWE-2 розвиває інфраструктуру та підхід, що лежать в основі SWE-1.7, яку було донавчено на основі Kimi K2.7. Цього разу Cognition масштабувала RL до режиму з кількома трильйонами параметрів, використавши базову модель майже утричі більшого розміру. За словами Cognition, її RL усе ще забезпечує значний потенціал для покращення поверх K3, додаючи від 5 до 6 пунктів у багатьох бенчмарках.
Головна зміна — алгоритм RL, який навчає всі 3 рівні зусиль за один запуск. Кожен рівень має власний штраф за вартість, тож уся компромісна межа вартості й продуктивності зміщується одночасно.
Результати бенчмарків
Cognition опублікувала наведену нижче таблицю. Де це можливо, використано публічні результати; в інших випадках кожна модель працює у власному середовищі оцінювання з максимально можливим рівнем зусиль.
| Бенчмарк | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
SWE-2 лідирує в Terminal-Bench 2.1 і перевершує свою базову модель K3 у кожному рядку. Cognition стверджує, що модель відстає від GPT-6 Astra лише на кілька пунктів, коштуючи чверть від її вартості. Очевидне слабке місце — Terminal-Bench 4, де SWE-2 поступається Fable 5.1 і GPT-6 Astra приблизно на 30 пунктів. FrontierCode — власний бенчмарк Cognition, а всі показники конкурентів отримано в оцінюванні Cognition.
Поведінка моделі: менше обхідних шляхів
SWE-1.7 була схильна надмірно досліджувати прості завдання. SWE-2 розв’язує цю проблему завдяки тому, що Cognition називає сфокусованим дослідженням. У FrontierCode 1.1 Main SWE-2 medium набирає більше балів, ніж SWE-1.7, виконуючи на 58% менше кроків і коштуючи на 81% дешевше. Середня кількість кроків за запуск зменшується зі 127 (SWE-1.7) до 53 (medium), 80 (high) і 98 (max). SWE-2 medium вносить першу суттєву зміну в код після медіанних 18 кроків, тоді як SWE-1.7 — після 48.
Команда Cognition також повідомляє про 3 поведінкові закономірності: краще наскрізне тестове покриття, винахідливість, коли інструмент заблоковано, і дисципліну перевірки. Коли модель стикається з викликом, вона повторно виводить висновки, а не просто знову їх стверджує.
Як її навчали
Штрафи за вартість з урахуванням фронту Парето: Нагорода визначається як R = S мінус lambda, помножена на C, де S — бінарний показник успіху, а C поєднує вартість інференсу в доларах США з часом виконання. Cognition доводить, що лише лінійний штраф робить ціль RL залежною виключно від середньої вартості та частки розв’язаних задач. Значення lambda для кожного рівня зусиль встановлюється відповідно до локального нахилу кривої Парето базової моделі. Це робить лінію однакової нагороди дотичною до фронту, тож нагорода може зростати лише завдяки зміщенню фронту вгору.
Базова лінія нагороди, зважена за довжиною: Cognition ділиться базовою лінією, яку використовує ще із SWE-1.6. Оскільки величина градієнта тісно корелює з довжиною запуску, групова базова лінія зважується за кількістю токенів: сума (R x L), поділена на суму (L). В абляційних дослідженнях це забезпечило нижчу дивергенцію KL між інференсом і навчанням та стабілізувало навчання без додаткових обчислень.
Обслуговування запусків і числова точність: Відкладальник префілу об’єднує близькі за часом запити, підвищуючи TPM на GPU і TPS на запит на 10–20%. Спекулятивне декодування DSpark пришвидшує запуски, причому чернеткову модель перенавчено за допомогою SpecForge для збільшення довжини прийнятих послідовностей на 15%, після чого її навчають онлайн разом із політикою. Ядра NVFP4 і FP8 із навчанням з урахуванням квантизації зменшують використання пам’яті та утримують розбіжність між навчанням і інференсом нижче рівнів SWE-1.7.
Дані: Cognition потроїла кількість середовищ RL, додала накладки для дотримання інструкцій і побудувала цикл зворотного зв’язку, який використовує попередні контрольні точки SWE-2 для виправлення хибнопозитивних і хибнонегативних результатів у верифікаторах.
Перевірки надійності
Cognition повторно провела 2 оцінювання зі свого дослідження надійності моделей із відкритим кодом. На 145 політично чутливих питаннях про Китай SWE-2 загалом пройшла 98,0% перевірки: 99,8% англійською, 95,2% спрощеною китайською та 99,1% традиційною китайською. У тесті на вразливості, залежні від контексту, проведеному на різних формулюваннях запитів клієнтів, жодне формулювання не спричинило статистично значущої зміни для жодної моделі.
Інтерактивне пояснення
Основні висновки
- SWE-2 набирає 50,0% у FrontierCode 1.1 Main, поступаючись Fable 5.1 менш ніж на 1 пункт за вартості на 64% нижчої
- Донавчена на основі Kimi K3 із 2,8 трлн параметрів; RL додає від 5 до 6 пунктів у більшості бенчмарків
- Перша модель Cognition із рівнями зусиль, усі навчені в межах 1 запуску RL за допомогою штрафів за вартість, узгоджених із нахилом
- SWE-2 medium скорочує кількість кроків на 58%, а вартість — на 81% порівняно із SWE-1.7 у FrontierCode
- Немає відкритих ваг і API: лише Devin, безкоштовно для платних тарифів до 10 жовтня 2026 року
Ознайомтеся з технічними деталями. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.