Cognition представи SWE-2: дообученa модел за писане на код, базирана на Kimi K3, която се изравнява с Fable 5.1 във FrontierCode при 64% по-ниска цена
Cognition, компанията зад кодиращия агент Devin, пусна SWE-2 — най-способния си модел за програмиране досега. SWE-2 е дообучен чрез обучение с подкрепление от Kimi K3 — отворения модел на Moonshot AI с 2,8 трилиона параметъра. Cognition отчита резултат от 50,0% на FrontierCode 1.1 Main, в рамките на 1 пункт от Fable 5.1, но при 64% по-ниска цена. Това е и първият модел на Cognition с избираеми нива на усилие за разсъждение, като всички те са обучени в рамките на един RL процес.
Може ли да бъде внедрен? Не на собствената ви инфраструктура. SWE-2 няма отворени тегла и самостоятелен API. Той работи само в Devin: днес в Desktop и CLI, а Devin Web и Fusion се въвеждат поетапно.
Какво представлява SWE-2
SWE-2 надгражда инфраструктурата и рецептата зад SWE-1.7, който беше дообучен от Kimi K2.7. Този път Cognition мащабира RL до режима на многотрилионните параметри, използвайки базов модел с почти 3 пъти повече параметри. Cognition заявява, че RL все още открива значителен потенциал за подобрение над K3, добавяйки 5 до 6 пункта в много бенчмаркове.
Основната промяна е RL алгоритъм, който обучава и трите нива на усилие в един процес. Всяко ниво има собствена санкция за разходите, така че целият фронт на съотношението цена–производителност се измества едновременно.
Резултати от бенчмарковете
Cognition публикува следната таблица. Където са налични, са използвани публични резултати; в противен случай всеки модел работи в собствения си хъpнес при максимално възможно усилие.
| Бенчмарк | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
SWE-2 води при Terminal-Bench 2.1 и превъзхожда базовия си модел K3 във всеки ред. Cognition заявява, че се доближава на няколко пункта от GPT-6 Astra при една четвърт от цената. Ясната слаба страна е Terminal-Bench 4, където SWE-2 изостава от Fable 5.1 и GPT-6 Astra с приблизително 30 пункта. FrontierCode е собствен бенчмарк на Cognition и всички резултати на конкурентите са получени от оценяването на Cognition.
Поведение на модела: по-малко отклонения
SWE-1.7 имаше склонност да изследва прекомерно при прости задачи. SWE-2 се справя с това чрез подход, който Cognition нарича фокусирано изследване. На FrontierCode 1.1 Main SWE-2 medium постига по-висок резултат от SWE-1.7, като същевременно извършва 58% по-малко стъпки и струва 81% по-малко. Средният брой стъпки за изпълнение намалява от 127 (SWE-1.7) до 53 (medium), 80 (high) и 98 (max). SWE-2 medium извършва първата си реална редакция след медиана от 18 стъпки в сравнение с 48 при SWE-1.7.
Екипът на Cognition също съобщава за 3 поведенчески модела: по-силно покритие от край до край с тестове, находчивост, когато даден инструмент е блокиран, и дисциплина при проверката. Когато бъде поставен под въпрос, моделът извежда отново заключенията, вместо просто да ги заяви повторно.
Как е обучен
Информирани от Парето санкции за разходите: Наградата е R = S минус lambda по C, където S е двоичен показател за успех, а C комбинира разходите за извеждане в щатски долари с времето за изпълнение. Cognition доказва, че само линейна санкция прави целта на RL зависима единствено от средната цена и процента на решаване. Lambda за всяко ниво на усилие се задава като локалния наклон на кривата на Парето на базовия модел. Така линията на изоревардата е допирателна към фронта, което означава, че наградата може да се увеличи само чрез изместване на фронта нагоре.
Базова стойност на наградата, претеглена спрямо дължината: Cognition споделя базова стойност, използвана от SWE-1.6 насам. Големината на градиента силно корелира с дължината на изпълнението, затова груповата базова стойност се претегля според токените: сумата от (R x L), разделена на сумата от (L). При аблационните изследвания това поддържа по-ниско KL отклонение между извеждането и обучението и стабилизира обучението без допълнителни изчислителни ресурси.
Обслужване на изпълненията и числени изчисления: Забавящ механизъм за предварително попълване групира близки заявки, увеличавайки TPM на графичен процесор и TPS на заявка с 10 до 20%. Спекулативното декодиране DSpark ускорява изпълненията, като черновият модел е дообучен чрез SpecForge за 15% по-дълги приети поредици, а след това е обучен онлайн заедно с политиката. Ядрата NVFP4 и FP8 с обучение, съобразено с квантизацията, поддържат ниско потреблението на памет и запазват несъответствието между обучението и извеждането под нивата на SWE-1.7.
Данни: Cognition утрои своите RL среди, добави слоеве за следване на инструкции и изгради цикъл за усъвършенстване, който използва по-ранни контролни точки на SWE-2, за да коригира фалшивите положителни и отрицателни резултати във верификаторите.
Проверки за надеждност
Cognition повтори 2 оценки от своето проучване на надеждността на моделите с отворен код. При 145 политически чувствителни въпроса за Китай SWE-2 премина успешно 98,0% от тях общо: 99,8% на английски, 95,2% на опростен китайски и 99,1% на традиционен китайски. При тест за уязвимости, зависим от контекста, проведен с различни формулировки от клиенти, нито една формулировка не доведе до статистически значима промяна при нито един модел.
Интерактивно обяснение
Основни изводи
- SWE-2 постига 50,0% на FrontierCode 1.1 Main, в рамките на 1 пункт от Fable 5.1 при 64% по-ниска цена
- Дообучен от Kimi K3 с 2,8 трилиона параметъра; RL добавя 5 до 6 пункта в повечето бенчмаркове
- Първият модел на Cognition с нива на усилие, всички обучени в 1 RL процес чрез санкции за разходите, съобразени с наклона
- SWE-2 medium намалява броя на стъпките с 58% и разходите с 81% спрямо SWE-1.7 във FrontierCode
- Няма отворени тегла и API: работи само в Devin, безплатен за платените планове до 10 октомври 2026 г.
Разгледайте техническите подробности. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и др.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.