Какво трябва да е вярно, за да замени агентното програмиране младшите инженери
Прочитам всеки значим анонс на модел. Повечето от тях идват с число за кодиране.
Числото расте. Изводът, който всички правят, е, че младшите инженери са приключили.
Мисля, че този извод се достига по погрешен начин. Хората разсъждават от резултат от бенчмарк към резултат на пазара на труда, прескачайки всяка междинна стъпка.
Затова нека подходя по различен начин. Вместо да питам „ще заменят ли агентите младшите инженери“, искам да попитам какво трябва да е вярно, за да се случи това. След това да проверя всяко условие спрямо най-добрите налични доказателства.
Условията са четири. Три от тях не са изпълнени. Четвъртото е онова, което трябва да ви тревожи, защото не изисква останалите три.
Условие 1: Агентите трябва да са надеждни за продължителността на задачата, която действително получава един младши инженер
Най-доброто измерване, с което разполагаме тук, е работата на METR върху времевия хоризонт. Те измерват времето, за което човешки експерти изпълняват реални софтуерни задачи, след което установяват продължителността на задачата, при която даден модел успява в 50% от случаите.
Основният резултат е, че този хоризонт се е удвоявал приблизително на всеки седем месеца от 2019 до 2025 г. Актуализираната версия на Time Horizon 1.1 на METR разшири набора от задачи с 34% и удвои броя на задачите, които отнемат осем или повече часа. Независими анализи на периода от 2024 до 2026 г. сочат, че удвояването оттогава се е ускорило. Текущата класация вече поставя хоризонтите на водещите модели в рамките на часове.
Това звучи решаващо. Прочетете методологията и вече не е толкова решаващо.
Важни са две неща:
- Първо, 50% не е праг, спрямо който можете да планирате екип. Kwa и съавторите му също отчитат хоризонт при 80%, който във всеки даден момент е драстично по-кратък от показателя за 50%. В техните данни водещите системи са почти безгрешни при задачи, които човек приключва за под четири минути, и успяват в по-малко от 10% от случаите при задачи, които отнемат на човек повече от четири часа.
- Второ, а това е частта, която почти никой не цитира: METR казва, че задачите му са умишлено самостоятелни и добре специфицирани. Собствената им формулировка е, че двучасова задача трябва да се разбира като нещо, което човек без предварителен контекст би могъл да направи за два часа, а не като нещо, което опитен инженер, познаващ кодовата база, би могъл да направи.
Това е точно обратната форма. Първите шест месеца на един младши инженер са почти изцяло придобиване на контекст. Коя услуга отговаря за това. Защо съществува тази абстракция. Кого да попита. Бенчмаркът измерва онази част от работата, от която е премахнато именно нещото, което я прави трудна.
Условие 2: Бенчмаркът трябва да измерва самата работа
През февруари 2026 г. OpenAI спря да публикува резултати за SWE-bench Verified и препоръча на останалите да направят същото.
Струва си да прочетете изцяло аргументите им, но две констатации се открояват. Те одитираха подмножество, съставляващо 27,6% от набора данни, и установиха, че поне 59,4% от одитираните задачи съдържат дефектни тестови случаи, които отхвърлят функционално коректни решения. Освен това установиха замърсяване: водещите модели можеха да възпроизвеждат точните златни пачове и дословни подробности от задачите, което показва, че са били изложени на тях по време на обучението.
Най-съвременните резултати се бяха повишили от 74,9% до 80,9% за шест месеца. Въпросът, който OpenAI постави, беше дали оставащите неуспехи отразяват ограничения на моделите или свойства на набора данни. Отговорът беше предимно свойства на набора данни.
Преминете към по-труден и по-малко замърсен набор и резултатите се сриват. SWE-bench Pro е създаден именно за това, а представянето на водещите модели в него е далеч под цифрите от Verified, които рекламните публикации при анонсирането изтъкват. По-нови набори като Terminal-Bench и бенчмаркове за еволюция с дълъг хоризонт се създават по същата причина.
Искам да бъда внимателен тук. Това не означава, че „бенчмарковете са безполезни“. Изводът е по-тесен и по-вреден: конкретното число, което в продължение на две години се използва, за да се твърди, че младшите инженери са отживелица, беше оттеглено от лабораторията, която го създаде, по причини, които правят числото да изглежда по-добре от реалността.
Условие 3: Цената на проверката на резултата на агента трябва да падне под цената на делегирането на задачата на човек
Това е условието, което според мен най-често се пренебрегва, и то е подкрепено от най-ясните експериментални доказателства.
METR проведе рандомизирано контролирано изпитване с 16 опитни разработчици на софтуер с отворен код, които изпълниха 246 реални задачи в собствените си хранилища. Използването на изкуствен интелект беше разрешавано или забранявано на случаен принцип. Записи на екрана. Реална работа.
Разработчиците прогнозираха ускорение от 24%. След това прецениха, че са били с 20% по-бързи. Всъщност са били с 19% по-бавни.
Две уговорки, защото предпочитам да ми се доверите за останалата част от този текст. Инструментите бяха от началото на 2025 г. Извадката е малка и специфична: опитни разработчици в зрели кодови бази, които познават добре. Това не е универсална оценка на продуктивността и METR не твърди, че е такава.
Но разликата във възприятията е устойчивата констатация. При измерване хората грешаха относно посоката на собствената си продуктивност.
По-широките данни сочат в същата посока. Проучването на Stack Overflow за 2025 г. сред повече от 49 000 разработчици установи, че 84% използват или планират да използват инструменти с изкуствен интелект, докато 46% активно не се доверяват на точността на резултата, срещу 33%, които му се доверяват. Само 3% съобщават за високо доверие. Сред опитните разработчици силното недоверие е 20%.
Изследването на DORA на Google анкетира около 5000 професионалисти и установи, че 90% използват изкуствен интелект на работа, а над 80% смятат, че той е повишил продуктивността им, докато 30% съобщават за малко или никакво доверие към генерирания от изкуствен интелект код. Показателят на DORA за пропускателната способност се е подобрил спрямо предходната година. Нестабилността при доставката не се е подобрила. Изводът им е, че изкуственият интелект е усилвател: той увеличава това, което организацията вече представлява.
Съберете всичко това. Генерирането поевтиня. Проверката не поевтиня. Капацитетът за преглед вече е ограничението, а капацитетът за преглед е времето на старшите инженери.
Условие 4: Фирмите трябва да са готови да разрушат собствения си поток за израстване на старши кадри
Ето я неудобната част.
Условия 1 до 3 описват дали заместването работи. Условие 4 описва дали фирмите все пак ще го опитат. Това не е един и същ въпрос, а на втория вече е отговорено.
Лабораторията за цифрова икономика на Станфорд проследява данни за заплатите от ADP, обхващащи приблизително един на всеки шестима американски работници. Тяхната работа Canaries установява, че заетостта на хората на възраст от 22 до 25 години в професиите, най-силно изложени на изкуствен интелект, сред които е разработването на софтуер, се е раздалечила рязко от тази на по-възрастните работници в същите професии. Недостигът е бил 15% според данните към юли 2025 г. Към юни 2026 г. той е 19%.
Текущото табло показва, че промяната се осъществява чрез намалено наемане, а не чрез съкращения. Никой не бива уволнен. Вратата се затваря.
Механизмът, предложен в преработената статия, е най-интересната констатация в цялото изследване. Заетостта е намаляла сред младите работници в професии, които разчитат на кодифицирано знание — онзи вид знание, който можете да усвоите от документация и стандартизирани процедури. Тя се е увеличила сред опитните работници в професии, които разчитат на неявно знание, придобивано чрез практика, наставничество и многократно излагане на реални ситуации.
Станфорд внимателно уточнява, че това са описателни закономерности, а не причинно-следствени оценки. Приемете го сериозно.
Но ако механизмът е верен, обърнете внимание какво означава това. Кодифицираното знание е онова, с което младшият инженер пристига. Неявното знание е онова, което младшият инженер би трябвало да придобие, като изпълнява кодифицираната работа под надзор, докато неявната част се усвои.
Автоматизираме чиракуването, като същевременно запазваме изискването към резултата, който чиракуването трябваше да произведе.
Какво всъщност мисля аз
Агентното програмиране не заменя младшите инженери. То заменя задачите, които преди възлагахме на младшите инженери, а това е различно нещо с по-лоши последици.
Тясното място никога не е било генерирането. То е проверката, контекстът и преценката, а всяко измерване, с което разполагаме, показва, че водещите модели са най-далеч точно от тези три неща.
Междувременно решенията за наемане се вземат въз основа на бенчмарк числа, които лабораторията, създала ги, публично оттегли.
Фирмите, които ще изглеждат умни след три години, са онези, които провеждат скучния експеримент: продължават да наемат младши инженери, дават им агенти още от първия ден и измерват дали достигат до преценката на старши инженер по-бързо от предишната група. Моето предположение е, че ще го направят, и то значително по-бързо. Никой не финансира това проучване, защото то не произвежда число за разговор с инвеститорите.
Какво би променило мнението ми
Предпочитам да подлежа на опровержение, вместо да изглеждам умен. Ето какво следя:
- Хоризонт на надеждност от 80%, който обхваща цял работен ден при задачи с предварителен контекст, а не самостоятелни задачи.
- Резултат на водещ модел над 60% върху незамърсен, частно създаден бенчмарк с дълъг хоризонт.
- Повторение на изпитването на METR, при което измереното и възприеманото време сочат в една и съща посока.
- Нестабилността при доставката според DORA да намалява две поредни години, докато използването на изкуствен интелект се запазва.
- Разликата в заетостта между хората на възраст от 22 до 25 години според данните на Станфорд да се свива, докато показателите за изложеност на изкуствен интелект продължават да нарастват.
Ако три от тези условия се изпълнят, ще напиша обратното на този текст и ще поставя линк към него тук.
Основни изводи
- Основният хоризонт на METR е мярка за 50% успеваемост при задачи без контекст; младшите инженери не работят нито при едното, нито при другото.
- OpenAI оттегли SWE-bench Verified, след като установи дефектни тестове в повечето от одитираните задачи, при които моделите са се провалили.
- Генерирането поевтиня, проверката — не; времето за преглед от старши инженери вече е реалното ограничение.
- Данните на Станфорд показват 19% разлика в заетостта при изложените на изкуствен интелект хора на възраст от 22 до 25 години, причинена от замразяване на наемането.
- Автоматизираме чиракуването, като същевременно продължаваме да изискваме резултата, който чиракуването трябваше да произведе.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.