Что должно быть верно, чтобы агентное программирование заменило младших инженеров
Я читаю каждый крупный релиз моделей. В большинстве из них фигурирует некий показатель программирования.
Показатель растёт. Вывод, который делают все, заключается в том, что младшие инженеры больше не нужны.
Я думаю, что к этому выводу приходят неверным путём. Люди переходят от показателя на бенчмарке к результату на рынке труда, пропуская все промежуточные этапы.
Поэтому позвольте мне рассмотреть вопрос иначе. Вместо того чтобы спрашивать: «Заменят ли агенты младших инженеров?», я хочу спросить, какие условия должны быть выполнены, чтобы это произошло. А затем проверить каждое из них по наиболее убедительным доступным данным.
Условий четыре. Три из них не выполнены. Четвёртое должно вас беспокоить, потому что для него не нужны остальные три.
Условие 1: Агенты должны быть надёжны на задачах такой продолжительности, какие действительно поручают младшему инженеру
Лучший доступный здесь показатель — исследование временного горизонта METR. Они замеряют время, за которое люди-эксперты выполняют реальные задачи по разработке ПО, а затем определяют продолжительность задачи, при которой модель справляется в 50% случаев.
Основной результат таков: с 2019 по 2025 год этот горизонт примерно удваивался каждые семь месяцев. Обновлённая версия METR — Time Horizon 1.1 — расширила набор задач на 34% и вдвое увеличила число задач продолжительностью восемь и более часов. Независимые оценки периода с 2024 по 2026 год свидетельствуют, что темпы удвоения с тех пор ускорились. На текущей таблице лидеров горизонты передовых моделей уже измеряются часами.
Звучит убедительно. Но если прочитать методологию, уверенность исчезает.
Важны две вещи:
- Во-первых, 50% — это не тот порог, на который можно опираться при формировании команды. Kwa и соавторы также приводят горизонт 80%, и в любой конкретный момент он значительно короче показателя для 50%. Согласно их данным, передовые системы почти безошибочно справляются с задачами, которые человек выполняет менее чем за четыре минуты, но преуспевают менее чем в 10% случаев на задачах, требующих от человека более четырёх часов.
- Во-вторых — и это почти никто не цитирует, — METR говорит, что его задачи намеренно самодостаточны и чётко сформулированы. Согласно собственной формулировке организации, двухчасовую задачу следует понимать как то, что за два часа может выполнить человек без какого-либо предварительного контекста, а не опытный инженер, хорошо знакомый с кодовой базой.
А это как раз неправильная постановка задачи. Первые шесть месяцев работы младшего инженера почти полностью уходят на освоение контекста. Какой сервис отвечает за это. Зачем нужна такая абстракция. К кому обратиться. Бенчмарк измеряет ту часть работы, из которой убрали фактор, делающий её сложной.
Условие 2: Бенчмарк должен измерять саму работу
В феврале 2026 года OpenAI перестала публиковать результаты SWE-bench Verified и рекомендовала другим поступить так же.
Их аргументацию стоит прочитать полностью, но особенно выделяются два вывода. Они проверили 27,6% набора данных и обнаружили, что как минимум в 59,4% проверенных задач были некорректные тесты, отклонявшие функционально правильные решения. Кроме того, они обнаружили загрязнение данных: передовые модели могли воспроизводить точные эталонные патчи и дословные формулировки задач, что указывало на наличие этих материалов в обучающей выборке.
За шесть месяцев показатель передового уровня вырос с 74,9% до 80,9%. OpenAI задала вопрос: оставшиеся ошибки отражают ограничения моделей или свойства набора данных? Ответом в основном оказались свойства набора данных.
Если перейти к более сложному и менее загрязнённому набору, показатели резко падают. SWE-bench Pro создан именно для этого, и результаты передовых моделей на нём значительно ниже показателей Verified, которыми рекламируют новые релизы. Более новые наборы, такие как Terminal-Bench и бенчмарки эволюции на длинном временном горизонте, создаются по той же причине.
Здесь важно соблюдать осторожность. Речь не о том, что «бенчмарки бесполезны». Вывод более узкий и более неприятный: конкретный показатель, который на протяжении двух лет использовали, чтобы доказывать ненужность младших инженеров, был отозван лабораторией, его создавшей, по причинам, из-за которых этот показатель выглядит лучше реальности.
Условие 3: Стоимость проверки результата агента должна быть ниже стоимости делегирования задачи человеку
Это условие, которое, как мне кажется, чаще всего игнорируют, и именно для него есть самые убедительные экспериментальные данные.
METR провела рандомизированное контролируемое исследование с участием 16 опытных разработчиков открытого ПО, которые выполнили 246 реальных задач в собственных репозиториях. Возможность использовать ИИ определялась случайным образом. Видеозапись экрана. Настоящая работа.
Разработчики прогнозировали ускорение на 24%. После эксперимента они оценили, что работали на 20% быстрее. На самом деле они работали на 19% медленнее.
Два уточнения — потому что я хочу, чтобы вы доверяли остальному тексту. Инструменты относились к началу 2025 года. Выборка была небольшой и специфичной: опытные разработчики, работавшие со зрелыми кодовыми базами, которые они хорошо знали. Это не универсальная оценка производительности, и METR не утверждает обратного.
Но устойчивым результатом оказался разрыв между восприятием и реальностью. Под измерением люди ошибались даже в отношении направления изменения собственной производительности.
Более широкие данные указывают на то же. В исследовании Stack Overflow за 2025 год, в котором участвовали более 49 000 разработчиков, 84% сообщили, что используют или планируют использовать инструменты ИИ, а 46% активно не доверяют точности результатов против 33%, которые им доверяют. Лишь 3% сообщили о высоком уровне доверия. Среди опытных разработчиков высокий уровень недоверия достигает 20%.
В исследовании DORA Google опросила около 5 000 специалистов и выяснила, что 90% используют ИИ на работе, а более 80% считают, что он повысил их производительность; при этом 30% сообщили о небольшом или полном отсутствии доверия к коду, сгенерированному ИИ. Показатель пропускной способности по сравнению с предыдущим годом улучшился. Стабильность поставки — нет. Вывод DORA состоит в том, что ИИ является усилителем: он увеличивает то, чем организация уже является.
Сведём всё вместе. Генерация стала дешёвой. Проверка — нет. Теперь ограничением является пропускная способность проверки, а это время старших инженеров.
Условие 4: Компании должны быть готовы разрушить собственную систему подготовки старших специалистов
Вот неприятная часть.
Условия с первого по третье описывают, работает ли замещение. Условие 4 описывает, станут ли компании всё равно его внедрять. Это разные вопросы, и на второй из них уже есть ответ.
Лаборатория цифровой экономики Стэнфордского университета отслеживает данные о зарплатных ведомостях ADP, охватывающие примерно каждого шестого американского работника. Их исследование Canaries показывает, что занятость людей в возрасте от 22 до 25 лет в профессиях, наиболее подверженных влиянию ИИ, включая разработку ПО, резко разошлась с занятостью работников старшего возраста в тех же профессиях. В данных за июль 2025 года отставание составляло 15%. По состоянию на июнь 2026 года оно достигло 19%.
Текущая панель данных показывает, что корректировка происходит за счёт сокращения найма, а не увольнений. Никого не увольняют. Дверь закрывается.
Механизм, предложенный в обновлённой статье, — самая интересная находка во всём этом исследовании. Занятость снизилась среди молодых работников в профессиях, опирающихся на формализованные знания — такие, которые можно получить из документации и стандартных процедур. Среди опытных работников в профессиях, опирающихся на неявные знания, приобретённые через практику, наставничество и многократное столкновение с реальными ситуациями, занятость выросла.
Стэнфорд подчёркивает, что это описательные закономерности, а не причинно-следственные оценки. К этому следует отнестись серьёзно.
Но если этот механизм действительно работает, обратите внимание на его значение. Формализованные знания — это то, с чем приходит младший специалист. Неявные знания — это то, что младший специалист должен приобрести, выполняя формализованную работу под руководством, пока не усвоит неявную часть.
Мы автоматизируем ученичество, но сохраняем требование к результату, который это ученичество должно было обеспечить.
Что я на самом деле думаю
Агентная разработка не заменяет младших инженеров. Она заменяет задачи, которые мы раньше поручали младшим инженерам, а это совсем другое — и последствия у этого хуже.
Узким местом никогда не была генерация. Им являются проверка, контекст и суждение, а все имеющиеся у нас измерения говорят, что передовые системы дальше всего именно от этих трёх качеств.
Тем временем решения о найме принимаются на основе показателей бенчмарков, от которых лаборатория, их создавшая, публично отказалась.
Компании, которые через три года будут выглядеть дальновидными, проведут скучный эксперимент: продолжат нанимать младших специалистов, дадут им агентов с первого дня и измерят, достигнут ли они уровня суждений старшего инженера быстрее предыдущего набора. Я предполагаю, что да, причём значительно быстрее. Никто не финансирует такое исследование, потому что оно не создаёт показателя для отчёта о доходах.
Что могло бы изменить моё мнение
Я предпочитаю, чтобы мои утверждения можно было опровергнуть, а не чтобы они казались остроумными. Вот за чем я слежу:
- Горизонт надёжности 80%, охватывающий полный рабочий день на задачах с предварительным контекстом, а не на самодостаточных задачах.
- Результат передовой модели выше 60% на незагрязнённом бенчмарке длинных задач, составленном частным образом.
- Повторение исследования METR, в котором измеренное и воспринимаемое время указывают в одном направлении.
- Снижение нестабильности поставки в DORA на протяжении двух лет подряд при сохранении темпов внедрения ИИ.
- Сокращение разрыва в занятости между работниками в возрасте от 22 до 25 лет в Стэнфорде при продолжающемся росте показателей подверженности ИИ.
Если сбудутся три из этих пунктов, я напишу противоположное этой статье и дам здесь ссылку на неё.
Главные выводы
- Основной горизонт METR — это показатель 50%-ной успешности на задачах без контекста; младшие специалисты не работают ни в таких условиях, ни с таким уровнем надёжности.
- OpenAI отказалась от SWE-bench Verified после того, как обнаружила некорректные тесты в большинстве проверенных задач, на которых модели потерпели неудачу.
- Генерация стала дешёвой, проверка — нет; время старших инженеров на проверку теперь является настоящим ограничением.
- Данные Стэнфорда показывают 19%-ный разрыв в занятости среди людей в возрасте от 22 до 25 лет в профессиях, подверженных влиянию ИИ; причиной стало сокращение найма.
- Мы автоматизируем ученичество, продолжая требовать результат, который оно должно было обеспечить.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.