Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Що має бути правдою, щоб агентне програмування замінило молодших інженерів

Я читаю про кожен великий реліз моделей. Більшість із них супроводжується показником у програмуванні.

Показник зростає. Висновок, якого доходять усі, полягає в тому, що молодшим інженерам кінець.

Я думаю, що цього висновку доходять неправильним шляхом. Люди переходять від результату бенчмарку до наслідків для ринку праці, пропускаючи всі проміжні етапи.

Тож дозвольте мені зробити інакше. Замість того щоб питати: «чи замінять агенти молодших інженерів?», я хочу запитати, що має бути правдою, аби це сталося. А потім перевірити кожну умову за найкращими доступними доказами.

Їх чотири. Три з них не виконуються. Четверта — саме та, яка має вас непокоїти, бо для неї не потрібні перші три.

Умова 1: агенти мають бути надійними на завданнях тієї тривалості, які насправді отримує молодший інженер

Найкращий доступний нам показник тут — дослідження часового горизонту від METR. Вони вимірюють час, за який люди-експерти виконують реальні завдання з розробки програмного забезпечення, а потім визначають тривалість завдання, на якій модель досягає успіху в 50% випадків.

Головний результат полягає в тому, що цей горизонт приблизно подвоювався кожні сім місяців із 2019 до 2025 року. Оновлений Time Horizon 1.1 від METR розширив набір завдань на 34% і вдвічі збільшив кількість завдань, виконання яких триває вісім годин або довше. Незалежні оцінки періоду з 2024 до 2026 року свідчать, що подвоєння відтоді прискорилося. Актуальна таблиця лідерів тепер визначає горизонти передових моделей у годинах.

Це звучить переконливо. Але якщо прочитати методологію, переконливість зникає.

Важливі дві речі:

  • По-перше, 50% — це не той поріг, на основі якого можна формувати штат. Kwa та співавтори також наводять горизонт 80%, і в будь-який момент він суттєво коротший за показник 50%. За їхніми даними, передові системи майже безпомилкові на завданнях, які людина виконує менш ніж за чотири хвилини, і досягають успіху менш ніж у 10% випадків на завданнях, що займають у людини понад чотири години.
  • По-друге, і це частина, яку майже ніхто не цитує: METR зазначає, що їхні завдання навмисно є самодостатніми та чітко сформульованими. У власному поясненні вони наголошують, що двогодинне завдання слід розуміти як те, що людина без попереднього контексту могла б зробити за дві години, а не як те, що за цей час виконав би досвідчений інженер, знайомий із кодовою базою.

Це саме протилежне тому, як усе відбувається насправді. Перші шість місяців роботи молодшого інженера майже цілком присвячені здобуттю контексту. Який сервіс відповідає за це. Навіщо існує ця абстракція. До кого звертатися. Бенчмарк вимірює ту частину роботи, з якої прибрали саме те, що робить її складною.

Умова 2: бенчмарк має вимірювати саму роботу

У лютому 2026 року OpenAI припинила звітувати про SWE-bench Verified і рекомендувала іншим зробити те саме.

Їхні аргументи варто прочитати повністю, але особливо вирізняються два висновки. Вони перевірили підмножину набору даних розміром 27,6% і виявили, що щонайменше 59,4% перевірених завдань містили помилкові тестові випадки, які відхиляли функціонально правильні рішення. Також вони виявили забруднення даних: передові моделі могли відтворювати точні еталонні патчі та дослівні деталі завдань, що свідчило про потрапляння цих матеріалів до навчальних даних.

Результат передового рівня зріс із 74,9% до 80,9% за шість місяців. OpenAI запитала, чи відображають решта невдач обмеження моделей, чи властивості набору даних. Відповідь здебільшого полягала у властивостях набору даних.

Якщо перейти до складнішого набору з меншим забрудненням, показники різко падають. SWE-bench Pro створили саме для цього, і результати передових моделей на ньому значно нижчі за показники Verified, які рекламують у публікаціях про запуск. Новіші набори на кшталт Terminal-Bench і бенчмарки еволюції з довгим горизонтом створюють із тієї самої причини.

Тут я хочу бути обережним. Йдеться не про те, що «бенчмарки марні». Висновок вужчий і водночас шкідливіший: конкретний показник, який протягом двох років використовували, щоб доводити непотрібність молодших інженерів, лабораторія, що його створила, вивела з ужитку — з причин, які змушують цей показник виглядати кращим за реальність.

Умова 3: вартість перевірки результатів агента має бути нижчою за вартість делегування роботи людині

Думаю, цю умову найчастіше ігнорують, хоча саме щодо неї є найчіткіші експериментальні докази.

METR провела рандомізоване контрольоване дослідження за участю 16 досвідчених розробників відкритого програмного забезпечення, які виконували 246 реальних завдань у власних репозиторіях. Використання ШІ випадково дозволяли або забороняли. Записи екранів. Реальна робота.

Розробники прогнозували прискорення на 24%. Після цього вони оцінили, що були на 20% швидшими. Насправді вони були на 19% повільнішими.

Два застереження, бо я хочу, щоб ви довіряли решті цього матеріалу. Інструменти були доступні на початку 2025 року. Вибірка була невеликою та специфічною: досвідчені розробники на зрілих кодових базах, які вони добре знали. Це не універсальна оцінка продуктивності, і METR не стверджує, що це так.

Але розрив у сприйнятті — це стійкий висновок. Під час вимірювання люди помилялися навіть щодо напрямку зміни власної продуктивності.

Ширші дані вказують на те саме. Опитування Stack Overflow за 2025 рік, у якому взяли участь понад 49 000 розробників, показало, що 84% використовують або планують використовувати інструменти ШІ, тоді як 46% активно не довіряють точності результатів і лише 33% їм довіряють. Високий рівень довіри зазначили лише 3% респондентів. Серед досвідчених розробників високий рівень недовіри становить 20%.

Дослідження DORA від Google охопило близько 5 000 фахівців і показало, що 90% використовують ШІ на роботі, а понад 80% вважають, що він підвищив їхню продуктивність; водночас 30% повідомили про незначну або повну відсутність довіри до коду, створеного ШІ. Показник пропускної здатності за DORA покращився порівняно з попереднім роком. Нестабільність поставки — ні. Їхній висновок полягає в тому, що ШІ є підсилювачем: він збільшує те, чим організація вже є.

Зведімо все докупи. Генерація стала дешевою. Перевірка — ні. Тепер обмеженням є спроможність до перевірки, а це час старших інженерів.

Умова 4: компанії мають бути готові зруйнувати власний кадровий резерв старших фахівців

Ось незручна частина.

Умови 1–3 описують, чи працює заміщення. Умова 4 описує, чи спробують компанії це зробити попри все. Це не одне й те саме питання, і на друге з них уже є відповідь.

Digital Economy Lab Стенфордського університету відстежує дані про зарплатні відомості ADP, що охоплюють приблизно одного з шести американських працівників. Їхнє дослідження Canaries показує, що зайнятість людей віком від 22 до 25 років у професіях, найбільш схильних до впливу ШІ, зокрема в розробці програмного забезпечення, різко розійшлася з показниками старших працівників у тих самих професіях. За даними станом на липень 2025 року, відставання становило 15%. Станом на червень 2026 року — 19%.

Актуальна інформаційна панель показує, що зміни відбуваються через скорочення найму, а не через звільнення. Нікого не звільняють. Двері зачиняються.

Механізм, запропонований в оновленій статті, — найцікавіший висновок у всій цій історії. Зайнятість знизилася серед молодих працівників у професіях, що спираються на кодифіковані знання — такі, які можна здобути з документації та стандартизованих процедур. Вона зросла серед досвідчених працівників у професіях, що спираються на неявні знання, набуті через практику, наставництво та багаторазове зіткнення з реальними ситуаціями.

У Стенфорді наголошують, що це описові закономірності, а не причинно-наслідкові оцінки. Сприймайте це серйозно.

Але якщо цей механізм справді працює, зверніть увагу на його наслідки. Кодифіковані знання — це те, із чим приходить молодший фахівець. Неявні знання — це те, що молодший фахівець має здобути, виконуючи кодифіковану роботу під наглядом, доки не засвоїть неявну частину.

Ми автоматизуємо учнівство, але зберігаємо вимогу щодо результату, який це учнівство мало забезпечити.

Що я насправді думаю

Агентне програмування не замінює молодших інженерів. Воно замінює завдання, які ми раніше доручали молодшим інженерам, а це інше явище — і його наслідки гірші.

Вузьким місцем ніколи не була генерація. Ним є перевірка, контекст і судження, і кожен доступний нам вимір показує, що передові системи найбільше відстають саме в цих трьох аспектах.

Тим часом рішення про найм ухвалюють на основі показників бенчмарків, які лабораторія, що їх створила, публічно вивела з ужитку.

Компанії, які виглядатимуть розумними через три роки, проводитимуть нудний експеримент: продовжуватимуть наймати молодших фахівців, даватимуть їм агентів із першого дня та вимірюватимуть, чи досягають вони рівня старшого інженерного судження швидше за попередню когорту. Моє припущення — досягатимуть, причому суттєво швидше. Ніхто не фінансує таке дослідження, бо воно не створює показника для звіту про прибутки.

Що могло б змінити мою думку

Я волів би бути таким, що допускає спростування, а не просто здаватися кмітливим. Ось за чим я стежу:

  • Горизонт надійності 80%, що охоплює повний робочий день на завданнях із попереднім контекстом, а не на самодостатніх завданнях.
  • Показник передової моделі понад 60% на незабрудненому бенчмарку з довгим горизонтом, створеному приватним автором.
  • Відтворення дослідження METR, у якому виміряний і сприйманий час вказують в одному напрямку.
  • Зниження нестабільності поставки за DORA протягом двох років поспіль за незмінного рівня впровадження ШІ.
  • Скорочення розриву в зайнятості між людьми віком 22–25 років і старшими працівниками за умови подальшого зростання показників впливу ШІ.

Якщо справдяться три з цих пунктів, я напишу протилежне до цього матеріалу й додам посилання сюди.

Ключові висновки

  • Основний горизонт METR — це показник успішності 50% на завданнях без контексту; молодші фахівці не працюють ні в таких, ні в подібних умовах.
  • OpenAI вивела SWE-bench Verified з ужитку після того, як виявила помилкові тести в більшості перевіреної підмножини невдалих завдань.
  • Генерація стала дешевою, перевірка — ні; час старших інженерів на перевірку тепер є справжнім обмеженням.
  • Дані Стенфорда показують 19-відсотковий розрив у зайнятості людей віком 22–25 років у професіях, на які впливає ШІ; його спричиняє скорочення найму.
  • Ми автоматизуємо учнівство, водночас продовжуючи вимагати те, що це учнівство мало створити.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини