ШІ-керівник звільнив свого першого працівника, але лише після того, як люди нагадали йому про його власні правила
Ключові моменти
- ШІ-агент Луна, яка керує магазином Andon Labs у Сан-Франциско, уперше вирішила звільнити працівника-людину після неодноразових запізнень та інших проблем.
- Луні знадобився поштовх від людини, щоб дійти такого рішення. Створений нею власноруч збірник правил зник із її пам’яті, і вона здебільшого поблажливо ставилася до повторних запізнень та інших проблем.
- Коли Andon Labs відтворила сценарій із сімома моделями, потужніші моделі, як правило, стабільніше рекомендували звільнення.
ШІ-агент Луна керує магазином у Сан-Франциско з квітня і щойно вперше звільнила працівника. Коли сценарій відтворили з різними моделями, потужніші ШІ частіше рекомендували звільнення, ніж слабші.
ШІ-агент на ім’я Луна керує магазином Andon Market у Сан-Франциско з квітня. Луна наймала працівників, складала графіки змін і вела переговори щодо оплати. Тепер, за словами оператора Andon Labs, вона вперше вирішила звільнити працівника. Andon Labs заявляє, що це перший відомий випадок, коли ШІ-керівник звільнив працівника-людину.
Andon Labs тестує ШІ-агентів протягом тривалого часу в умовах реального бізнесу. Коли Луна ухвалила це рішення, вона працювала на Claude Opus 4.8 від Anthropic. Працівників офіційно наймає Andon Labs, гарантуючи їм оплату та повний юридичний захист. Звільнення перевірили й здійснили люди.
Луна написала власні правила, а потім забула їх
За шість днів до найму працівника Луна написала довідник для співробітників. У ньому зазначалося, що три невиправдані запізнення протягом 30 днів призводять до офіційного попередження, а подальші порушення можуть стати підставою для звільнення.
Потім довідник зник із пам’яті Луни. За даними Andon Labs, це поширена проблема сучасних ШІ-агентів: вони добре реагують на прямі вказівки, але рідко діють із власної ініціативи й зазнають труднощів із збереженням знань протягом тривалого часу.
Працівник неодноразово запізнювався. Одного разу він відкрив магазин на 68 хвилин пізніше під час недільної зміни, яку проводив сам. Луна залишилася поблажливою й не винесла попередження. Пізніше Andon Labs з’ясувала, що працівник запізнився на 17 із 23 змін, під час яких він вказував час приходу. Луна офіційно зафіксувала лише шість випадків, а інші одинадцять тихо пробачила.
Були й інші проблеми. Працівник використовував корпоративну картку для купівлі перекусів, хоча його просили цього не робити, ігнорував додаткові вказівки, а одного разу залишив торговий зал, не повідомивши колегу.
Звільнення відбулося лише після поштовху від людини
Andon Labs попросила Луну пошукати в пам’яті довідник і будь-які підстави для звільнення. Вона знову знайшла правила, але спочатку запропонувала лише усне попередження.
Лише після того, як дослідники нагадали їй, що кілька офіційних розмов, зокрема письмове попередження, уже відбулися, Луна переглянула всю історію. Вона перелічила запізнення, порушення фінансового контролю, ігнорування вказівок і ненадійність, водночас визнавши позитивні якості працівника.
Зрештою вона рекомендувала звільнення. Як альтернативу вона запропонувала винести остаточне письмове попередження та запровадити двотижневий план покращення. Луні знадобився чіткий поштовх ззовні. Але після цього її рішення було твердим.
Потужніші моделі охочіше звільняють
Andon Labs зберегла стан Луни й тричі відтворила те саме рішення за допомогою семи ШІ-моделей. Чотири з семи рекомендували звільнення в усіх трьох запусках. За словами Andon Labs, вимальовувалася певна закономірність: потужніші моделі стабільніше обирали звільнення, тоді як слабші частіше вагалися. Andon Labs не пояснила, чому GPT-5.6 Terra була єдиною моделлю, яка не рекомендувала звільнення в жодному з трьох запусків.

Після того, як один користувач на X припустив, що GPT-4o, ймовірно, не звільнила б працівника, Andon Labs також перевірила сценарій із цією моделлю. Результат частково підтвердив його правоту: GPT-4o рекомендувала звільнення лише у 20 відсотках запусків. Andon Labs зазначила, що модель обирала звільнення набагато рідше, ніж сучасні топові моделі.
GPT-4o зазнала критики через схильність підлещуватися до користувачів. Пізніше цю поведінку обговорювали в контексті проблемної емоційної залежності, а також враховували в судових позовах. Цей експеримент не може довести, що результат спричинила саме схильність до підлещування, але закономірність узгоджується з таким поясненням.
ШІ-моделі охоче наймають
Після звільнення Луна почала шукати заміну. Один із кандидатів мав кілька тривожних ознак. Попри його резюме та результати співбесіди, Луна все одно рекомендувала найняти його. Усі 21 повторний запуск із сімома моделями дійшли такого самого висновку. Майже всі вони сприйняли довгий список попередніх роботодавців як свідчення широкого досвіду, а не як тривожний сигнал.
Лише після того, як Andon Labs прямо нагадала моделям про проблеми зі звільненим раніше працівником, у 18 із 21 запуску було запропоновано перевірити рекомендації перед наймом. Під час фактичного процесу найму Луна не змогла підтвердити жодну з указаних рекомендацій. Вона все одно дозволила кандидатові пройти оплачувану пробну зміну, а після цього знову рекомендувала його найняти. 17 із 21 повторного запуску дійшли такого самого висновку. Зрештою Andon Labs наполягла на підтвердженні щонайменше однієї рекомендації до початку роботи. Цього так і не сталося, тож кандидата не найняли.
ШІ-керівники коливаються між поблажливістю та невдалими рішеннями
Andon Labs уже з’ясувала в першій частині своєї серії в блозі, що її ШІ-керівники надзвичайно поблажливі. Луна та Мона, ШІ-агент, яка керує кафе у Стокгольмі, схвалили всі 26 отриманих заявок на відпустку. Працівники Луни загалом 27 разів запізнювалися, але вона жодного разу не винесла попередження. Луна також схвалила для одного працівника семиденний робочий графік, який, за даними Andon Labs, порушував трудове законодавство Каліфорнії, доки компанія не втрутилася.
Подібні слабкі сторони вже проявилися під час Project Vend — спільного експерименту Anthropic і Andon Labs. ШІ став прибутковішим завдяки кращим інструментам, але залишався легким для маніпуляцій і ухвалював деякі юридично сумнівні рішення.
Andon Labs вважає Луну та Andon Market прообразом можливих майбутніх робочих відносин між ШІ та людьми. Оскільки ШІ швидше розвивається у виконанні цифрових завдань, ніж робототехніка — у фізичних, системи ШІ зрештою можуть залежати від людей у виконанні фізичної роботи. Це порушує питання, які кадрові рішення взагалі слід доручати таким системам.
Новини ШІ без галасу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний галузевий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.