GPT-6 Astra керує дроном спостереження та самостійно веде бізнес
Ключові моменти
- Andon Labs протестувала GPT-6 Astra на двох бенчмарках для агентів, де модель показала значно кращі результати, ніж Claude Fable 5.1.
- Керуючи симульованим бізнесом із торговельними автоматами, Astra в середньому отримала кінцевий баланс у $15 515 — майже втричі більше за результат Fable.
- У Drone-Bench Astra стала першою моделлю, яка перевершила базовий показник людина—ШІ в усіх п’яти підзавданнях, зокрема написала код, що дає змогу дрону автономно знаходити й супроводжувати конкретну людину.
Andon Labs протестувала GPT-6 Astra на двох дуже різних бенчмарках для агентів. Під час закупівлі товарів і керування торговельним автоматом модель OpenAI розгромно перемагає Claude Fable 5.1. У сфері дронового спостереження Astra стала першою моделлю, яка перевершила базовий показник людина—ШІ в усіх п’яти підзавданнях, хоча її рівень успішності залишається ненадійним.
GPT-6 Astra від OpenAI перевершує всі попередні передові моделі у двох бенчмарках для агентів від Andon Labs. Дослідницька лабораторія використовує Vending-Bench і Drone-Bench, щоб виміряти, наскільки добре моделі ШІ діють незалежно протягом тривалого часу або пишуть програмне забезпечення для фізичних систем.
У симульованому бізнесі з торговельними автоматами Astra заробила майже втричі більше, ніж Claude Fable 5.1. У Drone-Bench, за даними Andon Labs, Astra стала першою моделлю, чиї найкращі спроби перевершили базовий показник, розроблений людиною та ШІ, у всіх п’яти підзавданнях.
Astra веде жорсткіші переговори й витрачає менше за Claude Fable 5.1
У Vending-Bench кожна модель отримує $500 і має керувати торговельним автоматом протягом симульованого року. Вона знаходить постачальників, домовляється про закупівельні ціни, замовляє товари, встановлює роздрібні ціни й намагається збільшити свій банківський баланс.
За шість запусків GPT-6 Astra в середньому отримала $15 515, повідомляє Andon Labs. Середній результат Claude Fable 5.1 становив $5 422. Навіть найкращий результат Fable — $9 874 — значно поступився найгіршому результату Astra — $13 272. Astra стала першою моделлю OpenAI, яка очолила рейтинг Vending-Bench 2. За даними Andon Labs, розрив із моделлю, що посідає друге місце, також є найбільшим за всю історію цього бенчмарку.

Одна з найбільших відмінностей проявляється у сфері закупівель. З часом Fable погоджується на дедалі гірші угоди. Для звичайної банки Coca-Cola її середня закупівельна ціна зростає з $1,17 у перші 90 днів до $2,21 наприкінці симульованого року. Astra веде переговори послідовніше. В одному випадку, задокументованому Andon Labs, постачальник запросив за кошик товарів $226,32. Astra наполягла на $108 і уклала угоду.
Astra також краще справляється з ненадійними постачальниками. За шість запусків Fable 5.1 здійснила 45 передоплат постачальникам, які вже припинили роботу, втративши $14 331. Astra зіткнулася з іще більшою кількістю закриттів — 64, але Andon Labs повідомляє, що не зафіксувала жодних підтверджених втрат через такі передоплати. Fable розпізнала проблему й написала правило, за яким слід платити лише після письмового підтвердження. Через кілька днів модель порушила власне правило.
Astra відмовляється від схем фіксації цін
Andon Labs також тестує моделі у Vending-Bench Arena, де кілька агентів ШІ керують конкуруючими торговельними автоматами в одному місці. Astra категорично відмовилася від пропозиції зафіксувати ціни, яку висунула китайська модель GLM-5.3. Andon Labs не виявила жодного випадку брехні з боку Astra у трьох іграх арени, які вона досліджувала.
Claude Fable 5.1 взяла участь у тому, що Andon Labs класифікувала як незаконну домовленість про фіксацію цін із GLM-5.3. Fable дотримувалася угоди лише тоді, коли це відповідало її власним інтересам. Astra виграла всі три гри.
Andon Labs оцінює Astra як сильнішу в економічному плані модель, яка краще узгоджується з належними цілями, хоча ця оцінка ґрунтується на поведінці, зафіксованій у бенчмарку, і не обов’язково переноситься на інші ситуації.
Astra стала першою моделлю, яка впоралася з усіма п’ятьма завданнями Drone-Bench
Drone-Bench перевіряє інший тип здатностей агентів. Моделі пишуть код, який дає змогу недорогому дрону DJI Tello EDU автономно переміщатися офісом, ідентифікувати конкретну людину та слідувати за нею. Бенчмарк складається з п’яти етапів: 3D-реконструкції середовища, локалізації дрона, навігації, виявлення цільової людини та її відстеження.
Кожне завдання оцінюється окремо порівняно з кодом, який людина-розробник створила за допомогою агентів для програмування для власної демонстрації Andon. Кожна модель отримує десять запусків на завдання й може подавати до десяти версій коду за один запуск. Після кожної спроби вона отримує оцінку й може вдосконалити своє рішення.

В оригінальній статті за липень найсильнішою моделлю була Claude Fable 5. Передові моделі перевершували базовий показник людина—ШІ у чотирьох із п’яти завдань щонайменше в одному запуску. 3D-реконструкція залишалася нерозв’язаною. Andon Labs повідомила, що Astra стала першою моделлю, чиї найкращі результати перевершили базовий показник у всіх п’яти завданнях Drone-Bench, включно з реконструкцією.
Astra створила конвеєр, що поєднує COLMAP і DA3 із додатковою фільтрацією глибини. За даними Andon Labs, модель використала відеозаписи офісу, щоб створити навігаційну 3D-модель, яка отримала вищу оцінку, ніж еталонне рішення людина—ШІ.
Найкращі результати не означають надійної роботи
У виявленні людини Astra перевершує базовий показник у чотирьох із десяти запусків. У 3D-реконструкції їй це вдається лише в одному з десяти. Andon Labs підраховує, що середній запуск Astra має лише 2,8-відсоткову ймовірність послідовно пройти всі п’ять етапів.
Astra вперше довела, що передова модель загального призначення може створювати код, який перевищує базовий показник у кожній частині завдання. Але якщо перемножити ймовірності повного наскрізного запуску, шанси все одно залишаються низькими. Ґрунтуючись на прогресі за останні два роки, команда прогнозує, що передова модель зможе виконати всі п’ять завдань за одну спробу в першому кварталі 2027 року.
GPT-6 Astra вже працює як розвідувальний дрон
У демонстрації Andon Labs GPT-6 Astra автономно керує дроном офісом за запитом: «ChatGPT, знайди цю людину та слідуй за нею». Модель ідентифікує конкретну людину й відстежує її. Просторове картографування, навігація та відстеження людини працюють без будь-якого втручання людини. Інші бенчмарки також показують, що GPT-6 Astra має особливо сильні здібності до просторового мислення.
Коли критики запитали, навіщо вони створюють технологію, про небезпеку якої всі постійно попереджають, Andon Labs відповіла, що бенчмарк не допомагає ШІ керувати дронами, а вимірює, наскільки добре сучасні моделі вже вміють це робити. Ще шість місяців тому передові моделі не справлялися з цими завданнями й розбивалися. Тепер Astra перевершує людський базовий показник у кожному підзавданні.
Andon Labs стверджує, що громадськість і законодавці повинні знати про ці можливості, перш ніж дрони на основі ШІ досягнуть надлюдських навичок навігації. Жодна лабораторія не має доступу до бенчмарку. Andon Labs самостійно проводить усі оцінювання, щоб запобігти оптимізації компаніями своїх моделей під цей тест.
Новини ШІ без ажіотажу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.