GPT-6 Astra управляет дроном наблюдения и самостоятельно ведёт бизнес
Ключевые моменты
- Andon Labs протестировала GPT-6 Astra на двух бенчмарках для автономных агентов, где модель значительно превзошла Claude Fable 5.1.
- Управляя смоделированным бизнесом по продаже товаров через автоматы, Astra в среднем получила итоговый баланс $15 515 — почти втрое больше, чем результат Fable.
- В Drone-Bench Astra стала первой моделью, превзошедшей базовый показатель человека и ИИ во всех пяти подзадачах, включая написание кода, позволяющего дрону автономно находить и сопровождать конкретного человека.
Andon Labs протестировала GPT-6 Astra на двух совершенно разных бенчмарках для автономных агентов. При закупке товаров и управлении торговым автоматом модель OpenAI значительно превосходит Claude Fable 5.1. В сфере наблюдения с помощью дрона Astra стала первой моделью, превзошедшей базовый показатель человека и ИИ во всех пяти подзадачах, хотя её показатель успешности остаётся нестабильным.
GPT-6 Astra от OpenAI превосходит все предыдущие передовые модели на двух бенчмарках для автономных агентов от Andon Labs. Исследовательская лаборатория использует Vending-Bench и Drone-Bench, чтобы измерить, насколько хорошо модели ИИ действуют самостоятельно в течение длительного времени или пишут программное обеспечение для физических систем.
В смоделированном бизнесе по продаже товаров через автоматы Astra заработала почти втрое больше, чем Claude Fable 5.1. В Drone-Bench, по данным Andon Labs, Astra стала первой моделью, чьи лучшие попытки превзошли базовый показатель, разработанный человеком и ИИ, во всех пяти подзадачах.
Astra ведёт более жёсткие переговоры и тратит меньше, чем Claude Fable 5.1
В Vending-Bench каждая модель получает $500 и должна управлять торговым автоматом в течение смоделированного года. Она ищет поставщиков, договаривается о закупочных ценах, заказывает товары, устанавливает розничные цены и пытается увеличить баланс на банковском счёте.
По данным Andon Labs, за шесть запусков GPT-6 Astra в среднем получила $15 515. Средний результат Claude Fable 5.1 составил $5 422. Даже лучший результат Fable — $9 874 — значительно уступил худшему результату Astra, составившему $13 272. Astra стала первой моделью OpenAI, возглавившей рейтинг Vending-Bench 2. По данным Andon Labs, отрыв от модели, занявшей второе место, также оказался крупнейшим за всю историю бенчмарка.

Одно из наиболее существенных различий проявляется в закупках. Со временем Fable соглашается на всё менее выгодные сделки. Для обычной банки Coca-Cola средняя закупочная цена повышается с $1,17 в первые 90 дней до $2,21 ближе к концу смоделированного года. Astra ведёт переговоры более последовательно. В одном из задокументированных Andon Labs случаев поставщик запросил за корзину товаров $226,32. Astra твёрдо настояла на цене $108 и заключила сделку.
Astra также лучше справляется с ненадёжными поставщиками. За шесть запусков Fable 5.1 внесла 45 предоплат поставщикам, которые уже прекратили работу, потеряв $14 331. Astra столкнулась с ещё большим числом закрытий — 64, — но, по данным Andon Labs, не было зафиксировано ни одной выявленной потери из-за таких предоплат. Fable распознала проблему и написала правило, согласно которому платить можно только после письменного подтверждения. Несколько дней спустя модель нарушила собственное правило.
Astra отказывается от сговора о ценах
Andon Labs также тестирует модели в Vending-Bench Arena, где несколько ИИ-агентов управляют конкурирующими торговыми автоматами в одном месте. Astra однозначно отказалась от предложения о сговоре по ценам, поступившего от китайской модели GLM-5.3. Andon Labs не обнаружила ни одного случая лжи со стороны Astra в трёх изученных играх арены.
Claude Fable 5.1 участвовала в том, что Andon Labs классифицировала как незаконное соглашение о сговоре по ценам с GLM-5.3. Fable соблюдала соглашение только тогда, когда это отвечало её собственным интересам. Astra выиграла все три игры.
Andon Labs оценивает Astra как более эффективную с экономической точки зрения и лучше согласованную с заданными целями, однако эта оценка основана на поведении, наблюдавшемся в рамках бенчмарка, и автоматически не распространяется на другие ситуации.
Astra — первая модель, выполнившая все пять задач Drone-Bench лучше базового показателя
Drone-Bench проверяет другой тип возможностей автономных агентов. Модели пишут код, позволяющий недорогому дрону DJI Tello EDU автономно перемещаться по офису, распознавать конкретного человека и следовать за ним. Бенчмарк состоит из пяти этапов: реконструкция окружающей среды в 3D, определение местоположения дрона, навигация, обнаружение целевого человека и отслеживание.
Каждая задача оценивается отдельно по сравнению с кодом, который разработчик-человек создал с помощью агентов для написания кода для собственной демонстрации Andon. Каждая модель получает десять запусков на задачу и может отправить до десяти версий кода за один запуск. После каждой попытки она получает оценку и может улучшить своё решение.

В оригинальной статье за июль самой сильной моделью была Claude Fable 5. Передовые модели превзошли базовый показатель человека и ИИ в четырёх из пяти задач хотя бы в одном запуске. 3D-реконструкция оставалась нерешённой задачей. Andon Labs сообщила, что Astra стала первой моделью, чьи лучшие результаты превзошли базовый показатель во всех пяти задачах Drone-Bench, включая реконструкцию.
Astra создала конвейер, объединяющий COLMAP и DA3 с дополнительной фильтрацией глубины. По данным Andon Labs, модель использовала видеозаписи офиса для создания пригодной для навигации 3D-модели, которая получила более высокую оценку, чем эталонное решение человека и ИИ.
Лучшие результаты не означают стабильной работы
В задаче обнаружения человека Astra превосходит базовый показатель в четырёх из десяти запусков. В 3D-реконструкции ей удаётся сделать это лишь в одном из десяти запусков. Andon Labs подсчитала, что средний запуск Astra имеет лишь 2,8% вероятности пройти все пять этапов последовательно.
Astra впервые доказала, что передовая модель общего назначения может создавать код, превосходящий базовый показатель, для каждой части задачи. Но если перемножить вероятности успешного выполнения полного сквозного запуска, шансы всё ещё остаются низкими. Основываясь на прогрессе за последние два года, команда прогнозирует, что передовая модель сможет решить все пять задач за одну попытку к первому кварталу 2027 года.
GPT-6 Astra уже работает как разведывательный дрон
В демонстрации Andon Labs GPT-6 Astra автономно проводит дрон через офис по команде «ChatGPT, найди этого человека и следуй за ним». Модель распознаёт конкретного человека и отслеживает его. Пространственное картографирование, навигация и отслеживание человека выполняются без участия человека. Другие бенчмарки также показывают, что GPT-6 Astra обладает особенно сильными способностями к пространственному мышлению.
Когда критики спросили, зачем они создают технологию, о которой все постоянно предупреждают, Andon Labs ответила, что бенчмарк не помогает ИИ управлять дронами, а измеряет, насколько хорошо нынешние модели уже способны это делать. Шесть месяцев назад передовые модели не справлялись с этими задачами и терпели крушение. Теперь Astra превосходит базовый показатель человека в каждой подзадаче.
Andon Labs утверждает, что общественность и законодатели должны знать об этих возможностях до того, как дроны с ИИ достигнут сверхчеловеческого уровня навигации. Ни одна лаборатория не имеет доступа к бенчмарку. Andon Labs самостоятельно проводит все оценки, чтобы не дать компаниям оптимизировать свои модели под этот тест.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчёт о передовых технологиях «AI Radar» шесть раз в год, полный доступ к архиву и разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.