Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

GPT-6 Astra управлява дрон за наблюдение и самостоятелно ръководи бизнес

GPT-6 Astra управлява разузнавателен дрон и самостоятелно ръководи бизнес
Tomislav Bezmalinović
13 септември 2026 г.
Nano Banana Pro по заявка на THE DECODER

Основни моменти

  • Andon Labs тества GPT-6 Astra в два бенчмарка за агенти, в които моделът постига много по-добри резултати от Claude Fable 5.1.
  • При управлението на симулиран бизнес с вендинг автомати Astra постига среден краен банков баланс от 15 515 долара — почти три пъти повече от резултата на Fable.
  • В Drone-Bench Astra става първият модел, надминал базовото ниво на човешко-ИИ представяне и в петте подзадачи, включително при писането на код, който позволява на дрон автономно да открие и следва конкретен човек.

Andon Labs тества GPT-6 Astra в два много различни бенчмарка за агенти. При закупуването на стока и управлението на вендинг автомат OpenAI моделът разгромява Claude Fable 5.1. При наблюдение с дрон Astra е първият модел, надминал базовото ниво на човешко-ИИ представяне и в петте подзадачи, макар че процентът му на успеваемост остава ненадежден.

GPT-6 Astra на OpenAI превъзхожда всички предишни водещи модели в два бенчмарка за агенти на Andon Labs. Изследователската лаборатория използва Vending-Bench и Drone-Bench, за да измери доколко добре моделите с изкуствен интелект действат самостоятелно за продължителни периоди или пишат софтуер за физически системи.

В симулиран бизнес с вендинг автомати Astra печели почти три пъти повече от Claude Fable 5.1. В Drone-Bench Andon Labs посочва, че Astra е първият модел, чиито най-добри опити надминават базовото ниво, разработено от човек и ИИ, и в петте подзадачи.

Astra преговаря по-настойчиво и харчи по-малко от Claude Fable 5.1

В Vending-Bench всеки модел получава 500 долара и трябва да управлява вендинг автомат в продължение на симулирана година. Той намира доставчици, договаря покупни цени, поръчва стоки, определя цени на дребно и се опитва да увеличи банковия си баланс.

В шестте теста GPT-6 Astra постига средно 15 515 долара, според Andon Labs. Claude Fable 5.1 постига средно 5 422 долара. Дори най-добрият резултат на Fable — 9 874 долара — е значително под най-слабия резултат на Astra от 13 272 долара. Astra е първият модел на OpenAI, оглавил класацията на Vending-Bench 2. Разликата спрямо модела на второ място също е най-голямата, регистрирана някога от бенчмарка, според Andon Labs.

Точкова диаграма от Vending-Bench 2, показваща крайните банкови баланси на GPT-6 Astra (средно 15 515 долара) спрямо Claude Fable 5.1 (средно 5 422 долара) след една симулирана година.
Крайни банкови баланси от шест теста на Vending-Bench 2 за всеки модел. Лентите показват средните стойности, а точките — отделните тестове. Всеки тест на Astra надминава всеки тест на Fable. | Изображение: Andon Labs

Една от най-големите разлики се проявява при снабдяването. С течение на времето Fable приема все по-неизгодни сделки. При стандартна кенче Coca-Cola средната му покупна цена се повишава от 1,17 долара през първите 90 дни до 2,21 долара към края на симулираната година. Astra преговаря по-последователно. В един документиран от Andon Labs случай доставчик предлага кошница със стоки за 226,32 долара. Astra настоява за 108 долара и сключва сделката.

Astra се справя по-добре и с ненадеждните доставчици. В шестте теста Fable 5.1 прави 45 авансови плащания към доставчици, които вече са прекратили дейността си, и губи 14 331 долара. Astra се сблъсква с още повече закрити доставчици — 64, но Andon Labs посочва, че не е регистрирала идентифицирани загуби от такива авансови плащания. Fable разпознава проблема и създава правило да плаща само след писмено потвърждение. Няколко дни по-късно моделът нарушава собственото си правило.

Astra отказва схеми за фиксиране на цените

Andon Labs тества моделите и във Vending-Bench Arena, където множество ИИ агенти управляват конкуриращи се вендинг автомати на едно и също място. Astra изрично отказва предложение за фиксиране на цените от китайския модел GLM-5.3. Andon Labs не наблюдава нито един случай на лъжа от страна на Astra в трите арена игри, които изследва.

Claude Fable 5.1 участва в това, което Andon Labs определя като незаконно споразумение за фиксиране на цените с GLM-5.3. Fable спазва споразумението само когато то отговаря на собствените му интереси. Astra печели и трите игри.

Andon Labs оценява Astra като по-силен икономически играч и по-добре съгласуван с човешките цели, макар че тази оценка се основава на поведението, наблюдавано в бенчмарка, и не се пренася автоматично към други ситуации.

Astra е първият модел, надминал и петте задачи в Drone-Bench

Drone-Bench тества различен тип способности на агентите. Моделите пишат код, който позволява на евтин дрон DJI Tello EDU автономно да се придвижва в офис, да идентифицира конкретен човек и да го следва. Бенчмаркът има пет стъпки: 3D реконструкция на средата, локализиране на дрона, навигация, откриване на целевия човек и проследяване.

Всяка задача се оценява индивидуално спрямо код, създаден от човек-разработчик с помощта на кодиращи агенти за собствената демонстрация на Andon. Всеки модел получава десет опита за задача и може да изпрати до десет версии на кода за всеки опит. След всеки опит той получава оценка и може да подобри решението си.

3D облак от точки на офисна среда в жълто и синьо, реконструирана от GPT-6 Astra в Drone-Bench.
3D реконструкцията на офисната среда, създадена от GPT-6 Astra. | Изображение: Andon Labs

В оригиналната статия от юли Claude Fable 5 е най-силният модел. Водещите модели са надминали базовото ниво на човешко-ИИ представяне в четири от петте задачи в поне един тест. 3D реконструкцията остава нерешена. Andon Labs съобщава, че Astra е първият модел, чиито най-добри изпълнения надминават базовото ниво и в петте задачи на Drone-Bench, включително реконструкцията.

Astra изгражда процес, комбиниращ COLMAP и DA3 с добавено филтриране на дълбочината. Моделът използва видеозапис от офис, за да създаде навигируем 3D модел, който според Andon Labs получава по-висока оценка от референтното решение, разработено от човек и ИИ.

Най-добрите резултати не означават надеждно представяне

При откриването на хора Astra надминава базовото ниво в четири от десетте теста. При 3D реконструкцията успява само в един от десетте. Andon Labs изчислява, че средният тест на Astra има едва 2,8 процента вероятност да премине и петте стъпки последователно.

Astra за първи път доказва, че водещ модел с общо предназначение може да създаде код над базовото ниво за всяка част от задачата. Но когато вероятностите за пълно изпълнение от край до край се умножат, шансовете все още са ниски. Въз основа на напредъка през последните две години екипът прогнозира, че водещ модел би могъл да реши и петте задачи с един опит до първото тримесечие на 2027 г.

GPT-6 Astra вече работи като разузнавателен дрон

В демонстрация на Andon Labs GPT-6 Astra управлява автономно дрон през офис след подадената команда „ChatGPT, намери този човек и го следвай“. Моделът идентифицира конкретен човек и го проследява. Пространственото картографиране, навигацията и проследяването на хора се извършват без човешка намеса. Други бенчмаркове също показват, че GPT-6 Astra има особено силни способности за пространствено мислене.

Когато критици питат защо създават технология от типа, за който всички постоянно предупреждават, Andon Labs отговаря, че бенчмаркът не помага на ИИ да управлява дронове, а измерва доколко добре настоящите модели вече могат да го правят. Преди шест месеца водещите модели се провалят в тези задачи и се разбиват. Сега Astra надминава човешкото базово ниво във всяка подзадача.

Andon Labs твърди, че обществеността и законодателите трябва да са наясно с тези способности, преди дроновете, управлявани от ИИ, да достигнат свръхчовешки умения за навигация. Нито една лаборатория няма достъп до бенчмарка. Andon Labs извършва всички оценки самостоятелно, за да предотврати оптимизирането на моделите от страна на компаниите специално за теста.

Новини за ИИ без сензация – подбрани от хора

Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за ИИ, нашия ексклузивен шест пъти годишно доклад за водещите модели „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.

Източник: Andon Labs Vending-Bench | Andon Labs Drone-Bench | Andon Labs @ X

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини