Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Пробивите в роботиката с ИИ няма да променят живота ви скоро

Тази история е съвместна работа на MIT Technology Review и Aventine — нестопанска изследователска фондация, която създава и подкрепя съдържание за това как технологиите и науката променят начина, по който живеем.

Робот с човешки облик — бял, с черна глава и торс — се появява във видеоклипове в социалните мрежи. Може би сте го виждали да танцува или да подава пуканки, да изхвърля боклук в кошче, да прахосмукира или да натиска бутона на микровълнова печка. А може би сте гледали как пада назад, докато раздава бутилки с вода, или как се мъчи да изглади риза.

Това е Optimus на Tesla — хуманоиден робот, задвижван от изкуствен интелект, за когото главният изпълнителен директор на компанията Илон Мъск смята, че ще бъде „не просто най-големият продукт на Tesla досега, а вероятно най-големият продукт изобщо“, насочен първо към работа във фабриките, а по-късно и в домовете ни. В крайна сметка той „ще има човешка, а след това и свръхчовешка сръчност“, каза Мъск пред акционерите през юли. По думите му роботите Optimus биха могли да автоматизират почти целия човешки труд — от пренасяне на метални листове до сгъване на пране — срещу едва 20 000 долара за брой. През януари, говорейки на годишната среща на Световния икономически форум в Давос, Швейцария, той прогнозира, че до края на 2027 г. роботите може да бъдат пуснати в продажба за широката публика.

Мъск не е единственият, който проповядва тази идея. Марк Андреесен, съосновател и генерален партньор на базираната в Силициевата долина компания за рисков капитал Andreessen Horowitz, казва, че роботиката може да се превърне в „най-голямата индустрия в историята на планетата“. През януари Дженсън Хуанг, главен изпълнителен директор на Nvidia, заяви, че хуманоидните роботи ще достигнат човешко ниво на способности още тази година. Според Morgan Stanley броят на роботите, които „приличат и действат като хора“, вероятно ще достигне близо 1 милиард до 2050 г., създавайки пазар на стойност над 5 трилиона долара.

Подобни твърдения до голяма степен се подхранват от идеята, че същият напредък в областта на изкуствения интелект, който стои зад инструменти като ChatGPT на OpenAI и Claude на Anthropic, ще позволи на ново поколение роботи да имитират човешките движения по начина, по който чатботовете имитират човешкия език. Много изследователи в областта на роботиката обаче са скептични и твърдят, че подобни предположения омаловажават предизвикателствата пред използването на интелект, изграден върху език и изображения, за овладяване на безкрайната изменчивост на физическия свят. „Нито една от тези компании [които създават хуманоидни роботи] — абсолютно нито една — няма представа как да направи тези роботи достатъчно умни, за да бъдат полезни“, каза Ян Льокун, често наричан един от кръстниците на изкуствения интелект, на друго събитие по време на януарската конференция в Давос.

Изследователите посочват също, че склонността да се смесват хуманоидните роботи, създадени по подобие на хората, с така наречените универсални машини, способни да се учат и да изпълняват множество задачи, е подвеждаща. „Много е лесно да направиш робот, който изглежда като човек“, обяснява Джонатан Хърст, съосновател и главен робототехнически директор на Agility Robotics и професор по роботика в Орегонския държавен университет. „Драматично по-трудно е да направиш машина, която се движи или се държи динамично и физически като човек.“

Тези противоречия — дали универсалните хуманоидни роботи са точно зад ъгъла или изобщо не се виждат на хоризонта, както и дали настоящите форми на изкуствения интелект са всичко необходимо за усъвършенстването им — се разиграват в лабораториите по роботика в цялата страна, където шумът около сроковете прикрива бавния, трудоемък, но значим напредък.

Преди около десетилетие поредица от пробиви доведе до революция в генеративния изкуствен интелект, превръщайки отдавна въобразяваната възможност за изкуствен интелект в реалност. Роботиците — макар да не са единодушни кога точно ще се случи това — смятат, че подобна трансформираща революция е възможна и в роботиката. Тя би дала на машините физическа интуиция и плавност на движенията, които отдавна остават недостижими. Докато напредъкът в роботиката бавно върви напред, въпросът е дали същите методи и инструменти, които подхраниха развитието на изкуствения интелект, ще са достатъчни, за да стигнем дотам, или е необходим напълно нов път.

Роботите срещат напредналия изкуствен интелект

За да видим един от най-умните роботизирани мозъци, работещи днес, си струва да разгледаме какво може да прави Google DeepMind с устройство, наречено ALOHA 2 — съкращение от „A Low-cost Open-source Hardware System for Bimanual Teleoperation“ („Нискобюджетна хардуерна система с отворен код за двуръчно телеуправление“).

Отдавна сред роботиците съществуват разногласия дали човешкият облик е необходим за универсалните роботи: привържениците му твърдят, че той ще помогне на роботите да се впишат в съществуващия свят, а противниците смятат, че усилията не си струват. ALOHA 2 отразява втория начин на мислене. Не е особено впечатляваща на вид — представлява просто чифт ръце, няколко захващащи механизма и две камери. Но въпреки привидната си простота тя е работен кон за изследователите от Google DeepMind, които я използват за тестване на най-напредналата си система за изкуствен интелект в роботиката — Gemini Robotics — в различните си лаборатории.

Когато се управлява от Gemini Robotics, ALOHA 2 се превръща в по-универсален робот, доколкото може да изпълнява множество задачи въз основа на примерите, върху които е била обучена. Помолете я да приготви кутия за обяд и, както показва видео от това упражнение, тя може да използва двата си захващащи механизма, за да постави внимателно парче бял хляб в плик Ziploc, да го затвори, да сложи грозде в контейнер Tupperware, да затвори капака и след това внимателно да премести предметите в кутия за обяд, преди да я закопчее.

Не е кой знае какъв обяд. Но фактът, че роботът може да го приготви, представлява реална крачка напред спрямо възможното дори само преди три години.

Това до голяма степен се дължи на изкуствения интелект и влиянието му върху така наречените политики на робота — системи, които управляват начина, по който универсалният робот трябва да оцени и разбере заобикалящата го среда, да планира как да се движи в нея и след това да изпълни задачата си правилно.

Роботът ALOHA 2 не е много повече от две механични ръце върху работен плот, но служи като тестова платформа за авангардни модели на изкуствен интелект в роботиката. Тези анимации са създадени въз основа на човешко телеуправление на ръцете на робота — данни, използвани за обучение на моделите на Google DeepMind. (Видео: Google DeepMind / Stanford University / Hoku Labs)

Исторически тези политики се основаваха на правила, разработени от инженери и твърдо кодирани в софтуера на робота — хиляди редове код, които определяха всеки милиметър от движенията на робота при стотици задачи. През последните няколко години обаче — и именно това до голяма степен стои зад оптимизма по отношение на универсалните роботи — политиките на роботите се поверяват на напреднали системи с изкуствен интелект, вместо да бъдат кодирани в софтуера им. Първоначално това се случи с VLM — модели за зрение и език. Те са подобни на големите езикови модели, но се обучават както с изображения, така и с думи. Покажете на VLM снимка на разлято кафе и го помолете да намери инструмент за почистване на бъркотията — той може да разпознае намираща се наблизо кърпа. Подобно непосредствено разбиране на контекста не съществуваше преди няколко години, когато политиките на роботите се кодираха ръчно.

След това се появиха модели за зрение, език и действие, които позволяват на роботите да оценяват средата си и да действат в нея. Моделите правят това, като добавят още един компонент: команди за движение. VLA се обучават с поредица от изображения или видеоклипове, свързани с изпълнението на дадена задача, заедно със съответните данни за движението на роботизирана ръка при изпълнението ѝ. Тези данни за движенията обикновено се събират чрез телеуправление, при което човек използва дистанционни управления, за да води робота през определено действие. Това обучение позволява на изкуствения интелект да се научи как да командва робота да се движи и да работи по време на дадена задача. Поставете робот, задвижван от VLA, пред бюро и му кажете „затвори лаптопа“ или „навий кабела на слушалките“ — той ще огледа сцената, ще разпознае съответния предмет, ще планира начин за изпълнение на заявката и след това ще задвижи ръцете си — поне ако вече е виждал тази задача изпълнена.

Моделът Gemini Robotics е VLA, обучен с много часове човешки демонстрации, показващи огромен набор от различни действия. В резултат той може да изпълнява сравнително сложни задачи като вземане на снежен грах с кухненски щипки, правене на оригами или приготвяне на обикновен обяд. Това е впечатляващо, но има очевидно ограничение: засега, ако робот, управляван от VLA, бъде помолен да изпълни задача извън набора, с който е обучен, вероятността да се провали е много голяма.

„Ако мислим за пространството на всички задачи, една наистина универсална политика би могла да изпълнява всичко по този спектър“, казва Едуард Джонс, професор по роботика в Имперския колеж в Лондон. Днес обаче моделът Gemini Robotics може да прави само „няколко неща тук и няколко неща там“.

Търсенето на истинска универсалност

И така, как да накараме роботите да могат да правят повече неща? Обичайният отговор вероятно не е изненадващ: да ги обучаваме с повече данни.

Повече данни означава повече примери, а повече примери означават по-голяма универсалност. Google DeepMind например иска да събере „колкото се може повече данни“, казва Панаг Санкети, бивш технически ръководител по роботика в компанията, който в момента работи по свой проект за изкуствен интелект и роботика. Но откъде да се набавят те? Големите езикови модели имаха предимството на океани от съществуващ текст за обучение. Не съществува съответстващ резерв от висококачествени физически демонстрации, с които да се обучават роботите. Изследователите имат няколко начина да компенсират това, но всички те имат недостатъци. Единият е да се наемат голям брой хора, които да създават и събират данни чрез телеуправление — скъпо и бавно. Другият е VLA да се обучават с видеоклипове на хора, изпълняващи различни дейности — полученото качество на данните е ниско. Трети вариант е роботите да се изпращат в реалния свят и събраните от тези преживявания данни да се използват за допълнително усъвършенстване на моделите — роботите не са безопасни или надеждни извън лабораториите. Санкети смята, че най-вероятният път напред е „многопосочен“ подход, който използва данни, събрани от всички тези източници.

Но убеждението, че само данните за обучение са отговорът, далеч не е универсално. Хърст от Agility го описва като „фундаментално погрешна предпоставка“.

Проблемът е, че задачите в реалния свят бързо се усложняват. Ако се опитвате например да приготвите кафе, има безброй променливи: няма две еднакви кухни; кафемашините работят по различен начин; различните чаши изискват различен захват; кафето, горещата вода и млякото трябва да се обработват по различен начин. Дори тази проста задача изисква разбиране на постоянно променящ се набор от възможности. Постигането на универсалност чрез VLA, твърди Хърст, би изисквало „пълно покритие с данни на всички неща, които [един робот] би могъл някога да направи“. Или с други думи — почти безкраен обем от данни за обучение.

Льокун отхвърля целия този подход. „Подходите [към изкуствения интелект], които са успешни при езика, не работят при многомерни, непрекъснати и шумни данни“ — точно такъв тип данни са обичайни в роботиката, каза той в Давос. „Трябва да използвате нещо друго.“

Водещият кандидат за това „нещо друго“ е така нареченият модел на света — форма на изкуствен интелект, обучена не толкова с текст, колкото с комбинация от видео, триизмерни сканирания и данни от сензори, създадена да предсказва резултатите от действията в реалния свят. Целта е да се създадат модели, които притежават вътрешно представяне на реалността, достатъчно прецизно, за да улавят начина, по който физическият свят действително функционира — как предметите се движат, сблъскват, падат и деформират. Ако роботиците успеят да обучат машините в симулации, достатъчно близки до физиката на реалния свят, разработването ще стане по-бързо, по-евтино и по-безопасно, като се намали необходимостта от изпитания в реална среда. Още по-трансформиращо би било, ако роботите, снабдени с модели на света, могат да разсъждават за заобикалящата ги среда, вместо просто да реагират на нея, което би им помогнало да предвиждат последствията от дадено действие, преди да го предприемат.

Най-новите модели на Google DeepMind за роботи са все по-сръчни, макар и доста бавни и непредсказуеми

Компании като Nvidia и Google работят по тази технология, а инвеститорски капитали се вливат във високопрофилни стартъпи. World Labs, съоснована от изследователката в областта на изкуствения интелект от Станфорд Фей-Фей Ли, привлече 1 милиард долара финансиране през февруари и беше придобита от AMD в края на септември за 8,2 милиарда долара. AMI Labs, съоснована от Льокун — бивш главен учен по изкуствения интелект в Meta — също привлече 1 милиард долара през март. Но по собственото им признание все още сме в началото. В края на миналата година Ли описа областта като „в начален стадий“, като добави, че „фундаменталните подходи все още се изграждат“. В публикация в Substack от юни тя описа плашещи предизвикателства. Засега моделите на света са обещаваща изследователска област, а не непосредствен път към универсална роботика, но започваме да виждаме проблясъци на това, което биха могли да постигнат.

Един такъв проблясък се появи при малък, но потенциално значим скок напред, случил се в роботизирана лаборатория в Сан Франциско през април миналата година.

Пробив?

В сърцето на района Мишън в Сан Франциско стартъпът Physical Intelligence — или PI (както π), както предпочита да бъде известен — се фокусира върху разработването на универсален мозък, който теоретично би могъл да превърне всеки робот в универсален. Използвайки подход към обучението на модели за роботи, който включва всичко, включително кухненската мивка, компанията наскоро забеляза намек за това на какво би могъл да бъде способен роботизиран мозък, снабден с модел на света.

През 2024 г. PI публикува подробности за първата си универсална роботизирана система, наречена π0 — VLA, която компанията определи като „най-способната и сръчна универсална политика за роботи досега“. Първоначално моделът е обучен с 10 000 часа собствена колекция от човешки демонстрации, събрани чрез телеуправление, както и с няколко набора от данни за роботи с отворен код. Версията, пусната през пролетта на 2025 г., π0.5, е обучена с по-голямо разнообразие от набори данни, включително анотирани изображения от интернет, което ѝ придава по-голяма универсалност. Актуализацията от есента на 2025 г., π0.6, добавя към модела обучение чрез подсилване.

Всяка актуализация води до значителни подобрения в представянето на модела, увеличавайки набора му от способности — от бавно сгъване на пране, през прибиране на предмети в нова среда, до изпълнение на задачи като сгъване на кутии с по-висока успеваемост. След това, през април 2026 г., π0.7 сякаш изстрелва PI на нова територия. Тази версия използва по-малко мощен модел на света, който генерира изображения на стъпките, необходими за изпълнението на дадена задача. Докато роботът изпълнява работата, този „лек“ модел му подава моментни снимки на следващото действие.

Как се учи робот да използва нож? В стартъпа Physical Intelligence всичко започва с проектирането на правилната архитектура на изкуствения интелект, която включва компоненти, посветени на езика, зрението и движението. Това ще му помогне да свърже команди като „Хей, роботе, нарежи зеленчуците ми!“ с подходящите действия.
WINNI WINTERMEYER
Данните за обучение на изкуствения интелект могат да идват от много източници, но един от най-важните са човешките демонстрации. Служител на стартъпа управлява роботизирана ръка чрез телеуправление, запознавайки изкуствения интелект със задачата да нареже тиквичка.
WINNI WINTERMEYER
A researcher points out a detail from a training video to his colleague on a laptop screen
Изследователи обучават модела на изкуствения интелект със стотици примери на човешки демонстрации, както и с изображения от интернет и видео от гледна точка на човек.
WINNI WINTERMEYER
Robot grippers cutting a yellow squash with a kitchen knife
След като изкуственият интелект бъде обучен, екипът му поставя задача, която не е виждал досега, например да нареже тази лятна тиква. Когато роботът не е виждал точно тази задача — може да се чуди дали това е жълта тиквичка или необичаен банан — той може да сгреши. Но всеки провал може да бъде използван за усъвършенстване на модела.
WINNI WINTERMEYER

Компанията твърди, че моделът показва първите признаци на композиционна генерализация — термин, описващ способността на системите с изкуствен интелект да изпълняват умения, на които никога не са били изложени, като комбинират научени по време на обучението умения. При един тест моделът е помолен да „постави сладък картоф във фритюрник с горещ въздух“ — задача, с която никога преди не се е сблъсквал. В демонстрационно видео машината се суети малко, прави няколко неуспешни опита и в крайна сметка се справя що-годе добре, макар че не завършва задачата напълно.

Сергей Левин, професор в Калифорнийския университет в Бъркли и съосновател на PI, е развълнуван от потенциала: „Това всъщност е първият път, когато убедително виждаме подобен тип композиционна генерализация — можем по същество да поискаме от модела да изпълни задачи, за които не сме събирали конкретни данни и не сме го обучавали, а той действително ще направи приемлив опит.“

Успехът кара екипа да се запита как моделът е успял да постигне подобно нещо. След известно проучване те откриват откъси от релевантни анотирани данни от телеуправление, скрити в обучаващия материал, включително два примера на човек, използващ робота, за да вкара кошницата на фритюрник с горещ въздух във фритюрника. Тези късчета данни може да са били достатъчни, за да позволят на π0.7 почти да изпържи сладък картоф с горещ въздух.

Засега остава неясно колко впечатляващи са всъщност способностите на π0.7 за генерализация. Въпреки това, предвид колко бегло моделът се е сблъсквал с фритюрници с горещ въздух, той дава представа докъде могат да стигнат роботите с най-съвременните изследвания в момента.

„70% успеваемост е все едно не работи“

Може би усещате разминаването между несигурните бебешки стъпки, които роботите правят в лабораториите — „Вижте! Постави сладък картоф във фритюрник с горещ въздух!“ — и ослепителната, реалистична пъргавина, демонстрирана в много презентации и видеоклипове, в които роботите правят всичко — от танцуване на сцена до учтиво сервиране на напитки. Подобни демонстрации често не разкриват ясно един ключов факт: в много случаи хора управляват робота или внимателно са програмирали действията му. (Роботът, който се появи на сцената с главния изпълнителен директор на Nvidia Дженсън Хуанг през март 2025 г. и привидно реагираше на инструкциите му и го следваше, е бил управляван дистанционно от човек, когото създателите му нарекли „кукловод зад кулисите“.)

Засега напълно автономното планиране на движенията, при което роботът знае накъде трябва да се насочи — особено в нови и хаотични среди като строителна площадка или непознат дом — остава до голяма степен нерешено предизвикателство. Още по-голямо предизвикателство — макар често свързано с него — е да се накарат роботите да изпълняват по-големи и по-неясни задачи, които включват множество действия и изискват решения за това как и в какъв ред да бъдат изпълнени. Това би било разликата между робот, който може да постави чиния в микровълнова печка, и робот, който може успешно да реагира на команда „Приготви вечеря“, като провери хладилника, нареже продуктите и включи печката. Най-добрите опити на Google DeepMind за нещо подобно — при които роботът е трябвало да огледа кухня и да събере в кошница всички съставки за гъбено ризото — досега са завършвали с провал.

Предизвикателството се усложнява и от факта, че един практичен робот трябва да се справя правилно почти всеки път. При VLA „хората са много въодушевени, когато резултатът им се подобри от 50% успеваемост на 70%“, казва Марк Райбърт, основател на Boston Dynamics. „Но 70% успеваемост е все едно не работи, нали?“

split screen of nine clips with different robots attempting tasks; some are teleoperated and a few have collided with objects or fallen.
Демонстрациите често карат роботите да изглеждат полезни, но машините все още допускат твърде много грешки, за да могат да се използват надеждно в домовете и фабриките.
AP IMAGES, SHUTTERSTOCK, 1X, AGILITY ROBOTICS, GOOGLE DEEPMIND

Малкото хуманоидни роботи, които се тестват в реални условия, изпълняват изключително ограничени задачи в строго контролирана среда. Те са далеч от универсални. Според компанията стотици роботи на Agility са внедрени в рамките на изпитания в обекти, собственост на GXO Logistics, Amazon и Schaeffler. Но засега, казва Хърст, роботите са насочени към прости задачи като преместване на контейнери и кошове. Дори тогава, добавя той, са били нужни години, за да се разработят роботи, достатъчно безопасни, за да могат логистичните компании изобщо да обмислят използването им. От своя страна Илон Мъск заяви през май 2025 г., че „хиляди“ роботи Optimus ще работят във фабриките на Tesla до края на годината, но през януари тази година каза, че компанията разполага само с „няколко робота Tesla Optimus, които изпълняват прости задачи във фабриката“.

Макар хуманоидите да започват да навлизат във фабриките, преминаването към дома ще бъде още по-трудно. В момента, ако желаете, можете да поръчате предварително домашния робот Neo на 1X, който се очаква да бъде готов за доставка по-късно тази година. Срещу 20 000 долара той обещава да поеме „скучните и рутинни задачи у дома“ — да прибира съдовете, да отваря вратата, да подрежда дневната — „за да можете да се съсредоточите върху важните за вас неща“. Идеята е един ден този робот с височина пет фута и шест инча да изпълнява всички тези задачи автономно, но засега за повечето от тях е необходим дистанционен човешки оператор. (Да, човек ще трябва да получи разрешение да наднича в дома ви през камерите на робота.) Попитан колко време ще е необходимо, докато напълно автономните роботи бъдат готови за домашна работа, Хърст каза: „Ако трябва да посоча число, бих казал, че ще са нужни 10 години, преди роботите… действително да започнат да вършат полезни неща в домовете на хората.“

Когато това се случи, роботите напълно възможно е да бъдат китайски, тъй като Китай изпреварва значително Запада по отношение на производството. Близо 90% от приблизително 15 000-те хуманоидни робота, доставени през 2025 г., са произведени от китайски компании, според компанията за пазарни анализи Omdia и китайската роботизирана фирма Unitree. Един от моделите, произведени от Unitree — компанията, доставила повече хуманоидни роботи от всяка друга през миналата година — струва по-малко от 6000 долара. Подобна достъпна цена може значително да увеличи привлекателността на роботите за потребителите, макар че компанията очаква машините ѝ първоначално да се използват в индустриални приложения. (Ако се чудите кой купува всички тези китайски роботи, AP наскоро съобщи, че поръчките идват предимно от корпоративни и академични лаборатории и държавни предприятия.)

И преди сме били тук

Мечтата за създаване на хуманоиден робот е дълбоко вкоренена: още през 1495 г. Леонардо да Винчи скицира проекти за механичен рицар, управляван с кабели и макари. През XX век машините от научнофантастичните мечти се появяват и изчезват.

Jeanne Dowling reaches up to light a cigarette for Elektro, a seven foot robot built by Westinghouse.
Elektro на Westinghouse е сензация на Световното изложение през 1939 г.
GETTY IMAGES

Elektro — седемфутова кутия върху крака, създадена от Westinghouse — се появява на Световното изложение в Ню Йорк през 1939 г., пушейки цигара. WABOT-1, създаден от университета Васеда в Япония през 1973 г., е първият пълноразмерен програмируем хуманоиден робот. ASIMO на Honda, представен през 2000 г., вероятно е първата подобна машина, която демонстрира някаква реална компетентност — поне до известна степен можеше да изкачва стъпала, да разпознава лица и автономно да се придвижва в пространството. Но роботът е спрян от производство през 2018 г., тъй като не успява да надхвърли достатъчно възможностите си от демонстрациите, за да бъде полезен.

По онова време всички те са впечатляващи — дори зашеметяващи — инженерни постижения. Но нито един не е готов да се ориентира в реалния свят. Днешните роботи, дори с трансформиращата сила на напредналия изкуствен интелект, все още са изправени пред същото екзистенциално предизвикателство.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MIT Tech Review на

Прочетете оригинала в MIT Tech Review ↗

Текстът и изображенията са собственост на MIT Tech Review и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини