Създателите на роботизирани мозъци излизат от ерата на GPT-2
Физическият ИИ е един от най-горещите сектори във финансирането на рисков капитал, като компаниите набират милиарди, за да приложат инструментите, които ни дадоха големите езикови модели, в роботиката.
Този ентусиазъм помогна за успешното първично публично предлагане на Unitree, водещия китайски производител на роботи, чиято оценка достигна 66 милиарда долара след листването му на китайския еквивалент на NASDAQ. Тази седмица обаче всичко се срина и компанията загуби почти половината от стойността си. Анализаторите посочват един очевиден проблем: Макар физическите възможности на роботите да се подобряват, те все още не разполагат с необходимото ноу-хау, за да извършват действително работа, създаваща стойност.
На конференцията Actuate миналата седмица, на която се събраха разработчици, изграждащи ИИ мозъци за роботи, ентусиазмът беше очевиден. Събитието е утроило размера си, откакто стартира през 2023 г., и е имало 1500 участници, според организатора Foxglove — компания, която помага на разработчиците на модели за физически ИИ да управляват и визуализират данните си.
Рискът също беше очевиден: На табела на щанда на Avala, друг играч в инфраструктурата за физически ИИ, беше обещано да се реши „кризата с данните в роботиката“.
Тази криза се изразява в липсата на висококачествени тренировъчни данни за моделите на ИИ. Опитите да се създадат универсални роботи, които могат да изпълняват всякакви задачи, все още са далеч от успеха, а използването на обучение от край до край за конкретни задачи все още не е довело до продукти с надеждна търговска ефективност. За разработчиците отговорът е да имитират по-добре напредъка на водещите лаборатории за ИИ — да откриват или създават по-разнообразни набори от данни, да експериментират с различни режими на обучение и да измислят по-добри сценарии за обучение с подсилване.
Хари Мелсоп, основател на Antioch, стартъп, който изгражда инструменти за симулации за разработчици на модели, предполага, че физическият ИИ се намира в своята „ера на GPT 2“ — модела на OpenAI, предхождащ появата на ChatGPT. Ще са необходими повече данни и изчислителна мощ, за да бъде преодоляна тази граница, особено графични процесори, оптимизирани за проследяване на лъчи, които се използват за създаване на висококачествени симулации.
Най-напреднали са автономните превозни средства, отчасти заради възможността да събират релевантни данни от автомобили, управлявани от хора, и отчасти защото основната задача е да се избягва контакт, а не да се манипулира физическата среда. Голяма част от инструментите за изграждане на модели идват от компаниите за автономни превозни средства; например Foxglove е основана от бивши служители на Cruise, някогашното подразделение за автономно шофиране на General Motors.
А сега тези автомобилни компании все повече залагат, че инвестициите им в инструменти за машинно обучение ще им позволят да се конкурират със специализираните производители на хуманоидни роботи. Tesla вече опитва това със своя робот Optimus, а сега както фокусираната върху автономните превозни средства Wayve, така и гигантът в споделените пътувания Uber стартираха роботизирани лаборатории, насочени към хуманоидни форми, като част от усилията си за научноизследователска и развойна дейност.
„Мисля, че трябва да започнете с превозните средства… роботиката за манипулация е като автономното шофиране преди пет години“, каза пред TechCrunch Алекс Кендъл, главен изпълнителен директор на Wayve. „Инфраструктурата за данни, симулациите и инфраструктурата за ML операции вероятно ще бъдат споделени, но специфичният световен модел за симулатора ще бъде различен след обучението. Ще има много повече общи неща, отколкото различия, но ще са необходими и някои разлики за различните въплъщения.“
Кендъл твърди, че е твърде рано да се обвързват с една конкретна хардуерна платформа — напредъкът при сензорите и другите компоненти се случва бързо, а един наистина универсален модел би трябвало да бъде по-агностичен.
Теофил Жерве, главен изпълнителен директор на Genesis AI, вертикално интегрирана компания за хуманоидна роботика, която тази година набра начален рунд от 105 милиона долара, не беше съгласен и каза пред TechCrunch: „Твърде рано сме в тази вълна, за да работи стратегията с един мозък; нашето виждане е, че има много възможности за съвместно проектиране на хардуера и ИИ.“
Жерве засегна и друга гореща тема в сектора: Към коя конкретна област да насочите бизнеса си с физически ИИ. Роботизираните компании, които се насочват към конкретни задачи, вече извеждат роботите си на терен — Gritt изгражда соларни паркове, Agility внедрява роботи в индустриални среди, а Bedrock управлява автономно багери. Междувременно хуманоидните роботи с общо предназначение не излизат от лабораториите.
„Никой клиент не се интересува от робот с общо предназначение, който работи с 80% успеваемост“, каза Жерве по повод на дилемата. „Виждаме, че много други играчи се насочват към универсални решения, но няма предоставена стойност, защото липсва вертикален фокус… но ако изграждате [за тясна] вертикална област върху GPT 2, ще бъдете смачкани от компанията, която изгражда върху GPT 4.“
Изкушението да се инвестира в конкретна вертикална област обаче е голямо, защото тя осигурява не само приходи, но и данни от реални внедрявания. Макар че данните, специфични за конкретна задача, може да не са достатъчно разнообразни, за да тласкат напред моделите с общо предназначение, те са важни за създаването на робот, който добавя стойност. Техническият директор на Bedrock Кевин Питърсън отбеляза, че компанията му тепърва започва с изкопните дейности като начин да разбере предизвикателствата на „манипулацията в реални условия“, но планира да разработи слой за интелигентност, който да обхваща поредица от строителни машини.
Управлението на всички тези данни е предизвикателство, особено заради голямата плътност на визуалните и лидарните данни. Тази седмица Foxglove обяви нов продукт, изграден върху световния модел Cosmos на Nvidia с отворени тегла, който позволява на инженерите да търсят в тези данни чрез сложни заявки на естествен език, за да създават оценки и симулации. Целта е по-бързо сортиране и отстраняване на грешки, така че разработчиците на модели да могат да итеративно подобряват работата си по-бързо.
И така, какъв ще бъде прословутият момент на ChatGPT за физическия ИИ, който Сам Алтман наскоро каза, че е само на няколко години разстояние? Кендъл посочва, че най-мащабното внедряване на роботи в света все още е това на потребителските роботи прахосмукачки. За него моментът на ChatGPT би бил нещо, което вълнува потребителите, а не инвеститорите, които и без това изглеждат достатъчно развълнувани.
„Един пример за това би бил, когато постигнете автономност без необходимост от наблюдение за по-малко от 1000 долара [за хардуера] в автомобил“, казва Кендъл; неслучайно неговата компания лицензира модели на автомобилни производители в опит да създаде именно това. А този бизнес, който той вижда като възможност за милиарди долари, ще им позволи да изградят наистина универсален модел на въплътен ИИ.
За Жерве моментът, в който физическият ИИ стане реалност, е „манипулация, която просто работи веднага. Можете да говорите с робот на естествен език и да го накарате да изпълнява всяка базова задача, свързана с манипулация, например да бута, да дърпа, да затваря лаптоп, да почиства маса — каквото пожелаете — и той да работи с известна степен на надеждност, да кажем над 80% още от кутията. Това приблизително ще бъде вашето изживяване с ChatGPT.“
Ейдриън Макнийл, главен изпълнителен директор на Foxglove, разглежда въпроса малко по-различно.
„Няма да има момент на ChatGPT за роботиката“, каза той пред TechCrunch. „Това, което превърна ChatGPT в исторически момент, беше разпространението — те преминаха от нула до около милион активни потребители за приблизително седмица… разпространението в реалния свят е много по-трудно от това, нали? Бих се развълнувал много от момента на Apple II в роботиката или от момента на IBM PC в роботиката. Кога ще мога да си купя домашен робот, който да започне да върши някои полезни и забавни неща?“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.