Прорывы в робототехнике с ИИ не изменят вашу жизнь в ближайшее время
Эта статья подготовлена в сотрудничестве MIT Technology Review и Aventine — некоммерческого исследовательского фонда, который создает и поддерживает материалы о том, как технологии и наука меняют нашу жизнь.
Робот, похожий на человека, — белый, с черной головой и торсом, — то и дело появляется в видеолентах. Возможно, вы видели, как он танцует или передает попкорн, выбрасывает мусор в урну, пылесосит или нажимает кнопку микроволновки. А может быть, вы наблюдали, как он падает назад, раздавая бутылки с водой, или безуспешно пытается погладить рубашку.
Это Optimus компании Tesla — гуманоидный робот на базе ИИ, который, по мнению генерального директора компании Илона Маска, станет «не просто крупнейшим продуктом Tesla, а вероятно, крупнейшим продуктом в истории» и сначала отправится работать на заводы, а затем — в наши дома. В конце концов он «будет обладать человеческой, а затем и сверхчеловеческой ловкостью», заявил Маск акционерам в июле. По его словам, роботы Optimus смогут автоматизировать практически весь человеческий труд — от переноски листового металла до складывания белья — и стоить всего около 20 000 долларов каждый. Выступая в январе на ежегодной встрече Всемирного экономического форума в Давосе, Швейцария, Маск предсказал, что к концу 2027 года роботы могут поступить в продажу для широкой публики.
Маск не одинок в своем энтузиазме. Марк Андриссен, сооснователь и генеральный партнер венчурной компании Кремниевой долины Andreessen Horowitz, заявил, что робототехника может стать «крупнейшей отраслью в истории планеты». В январе Дженсен Хуанг, генеральный директор Nvidia, сказал, что гуманоидные роботы достигнут человеческого уровня возможностей уже в этом году. Согласно Morgan Stanley, число роботов, которые «похожи на людей и действуют как люди», к 2050 году, вероятно, достигнет почти 1 миллиарда, а объем рынка превысит 5 триллионов долларов.
Подобные заявления во многом подпитываются идеей о том, что те же достижения в области ИИ, которые лежат в основе таких инструментов, как ChatGPT от OpenAI и Claude от Anthropic, позволят создать новое поколение роботов, способных имитировать движения человека так же, как чат-боты имитируют человеческую речь. Однако многие исследователи в области робототехники относятся к этому скептически, утверждая, что подобные предположения преуменьшают сложность использования интеллекта, созданного на основе языка и изображений, для освоения бесконечно разнообразного физического мира. «Ни у одной из этих компаний [создающих гуманоидных роботов] — абсолютно ни у одной — нет ни малейшего представления о том, как сделать этих роботов достаточно умными, чтобы они приносили пользу», — заявил Янн ЛеКун, которого часто называют одним из крестных отцов ИИ, на другом мероприятии во время январской конференции в Давосе.
Исследователи также указывают, что тенденция смешивать гуманоидных роботов, созданных по образу людей, с так называемыми универсальными машинами, способными обучаться и выполнять множество задач, вводит в заблуждение. «Сделать робота, похожего на человека, очень легко, — объясняет Джонатан Херст, сооснователь и главный специалист по роботам компании Agility Robotics, а также профессор робототехники в Университете штата Орегон. — Гораздо сложнее сделать машину, которая двигается или ведет себя динамически и физически как человек».
Эти противоречия — вопрос о том, появятся ли универсальные гуманоидные роботы уже в ближайшем будущем или их пока даже не видно на горизонте, а также вопрос о том, достаточно ли современных форм ИИ, чтобы довести их до совершенства, — проявляются в робототехнических лабораториях по всей стране, где шумиха вокруг сроков затмевает кропотливый, но значимый прогресс.
Около десяти лет назад серия прорывов привела к революции генеративного ИИ, превратив давно воображаемую возможность создания искусственного интеллекта в реальность. Специалисты по робототехнике — хотя и расходятся во мнениях относительно точных сроков — считают, что столь же преобразующая революция возможна и в робототехнике: она наделит машины физической интуицией и плавностью движений, которые долгое время оставались недостижимыми. По мере того как робототехника медленно движется вперед, возникает вопрос: достаточно ли тех же методов и инструментов, которые обеспечили прогресс в ИИ, или потребуется совершенно новый путь.
Роботы встречают передовой ИИ
Чтобы увидеть, как сегодня работает один из самых умных роботизированных мозгов, стоит взглянуть на то, что Google DeepMind может делать с оборудованием под названием ALOHA 2 — сокращение от «A Low-cost Open-source Hardware System for Bimanual Teleoperation» («Недорогая аппаратная система с открытым исходным кодом для бимануального телеуправления»).
Специалисты по робототехнике давно спорят о том, необходима ли универсальным роботам человекоподобная форма: сторонники считают, что она поможет им вписаться в существующий мир, а противники утверждают, что сложности того не стоят. ALOHA 2 отражает второй подход. Внешне это непримечательная конструкция: всего пара рук, несколько захватов и две камеры. Но, несмотря на кажущуюся простоту, для исследователей Google DeepMind это рабочая лошадка, которую они используют для испытания своей самой передовой системы ИИ для робототехники Gemini Robotics в разных лабораториях.
Под управлением Gemini Robotics ALOHA 2 становится своего рода универсальным роботом: он может выполнять самые разные задачи на основе примеров, на которых его обучали. Попросите его собрать ланч-бокс — как показано в видеозаписи этого упражнения, — и он сможет с помощью двух клещевых захватов аккуратно положить кусок белого хлеба в пакет Ziploc, закрыть его, поместить гроздь винограда в контейнер Tupperware, закрепить крышку, а затем осторожно переложить все в ланч-бокс и застегнуть его.
Ланч получается не особенно удачным. Но сам факт, что робот способен его собрать, означает объективный шаг вперед по сравнению с тем, что было возможно еще, скажем, три года назад.
Во многом это стало возможным благодаря ИИ и его влиянию на так называемые роботизированные политики — системы, которые определяют, как универсальный робот должен оценивать и понимать окружающую обстановку, планировать движения в ней, а затем правильно выполнять задачу.




Робот ALOHA 2 — это немногим больше, чем две механические руки на столе, но он служит испытательной платформой для передовых моделей ИИ в робототехнике. Эти анимации основаны на телеуправлении руками робота человеком; полученные данные используются для обучения моделей Google DeepMind. (Видео: Google DeepMind / Стэнфордский университет / Hoku Labs)
Исторически эти политики основывались на правилах, разработанных инженерами и жестко закодированных в программном обеспечении робота, — тысячах строк кода, которые определяли каждое движение робота с точностью до миллиметра при выполнении сотен задач. За последние несколько лет — и именно это в значительной степени объясняет оптимизм в отношении универсальных роботов — роботизированные политики стали передавать передовым системам ИИ, а не кодировать в программном обеспечении робота. Сначала появились VLM, или визуально-языковые модели. Они похожи на большие языковые модели, но обучаются не только на словах, но и на изображениях. Покажите VLM фотографию пролитого кофе и попросите найти инструмент для уборки — модель сможет распознать лежащую поблизости тряпку. Еще несколько лет назад, когда роботизированные политики жестко кодировались, такого мгновенного понимания контекста не существовало.
Затем появились модели «зрение — язык — действие», позволяющие роботам оценивать окружающую среду и действовать в ней. Они делают это, добавляя еще один компонент: команды движения. VLA обучаются на серии изображений или видеозаписей, связанных с выполнением определенной задачи, а также на соответствующих данных о движении руки робота при ее выполнении. Такие данные о движениях обычно собираются посредством телеуправления, когда человек с помощью дистанционного управления проводит робота через определенное действие. Благодаря такому обучению ИИ учится отдавать роботу команды двигаться и работать во время выполнения конкретной задачи. Поставьте робота на базе VLA перед столом и скажите ему «закрой ноутбук» или «смотай провод от наушников» — он осмотрит сцену, определит нужный объект, спланирует выполнение запроса, а затем приведет руки в действие, по крайней мере если раньше уже видел, как выполняется эта задача.
Модель Gemini Robotics — это VLA, обученная на многих часах демонстраций людей, показывающих огромное разнообразие действий. В результате она может выполнять относительно сложные задачи: брать сахарный горошек кухонными щипцами, складывать оригами или собирать простой ланч. Это впечатляет, но есть серьезное ограничение: пока что, если робота под управлением VLA попросить выполнить задачу, не входящую в его набор обучения, он с большой вероятностью потерпит неудачу.
«Если рассматривать пространство всех задач, настоящая универсальная политика должна уметь выполнять все задачи в этом диапазоне, — говорит Эдвард Джонс, профессор робототехники в Имперском колледже Лондона. — Но сегодня модель Gemini Robotics умеет делать лишь “несколько вещей здесь и несколько вещей там”».
В поисках настоящей универсальности
Как же научить роботов делать больше? Обычный ответ, вероятно, не удивит: обучать их на большем количестве данных.
Логика такова: больше данных означает больше примеров, а больше примеров — большую универсальность. Например, Google DeepMind хочет собрать «как можно больше данных», говорит Паннаг Санкети, бывший технический руководитель робототехнического направления компании, который сейчас работает над собственным проектом в области ИИ и робототехники. Но где их взять? Большим языковым моделям на пользу пошли океаны существующих текстов для обучения. Аналогичного массива высококачественных физических демонстраций, на которых можно обучать роботов, не существует. Исследователи пытаются компенсировать это несколькими способами, но у каждого есть недостатки. Один вариант — привлечь множество людей для создания и сбора данных телеуправления (это дорого и требует много времени). Другой — обучать VLA на видеозаписях действий людей (качество получаемых данных низкое). Третий — выпускать роботов в реальный мир и использовать собранные там данные для дальнейшего совершенствования моделей ИИ (вне лабораторий роботы небезопасны и ненадежны). Санкети считает, что наиболее вероятным путем вперед станет «многосторонний» подход, использующий данные из всех этих источников.
Но убеждение, что одних обучающих данных достаточно, чтобы решить проблему, разделяют далеко не все. Херст из Agility называет это «изначально ошибочной предпосылкой».
Проблема в том, что задачи реального мира быстро усложняются. Если вы пытаетесь, например, приготовить кофе, возникает бесчисленное множество переменных: две кухни не бывают одинаковыми; кофемашины работают по-разному; для разных чашек нужны разные захваты; с кофейными зернами, горячей водой и молоком нужно обращаться по-разному. Даже эта простая задача требует понимания постоянно меняющегося набора возможностей. По мнению Херста, достижение универсальности с помощью VLA потребовало бы «полного охвата данными всего, что [робот] когда-либо мог бы сделать». Иными словами, почти бесконечного массива обучающих данных.
ЛеКун отвергает весь этот подход. «Подходы [к ИИ], которые оказались успешными в работе с языком, не работают с многомерными, непрерывными, зашумленными данными» — именно с такими данными обычно приходится иметь дело в робототехнике, — заявил он в Давосе. «Нужно использовать что-то другое».
Главным претендентом на роль этого «чего-то другого» считается так называемая модель мира — форма ИИ, обученная не столько на текстах, сколько на сочетании видео, трехмерных сканов и данных с датчиков и предназначенная для прогнозирования последствий действий в реальном мире. Цель состоит в создании моделей, обладающих настолько точным внутренним представлением о реальности, чтобы они могли описывать, как на самом деле работает физический мир, — как объекты движутся, сталкиваются, падают и деформируются. Если бы специалисты по робототехнике могли обучать машины в симуляциях, достаточно точно воспроизводящих физику реального мира, разработка стала бы быстрее, дешевле и безопаснее, а потребность в испытаниях в реальном мире сократилась бы. Еще более важным было бы то, что роботы с моделями мира могли бы рассуждать об окружающей среде, а не просто реагировать на нее, помогая предвидеть последствия действия до его совершения.
Такие компании, как Nvidia и Google, работают над этой технологией, а в известные стартапы вливаются деньги инвесторов. Компания World Labs, сооснователем которой является исследователь ИИ из Стэнфорда Фэй-Фэй Ли, привлекла 1 миллиард долларов финансирования в феврале, а в конце сентября была приобретена AMD за 8,2 миллиарда долларов. Компания AMI Labs, сооснователем которой является ЛеКун (ранее главный научный сотрудник Meta по ИИ), также привлекла 1 миллиард долларов в марте. Однако, по собственному признанию этих компаний, все еще только начинается. В конце прошлого года Ли назвала эту область «зарождающейся», добавив, что «фундаментальные подходы все еще формируются». В июньской публикации на Substack она описала серьезные проблемы. Пока модели мира остаются многообещающим направлением исследований, а не прямым путем к универсальной робототехнике, но мы уже начинаем видеть проблески того, чего они способны достичь.
Один из таких проблесков появился в результате небольшого, но потенциально значительного скачка вперед, произошедшего в апреле прошлого года в робототехнической лаборатории Сан-Франциско.
Прорыв?
В самом центре района Мишн в Сан-Франциско стартап Physical Intelligence — или PI (как π), как его предпочитают называть, — сосредоточен на разработке универсального мозга, который теоретически мог бы превратить любого робота в универсального исполнителя. Используя при обучении моделей ИИ для роботов подход «все, включая кухонную раковину», компания недавно увидела намек на то, на что способен роботизированный мозг, оснащенный моделью мира.
В 2024 году PI опубликовала подробности своей первой универсальной робототехнической системы под названием π0 — VLA, которую компания назвала «самой мощной и ловкой универсальной политикой для роботов на сегодняшний день». Изначально модель обучалась на собственной коллекции из 10 000 часов демонстраций людей, собранных посредством телеуправления, а также на нескольких наборах данных роботов с открытым исходным кодом. Версия, выпущенная весной 2025 года, π0.5, обучалась на более широком наборе данных, включая размеченные изображения из интернета, что сделало ее более универсальной. В обновлении осени 2025 года, π0.6, в модель добавили обучение с подкреплением.
Каждое обновление давало важные улучшения производительности модели, расширяя набор ее способностей: от медленного складывания белья до уборки предметов в новых условиях и выполнения таких задач, как складывание коробок, с большей вероятностью успеха. Затем, в апреле 2026 года, π0.7, похоже, вывела PI на новую территорию. Эта версия использует менее мощную модель мира, которая генерирует изображения шагов, необходимых для выполнения задачи. Пока робот выполняет работу, эта «легковесная» модель подсказывает ему, что делать дальше, с помощью серии снимков.




Компания утверждает, что модель демонстрирует первые признаки композиционной генерализации — так называют способность систем ИИ выполнять навыки, с которыми они никогда не сталкивались, комбинируя навыки, усвоенные в процессе обучения. В одном из тестов модель попросили «положить батат в аэрогриль» — с такой задачей она прежде не сталкивалась. На демонстрационном видео машина немного возится, делает несколько неудачных попыток и в конце концов справляется более или менее приемлемо, хотя полностью задачу не завершает.
Сергей Левин, профессор Калифорнийского университета в Беркли и сооснователь PI, с воодушевлением оценивает потенциал: «На самом деле это первый случай, когда мы убедительно увидели такую композиционную генерализацию: мы можем по сути попросить модель выполнить задачи, для которых мы специально не собирали данные и не обучали ее, — и она действительно делает приемлемую попытку».
Успех заставил команду задуматься, как модели удалось добиться такого результата. После более тщательного анализа исследователи обнаружили в обучающих материалах фрагменты релевантных размеченных данных телеуправления, включая два примера того, как человек с помощью робота задвигает корзину аэрогриля внутрь устройства. Возможно, этих обрывков данных оказалось достаточно, чтобы π0.7 почти смогла приготовить батат в аэрогриле.
Пока остается неясным, насколько впечатляющи способности π0.7 к генерализации. Тем не менее, учитывая, насколько мимолетным было знакомство модели с аэрогрилями, этот результат дает представление о том, как далеко передовые исследования сегодня могут продвинуть роботов.
«70% успеха — это все равно не работает»
Возможно, вы ощущаете разрыв между неуверенными детскими шагами роботов в лабораториях — «Смотрите! Он положил батат в аэрогриль!» — и ослепительной, реалистичной ловкостью, которую демонстрируют многие роботы на показах и видео, где они делают все: от танцев на сцене до вежливой подачи напитков. Такие демонстрации часто не раскрывают важный факт: во многих случаях роботом управляют люди или его действия тщательно запрограммированы. (Например, роботом, который в марте 2025 года появился на сцене вместе с генеральным директором Nvidia Дженсеном Хуангом, по всей видимости реагировал на его инструкции и следовал за ним, дистанционно управлял человек, которого создатели назвали «кукловодом за кулисами».)
Пока полностью автономное планирование движений, позволяющее роботу понимать, куда ему следует направляться, остается в значительной степени нерешенной задачей — особенно в новых, хаотичных условиях, например на стройке или в незнакомом доме. Еще более сложная проблема, хотя и связанная с первой, — научить роботов справляться с масштабными, неоднозначными заданиями, включающими несколько задач и требующими принимать решения о том, как и в какой последовательности их выполнять. В этом заключается разница между роботом, который может поставить тарелку в микроволновку, и роботом, который способен успешно отреагировать на команду «Приготовь ужин», осмотрев холодильник, нарезав ингредиенты и включив плиту. Лучшие попытки Google DeepMind сделать нечто подобное — робота просили осмотреть кухню и собрать в корзину все ингредиенты для грибного ризотто — пока закончились неудачей.
Сложность усугубляется тем, что практичный робот должен практически всегда выполнять задачу правильно. В случае с VLA «люди очень радуются, когда результат улучшается с 50% успеха до 70%», говорит Марк Райберт, основатель Boston Dynamics. «Но 70% успеха — это все равно что не работает, разве нет?»

Немногие гуманоидные роботы, которых испытывают в реальных условиях, выполняют крайне ограниченный набор задач в жестко контролируемой среде. До универсальности им далеко. По данным компании, у Agility сотни роботов задействованы в испытаниях на объектах, принадлежащих GXO Logistics, Amazon и Schaeffler. Но пока, говорит Херст, роботы выполняют простые задачи, например перемещают контейнеры и ящики. Даже на это, добавляет он, ушли годы разработки роботов, достаточно безопасных, чтобы логистические компании хотя бы начали рассматривать возможность их использования. Со своей стороны, Илон Маск в мае 2025 года заявил, что к концу года на заводах Tesla будут работать «тысячи» роботов Optimus, но в январе этого года сказал, что на предприятии «лишь некоторые роботы Tesla Optimus выполняют простые задачи».
Хотя гуманоидные роботы начинают выходить на заводские площадки, переход к работе в домах окажется еще сложнее. Сейчас, если вы захотите, можно предварительно заказать домашнего робота 1X Neo, поставки которого ожидаются позднее в этом году. За 20 000 долларов он обещает взять на себя «скучные и рутинные задачи по дому» — убирать посуду, открывать дверь, наводить порядок в гостиной, — «чтобы вы могли сосредоточиться на том, что важно для вас». Предполагается, что однажды этот робот ростом пять футов и шесть дюймов сможет выполнять все эти задачи автономно, но пока для большинства действий ему необходим удаленный оператор-человек. (Да, человеку потребуется разрешение, чтобы заглядывать в ваш дом через камеры робота.) На вопрос, сколько времени пройдет до появления полностью автономных роботов, готовых к работе в домах, Херст ответил: «Если нужно назвать число, я бы сказал, что пройдет 10 лет, прежде чем роботы… действительно начнут делать что-то полезное в домах людей».
Когда это произойдет, роботы вполне могут оказаться китайскими, поскольку Китай значительно опережает Запад по объемам производства. По данным аналитической компании Omdia и китайского производителя роботов Unitree, почти 90% из примерно 15 000 гуманоидных роботов, поставленных в 2025 году, были произведены китайскими компаниями. Одна из моделей Unitree, которая в прошлом году поставила больше гуманоидных роботов, чем любая другая компания, стоит менее 6000 долларов. Такая доступная цена может значительно повысить привлекательность роботов для потребителей, хотя компания ожидает, что сначала ее машины будут использоваться в промышленности. (Если вам интересно, кто покупает всех этих китайских роботов, AP недавно сообщило, что заказы в основном поступают от корпоративных и академических лабораторий, а также государственных предприятий.)
Мы уже через это проходили
Мечта о создании гуманоидного робота уходит корнями глубоко в историю: еще в 1495 году Леонардо да Винчи набросал проекты механического рыцаря, управляемого с помощью тросов и шкивов. На протяжении XX века машины, рожденные научно-фантастическими мечтами, появлялись и исчезали.

Семифутовый робот Elektro, представлявший собой коробку на ногах, появился на Всемирной выставке в Нью-Йорке в 1939 году, куря сигарету. WABOT-1, созданный японским Университетом Васэда в 1973 году, стал первым полноразмерным программируемым гуманоидным роботом. ASIMO компании Honda, представленный в 2000 году, вероятно, был первой подобной машиной, продемонстрировавшей хотя бы какую-то компетентность: он мог, по крайней мере в определенной степени, подниматься по ступеням, распознавать лица и автономно перемещаться в пространстве. Но в 2018 году робота сняли с производства: он так и не смог выйти за пределы демонстрационных возможностей настолько, чтобы стать полезным.
В свое время все эти достижения казались впечатляющими — даже поразительными — инженерными подвигами. Но ни одна из машин не была готова ориентироваться в реальном мире. Современные роботы, даже обладая преобразующей силой передового ИИ, по-прежнему сталкиваются с той же экзистенциальной проблемой.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.