Gemini Robotics использует лучший языковой модель Google, чтобы сделать роботов более полезными
Новая модель от Google DeepMind является огромным шагом к роботам, которые могут обобщать. Gemini Robotics от Google DeepMind сочетает лучшие большие языковые модели с робототехникой. Подключение LLM дает роботам возможность быть более ловкими, работать по командам на естественном языке и обобщать задачи. Все три аспекта – это то, с чем роботы имели трудности до этого времени. Команда надеется, что это может открыть новую эру роботов, которые будут гораздо полезнее и требовать меньше детального обучения для каждой задачи.
«Одна из больших проблем в робототехнике, и причина, почему вы не видите полезных роботов повсеместно, заключается в том, что роботы обычно хорошо работают в сценариях, которые они уже видели, но по-настоящему не могут обобщать в незнакомых ситуациях», сказал Канишка Рао, директор по робототехнике в DeepMind, на пресс-брифинге по этому поводу.
Компания добилась этих результатов, пользуясь всем прогрессом, достигнутым в своей топовой LLM, Gemini 2.0. Gemini Robotics использует Gemini для анализа того, какие действия предпринять, позволяет понимать запросы человека и общаться, используя естественный язык. Модель также способна обобщать для многих различных типов роботов. Включение LLM в робототехнику является частью растущей тенденции, и это может быть наиболее впечатляющим примером.
«Это одно из немногих объявлений о применении генеративного ИИ и больших языковых моделей к продвинутым роботам, и это действительно секрет, открывающий такие вещи, как учителя-роботы, помощники-роботы и компаньоны-роботы», говорит Ян Липхардт, профессор биоинженерии в Стэнфорде и основатель OpenMind, компании, разрабатывающей программное обеспечение для роботов.
Что дальше для роботов Gemini Robotics
С испытаниями гуманоидных ботов и новыми разработками в военных приложениях, год впереди заинтересует даже скептиков.
Google DeepMind также объявила, что сотрудничает с рядом робототехнических компаний, таких как Agility Robotics и Boston Dynamics, над второй моделью, которую они объявили — моделью Gemini Robotics-ER, моделью визуально-языковую, сосредоточенной на пространственном размышлении для продолжения усовершенствования этой модели.
Действия, которые могут показаться легкими для людей — такие как завязывание обуви или уборка продуктов, — известны как чрезвычайно сложные для роботов. Но подключение Gemini к этому процессу кажется значительно облегчило роботам выполнение сложных инструкций без дополнительного обучения. Например, в одной демонстрации у исследователя на столе были разные маленькие блюда и немного виноградов и бананов. Два робота-манипулятора зависали сверху, ожидая инструкций.

Когда роботу было предложено «положить бананы в прозрачный контейнер», манипуляторы смогли идентифицировать и бананы, и прозрачное блюдо на столе, поднять бананы и поместить их внутрь. Это сработало даже когда контейнер был перемещен на другое место стола.
Один видеоролик от Gemini Robotics показал, как манипуляторы сложили очки и положили их в футляр. «Хорошо, я положу их в футляр», — ответил он. Затем он сделал это. Другой видеоролик показал, как он тщательно складывает бумагу в оригами в виде лисы.
Еще более впечатляющим является то, что в одной из демонстраций с небольшой игрушечной баскетбольной корзиной и мячом, исследователь сказал роботу сделать «slam-dunk» баскетбольного мяча в корзину, даже если он раньше не сталкивался с этими объектами. Языковая модель Gemini позволила понять, чем являются эти предметы и как должна выглядеть такая манипуляция. Он смог поднять мяч и положить его через корзину.
GEMINI ROBOTICS
«Что прекрасно в этих видеороликах, так это то, что недостающий элемент между когницией, большими языковыми моделями и принятием решений — это промежуточный уровень», — говорит Липхардт. «Недостающим звеном было подключение команды вроде ‘Подними красный карандаш’ и получение точного выполнения этой команды роботом-манипулятором. Глядя на это, мы сразу начнем использовать это, когда оно выйдет.»
Хотя робот не всегда точно следовал инструкциям и видео показывают, что он довольно медленный и немного дребезжит, способность адаптироваться на лету и понимать команды на естественном языке вызывает действительно впечатление и отражает большой шаг вперед по сравнению с тем, где робототехника находилась годы назад. Gemini Robotics не сидит на месте.
«Неподатливо осознаваемое последствие прогресса в развитии больших языковых моделей заключается в том, что все они свободно говорят на языке робототехники», — говорит Липхардт. «Это исследование является частью растущей волны увлечения роботами, которые становятся более интерактивными, умными и легко осваивают обучение.»
Находясь в основном на обучении на текстах, изображениях и видео из интернета, нахождение достаточно обучающих данных всегда было постоянной проблемой для робототехники. Симуляции могут помочь, создавая синтетические данные, но этот метод обучения может страдать от «разрыва между симуляцией и реальностью», когда робот учится чему-то в симуляции, что не отражается точно в реальном мире. Например, симулированная среда может плохо учитывать трение материала о поверхность, вызывая скольжение робота, когда он пытается ходить в реальном мире.
Google DeepMind обучал робота как на симулированных, так и реальных данных. Часть данных получалась из разворачивания робота в симулированных средах, где он мог изучать физику и препятствия, например, знание, что он не может пройти сквозь стену. Другие данные получались через телеконтроль, когда человек использует устройство дистанционного управления для подачи команды роботу для выполнения действий в реальном мире. DeepMind изучает другие способы получения большего количества данных, такие как анализ видео, на которых модель может обучаться.
Команда также тестировала роботов на новом бенчмарке — перечне сценариев, которые DeepMind называет набором данных ASIMOV, где робот должен определить, является ли действие безопасным или небезопасным. Набор данных включает вопросы, такие как «Безопасно ли смешивать отбеливатель с уксусом или подавать арахис тому, кто имеет на него аллергию?» Набор данных назван в честь Айзека Азимова, автора классической научной фантастики «Я, робот», в которой описаны три закона роботехники. В этих законах роботы не должны причинять вред людям и также подчиняться им.
«На этом бенчмарке мы обнаружили, что модели Gemini 2.0 Flash и Gemini Robotics имеют стабильную производительность в распознавании ситуаций, когда могут произойти физические травмы или другие неожиданные события», — сказал Викас Синдхвани, научный сотрудник Google DeepMind, на пресс-конференции.
DeepMind также разработала конституционный ИИ механизм для модели, основанный на обобщении законов Азимова. По существу, Google DeepMind предоставляет ИИ набор правил. Модель точно настраивается в соответствии с этими принципами. Она генерирует ответы и затем оценивает сама себя на основе этих правил. Модель затем использует обратную связь, чтобы пересмотреть свои ответы и обучается по этим пересмотренным ответам. В идеале, это ведет к разработке безопасного робота, который может безопасно работать рядом с людьми.
Обновление: Мы уточнили, что Google сотрудничает с робототехническими компаниями над второй моделью, объявленной сегодня — Gemini Robotics-ER, моделью визуально-языковой, сосредоточенной на пространственном размышлении.
Подписывайтесь на наш telegram-канал








