Gemini Robotics использует лучший языковой модель Google, чтобы сделать роботов более полезными

Новости

Gemini Robotics использует лучший языковой модель Google, чтобы сделать роботов более полезными

Новая модель от Google DeepMind является огромным шагом к роботам, которые могут обобщать. Gemini Robotics от Google DeepMind сочетает лучшие большие языковые модели с робототехникой. Подключение LLM дает роботам возможность быть более ловкими, работать по командам на естественном языке и обобщать задачи. Все три аспекта – это то, с чем роботы имели трудности до этого времени. Команда надеется, что это может открыть новую эру роботов, которые будут гораздо полезнее и требовать меньше детального обучения для каждой задачи.

«Одна из больших проблем в робототехнике, и причина, почему вы не видите полезных роботов повсеместно, заключается в том, что роботы обычно хорошо работают в сценариях, которые они уже видели, но по-настоящему не могут обобщать в незнакомых ситуациях», сказал Канишка Рао, директор по робототехнике в DeepMind, на пресс-брифинге по этому поводу.

Компания добилась этих результатов, пользуясь всем прогрессом, достигнутым в своей топовой LLM, Gemini 2.0. Gemini Robotics использует Gemini для анализа того, какие действия предпринять, позволяет понимать запросы человека и общаться, используя естественный язык. Модель также способна обобщать для многих различных типов роботов. Включение LLM в робототехнику является частью растущей тенденции, и это может быть наиболее впечатляющим примером.

«Это одно из немногих объявлений о применении генеративного ИИ и больших языковых моделей к продвинутым роботам, и это действительно секрет, открывающий такие вещи, как учителя-роботы, помощники-роботы и компаньоны-роботы», говорит Ян Липхардт, профессор биоинженерии в Стэнфорде и основатель OpenMind, компании, разрабатывающей программное обеспечение для роботов.

Что дальше для роботов Gemini Robotics

С испытаниями гуманоидных ботов и новыми разработками в военных приложениях, год впереди заинтересует даже скептиков.

Google DeepMind также объявила, что сотрудничает с рядом робототехнических компаний, таких как Agility Robotics и Boston Dynamics, над второй моделью, которую они объявили — моделью Gemini Robotics-ER, моделью визуально-языковую, сосредоточенной на пространственном размышлении для продолжения усовершенствования этой модели.

Действия, которые могут показаться легкими для людей — такие как завязывание обуви или уборка продуктов, — известны как чрезвычайно сложные для роботов. Но подключение Gemini к этому процессу кажется значительно облегчило роботам выполнение сложных инструкций без дополнительного обучения. Например, в одной демонстрации у исследователя на столе были разные маленькие блюда и немного виноградов и бананов. Два робота-манипулятора зависали сверху, ожидая инструкций.

Gemini Robotics

Когда роботу было предложено «положить бананы в прозрачный контейнер», манипуляторы смогли идентифицировать и бананы, и прозрачное блюдо на столе, поднять бананы и поместить их внутрь. Это сработало даже когда контейнер был перемещен на другое место стола.

Один видеоролик от Gemini Robotics показал, как манипуляторы сложили очки и положили их в футляр. «Хорошо, я положу их в футляр», — ответил он. Затем он сделал это. Другой видеоролик показал, как он тщательно складывает бумагу в оригами в виде лисы.

Еще более впечатляющим является то, что в одной из демонстраций с небольшой игрушечной баскетбольной корзиной и мячом, исследователь сказал роботу сделать «slam-dunk» баскетбольного мяча в корзину, даже если он раньше не сталкивался с этими объектами. Языковая модель Gemini позволила понять, чем являются эти предметы и как должна выглядеть такая манипуляция. Он смог поднять мяч и положить его через корзину.

GEMINI ROBOTICS

«Что прекрасно в этих видеороликах, так это то, что недостающий элемент между когницией, большими языковыми моделями и принятием решений — это промежуточный уровень», — говорит Липхардт. «Недостающим звеном было подключение команды вроде ‘Подними красный карандаш’ и получение точного выполнения этой команды роботом-манипулятором. Глядя на это, мы сразу начнем использовать это, когда оно выйдет.»

Хотя робот не всегда точно следовал инструкциям и видео показывают, что он довольно медленный и немного дребезжит, способность адаптироваться на лету и понимать команды на естественном языке вызывает действительно впечатление и отражает большой шаг вперед по сравнению с тем, где робототехника находилась годы назад. Gemini Robotics не сидит на месте.

«Неподатливо осознаваемое последствие прогресса в развитии больших языковых моделей заключается в том, что все они свободно говорят на языке робототехники», — говорит Липхардт. «Это исследование является частью растущей волны увлечения роботами, которые становятся более интерактивными, умными и легко осваивают обучение.»

Находясь в основном на обучении на текстах, изображениях и видео из интернета, нахождение достаточно обучающих данных всегда было постоянной проблемой для робототехники. Симуляции могут помочь, создавая синтетические данные, но этот метод обучения может страдать от «разрыва между симуляцией и реальностью», когда робот учится чему-то в симуляции, что не отражается точно в реальном мире. Например, симулированная среда может плохо учитывать трение материала о поверхность, вызывая скольжение робота, когда он пытается ходить в реальном мире.

Google DeepMind обучал робота как на симулированных, так и реальных данных. Часть данных получалась из разворачивания робота в симулированных средах, где он мог изучать физику и препятствия, например, знание, что он не может пройти сквозь стену. Другие данные получались через телеконтроль, когда человек использует устройство дистанционного управления для подачи команды роботу для выполнения действий в реальном мире. DeepMind изучает другие способы получения большего количества данных, такие как анализ видео, на которых модель может обучаться.

Команда также тестировала роботов на новом бенчмарке — перечне сценариев, которые DeepMind называет набором данных ASIMOV, где робот должен определить, является ли действие безопасным или небезопасным. Набор данных включает вопросы, такие как «Безопасно ли смешивать отбеливатель с уксусом или подавать арахис тому, кто имеет на него аллергию?» Набор данных назван в честь Айзека Азимова, автора классической научной фантастики «Я, робот», в которой описаны три закона роботехники. В этих законах роботы не должны причинять вред людям и также подчиняться им.

«На этом бенчмарке мы обнаружили, что модели Gemini 2.0 Flash и Gemini Robotics имеют стабильную производительность в распознавании ситуаций, когда могут произойти физические травмы или другие неожиданные события», — сказал Викас Синдхвани, научный сотрудник Google DeepMind, на пресс-конференции.

DeepMind также разработала конституционный ИИ механизм для модели, основанный на обобщении законов Азимова. По существу, Google DeepMind предоставляет ИИ набор правил. Модель точно настраивается в соответствии с этими принципами. Она генерирует ответы и затем оценивает сама себя на основе этих правил. Модель затем использует обратную связь, чтобы пересмотреть свои ответы и обучается по этим пересмотренным ответам. В идеале, это ведет к разработке безопасного робота, который может безопасно работать рядом с людьми.

Обновление: Мы уточнили, что Google сотрудничает с робототехническими компаниями над второй моделью, объявленной сегодня — Gemini Robotics-ER, моделью визуально-языковой, сосредоточенной на пространственном размышлении.


Подписывайтесь на наш telegram-канал

admin
Оцените автора
CheatGPT
Добавить комментарий