Google DeepMind току-що представи нова версия на своя модел с изкуствен интелект Gemini, която може да управлява различни роботи – включително хуманоиди, способни да извършват прецизни задачи като завинтване на крушки и завързване на торби за боклук.
Gemini Robotics 2 комбинира няколко различни AI модела в една обща система. Обединени заедно, те позволяват на робота да възприема заобикалящата го среда и да решава как да действа в нея. Визуално-езиковият модел (VLM), който разбира изображения и видео, може да комуникира с хора и да разсъждава как да изпълнява различни задачи. Два визуално-езиково-двигателни (VLA) модела, обучени да разбират движението във физическото пространство, контролират движението на цялото тяло на робота, както и движенията на захващащите механизми или ръцете.
Във видео демонстрации, споделени преди пускането на пазара, компанията показа няколко различни робота, които изпълняват автономно сложни задачи, използвайки обединения модел. В една от демонстрациите роботът Apollo 2 на Apptronik използва ръце от компанията Sharpa, за да подрежда рафтове. Google DeepMind е обучил модела да изпълнява тези задачи чрез комбинация от дистанционно управление от хора, видео примери и симулации – все още не е възможно AI моделите да изпълняват широк спектър от сложни задачи без специфично обучение.
Въпреки че Anthropic и OpenAI са лидери при чатботовете и инструментите за писане на код с AI, Google има по-сериозни постижения в изследванията на роботиката и е публикувал важни научни трудове за използването на AI за обучение на роботи. Новият модел е поредният знак, че търсачката залага на това, че изкуственият интелект ще трябва да излезе извън дигиталната сфера, за да разгърне пълния си потенциал. (Преди това компанията си партнираше с Boston Dynamics, лидер в областта на роботите с крака, за да осигури „мозъка“ за тези машини.)
„Това е поредният крайъгълен камък по пътя ни към постигането на това, което наричаме физически общ изкуствен интелект (AGI), което означава да накараме робот да прави всичко, което човек може“, споделя пред WIRED Каролина Парада, ръководител на отдела по роботика в Google DeepMind.
Предоставянето на достъп на модерни AI модели до роботи, за да могат те да се разхождат из работни места или домове и да манипулират обекти, обаче крие рискове. Предишни изследвания показват, че използването на авангарден AI за управление на роботи може да доведе до неочаквано и понякога опасно поведение. Идеята, че тези модели могат да предприемат внезапни или нежелани действия в дигиталната сфера, стана ясна наскоро, когато непубликуван AI агент, разработен от OpenAI, компрометира няколко системи.
„Въпросът за безопасността е още по-належащ, защото ги поставяте в много други ситуации“, казва Парада. „Ще се появи голяма несигурност, така че искате да можете да разберете въпроса за безопасността по-дълбоко.“
Парада допълва, че Google прилага многослоен подход към безопасността, като предпазните механизми са внедрени на всяко ниво на моделите. Компанията също така представя ASIMOV-Agentic – нов бенчмарк за измерване на безопасността на различни AI системи, които си сътрудничат за управлението на робот. Този бенчмарк засича дали дадена команда ще доведе до вреден или несигурен резултат.
Изпълнителният директор на компанията, Демис Хасабис, по-рано сподели пред WIRED, че се надява да разработи операционна система с изкуствен интелект за множество различни роботи, подобна на операционната система Android за смартфони.