Репортаж от Wedoany,Лаборатория исследований в области искусственного интеллекта DeepMind (Google DeepMind), входящая в состав Alphabet Inc., сегодня представила серию моделей Gemini Robotics 2. Эта серия разработана для гуманоидных роботов, поддерживает совместное выполнение одной задачи несколькими автономными роботами и способна автоматически выполнять бытовые задачи, состоящие из сотен шагов.
В настоящее время в основных гуманоидных роботах используется двухсистемная архитектура ИИ: воплощённая модель рассуждения отвечает за составление высокоуровневого плана выполнения задачи, а модель VLA преобразует план в низкоуровневые команды для электродвигателей робота. Ядром серии Gemini Robotics 2 является воплощённая модель рассуждения под названием Gemini Robotics ER 2, с помощью которой пользователи могут описывать на естественном языке задачи, которые должен выполнить робот. По данным Google, ER 2 поддерживает задачи, состоящие из сотен шагов и занимающие несколько минут.
ER 2 может разделять длинные задачи между несколькими различными роботами для ускорения выполнения, а её функция вызова инструментов позволяет модели обращаться к внешним облачным сервисам, например, использовать поиск Google для уточнения непонятных частей подсказки.
С учётом потребности гуманоидных роботов в повторении неудачно выполненных задач, инженеры оснастили ER 2 двумя функциями. Во-первых, модель может отслеживать ход выполнения задачи с помощью изображений, снятых собственной камерой робота; при возникновении ошибки она определяет последний правильно выполненный шаг и продолжает с места прерывания, избегая необходимости начинать всё заново. Во-вторых, ER 2 превосходит предыдущие модели в определении момента завершения задачи: чем раньше робот подтверждает окончание одной задачи, тем быстрее он может перейти к следующей; эта функция также упрощает такие этапы, как выявление и исправление ошибок.
Инженеры Google Стивен Хансен (Steven Hansen) и Пэн Сюй (Peng Xu) в корпоративном блоге компании рассказали, что, просматривая непрерывный видеопоток, робот может отслеживать собственный прогресс, корректировать действия при возникновении проблем и чётко определять момент перехода к следующему шагу.
После составления плана действий ER 2 может отправлять команды одной из двух других моделей VLA в серии Gemini Robotics 2. Первая модель, названная Gemini Robotics 2, управляет всеми частями тела гуманоидного робота, а не только руками, оптимизирует центр тяжести хост-машины со снижением риска падения, а также поддерживает большее разнообразие манипуляторов, чем раннее программное обеспечение DeepMind.
Вторая модель VLA, названная Gemini Robotics On-Device 2, предназначена для непосредственного запуска на бортовом компьютере гуманоидного робота и может быть адаптирована к новому роботу всего за несколько часов обучения. Разработчики могут получить доступ к ER 2 через Google Cloud, Gemini API и Google AI Studio.
Вместе с выпуском моделей Google также представила новый бенчмарк безопасности для воплощённого ИИ — ASIMOV-Agentic Benchmark, предназначенный для оценки способности гуманоидных роботов избегать таких рисков, как столкновения.










