Репортаж от Wedoany,Даньфэй Сюй из Китая инициировал создание экосистемы и стандарта данных о действиях человека от первого лица под названием EgoVerse, целью которого является создание для обучения роботов аналога эффекта ImageNet для визуального ИИ. Даньфэй Сюй в настоящее время является доцентом Школы интерактивных вычислений Технологического института Джорджии (Georgia Institute of Technology) и руководителем Лаборатории обучения и рассуждения роботов (RL2). Во время обучения в докторантуре Стэнфордского университета (Stanford University) он находился под совместным руководством Фэй-Фэй Ли и Сильвио Саварезе. EgoVerse представляет собой устойчиво растущую инфраструктуру данных, партнерами которой являются Технологический институт Джорджии, Стэнфордский университет, Швейцарская высшая техническая школа Цюриха (ETH Zurich), Калифорнийский университет в Сан-Диего (University of California San Diego), а также компании Meta, Scale AI, Guanglun Intelligence, Mecka AI, MicroAGI, Trace Labs и другие. Guanglun Intelligence является единственной китайской компанией-участницей.
Обучение роботов долгое время сталкивалось с проблемой получения данных. В настоящее время обучение по-прежнему опирается на телеуправление на реальных роботах, и каждое новое демонстрационное действие требует аппаратного обеспечения, персонала и площадей, что приводит к высоким затратам и ограниченному кругу задач. Поведение человека естественным образом содержит богатую визуальную и двигательную информацию, что делает его более идеальным источником для обучения. Однако предыдущие наборы данных о человеке в основном были разовыми проектами, с несовместимым оборудованием для сбора, системами координат и определениями задач, что затрудняло их объединение для обучения. EgoVerse разработан как «живая» коллаборативная структура, призванная преодолеть эти ограничения и позволить глобальным воплощенным данным циркулировать в рамках единой «языковой системы».
Текущая публичная версия EgoVerse включает 1362 часа демонстрационных данных о человеке, около 80 000 эпизодов, 1965 задач, 240 сценариев и 2087 участников сбора данных. Данные охватывают видео от первого лица, положение камеры, трехмерную информацию о кистях рук и детализированные языковые описания, а также была подтверждена эффективность переноса в различных лабораториях, на разных роботах и платформах.

EgoVerse объединяет усилия нескольких ведущих организаций. Технологический институт Джорджии выполняет роль организационного центра и исследовательской структуры, а команда Даньфэя Сюя отвечает за проверку репрезентативных задач. Команда профессора Шурань Сонг из Стэнфордского университета через разработанный ими UMI (Universal Manipulation Interface) позволяет переносить данные о действиях человека на различные роботизированные платформы. Meta предоставляет проекту специализированные очки для сбора данных Project Aria. Mecka AI продвигает использование iPhone и облегченных головных устройств для сбора данных от первого лица, снижая аппаратный порог. Scale AI отвечает за очистку, разметку и контроль качества данных. MicroAGI исследует распределенный краудсорсинг сбора данных. Trace Labs также принимает участие. Вклад Guanglun Intelligence заключается в создании системы контроля качества, охватывающей сбор на конечных устройствах, облачную обработку и имитационную верификацию.
Guanglun Intelligence разбивает контроль качества данных о человеке на три этапа. Во-первых, с помощью агентно-ориентированного мониторинга в реальном времени процесса сбора обеспечивается контроль целостности задач, эффективности действий и распределения данных, а также осуществляется корректировка на месте сбора. Во-вторых, с помощью облачной платформы, совместимой с различным оборудованием для сбора, достигается единый стандарт данных, включающий обработку визуально-инерциальной одометрии (VIO), трехмерную разметку кистей рук и тела, а также семантическую разметку действий уровня V7; решение Guanglun Intelligence для работы с данными о человеке EgoSuite способно предоставлять такую разметку в производственных масштабах. В-третьих, с помощью имитационной платформы SimFoundry и оценочной платформы RoboFinals проверяется, действительно ли данные пригодны для обучения роботов, и результаты оценки направляются обратно для руководства следующим циклом сбора, формируя замкнутый цикл контроля качества данных.
Guanglun Intelligence также участвует в другом глобальном проекте физической ИИ-инфраструктуры Newton. Этот проект был совместно инициирован NVIDIA, Google DeepMind и Disney Research. В его технический руководящий комитет входят NVIDIA, Google DeepMind, Disney Research, Guanglun Intelligence и Toyota Research Institute (TRI), и его цель — определить технический маршрут для роботизированного моделирования и физического моделирования. Guanglun Intelligence в настоящее время является единственной китайской компанией, одновременно участвующей в двух международных стандартных системах — EgoVerse и Newton, переходя от роли пользователя стандартов к роли их соавтора.










