Репортаж от Wedoany,Китайская компания UniX AI (优理奇机器人) совместно с Чжэцзянским университетом, Массачусетским технологическим институтом, Оксфордским университетом, Йельским университетом и Шанхайским университетом Цзяо Тун представила новую научную разработку UniTac, предложив архитектуру для межсенсорного тактильного понимания и генерации, которая интегрирована в модель «зрение-язык-действие», позволяя роботам предсказывать тактильное состояние до контакта с объектом. Работа принята на ECCV 2026.
За последний год воплощённые фундаментальные модели быстро развивались, и роботы смогли выполнять задачи по манипуляции объектами с чёткими контурами. Однако при работе с гибкими, хрупкими объектами или в сценариях плотного контакта роботы, полагающиеся только на зрение, оказываются неэффективны. Например, такие задачи, как сжатие виноградины без её повреждения или захват бумажного стаканчика без деформации, требуют от робота тактильного восприятия, подобного человеческому. С развитием исследований команды UniTouch, AnyTouch и другие пытались унифицировать представление данных от различных тактильных датчиков; FuSe и Tactile-VLA интегрировали тактильную информацию в универсальные стратегии и модели VLA; TacImag исследовал возможность «воображения» тактильных ощущений роботом только на основе зрения и проприоцепции. Однако эти методы всё ещё сталкиваются с проблемами гетерогенности данных датчиков и разделения тактильного понимания и генерации в разных моделях.

UniTac обучает унифицированное тактильное представление на основе крупномасштабных мультисенсорных данных, позволяя роботу предсказывать тактильное состояние объекта после контакта на основе визуальной информации, реализуя «ощущение до прикосновения». Например, при захвате бумажного стаканчика модель VLA, интегрированная с UniTac, может предсказать деформацию стенок стаканчика под нагрузкой, определяя точку контакта и силу; модель VLA без UniTac просто сжимает стаканчик. Таким образом, тактильная информация смещается с обратной связи после контакта на априорное знание до контакта.

Для взаимодействия робота с физическим миром необходимо пройти три уровня привязки: модель «зрение-язык» соотносит абстрактные понятия с реальными объектами, модель «зрение-язык-действие» связывает семантику с траекториями действий, а третий уровень требует от робота понимания и предсказания физических последствий в процессе контакта. Модели VLA, полностью полагающиеся на зрение, склонны применять одну и ту же стратегию к визуально похожим объектам, и когда коррекция происходит после контакта, хрупкие объекты уже деформируются. UniTac переносит предсказание тактильного состояния на этап до первого контакта, предоставляя VLA априорную информацию о процессе контакта, что делает первый контакт более безопасным.
Основная сложность, решаемая UniTac, — это унификация тактильных данных от разных датчиков. Визуальные тактильные датчики (например, GelSight, DIGIT, Duragel) регистрируют деформацию геля под давлением с помощью камеры, при этом изображение содержит как свойства объекта, так и конфигурацию датчика. Модель должна различать, какие изменения вызваны объектом (твёрдость, шероховатость, текстура), а какие — датчиком (освещение, состояние геля, разметка маркеров). Для решения проблемы гетерогенности датчиков UniTac разделяет тактильную информацию на две части: физические свойства и конфигурацию датчика. На этапе понимания модель одновременно изучает описание свойств объекта и идентификацию датчика, вынуждая модель различать источники сигнала; на этапе генерации токены датчика включаются в процесс генерации, избегая безусловной тактильной генерации. Эксперименты показали, что UniTac лидирует как в понимании, так и в генерации: на тесте PHYSICLEAR-Test UniTac-7B набрал 66,51 балла, опередив модели тактильного понимания, такие как Octopi, и универсальные модели, такие как BLIP3o; в задаче сопоставления свойств и объектов он достиг 64,61 балла. Для четырёх типов датчиков — Digit, GelSight, GelSight Mini и Duragel — средний SSIM UniTac составил 0,836, а средний PSNR — 19,93.






UniTac разработан под руководством компании UniX AI. Компания была основана в апреле 2024 года в Сучжоу доктором наук Йельского университета Ян Фэнъюем и является полноценным предприятием в области воплощённого интеллекта. Ян Фэнъюй является одним из первых авторов статьи UniTac. Другой первый автор, Jiahang Tu, из Чжэцзянского университета, занимается компьютерным зрением и генеративными моделями; ответственный автор Hanbin Zhao — доцент Чжэцзянского университета, давно работает в области машинного обучения и генеративных моделей; Zhi Tao из UniX AI отвечает за алгоритмы и внедрение систем на реальных роботах. Среди соавторов статьи также Chenyang Ma из Оксфордского университета, Xihang Yu из Массачусетского технологического института, Ziyao Zeng и Alex Wong из Йельского университета, Shaokai Wu из Шанхайского университета Цзяо Тун и другие. Предыдущие работы, такие как сбор данных Touch and Go, унификация представления мультисенсорных данных UniTouch и трёхмерное выравнивание визуального тактильного восприятия TaRF, были направлены на развитие тактильного направления. UniTac объединяет тактильное понимание, генерацию и межсенсорный перенос в единую архитектуру, предоставляя тактильные априорные знания для моделей VLA, что может повысить плавность и безопасность операций роботов в таких сценариях, как домашний уход, точная сборка и сервисные операции.











