Китайская исследовательская группа предложила новую парадигму DPCN для многолетнего планирования путей

2026-07-17 14:58
В избр.

Репортаж от Wedoany,Китайская исследовательская группа предложила новую парадигму под названием DPCN (Decentralized-Planning-Centralized-Negotiation) для решения задачи многолетнего планирования путей (MAPF). Эта парадигма, сохраняя масштабируемость децентрализованных методов, эффективно обрабатывает динамические конфликты с помощью механизма централизованных переговоров, достигая на стандартных тестовых наборах производительности, превосходящей существующие методы обучения с подкреплением.

Многолетнее планирование путей направлено на прокладку бесконфликтных маршрутов для нескольких агентов в общей среде и широко применяется в таких областях, как автоматизированные складские системы, диспетчеризация сервисных роботов и аэропортовая логистика. Традиционные стратегии централизованного планирования показывают отличные результаты на задачах малого масштаба, но вычислительная сложность резко возрастает при работе с большими группами агентов. Децентрализованные методы на основе обучения с подкреплением, хотя и обладают масштабируемостью и способностью адаптироваться к среде, из-за ограниченного локального обзора часто приводят к блокировкам, столкновениям и даже тупикам.

DPCN делит каждый временной шаг на два этапа: на этапе планирования каждый агент независимо генерирует намерение действия на основе локальной наблюдаемой информации o_i^t (обзор 3×3); на этапе переговоров система обнаруживает все потенциальные конфликты (включая конфликты вершин и обмена) и динамически объединяет агентов, вовлеченных в конфликт, в «суперагента». С помощью обучаемой сети PNSE (Pointer Network Special Edition) из конфликтующего набора выбирается один «победитель», который выполняет свое первоначальное намерение, в то время как остальные агенты остаются неподвижными или повторно выбирают новое действие.

Рисунок 1: Общая архитектура DPCN

Для решения проблем несоответствия наборов действий суперагента и сложности динамического обучения сеть PNSE, вдохновленная сетями указателей, способна обрабатывать входные данные переменной длины и несоответствующие пространства действий. Исследовательская группа предложила механизм обучения с подкреплением на основе специальной стратегии градиента, использующий приближение среднего поля для справедливого распределения глобального вознаграждения, что обеспечивает эффективное обучение динамических суперагентов.

Эксперименты проводились на стандартных тестовых наборах MAPF и случайных картах. Сравнение включало два типа централизованных планировщиков (ODrM*, BALANCE) и три передовых метода RL (SCRIMP, DCC, PICO). В экспериментах на случайных картах размер карт варьировался от 30×30 до 100×100, плотность препятствий — от 0% до 30%, количество агентов — от 32 до 256. Каждая конфигурация повторялась 200 раз, фиксировались показатель успешности и количество шагов для выполнения задачи. Результаты показали, что DPCN при высокой плотности препятствий (30%) и в крупномасштабных сценариях стабильно поддерживает высокий уровень успешности и низкое время выполнения задачи, значительно превосходя не только другие методы RL, но и централизованные планировщики.

При оценке способности к обобщению на структурированных картах в экспериментах использовались три типичных типа карт: многокомнатная среда размером 32×32 (размер комнат 3×3), среда аудитории размером 162×141 и складская среда размером 170×84 (ширина проходов между стеллажами всего 2 клетки). Каждая карта содержала 25 экземпляров задач. DPCN продемонстрировал способность эффективно координировать крупные группы агентов в этих сложных структурах.

Исследовательская группа отмечает, что DPCN благодаря инновационной архитектуре децентрализованного планирования и централизованных переговоров эффективно решает проблемы координации конфликтов в условиях ограниченного локального обзора, сохраняя при этом масштабируемость. В будущем планируется изучить применение в средах с динамическими препятствиями, гетерогенными агентами и на реальных роботизированных платформах.

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com

Связанные продукты

WiFi-локальный переходник - CREATEC
6422 Оптический рефлектометр (OTDR) - Ceyear Technologies Co., Ltd.
Интеллектуальный автоматический калибратор давления ConST811A - Beijing ConST Instruments Technology Inc.
Т профиль шкафа - Xinli Tongchuang Electronic Equipment Co., Ltd.
Контроллер системы обнаружения горючих газов 30 - Jinan Benan Technology Development Co., Ltd.
Промышленная кольцевая сеть Ethernet для горнодобывающей промышленности (10 Гбит/с / 1 Гбит/с) - Chongqing Mas Sci&Tech Co., Ltd.
Автоматический патрульный робот/автоматический робот безопасности - FOTUN HONGKONG LIMITED
Тропосферный ветровой профилемер P-диапазона TWP16 - China Huayun Meteorological Technology Group Co., Ltd.
Планшетный портативный спутниковый терминал  Ручной портативный терминал с антенной диаметром 0,35 м - China Starwin Science & Technology co., Ltd.
Беспроводная локальная сеть | Точка доступа AirEngine 5776-56T - Huawei
Одномодовое волокно G.652B - SHENZHEN SDG INFORMATION CO., LTD.
Беспилотный рефрижератор Neolix X6 - Neolix Beijing Technology Co., Ltd.
Читайте также
Hyundai Motor Group запускает маховик данных ИИ для автономного вождения: серийное производство системы L2+ в 2028 году
2026-09-14
SoftBank заключила кредит на 11,87 млрд долларов для финансирования инвестиций в OpenAI
2026-09-14
Спрос на токены в Китае демонстрирует взрывной рост: ожидается, что к 2026 году потребление достигнет 1 квинтиллиона
2026-09-13
Anthropic планирует привлечь до 100 млрд долларов в ходе IPO в США
2026-09-12
Rapidus представила концепцию лунного завода по производству полупроводников к 2040 году
2026-09-12
ОАЭ планируют инвестировать в Германию 40 млрд евро, включая центры обработки данных мощностью около 1 ГВт
2026-09-11
Компания Analog Devices из США подписала соглашение о приобретении Alif Semiconductor за 1,35 млрд долларов
2026-09-11
Перу и США подписали меморандум о взаимопонимании по сотрудничеству в области искусственного интеллекта
2026-09-11
Американская Palantir и нидерландская Nebius заключили партнёрство в области суверенной инфраструктуры ИИ
2026-09-10
Официальный выпуск модели DeepSeek V4.1 Flash: полное превосходство над V4 Pro, нативное мультимодальное визуальное понимание, снижение цен на API
2026-09-10