Американская OpenAI совместно с AMD, Broadcom, NVIDIA и другими представила открытый сетевой протокол MRC: многопутевая передача решает проблему простоя GPU

2026-05-07 11:47
В избр.

Репортаж от Wedoany,6 мая 2026 года американская компания OpenAI объявила о сотрудничестве с AMD, Broadcom, Intel, Microsoft и NVIDIA и официально представила новый открытый сетевой протокол под названием «Многопутевое надежное соединение» (Multipath Reliable Connection, MRC), нацеленный на решение широко распространенных в сверхмасштабных кластерах для обучения ИИ проблем простоя вычислительных мощностей GPU и узких мест, связанных с перегрузкой сети.

В официальном техническом блоге OpenAI указала прямую причину разработки этого протокола: «Перегрузка сети, отказы каналов и устройств являются наиболее распространенными источниками задержек и джиттера при передаче. С ростом масштаба кластеров эти проблемы возникают все чаще, а сложность их решения возрастает». При обучении больших моделей один шаг может включать миллионы синхронных передач данных между GPU, и одна задержка может привести к простою большого количества GPU в ожидании. MRC динамически распределяет поток данных одного RDMA-соединения по сотням сетевых путей и использует технологию маршрутизации от источника SRv6 для кодирования решений о пересылке в заголовок пакета. При возникновении отказа канала или перегрузки трафик автоматически перенаправляется в обход за микросекунды, что значительно сокращает перерывы в обучении и простои вычислительных мощностей.

Глубина отраслевого сотрудничества в рамках этого протокола также заслуживает внимания. AMD внесла в MRC технологию контроля перегрузок и уже реализовала ее развертывание на сетевых картах 400G, обеспечив плавный переход к своим Pensando «Vulcano» 800G AI NIC. NVIDIA впервые проверила и оптимизировала MRC на платформе Spectrum-X Ethernet, где ее технология обхода отказов способна обнаружить сбой пути за несколько микросекунд и автоматически перенаправить трафик на аппаратном уровне. Сетевой адаптер Broadcom Thor Ultra 800Gbps Ethernet добавил поддержку MRC, обеспечив аппаратную основу для многоплоскостных ИИ-сетевых архитектур. OpenAI публикует протокол MRC по открытой лицензии через Open Compute Project (OCP), что означает, что любой облачный провайдер или предприятие может бесплатно использовать эту технологию.

Руководитель направления промышленных вычислений OpenAI Сачин Катти (Sachin Katti) публично заявил в официальном блоге NVIDIA: «Мощное сотрудничество с NVIDIA сделало развертывание MRC на поколении Blackwell очень успешным». Старший вице-президент сетевого подразделения NVIDIA Гилад Шайнер (Gilad Shainer), в свою очередь, отметил, что развертывание MRC на Spectrum-X Ethernet уже помогло нескольким гиперскейлерам повысить эффективность и надежность крупномасштабного обучения.

Темпы развертывания синхронизированы с итерацией моделей. MRC уже полностью развернут во всех крупных суперкомпьютерах OpenAI, используемых для обучения передовых моделей, включая площадку облачной инфраструктуры Oracle в Абилине, штат Техас, США, а также кластер суперкомпьютеров Microsoft Fairwater. Эти кластеры выполняют задачи по обучению следующего поколения моделей для таких продуктов, как ChatGPT и Codex. В настоящее время MRC встроен в новейшие сетевые интерфейсы 800Gb/s, глубоко интегрирован с NVIDIA Spectrum-X Ethernet, проверен и оптимизирован на архитектуре GPU Blackwell.

Команда OpenAI в техническом решении привела характерный пример: недавно при обучении передовой большой модели для ChatGPT и Codex инженерной группе потребовалось перезагрузить четыре первичных коммутатора ядра сети. В традиционной сетевой архитектуре такие операции обычно требуют чрезвычайно тщательной координации с эксплуатационной командой. После внедрения MRC, благодаря наличию механизмов многопутевой передачи и быстрой перемаршрутизации, им даже не потребовалось заранее согласовывать перезагрузку с командой, отвечающей за задачи обучения кластера, и процесс обучения не пострадал.

Протокол построен на основе традиционного RoCEv2 (RDMA over Converged Ethernet). Традиционный RoCEv2 поддерживает только один сетевой путь на соединение и не может полностью использовать многопутевую топологию внутри центров обработки данных. При потере пакетов его механизм отката N требует повторной передачи всех последующих пакетов в окне, создавая дополнительные сетевые издержки. В крупномасштабных кластерах решение на основе无损ной сети с приоритетным управлением потоком (PFC) также вызывает распространение перегрузок и блокировку начала очереди (HOL blocking). MRC предлагает решения для каждого из этих недостатков — многопутевая балансировка нагрузки, выборочная повторная передача вместо отката N и явное управление маршрутизацией на основе SRv6, — что в совокупности формирует сетевой транспортный уровень для ИИ-фабрик гигаваттного масштаба.

В комментариях к официальному аккаунту OpenAI в социальных сетях многие отраслевые специалисты оценили MRC как «настоящий инфраструктурный прогресс», а некоторые отметили, что это знаменует переход конкуренции в области ИИ-инфраструктуры от простого наращивания количества GPU к стандартизации эффективности кластерных коммуникаций. По мере того как масштаб параметров ИИ-моделей продолжает расти до триллионов, сетевой уровень становится третьей ключевой переменной, ограничивающей эффективность обучения, после вычислительных мощностей и систем хранения. Открытая публикация MRC предоставляет всей отрасли переиспользуемую базовую сетевую структуру.

Данный материал скомпилирован платформой Wedoany. При цитировании материалов, созданных с помощью искусственного интеллекта (ИИ), необходимо обязательно указывать источник — «Wedoany». В случае выявления нарушения прав или иных проблем просим своевременно информировать нас. Сайт оперативно внесёт изменения или удалит материал.Электронная почта: news@wedoany.com

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com

Связанные продукты

Тропосферный ветровой профилемер P-диапазона TWP16 - China Huayun Meteorological Technology Group Co., Ltd.
Т профиль шкафа - Xinli Tongchuang Electronic Equipment Co., Ltd.
6422 Оптический рефлектометр (OTDR) - Ceyear Technologies Co., Ltd.
Беспроводная локальная сеть | Точка доступа AirEngine 5776-56T - Huawei
Промышленная кольцевая сеть Ethernet для горнодобывающей промышленности (10 Гбит/с / 1 Гбит/с) - Chongqing Mas Sci&Tech Co., Ltd.
Антенные системы и сопутствующая электронная продукция - Chengdu Zhongdian Jinjiang Information Industry Co., Ltd.
Решения для систем безопасности SIS - Beijing Consen Automation Technology Co., Ltd.
Лазерный принтер TG1020AD - Xiamen Hanin Co., Ltd.
QPS-20A Резервированный переключатель питания - CHN ENERGY ZHISHEN CONTROL TECHNOLOGY CO., LTD.
Решение для защиты офиса от утечки данных - Sangfor Technologies Inc.
Автоматический патрульный робот/автоматический робот безопасности - FOTUN HONGKONG LIMITED
Интеллектуальный автоматический калибратор давления ConST811A - Beijing ConST Instruments Technology Inc.
Читайте также
Компания Analog Devices из США подписала соглашение о приобретении Alif Semiconductor за 1,35 млрд долларов
2026-09-11
Китайская компания SIRUP представила чипы для оптической связи 800G/1.6T на выставке CIOE 2026
2026-09-10
HCLTech инвестирует 1,85 млрд рупий в создание полупроводниковой лаборатории в Бангалоре, Индия
2026-09-09
В Копенгагене построят квантовую фабрику площадью 5300 кв. м, запуск — в 2027 году
2026-09-05
Американская Broadcom прогнозирует удвоение доходов от ИИ-чипов к 2027 году до примерно 115 миллиардов долларов
2026-09-05
Navitas Semiconductor и GlobalFoundries: первые американские изделия GaNFast пятого поколения отгружаются в сентябре
2026-09-04
Новое поколение смартфонов Doubao от ByteDance использует память LPDDR5X производства ChangXin Technology
2026-09-04
Японская компания Sumitomo Chemical начала массовое производство 4-дюймовых эпитаксиальных пластин из фосфида индия, ожидаемый объём продаж — десятки миллиардов иен
2026-09-03
TRUMPF представляет технологию лазерного охлаждения чипов UKP — скорость обработки в 5 раз выше, чем при традиционном травлении
2026-09-03
CollPlant приобретает израильскую компанию по оптическим вычислениям LightSolver
2026-09-02