Репортаж от Wedoany,Компания Liqid предоставляет уровень объединенной памяти для системы Abaco, разработанной Micron для Тихоокеанской северо-западной национальной лаборатории (Pacific Northwest National Laboratory, PNNL) Министерства энергетики США. Эта платформа способна обеспечить более 160 ТБ когерентной памяти на нескольких серверах, ориентируясь на ИИ и научные рабочие нагрузки, где ограничения эффективности доступа к данным более значимы, чем производительность процессора.

Текущие темпы роста вычислительной мощности опережают развитие емкости памяти, пропускной способности и локальности. Крупные графовые модели, научное моделирование, молекулярные рабочие нагрузки и ИИ-инференс часто останавливаются из-за ожидания процессором данных или необходимости разделения задач операторами в рамках ограничений памяти одного сервера. Концепция Abaco рассматривает память как общий, программируемый ресурс, а не как фиксированный компонент, постоянно привязанный к одной машине. По заявлению Liqid, их конструкция масштаба стойки позволяет выделять до 160 ТБ DRAM одному хосту или распределять емкость между максимум 16 узлами. Micron является основным техническим подрядчиком проекта, а Liqid предоставляет расширительное оборудование, коммутационную структуру, адаптеры хоста и уровень оркестрации. Это развертывание остается на уровне национальной лаборатории и не является сигналом того, что основные центры обработки данных готовы перестроиться на разнесенную память, но оно переводит обсуждение с архитектурных схем на реально работающее оборудование.
Платформа Liqid EX 5410C поддерживает CXL 2.0, обеспечивая до 40 ТБ DRAM в одном корпусе, при этом несколько корпусов могут образовывать пул емкостью более 160 ТБ. Программное обеспечение Liqid Matrix отвечает за распределение емкости между хостами и интегрируется с такими инструментами, как Kubernetes, Slurm и Ansible. Ключевое утверждение заключается в том, что дорогая память не должна простаивать в неправильном сервере. Операторы могут выделять большие пулы для моделирования, аналитических задач или инференс-нагрузок, а затем перенаправлять эту емкость на другие задачи. В идеале это повышает коэффициент использования и откладывает закупку серверов.
Однако на практике экономическая эффективность зависит от поведения рабочих нагрузок. Объединение памяти вводит компоненты структуры, адаптеры, управляющее ПО и новые эксплуатационные зависимости, тогда как локальная DRAM остается более простой. Приложения с высокой чувствительностью к задержкам могут не выдержать режим удаленного доступа, даже если структура CXL обеспечивает высокую пропускную способность. Покупателям необходимо принимать решения на основе измерений своих собственных задач, а не только агрегированных показателей емкости. Зоны отказа также меняются: общий пул памяти на нескольких узлах повышает гибкость, но сбой структуры или управления может одновременно затронуть больше систем. Планирование емкости переходит от закупки серверов к стратегии оркестрации, что требует перестройки соответствующих процессов мониторинга, контроля доступа и восстановления.









