Недавно команда из Центра вычислительных сетей и информации Китайской академии наук разработала программное обеспечение HIP-DFPT для крупномасштабных квантовых возмущённых вычислений на гетерогенных кластерах GPU. Данное ПО, учитывая нерегулярную нагрузку в квантовых возмущённых вычислениях, предлагает методы реорганизации микрозадач, оптимизации памяти GPU и многопоточной асинхронной конвейерной обработки, преобразуя множество мелкозернистых вычислительных задач в микрозадачи, более подходящие для выполнения на GPU, повышая эффективность использования потоков и доступа к данным, а также снижая накладные расходы на связь и передачу данных.

Квантовая теория возмущений является важным теоретическим инструментом для изучения отклика материалов и молекулярных систем, позволяя раскрыть такие микроскопические физические свойства, как фононные спектры, поляризуемость и спектры комбинационного рассеяния. Она имеет важное прикладное значение в таких областях, как материаловедение, физика конденсированного состояния и молекулярное моделирование.
Исследовательская группа предложила метод моделирования производительности на основе ИИ для сложного ветвящегося кода, позволяющий быстро прогнозировать время выполнения задач при выборке лишь небольшого объёма данных, а также разработала гибридный многоуровневый алгоритм балансировки нагрузки, обеспечивающий совместную оптимизацию динамического планирования между узлами и внутри GPU. Экспериментальные результаты показывают, что HIP-DFPT может масштабироваться до 8192 отечественных GPU и поддерживать моделирование с полной электронной точностью для систем размером до 200 000 атомов, при этом пропускная способность по атомам увеличивается на 70%. Это подтверждает возможности параллельного масштабирования и потенциал инженерного применения данного ПО в крупномасштабных квантовых возмущённых вычислениях, а также открывает новый технологический путь для интеллектуальной оптимизации сложных научных вычислительных программ на гетерогенных кластерах GPU.
Сообщается, что соответствующие результаты исследований были приняты к публикации в журнале IEEE Transactions on Parallel and Distributed Systems (журнал категории A CCF).
