Репортаж от Wedoany,Недавно Пекинский университет транспорта и Пекинский университет химической технологии совместно с более чем 30 организациями, включая Huawei, Пекинскую группу данных, Университет Цинхуа и Пекинский университет, официально опубликовали «Белую книгу по фабрикам данных». Этот документ является первым в Китае систематическим исследованием политики, теории и практики фабрик данных. В нём впервые чётко определены понятие, типология и основные характеристики фабрик данных, что обеспечивает системную основу для развития китайской индустрии элементов данных и внедрения сценариев искусственного интеллекта.
Белая книга состоит из шести глав. Первая часть, исходя из текущего состояния развития искусственного интеллекта, формирования цифровой интеллектуальной промышленной цепочки и её слабых звеньев, обосновывает необходимость и срочность создания фабрик данных как ключевого объекта для масштабного производства высококачественных наборов данных. Во второй части рассматриваются практические примеры типичных фабрик данных в Китае и за рубежом. Международные примеры включают Scale AI, американский проект «Звёздные врата», Европейский центр данных, Европейскую лабораторию данных, Parse Biosciences, Bioptimus, Лабораторию Декарта и др. Внутренние примеры охватывают суперфабрику данных «Фань|Будущий сельскохозяйственный интеллектуальный хаб» Национальной лаборатории Ячжоувань, Главный центр хранения и вычислительных мощностей провинции Гуйчжоу и базу обеспечения элементов данных, «Суперфабрику корпусов» Купаси, фабрику данных ИИ в Пекинском индустриальном парке элементов данных (Тяньцзинь-Хэбэй), Передовой центр хранения провинции Гуандун, суперфабрику данных для воплощённого интеллекта Пасини, «Мо-суперпространство» в районе Сюйхуэй Шанхая, «Мо-шу-мир» в Пекинской зоне экономического и технологического развития, «Мо-шу-пространство» в городе Чжухай, «Суперфабрику больших моделей» в районе Шицзиншань Пекина и др. Также обобщены общие характеристики китайских фабрик данных. В третьей части предлагается, что фабрика данных является объектом масштабного производства высококачественных наборов данных и новым видом деятельности, а также важной частью национальной инфраструктуры данных. Она подразделяется на три типа: централизованный, полуцентрализованный и распределённый, и обладает пятью основными характеристиками: диверсификация, масштабируемость, системность, стандартизация и AI-ориентация. Четвёртая часть описывает состав, позиционирование и функции фабрик данных на широком и узком уровнях: в широком смысле они включают национальную базу данных, национальную фабрику данных и национальный полигон для обучения ИИ; в узком смысле — складской цех, производственный цех и пилотный цех, соответствующие базе поставок сырья данных, конвейеру высококачественных наборов данных и полигону наборов данных. Пятая часть рассматривает четыре модели строительства (итерация предприятий по разметке данных, модернизация баз хранения данных, расширение компаний ИИ, инновационное создание технологических компаний), четыре механизма эксплуатации (гарантия, кастомизация, партнёрство, электронная коммерция) и три стратегии развёртывания (развёртывание фабрик данных с общедоступными наборами данных на национальной инфраструктурной базе, развёртывание фабрик данных с отраслевыми общедоступными наборами данных на важных функциональных объектах, развёртывание фабрик данных с отраслевыми специализированными наборами данных на различных бизнес-узлах). Шестая часть предлагает рекомендации по развитию с четырёх измерений: политика, стандарты, технологии и платформы, включая ускорение выпуска руководящих принципов, запуск разработки стандартов, преодоление ключевых технологических узких мест и т.д.


























