NHN Cloud正式投运AI数据中心“FactoryX Seoul”,并以此加码大规模AI基础设施竞争。该中心共部署7656块NVIDIA B200 GPU。NHN Cloud表示,其核心竞争力不只是GPU数量,更在于将大规模GPU整合为单一计算环境的集群能力,以及围绕液冷散热、网络和安全体系构建的稳定运维能力。
6日,在首尔永登浦区举行的数据中心参观活动上,NHN Cloud技术业务部负责人Lee Iljun表示,AI基础设施服务商的竞争力,不仅取决于是否拥有数千块GPU,更关键的是能否把这些GPU构建成可用于实际训练的大规模集群,并长期稳定运行。
据介绍,FactoryX Seoul共部署7656块B200 GPU。其中,位于3层和4层的255个节点分别接入同一集群,合计形成由510个节点、4080块GPU组成的单一集群。NHN Cloud称,公司原本建议拆分为两个集群,但在政府提出建设大型单一集群的要求后,最终调整为合并部署。
在大规模AI训练场景中,多块GPU需要协同处理同一任务,因此高带宽网络、存储系统和集群运维能力的重要性,并不亚于GPU本身的数量。NHN Cloud表示,其510节点集群在高性能Linpack(HPL)基准测试中的成绩位列全球超级计算机榜单TOP500第20位。
支撑大规模集群运行的关键,在于电力和冷却能力。NHN Cloud认为,与强调超低时延的业务不同,AI训练型基础设施更看重能否在同一地点落实大规模电力供应和GPU资源,而非数据中心的地理位置本身。
Lee Iljun表示,AI工作负载通常是在一次传输大规模数据后进行长时间训练,因此首都圈与地方之间的区位差异,对这类业务的影响相对有限。在FactoryX Seoul选址过程中,比起区位条件,更重要的是能否在所需时间内落实充足电力。
为适配高密度GPU运行环境,FactoryX Seoul采用直连液冷(DLC)方案。该数据中心最初按风冷架构设计,但为了大规模部署B200,NHN Cloud用了约5个月时间增设液冷管路和制冷设施。具体而言,CPU和GPU芯片通过冷板直接导出热量,而内存、网络设备和存储设备等仍沿用原有风冷方式。
NHN Cloud指出,液冷不仅关系到能效,也直接影响运行稳定性。GPU温度升高后,设备可能主动降频;一旦超过阈值,甚至可能停止工作。集群规模越大,散热能力对实际算力表现的影响就越明显。
在运维层面,故障处置被视为最棘手的问题。Lee Iljun表示,一旦发生故障,客户正在运行的业务可能中断,并进一步引发投诉或赔偿责任。NHN Cloud称,在液冷环境下,设备故障概率低于风冷方案。
对于承担国家级AI基础设施运营的数据中心而言,安全同样是关键环节。NHN Cloud表示,为满足政府及产学研机构的安全要求,依托国家预算建设的GPU资源运行在与既有云服务相隔离的独立网络中,并单独部署了防火墙、DDoS防护设备和入侵防御系统(IPS)等安全设施。公司还表示,已取得多项安全认证,其云服务安全能力已获得外部验证。
目前,已建成的相关资源也已投入国家AI项目。NHN Cloud称,截至上月,510节点和255节点的国家级GPU算力资源已向产业界、研究机构和高校等约200家产学研机构提供,目前正将运行环境切换为面向“自主AI基础模型”项目参与企业使用。
FactoryX Seoul由韩国科学技术信息通信部与韩国信息通信产业振兴院(NIPA)推动的AI计算基础设施项目建成。NHN Cloud负责约1万亿韩元规模的AI基础设施采购与建设,并承担未来5年的运营任务。根据项目结构,部分归国家所有的GPU也可由NHN Cloud用于自身研发或面向民间客户提供服务。
不过,要让这笔大规模GPU投资进一步带动民间AI基础设施业务扩张,长期需求仍是一个待解课题。由于GPU前期投入高、产品迭代周期短,一旦利用率下滑,运营方负担可能明显加重。
Lee Iljun表示,如果政府能够提前明确计划租用的资源规模,云服务企业将更容易作出投资决策;若要持续扩大大规模GPU投入,提升长期需求的可预见性仍然十分关键。