韩国科学技术院(KAIST)与Meta围绕下一代AI数据中心架构展开合作研究,并在国际期刊《Nature Reviews Electrical Engineering(NREE)》发表综述论文。
KAIST电气与电子工程系教授Jeong Myungsoo及其创办的Panmnesia研究团队9日表示,已与Meta研究人员共同提出一套基于CXL(Compute Express Link,计算快速链接)的新型数据中心架构。该方案试图将CPU、AI加速器和内存统一互联,并把这一连接方式从单机、机架进一步扩展到整个数据中心。
CXL是一项国际标准互联技术,可实现CPU、加速器、内存等不同计算资源之间的高速连接与共享。研究团队认为,随着AI计算任务调用的加速器数量不断增加,如何高效连接大量加速器与内存,正成为影响整体性能的关键因素之一。加速器规模越大,设备之间的数据传输延迟对系统性能的拖累也越明显。
与传统数据中心主要依靠网络连接多台服务器协同工作的方式不同,该团队提出的架构不再以单台服务器为边界,而是将CPU、加速器和内存更紧密地组织在一起,使整个数据中心能够像一台计算机那样运行。
目前,Nvidia的NVLink、UALink等技术也被用于多加速器高速互联,但主要应用于机架内互联。相比之下,上述方案以CXL为基础,不仅覆盖加速器之间的连接,还将CPU和内存纳入同一互联体系,并把适用范围进一步扩大到整个数据中心。
按照研究团队的分析,这一架构下,单一连接域最多可接入960个加速器,规模约为现有基于NVLink的机架的13倍。与此同时,数据传输延迟有望从传统网络架构下的微秒(μs)级降至数百纳秒(ns)级。
除扩大互联规模、降低时延外,该架构还被认为有助于提升计算资源利用率。论文指出,CPU、加速器和内存可以作为相对独立的资源灵活连接;一旦出现故障,也只需更换对应部件。对于暂时闲置的计算或内存资源,系统还可分配给其他任务使用。
Jeong Myungsoo表示,AI规模越大,就越需要以更快、更高效的方式连接大量加速器和内存。“这项研究的意义在于,我们基于CXL提出了让整个数据中心以单一计算系统方式运行的下一代AI基础设施方向。”他说。