AI芯片竞争正从单芯片性能比拼,转向数据中心整体效率之争。图片来源:Shutterstock

随着AI算力规模迈向吉瓦级,市场对于NVIDIA竞争力的判断也在发生变化。相比GPU本身的性能和供应能力,内存、存储、网络以及数据流的系统级协同,正成为决定AI数据中心性能与成本的关键因素。

据科技媒体TechCrunch 8月29日(当地时间)报道,在NVIDIA公布业绩后,市场分析普遍认为,其优势已不再仅仅体现在GPU供应领先,更在于对整个数据中心架构的整合能力。

在AI热潮初期,NVIDIA凭借对高端GPU的近乎垄断式供应,获得了可观收益。不过,随着Amazon、Google等超大规模云服务商加快推进自研AI芯片,市场对其GPU优势还能维持多久的担忧也随之升温。

自2023年初至2025年中,NVIDIA市值累计接近增长十倍;但过去一年,其股价涨势已明显放缓。这一变化同样反映出市场对竞争加剧的顾虑。

不过,随着AI基础设施持续扩张,行业竞争的重心本身也在转移。对于大规模AI数据中心而言,仅靠提升GPU算力已不足以解决效率问题。要实现高效运行,还需要同步优化内存、存储和网络之间的协同,并确保所需数据能够及时送达GPU。

在这一背景下,NVIDIA正将战略重点从单一GPU,进一步延伸至数据中心关键硬件与系统方案的一体化布局。

其中,下一代Vera Rubin架构是这一方向的代表。NVIDIA计划将Rubin GPU与Vera CPU结合,并把推理加速器、存储设备以及网络机架等组件整合进同一套系统方案。

这一布局的重点,并不只是增加计算单元数量,而是尽可能减少因数据传输不及时或网络瓶颈导致的算力闲置,从而提升数据中心整体效率。

NVIDIA存储技术负责人、副总裁Jason Hardy在谈及Vera的意义时表示,单台服务器或计算平台可搭载的内存存在物理上限。即便数据中心的算力和内存容量同步增长,如果无法及时将所需数据传送给GPU,整个系统的效率仍可能下降。

Hardy称,Vera CPU在部分加速相关任务中可带来最高3倍的性能提升,并有助于让闪存存储性能在不受瓶颈制约的情况下得到更充分释放。

对于试图提升单位电力可处理Token数量、同时压降成本的AI服务企业而言,这种对数据流的控制能力,可能成为新的关键竞争要素。

类似思路也出现在其他AI公司身上。OpenAI本月初在博客中介绍,其自研“Jalapeño”芯片将重点放在减少数据移动和通信延迟上,希望尽可能在统一互连系统内完成整体任务,降低数据搬运需求,并提升请求处理全流程的速度与效率。

两家公司的路径并不完全相同。OpenAI更倾向于在一体化芯片内部完成任务,以减少数据移动本身;而NVIDIA则更接近通过统筹GPU、CPU、存储和网络等全栈系统能力来提升效率。

不过,二者的共同点十分明确:随着AI基础设施加速扩张,相比单纯提升处理器算力,如何以更快、更高效的方式完成数据传输,正变得愈发重要。

这也意味着,AI芯片竞争正在从“GPU单品性能对比”,转向“数据中心整体系统设计能力”的较量。

未来,NVIDIA仍将面对来自自研AI芯片的超大规模云服务商及其他芯片厂商的挑战。但在AI基础设施竞争仍处于早期阶段的当下,相比打造一颗可与NVIDIA对标的GPU,让整个数据中心运转得更高效的系统能力,正成为更关键的变量。

NVIDIA能否从GPU厂商进一步进化为整合算力、内存、存储和网络的系统型企业,或将成为影响下一阶段AI基础设施市场竞争格局的核心看点。

关键词

#NVIDIA #AI数据中心 #GPU #Vera Rubin #Vera CPU #数据流 #存储 #网络 #超大规模云服务商 #OpenAI #系统设计能力
版权所有 © DigitalToday。未经授权禁止转载或传播。