在二季度财报发布前夕,NVIDIA于当地时间25日在美国举行的半导体设计大会Hot Chips 2026上发布多款面向AI推理和网络基础设施的新产品,涵盖推理加速器、以太网扩展方案和基础设施加速技术,重点指向AI推理阶段,尤其是Token生成速度。
此次亮相的产品包括启动量产的交互式AI推理加速器“NVIDIA Grok 3 LPX”、以太网扩展技术Spectrum-X Multiplane,以及基础设施加速方案ScaleIn。NVIDIA在会上反复强调三条主线:推理性能、网络可扩展性,以及面向AI智能体的新一代CPU。公司表示,这些产品和技术均建立在统一的Vera Rubin平台之上。NVIDIA将于当地时间26日发布第二季度业绩,按韩国时间为27日凌晨。
Grok 3 LPX启动量产,主打高Token生成速度
NVIDIA在Hot Chips 2026上宣布,Grok 3 LPX正式进入量产阶段。该产品被定位为服务于下一代AI工厂平台Vera Rubin的推理加速器。NVIDIA表示,这是该产品目前公布的最高性能表现之一。
根据NVIDIA披露的数据,在Artificial Analysis基准测试中,Grok 3 LPX在10万Token上下文条件下运行开源智能体模型Gemma 4 31B时,输出Token速度达到每秒3400个。
AI云公司Nebius计划率先在其推理平台Nebius Token Factory中引入Grok 3 LPX;AI推理云服务商Grok也被列入首批导入企业名单。
NVIDIA创始人兼CEO Jensen Huang表示,推理正成为AI增长的核心驱动力。面向AI智能体时代,Vera Rubin将通过针对不同工作负载优化的AI工厂配置扩展这一愿景,而LPX则可进一步提升超高速Token生成能力和整体性能上限。
NVIDIA指出,AI智能体通常需要在缺少人工干预的情况下自主完成多步骤任务,因此在数百到数千步的推理过程中会生成大量Token。如果生成速度不足,整体任务完成时间就会被明显拉长。公司认为,AI智能体对系统提出了两项关键要求:一是处理海量上下文,二是以低时延生成Token。Grok 3 LPX的重点,正是提升单用户场景下的Token生成速度。
Spectrum-X Multiplane瞄准大规模扩展
NVIDIA同时发布了以太网新技术Spectrum-X Multiplane。公司表示,当AI工厂规模继续扩大、超过当前最大集群水平后,传统扩展方案往往需要引入第三层网络,但这会带来更高的时延、更大的性能波动,以及更高的线缆、光模块和电力成本。
为解决这一问题,Spectrum-X Multiplane将服务器网络连接拆分为多个相互独立的路径“平面”,并让每个平面在各自的二层网络中运行。NVIDIA称,在不引入第三层网络的情况下,该方案可将平面式架构扩展至51.2万块GPU。
路径管理由ConnectX SuperNIC内置的专用硬件引擎负责。NVIDIA表示,一旦发生故障,系统可立即重新计算路径并绕开故障点,使应用和软件层面仍只感知到单一连接。在8平面配置下,即便其中1个平面失效,整体带宽仍可维持在约90%;与软件负载均衡相比,硬件恢复速度快11倍。NVIDIA称,这一设计可将AI工厂产出提升1.6倍。
ScaleIn扩展至网络、存储、安全和运维
除计算和网络之外,NVIDIA还把加速范围扩展到基础设施服务。此次发布的ScaleIn基于BlueField-4处理器和DOCA软件平台,可对网络、存储、安全及运维进行协同加速。NVIDIA表示,随着AI工厂持续扩张,基础设施服务本身也需要接近AI计算的速度同步提升。
此次公布的网络技术按Vera Rubin NVL72定制设计,包括Spectrum-X SN6000系列交换机和ConnectX-9 SuperNIC。面向多数据中心互联的Spectrum-XGS以太网则用于把多个数据中心整合成单一AI超级工厂。NVIDIA称,该方案可将多站点NCCL集合通信运算速度提升1.9倍。
SpaceXAI采用Vera CPU,面向轨道环境部署AI基础设施
NVIDIA还披露,SpaceXAI将采用Vera CPU,以加速下一代AI智能体工作负载。公司指出,轨道环境在供电与散热管理、带宽、可靠性及物理集成等方面,与地面数据中心存在明显差异。
Vera被NVIDIA定位为首款专为AI智能体打造的CPU,搭载NVIDIA自研的88个Olympus核心,并配备高带宽LPDDR5X内存,带宽最高可达1.2TB/s。NVIDIA表示,在AI智能体、强化学习和数据处理等工作负载中,Vera的任务完成速度较x86 CPU最高可提升1.8倍。
NVIDIA强调CPU的重要性,原因在于AI智能体的运行方式正在发生变化。公司指出,智能体应用在模型调用之间需要完成工具编排、代码执行和数据处理,因此对CPU性能的依赖正在上升。SpaceXAI总裁Mike Nichols表示,Vera在让GPU专注于其最擅长任务的同时,也提供了大规模编排、代码执行和数据处理所需的CPU性能与内存带宽。
SpaceXAI计划基于Vera Rubin,把支撑Grok的AI基础设施扩展至吉瓦级计算规模。其第一代Starmind AI卫星将采用优化后的Vera Rubin NVL72系统,目标是将驱动地面AI工厂的架构延伸至轨道环境。