NVIDIA面向AI代理的推理加速器Groq 3 LPX已进入量产。图片来源:NVIDIA

NVIDIA宣布,面向AI代理的专用推理加速器Groq 3 LPX已进入量产。

据SiliconANGLE等外媒24日报道,这款芯片基于NVIDIA数据中心平台Vera Rubin扩展开发,瞄准AI代理场景,主打高速token生成。NVIDIA已在Hot Chips 2026上发布该产品,Nebius Group也成为首批宣布部署Groq 3 LPX的客户之一。

所谓AI推理,是指将完成训练的模型投入实际应用的过程。随着能够替代部分人工执行任务的AI代理加速落地,推理、规划、代码编写与执行、系统文件检查以及外部工具调用等环节会反复发生,系统需要持续处理海量token。在这一过程中,解码时延正成为影响用户响应速度的核心瓶颈。NVIDIA表示,要降低这类时延,关键在于将长上下文处理与token生成拆分,并采用专用计算架构。

在这一架构中,机架级平台Vera Rubin NVL72负责长上下文处理,多颗Vera Rubin GPU承担大规模上下文输入与计算;引入Groq 3 LPX后,解码环节则可独立运行。NVIDIA称,在整机架配置下,系统最多可通过超高带宽芯片互连接入256个LP30加速器,由GPU与语言处理器(LPU)协同工作,形成覆盖AI代理推理全流程的一体化推理引擎。

NVIDIA表示,这一方案可在吞吐与时延之间实现更好平衡。按照公司的说法,Groq 3 LPX能够在低时延条件下,支持AI代理扫描长上下文窗口、校验数据、调用外部工具,并实时反复执行复杂的多步骤任务。

在Artificial Analysis基准测试中,Groq 3 LPX在10万token上下文窗口下运行开源Gemma 4 31B代理模型时,生成速度最高达到每秒3400个token。NVIDIA称,在对时延敏感的任务中,这一成绩意味着其响应速度较竞品平台提升4倍,并可将原本需要数小时的多步骤代理任务压缩至数分钟内完成。

Groq 3 LPX基于半导体初创公司Groq的授权技术开发。NVIDIA于去年12月以200亿美元获得相关技术使用权,并在同一协议中引入Groq创始人Jonathan Ross和总裁Sunny Madra。需要说明的是,Groq与SpaceX的AI模型Grok并非同一主体;前者长期专注于面向推理、而非训练的处理器开发。

NVIDIA CEO Jensen Huang表示,公司已通过Grace Blackwell和NVL72平台,在AI推理性能与效率方面实现创新。随着AI进入代理时代,Vera Rubin将进一步针对相关工作负载优化AI工厂形态,而LPX则把超高速token生成能力扩展到新的水平,推动AI在吞吐、效率和响应速度上的又一次跃升,并改变智能生成的方式。

Nebius Group是决定部署Groq 3 LPX的早期企业之一。该公司计划将这一芯片用于其生产级推理平台“Nebius Token Factory”,面向对响应速度要求较高的AI代理应用提供高速token生成能力。

Nebius CTO Danila Shtan表示,生成阶段决定了AI系统的实际响应速度,而Groq 3 LPX正是围绕这一环节的加速需求设计。Nebius Token Factory作为率先实现商用的AI云之一,将使AI代理循环中的每一步都更接近实时响应。

此外,NVIDIA还在Hot Chips活动上宣布,已将SpaceX纳入新的代表性客户名单。SpaceX计划围绕Vera Rubin平台构建下一代AI架构,并将在从地面数据中心到轨道卫星的CPU密集型编排、工具执行和仿真任务中部署NVIDIA Vera CPU。

与此同时,NVIDIA还公布了多项面向AI工厂的配套技术,包括:可支持集群扩展至最多51.2万块GPU的AI优化以太网架构Spectrum-X Multiplane;可将安全、网络和数据管理从主机计算节点卸载并加速的基础设施软件平台NVIDIA Scale-in;以及用于将定制CPU和数据处理设备连接至第六代NVLink机架系统的NVIDIA NVLink Fusion。

关键词

#NVIDIA #Groq 3 LPX #Vera Rubin #NVL72 #AI代理 #推理加速器 #LPU #Gemma 4 31B #Hot Chips 2026 #Nebius Group
版权所有 © DigitalToday。未经授权禁止转载或传播。