NVIDIA表示,真正的AI Agent,是在接到任务后能够连续自主工作12小时的AI系统,而不是仅在用户提问时给出答案、再等待下一轮指令的对话式AI。
29日,在首尔江南区COEX举行的Digital Insight 2026大会上,NVIDIA Korea常务董事 Kim Sun-wook 表示,Agent在接收任务后,可以连续自主运行5小时,甚至12小时。
他指出,Agent并不是单一模型,而是需要调动多种工具和执行要素协同工作。“只有在编排(orchestration)框架下运行的系统,才是真正的Agent。”
Kim Sun-wook 说,企业已经开始积极寻找运行这类Agent所需的基础资源。近期,围绕“算力不足时能否租用计算资源”的咨询明显增加,这反映出企业对Agentic AI的使用和部署需求正在升温。
在他看来,Agent的基本结构可以概括为“LLM+harness”。其中,LLM相当于负责理解语言的“大脑”,harness则承担连接、调度和执行的作用。它不仅会基于用户历史记录优化提问方式,还负责连接文件、电脑和各类工具,代替用户执行具体操作。至于作为“大脑”的LLM,则可根据计算环境选择不同方案,包括NVIDIA、Google等提供的方案。
在这一架构中,harness主要运行在CPU上。Kim Sun-wook 表示,LLM运行在GPU上,而harness大多依赖CPU,因此CPU的重要性正在明显上升。与此同时,Agent训练模式的变化,也进一步提高了CPU所承担的比重。
他解释称,过去训练重点更多放在LLM本身,如今则正转向Agent训练。系统需要对Agent的执行结果进行反馈,并将这一过程重复数万次,而这一环节主要由CPU承担。这也是NVIDIA推出独立CPU机架的原因之一。NVIDIA目前采用的是自研Arm架构CPU“Vera”。
对于CPU难以完全覆盖的存储安全、数据处理等任务,则由DPU(Data Processing Unit)分担。Kim Sun-wook 介绍,DPU是NVIDIA将过去由CPU承担的一部分数据处理任务拆分后推出的芯片,可通过高性能网络接口完成数据解析和处理,并将数据高效传输至GPU和CPU。
除了芯片分工外,Agent持续运行还离不开内存支持。Agent会将任务内容和历史信息加载到内存中,并在此基础上运行。Kim Sun-wook 表示,人类之所以擅长很多事情,是因为从小持续积累记忆,因此内存对Agent同样“非常重要”。
不过,即便CPU、GPU、DPU等硬件齐备,Agent系统也不会自动拼接成形。他表示,目前市场上既有专注模型开发的公司,也有专门做harness的公司,原因正在于两者分工不同。为帮助客户整合各类组件,NVIDIA提供了一套Agent工具组合,涵盖自研LLM“Nemotron”、数据加速库以及安全组件等。用户既可以直接采用这些组件,也可以替换为其他模型。“只要替换最擅长的那一部分,就能得到不同结果。”
Kim Sun-wook 强调,NVIDIA将Agent视为一个基础设施问题。只有将CPU、GPU和存储服务器整合为一套完整基础设施,Agent才能稳定运行。而驱动这套基础设施的核心是电力。按他的说法,Agent运行最终会受到能源供给约束,“投入多少电,产出多少token,本质上就是成本问题”。
他还表示,NVIDIA所展望的下一阶段是机器人。由于机器人相当于“会移动的人”,对Agent带来的负担更重,因此也需要构建更复杂的系统。