Qualcomm高级副总裁Chris Patrick在Snapdragon Summit 2026发表主题演讲。图片来源:Qualcomm

【美国茂宜岛(毛伊岛)】Qualcomm正试图突破端侧AI在手机内存上的限制。通过让数据尽量贴近计算单元的架构设计,该公司把可在智能手机本地运行的AI模型规模提升至300亿参数,并将这一思路进一步扩展到CPU等更多核心模块。

在当地时间22日举行的Snapdragon Summit 2026主题演讲上,Qualcomm高级副总裁、移动业务负责人Chris Patrick表示,随着AI智能体能力提升,其对大模型的依赖也在增强,尤其需要更强的推理能力和更大的上下文窗口。

他解释称,智能体若要代替用户完成任务,往往需要进行多步推理、检索相关上下文并调用各类工具,因此模型规模和可处理的上下文长度都必须同步提升。

本次大会上,Qualcomm发布了新一代旗舰移动平台Snapdragon 8 Elite第六代。按照该公司的说法,新平台可在手机端运行300亿参数AI模型,核心思路是按需从闪存调入所需参数,同时把高频使用的数据尽量保留在NPU内部。Qualcomm称,Hexagon NPU的共享内存较上代提升50%。

Qualcomm此前在媒体沟通中曾提到,已注意到行业普遍面临的内存瓶颈,并围绕“让数据更靠近计算单元”持续推进架构创新。从本次公布的方案看,其重点之一就是进一步提升NPU内部可用内存容量,让更多上下文和KV缓存停留在Hexagon NPU的共享内存中。KV缓存可理解为模型为避免重复计算已处理内容而保留的临时记忆。

Qualcomm表示,更多数据保留在NPU内部后,可减少与外部DDR之间的数据往返,从而降低时延。新引入的Element Accelerator支持最高3.2万token上下文窗口。公司还称,部分模型的Prefill阶段——即模型首次读取输入内容的阶段——性能最高可提升80%。

除NPU外,Qualcomm还将专家混合架构(MoE)与闪存结合使用。MoE会把模型拆分为多个“专家”模块,每次仅激活与当前请求相关的部分。相较于每一步推理都调用大部分网络参数的稠密模型,这种方式可以降低实际计算量和内存带宽压力。

按照Qualcomm的说法,在每次生成token时,该模型只会激活全部参数中的约30亿个,并结合UFS 5.0和自研智能闪存管理系统,实现模型按需从闪存加载运行。

主题演讲现场,Qualcomm还展示了一段基于该模型运行的智能体演示。演示中,智能体读取大会邀请函后,识别出日期、航班和地点信息,并自动生成一份为期3天的行程安排,内容涵盖欢迎晚宴相关出行与入住、第二天的会议安排,以及第三天的主题演讲和展位接待。Qualcomm表示,在理解、推理和执行等不同阶段,MoE架构会调用不同的专家模块。

Qualcomm称,上一代架构尚无法运行300亿参数以上的MoE模型。此次新平台在优化NPU结构的同时,新增Element Accelerator,并进一步扩大NPU内部内存容量。其整体方案是根据数据特性,分别将其放置在NPU内部、DRAM和闪存之中,以在扩大模型规模的同时兼顾响应速度。Qualcomm认为,这一架构将为手机端生成式AI在快速响应与隐私保护之间取得平衡提供基础。

“让数据靠近计算单元”的思路也被引入到CPU设计中。Qualcomm希望借此支撑游戏、视频编辑和多任务处理等对数据搬运效率要求较高的负载。Chris Patrick表示,新一代Oryon CPU配备的FlexCache可为8个核心提供共享池化L2缓存,并按需动态分配资源;当AI智能体在不同CPU核心之间切换任务、执行推理和调用工具时,FlexCache可帮助提升切换效率。

关键词

#Qualcomm #Snapdragon Summit 2026 #Snapdragon 8 Elite #Hexagon NPU #端侧AI #300亿参数模型 #MoE #UFS 5.0 #KV缓存 #Oryon CPU #FlexCache #Element Accelerator
版权所有 © DigitalToday。未经授权禁止转载或传播。