Lee Junbeom,Rabbleup研究员(图片来源:DigitalToday)

“多个模型组合使用,已经是生成式AI服务中的日常,只是用户未必能直接感知。”

Rabbleup研究员Lee Junbeom在接受采访时表示,当前生成式AI服务内部普遍采用不同规模模型分工协作的方式:检索、信息收集、摘要等相对简单的任务,通常交由小型模型处理;关键判断以及内容生成,则由前沿大模型承担。

他以代码智能体为例称,读取文件、联网搜索等信息收集工作可以由最小规模的模型完成;在此基础上进一步分析返回信息,或编写关键代码等任务,则由更大模型负责。

Lee Junbeom指出,随着智能体应用日益普及,这种分工的必要性还在进一步上升。在“查找—阅读—判断—行动”的链路中,AI会反复调用模型。如果所有环节都使用性能最强的模型,推理成本将迅速攀升。

公开资料显示,Lee Junbeom长期从事韩语自然语言处理(NLP)和开源语言模型研究,曾开发KoAlpaca、Gemma-KO等韩语开源模型。近期,他的研究重点已扩展至小型模型、智能体以及推理效率优化。

在他看来,小型模型与开源模型并不是同一概念。前者主要按模型规模和计算量划分,后者则是指向外部开放模型权重等内容、可供外部使用的模型。换言之,开源模型中既有小模型,也有大模型。

Lee Junbeom还表示,小型模型的发展方向也在发生变化。近期市场需求正从“知识”转向更强调“智能”,因此,小型模型正在更多依靠网页检索、阅读指定文档并基于文档作答等方式提升能力。

不过,在无需额外训练的情况下适配新工具或新任务,小型模型目前仍弱于大模型。为弥补这一短板,Lee Junbeom去年研究了“MCP Sidecar sLM”。当时,小型开源模型还难以熟练使用模型上下文协议(MCP),其团队因此在主模型之外增加了一个独立的小型模型,专门学习MCP的使用方式,以辅助工具调用。

他说,这一方案的核心思路,是增加一个更小、但能够理解MCP的模型,承担“侧助”角色。

随着此后发布的开源模型陆续具备MCP和工具调用能力,这项研究的紧迫性有所下降。但他同时指出,当新工具或新接口出现时,与重新训练整个模型体系相比,通过外挂一个负责新能力的小型辅助模型来更快响应,依然是可行路径。

对于“小型模型将取代前沿大模型”的观点,Lee Junbeom并不认同。他表示,自2018年以来,“规模化(scaling)规律”并未被打破,模型越大、整体越聪明的趋势依然成立。

他进一步解释称,虽然同等规模模型受益于数据和训练方法进步,较数年前已具备更高性能,但若以同一时间点的最新模型作比较,仍然是大模型的整体智能水平更高。

在开源模型阵营,模型持续做大也已成为近期的显著趋势。过去,千亿至两千亿参数通常已被视为大模型;而近期,参数规模达到万亿级的模型也开始出现。Lee Junbeom预计,随着前沿大模型继续扩大规模,围绕不同任务拆分流程、配置不同尺寸模型的使用方式,也会得到更广泛应用。

这一变化也反映在企业AI基础设施需求上。Lee Junbeom表示,过去市场需求更多集中在预训练或训练阶段,但近期推理和强化学习相关需求明显上升。企业关注点也不再停留在是否部署GPU基础设施,而是进一步评估在现有基础设施上能运行哪些模型、可支撑多少用户,以及能够提供怎样的服务速度。

在企业场景中,“小型模型”的标准也会随环境变化而不同。在个人PC或智能手机上,数十亿参数级模型通常就可被视为小型模型;但在企业环境中,数百亿至数千亿参数规模的开源模型,也可能被归为相对“小”的模型。Lee Junbeom以NVIDIA个人AI超级计算机“DGX Spark”单机可运行的模型规模为例称,这一能力范围可作为本地环境部署模型时的参考尺度。

他还指出,训练阶段更依赖多GPU、多服务器之间的高速通信;而到了推理阶段,关键则在于是否拥有足够内存以应对并发用户请求,以及如何管理键值(KV)缓存。近期,他也在研究扩散式语言模型,希望通过基于扩散方法一次生成多个token,进一步提升推理速度。

关键词

#Rabbleup #多模型协同 #智能体 #小型模型 #前沿大模型 #推理成本 #开源模型 #MCP #KV缓存(键值缓存) #GPU基础设施
版权所有 © DigitalToday。未经授权禁止转载或传播。