MIT电气工程与计算机科学系教授 Kim Yoon-hyung。图片来源:SK Telecom

有观点认为,要在国家层面建立“主权AI”竞争力,关键在于培养能够实际开发并运营大规模AI系统的研究人员和工程师。

SK Telecom Newsroom于6日披露,SK Telecom正与美国麻省理工学院(MIT)开展联合研究,开发提升自研AI基础模型推理性能和算力效率的相关技术。

参与该项目的MIT电气工程与计算机科学系教授 Kim Yoon-hyung 认为,“主权AI”的核心竞争力,归根结底在于人才以及大规模系统的运营经验。

他表示,算力可以通过资金投入获得,数据中心也可以建设,但大规模系统的实际开发和运维经验需要长期积累,难以在短时间内形成。

Kim Yoon-hyung 进一步指出,当前AI性能在很大程度上取决于能否将相对简单的算法进行大规模扩展。因此,培养具备大型系统开发与运维能力的研究人员和工程师尤为重要。

在他看来,AI已经成为国家安全层面的关键要素,各国建设独立AI生态也是顺理成章的发展方向。不过,如果过于强调“主权”本身,也可能带来超出合作必要范围的过度竞争。

从这一角度看,SK Telecom与MIT的此次合作,不仅着眼于提升自研基础模型的技术竞争力,也有助于积累大规模系统的运营能力。

双方此次研究的重点是“推理时训练”(Test-Time Training,简称TTT)。这项技术是指,已部署的AI模型在回答特定问题之前,先基于相关资料进行短时追加学习,再生成答案。

通常情况下,语言模型在完成预训练后会以固定参数状态投入使用;而TTT则是在推理过程中调动部分算力,对模型能力进行即时补强,从而提升输出效果。

Kim Yoon-hyung 表示,过去几年AI性能的提升主要依赖于扩大预训练规模,而近期研究表明,在生成答案的推理阶段投入额外计算资源,同样能够带来性能改善。

他解释称,TTT的出发点在于:能否让模型把一部分计算资源用于解决当前面对的具体问题。换言之,这是一种将推理阶段算力直接转化为实际性能提升的技术路径。

相关研究还聚焦于让AI代理以更低成本、更高准确度理解长上下文。对此,Kim Yoon-hyung 将长上下文理解能力划分为两个层面:一是从海量文本中找到所需信息的信息检索能力,二是把握整篇文档逻辑关系的全局整合能力。

他指出,目前AI模型在长文档中的检索任务上表现相对较好,但在识别前后内容冲突、理解全文逻辑一致性等需要整体整合的任务上,能力仍显不足。

他强调,即便模型在理论上可以处理100万个token,也未必意味着其真正具备对长上下文的“整合式理解”能力。若要开发真正实用的AI代理,仍需构建能够深度理解长上下文的系统。

SK Telecom预计,此次联合研究成果可用于提升公司近期公开的自研AI基础模型“A.X K2”的推理性能。

近期研究显示,在推理阶段增加计算投入,能够在数学解题等推理类任务上持续提升大语言模型性能。引入TTT后,模型既可以在相同推理算力下获得更高性能,也可以在更低成本下实现既定性能目标。

Kim Yoon-hyung 表示,此次联合研究将开发的TTT技术,有望显著改善SK Telecom自研基础模型在推理算力投入与性能产出之间的效率。

他还表示,推动AI实现跨越式进步,需要学界对新可能性的探索,与企业将技术落地到实际场景的能力形成结合,而SK Telecom与MIT的合作有望成为这一模式的示范案例。

谈及韩国自研AI基础模型相关项目时,Kim Yoon-hyung 建议,与其优先关注是否提出了全新的想法,不如先评估与全球领先模型之间的性能差距究竟缩小了多少。

他表示,在后续评估中,更合理的做法是参考全球领先模型开发方实际采用的核心基准,并提高对“差距缩小幅度”的权重。因为缩小与现有前沿模型的差距,本身就意味着具备了在大规模环境中正确执行既有技术和开发方法的能力。

关键词

#SK Telecom #MIT #主权AI #自研基础模型 #推理性能 #算力效率 #Test-Time Training #TTT #大语言模型 #A.X K2 #AI代理
版权所有 © DigitalToday。未经授权禁止转载或传播。