A.X K2与全体参评者平均分的各题得分对比图

SK Telecom面向政府主导的本土基础模型项目研发的A.X K2,近日在多项衡量AI数学推理能力的评测中取得亮眼成绩。

据SK Telecom介绍,A.X K2先是在国际数学奥林匹克竞赛IMO 2026相关测试中获得达到金牌线的成绩,随后又在开源AI平台Hugging Face的MathArena AIME 2026榜单上并列榜首。

在IMO 2026六道题的测试中,A.X K2在满分42分中获得29分,达到金牌水平。SK Telecom表示,今年IMO金牌线为29分。

公司称,在去年的IMO测试中,Google DeepMind的Gemini Deep Think和OpenAI相关模型均获得35分,达到金牌线;而在今年IMO测试中,中国RedNote的dots-note-3.0获得42分满分,A.X K2紧随其后。SK Telecom强调,截至目前,除美国和中国外,尚无其他地区开发的模型达到IMO 2026金牌线。

除IMO外,A.X K2还在KMO 2026第二轮考试中取得满分。上一代模型A.X K1则曾在KMO第一轮考试中,创下韩国本土自研模型的最高成绩。

在评估高难度数学推理与解题能力的MathArena AIME 2026榜单中,A.X K2以97.1%的准确率并列第一。

SK Telecom表示,这一成绩与由前OpenAI CTO Mira Murati创办的Thinking Machines Lab推出的开放式AI模型Inkling持平。

公司还指出,A.X K2在与多款全球开放权重模型的同场比较中,同样展现出突出的数学推理能力。其中,中国初创公司StepFun的Step-3.5-Flash以96.67%排名第三,Moonshot AI的Kimi-K2.6以96.4%排名第四。

SK Telecom认为,AI模型在数学推理方面的表现,不仅反映其解题能力,也可作为衡量复杂任务处理能力的重要参考指标。国际AI安全报告(International AI Safety Report)指出,数学推理能力的提升有助于安全关键型软件验证、复杂科学问题求解,乃至推动AI研究本身;数学能力越强,AI在财务、制造流程等需要多步骤精密计算的产业场景中,就越有可能输出更可信、更高效的结果。

上月29日,SK Telecom正式发布A.X K2,并提出推动AI在公众日常生活和产业一线全面应用的目标。公司介绍称,A.X K2参数规模达6880亿(688B)参数,较此前参数规模为519B的A.X K1进一步扩大,并强化了数学、科学推理以及韩语知识理解和长文本推理能力。

SK Telecom表示,后续将基于A.X K2,进一步升级其在制造、国防、生物等领域已挖掘出的基础模型应用案例。在日常生活场景中,公司已将A.X K2轻量模型应用于SKT的A.Dot服务,并计划参与韩国科学技术信息通信部推进的“AI全民化”项目。

关键词

#SK Telecom #A.X K2 #基础模型 #数学推理 #IMO 2026 #MathArena AIME 2026 #Hugging Face #A.X K1 #A.Dot #韩国科学技术信息通信部
版权所有 © DigitalToday。未经授权禁止转载或传播。