搜索关键词 数学推理
AI & Enterprise
SK Telecom基础模型A.X K2数学推理评测跻身全球第一梯队
SK Telecom自研基础模型A.X K2近日在多项数学推理评测中取得亮眼成绩:在IMO 2026六道题测试中获得29分,达到金牌线;在MathArena AIME 2026榜单中以97.1%的准确率并列第一。公司表示,数学推理能力可视为衡量复杂任务处理能力的重要参考指标,后续将推动A.X K2在产业和日常生活场景中的应用落地。
AI & Enterprise
“AI IQ”上线:用单一分数比较GPT-5.5、Gemini和Claude等模型
工程师兼创业者Ryan Shay推出“AI IQ”项目,将多项公开基准成绩换算为“估算IQ”并汇总为单一分数,用于比较GPT-5.5、Gemini、Claude等主流模型。该项目还提供时间趋势、厂商分组和成本测算等视图,但以单一分数概括模型能力的做法也引发争议。
AI & Enterprise
美NIST旗下CAISI评测:DeepSeek V4 Pro接近GPT-5水平,与美国最新头部模型仍差约8个月
美国国家标准与技术研究院(NIST)旗下CAISI发布评测报告称,DeepSeek V4 Pro目前在中国同类模型中表现最强,但按综合表现判断,与美国最新头部模型相比仍有约8个月差距。报告显示,该模型综合评分较Kimi K2.5高约200分;在成本效率方面,较OpenAI GPT-5.4 mini高出41%至53%。