搜索关键词 盲评
AI & Enterprise
韩国独立AI基础模型项目第二阶段评分明细公布:Motif总分仅落后LG AI Research 3.2分
韩国科学技术信息通信部公布“独立AI基础模型”项目第二阶段评分明细。SK Telecom以70.6分位居第一,Upstage、LG AI Research和Motif分别为69.9分、69.0分和65.8分。尽管Motif在基准测试中拿下最高分,但因专家评审和用户评测得分偏低,最终无缘下一阶段,并就评测结果提出异议。
AI & Enterprise
Motif Technologies质疑韩国“独立AI基础模型”第二阶段评估结果,要求公开评分细则并复核
Motif Technologies已就韩国“独立AI基础模型”项目第二阶段评估结果提出异议,并向韩国科学技术信息通信部申请公开各分项得分、评分标准及折算依据,同时要求启动复核。该公司表示,自研模型Motif 3在AAII中获得47分,为参评模型最高,但在第二阶段评估中得分垫底,未能入围。
AI & Enterprise
斯坦福法学院研究:AI在盲评中整体评分高于法学教授
斯坦福大学法学院一项研究显示,在由美国法学院教授参与的匿名盲评中,AI生成的合同法课程答复整体评分高于人类教授答复,在一对一比较中胜出比例约为75%。在“教学有害性”指标上,AI答复被认定可能妨碍理解或引发误解的比例仅为3.5%,低于人类答复的约12%。研究认为,这表明AI有望成为提供高质量、个性化学习支持的辅助工具。