SelectStar标识。

SelectStar 9月28日表示,公司研究人员参与的5篇AI可信与安全相关论文已获自然语言处理领域国际会议EMNLP 2026接收。

上述论文包括1篇主会论文、1篇Findings论文和3篇研讨会论文。EMNLP 2026将于10月24日至29日在匈牙利布达佩斯举行。

其中,入选主会的论文提出了一种新的评估方法。该方法不仅判断AI回答是否正确,还会在模型答错时,分析其错误选项是否与人类呈现出相近的选择模式。研究通过对比人类与大语言模型(LLM)在答对和答错情况下的作答分布,评估AI与人类判断模式的相似程度。

入选Findings的论文则围绕用于过滤有害请求的“守护模型”展开,重点分析其判断可靠性。研究发现,部分守护模型在判断存在不确定性时,仍会给出高置信度结论,从而可能引发误判。SelectStar表示,计划将相关研究结果应用于AI护栏优化,减少AI服务中的过度拦截。

3篇研讨会论文中,2篇聚焦金融场景,1篇关注跨文化语境下的AI安全。两篇金融方向研究分别讨论了如何在不削弱现有防护能力的前提下优化AI护栏,以及如何通过联合分析多个网页识别金融钓鱼网站。

SelectStar表示,计划将此次研究成果应用于AI评估平台Datumo,以及红队测试和AI护栏等技术能力建设,进一步提升面向不同国家和行业的AI安全评估能力。

SelectStar CEO Kim Se-yeob表示,公司将推动研究成果与评估、红队测试及护栏技术结合,逐步构建可应用于真实服务环境的AI可信验证体系。

关键词

#SelectStar #EMNLP 2026 #AI可信与安全 #大语言模型(LLM) #守护模型 #红队测试 #金融反钓鱼
版权所有 © DigitalToday。未经授权禁止转载或传播。