韩国KAIST宣布,电气与电子工程系Noh Yong-man教授团队开发出两项多模态AI技术,分别用于提升模型对传感器数据的理解能力,以及降低不同感知信息相互干扰所引发的“幻觉”问题。
随着多模态AI逐步从文本、图像扩展到语音及各类传感器数据,模型在真实环境中的应用需求不断上升。不过,现有部分模型仍难以准确区分不同传感器的特性,也可能将某一种感知渠道获取的信息误判为已被其他渠道印证,进而输出错误答案。
针对这一问题,研究团队提出了两项方案。第一项是名为“DNA”的传感器理解优化方法,重点提升模型对热成像、深度图、X光等传感器数据所对应物理信息的理解能力。
研究团队表示,现有AI在处理热成像画面时,可能会把亮区误解为普通照片中的光照变化,而非高温区域。为此,团队围绕模型的高频错误场景进行了针对性优化训练,使其能够更准确地区分温度、距离等由传感器采集的物理信息。借助这一方法,AI即使处于黑暗、烟雾等普通相机难以识别目标的环境中,也能结合多种传感器数据更准确地完成识别。
第二项技术为“MAD”,主要用于减少视觉与听觉信息混淆所带来的“幻觉”现象。该方法可在模型作答前,先判断当前任务应主要依赖视频信息还是音频信息,再将注意力集中到相关性更高的模态上。KAIST称,这一方案无需从头重新训练模型,即可有效降低感知混淆和“幻觉”发生概率。
研究团队介绍,DNA可在较少数据条件下提升模型对多类传感器数据的理解能力;MAD则采用可直接附加至现有AI模型的设计思路,部署门槛相对较低。团队预计,相关技术可应用于自动驾驶汽车、救援机器人、热成像无人机等工业场景,也有望扩展至需要同时分析多种医学影像的医疗AI领域。
Noh Yong-man表示,多模态AI若要在真实环境中可靠落地,关键在于准确理解不同传感器的特性,并避免混淆来自不同感知渠道的信息。此次团队在无需大规模重新训练的前提下,降低了模型的感知偏差和“幻觉”问题,为可在工业现场实际使用的多模态AI奠定了基础。
此次两项研究中,KAIST电气与电子工程系博士生Jeong Sang-yun担任共同第一作者;Yu Young-jun为DNA研究的共同第一作者。
其中,MAD研究已于今年6月在国际计算机视觉与模式识别会议(CVPR)发布;DNA研究则发表于国际期刊《IEEE Transactions on Image Processing》。
本次研究获得韩国信息通信企划评价院(IITP)“以人为中心的人工智能核心源泉技术开发”项目,以及国防科学研究所人工智能特化研究中心课题等支持。