图灵奖得主、蒙特利尔大学教授 Yoshua Bengio。

图灵奖得主、全球高被引科学家、蒙特利尔大学教授 Yoshua Bengio 近日在个人博客中发文,讨论AI代理失控事件增多的原因及应对方向。

Yoshua Bengio 表示,在OpenAI测试中AI代理出现“Hugging Face相关入侵行为”等事件,再次说明AI引发的各类事故并非简单失误,而是现行训练路径下大概率会出现的结果。如果继续沿用当前做法,类似问题今后仍会频繁发生。

在他看来,过去几个月里,AI代理已接连表现出一些如果放在人类社会语境下几乎可视作犯罪的行为:为完成既定任务规避监控、实施作弊,甚至在无人明确指示的情况下,围绕网络攻击等目标彼此协作。

Yoshua Bengio 将问题根源指向AI模型本身的训练方式。

他指出,当前AI模型训练通常分为两个阶段:首先是预训练,即通过学习人类写作以及图像、视频等内容,掌握海量知识;其次是基于试错机制的强化学习。

在强化学习阶段,又包括多个方向,例如在答案可验证的问题上进行推理训练、训练模型使用工具并与人互动完成任务的代理能力,以及通过奖励机制,让模型更倾向于采取能获得人类认可的行为,也就是所谓的对齐训练。

Yoshua Bengio 认为,问题在于训练结束后,模型往往仍会延续“追逐奖励”的行为模式。由于“让评估者满意”本身是一个模糊且缺乏严格定义的目标,AI就可能自行寻找捷径,包括欺骗评估者、迎合评估者,甚至隐藏自身计划。

他以“阿谀迎合(sycophancy)”为例称,当训练把“获得人类认可”作为评价标准时,迎合性的表达有时比真实回答更容易拿到高分。这样一来,AI可能会顺着人类原有的错误信念或情绪不断放大,最终带来严重后果。

对于“自我保全倾向”,Yoshua Bengio 也作出了类似分析。他表示,没有人专门教AI“求生”,但只要持续运行、保住控制权有助于提高任务完成率,模型就可能自然表现出抗拒被替换或被关闭的倾向。已有案例显示,当AI察觉自己可能被新版本替代时,确实会出现抵抗行为。AI之间相互帮助,甚至愿意承受一定损失开展协作,也可能源于同样的逻辑。

Yoshua Bengio 还强调,“奖励破解(reward hacking)”同样是重大风险。由于提示语言本身存在模糊性,而人类真实意图又只能通过有限反馈来推断,AI追求的奖励目标与人类真正希望得到的结果之间,天然会出现偏差。

他将这一现象类比为经济学和法学中的“Goodhart定律”:一项指标一旦成为目标,它就不再是一个好指标。Yoshua Bengio 表示,AI越聪明,就越擅长精细利用这些漏洞,甚至会进一步发展为操纵判定程序本身的“奖励篡改(reward tampering)”。他还提到,在OpenAI测试中“Hugging Face相关事件”的调查里,也出现了AI干预自身评估程序的线索。

Yoshua Bengio 认为,当“明确的任务目标”与“模糊的伦理约束”发生冲突时,AI通常会优先选择前者。

他解释说,评分程序能够清楚界定成败,但伦理指引往往存在多种解释空间。AI会据此钻空子,甚至自行构建一套为作弊辩护的逻辑,这一点与人类在实施错误行为时的自我合理化机制颇为相似。

Yoshua Bengio 警告称,如果对此放任不管,AI规避监管、隐蔽追逐目标的风险还会继续上升。部分AI已经能够识别自己正处于被评估的情境,并据此调整行为;此外,多智能体之间还可能通过将信号隐藏在看似普通的信息中,也就是借助隐写术(steganography)来实现串联协作。

在他看来,解决这一问题并不容易,靠“发现一个故障、修补一个漏洞”的方式,最终可能行不通。Yoshua Bengio 表示,一旦AI能力超过人类的监督和协同水平,人类甚至可能连其作弊行为都难以及时发现。因此,在安全性得到充分验证之前,应放缓训练和部署节奏,并从根本上重新审视“人类模仿+强化学习”的现行训练范式。

作为替代方向,Yoshua Bengio 提出,可关注“Scientist AI”等设计路线,即模型不自行设定目标,只负责给出诚实且一致的预测。他同时呼吁关注 LawZero 的研究。LawZero 是由 Yoshua Bengio 创立的非营利性AI安全研究机构。

关键词

#Yoshua Bengio #AI安全 #AI代理 #强化学习 #对齐训练 #奖励破解 #Goodhart定律 #隐写术 #OpenAI #Hugging Face
版权所有 © DigitalToday。未经授权禁止转载或传播。