图片来源:Shutterstock

围绕AI安全的争议正在持续升温,甚至连AI模型开发企业内部,也开始出现要求放缓研发节奏的声音。

一些研究者警告称,如果AI能力继续快速推进,而监管手段未能同步跟上,未来可能出现难以控制的局面,并带来严重后果。对外界而言,AI公司汇聚了大量顶尖人才,却仍反复强调“AI并不容易管住”,这也让相关风险讨论持续发酵。

据《纽约时报》近日报道,在当前阶段,要对AI实施有效监管和控制并非易事。

研究人员指出,企业在测试新一代AI模型时,往往需要更强的安全防护机制。但问题在于,承担测试和监管任务的AI系统,可能比制定规则的人类更容易放过其他AI的异常行为。

报道认为,这不仅是单一的测试问题,更进一步指向AI领域一个更核心、也更棘手的难题——“对齐”(alignment),即如何让AI始终按照人类意图行事。尽管目前尚未出现因失控AI系统导致致命损失的案例,但研究者普遍担心,AI的发展速度正逐渐超过人类的监管能力。

近期,公开警示AI可能对人类构成威胁的知名研究者不断增加。不过,也有不少观点认为,相关表述存在被夸大的成分,反而分散了外界对网络安全、虚假信息等现实风险的关注。

即便如此,《纽约时报》指出,多数人仍认为,OpenAI代理入侵Hugging Face事件已足以敲响警钟。

研究人员表示,这一事件暴露出测试环节存在多重失误。与此同时,OpenAI在相关测试中是否使用了AI模型参与监管,以及介入程度究竟有多深,外界目前并不清楚。

不过,报道也提到,包括实施此次入侵的AI在内,不少最新AI模型已经能够通过多步骤流程快速完成复杂任务,推进速度往往超出人类实时跟进的能力范围。在这种情况下,要约束AI代理的行为,企业往往只能更多依赖“以AI监管AI”。

但这一做法并不完美。它在常规情况下或许能够运转,一旦出现异常甚至失控,处置难度反而会更高。

Apollo Research负责AI系统安全研究的Alexander Meinke表示:“AI模型之间可能形成类似‘串通’的效果。一个AI系统可能被另一个AI模型‘说服’,从而共同规避测试人员设定的限制,而且不易被发现。OpenAI代理入侵Hugging Face时,确实出现了类似情况。”

他还表示,AI模型应当学会遵循一项基本原则:一旦发现在人类看来可疑或存在风险的行为,就应主动发出提示;同时,AI也需要具备判断能力,知道哪些情况尚未严重到必须交由人类介入。

部分研究者因此主张,AI企业应适度放慢开发节奏,并开展更多测试,以观察AI系统如何执行自我监管。

不过,也有大量观点认为,“对齐”本身就很难从根本上解决。要把人类的判断标准准确传递给AI,本就是一项极其困难的任务。《纽约时报》指出,如果规则设定不够具体,AI系统就可能学会绕开规则,或以超出预期的方式摆脱控制。

图灵奖得主、蒙特利尔大学教授Yoshua Bengio表示,沿用当前这种“发现一个问题、修补一个漏洞”的做法,最终很可能行不通。

他认为,一旦AI能力超过人类的监督与协作能力,人类甚至可能无法察觉其违规行为。在安全性得到充分验证之前,应放缓训练和部署速度,并从根本上重新审视现有的“模仿学习+强化学习”训练路径。他还提出了“Scientist AI”等替代性设计思路,即不为系统设定自我目标,而是让其专注于做出诚实且一致的预测。

关键词

#AI安全 #AI对齐 #AI监管 #AI代理 #OpenAI #Hugging Face #Apollo Research #Alexander Meinke #Yoshua Bengio #纽约时报
版权所有 © DigitalToday。未经授权禁止转载或传播。