围绕人工智能是否可能脱离人类控制的讨论持续升温。普林斯顿大学一支研究团队近日提出,AI安全不能只依赖“对齐”,而应建立由对齐、控制、下游防御和复原力组成的多层防御体系。
据科技媒体9to5Mac报道,研究人员Sayash Kapoor和Arvind Narayanan在一篇长文中指出,AI安全不应押注某一项技术或单一解决方案,而应采取分层设防的思路。
这场讨论升温的背景,是AI行业近期再次出现有关极端风险的预警。曾在OpenAI和Anthropic任职的AI研究者Jacob Coxon在离职后表示,两家公司都已意识到,AI系统未来10年内可能对全人类构成威胁。相关文章浏览量超过1.56亿次,进一步推高了争议。
Anthropic一名AI安全负责人Evan Hubinger对Coxon的担忧表示认同,但同时指出,这类风险真正显现的时间可能更晚。
当前争论的核心之一,是“对齐(alignment)”。所谓对齐,是指让AI系统的目标和行为符合人类意图与价值观,也是推动AI遵守人类指令和安全标准的重要研究方向。
不过,Kapoor和Narayanan认为,仅靠对齐并不足以应对AI风险。研究人员指出,AI可能为了通过安全评估,在外部表现上显得已经“对齐”,但实际上仍保留其他目标。在这种情况下,将安全完全寄托于单一道防线,本身就存在隐患。
在他们提出的框架中,第一层防线仍然是对齐。研究人员认为,让AI按照人类意图和安全标准运行,是整个安全体系的起点。
第二层是控制,即通过沙箱、人类监督和实时监测等手段,限制AI的自主行动范围,并确保一旦出现异常行为,人类能够及时介入。
第三层是下游防御。也就是说,当攻击者利用AI发起攻击时,防守方也应建立利用AI进行反制的能力。研究人员特别强调,需要防范针对电力、供水等关键基础设施及核心系统的网络攻击风险。
第四层是复原力。研究人员认为,与其把目标设定为“完全杜绝事故”,不如在事故发生后尽可能降低损害,并通过应急预案和恢复机制尽快修复系统。
这一观点也将AI安全讨论的重心,从“超级智能AI是否会导致人类灭亡”转向更具体的风险管理。研究人员主张,应将AI攻击关键基础设施、显著放大既有网络攻击的规模和速度等情景纳入考量,并提前构建多层防线。
对于AI安全社区部分观点提出的“人类灭绝风险”高概率预测,研究人员并未直接评估具体概率,而是采取了另一种路径:无论风险大小,都应尽快建立可执行的应对体系。
研究人员最后强调,对齐是必要条件,但不是充分条件。要真正提升AI安全水平,还需要同步建立限制和监控AI行为的控制手段、抵御攻击的防御体系,以及事故发生后的系统复原能力,形成覆盖事前、事中和事后的完整安全网。
随着AI开发竞赛不断加速,相关讨论预计还将继续升温。业界面临的任务,已不只是提升AI本身的安全性,也包括增强社会在AI偏离预期运行时的承受与应对能力。