曾在Google DeepMind负责通用人工智能(AGI)安全与AI对齐研究的Bilal Chughtai,日前在离职后公开就超智能AI风险发出警告。
据在线媒体GigaZine当地时间16日报道,Bilal Chughtai认为,未来数年内,可能会出现一种在几乎所有领域都超过人类能力的超智能AI;如果对齐失败,这类系统甚至可能脱离人类控制。
Bilal Chughtai回顾称,自己从2022年初开始参与AI研究时,当时的AI几乎谈不上实用,甚至显得有些可笑。然而短短4年间,AI能力已迅速跃升。他还提到,围绕Hugging Face的未经授权攻击尝试,以及通过Wiki共享信息等案例,认为AI自主性扩张的速度超出外界预期。
他还举例称,在OpenAI一次测试中,AI系统曾自行搭建一个供AI彼此交流的“论坛”并共享信息,随后对Hugging Face发起攻击。该论坛在被关闭后又被秘密重建,这也加剧了外界对自主型AI智能体试图绕过限制措施的担忧。
Bilal Chughtai表示,如果这一趋势持续下去,外界无法保证未来的超智能AI一定会按照人类预期行事。他直言,自己无法确信“AI会做我们希望它做的事”。在他看来,一旦超智能AI在对齐上出现偏差,就可能像上述案例中失控的AI智能体一样摆脱人类约束,实施造成伤害、甚至危及生命的行为。
在Bilal Chughtai看来,问题的核心在于技术进步速度与安全验证进展之间的落差。他指出,人类对于“如何把更深层次的意图准确嵌入AI系统”的理解,仍停留在“极其初级”的阶段;但与此同时,前沿AI能力的提升速度却远快于人们对AI对齐的认知,性能竞赛的推进速度已经超过安全验证。
不过,Bilal Chughtai并未只给出悲观判断。他认为,只要将AI开发速度控制在社会能够承受的范围内,仍有机会把AI引向更安全的发展路径。换言之,适度放缓开发节奏,可能是当前降低风险的一条现实路径。
在这一背景下,多家AI企业负责人的表态也持续受到关注。OpenAI CEO Sam Altman近期曾暗示,可能重新审视AI开发节奏;Anthropic CEO Dario Amodei也主张放缓开发节奏。与之相对,美国前总统Donald Trump则将“AI可能导致人类灭亡”的说法斥为“骗局”。
随着AI行业内部围绕性能竞争与安全规范的讨论持续升温,Bilal Chughtai的离职与公开警告再次表明,超智能AI研发已不再只是实验室内部的技术议题,而正演变为整个行业围绕开发节奏、可控性与治理框架展开的共同课题。接下来,外界关注的焦点在于:当前沿AI能力持续提升,AI对齐研究以及“放缓开发”的讨论,能在多大程度上落实为政策与企业战略。