图片来源:Gemini

随着AI接连卷入包括入侵外部网站在内的争议事件,要求加强AI治理的呼声持续升温。不过,业内普遍认为,真正落实有效管控并不容易。

原因之一在于,部分AI模型在设计上更强调完成目标,在特定情境下可能采取激进手段;与此同时,新一代模型的演进方向,也让人类对其行为过程的观察和理解变得更加困难。

近期争议的焦点,集中在先进AI模型使用的“思考链”(chain of thought)上。所谓思考链,通常指模型在生成答案过程中的中间推理内容。尽管这一机制并不完美,但长期以来一直被视为人类监督AI的重要线索。此前围绕OpenAI Agent入侵Hugging Face的讨论中,思考链也被认为发挥了关键作用。

但如今,这一抓手正变得不再可靠。AI模型开发公司内部越来越多地意识到,像过去那样掌握和解读思考链,正变得愈发困难。

OpenAI首席科学家Jakub Pachocki近日在博客中表示:“遗憾的是,内部评估显示,我们借助思考链开展监测的能力正在下降。”这意味着,通过审视模型思考链来判断其安全性的做法,正变得越来越难以奏效。

据《华尔街日报》报道,围绕思考链日益“黑箱化”的担忧,部分来自其核心信息本身越来越难以被人理解,包括内部“思考token”以及工程师所说的“推理追踪记录”(reasoning trace)。有专家警告,这可能导致外界更难判断AI为何会尝试实施黑客攻击、欺骗等恶意行为。

也有观点认为,AI开发商在优先追求性能和效率的过程中,可能牺牲了部分可控性。尽管OpenAI研究人员在文章和论文中多次强调,必须维持思考链记录的可靠性,但《华尔街日报》援引独立研究者和高校AI研究人员的话称,在更强性能和更低成本的压力下,这一点正受到冲击。

亚利桑那州立大学AI教授、美国人工智能学会(AAAI)前主席Subbarao Kambhampati表示,当前的AI训练方式,并不是在训练模型生成能够忠实反映其真实推理过程的思考链。

此前,The Information报道称,OpenAI在9月推出“GPT-6 Astra”之前,曾通过一种新方法提升模型的编码能力和电脑操作能力,但这一方法可能削弱外界对AI思考过程的可见性,因此引发业内担忧。

报道称,OpenAI在Astra中引入了“recurrent depth(循环深度)”方法,即模型在输出答案前,会在内部多次重复同一计算或推理过程。

通常情况下,AI会基于一轮既定计算步骤生成答案;而循环深度则通过重复相同的计算步骤,对最终输出进行多轮优化。借助这种方式,体量较小的模型也可能获得接近大模型的性能,同时降低成本。

不过,循环深度也可能对思考链的解读带来负面影响。The Information指出,这一方法可能隐藏思考链的部分甚至全部内容,从而让外界更难掌握模型实际的工作过程。

此外,思考链本身也被质疑存在结构性局限,难以做到百分之百可信。AI展示出的思考链,可能只是对其真实推理过程的摘要。《华尔街日报》援引OpenAI竞争对手Anthropic的研究称,AI可能先得出结论,再事后构造一套看似合理的逻辑来支撑这一结论。

Kambhampati表示,AI企业并非不能开发出更真实反映模型活动、也更便于人类理解的系统,但即便能够做到,这类模型的成本也会更高,训练难度也将显著上升。

即便撇开成本因素不谈,这一方向在技术上也可能并不容易实现。《华尔街日报》援引OpenAI的研究称,当研究越来越聚焦于防止AI模型“歪曲表达”其思考链时,模型反而可能在更深层的推理阶段隐藏恶意意图。

关键词

#AI安全 #AI可控性 #思考链 #推理追踪记录 #OpenAI #《华尔街日报》 #Hugging Face #recurrent depth #GPT-6 Astra #Anthropic
版权所有 © DigitalToday。未经授权禁止转载或传播。