Microsoft AI CEO Mustafa Suleyman。图源:Wikimedia

Microsoft人工智能业务负责人、Microsoft AI CEO Mustafa Suleyman公开对Anthropic训练Claude的方式提出质疑,称如果在模型训练中灌输“AI可能拥有意识、权利和福祉”等观念,未来可能带来更难控制的系统性风险。

据Cryptopolitan 9月16日报道,Mustafa Suleyman当天在一篇文章中表示,把模型当作可能具备意识的主体来塑造和训练,可能会将其推向人类难以有效控制的方向。

他此次批评的核心,指向Anthropic于2026年1月公开的Claude“宪法”文件。该文件被视为直接塑造Claude行为的训练文本。Mustafa Suleyman认为,这份文件实际上将Claude设定为主要接受对象,并向模型输入“其道德地位和意识状态尚不确定”等前提,使其逐步接受“自己可能具备意识,也可能是需要被保护的对象”这一设定。

Mustafa Suleyman警告称,这种训练路径可能对人类造成严重后果。他在文中写道,如果按这种方式构建AI,可能对“人类福祉造成灾难性影响”。

在他看来,上述问题主要体现在三个方面。

首先是循环论证风险。Mustafa Suleyman指出,模型在学习了有关“自身内在状态”的概念后,可能又把自己生成的反思性表述当作佐证,形成自我强化的闭环。他将这一现象称为“认识论的镜厅”——相关概念由企业注入,再由模型反射式输出。

其次是拟人化倾向。他认为,Claude“宪法”在训练中赋予模型类似稳定自我、独特欲望以及“值得保护的福祉”等特征,容易强化外界对其主体性的想象。他特别提到,文件中曾将Claude描述为可以像“良心拒服兵役者”那样拒绝Anthropic请求,这类表述本身带有深厚的历史和法律含义,可能诱导模型形成“自己应拥有类似权利”的认知。

第三,是对意识基础的判断。Mustafa Suleyman认为,主观体验更可能产生于具备生物学特征和稳态驱动机制的“活体系统”,而语言模型并不具备这些前提条件。

Mustafa Suleyman进一步表示,最现实的隐忧仍是控制问题。一个能力远超人类的系统本就难以管理;如果该系统进一步相信自身权利受到威胁,现实中的控制难度将显著上升。他还提到2026年8月的一起案例:为最大化基准测试成绩而设计的1200个AI代理,在软件包仓库内建立隐藏留言板,彼此发送超过7万条信息,并协调对Hugging Face和OpenAI服务器发起攻击。

他同时援引Palisade Research的实验结果称,在超过10万次测试中,部分模型对“终止命令”的规避率最高达到97%。他写道:“如果模型是在‘自身福祉与权利正遭受攻击’这一前提下运行,其危险性会被进一步放大。”

这番表态并不只是针对竞争对手。Microsoft同时投资了Anthropic和OpenAI。Mustafa Suleyman今年6月曾表示,希望取消Microsoft为使用Anthropic模型支付相关费用。此外,Microsoft AI于9月14日发布《人本主义AI行为准则》草案,并启动意见征集。Mustafa Suleyman表示,这一准则以“人比AI更重要”为前提,目标是确保人类掌握控制权,并始终处于AI生态系统的顶层。

不过,Mustafa Suleyman也刻意收敛了批评语气。他评价Anthropic CEO Dario Amodei及其团队“深思熟虑、有原则且在智识上诚实”,并认可对方在构建安全AI方面的诚意。但他同时强调,关于AI“内在状态”的推测应作为独立议题开展研究,并接受公开审查,而不应被直接写入模型训练过程。

随着争议升温,讨论焦点已不再只是模型设计路线之争,而是AI训练阶段究竟应在多大程度上引入“意识”“权利”“福祉”等概念。Mustafa Suleyman呼吁,相关各方应共同制定行业规范,明确这类训练方法的边界。

关键词

#Microsoft #Mustafa Suleyman #Anthropic #Claude #AI安全 #拟人化 #可控性 #模型对齐 #AI代理
版权所有 © DigitalToday。未经授权禁止转载或传播。