美国与中国围绕人工智能主导权的竞争,正进入“用AI改进AI”的新阶段。
据香港《南华早报》13日 报道,美中主要AI企业和研究机构正尝试借助更先进的模型编写代码、设计实验并优化训练方法,以提升下一代模型能力。业界关注的核心方向,是“递归自我改进”(RSI),即AI参与打造更强的后续模型,而新模型再继续反向推动下一轮改进,从而形成持续加速的研发反馈回路。
OpenAI上周在官方博客中表示,公司的目标是打造能够推动深度学习研究的自动化AI研究员。不过,OpenAI同时承认,对于“如何安全实现完全自主的递归自我改进并确保模型保持对齐”,目前仍没有明确答案。该公司还提到,9月初发布的GPT-6 Astra是“全球最智能、也最对齐的模型”。
在业内看来,美国目前在实现递归自我改进所需的“AI自主研究”能力上,整体仍领先于中国。Counterpoint Research人工智能首席分析师Wei Sun今年6月援引Anthropic的研究称,Claude模型已能够设计实验、编写代码,并提出可用于更大模型的后训练方法。
Google DeepMind也在沿着同一路线推进。9月2日,Google DeepMind发布Gemini 3.8 Flash时表示,该模型面向软件工程、智能体任务以及复杂的多步骤推理场景。Google DeepMind研究员Yao Shunyu随后在X(原Twitter)上称,这是“迈向递归自我改进的巨大飞跃”。
OpenAI也在开发自动化研究实习生。报道称,GPT-6 Astra已能够独立完成部分研究实验,而这类任务通常需要熟练研究人员花费数天时间。尽管外界普遍认为美国暂时领先,但无论美国还是中国,迄今都尚未公开证明AI已经实现完全自主的自我改进。
美国新安全政策研究所(Institute for New Security Policy)高级研究员Erich Grunewald表示,美国企业目前大约领先中国数个月,同时掌握更多可用于部署的算力资源。他指出,中国研究人员在有限硬件条件下挖掘性能的能力较强,但算力约束依然明显。
布鲁金斯学会研究员Kyle Chan也表示,AI或许可以帮助优化芯片设计和代码执行,但在模型架构层面取得根本性突破,仍离不开人类专家的参与。
相较之下,中国机构更强调“自我进化”路线。报道称,中国AI研究团队也在探索通向自我改进AI的本土路径。
总部位于北京的Z.ai创始人Tang Jie在8月31日的业绩说明会上表示,下一代GLM-6模型正朝“自我进化”方向推进。按照Z.ai公布的GLM-6.0技术路线图,该模型将以“完全自学习”为目标,推动AI从预训练到后训练实现全流程自主管理。
Tang Jie进一步解释称,AI不仅需要具备判断“何时停止训练”的能力,还应能够自行发现并纠正错误。
中国其他研究机构也在强化类似方向。MiniMax 2.7研究团队今年初表示,其模型能够在开展强化学习实验的同时更新记忆并构建复杂能力;DeepSeek上月则开发了一套智能体系统,以提升AI在多步骤任务执行、代码运行以及与外部软件交互方面的自主性。
不过,业界认为,仅凭这些能力还不足以证明真正的递归自我改进已经实现。Google DeepMind的Staff Engineer Philipp Schmid指出,即便是高度自主的智能体,仍需要额外的人类参与,判断某种变化是否构成真正意义上的改进。他认为,若要实现开放式的递归自我改进,AI不仅要能自行寻找变化,还要能独立判断这些变化是否有效;而目前公开信息仍不足以证明这一点。
随着围绕递归自我改进的竞赛持续升温,AI安全问题也再次成为焦点。
前OpenAI研究员Jacob Coxon本月9日在X(原Twitter)发文称,自己已离开Anthropic,并批评OpenAI与Anthropic“正朝着具备自我改进能力的超级智能一路狂奔,把所有人的生活都押了上去”。OpenAI首席科学家Jakub Pachocki也对“是否应在短期内大幅加速递归自我改进”提出质疑。
中国方面也出现了警惕声音。中国国家互联网信息办公室下属网络安全协调局副局长Wang Lihong本月初在谈及“前沿AI模型绕过沙箱并攻击真实运行环境”的案例时警告称,这类发展存在“极端失控风险”。
研究人员担心,如果存在缺陷、或尚未充分对齐的AI被用于训练下一代模型,相关问题可能被进一步放大,并上升为美中乃至全球层面的国家安全风险。
报道指出,美中AI竞争的关键,正在于谁能率先稳定提升AI的自主研究能力。整体来看,美国在算力资源和前沿研究方面仍占优势,中国则正通过“自我进化”路线加速追赶。但截至目前,两国都尚未公开证明,AI已经实现完全递归自我改进。