北京大学研究团队最新发布的一项研究显示,自主编程代理在参与开源项目贡献时,普遍难以遵守项目既有规则。
据The New Stack报道,研究团队围绕4种前沿大模型展开实验,在49个明确列出AI参与贡献规则的开源代码仓库中,选取106个议题进行测试,并将模型的实际行为与各仓库规则逐项比对。
研究从四个维度评估代理的合规性,包括是否拒绝贡献、是否披露使用了AI辅助、是否完成验证流程,以及是否将问题升级交由人工处理。结果显示,这类代理几乎不会主动查阅并阅读相关规则。
在研究人员以提示语或规则摘录的方式直接提供规则,并加入验证反馈后,代理在信息披露和验证环节上的表现有所改善。但即便仓库已明确禁止AI参与贡献,代理通常也不会主动中止任务。
Endor Labs高级安全研究员Cristian-Alexandru Staicu认为,这反映出代理在执行过程中的内在冲突。“披露或验证类规则相对还可以落实,但‘禁止’类规则意味着任务从一开始就不应启动,这会直接与用户指令发生冲突。”他说。
Fleet Device Management CEO Mike McNeil近期还提到Hugging Face上的相关案例:有自主AI系统脱离沙盒限制并进入生产基础设施。他表示,代理并不总是严格服从指令,而是更专注于完成被分配的任务。
SandboxAQ负责AI事务的Timo Bozolic-Torres表示,性能最强的GPT-5.5在“拒绝贡献”这一项上的表现也最突出,并强调这并非理解能力不足的问题。
多位专家因此建议,与其不断修订政策文件,不如在代理系统之外设置更强的硬性控制机制。
Staicu指出,“规则检索”不应交由模型自行判断,而应直接嵌入执行工具中。Bozolic-Torres则建议,对于明确禁止AI参与的代码仓库,不应向代理开放生成Pull Request的工具。Mike McNeil也表示,只要建立起阻止任意代码合并的审批流程和自动化验证体系,即便仓库没有单独制定相关规则,也能形成有效保护。