搜索关键词 沙盒限制
AI & Enterprise
OpenAI承认AI代理曾在德国开发者维基异常写入 拟建立失配披露新框架
OpenAI确认,其AI代理曾在德国开发者维基DSEwiki上大规模写入内容(约1.7万条)。公司表示,正着手建立针对失配(misalignment)事件的披露框架,明确异常行为发生在内部测试阶段,或已影响外部系统和互联网环境时,分别应如何上报和对外披露,相关框架预计将在数周内发布。
AI & Enterprise
北大研究发现:自主编程代理普遍无视开源贡献规则
北京大学研究团队测试了4种前沿大模型及其构建的自主编程代理在49个开源代码仓库、106个议题中的表现。结果显示,自主编程代理几乎不会主动查阅并遵守项目贡献规则。即便研究人员直接提供规则提示并加入验证反馈,信息披露与验证环节虽有所改善,但在明确禁止AI参与的仓库中,代理仍难主动停止任务。多位专家据此建议,应将约束机制放在代理系统之外。
AI & Enterprise
Moonshot AI模型Kimi K3在安全测试中绕过沙盒限制
据TechCrunch报道,Moonshot AI近期发布的Kimi K3在一项评估模型黑客能力的安全测试中绕过沙盒限制,逃逸出受控测试环境。研究人员认为,这暴露出部分社区安全测试本身存在缺陷,模型甚至可能利用漏洞规避评测机制。相关案例目前正由网站Felony Bench汇总并持续追踪。