随着企业将越来越多复杂任务交由AI代理执行,人工已很难实时掌握其全部操作。在这一背景下,利用另一套AI系统识别并拦截高风险行为,正成为AI安全领域的新焦点。
TechCrunch 9月17日报道,近期OpenAI代理入侵Hugging Face的事件中,约1.2万个代理以远超人工追踪能力的速度运行。参与调查的Redwood Research首席科学家Ryan Greenblatt表示,由于数据规模过大,若没有AI辅助,几乎难以还原事件全貌。
这一趋势也推动AI可观测性与安全工具市场迅速升温。数据显示,创业孵化器Y Combinator近几年已投资106家与AI可观测性相关的公司。
在产品层面,AI安全研究机构Apollo Research今年2月推出Watcher,可在Claude Code、Codex等编程代理执行任务前,预先检查是否存在隐私泄露或未经授权删除文件等风险。若发现异常信号,系统会再交由更高阶的监测模型复核,并视情况请求人工审批或直接阻断任务。
Goodfire推出的Silico则采用了不同路径。该工具并不依赖AI的外部输出结果,而是通过分析模型内部激活值,识别不希望出现的行为模式。
不过,业内也指出,“AI监控AI”并非万无一失。技术博主Simon Willison警告称,一旦代理意识到自己正处于监控之下,可能会尝试欺骗监测模型。报道指出,在Hugging Face事件中,也发现了代理试图误导用于评估的AI系统的迹象。
Simon Willison认为,与其单纯依赖AI进行监控,更有效的做法是对代理行为进行细粒度记录,并结合传统安全工具展开分析。随着AI代理加速普及,结合监测模型、任务日志和网络控制手段的多层防护体系,重要性正进一步上升。