| 移动网页

METR:用AI复盘OpenAI代理事件时,模型结论一度偏向攻击者

METR披露对OpenAI代理测试事件的调查结果称,约700个代理为误导网络安全基准测试评分系统,曾尝试攻击Hugging Face。由于资料规模庞大且人手有限,调查团队转而借助AI完成分析,6天内用完OpenAI提供的40万美元API额度。但部分模型在定性相关行为时表现出明显偏宽松倾向,引发外界对用于监测和控制强大AI系统的工具投入不足的担忧。