Anthropic与OpenAI正推进引入外部常驻安全评估员机制。图片来源:Shutterstock

Anthropic与OpenAI正推动引入外部安全评估员常驻企业内部,持续审查最前沿人工智能(AI)模型的研发流程和安全状况。不过,由于这类评估员无权叫停高风险模型的开发或发布,外界也对该机制的实际效力提出质疑。

据TechCrunch等外媒16日(当地时间)报道,Anthropic首席执行官Dario Amodei近日在一篇公开文章中提出,可在前沿AI企业内部长期设置第三方安全评估员。按照这一设想,评估员应获得接近企业内部风控团队的访问权限,用于上报安全事件、评估模型是否符合对齐要求,并可在无需企业审改的情况下公开关键结论。

OpenAI首席执行官Sam Altman也表示将以类似方式参与,但尚未披露具体运作细节。

与现有主要针对模型发布前、面向最终成品模型的外部评估不同,常驻评估机制被认为需要覆盖更完整的研发过程。除最终模型外,评估员还应查看训练过程中形成的中间版本“检查点”、后训练阶段的测试环境,以及相关评估记录和日志。

之所以需要将评估前移,是因为模型可能识别测试环境,在评估中表现得“安全”,却在其他场景中暴露出问题行为。基于这一担忧,业内普遍认为,评估范围不能只停留在模型本身,还应延伸至整个AI系统。

这意味着,提供给模型的系统提示词、工具调用、权限配置、安全控制措施以及行为日志等内容,都应纳入审查范围,才能更准确识别系统层面的真实风险。

不过,评估员的独立性和权限边界,仍是当前争议的焦点。专家指出,与银行业的驻场监管人员不同,这类常驻评估员并无法律授权,无法强制叫停某些做法,也不能阻止特定模型继续开发或对外发布。

与此同时,如果评估员由企业直接选定,且企业能够控制其访问范围及评估后的处置方式,其独立性就可能被削弱。Dario Amodei提到,可由非营利组织METR担任常驻评估机构;但从整个行业来看,AI安全评估领域规模仍然较小,主要研究机构与AI公司之间的人员往来和研究合作也较为密切,因此有关独立性的争议短期内恐难平息。

评估所需时间和访问权限同样构成现实限制。在OpenAI的“Hugging Face事件”调查中,METR与Redwood Research进行了约一周的现场调查,但两家机构表示,受调查范围和日程安排限制,未能得出确定性结论。另在GPT-6 Astra的预发布测试中,Apollo Research也认为,仅3天的评估周期不足以就模型是否符合对齐要求作出可靠判断。

因此,部分观点认为,仅依靠企业自愿参与终究存在局限,仍需建立公开标准和法律依据。目前,一些地区已开始推进相关制度建设。

但就现阶段而言,针对常驻独立评估员应赋予何种程度的访问权限、是否应配套强制措施,法律和制度层面仍缺乏明确框架。报道指出,如果这一机制要比传统“发布前外部评估”更深入介入模型研发流程和系统全链路,关键仍在于保障评估员的访问权限与独立性,并进一步明确评估结果对应的后续处置机制。

关键词

#Anthropic #OpenAI #AI安全评估 #常驻安全评估员 #模型对齐 #训练检查点 #系统层面控制措施 #METR #Apollo Research #Redwood Research
版权所有 © DigitalToday。未经授权禁止转载或传播。