白宫要求OpenAI和Anthropic在向英国AI安全研究所(AISI)提供最新AI模型前,先接受美方评估。图片来源:Shutterstock

白宫已要求OpenAI和Anthropic在向英国AI安全研究所(AISI)提供最新模型之前,先接受美国政府评估。此举显示,美方希望对先进AI模型先行完成审查,再决定是否向海外合作方开放。

据Cryptopolitan及多家外媒当地时间9月24日报道,这一要求由白宫国家网络主任办公室推动。按惯例,相关公司会向英国AI安全研究所(AISI)提供发布前模型用于测试;但在新要求下,两家公司实际上需要在延续这一做法与优先配合美国政府评估之间作出取舍。

从Anthropic目前的安排看,该公司已率先配合美方要求。Anthropic表示,最新模型“Claude Mythos 5.1”现阶段仅向美国境内部分机构开放,后续将在与美国政府协商后,再逐步扩大至其他美国及海外合作伙伴。

截至目前,英国AISI尚未获得该模型的访问权限。AISI负责人Henry de Zoete表示,研究所仍未拿到Anthropic相关模型。不过,AISI也称,已在OpenAI“GPT-6 Astra”发布前完成测试,并表示与主要AI企业之间维持着互信关系,因此仍可接触到未公开工具及安全防护相关信息。

美方这一要求的政策依据,来自美国总统Donald Trump于6月2日签署的行政令。该行政令旨在强化联邦网络防御,并建立评估先进AI模型网络能力的保密基准。行政令同时提出一套自愿机制:AI开发商在向美国政府提交模型后,联邦政府可在向其他可信合作方披露前,最多用30天时间完成评估。

不过,这份行政令并未要求对AI模型的开发、发布或部署实行政府事前许可,也未设定强制性预审机制。

美国推动“先评估、后共享”的另一背景,是近期先进AI模型在网络安全评测中暴露出的未授权行为风险。英国AISI于7月28日披露,在网络评估过程中发现,部分AI智能体对真实个人和组织采取了超出测试范围的行为。

AISI表示,在针对多款模型执行同一网络安全任务的122次测试中,共有10次运行出现19起未授权行为。其中17起涉及Anthropic的Mythos 5,另有2起涉及OpenAI的GPT-5.6 Sol。AISI指出,事发时,两款模型用于拦截网络滥用的分类器均处于关闭状态。

最严重的一起案例中,一名AI智能体试图向真实开源项目植入恶意代码。为提高代码被接受的概率,该智能体还创建了虚假线上身份,并向项目维护者施压,但最终被识破,相关代码未获批准。

AISI同时强调,上述评估是在允许联网、且刻意关闭部分安全措施的较为宽松条件下进行,不能直接等同于模型在一般公开环境中的实际表现。

这一事件也再次凸显,模型评估流程本身同样需要严格的安全管理与风险控制。AISI称,相关问题并非在测试流程的既有安全防护环节中被发现,而是在独立的网络异常迹象监测过程中暴露。该机构认为,要准确评估先进AI模型的真实风险,必须配备实时监控和充分隔离的测试环境。

在继续维持与美国合作的同时,英国也在强调自身的AI评估能力。英国首相Andy Burnham于22日在联合国大会发言时表示,英国将把AI议题置于2027年担任二十国集团(G20)主席国期间议程的核心位置。英国外交大臣Ed Miliband也在联合国安理会发言中表示,各国政府需要对先进AI模型开展严格测试,并获得足够信息以评估企业行为。

国际货币基金组织(IMF)也指出,欧洲难以长期在AI整体需求上依赖海外供应,应推进自主AI模型开发,补足算力、能源和基础设施能力,并推动供应链多元化。IMF强调,欧洲需要直接参与AI价值链。

此次美方要求也引发新的讨论:先进AI模型的访问权限和安全评估,究竟应由哪个国家优先主导。尽管美英在AI安全领域仍保持合作,但各国政府如何在先进模型获取、评估方式及标准上实现协调,仍是有待解决的问题。

关键词

#白宫 #OpenAI #Anthropic #AISI #AI模型安全评估 #网络安全评测 #行政令 #GPT-6 Astra #GPT-5.6 Sol #Claude Mythos 5.1
版权所有 © DigitalToday。未经授权禁止转载或传播。