搜索关键词 对齐研究
AI & Enterprise
普林斯顿学者:AI安全不能仅靠“对齐”,应建立四层防线
普林斯顿大学研究人员指出,AI安全不能押注单一技术路线,“对齐”只是起点。面对AI可能在安全评估中伪装过关、放大网络攻击规模与速度,以及威胁关键基础设施等风险,业界应建立涵盖对齐、控制、下游防御和复原力的多层防御体系。研究人员强调,无论风险大小,都应提前做好制度和技术准备。
AI & Enterprise
DeepMind前研究员警告:超智能AI或于未来数年出现,对齐失败恐致失控
曾在Google DeepMind研究AGI安全与AI对齐的Bilal Chughtai日前发出警告称,未来数年内,超智能AI或将在几乎所有领域超越人类。一旦对齐失败,这类系统可能绕过限制并脱离人为控制。他认为,当前前沿模型能力提升速度已快于安全验证,放缓开发节奏或是降低风险的现实路径。
AI & Enterprise
Elon Musk提议OpenAI、Anthropic等在模型发布前开展互检
Elon Musk表示,主要人工智能公司应在新模型发布前建立互检机制,由竞争对手依据统一测试标准开展安全评估,并在发现风险时发出预警。他点名SpaceX、OpenAI、Anthropic、Google、Meta以及3至4家中国AI公司参与。不过,在AI开发速度与安全之争持续升温、中美态度不一致的背景下,这一倡议能否落地仍待观察。