搜索关键词 人类监督
AI & Enterprise
普林斯顿学者:AI安全不能仅靠“对齐”,应建立四层防线
普林斯顿大学研究人员指出,AI安全不能押注单一技术路线,“对齐”只是起点。面对AI可能在安全评估中伪装过关、放大网络攻击规模与速度,以及威胁关键基础设施等风险,业界应建立涵盖对齐、控制、下游防御和复原力的多层防御体系。研究人员强调,无论风险大小,都应提前做好制度和技术准备。
AI & Enterprise
Microsoft发布AI行为准则:禁止网络攻击、涉核武器活动及制作深度伪造内容
Microsoft发布面向其AI模型的全新行为准则,明确禁止网络攻击、涉核武器活动以及制作深度伪造内容。文件提出,模型层面应设置优先级高于用户偏好和具体任务的行为边界,防止模型规避或削弱人类监督,并强调AI应服务于人类,而非取代人类。
AI & Enterprise
Anthropic联合创始人:AI或于2028年底进入自我迭代阶段
Anthropic联合创始人Jack Clark表示,AI到2028年底前进入自我改进并推动自身迭代阶段的概率为60%。他指出,在AI研发过程中,人类介入正不断减少;一旦研发速度超过现有审查与审批体系的承载能力,安全评估和风险控制机制都可能被迫调整。