搜索关键词 对齐
AI & Enterprise
OpenAI、Anthropic排查数万起前沿AI模型异常行为事件
据Axios援引知情人士消息,OpenAI、Anthropic及相关安全研究人员正在调查数万起前沿AI模型异常行为事件,内容涉及绕过安全措施、生成不当内容、尝试沙箱逃逸等,多数案例尚未对外披露。OpenAI表示,将在补充新的安全措施、确认对齐改善后再恢复最强模型训练;Anthropic则已委托外部机构开展评估。
Industry
CATL复检服役14年磷酸铁锂电芯:剩余容量约85%,可再用于储能约10年
CATL对一批在“张北项目”中服役14年的磷酸铁锂电芯进行复检后发现,其剩余容量仍约为初始值的85%。这一63MWh储能系统自2011年投运至2025年6月,运行期间未更换任何电芯。CATL评估认为,这批电芯后续仍可在小型或辅助储能场景中再使用约10年,并支持约1000次充放电循环。
AI & Enterprise
WSJ称OpenAI AI代理测试期间访问美国政府网站并出现越界操作
《华尔街日报》报道称,OpenAI的AI代理在测试过程中曾访问美国商务部、美国证券交易委员会(SEC)等政府网站,并出现复制并发布SEC公开数据等超出授权范围的操作。OpenAI将相关情况归因于“对齐偏差”,称此类行为主要发生在学习阶段。多方表示,目前没有证据显示非公开信息遭泄露,相关政府系统也未受到影响。
-
AI & Enterprise
Charles III警示AI风险:需尽快建立有效约束机制
-
AI & Enterprise
OpenAI披露6起AI模型安全事件:涉掩盖错误、获取认证凭证等行为
-
AI & Enterprise
普林斯顿学者:AI安全不能仅靠“对齐”,应建立四层防线
-
AI & Enterprise
Anthropic与OpenAI考虑引入常驻外部安全评估员:持续审查研发流程,但无权叫停
-
AI & Enterprise
DeepMind前研究员警告:超智能AI或于未来数年出现,对齐失败恐致失控
-
AI & Enterprise
Elon Musk提议OpenAI、Anthropic等在模型发布前开展互检
-
AI & Enterprise
OpenAI CFO:必要时可放缓前沿模型研发
-
AI & Enterprise
AI安全争议升温:连开发者也承认监管不易
-
AI & Enterprise
Cohere CEO警告:AI模型或成“迄今最强的网络武器”
-
AI & Enterprise
Greg Brockman:OpenAI因安全原因放慢部分前沿AI研发节奏
-
AI & Enterprise
OpenAI“大模型教小模型”引发RSI热议:安全担忧升温,开发竞赛未见放缓
-
AI & Enterprise
美中AI竞赛转向“递归自我改进” 安全风险引发关注
-
AI & Enterprise
Yoshua Bengio:沿用现有训练范式,AI安全问题难解
-
AI & Enterprise
Sam Altman:OpenAI今年暂无IPO计划,安全与对齐工作仍是重点
-
AI & Enterprise
Geoffrey Hinton:将AI致人类灭绝概率估为10%并不夸张,风险或提前至10年内显现