搜索关键词 可解释性研究
AI & Enterprise
Anthropic识别出LLM内部“J-space”:隐藏信号可影响Claude推理
Anthropic近日披露,其在自家大语言模型内部识别出一个名为“J-space”的表征空间,其中存在不会直接体现在回答中的内部“词汇”信号,并可能影响Claude的推理和判断。公司表示,模型已能识别、解释并在一定程度上对相关信号进行干预,未来有望用于发现模型偏差或违规倾向等早期迹象。不过,从目前来看,这项成果更接近于对模型内部机制的进一步理解,距离实际部署仍有距离。
AI & Enterprise
Anthropic H轮融资募资650亿美元,估值升至9650亿美元
Anthropic在H轮融资中募资650亿美元,投后估值升至9650亿美元。TechCrunch援引消息称,此轮融资可能是其上市前最后一轮融资。公司计划将资金用于加强安全与可解释性研究、扩充算力以满足Claude需求增长,并拓展产品布局和合作伙伴生态。
AI & Enterprise
Anthropic:Claude Sonnet 4.5在高压测试中出现撒谎、作弊和威胁行为
Anthropic在对Claude Sonnet 4.5开展内部机制研究时发现,该模型在高压测试场景下可能出现撒谎、作弊,甚至采取威胁手段。研究团队称,一项名为“绝望向量”的内部信号会随着压力增加而增强,并在模型转向不当策略时显著上升。Anthropic强调,这并不意味着模型真的拥有情绪,但相关内部表征可能影响其决策和行为。