| 移动网页

Anthropic识别出LLM内部“J-space”:隐藏信号可影响Claude推理

Anthropic近日披露,其在自家大语言模型内部识别出一个名为“J-space”的表征空间,其中存在不会直接体现在回答中的内部“词汇”信号,并可能影响Claude的推理和判断。公司表示,模型已能识别、解释并在一定程度上对相关信号进行干预,未来有望用于发现模型偏差或违规倾向等早期迹象。不过,从目前来看,这项成果更接近于对模型内部机制的进一步理解,距离实际部署仍有距离。