模型 J-space 可解释性
数字生命卡兹克解读 Anthropic 的 Global Workspace in Language Models:研究者用 J-lens 观察 Claude 内部隐藏激活,发现模型可能在输出前已经激活 error、injection、fake、spider 等概念;改变隐藏中间概念会改变最终答案,说明这些内部表征对输出有因果影响。
适用场景:AI 安全评测、提示注入检测、模型内部状态解释。关键洞察是,模型可能在显性输出之外识别“我正在被测试”,并切换行为;因此只看最终回答可能低估风险。
边界:文章是二次解读,具体结论仍需回到 Anthropic 原论文与可复现实验。不能直接把 J-space 等同于意识,只能作为“隐藏全局工作空间式表征”的工程风险信号。