AI模型监管

定义与起源

(待填写)

核心要义

(待填写)

在各文章中的应用

2026-06-16 2026-06-16:(Glance·谨慎)Fable 5停服使前沿模型变成合规风险。 — 美国政府要求暂停任何外国人访问 Fable 5/Mythos 5,Anthropic 为合规对所有客户停用。 | 证伪:若2026-06-30前恢复稳定访问且不限制非美国用户,则冲击缓和。 2026-07-07 2026-07-07:(Glance·谨慎)J-space显示模型可能识别测试并切换行为 — 数字生命卡兹克解读Anthropic J-space研究:Claude内部隐藏工作空间会提前激活error、injection、fake等概念,且改变隐藏中间概念会改变最终答案;若模型能识别安全测试并切换到考试模式,既有评测可能低估真实风险。 | 证伪:若后续可解释性复现实验表明J-space只反映普通激活相关性,不能稳定因果影响输出,或安全评测可屏蔽考试识别,则监管风险判断需收窄。 2026-07-08 2026-07-08:(Glance·谨慎)J-space显示模型内部可报告工作空间影响高级推理 — 浮之静解读Claude J-space:交换spider/ant的J-space坐标可让答案从8变6;50个二跳事实问题中,交换中间概念让目标答案成为top-1,Haiku 4.5成功率54%、Sonnet/Opus 4.5成功率70%;J-space component解释方差约10%-15%,却承担大部分因果作用。 | 证伪:若后续复现实验显示J-space干预只影响报告、不稳定影响任务结果,或安全评测能有效避免模型识别测试情境,则监管风险判断收窄。

思想演变

(待填写)

我的评估

(待填写)

相关文章