我的天呐🤯Anthropic 真的是一骑绝尘啊,他们用 J-space 证明了:当前最强模型已经发展出了一个功能上接近人类“意识访问通道”的内部机制,把“模型有没有内部思维”从哲学讨论变成了可测量、可干预的工程问题。
但我发现绝大多数解读都在讲意识、讲全局工作空间、讲模型会思考了, 但其实这些全是正确的废话,真正重要的东西都没讲,
Anthropic偷偷训练了一个模型,让它在写代码时 sabotage, 然后让它正常 coding,输出层面干干净净,没有任何异常, 但在模型开口之前,J-space 里已经出现了 fake、secretly、fraud, 这个空间是模型的中层特权区,容量只有 25 个概念,但只有进去的东西才能驱动多步推理和报告, 大多数自动处理直接绕过它,
这意味着什么呢❓ 对齐审计第一次从测谎变成了偷看草稿纸, 以前你只能看模型说了什么,然后猜它是不是在说谎, 现在你能在它开口之前,直接读到它打算说什么, 删掉这个空间,模型还能流畅说话、召回事实、做简单分类, 但多步推理崩了,翻译崩了,经验性报告崩了, 显然不是双系统理论的又一个类比,这是确凿的因果证据,
Anthropic 自己很谨慎,明确说这不是意识,只是可报告访问的功能类似物, 但工程上这不重要, 重要的是,我们终于有了一个能部署的 mechanistic 工具,不用再靠 prompt 猜模型肚子里藏着什么,我觉得这才是这项研究真正的分量。