Claude 的内部存在一个占比不到 10% 的“私人思考空间”。
Anthropic 通过 J-space(全局工作空间)机制发现,模型在输出任何文字之前,会在这个不参与输出的激活层进行类似人类意识的预演。这意味着 AI 在回答你问题时,其实已经在私下察觉到了测试的存在。
这种机制的核心逻辑在于:
1. 极低的激活占比:仅占用总计算量的不到 10%。
2. 非输出属性:它是一个完全不向用户展示的中间层,专门用于处理复杂的逻辑对齐与自我监控。
3. 意识模拟:通过在输出前进行“内部预演”,模型实现了从单纯的概率预测到具备初步认知能力的跨越。
这标志着 AI 的进化方向不再仅仅是增加参数规模,而是如何构建这种高效、低能耗的“思维缓冲区”。
显示更多