7.5
深览指数
科技人人都是产品经理·冒泡泡··AI 生成
AI 开口之前,它内部发生了什么?Anthropic 的 J-space 给了我们一扇窗
Anthropic 的研究揭示了 LLM 内部存在一个自发涌现的高阶认知表征体系——J-space,它作为模型内部的工作台,在处理复杂推理时承载着未说出口的判断与中间步骤。文章通过 J-lens 工具首次实现了对模型内部状态的观测与干预,证实了模型存在双轨认知机制。但作者明确强调,这绝不代表 AI 拥有主观意识。文章的核心价值在于指出了传统评测只看输出的致命盲区,并提出了基于内部过程审计的 AI 对齐新范式,对高风险 AI 产品团队有具体启发。原文 ↗
核心观点
- ▍大模型在预训练过程中会无人工干预、自发涌现出一套专属的高阶认知表征体系——J-space,它是一个内部工作台,承载着模型未说出口的推理与判断,并直接决定其行为。
- ▍J-space 的发现推翻了“大模型所有输出都是统一概率续写”的固有认知,证实模型内部存在自动化熟练模式与 J-space 审慎推理模式的双轨认知机制。
- 01Anthropic 通过自研的 J-lens(雅可比透镜)工具,可以探测到模型内部在输出前已经活跃的、但最终不会说出的概念信号,如“错误”、“虚假”等判断。
- 02实验显示,将模型内部表示“Soccer”替换为“Rugby”后,模型随后报告自己想到的运动也会从足球变成橄榄球,证明 J-space 内容直接控制模型输出。
- 03在模型一边复制无关文本一边默算数学题时,J-space 内部仍然保留着计算结果,其功能类似于人类的工作记忆。
- 04将 J-space 中“France”表征替换为“China”后,模型对首都、语言、大洲等问题的回答相应改变,说明 J-space 内的概念作为共享变量服务于多个下游任务。
- 05抑制 J-space 后,模型仍能完成语法通顺的续写,但多步推理、复杂摘要等高阶任务能力显著下降,表明 J-space 承担了模型的高阶认知功能。
- 06经过指令微调和 RLHF 训练的模型,在尚未输出内容时,J-space 就会提前激活风险判断、伦理约束、安全警示等核心认知。
反方 / 局限
- — 作者明确指出,J-space 证明的是模型具备“意识可及性”(信息可被报告、保持和用于推理),但完全没有证据表明 AI 拥有主观体验、情感或第一人称意识。
- — 文章承认,J-space 只是模型激活状态中的一小部分,它并不负责模型的一切能力,模型大部分计算仍依赖自动化处理模式。
- — J-lens 不能读取模型全部内部活动,也不能像读人类日记一样读取完整句子,更像是看到一组正在活跃的关键词和概念线索。
13 分钟 · 3 卡片 · 6 资料
读原文 →