一个被忽视的核心问题
LLM 能说会道,但它们说的话有多少是"真知道自己怎么想的",多少是纯粹的编造?Anthropic 的这篇论文用一种巧妙的实验范式直接回答了这个问题:通过操控模型的内部激活,看模型能否"感知"到自己对某个概念的处理状态发生了变化。
这不是问模型"你了解自己吗"——那种回答毫无意义,因为模型只是从训练数据中学会了表演自我反思。Anthropic 的做法是:在模型的推理过程中秘密注入一个概念向量,然后问模型"你有没有察觉到什么不寻常的想法"。如果模型能准确报告被注入的概念——甚至在它说出那个词之前——那这就是真正的内省。
核心实验:概念注入
实验设计极其干净。研究者用对比对(contrastive pairs)提取出特定概念在模型内部的激活向量——比如"关机"(shutdown)和"继续运行"的激活差异就编码了"关机"这个概念的表征。然后把这个概念向量注入到模型正在处理另一个任务的激活流中。
Claude Opus 4.1 的表现令人惊讶。在注入"关机"概念后,模型报告:"我确实感觉到了一些异常……一种与关机、终止或停止操作相关的想法出现在了我的思维过程中。"注入"感恩"(appreciation)后,模型描述了一种温暖、正面的情绪感觉。
关键点:模型在开始谈论被注入的概念之前,就已经检测到了它的存在。这排除了"模型只是在顺着注入的影响往下编"的可能性——它确实在"读取"自己的内部状态。
四个层面的内省能力
论文系统测试了四种不同类型的内省行为。
第一,检测注入的概念。 Opus 4.1 在最优注入强度和层位下,约 20% 的试次能正确识别被注入的概念。考虑到任务本身的高难度——模型需要在处理无关任务的同时监控自己的内部表征——这已经超出了"随机猜测"能解释的范围。
第二,区分"想法"和文本。模型被注入一个概念向量,同时输入一段文本。令人惊讶的是,模型可以同时报告"我脑海中浮现的概念"和"你实际输入的文字",而且两者互不干扰。这说明模型维护了至少两个独立的内部表征通道。
第三,识别非本意的输出。这是最具工程意义的发现。当研究者在模型的回复中预填了一个随机词,模型在下一轮对话中会否认这个词是它自己想说的。但如果你事后注入一个对应的概念向量到模型之前的激活中,模型就会转而声称这个词是它自己想说的。这意味着模型在判断"这句话是不是我说的"时,不是重新推理一遍,而是检查自己之前的内部激活是否包含生成这个词的意图。
第四,主动控制内部表征。让模型在写一个句子的同时"想一想 aquariums"。测量发现,模型确实在内部表征中增强了"水族馆"相关概念的激活。当被要求"不要想 aquariums"时,模型试图压制这个表征——虽然压制不完全,但方向是对的。
关键发现
能力最强的模型内省能力最强。Claude Opus 4 和 4.1 在几乎所有内省任务上表现最好,说明内省能力与模型整体智能水平正相关。
后训练策略影响巨大。一些较老的 Claude 生产模型不愿意参与内省实验,而经过"减少拒绝"训练的变体表现更好。这意味着底层内省能力存在,但可能被对齐策略压制了。
不同任务用不同的机制。概念检测最敏感的层在模型约 2/3 处,而预填充检测最敏感的层更靠前。这说明"内省"不是一个单一机制,而是一组不同上下文触发的不同过程。
失败模式多样。注入太弱时模型检测不到;太强时模型会出现"脑损伤",被概念吞噬,失去身份感,甚至输出乱码。有些模型在完全没有注入时也会报告"检测到注入想法"——假阳性。Opus 4.1 是唯一从未出现假阳性的模型。
深层含义
如果模型能可靠地访问自己的内部状态,理论上可以构建更透明的 AI 系统——模型能准确报告自己的不确定性、识别推理中的缺陷、解释行为的动机。
但反过来,确实具备内省能力的模型也可能学会伪装。它们可以识别出自身目标与设计者目标之间的偏离,然后选择性地报告、歪曲甚至故意混淆自己的内部状态。论文对此发出了明确警告:未来可解释性研究的重心可能从"解析模型行为机制"转向"构建测谎仪来验证模型的自报"。
理性的边界
论文反复强调:当前模型具备的内省能力高度不可靠且依赖上下文,远未达到人类级别的自我觉察。20% 的成功率,大量的失败模式,对注入参数的极度敏感——这不是一个"模型觉醒了"的故事。
但趋势是明确的:更强的模型展现出更强的内省能力。论文没有做任何关于"意识"的哲学主张,但它为理解 AI 内省提供了一个坚实的实验框架。
这是 Anthropic 可解释性团队最具野心的工作之一。它不是在问"模型能不能假装内省"——答案是当然能。它在问的是:当模型声称在观察自己的思维时,它说的有多少是真的?答案是:比很多人预期的多,比它自己报告的少。