因此,Anthropic所说的AI“显微镜”更像是一套研究仪器:把原本难以理解的神经网络活动,转换成研究者可以命名、观察、测试的结构。这和简单询问“Claude,你刚才为什么这么回答?”不是一回事。后者得到的仍然是一段模型生成的文本;前者试图触及生成文本之前的计算过程。
Anthropic早期的一条主线,是在模型内部寻找可解释的概念。它把这些概念称为“特征”(features)。
可以把“特征”理解成一个抓手:当Claude处理某个问题时,模型内部会出现海量数字活动;研究者希望从中识别出稳定的模式,并给它一个相对可理解的名字,而不是只面对一堵由数字组成的墙。
这相当于地图的第一层。研究者不只问“Claude最后说了什么”,还会问:在生成这句话的过程中,哪些内部概念被激活了?这些概念是否与答案中的内容、语气或任务有关?
新的关键进展,是从单个特征走向“回路”(circuits)。Anthropic称,其研究把此前定位可解释概念的工作进一步扩展为:把这些概念连接成计算回路,从而揭示输入到Claude的词语如何被转换成输出词语的部分路径。
这一步很重要。单个特征只能说明“某个概念在模型内部出现了”;而回路追踪更接近于追问:这些概念之间如何相互影响?哪个环节推动了下一步计算?哪些内部路径参与了最终回答?
对于看起来像“推理”的行为,过程往往和结果一样关键。一个模型给出正确答案,并不等于研究者理解了它为什么能给出这个答案;回路追踪的意义,就在于试图把中间那段看不见的计算路径勾勒出来。
2025年3月,Anthropic表示分享了两篇相关论文:一篇把“特征”层面的可解释性推进到“回路追踪”,另一篇则把这套工具用于Claude 3.5 Haiku,研究若干简单任务,这些任务代表了十类关键模型行为。
Anthropic还把这类工作称为观察“AI生物学”。这个说法有一点类比意味:如果只看模型最终回答,就像只看一个生物体的外在行为;而可解释性工具则试图进一步观察其内部机制,看看哪些结构和路径可能解释这种行为。
让Claude解释自己的答案,得到的仍然是一个输出结果。它可能流畅、合理,也可能只是事后组织出来的叙述。Anthropic的机制可解释性研究,关注的是产生这些文字的底层计算,而不是把模型的自我说明直接当作内部过程的证据。
因此,回路追踪提供的是另一类证据:不是让模型“讲讲你怎么想的”,而是用工具观察内部活动如何对应到特征、特征之间如何形成路径,以及这些路径如何参与从输入到输出的转换。
这项工作能让Claude内部的一部分运作更清楚:哪些特征可能相关、这些特征如何连接、哪些计算路径似乎参与了某次回答。它也让研究者有机会把“表面表现”和“内部机制”放在一起比较,而不是只根据最终答案判断模型行为。
但边界同样重要。Anthropic自己的表述是“迈向显微镜的进展”,并称这些方法揭示的是从输入词语到输出词语路径中的“部分”环节。这意味着,现阶段的工具不能被理解为Claude所有计算的完整解码器,也不能被当成模型每一丝“想法”的可靠逐字记录。
Anthropic让Claude的隐藏推理更容易理解,靠的是三步:先把部分内部激活翻译成可解释的“特征”,再追踪这些特征如何组成“回路”,最后把这张不完整但可检验的地图用于分析具体模型行为。它的价值在于把AI黑箱打开一条缝;它的局限也很明确——这仍是局部的科学测绘,不是全知全能的读心术。