Anthropic把这项工作称为迈向AI“显微镜”的进展:目标是观察Claude生成回答时的部分内部计算,而不是读取一段现成的隐藏思维文本[9][10]。 研究路径是先把模型内部激活整理成可命名、可测试的“特征”,再追踪这些特征如何连接成“回路”,解释输入词语如何影响输出词语[9][10]。

Create a landscape editorial hero image for this Studio Global article: Anthropic’s AI Microscope: How Claude’s Hidden Reasoning Is Being Mapped. Article summary: Anthropic’s 2025 interpretability work tries to make Claude’s hidden reasoning legible by mapping internal activations into “features” and linking them into “circuits”; it is progress toward an AI “microscope,” not a.... Topic tags: ai, anthropic, claude, ai safety, ai transparency. Reference image context from search candidates: Reference image 1: visual subject "### Anthropic Develops AI 'Microscope' to Reveal the Hidden Mechanics of LLM Thought. Anthropic has unveiled new research tools designed to provide a rare glimpse into the hidden r" source context "Anthropic Develops AI 'Microscope' to Reveal the Hidden Mechanics of LLM Thought -- Campus Technology" Reference image 2: visual subject "Late 2024, Anthropic published a p
在中文语境里,很多人会把大模型理解成“会聊天的黑箱”:它给出的答案看似条理清楚,但答案背后到底经过了怎样的计算,并不会自动摊开给人看。Anthropic对Claude做的可解释性研究,核心就是尝试给这个黑箱配一台“显微镜”——不是看一段模型秘密写下的内心独白,而是让研究者能检查Claude生成文字时的部分内部计算。
大型语言模型在写出每一个词时,背后都有大量计算。Anthropic称,这些策略被编码在模型为每个词执行的“数十亿次计算”中;即使是模型开发者,如果没有专门工具,也很难直接看懂这些计算。
因此,Anthropic所说的AI“显微镜”更像是一套研究仪器:把原本难以理解的神经网络活动,转换成研究者可以命名、观察、测试的结构。这和简单询问“Claude,你刚才为什么这么回答?”不是一回事。后者得到的仍然是一段模型生成的文本;前者试图触及生成文本之前的计算过程
。
Anthropic早期的一条主线,是在模型内部寻找可解释的概念。它把这些概念称为“特征”(features)。
可以把“特征”理解成一个抓手:当Claude处理某个问题时,模型内部会出现海量数字活动;研究者希望从中识别出稳定的模式,并给它一个相对可理解的名字,而不是只面对一堵由数字组成的墙。
这相当于地图的第一层。研究者不只问“Claude最后说了什么”,还会问:在生成这句话的过程中,哪些内部概念被激活了?这些概念是否与答案中的内容、语气或任务有关?
新的关键进展,是从单个特征走向“回路”(circuits)。Anthropic称,其研究把此前定位可解释概念的工作进一步扩展为:把这些概念连接成计算回路,从而揭示输入到Claude的词语如何被转换成输出词语的部分路径。
这一步很重要。单个特征只能说明“某个概念在模型内部出现了”;而回路追踪更接近于追问:这些概念之间如何相互影响?哪个环节推动了下一步计算?哪些内部路径参与了最终回答?
对于看起来像“推理”的行为,过程往往和结果一样关键。一个模型给出正确答案,并不等于研究者理解了它为什么能给出这个答案;回路追踪的意义,就在于试图把中间那段看不见的计算路径勾勒出来。
2025年3月,Anthropic表示分享了两篇相关论文:一篇把“特征”层面的可解释性推进到“回路追踪”,另一篇则把这套工具用于Claude 3.5 Haiku,研究若干简单任务,这些任务代表了十类关键模型行为。
Anthropic还把这类工作称为观察“AI生物学”。这个说法有一点类比意味:如果只看模型最终回答,就像只看一个生物体的外在行为;而可解释性工具则试图进一步观察其内部机制,看看哪些结构和路径可能解释这种行为
。
让Claude解释自己的答案,得到的仍然是一个输出结果。它可能流畅、合理,也可能只是事后组织出来的叙述。Anthropic的机制可解释性研究,关注的是产生这些文字的底层计算,而不是把模型的自我说明直接当作内部过程的证据。
因此,回路追踪提供的是另一类证据:不是让模型“讲讲你怎么想的”,而是用工具观察内部活动如何对应到特征、特征之间如何形成路径,以及这些路径如何参与从输入到输出的转换。
这项工作能让Claude内部的一部分运作更清楚:哪些特征可能相关、这些特征如何连接、哪些计算路径似乎参与了某次回答。它也让研究者有机会把“表面表现”和“内部机制”放在一起比较,而不是只根据最终答案判断模型行为
。
但边界同样重要。Anthropic自己的表述是“迈向显微镜的进展”,并称这些方法揭示的是从输入词语到输出词语路径中的“部分”环节。这意味着,现阶段的工具不能被理解为Claude所有计算的完整解码器,也不能被当成模型每一丝“想法”的可靠逐字记录
。
Anthropic让Claude的隐藏推理更容易理解,靠的是三步:先把部分内部激活翻译成可解释的“特征”,再追踪这些特征如何组成“回路”,最后把这张不完整但可检验的地图用于分析具体模型行为。它的价值在于把AI黑箱打开一条缝;它的局限也很明确——这仍是局部的科学测绘,不是全知全能的读心术
。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Anthropic把这项工作称为迈向AI“显微镜”的进展:目标是观察Claude生成回答时的部分内部计算,而不是读取一段现成的隐藏思维文本[9][10]。
Anthropic把这项工作称为迈向AI“显微镜”的进展:目标是观察Claude生成回答时的部分内部计算,而不是读取一段现成的隐藏思维文本[9][10]。 研究路径是先把模型内部激活整理成可命名、可测试的“特征”,再追踪这些特征如何连接成“回路”,解释输入词语如何影响输出词语[9][10]。
Anthropic已将这套方法用于Claude 3.5 Haiku,并称其为研究“AI生物学”的一部分;但目前工具只能揭示部分路径,不能完整解码Claude的所有内部计算[9][10]。