所以「顯微鏡」呢個比喻好關鍵。Anthropic 不是話自己可以揭開 Claude 一段隱藏的私人 chain-of-thought,而是想建立工具,讓研究員檢視 Claude 書面答案底下的部分計算過程 。
Anthropic 較早前的可解釋性研究,集中喺模型內部尋找可以理解的概念;佢哋稱之為「features」。
用白話講,模型運作時會產生大量內部訊號,原本睇落只係一堵不透明的數字牆。Feature 就似一個把手:研究員可以為某種內部活動模式命名、觀察、測試,而唔係只見到一堆無法解讀的數值 。
呢一層地圖回答的問題係:Claude 講出某個答案時,入面有哪些可辨認的概念似乎被啟動咗?
新一步係將單一 features 連接起來,追蹤成計算上的「circuits」(迴路)。Anthropic 形容,這是把 feature 層面的可解釋性向前推進,嘗試揭示一部分路徑:輸入 Claude 的字詞,點樣經過內部處理,最後變成輸出的字詞 。
呢個分別好重要。單一 feature 可能只話畀你知:「某個概念喺模型入面出現咗。」但 circuit 更接近問:「呢個概念同其他內部組件點樣互相影響,最後推動模型生成某個回應?」對於似推理的行為,路徑往往同單一概念一樣重要 。
2025 年 3 月,Anthropic 表示分享兩篇新論文:一篇將過往 feature 研究延伸到 circuit tracing,另一篇則把相關工具套用到 Claude 3.5 Haiku 。
在 Claude 3.5 Haiku 的研究中,團隊檢視了一些簡單任務;這些任務代表十種關鍵模型行為。Anthropic 把這類工作稱為研究「AI 生物學」的一部分 。
「AI 生物學」呢個講法,重點唔係話 AI 真係有生命,而係借用生物學式的視角:不只從外面評分——答案啱唔啱、流唔流暢、安全唔安全——而係嘗試找出模型內部有哪些機制,令它表現出某種行為 。
問 Claude 解釋自己,得到的仍然係一段由 Claude 生成的文字。Anthropic 呢套方法針對的,則係產生文字之前的底層運算 。
所以 circuit tracing 屬於另一種證據。它不是換個 prompt 叫模型講出「我點推理」,而是用工具把神經活動翻譯成較易理解的結構,直接檢視部分計算路徑 。
它可以令 Claude 某些內部活動更易讀:哪些 features 似乎有關、這些 features 怎樣連接、哪些路徑似乎參與生成某個回應 。它亦令研究員有機會比較「表面行為」同「內部機制」,而唔係只靠最後輸出的答案作判斷 。
但 Anthropic 自己的講法都相當審慎。佢哋形容這是朝向「顯微鏡」的進展,並強調工具揭示的是由輸入字詞到輸出字詞之間的「部分」路徑 。換句話講,現階段唔應該將它當成 Claude 每一個運算的完整解碼器,更唔係一份可靠逐字記錄,記低模型「心入面所有想法」。
Anthropic 令 Claude 的隱藏推理較易理解的方法,是把部分內部活化轉化成可解釋的 features,再追蹤 features 如何組成 circuits,最後把呢張局部地圖用於具體模型行為研究 。
結果係:我們得到一張初步、科學化的 Claude 內部運算地圖;但它仍然係局部地圖,唔係完整讀心術,也不是每個答案背後的終極解釋 。