對推理模型來說,問題不只是最終回覆是否遵守指令,而是模型在解題過程中的中間推理軌跡,能否留在預期範圍內。
OpenAI 代管的 CoT 可控性論文把 CoT 控制與輸出控制分開衡量。 OpenAI 的公開摘要則指出,在多個前沿推理模型上,CoT 可控性偏低。
換句話說,模型最後看起來合規,並不代表它的推理軌跡同樣可治理;最終答案品質、輸出格式漂亮、指令遵循良好,都不能單獨證明推理軌跡可控。
在目前檢視到的證據中,最直接的模型行為結果來自〈Reasoning Models Struggle to Control their Chains of Thought〉。研究者評估開源推理模型 OLMo-3-7B-RL-Zero-Math 的後續檢查點,發現它控制自身思維鏈的能力下降超過一個數量級。
這不表示所有推理模型都會以同樣方式退化,也不是對 Spud 的直接評測。不過,它足以挑戰一個常見想像:推理軌跡越長、越明確,並不會自動變得更容易控制。OpenAI 代管的 PDF 也把 CoT 可控性與輸出可控性並列比較,進一步提醒:軌跡控制與輸出控制不是同一個指標。
CoT 可控性低,不能簡化成「安全」或「不安全」的單一結論。它在某個面向可能是好事:OpenAI 代管的論文提到,即使給模型某些理由,模型仍可能無法成功逃避監測系統;第三方報導也指出,OpenAI 將弱 CoT 操弄能力視為可能正面的安全信號。
更長的推理軌跡不是免費的。Finding RELIEF 將其方法的一部分定位為避免長推理軌跡的高成本。 Thought-Transfer 研究思維鏈推理模型的投毒攻擊,並報告對抗性推理軌跡可以誘導模型生成過長的推理軌跡。
目前較有建設性的方向,不是相信長推理自然可管,而是加入明確控制:
對任何未來 GPT-5.5/Spud 類模型,或任何會暴露長推理軌跡的推理模型,現有證據支持較保守的評估流程:
最穩妥的預設,是把長推理軌跡當成要評估的證據,而不是自動提供治理的保證。