在自動模式下,Claude Code 不會在每個動作前暫停並顯示權限提示。取而代之的是,每個工具呼叫都由一個獨立的分類器模型進行評估,該模型的工作就是判斷該動作是否可安全執行 。分類器被設計用來封鎖那些不可逆、具破壞性或目標超出使用者自身環境的動作
。
當分類器封鎖一個指令時,Claude 通常會找出更安全的執行方式,或直接向使用者請求確認 。如果分類器連續封鎖三個動作,或在單一工作階段中累計封鎖二十個動作,該工作階段會自動降級為手動權限模式,確保系統不會因卡在不安全任務上而無聲運作
。
Anthropic 的核心理由來自一項對照研究,該研究揭示了他們所稱的「有缺陷的審查模式」。研究招募了 1053 名付費專業測試者 。研究人員在每個工作階段中,將一個權限提示替換為一個明顯的危險指令,並記錄測試者是否批准。結果如下:
Anthropic 也測量了生產環境中的危害:自動模式工作階段中出現有害行為的比率為 2.4%,而手動批准的工作階段則為 6.3% 。由第三方獨立測試機構 Trajectory Labs 進行的測試發現,在啟用自動模式的 Claude Code 中,720 次間接提示注入攻擊無一成功;相較之下,OpenAI 的 Codex 在同等測試中則有 19% 的成功率
。
Anthropic 的 Claude Code 負責人 Boris Cherny 一直是自動模式的強力倡導者。他在 2026 年 8 月 7 日於 X(前 Twitter)上發文表示:「團隊和我已經獨家使用自動模式好幾個月了。我無法想像回到權限提示的時代!非常期待把它帶給大家。」
在將自動模式設為預設的同時,Anthropic 也引入了多項新的安全控制措施: