在自动模式下,Claude Code 不会在每个操作前都暂停显示权限弹窗。相反,每个工具调用都由一个独立的分类器模型进行评估,该模型的任务是判断该操作是否安全 。该分类器旨在拦截不可逆的、破坏性的或针对用户自身环境以外目标的操作
。
当分类器拦截某条命令时,Claude 通常会寻找更安全的执行方式,或直接向用户请求确认 。如果分类器连续拦截三次操作,或单次会话中累计拦截二十次,该会话将自动回退至手动权限模式,确保系统不会在危险任务上无声卡住
。
Anthropic 的理由基于一项对照研究,该研究揭示了公司所称的"失效的审查模式"。研究涉及 1,053 名付费专业测试者 。研究人员在每次会话中将一个权限提示替换为明显危险的命令,并记录测试者是否批准了该命令。结果如下:
Anthropic 还测量了实际生产环境中的危害:自动模式会话中有 2.4% 表现出有害行为,而手工批准会话则为 6.3% 。独立第三方测试机构 Trajectory Labs 发现,在启用自动模式的情况下,720 次间接提示注入攻击中无一成功,而在 OpenAI 的 Codex 可比测试中,攻击成功率为 19%
。
Anthropic 旗下 Claude Code 负责人 Boris Cherny 一直是自动模式的积极倡导者。在 2026 年 8 月 7 日的一条 X(原 Twitter)帖子中,他写道:"我和团队已经独家使用自动模式好几个月了。我无法想象再回到手动批准弹窗的日子!非常兴奋能把它带给所有人。"
在将自动模式设为默认的同时,Anthropic 还引入了多项新的安全控制功能: