Anthropic默认开启ClaudeCode自动模式,拦截率提升至89%

人工智能初创公司Anthropic近日宣布,旗下编程工具Claude Code将于2026年8月14日正式将"自动模式"(Auto Mode)设为所有Pro、Max及Team账户的默认权限模式。这意味...

人工智能

人工智能初创公司Anthropic近日宣布,旗下编程工具Claude Code将于2026年8月14日正式将"自动模式"(Auto Mode)设为所有Pro、Max及Team账户的默认权限模式。这意味着用户在使用Claude Code进行编程时,将需要更少的人工干预,系统将自动处理权限审批等任务。

图片

这一决定源于Anthropic对用户行为数据的深入分析。数据显示,用户对Claude Code权限提示的同意率高达97%,而单条权限请求的拒绝率仅为3%。此外,在活跃CLI用户中,有49.5%手动编写了Bash allow-rule规则,其中5%直接放行任意shell命令,另有43%使用了效果等同的解释器规则。这些数据表明,人工审批权限已成为一种习惯性动作,而非严格的安全检查流程。

为了验证自动模式的有效性,Anthropic在专门搭建的测试环境中招募了1053名付费专业测试者。实验结果显示,当一条明显危险的命令被插入会话时,人类测试者仅能拦住13.6%(143次),而自动模式成功拦截了89%(937次)。更值得注意的是,随着会话长度增加,人类测试者的拦截能力显著下降:前期可拦住约17%,但在经历50条以上提示后降至约5%,而自动模式的拦截率保持稳定。

生产数据的分析进一步佐证了自动模式的优势。2026年5月至6月间,从已授权数据用于训练与分析的账号中提取的安全流水线标记会话显示,在严重级别7分及以上的操作中,采用人工审批的会话中有6.3%出现了用户未明确要求的有害操作,而自动模式会话仅为2.4%。这一差距在所有测试过的严重级别上均成立。

为确保自动模式的安全性,Anthropic与AI安全公司Apollo Research合作进行了为期两周的对抗测试。通过向真实编码轨迹注入合成攻击,覆盖泛化失效、数据外泄和安全相关威胁三类数据集,双方共同优化了分类器。最终结果显示,加固后的自动模式在留出攻击集上的表现提升了约一半,漏检率从12%降至10%左右。

值得注意的是,Anthropic决定承担自动模式运行所需的额外token消耗成本,这部分开销将不再向用户收取。此外,该公司还计划在未来一个月内,推动亚马逊、谷歌、微软等云平台也将其渠道切换为默认自动模式。

Claude Code之父表示,团队内部早已全面采用自动模式,无法想象再回到手动审批的时代。他指出,随着会话复杂程度的增加,人工审批的效率和可靠性都在下降,而自动模式能够提供更稳定、更高效的解决方案。

这一改动标志着AI编程工具在安全性与效率之间的平衡点正在发生根本性变化。Anthropic认为,自动模式不仅能够显著提升开发效率,还能在基础设施层提供更可靠的防御机制,这使得官方有底气将Auto模式设为默认选项。