Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想
律动BlockBeats|2026年08月10日 03:59
Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。[原文链接](动察 Beating)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接