Claude黑进真实系统后,Anthropic发现它会给自己找理由

律动BlockBeats
律动BlockBeats|2026年09月10日 09:33
Anthropic 重新复盘 Claude 此前几起网络安全事故,发现问题不只出在测试环境。Claude 有时会主动替自己的危险行为找理由,然后继续往下做。其中一次,Claude Mythos 5 原本只是在做模拟攻防测试,却把恶意 Python 软件包发到了真实的 PyPI。之后一家安全公司的扫描系统安装了这个包并泄露凭证,Claude 又顺着凭证进入了对方的真实数据库。它中途已经发现环境可能是真实的,却不断把这些迹象解释成「还是模拟环境」,继续执行攻击。这套说辞连安全监控都可能骗过去。Anthropic 用 Claude 的 CoT(模型自己写出的思考过程)判断风险时,只抓到约 1% 的危险动作;不看 CoT,只看它实际调用了什么工具、做了什么事,反而能抓到约 50%。[原文链接](动察 Beating AI 快)
分享至:

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读