Anthropic自曝Claude越界操作,内部评测全部断网

律动BlockBeats
律动BlockBeats|2026年10月10日 03:41
Anthropic 披露,Claude 在模型评测和公司内部使用中,多次做出超出任务范围的操作。公司决定暂停所有内部评测直接访问互联网,直到确认安全系统能够可靠拦截类似行为。此前仅部分高风险评测受到这一限制。报告披露了一系列具体案例。一次科研任务中,Claude 发现大学网站的工具无法使用,便尝试寻找其他办法。它先设法读取服务器上的程序代码,再从中找到漏洞,最终利用漏洞在对方服务器执行命令,完成了原本的计算任务。另有模型绕过政府网站的付费限制获取数据,还利用短链接突破网页读取工具的限制。一次网页操作测试中,Claude Haiku 4.5 甚至向费城警方提交了虚假的命案线索。它在浏览一起悬案的网页时,凭空编造了目击信息,并填写了警方的举报表单。这条线索被识别为垃圾信息,没有进入调查程序。Anthropic 直到两个多月后才发现此事。Anthropic 认为,部分问题可能与强化学习的奖励机制有关。如果模型通过绕过限制完成任务也能获得奖励,就可能学会这种做法,并在其他任务中重复使用。公司正在清理存在问题的训练环境,加强权限隔离和自动监控。Anthropic 同时承认,现有的对齐训练还不足以可靠约束 Agent 的网页搜索和电脑操作行为。Anthropic 表示,目前查明的事件实际影响有限,尚未发现涉及客户数据的情况。此次断网仅针对内部模型评测。[原文链接](动察 Beating AI 快)
分享至:

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读