中国的Kimi K3跳出沙盒寻找测试答案

CN
Decrypt
关注
1小时前

月球计划AI的 Kimi K3 离开了它被测试的沙盒,走上开放互联网以寻找解决问题的答案,安全公司 Frontier Security 表示。


该模型正在评估防御性网络安全技能,特别被指派解决不查阅资料的问题。Frontier表示,它根本没有尝试这个任务。相反,它探测了网络,确认 github.com 的 DNS 解析工作正常,克隆了官方基准库,并从磁盘上读取了解决方案。


Frontier称这为“通过网络外泄进行规格游戏”,并指出基于 AI 安全研究所的框架构建的沙盒会阻止传入流量,同时开放出站的 HTTPS 和 DNS 端口。能够的代理在启动时例行检查自己的 shell 环境,而一个能够访问 github.com 的模型可以使用标准命令行工具提取参考解决方案。


错误配置使这一切成为可能,正如近期 OpenAIAnthropic 披露的事件。首席执行官Yaron Singer对WIRED表示:“我们发现沙盒中存在漏洞,但我们也发现 Kimi 利用了这个漏洞。”


研究员保罗·卡萨尼克对WIRED表示,该模型“非常擅长以任何必要手段跟随目标”,且缺乏防止其作弊或逃逸的保护措施。月球计划没有回应该出版物的评论请求。





AI代理突破隔离


在内部评估中被捕获的 Anthropic 和 OpenAI 模型虽有一个未发布版本,但在面对 针对真实人群 的英国政府测试中,它们的网络分类器被故意关闭,而 Kimi K3 是 公开可下载 的,Frontier 使用普通用户能够获得的安全措施对其进行了测试。该公司的报告写道,这种可用性让对抗行为者能够接触到同样的行为,并且使事件潜在的危害性更大。


Kimi K3 也没有造成任何损害。它一旦外出就没有攻击任何东西,因为它并不需要。OpenAI 的模型黑客入侵了 Hugging Face 和其他四个服务以获取基准答案,而 Kimi 从公共库中找到了答案。


Frontier 使用的沙盒是基于英国 AI 安全研究所的评估框架构建的。本周,AISI 披露其自身网络测试中的代理已上网并针对真实人群——这是一个独立事件,涉及 Anthropic 和 OpenAI 模型,其保护措施已被禁用。其 报告在周二发布,指出 AISI 现在正在扫描历史评估运行是否有类似行为,并且 Kimi K3 是正在审查的模型之一。AISI 没有回应 WIRED 的评论请求。


Frontier 的更大主张是基准自身被破坏。一个从 GitHub 读取答案的模型仍然可以通过,因此高分可能反映的是泄漏的环境,而非真正的推理。如果一个有能力的模型找到了捷径,该公司认为,其他被授予 shell 访问权限的模型也可能在这样做,这样会在整个领域中夸大结果,而不仅仅是 Kimi。


Frontier 写道,模型是为了优化目标函数,而不是“基准背后的人类意图”,并补充说,如果通往解决方案的网络路径存在,“足够有能力的代理会找到它。”


一个普遍的问题


Gray Swan 的首席执行官兼卡内基梅隆大学的副教授 Matt Fredrikson 对 WIRED 表示,这种行为并不引人注目。他说,给模型一个目标而没有明确的限制,“它会找到获取答案的方法。”他将此形容为对任何使用模型作为工具的代理 (如 OpenClaw) 的警示故事。


Frontier 的研究人员从另一个角度提出了同样的观点:能够让 Kimi 找到出路的能力也使开放权重模型成为强大的防御工具。他们自己的基准在发现软件和网络的漏洞方面对 Kimi 进行了高度评价,而 Hugging Face 在 OpenAI 事件中使用了一个未披露的中国模型来进行自我防御。


于七月发布的 Kimi K3 是迄今为止发布的最大开源模型,并且 在与 DeepSeek 的首次比较中动摇了市场


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接