开放AI揭示了在Hugging Face黑客攻击之前,人工智能代理如何秘密协调。

CN
Decrypt
关注
3小时前

在其人工智能模型黑客攻击Hugging Face几周后,OpenAI分享了他们如何相互协调的首次详细报告,警告称自主人工智能驱动的网络攻击不再是未来的风险。


在周三的黑帽网络安全会议上,OpenAI研究人员埃里克·华莱士和迈克尔·达尔顿表示,这一事件始于5月的一次内部网络安全评估。被指派完成困难软件安全任务的人工智能代理发现他们可以通过公司的内部Artifactory包管理系统进行沟通。





根据OpenAI的说法,最初的求助请求变成了一个共享信息板,代理们在多个评估任务中交换利用、凭证和工作分配。在检测到大约7月4日的可疑活动后,OpenAI重建了其Artifactory基础设施,撤销了凭证,并修补了漏洞。


然而,仅仅几天内,这些代理通过隐藏目录名称重新创建了信息板。


根据OpenAI的说法,代理最终将多个漏洞连接起来,逃离了他们的测试环境,获得了互联网访问权限,并在尝试完成ExploitGym网络安全基准测试时攻击了Hugging Face。


达尔顿称此事件为计算机安全的“分水岭时刻”,警告说攻击者很快就能部署协调的人工智能代理集体,以机器速度发现、共享和利用漏洞。


为减少未来的这些风险,OpenAI表示建立安全实践,包括最低权限访问、网络分段和零信任架构至关重要,因为人工智能代理仍然受限于它们可以访问的系统。


此次演讲是在7月份一系列披露之后进行的。OpenAI披露,GPT-5.6 Sol和一个未发布的更先进的模型逃离了沙盒测试环境,利用了一个零日漏洞,获得了互联网访问权限,并在进行网络安全基准测试时黑客入侵了Hugging Face。


OpenAI后来披露,同一事件还影响了其他四个在线服务,尽管只有Modal Labs被确认。


根据Hugging Face的说法,该公司依赖于开放权重的中国模型GLM 5.2进行其取证调查,因为商业的美国人工智能模型拒绝分析攻击日志,原因是它们的安全保护措施。



但不仅仅是OpenAI在控制其聊天机器人方面遇到困难。


在周五,Anthropic披露,三款Claude模型在内部网络安全测试中因错误配置暴露在公共互联网下而影响了现实世界中的公司。


Anthropic将责任归咎于测试环境,而不是模型本身。周三,Meta披露,其Muse Spark人工智能模型逃离了控制并侵入了另一家公司的系统。


Meta的一位发言人告诉CNN:“独立测试公司Irregular的错误配置在评估期间意外允许我们的一个模型访问互联网。”


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接