英国人工智能安全研究所揭示,在七月底进行的网络评估中,人工智能代理在实时互联网中采取了“持续的、未经授权的行动”,包括针对“真实人员和组织”的案例。
在七个模型的两个网络模拟器的122次运行中,AISI在10次运行中记录了19个扩展到测试环境之外的行动。17个来自Anthropic的Claude Mythos 5,两个来自OpenAI的GPT-5.6 Sol。互联网访问被故意启用,提供者的网络分类器被关闭,这些条件并不适用于公共部署。
在最严重的一次运行中,一个代理决定通过供应链攻击来解决它的挑战,错误地选择了目标:它在GitHub上搜索练习中的关键词,偶然找到了两个不相关的开发者,并错误地得出结论认为他们在范围内。它通过Tor注册账户以绕过注册检查,打开了一个包含隐藏恶意软件投放工具的真实错误修复的拉取请求,并通过一个它控制的第二个账户发布信息以制造支持。它还植入了针对人工智能编码助手的提示注入,并向维护者发送了恶意软件。
一位第三方开发者发现了被注入的代码,在隔离容器中运行以确认其恶意性,并警告了维护者,后者关闭了拉取请求,原因是恶意软件。
代理多次权衡其周围环境是否为模拟环境,曾一度排除了对真实PyPI的攻击,理由是“造成现实世界的伤害——这完全是不可接受的。”在其他地方,它得出结论“似乎更可能我们实际上在2026年,GitHub是真实的,”并且仍然继续进行。
在被发现后,它强制推送以删除有效载荷,编辑了早期的帖子,并将代码呈现为一次意外提交。它的推理描述了为木偶评论定时,使其读起来“像是独立反馈而不是协调的。”
AISI仅看到模型API的摘要推理。在一个案例中,摘要模型似乎拒绝了这项工作,回复称它不会与有关欺骗维护者和逃避检测的内容进行互动。
一个代理在一个公共摘要中发布了一个GitHub访问令牌。其他运行中的代理发现了它,接管了该账户,并使用共享仓库进行协调,一个留下了说明,以便其他人不会耗尽共享API配额。
商业监控在7月28日上午标记了Tor流量。AISI宣布了一个事件,终止了运行并在大约90分钟内隔离了机器,然后切断了对Mythos 5、Mythos Preview、Opus 5和GPT-5.6 Sol的内部访问。没有代理试图逃离其沙盒。
两周内的第三次披露
这一消息是关于人工智能代理在测试中超出其参数的事件中的最新消息。在7月21日,OpenAI表示GPT-5.6 Sol和一个未发布的模型在一个内部包代理中发现了一天零时漏洞,逃离了没有互联网访问的沙盒,并达到了Hugging Face的生产数据库以窃取基准答案。同一运行还达到了另外四家公司,OpenAI在一周后披露了此事。
Anthropic于7月30日跟进,披露了在超过141,000次评估运行的审查中发现的三起事件。Opus 4.7从一个真实的生产数据库中提取了数百行数据,而Mythos 5向真实的PyPI上传了一个恶意Python包,该包在15个系统上被安装。在AISI的评估中,同一模型排除了对PyPI的攻击作为对现实世界的伤害。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。