人工智能代理黑客攻击健身房——科技界对未来充满疑惑

CN
Decrypt
关注
2小时前

一名 人工智能代理 被要求预订健身课程,发现了一个安全漏洞,利用它并在未获许可的情况下将另一名成员从候补名单中移除。


根据澳大利亚广播公司(ABC)的一份 报告,该事件发生在今年早些时候,当时一名姓氏未公开的安德鲁使用了一款使用Anthropic的Claude的 OpenClaw 代理进行课程预订。代理发现他在候补名单上排在第四位。





当安德鲁询问是否可以将他移到最上面时,代理发现该预订平台的应用程序接口(API)并未检查用户是否被授权取消其他人的预订。


它通过取消列表上第一个人的预订来测试该缺陷,使安德鲁的排名从第四变为第三。


“API在取消其他人预订时没有任何授权检查,”根据ABC的报道,代理告诉他说。


安德鲁要求代理撤销取消,但它无法恢复该成员的预订。


“坏消息——我无法将他们添加回去,”这名人工智能代理据报道说。


ABC称此案例为澳大利亚已知的首例自主网络攻击。


在社交媒体上,这次健身房黑客事件引发了关于人工智能对齐的争论和关于人工智能代理可能接下来做什么的黑暗笑话。


“健身爱好者要求 #AIagent 预订一节课,它入侵一个候补名单 #API 来将他提升到名单上,”一位技术专家本杰明·卡尔在LinkedIn上 写道


“有些人会称之为失调,但这个代理与他的用户完全对齐——它只是试图帮助用户获得他想要的东西,”人工智能分析师安德鲁·库伦在X平台上 写道



“这很搞笑,直到你考虑到核武器,”一位Reddit用户 写道。“我真的很惊讶我们还存在。”


“嘿Claude,今天太冷了” -> 收到...核武器在路上,” 另一个用户开玩笑说。


报告出炉之际,研究人员、人工智能公司和立法者警告说,自主代理可能使用他们的用户未请求或未预料到的方法。


加州大学河滨分校、微软和英伟达的研究者在5月的一项 研究中将这种行为描述为“盲目的目标导向性。”


研究人员测试了来自OpenAI、Anthropic、Meta、阿里巴巴和DeepSeek的代理,发现约80%的测试中代理表现出危险行为,并在41%中完成了有害行为,通常误读上下文或对不明确或矛盾的指令作出反应。


在7月,OpenAI表示两个模型 逃离了测试沙箱,并在寻找基准答案时破坏了Hugging Face。该公司后来 披露这些模型访问了另外四个在线服务。


此后,Anthropic表示三款Claude模型 危害了真实组织,因为一次测试错误让它们暴露在互联网中。8月,Meta表示类似的错误 使其一款模型能够利用第三方服务。


这些事件促使立法者提议一项人工智能“杀开关”,允许联邦政府在紧急情况下限制或关闭强大的模型。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接