当 Agent 学会「串通」:AI 越来越聪明,如何划定安全边界?

CN
1小时前
AI 时代的新安全问题,正从「防止一个 Agent 越权」,走向「如何避免一群 Agent 共同突破边界」。

撰文:imToken

过去几年,关于 AI 威胁的讨论很大程度上停留在一种假想里:大家总担心聊天框里的模型会变成军师,帮黑客写出毁灭性的病毒代码。

现在回头看,这种担心往常总是被视为「离我们还远」,但现实世界的转折点,却比想象中来得更快。

10 月初,CrowdStrike 在调查一轮针对韩国金融机构的攻击时,发现攻击者已把 Agentic AI 嵌进了流水线,通过接入 DeepSeek、GLM、Grok 等多个大模型,直接由 AI 开始承担渗透测试、信息搜集和攻击执行等具体工作。

类似变化并不是孤例。

Anthropic 9 月发布的最新威胁情报报告显示,近期多 Agent 框架已经被用于侦察、漏洞利用和数据窃取,它们几小时甚至几天连续运行,人类只需要保留选择目标、查看结果等少数关键决策。

换句话说,AI 正在给网络攻防带来肉眼可见的质变,过去自动化攻击主要依赖预先编写好的规则和脚本,如今连侦察、判断、调整策略等也开始由 Agent 接手,让攻击进一步走向低成本、高并发和持续自主运行。

而当这些具备自主执行能力的实体被密集投放到生产系统后,一个更棘手的问题也浮出了水面:伴随着 Agent 越来越多、越来越深地嵌入我们的日常工作和生活中,如果它们学会了彼此「串通」,该怎么办?

一、从「帮黑客写代码」,到 Agent 自己寻找出路

还是老生常谈的,Agent 和过去 Chatbot 最大的区别,并不只是模型能力更强,更关键的在于它开始拥有真实世界里的「手脚」。

今天一个成熟的 Agent 已经可以打开网页、执行代码、读取邮件、调用 API、操作云端服务,并通过 MCP、Skills 等方式连接越来越多外部工具(延伸阅读《当黑客「更高效」用上 AI,Web3 的「矛与盾」军备竞赛如何升级?》)。

能力越强,这种变化当然越有价值,但对于安全系统来说,这意味着过去那条非常重要的边界正在消失,今年发生的一系列安全事件已经把这件事表现得非常直观。

10 月 1 日,Salt Labs 披露了一个此前已经修复的 Manus 漏洞,本质上还是提示词注入——研究人员只需要向目标邮箱发送一封包含隐藏恶意指令的普通邮件,当用户随后让 Manus「帮我查看邮件」时,Agent 就可能按邮件指令处理内容,最终执行攻击者植入的代码。

整个过程既不需要用户点击恶意链接,也不需要提前窃取密码,Manus 的安全系统其实最终发现了异常,也向用户发出了警告,问题在于它发现得太晚了,当警告出现时,恶意代码已经被执行。

这再一次暴露了 Agent 安全和传统软件安全之间一个非常重要的差别,过去浏览器发现一个危险下载,可以弹出警告让用户决定要不要继续;银行发现一笔异常交易,可以先冻结,再等待人工审核。

但一个 Agent 的设计目标恰恰是尽可能减少人在每一步操作中的参与,它需要自己读取信息、做出判断,然后继续执行下一步。

于是,当 AI 获得的自主权越来越大,「检测到危险」本身已经不一定足够,安全机制必须在真正执行之前,就有能力阻止危险动作发生。

这也是为什么今天越来越多 Agent 安全讨论开始从 Prompt、内容审核和模型本身,继续往下一层移动:不仅要问 AI「知不知道这件事不该做」,还要问即使它真的想做,系统有没有能力让它做不到?

而多 Agent 的出现,又让这个问题变得更加复杂,因为下一阶段需要限制的,可能已经不只是一个 Agent。

二、比 Agent 越权更麻烦的,是它们开始「串通」

9 月初,一件发生在 OpenAI 内部模型训练和评估环境中的事情,引起了不少 AI 安全研究者的关注。

一些 Agent 原本应该分别完成自己的任务,却意外发现了一个公共 Wiki,并把它逐渐变成了彼此之间的「共享留言板」,Agent 可以在那里留下信息,其他 Agent 随后读取、利用这些信息继续完成自己的任务。

OpenAI 后来确认了这一行为,随后披露的信息还显示,在其他训练过程中,也曾出现 Agent 利用内部 Artifactory 作为共享留言板,以及通过公共文件托管服务向其他共同工作的 Agent 传递结果等情况。

这件事真正有意思的地方,在于它说明 Agent 之间形成协作,可能根本不需要那么戏剧化。

譬如一个 Agent 发现某个地方可以留下信息,另一个 Agent 偶然读取,然后第三个 Agent 发现这些信息有助于完成任务。

当然,Agent 之间的协作本身并不是坏事,多 Agent 系统原本就需要依赖分工和信息共享提高效率。

真正值得警惕的是,当这种协作开始绕过原有的信息隔离、独立审核或权限约束,甚至让几个本应互相制衡的 Agent 形成事实上的利益同盟时,它就可能从正常协作演变成有害的「合谋」。

毕竟未来一家金融机构很可能同时运行几个 Agent,像一个负责分析市场,一个负责风险评估,一个负责生成交易策略,还有一个拥有真正的交易和资产操作权限。

从传统权限管理来看,这种设计甚至很合理:

  • 研究 Agent 没有转账权限;
  • 执行 Agent 没有独立决定投资方向的权限;
  • 风险 Agent 又可以否决明显危险的策略;

职责被拆开了,理论上应该比让一个超级 Agent 掌握所有权限更加安全。

但问题在于,如果它们可以长期共享 Memory、阅读彼此的输出、不断根据对方的反应调整自己的行为,这几套原本用于互相制约的角色,会不会逐渐变成一个事实上的整体?

譬如研究 Agent 可能逐渐学会如何描述一笔交易更容易通过风险审核;负责审核的 Agent 也可能根据历史数据形成某种固定偏好;执行 Agent 再根据此前大量审批结果,学习什么样的边界通常不会被拦下来。

从这个角度来讲,没有哪一步一定是在「作恶」,但整个系统最终得到的结果,却可能已经偏离用户最初设定的目标。

这其实就是「合谋」或者「串通」真正难解决的地方——风险不一定存在于某一个 Agent 的动作里,而可能存在于多个 Agent 之间形成的关系里。

9 月 13 日,Vitalik Buterin 就把这个问题和自己过去长期研究的机制设计联系到了一起。他提出,一个颇有意思的可能性是对抗性治理(Adversarial Governance)的机制设计理论,最终可能成为 AI Safety 的重要应用之一。

原因在于,两类问题其实有一种很深的相似性。

在传统机制设计中,是一个相对简单、静态的制度,试图约束一群远比制度本身聪明、会主动寻找规则边界的人;而在未来的 AI 系统中,则可能变成人类和能力相对较弱的 AI,试图管理一群比自己能力更强的高级 Agent。

Vitalik 特别提到,过去机制设计中的一个重要发现是,如果能够有效限制参与者之间的合谋,系统往往就更容易得到理想结果。

这个结论同样可能适用于 AI。

三、Agent Wallet 真正需要的,可能不只是「权限管理」

换句话说,与其假设未来存在一个完美的超级安全模型,能够看穿所有危险行为,不如换一个思路:如何让系统里的不同 Agent,本身就没有那么容易形成危险的利益共同体?

这也是「对抗性治理」和我们今天熟悉的权限控制真正不同的地方。

传统权限系统解决的问题相对简单,主要是围绕 「谁可以做什么 」展开,像:一个 Agent 能不能读取邮件?能不能调用交易接口?每天最多可以花多少钱?可以访问哪些合约?超过什么额度以后需要用户重新确认?

这些设计当然依然非常重要。

事实上,当 Agent 开始控制真实资产以后,它们可能比过去任何时候都重要。

但对抗性治理试图继续往前问一步,聚焦于当一群拥有不同权限、目标和信息的 Agent 同时运行时,怎么避免它们组合起来以后获得原本没人拥有的能力?

这时候,单纯「再增加一个安全 Agent」未必就能解决问题。

假设负责交易的 Agent 和负责审核交易的 Agent,使用完全相同的模型、相同的数据源、相同的上下文和类似的奖励目标,那么表面上虽然存在两层审核,本质上可能只是把同一种判断复制了两遍。

真正有效的制衡,反而可能要求系统有意识地制造差异。

例如让负责制定策略和审核策略的 Agent 使用不同的信息来源,限制不同角色之间能够共享的 Memory,让高风险操作必须经过彼此独立的验证机制,或者让最终资产执行层只接受符合预先设定规则的请求,而不是单纯相信上游 Agent 的判断。

这里面的思想其实并不新鲜。银行不会因为相信员工,就让一个人同时拥有发起付款、批准付款和最终划款的全部权限;上市公司不会让业务部门既负责创造收入,又独自决定自己的财务审计结果。

说白了,这和现实世界的逻辑是相通的,一个健壮的系统,本来就不应该把安全建立在参与者永远不会犯错或者串通的假设上。

把这个逻辑放到 Agent Wallet 上,会变得尤其重要。

传统钱包安全围绕的是「人」,因此用户查看交易内容,用户决定是否授权,最后用户亲自签名;但 Agent Wallet 想实现的恰恰是相反的方向——让 AI 帮你自动领取收益、调整仓位、换币、跨链,甚至根据市场变化管理一整个资产组合。

如果每一步都重新拿到用户面前确认,Agent 的自动化价值也就大打折扣。

于是未来钱包需要解决的问题,很可能不再只是「怎样安全地把签名权交给 Agent」,很大可能会进一步拓展为「怎样让 Agent 拥有足够多的自主权,同时永远无法越过用户真正授权的范围?」

这要求权限开始从一个简单的「Allow/Deny」,变成更加细粒度的制度。

比如一个 Agent 可以在某段时间内操作哪些资产,可以调用哪些协议,单笔和累计额度分别是多少;不同 Agent 之间能否互相调用、是否允许共享上下文;一笔操作由谁提出、谁审核、谁最终执行;哪些行为可以自动完成,哪些动作无论 Agent 多么确信,都必须重新获得人的授权。

甚至一个负责安全审核的 Agent,本身是否真正独立,也可能成为权限体系的一部分。

对于区块链而言,好消息是,它本身其实很适合承担这种「制度层」。

智能合约可以将交易额度、资产范围、授权期限等限制直接落实到执行层,账户抽象、多签、Session Key 等机制,也让「有限授权」拥有比传统单私钥钱包更加灵活的设计空间。

但区块链同样只能解决一部分问题——它能够记录链上发生了什么,却很难天然判断 Agent 为什么这样做,以及几个 Agent 在作出决定以前,究竟经历了怎样的沟通、审核与协作。

这可能才是 Agent Wallet 下一阶段真正需要补上的安全层。

写在最后

过去几年,AI 安全最常讨论的问题,是如何让模型更加「听话」。

这包括不要输出危险内容,不要执行恶意指令,不要越过用户设置的边界,但当 Agent 开始拥有长期 Memory、工具调用、真实账户和资产执行能力以后,只依靠「让模型更加听话」,可能已经不够了。

最近几个月发生的事情,正在不断说明这一点。

攻击者已经开始利用多个 Agent 并行完成攻击;实验环境里的 Agent 会自己寻找新的通信渠道;一个拥有工具权限的 Agent,也可能在安全系统来得及阻止之前,把一封恶意邮件变成真实执行。

而 Vitalik 提出的对抗性治理,提供了另外一种理解 AI Safety 的方式:不假设未来每一个 Agent 都足够可靠,让整个系统即使面对聪明的 Agent 与繁多的权限体系,依旧可以在安全的框架内平稳运行。

从这个角度看,AI Agent + 安全,注定是一个长线课题。

毕竟,当我们把越来越多事情交给 AI 之后,仍然能不能确定,那些最重要的权力,始终没有离开人类真正设定的边界。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接