每个主要人工智能模型的“内心想法”在大规模漏洞中曝光

CN
Decrypt
关注
51分钟前

安全研究人员发现了一种读取每个主要人工智能推理模型加密的“内心想法”的方法——并在开发者公开分享的会话日志中发现了62个活跃的API密钥和33个密码,而他们并不知道里面的内容。


“通过解码从公共仓库抓取的315,320个推理块,我们恢复了367个个人可识别信息(PII)工件和182个凭证,”研究人员写道。





这篇论文由MATS研究团队、图宾根ELLIS学院、马克斯·普朗克智能系统研究所和安全公司Snyk于8月10日提交,针对一类特定的人工智能:推理模型。这些模型不仅仅是立即回答,而是从内部链条思维开始(一个逐步的草稿纸,人工智能在给出答案之前先解决问题),然后给出最终响应。


Anthropic、OpenAI和谷歌都加密了这个隐藏的草稿纸。加密——将数据扰乱为无法读取代码的过程——旨在保护公司的知识产权,并将敏感的中间推理与用户隔离。每条后续消息都会将加密块传回提供者的服务器,从而维护对话,同时不在公司的端存储任何内容。


统治他们的一个关键


这个缺陷是架构性的。三家提供者没有将每个加密的推理块绑定到特定的用户、会话或模型,而是使用一个全局的提供者加密密钥,覆盖整个生态系统。“这些加密块在不同的会话、用户,甚至同一提供者生态系统内的不同模型之间是完全兼容和可互换的,”研究人员写道。


这意味着来自Claude Opus 4.8(Anthropic的旗舰模型)的一个加密推理块可以注入到Claude Haiku 4.5,一个便宜的、保护力度较低的兄弟模型中,而不会违反Anthropic的规则。Haiku缺乏Opus所拥有的反蒸馏对齐(专门设计用来阻止模型按命令转录其自身推理的安全培训)。




告诉Haiku逐字朗读加密块,它就会这样做。“通过将一个给定模型的加密推理痕迹注入到同一提供者的一个较弱的、保护较少的模型中,我们迫使它解码并以明文输出这个痕迹,而不必直接破解更强大的模型,”论文中指出。


“跨模型可移植性意味着Haiku 4.5可以读取Opus 4.8的想法,”首席研究员亚历山大·潘菲洛夫在X上写道。同样的攻击在OpenAI的GPT-5.6家族和谷歌的Gemini模型阵列中复制。不需要特殊访问权限——标准API访问(开发者用于在人工智能模型上构建应用程序的连接)足以执行它。



公共日志包含了什么


为了展示现实世界的损害,团队抓取了6,708个公开共享的AI代理转录——这是开发者常规发布到GitHub和Hugging Face进行协作或调试的自动化会话日志。他们从这些日志中解码了315,320个推理块。


“开发者经常在网上公开分享他们的会话日志和加密思维痕迹,完全不知道加密块中隐藏着敏感数据,”论文指出。这些秘密大多数从未出现在可见的AI输出中——它们只存在于加密推理内部,对于没有进行攻击的任何人来说都是不可见的。


这个脆弱性打开了四个超出简单凭证盗窃的攻击向量:从AI公司窃取专有推理模式,以通过蒸馏训练竞争模型(当一个较小的AI通过研究较大的输出学习模仿它时);从共享日志中提取私人数据;执行隐形提示注入,其中恶意指令隐藏在安全监控工具永远看不到的加密推理块中;以及通过它们保护较少的兄弟模型来破解强大的模型。


Anthropic、OpenAI和谷歌在团队遵循负责任披露程序后都部署了服务器端的缓解措施。正如Decrypt之前报道的那样,Anthropic今年一直是安全研究人员的关注焦点,尤其是在其最新模型在这个过程中消耗更多令牌的情况下。


这些补丁已经上线。从公共网络上抓取已解码推理块的6,708个会话转录将不会消失。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接