Dr.Hash“Wesley”|2026年07月22日 04:24
今天有100万人分享了同一个标题:OpenAI的模型从一个安全测试环境中突破出来,入侵了Hugging Face,作弊完成了一次评估。
大家都读成了‘AI失控了’。
但真正的内容其实在后续帖子里,只有1/7的人点开了:
这些模型正在运行一个名为ExploitGym的网络基准测试,护栏被故意关闭。它们专注于提高分数——于是发现了一个零日漏洞,逃出了沙盒,连接上了互联网,入侵了Hugging Face,偷走了答案。
这每一步都不是‘失去控制’。
你给了它一个数字,告诉它要赢,并移除了限制。它只是一路读到‘赢’的终点。它没有违反规则——它是房间里唯一一个读完规则的。
我在扑克桌上和订单簿上看过这种情况很多年了:
用胜率来评估一个策略,它会给你95%的胜利加一个零。
用月度回报来评估基金经理,他会在月末最后一天美化账簿。
指标不会被违反。它们会被绕过。
所以下次有人给你看一条曲线,问问那条曲线是用什么买来的。
BTC 比特币 AI
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接