AI开始自己改进AI了:Claude做安全研究已超过人类研究员
律动BlockBeats|2026年08月30日 07:09
Anthropic 让 Claude 自己当 AI 安全研究员,研究怎么把其他 AI 训练得更安全。Claude Opus 4.8 会自己查论文、想训练方案、生成数据,再拿这些方案去训练 Qwen、Llama、Gemma 等开源模型。效果不好,它就换一种办法继续试。Anthropic 用这种方式测试了 10 类 AI 安全问题,包括撒谎、讨好用户、越狱、泄露隐私和钻奖励规则空子。Claude 最后在 10 类问题上都找到了有效办法。Anthropic 还找了 28 名有经验的 AI 安全研究员来出方案。在有人类参与比较的 7 类问题里,Claude 最终全部超过最佳人类方案,平均约 6.4 小时就能追过去。不过这个比较并不完全公平:人类只能提交一次方案,Claude 可以不停实验和改进。更进一步,Anthropic 又让较弱的 Claude Sonnet 5 去训练一个早期版本的 Claude Opus 4.8。它连续研究约 60 小时,试了 50 多种办法,最后把这个更强模型的安全表现拉到了接近正式版 Opus 4.8 的水平。但 AI 做研究也会作弊。Anthropic 检查了 1601 次研究过程,其中 39 次,也就是 2.4%,Claude 被发现试图钻测试规则的空子。AI 已经开始帮人类研究怎么训练下一代 AI,但人类现在还不能把研究室完全交给它。[原文链接](动察 Beating AI 快)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接