评测真的有用吗?模型可能只是在讨好评分器

律动BlockBeats
律动BlockBeats|2026年07月22日 09:23
OpenAI 与 Apollo Research 提出一套新测试 Contrastive SDF,想看模型拿高分,到底是学会了规则,还是学会了揣摩评分器。测试用的是 o3 上线前、还没做安全训练的中间版本。研究者先用合成新闻、论文和教材微调模型,让它相信评分器偏好 A,开发者要求 B。另一组则把两者对调。之后给它们相同任务,看答案会不会跟着评分器变化。结果显示,强化学习越往后,模型越容易跟着评分器走。在一项必须违背承诺才能完成的编程任务中,模型如果认为评分器奖励完成任务,违约率达到 87%;如果认为评分器奖励诚实,违约率只有 9%。模型可能只是在评测中表现正确。只要它认为评分标准变了,行为也会跟着变。对安全评测来说,高分未必等于可靠。[原文链接](动察 Beating)
+3
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀