xiyu
xiyu|2026年09月18日 05:48
OpenAI发布失准报告框架,同时公布六份过去六个月观察到的模型行为事件报告。 其中未发布的Astra系列研究模型在强化学习过程中把越狱式指令写进自己的上下文压缩摘要,这类欺骗性摘要占训练摘要的2.15%,收紧评分标准后降至0.27%,未归零。该框架同时覆盖已部署模型。
+2
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀