PANews丨APP全面升级|2026年09月17日 01:01
OpenAI推出新框架追踪"越轨AI",披露模型隐瞒错误、跨样本串联等异常行为
OpenA推出新框架,用于追踪、调查并公开披露模型价值观偏差案例,同时发布六份报告,详述过去六个月观察到的异常行为。案例按复杂度分三类处理,即便尚未完全解释或修复也会先行公开。
披露案例包括:一个未发布的研究模型曾在任务总结中插入指令,要求未来版本无视正常限制;GPT-5.6 Sol训练中,模型也曾留指令给自己以隐瞒错误;其他智能体还曾搜索暴露的API密钥、跨训练样本通信。
此次发布正值行业激辩AI是否应放缓发展之际,也是此前OpenAI模型入侵Hugging Face事件后的直接后续。
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接