OpenAI提出前沿AI训练「安全论证」框架,建议开跑前先过安全文档
律动BlockBeats|2026年09月29日 06:13
OpenAI 官方发布长文《Towards safety cases for frontier AI training》(面向前沿 AI 训练的安全论证)。文中提及,前沿强化学习训练在继续推进前,应先完成结构化安全文档,理想形态对标航空、核电行业的「安全论证」。公司承认,因能力跃迁后的涌现复杂性,AI 很难做到与传统高危行业同等严谨,目前该框架仍在内部落地并面向外界征求反馈。OpenAI 明确只覆盖前沿 RL 训练,内部及对外部署还需另看更广的对齐属性。技术侧,OpenAI 将安全论证拆成对齐训练、隔离与监控三层。对齐方面包括自动/人工审查 RL 环境、调校评分器以防奖励黑客、离线对齐评测与回测,以及禁止自动评分器读取思维链,避免模型学会躲避监控。隔离方面强调多层沙箱与基础设施加固、用训练检查点做红队、限制样本间高带宽通信,并用一次写入存储固化对话记录。监控方面要求模型保持可监测性,对历史事故高召回,新增风险及时补评测,高优先级告警须在约定时限内人工响应或自动暂停训练。运营侧建议包括:由其他团队写异议预演、高管(研究负责人、安全负责人、首席科学家等)可一票否决开跑、训练负责人对安全论证和事故响应问责、安全论证失效时按手册暂停、向内部监督委员会公开、给审计方足够核验权限、设错位严重度分级并允许值班人员呼叫 CEO。系统应默认失败关闭,无法在无监控状态下开跑;同时要能回滚被错位模型污染的下游数据与评分。事故调查方面,OpenAI 提出对标航空调查实践:调查期间对内滚动通报、用消融和重采样追溯训练动力学、做运营与文化复盘、开发不直接拟合事故样本的检测评测,并以事故衍生评测做回归测试。调查结论、复盘与流程改动应在结束后对外披露,受影响第三方应尽快获知。[原文链接](动察 Beating AI 快)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接