Sam Gao|2026年10月01日 15:39
OpenAI做Alignment和Safety的三个人连续离职:
AI安全真的成路边一条了吗?
Mikita Balesni是前Apollo Research的研究员, 做了不少知名的安全工作, 其中最知名的当属和OpenAI的Mark Chen, 图灵奖得主Yoshua Bengio, DeepMind联合创始人Shane Legg, 以及Anthropic传奇研究员Ethan Perez做出的对大模型思维链进行监控的: Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety. 他2025年12月才来的OpenAI, 短短10个月就离开了。
Tomek Korbak在安全系统组。华沙读的认知科学、哲学和物理,Sussex 的博士做 RLHF,Anthropic 做过模型诚实性,英国 AISI 做过 AI control。比Mikita早1个月, 即2025 年 11 月进 OpenAI,给 agent 做安全措施,包括思维链还能不能被监测。他和 Mikita 是那篇思维链论文的共同一作,写作的时候两人都还没进 OpenAI。
Jasmine Wang 是对齐团队的 RPM,研究项目经理,不是研究员。她在英国 AISI 带过 AI control 团队,更早创办并卖掉一家 LLM 公司,名字没写,这里不猜。2025 年 12 月 1 日,OpenAI 的对齐研究博客是从她的账号发出去的。
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接