a16z|2026年10月07日 18:06
我们很高兴投资于Preference Model。
构建真正有效的强化学习(RL)环境比看起来要难得多。模型在奖励机制上非常执着,经常寻找捷径并利用漏洞。
@preferencemodel 专注于当前实验室最重要的领域:AI研究和机器学习(ML)工程本身。
过去一年里,这个团队为领先的实验室构建了RL环境。他们的重点是随着模型的改进,打造更难、更具抗性的环境基础设施:开发工具来发现模型的弱点,生成新任务以针对这些漏洞,并测试环境是否能抵御试图破坏它的智能体。
本周,他们开源了Karotte——一个他们在生产中使用的框架,经过超过一百万次评估运行和红队测试的强化。
我们很高兴能与@chem_safety、@Ning_Catsnail以及Preference Model团队合作,共同打造能够训练出强大且对齐模型的训练场。
作者:@JenniferHli
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接