头雁|2026年10月07日 11:14
持续学习领域另一家重要的公司,是 Richard Sutton(2024 图灵奖得主)今年7月他与前学生 Khurram Javed 在加拿大成立 的Oak Lab(两人此前都在 John Carmack 卡马克[Doom核心架构师]的 Keen Technologies),不知道什么原因选择了离开了Keen,Keen的方向也是物理世界模型的RL+持续学习方向。
而Oak Lab方向是基于强化学习、从实时经验持续学习的智能体,目标之一是“万亿参数、实时学习与规划、约 20 瓦功耗”。
深入看这家公司,就必须看Richard Sutton之前的一些研究。
OaK 是 model-based RL 架构,强调持续学习 + 抽象发现。主要特点有三个:
1/所有组件持续学习(continual learning):没有“训练后冻结”阶段,智能体在运行时不断从经验中更新。
2/每个权重有专用 step-size(学习率)参数,通过在线交叉验证进行元学习(meta-learning),以更好地泛化。
3/持续创建状态与时间抽象,通过 FC-STOMP 进展(五步循环):
Feature Construction(特征构建):从现有状态特征生成新特征。
posing a SubTask(提出子任务):基于高排名特征定义子问题(例如“实现某个特征”)。
是终止条件。
learning an Option(学习 Option):解决该子任务的策略 + 终止条件。
Option 是(π,γ)对,其中π是策略(状态到动作分布的映射),γ 是终止条件。
learning a Model of the option(学习 Option 模型):预测执行该 Option 直到终止的后果(高层次转移模型)。
Planning using the option’s model(用模型规划):基于这些抽象进行更高层次规划。
要搞明白他这套体系一些资料,可以研究:
Reward-Respecting Subtasks for Model-Based Reinforcement Learning
OaK 的核心创新:
持续创造抽象(FC-STOMP 循环)OaK 最关键的地方是它会自己不断创造状态抽象和时间抽象。
这个过程叫 FC-STOMP 进展(有时也简称 STOMP):
Feature Construction(特征构建)
1/从现有特征中创造出新的状态特征。
2/posing a SubTask(提出子任务)
针对那些权重会波动的特征,自动提出“尊重奖励的特征达成子任务”。
3/learning an Option(学习 Option)
解决子任务,得到一个可以持续多个时间步的高级技能(时间抽象)。
4/learning a Model of the Option(学习 Option 模型)
预测执行这个 Option 后的状态和累积奖励。
5/Planning using the Option’s Model(用模型规划)
用这些高级模型进行更高效的规划,反过来改进策略和价值函数。
元学习:
靠人工调学习率解决不了,必须让系统自己学会“什么时候该学得快、什么时候该学得慢”。
为什么 OaK 特别强调元学习?
靠人工调学习率解决不了,必须让系统自己学会“什么时候该学得快、什么时候该学得慢”。
因为智能体要终身持续学习:
-环境会变化
-新的特征、新的 Option 会不断出现
-旧的知识有时需要快速修改,有时需要保护
靠人工调学习率解决不了,必须让系统自己学会“什么时候该学得快、什么时候该学得慢”。
我的研究后感受:
总之这家公司还是有很多不一样的地方,里面很多概念在LLM里是没有的,所以我把这家公司归类的RL公司。另外我看下的感受,他想要在很多环节自动化掉,比如自动化生成子任务,使用Option 这种概念,把跨越多个时间步的一段行为打包成一个整体:一段连续的动作。比如元学习,不人工设定参数,核心是很多子任务是自动的,没法人工去调所有动态生成的子任务。包括他们最新的反向传播的一些新算法。
The Alberta Plan for AI Research
https://arxiv.org/abs/2208.11173
Reward-Respecting Subtasks for Model-Based Reinforcement Learning
https://arxiv.org/abs/2202.03466
The Option-Critic Architecture
https://arxiv.org/abs/1609.05140
OptionZero: Planning with Learned Options
Options 框架基础实现
https://github.com/theophilegervet/options-hierarchical-rl
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接