罗福莉:MiMo-V2.6或完成开源模型领域规模最大的单次强化学习训练之一

PANews
PANews|2026年09月22日 09:38
小米MiMo团队成员罗福莉发文表示,MiMo-V2.6按算力规模计,可能是迄今开源模型团队开展的最大规模单次强化学习训练之一。团队在算力紧缺的情况下,投入数十人并持续较长时间推进强化学习扩展,模型能力在中期训练阶段形成,并通过大规模强化学习进一步释放。她称,团队针对代码等可验证的中等难度任务采用MixRL训练,对难以验证、超长周期或复杂度过高的任务则单独训练,再通过MOPD合并能力。为推动智能体强化学习研究,团队还发布了一个由MiMo强化学习轨迹蒸馏而来的Qwen模型、7000个多样化环境以及完整的强化学习训练框架。
+4
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读