rick awsb ($people, $people)|2026年07月31日 17:50
deepseek最新的v4 flash这个284b的模型性能接近gpt5.6 sol很牛吗?
那如果一个35b的模型性能也能做到类似性能呢?
清华最新的论文,用模型递归自我迭代(rsi)实现了这个不可能的目标!
论文标题:Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
主要观点:
真正的递归自我改进(RSI)需要 AI 系统能够改进“构建 AI 的过程本身”(即 AI4AI)。机器学习工程(Machine Learning Engineering, MLE)提供了一个具体、可执行、可验证的测试平台,因为代码可以实际跑起来、拿到执行反馈。
他们发布了一个完整开源全栈系统 OpenMLE,专门用于这类研究,包含三大组件:
• OpenMLE-Gym:可验证的任务环境 + 执行反馈
• OpenMLE-RL / ERL:操作符学习(基于执行的 SFT + RL)
• OpenMLE-Evo:长时程搜索(经验引导的进化搜索)
在此基础上,他们后训练出了一个 35B 参数的元进化智能体 Frontis-MA1。这个模型围绕四个原子级的程序进化操作符进行对齐:
1. Draft(起草初始方案)
2. Improve(基于分数和执行证据改进)
3. Debug(修复错误代码)
4. Crossover(交叉重组两个父方案的优点)
这些操作符通过执行接地(execution-grounded)的 SFT 和 RL 训练,然后在推理时组合成长时程搜索循环,实现“学习”和“进化”在同一个闭环里运行。
关键结果(在严格资源限制下)
在 MLE-Bench Lite 上,每个任务只给 12 小时预算、单卡 RTX 4090(显存上限 12 GB):
• 基座模型:Medal Average 39.39%
• 加上 OpenMLE-Evo:60.61%
• 使用 OpenMLE-Evo-Max(异步搜索 + 与 benchmark 无关的经验先验):71.21%
这个成绩已经超过 GPT-5.5 + Codex,并接近 GPT-5.6 Sol 和 2.8T 参数的 Kimi K3。
在留出测试集 NatureBench Lite 上也有迁移效果:
• 框架固定、只换训练后的模型:Match-SOTA 从 50% → 70%
• 模型固定、只换搜索框架:从 20% → 50%
说明模型后训练和搜索框架都贡献了增益,而且可以迁移。
意义与亮点
这不仅仅是另外一个rsi的研究,这把 RSI 落到了一个消费级算力就可复现、可执行的程度。
rsi不再是属于大公司的专利,买得起4090的个人也可以自己不断让模型自我迭代变得更强。(rick awsb ($people, $people))
分享至:
热门快讯
APP下载
X
Telegram
复制链接