rick awsb ($people, $people)|2026年08月06日 00:30
Prime Agent测试——为什么说RSI时代,0.1%的模型差距可能成为不可逾越的鸿沟?
Prime Intellect发布的Prime Agent是一套让模型长期工作、调用工具、组织子Agent并改进自身流程的运行及测试框架。
测试结果相当惊人:Claude Opus 5在原生Harness下,ARC-AGI-3得分约30.2%;换用Prime Agent后,成绩升至95.5%,略高于95.4%的人类专家基线。GPT-5.6 Sol也从官方Harness的13.3%、优化上下文后的38.3%,进一步升到78.3%。
Prime Agent用测试验证了一个很直白的道理:模型能力差距一旦进入长任务,就不再线性增长,而会沿着执行链条反复累积指数级增长。
Prime Agent通过RLM把上下文变成可编程数据。历史记录、任务状态和中间结果保存在持久Python环境中,模型自主决定写什么代码、提取哪些信息、什么时候调用工具。
强模型更容易建立正确的状态表示,弱模型则可能从一开始就保存错误假设。而接下来每一步,都建立在此前形成的认知结构上。
它还允许模型组建持久的多Agent团队。一个Agent研究规则,一个编写代码,另一个检查漏洞。Prime Agent负责通信、后台运行和状态保存,模型自己决定如何分工、何时并行、如何置信。
这等于把模型的组织能力也纳入Scaling:
会分工的模型获得并行收益;不会分工的模型只会让错误和Token消耗一起扩张。
Continual Harness让模型可以回顾执行轨迹,把有效方法写进Memory和Skill,修改Prompt或调整子Agent配置。
判断正确,成功经验就会持续复用;归因错误,偶然偏差也可能被固化。
以上三个方面都依赖于模型不断纠错优化,依赖于模型的多步执行能力,这就是0.1%差距可能变成鸿沟的原因。
假设两个模型每一步的可靠性只差0.1%,单次比较几乎无法察觉;任务执行数百步,再叠加记忆管理、Agent协调、经验提炼和流程修改,差距便会不断复利。更强模型不仅这一轮做得稍好,还会为下一轮留下更好的工具、记忆和组织结构。形成正向的复利效应。
Prime Agent框架及测试的意义,不仅仅在于用一种长程任务的方法来更深入的测试模型能力,更重要的是展示了在模型的递归自我迭代(RSI)时代,微弱领先的模型可能经过多次迭代后产生的巨大差异。
Prime Agent也告诉我们,scaling law在agentic的层面,还有很多待发掘的新潜力。(rick awsb ($people, $people))
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接