rick awsb ($people, $people)
rick awsb ($people, $people)|2026年08月16日 05:09
前沿模型自主做AI研究实验全解析:它们离全面递归自我改进(RSI)还有多远? 知名机构Prime Intellect今天公布迄今规模最大的ai自主进行ai研究的实验,结果证明最优秀的模型能做到人类最好水平的82% 实验是让一个124M参数的小GPT(规模接近早期GPT-2)验证损失降到3.28以下(验证损失衡量模型在没见过的数据上预测得准不准,数字越低越好,3.28是社区约定的合格门槛) 基线为3290步,人类研究员的纪录约2600步。最强模型Fable 5做到2726步,关闭了基线到人类纪录之间约82%的差距。Opus 5关闭约53.6%,Kimi K3关闭约45%–52%,多数模型仅关闭10%–30%。 表现最好的模型共同点在于:更会选择实验方向、更善于处理基准噪声、会回头重新验证旧的负面结果,甚至自己构建小模拟器和工具。Prime Intellect的harness(尤其Prime Agent)提供持久内核,支持模型自建研究工作流。所有traces、scratchpads与实验设置均已公开。 实验说明模型已能在受限但真实的科研任务上完成人类专家大部分工作,接近人类纪录。自主实验设计、噪声处理、工具构建与长期迭代能力显著提升,表明窄领域自动化R&D已比较接近可用。 但也能看出目前模型的局限与距离:没有原创性突破;没有自我改进——优化的是小GPT训练配方,而非自身架构或智能;任务高度结构化,远非开放式科学发现;可迁移性未知。 当前模型处于“能自主优化已知领域”的阶段。这是通向RSI的关键一步,但距离“能自主发现并实现显著提升自身能力的新方法、形成真正递归闭环”仍有明显鸿沟。主要卡点在原创性与自我改进闭环上。   但基于目前各家疯狂发布新模型的速度,模型在这项测试上全面超越人类研究的时间很可能就是下一次模型版本发布。(rick awsb ($people, $people))
分享至:

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀