rick awsb ($people, $people)|2026年09月09日 03:08
能跑在本地的开源模型2个月能达到openai astra目前的水平吗?
《The Information》援引知情人士称:Astra 用了有限的循环深度(recurrent depth / looped transformer)——生成下一个 token 前,同一组层会对内部状态多跑几圈;报道把这说成提升表现、同时减少可见思维链的一项技术。
如果这是真的,那么这对开源模型来说是一件大好事,因为比起大模型,循环深度对小模型的性能提升更大。
因为循环深度可以让一部分原本需要靠更大参数量获得的能力,改为在推理时靠更多计算换回来。 代价是更高的 inference compute。
更重要的是,循环深度和 MoE 架构存在明显的结构性协同,天然比 dense Transformer 更适合 MoE架构。因为MoE 循环时,每一轮可以调用不同专家,因此同一套共享层可以在不同循环里执行不同计算
之前已经有论文研究发现,通过循环深度技术能让3.5b的模型跑出50b模型的评分
虽然最终无法确认2个月之内开源小模型就一定能达到astra水平,但架构上,显然有更大优势。接下来astra等级的模型的能力可能会以比之前前沿模型更快的速度,被开源小模型赶上
所以。。。
显卡是不是又要再涨价了?(rick awsb ($people, $people))
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接