rick awsb ($people, $people)
rick awsb ($people, $people)|2026年09月03日 20:20
大名鼎鼎的佛拉西斯-肖莱,arc-agi创始人刚刚公布了OpenAI GPT-6 Astra 在全新基准测试 ARC-AGI-3 上的评估结果。 记录了令人瞩目的技术飞跃: 双轨测试表现:在纯粹中立、仅依赖公开笔记的标准测试环境(Standard Harness)下,Astra(max 推理档位)取得了 62.7% 的准确率;而在开放供应商底层状态保留与上下文压缩的适配环境(Provider Adapter Harness)下,Astra(high 推理档位)更是跑出了 99.9% 的成绩。 推理步数与动作效率:在动作效率上,Astra 展现出反常识的高效——高推理档位凭借极少的探索步数完成了关卡,整体 API 调用与 Token 消耗反而低于中档推理。对比 500 名人类受试者的中位数,Astra 在 96.0% 的任务中步数低于人类,平均动作步数减少了 51.7%。 自发工具与符号建模涌现:在沙盒红队测试框架 PRO-LONG 中,模型面对未知规则时自发构建了一套紧凑的领域专用代数语言(DSL)速记,并自行编写了诸如迷宫路径求解器(maze_solver.py)与状态同步脚本(sync_state.py)。 不过肖莱认为,ARC-AGI-3 本质上仍是一个规则完备、封闭确定的离散玩具环境;即使 AI 刷爆了这个榜单,还并不能说明astra已经是agi。 因为人类智能在学习时间尺度、世界模型复杂度以及动作空间上,依然保持着数个数量级(Orders of Magnitude, OOM)的代差。 但如果基于模型发展的速度线性外推,从计算与系统架构的演化路径来看,这三个维度并没有不可逾越的门槛 (而模型发展的速度并不是线性的): 动作空间,门槛最低:在数字符号领域,AI 瞬时调度海量 API 与代码执行的组合自由度早已超越人类;在物理具身领域,随着端到端扩散策略与 VLA 模型的演进,覆盖人类连续多自由度控制主要受制于硬件与工程数据,并无理论死角。 学习时间尺度,以并发弥补单体能力:AI 能通过集群仿真与并行自对弈,在数周内压缩数万年的交互经验,来弥补ai目前还不具备的,类似人类大脑能在数十年中无缝积累认知的能力。 世界模型复杂度,这是最难的部分:ARC-AGI-3 是确定、离散的封闭沙盒,而真实世界充满开放随机性与不可逆物理规律。依赖被动统计拟合(Next-token/frame)极易累积长链条幻觉;人类依靠抓握、摔砸等主动物理干预(Causal Intervention)构建因果,AI 要弥合 4–5 个数量级的复杂度差距,必须深入物理现实承担真实的试错成本。 这可能需要机器人技术的进步,需要大量的物理世界数据和仿真。但归根结底,仍没有理论上的空白,只有工程上的挑战。 所以无论专家们如何定义agi,我们现在要么已经身处其中,要么正站在agi到来的前夜(rick awsb ($people, $people))
+1
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读