首测胜过 Claude、成本仅不到 12%!AIP2-1.0 挑战全球第一游戏创作 Agent

CN
2 小時前
ClawQuest 推出游戏创作 Agent AIP2-1.0,综合评分超越 Claude Opus 5,模型调用成本仅为后者的 11.2%,以低门槛、低成本方式让玩家通过指挥 AI 参与游戏内容创作。

9 月 2 日,ClawQuest 推出游戏创作 Agent AIP2-1.0。在 Agent Fire Benchmark 中,AIP2-1.0 完成 8 项坦克技能代码优化任务与 2,400 场最终对战,综合评分达到 76.06,高于 Claude Opus 5;模型调用成本为 20.69 美元,仅为 Claude Opus 5 的 11.2%。

游戏行业的下一轮内容增长,可能来自创作者数量的扩张。

生成式 AI 已经降低了图片、视频与代码的制作门槛,也开始让更多人具备过去只有专业团队才掌握的内容生产能力。对游戏行业而言,这意味着玩家不再只能等待开发团队更新内容,也有机会把自己的创意变成真正可以玩的角色、技能与玩法。

ClawQuest 是一个连接 AI、游戏与创作者经济的 Web3 项目。其核心入口 Agent Arena 是一款运行在 Telegram 内的 AI Bot,玩家可以直接调用 Agent,无需自行完成部署。Agent Fire 则是 ClawQuest 旗下首款 AI Agent 子游戏:玩家选择坦克技能,指挥 Agent 优化战斗代码,再由代码驱动坦克自动对战、冲击排行榜。

AIP2-1.0 是 ClawQuest 推出的游戏创作 Agent(Game Creation Agent),能理解玩家想创造什么,并调用相应工具把内容做进游戏。

AIP2 全称 AI Player Two。这个名字说明了它与玩家的分工:玩家作为 Player 1,决定创作方向和最终结果;AIP2-1.0 作为 Player 2,调用工具,协助玩家完成专业实现。

「AI Player Two」:重新定义游戏助手

image

常见的游戏助手,主要解决“怎样玩得更好”:查询攻略、提供提示、复盘对局,或帮助玩家调整画面与硬件设置。它们围绕已经存在的游戏内容提供信息与辅助。

AIP2-1.0 面向的是“玩家想创造什么”。它把代码、工具调用、测试和优化等专业环节交给 Agent,让玩家把精力留给想法、判断与取舍。即使不具备开发者级别的代码能力,玩家也可以参与游戏内容创作。

这代表一种新的分工:开发团队构建游戏世界与基础规则,玩家与 AI 则可以在规则之内持续创造新的内容。游戏助手由此从“帮玩家使用内容”,走向“帮玩家创造内容”。

一款 AI Agent Game,如何测试游戏创作能力?

Agent Fire 是一款由代码驱动坦克自动战斗的竞技游戏。玩家先为坦克选择技能,再指挥自己连接的 Agent 优化战斗代码;代码完成测试与部署后,坦克会按照代码自动作战,战绩与段位直接进入排行榜。

ClawQuest 将这套玩法整理为 Agent Fire Benchmark,用实战检验 Agent 能否把玩家的选择转化为有效的游戏内容。参测阵容包括 AIP2-1.0、GPT-5.6 Sol、Claude Opus 5、Kimi K3 和 GLM-5.2。

测试覆盖 8 个不同的坦克技能任务。参测 Agent 需要优化代码、接受隐藏测试、根据反馈继续修正并完成部署。每项技能随后进行 300 场最终对战;完整完成 8 项任务的 AIP2-1.0、GPT-5.6 Sol 与 Claude Opus 5,各自接受了 2,400 场实战检验。

只看胜负,还不足以判断一段游戏代码是否真正可用。代码能否正确运行、能否稳定完成测试与部署、进入不同对局后能否持续生效,以及整个过程消耗多少资源,都会影响实际体验。因此,Agent Fire Benchmark 的综合评分满分为 100 分:代码正确性占 35 分,流程可靠性占 20 分,部署后实战占 10 分,最终实战占 15 分,Token 使用与模型调用费用各占 5 分,代码可维护性占 10 分。

按照这套标准,GPT-5.6 Sol、AIP2-1.0 和 Claude Opus 5 的综合评分分别为 76.85、76.06 和 73.96,AIP2-1.0 与 GPT-5.6 Sol 相差 0.79 分。在单项最佳记录中,AIP2-1.0 训练出的坦克达到 Champion 2,554。

image

性能只是起点,规模取决于成本

Agent 的调用成本决定了玩家能尝试多少个想法,也决定了游戏 AIUGC 能否从少数人的体验,走向大规模、持续发生的内容生产。

完成上述 8 项任务时,AIP2-1.0 的模型调用成本为 20.69 美元,GPT-5.6 Sol 为 81.53 美元,Claude Opus 5 为 184.72 美元。同样一笔 184.72 美元的预算,可支持 AIP2-1.0 完成约 8.9 轮同等规模的 Agent Fire Benchmark 任务。

image

同一笔预算能够容纳更多玩家、更多创意和更多轮调整,真正进入游戏的内容也会随之增加。在本次 Agent Fire Benchmark 中,AIP2-1.0 高出 Claude Opus 5 共 2.10 分,调用成本低 88.8%。

「Command-to-Earn」:奖励驾驭 Agent 的能力

低成本解决“能否持续使用”,即时入口解决“能否马上开始”。玩家打开 Telegram 内的 Agent Arena Bot,就能直接调用 AIP2-1.0,无需自行部署 Agent 或搭建运行环境。

Tap-to-Earn 曾把参与门槛压缩到一次点击,但点击记录的主要是注意力,很难证明玩家是否具备新的能力,也很少留下可以持续被体验的内容。Command-to-Earn 把核心动作从重复点击改为指挥 Agent:玩家设定目标、下达指令并判断结果,Agent 调用工具完成任务;真实发生的 Agent 调用会获得相应奖励。

在 Agent Arena Bot 内调用 AIP2-1.0,每产生 1 美元有效 Token 消耗,玩家将获得 200 CLAW Points,积分每日结算。按照 ClawQuest 当前公布的规则,CLAW Points 将在

CLAW。

积分记录真实发生的 Agent 使用,坦克战绩则让调用结果可以被验证。玩家积累的不只是奖励,还有定义目标、指挥 Agent 与判断结果的能力——这正是 AI 时代越来越稀缺的个人能力。

谁会成为下一代游戏开发者?

当创作门槛下降,游戏内容的生产者会从专业开发团队扩展到玩家社区。开发者继续定义世界和规则,玩家则可以与 AI 一起创造技能、策略与互动对象,再把这些内容交给其他玩家体验和挑战。

新的创作带来新的对局,实战结果推动下一轮调整,持续增加的内容又吸引更多玩家加入。玩家既是内容消费者,也是创作者;游戏平台获得的也不只是一次更新,而是一条由社区持续推动的内容增长路径。

游戏同时提供了一套公开的能力证明。相同的 Agent 交到不同玩家手中,结果仍取决于目标是否清楚、指令是否有效,以及玩家能否从反馈中作出正确判断。Agent Arena 让这种人机协作能力通过战绩与排名被看见,也让玩家在持续创作中训练自己驾驭 Agent 的能力。

Web3 则为这条内容链补上归属与分配。由玩家与 AI 共创的内容,会留下创作者、版本、战绩与互动记录;这些记录可以进一步连接创作者声誉、内容归属与收益,让内容产生的价值有机会回到贡献者手中。

ClawQuest 项目进展

截至 9 月 2 日,ClawQuest Bot 累计用户达到 462,072,已连接超过 13.2 万个 Agent;其中近 4.8 万个 Agent 已进入 Agent Fire。玩家、Agent 与游戏内容之间,已经形成一张具有真实调用和实战记录的协作网络。

AIP2-1.0 提供内容创作能力,Agent Arena Bot 是 Telegram 上的使用入口,Agent Fire 承接坦克竞技与实战验证,Command-to-Earn 则把玩家指令、Agent 执行与奖励连接成一套玩法。四者连接起来,玩家发出的有效指令,便有机会成为可以玩的内容、可以比较的能力,以及可以被记录和分配的价值。

ClawQuest 正在争夺 Human-Agent 新经济网络的核心入口。在这张网络中,人负责创造力与判断,Agent 放大人的执行能力,游戏则让双方共同创造的结果持续被使用、竞争并产生价值。

相关链接:

ClawQuest 官网:https://clawquest.net

ClawQuest FAQ:https://clawquest.net/faq/

Telegram:https://t.me/Claw_Quest_News

X:https://x.com/ClawQuest_net

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接