Meta推出AI编码代理Muse:以下是它与Claude Code和Codex的比较

CN
Decrypt
关注
1小时前

元宇宙是最新的科技巨头,推出了编码代理,争相与领先的人工智能巨头Anthropic和OpenAI竞争。


“我们很高兴推出Muse Code(测试版),这是一个由Muse Spark 1.2驱动的终端编码代理,我们最新的模型,”该公司在一份官方公告中写道。“这标志着我们朝着前沿迈出的下一步,未来还有更大和更强的模型。”





作为一个代理编程工具,Muse Code是为大型代码库的软件工程而构建的。根据Meta的说法,它“在大型代码库中承担复杂的软件工程任务:规划更改、编写代码和验证结果。它可以为每个任务协调多个持久性子代理,更快、更准确地解决困难问题,并减少干预。”


突出的细节是运行时。Muse Code记录每个模型调用、工具运行、审批和编辑到本地事件日志,该日志作为单一事实来源。“这个单一事实来源使得运行时的重放精准且安全:在崩溃后的情况下,代理可以准确地从停止的地方恢复,”Meta说。对于长时间运行的作业来说,这个特性比单纯的速度更重要——而这是竞争对手尚未成为卖点的部分。


它还附带默认技能。“/plan”命令将任务转化为审批驱动的计划,而“/grill”则在该计划上进行压力测试,直到它保持稳定,而“/goal”旨在实现与Hermes类似的目标的成功完成。Meta表示,它将Muse Spark 1.2与Muse Code共同训练,因此核心大语言模型和代理能够协同工作。


基准测试和陷阱


Muse Spark 1.2是针对Muse Spark 1.1的编码集中更新。Meta表示,它“在编码任务上显著扩大了训练计算,同时扩展了训练环境的多样性,改善了代码生成、复杂调试和端到端开发者工作流程。”图表清晰地讲述了这个故事。


在Terminal-Bench 2.1上,Muse Spark 1.2与Muse Code得分82.9%,落后于Claude Code在Opus 5上的得分86.7%,但高于Codex上的GPT-5.6 Terra(81.8%)和Grok Build(81.6%)。




DeepSWE 1.1用于测量代理的编码能力,结果更接近:Muse为59.3%,Opus 5为65.0%,Codex为64.8%。在Meta内部的编码基准测试中,Muse达到了70.6%,而Opus 5为79.4%。


加速图表颠倒了顺序。在超过1000次工具调用中,Opus 5与基线相比获得了最大的增益(大约74-75%),而Muse Spark 1.2的中间水平大约为61-69%,具体取决于运行。Meta的观点是,代理在工具调用累积时不断改进,这正是长远编码器所需的行为。




最有趣的演示是长远和多模态的。在压力测试中,Meta表示Muse Code“在Nvidia Hopper GPU上经过1000多次工具调用(长达24小时)迭代优化GPU内核。”这意味着它能够随时间改进。


还有一个视觉编码的角度。在一个演示中,用户将一段房屋的飞行视频以mp4格式放入终端,而Muse Code“解释视频并生成一个具有预订能力的视觉丰富网站。”将原始视频读取到一个工作网页应用程序是Meta在Muse系列中进行推广的多模态概念。


查看启动讨论:



领域已然拥挤


尽管如此,Meta在这场斗争中有些迟到。OpenAI的Codex已经运行了并行云代理;DeepSeek已经建立了自己的Claude Code竞争对手,而像Hermes或OpenClaw这样的代理工具已经是更具能力的良好替代品。Muse Code的优势在于崩溃安全的运行时和子代理设计,而不是基准测试的优越性。


风险仍然是代理编码的常见风险:在崩溃后恢复并不断调用工具24小时的代理是强大而不可预测的。Meta在押注开发者想要这种自主性,而他们现在就开始推出。


Muse Code在安装后可以通过输入以下命令进行测试:

curl -fsSL https://dev.meta.ai/install.sh | bash


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接