近日,Meta正式推出其AI编程代理产品Muse Code(测试版),正式加入与Anthropic和OpenAI在AI编码领域的竞争。Muse Code由Meta最新模型Muse Spark 1.2驱动,定位为面向大型代码库的终端代理工具,能够规划代码变更、编写实现并验证结果。Meta表示,该代理可协调多个持久化子代理并行处理复杂软件工程任务,减少人工干预,提升解决难题的速度与准确性。
Muse Code最突出的设计是运行时机制。它会把每一次模型调用、工具运行、审批操作和编辑记录到本地事件日志中,形成“唯一事实来源”。Meta称,这一机制使得运行时具备“回放精确”和“崩溃安全”的特性:即使代理因故障中断,也可从断点精准恢复执行。对于长时间运行的任务而言,这一功能比单纯的速度更具实际价值,也是当前竞品尚未作为核心卖点强调的部分。
此外,Muse Code内置了多个默认技能。例如:/plan指令可将任务转化为需审批的分步计划;/grill指令用于对计划进行压力测试直至其稳定;/goal则驱动代理落实目标,类似Hermes所实现的效果。Meta还透露,Muse Spark 1.2与Muse Code采用联合训练方式,使大模型与代理协同配合更高效。
在基准测试方面,Muse Spark 1.2相较1.1版本在编码任务上显著增加训练算力,并扩展了训练环境多样性。官方数据显示,在Terminal-Bench 2.1测试中,Muse Spark 1.2配合Muse Code取得82.9%的成绩,低于Claude Code(基于Opus 5)的86.7%,但高于GPT-5.6 Terra驱动的Codex(81.8%)以及Grok Build(81.6%)。在考察代理编码能力的DeepSWE 1.1评测中,Muse得分为59.3%,落后于Opus 5的65.0%和Codex的64.8%。Meta内部编码基准上,Muse为70.6%,Opus 5为79.4%。
在工具调用效率提升图表中,趋势发生反转。跨越超过1000次工具调用,Opus 5相对基线的提升最大(约74-75%),Muse Spark 1.2则处于中游水平,提升幅度约为61-69%,具体随运行环境而异。Meta强调,随着工具调用累积,Muse Code的性能仍在继续增长,这正是长时间编码任务所期望的特性。
最值得关注的演示集中在长时任务和多模态能力上。在压力测试中,Muse Code在Nvidia Hopper GPU上进行了超过1000次工具调用(最长24小时)的GPU内核迭代优化,展现出持续改进的能力。另一方面,Meta展示了视觉编码场景:用户将一个房屋飞越视频(mp4)拖入终端,Muse Code即可解读视频内容,并生成一个具备预订功能的视觉丰富网站。这一“从视频到可用Web应用”的流程,延续了Meta在Muse系列中所强调的多模态技术路线。
整体来看,AI编程代理赛道已经相当拥挤。OpenAI的Codex已支持并行云代理,DeepSeek也构建了类似Claude Code的竞争产品,同时Hermes、OpenClaw等代理工具同样提供了丰富替代能力。Muse Code的核心竞争优势并不在于基准分数全面领先,而是其崩溃安全的运行时和子代理机制设计。不过,风险也同样存在:一个能够在崩溃后自动恢复并持续调用工具长达24小时的代理,虽然强大,但也可能带来更高的不可预测性和使用风险。Meta显然在押注开发者愿意接纳这种高度自主的编码代理,且其现已开放测试,安装命令为:curl -fsSL https://dev.meta.ai/install.sh | bash。
