Meta Llama标识(图片来源:Shutterstock)

Meta发布AI编程代理Muse Code测试版,正式切入AI软件开发自动化赛道。与强调“最强性能”的竞品不同,Meta此次更突出长时间自主运行和故障恢复能力,试图借此与OpenAI、Anthropic等厂商形成差异化。

据区块链媒体Decrypt本月5日(当地时间)报道,Meta基于最新编程模型Muse Spark 1.2推出了Muse Code测试版。

Meta表示,Muse Code可通过Meta Model API和安装脚本直接使用。面向大型代码库时,该工具可完成变更规划、代码编写和结果验证,覆盖软件工程中的多个关键环节。目前,Meta已开放Muse Code测试版,并透露正在准备“更大、更强”的后续模型。

从产品架构看,故障恢复是Muse Code的核心设计之一。Meta介绍称,Muse Code会将模型调用、工具执行、用户审批以及代码修改记录写入本地事件日志,并据此管理任务状态。即使系统在执行过程中发生故障,代理也可从中断处继续运行。

针对长时开发任务,Muse Code还提供了一组终端指令,包括用于制定计划的“/plan”、用于复核计划的“/grill”,以及用于持续推进任务直至达成目标的“/goal”。Meta同时表示,Muse Spark 1.2已围绕大语言模型与代理之间的协同进行联合训练,以提升实际执行效果。

不过,从基准测试成绩来看,Muse Spark 1.2尚未进入第一梯队。Meta披露的资料显示,该模型在主要编程基准上的成绩均低于Anthropic的Opus 5,但在多数项目中领先于OpenAI Codex和Google Antigravity。

在评估终端型编程能力的Terminal Bench 2.1中,Muse Code得分为82.9%。作为对比,Claude Code(基于Opus 5)得分86.7%,Codex为81.8%,Grok Build为81.6%。

在衡量AI代理软件开发能力的DeepSWE 1.1中,Muse得分59.3%,低于Opus 5的65.0%和Codex的64.8%。在Meta内部编程基准中,Muse得分为70.6%,同样落后于Opus 5的79.4%。

Meta将产品优势明确定位在“长时任务稳定性”上。该公司称,在工具调用次数超过1000次的长时间运行场景下,Muse Spark 1.2的表现可提升至约61%至69%。在官方演示中,系统在Nvidia Hopper GPU上连续运行24小时,调用工具超过1000次,并持续优化GPU内核。

在另一项演示中,用户上传室内场景的无人机视频后,系统可自动分析视频内容,并生成带预约功能的网站。Meta称,该系统能够“理解视频内容,并生成视觉表现更丰富的预约网站”。

从市场节奏来看,Meta并非最早入场者。OpenAI此前已推出支持并行云端执行的编程代理Codex,DeepSeek也发布了与Claude Code竞争的产品;Hermes、OpenClaw等开源AI编程工具同样在快速扩散。在这一背景下,Meta将故障恢复、长时间自主执行和子代理运行机制作为差异化卖点。

不过,具备长时间自主运行能力的AI代理在提高生产效率的同时,也可能带来可预测性下降的问题,这仍被视为行业有待解决的课题。

Meta认为,上述架构更符合未来开发环境的需求,因此率先向开发者开放测试版。开发者只需执行安装命令,即可体验Muse Code。

关键词

#Meta #Muse Code #Muse Spark 1.2 #AI编程代理 #终端型编程代理 #故障恢复 #Claude Code #Codex #Terminal Bench 2.1 #DeepSWE 1.1 #Google Antigravity
版权所有 © DigitalToday。未经授权禁止转载或传播。