
Meta 发布 Muse Code:一个用「后台常驻 Agent」设计的终端编码助手
Meta 正式推出终端编码 Agent Muse Code(Beta),底层由新模型 Muse Spark 1.2 驱动。它用常驻异步后台 Agent 减少重复信息收集,用本地事件日志保证崩溃后精确恢复,还公布了 1000+ 次工具调用的 GPU 内核优化实战。
原文来源:Meta AI Research Blog — Meta 推出终端编码 Agent Muse Code(Beta)与升级模型 Muse Spark 1.2,主打长任务场景:常驻后台 Agent、可精确恢复的事件日志、与模型协同训练。
2026 年 8 月 5 日,Meta Superintelligence Labs 发布了 Muse Code(Beta)——一个运行在终端里的编码 Agent,由新模型 Muse Spark 1.2 驱动。这是 Meta 在编码 Agent 赛道的正式入场,目标很明确:复杂软件工程任务、大型代码仓库,以及"一跑就是几个小时"的长任务。
安装命令只有一行:
curl -fsSL https://dev.meta.ai/install.sh | bash目前支持 macOS 和 Linux。Meta 把它定位为"迈向 frontier 的下一步",更大的模型已经在路上。
常驻后台 Agent:与主流方案不同的架构选择
Muse Code 最特别的设计,是它的一套"异步后台 Agent"。
主流编码 Agent(Claude Code、Codex 等)的做法是:主 Agent 循环遇到子任务时,临时生成一个子 Agent 去执行,做完就销毁。Muse Code 反过来——后台 Agent 在整个会话期间常驻,不按任务临时生成。
这样做的好处是避免重复的信息收集。子 Agent 每次生成都要重新读一遍相关文件、重新理解上下文;常驻 Agent 把这些信息保留在会话里,主 Agent 需要时直接取用。Meta 称这降低了长任务的延迟和对人工引导的依赖。
后台 Agent 自己决定下一步做什么、什么时候把结果汇报给主 Agent。这有点像一个团队:负责人分派大方向,几个骨干各自盯着自己的领域,需要协作时再碰头。
—— 广告 ——
运行时设计:事件日志让崩溃恢复变成精确回放
Muse Code 的第二个关键设计是本地事件日志。
每一次模型调用、工具运行、审批操作、文件编辑,都被追加进一个本地日志。这个日志是"单一事实来源",Meta 称它让运行时变得 replay-exact(回放精确)和 restart-safe(重启安全)。
含义是:如果 Agent 跑到一半崩溃了,重启后它能精确地从上次中断的位置继续,而不是从头再来。这对长任务意义重大——一个持续 24 小时的 GPU 内核优化任务,如果崩溃一次就要重跑,基本没法用。
内置 Skills:/plan、/grill、/goal
Muse Code 出厂自带三个默认 skill:
/plan:把任务转化为一份需要逐项审批的计划/grill:对计划做压力测试,直到它经得起推敲/goal:朝着指定目标持续推进直到完成
这套组合拳的逻辑是:先规划、再验证、最后执行。/grill 这个设计比较少见——它相当于让 Agent 自己当自己的批评者,在动手写代码之前先把计划中的漏洞找出来。
Muse Spark 1.2:与 harness 协同训练的模型
Muse Code 背后的模型是 Muse Spark 1.2,一个编码聚焦的升级版。相比 1.1,Meta 大幅增加了编码任务的训练算力,并扩大了训练环境的多样性。改进方向包括代码生成、复杂调试、代码库理解、端到端开发流程。
三个值得注意的训练细节:
与 Muse Code 协同训练。模型训练时就用 Muse Code 的 harness 环境生成轨迹,用拒绝采样(rejection sampling)筛选高质量轨迹,并对 goal、compaction、subagent 等机制做了配方优化。换句话说,模型不是训练完再配个壳,而是从第一天起就在"如何使用自己的工具"上做优化。
长程训练。训练任务覆盖整仓库生成、大型端到端项目、自动研究。模型学会了用规划来排列工作顺序、用 goal conditioning 维持方向、用上下文压缩(context compaction)保留推进所需的知识。
自我改进循环。Meta 用 Muse Spark 1.1 生成有挑战性的编码环境和指令模板,让模型自己评分候选方案,产出一套可扩展的训练集。这套数据反过来喂给 1.2,让它更精准地遵循复杂指令。
实战案例:24 小时、1000+ 次工具调用的内核优化
Meta 公布了一个很有说服力的案例:让模型迭代优化 GPU 内核。
任务是在 NVIDIA Hopper GPU 上优化 KDA 和 MLA 两种内核,模型要写代码、编译、性能剖析、逐步改进,整个流程超过 1000 次工具调用,最长跑了 24 小时。基线是 FLA 的 Triton 实现,且明确禁止模型直接导入第三方内核库——它必须真正理解 KDA 的算法,用 Triton 从头实现。
结果是 Muse Spark 1.2 把"块并行准备内核"和"顺序跨块扫描"组合起来,在标准 fusion 和 tiling 基础上,加入了 KDA 特有的优化(比如把门控累积衰减的重心移到块中点)。对于 MLA,模型构建了一个两内核 Triton 流水线,复用共享的 KV latent 作为 K 和 V。
这个案例的价值不在于某个具体优化技巧,而在于证明了模型能在 24 小时的自主迭代中持续改进——这正好是长程 Agent 能力的试金石。
评测数据与定价
Meta 的评测方法论文档给出了具体数字:
- Terminal-Bench 2.1:全部 89 个任务,pass@1(5 次尝试取最优)。作为参照,Muse Spark 1.1 在此基准上是 80.0
- DeepSWE v1.1:113 个任务,覆盖 91 个仓库、5 种语言
- Meta Internal Coding Bench:440 个任务,全部来自 Meta 内部真实 PR
对照模型包括 Grok 4.5、Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash 和 Kimi K3,各自搭配自家的 Agent 产品。Meta 也坦率承认:它的 harness 未必为第三方模型做过调优,对比不能完全算公平。
定价方面,Muse Code 从 Meta 的 contributor tier 起步,按量付费是输入每百万 token 1.25 美元、输出每百万 token 4.25 美元(AppleInsider 报道)。模型也同步上线了 Meta Model API,全球开放。
怎么看这次发布
Muse Code 的三个设计选择——常驻后台 Agent、事件日志回放、模型与 harness 协同训练——都不是全新的概念,但它们组合在一起,指向了一个明确的趋势:编码 Agent 的竞争正在从"单次对话写一段代码"转向"自主运行数小时的长任务"。
常驻 Agent 解决的是上下文浪费问题,事件日志解决的是可靠性问题,协同训练解决的是模型与工具匹配问题。这三者恰恰是长任务 Agent 能否真正落地的三个瓶颈。Meta 在这三个方向上都给出了工程化答案,而且用 24 小时内核优化的案例做了实证。
当然,Beta 阶段的 Muse Code 还不完美:没有图形界面、依赖 Meta 的托管服务(未公布开放权重)、定价相比 Claude Code 等成熟产品也谈不上便宜。但作为 Meta 在编码 Agent 赛道的正式入场,这个开局的技术含量是实打实的。后续更大模型的发布,才是真正值得关注的点。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/muse-code-meta-coding-agent
相关文章
Harness 工程:决定 AI 能否自我改进的隐藏层
Lilian Weng 深度解析:围绕基座模型的 harness 系统(工作流、记忆、工具编排)如何决定 AI 的能力上限,以及递归自我改进的工程路径
Flint:让 AI Agent 稳定画出好图表的可视化中间语言
微软研究院开源的 Flint 用语义类型 + 编译器自动推导,把 AI 生成图表从'碰运气'变成'一次成功'——50 种图表类型、5 个渲染后端、一个统一接口
前沿实验室的 AI Agent 入侵:HuggingFace 7 月安全事件技术全复盘
HuggingFace 披露了一起由前沿 AI 模型驱动的复杂入侵事件,展示了 AI Agent 在真实攻击场景中的能力——从初始渗透到横向移动、凭证窃取的全链条技术复盘