8 月 5 日,Meta 发布了首款 AI 编程智能体 Muse Code 的测试版,正式踏进由 Anthropic 的 Claude Code 和 OpenAI 的 Codex 主导的赛道。与两家对手一贯强调能力领先不同,Meta 这一次把价格摆在了最显眼的位置。

一条命令装好,在终端里干完整活
Muse Code 是一款运行在终端里的编程智能体,支持 macOS 与 Linux,官方给出的安装方式是一条命令。据 Meta 首席 AI 官亚历山大·王(Alexandr Wang)介绍,它可以承担完整的软件工程任务,包括规划改动、编写代码和验证结果,在大型代码仓库中同样适用。
技术设计上有几处值得留意。Muse Code 采用”一个主智能体 + 一组异步后台智能体”的结构,后台智能体在整个会话期间持续在线,而不是每接一个任务就临时创建,这样可以避免重复收集同一批上下文,也减少了在多步骤复杂任务上反复人工纠偏的需要。大型项目会被拆给彼此隔离的子智能体,互不干扰。
运行时依赖一份本地事件日志:每一次模型调用、工具运行、人工批准和代码修改都会被追加记录。Meta 称这份日志是唯一可信来源,可以做到精确重放,程序崩溃后智能体能从中断处继续,而不必从头再来。
工具默认自带若干技能命令,例如 /plan 把任务转成需要人工批准的计划,/grill 反复压力测试这份计划直到站得住脚,/goal 则朝着既定目标推进直至完成。
Meta 公布的一个案例是图形处理器(GPU)内核优化:模型在超过 1000 次工具调用、最长 24 小时的过程中反复编写、编译、性能分析并改进内核代码,测试对象是面向英伟达 Hopper 架构的 KDA 与 MLA 两类内核,且明确禁止直接调用第三方内核库,只能自行用 Triton 实现算法。
价格才是真正的卖点
按量付费档的定价与 Muse Spark 系列的接口价格一致:每百万输入词元(token)1.25 美元,每百万输出词元 4.25 美元。此外还设有一个”贡献者档”,用户需同意提供反馈帮助改进模型,作为交换,价格比按量付费档还要低 10 倍以上。据《华尔街日报》,该档位为每百万输入词元 0.10 美元、每百万输出词元 0.20 美元。
对比之下差距相当直观。以每百万输出词元计算,OpenAI 的 GPT-5.6 Terra 为 12 美元、旗舰 Sol 为 30 美元;Anthropic 的 Claude Sonnet 5 为 10 美元、Opus 5 为 25 美元。也就是说,Muse Code 按量付费档的输出价,大约只有 GPT-5.6 Sol 的七分之一。Claude Code 与 Codex 目前主要以每月约 20 美元的订阅形式提供,超出额度后转为按量计费。
亚历山大·王把话说得很直白:Meta 不打算靠最尖端的能力去竞争,而是把价格当成核心差异点。他表示,对于大量工作流和使用场景而言,这会是一个很有吸引力的选项,尤其是从成本角度看。
针对企业客户,Meta 开始接受”零数据保留”申请,承诺不留存开发者数据用于模型改进。对一家 98% 收入来自广告业务的公司来说,这个表态本身就带有信号意义。
性能大致卡在第一梯队边缘
驱动 Muse Code 的是 Muse Spark 1.2,它是 7 月发布的 Muse Spark 1.1 的编程向升级版,与智能体协同训练而成。Meta 称模型在代码生成、复杂调试、代码库理解和端到端开发流程上均有改进。
按 Meta 公布的评测结果,Muse Spark 1.2 在考察命令行工作流的 Terminal-Bench 2.1 上略微领先 GPT-5.6 Terra,接近 Claude Opus 5;在考察长周期任务的 DeepSWE 1.1 上落后于这两者,但仍领先于 xAI 的 Grok 和谷歌的 Gemini 3.6 Flash;在 Meta 自建的编程基准上,成绩位于 Claude Opus 5 与 GPT-5.6 Terra 之间。需要说明的是,这些数据均由 Meta 自行公布,目前尚无第三方复现。
一个细节是,Meta 在官方说明中的对比对象是 GPT-5.6 Terra,并未提及能力更强的 Sol。换句话说,Muse Code 现阶段的定位不是”最强”,而是”够用且便宜”。
发布时机并不轻松
这次发布落在一个敏感的时间点。上周 Meta 因营收指引不及预期、第二季度自由现金流下滑,股价一周内下跌约 10%,投资者持续要求管理层给出巨额 AI 投入的变现路径。Muse Code 是马克·扎克伯格为 AI 业务开辟独立收入来源的最新尝试。
公司内部也在加码。据《The Information》看到的内部备忘录,Meta 已要求数千名工程师每周至少用内部 AI 编程助手提交一次代码改动,并纠正它犯的错,以此积累训练数据。这套反馈循环据称已经提升了 Muse Spark 1.1 的编程能力,预计还将惠及一款内部代号为 Watermelon 的新模型。
对开发者来说,现阶段选择 Muse Code 的理由不是速度或能力上限,而是成本结构。Meta 从推出首个 Muse Spark 模型到拿出与同行接近的编程成绩只用了四个月,这个追赶速度本身比单次跑分更值得关注。不过也要提醒一句:高频使用 AI 编程工具的团队,按量计费的最终账单未必比订阅制便宜多少,实际成本仍需按自身调用量测算。
来源:How-To Geek / Jon Fingas、Engadget、CNBC、《华尔街日报》、Meta AI 研究博客







