Meta发最强模型打响价格战,小扎对谷歌贴脸开大,北大校友立大功
太卷了。
九月才过去3天,就已经有五个前沿模型发布了!
Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。
就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。
小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃!
Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。
他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。
Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。
跑分显示,这次 Muse Spark 1.3 的提升更大。
它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。
在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。
亚历山大王嘲讽谷歌,「吸别家模型尾气」
最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。
Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。
在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。
Muse Spark 1.3:75.4 分
Claude Opus 5:74.0 分
GPT-5.6 Sol:73.0 分
不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。
在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。
在Terminal-Bench 2.1它拿下88.8 分。
在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。
在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。
在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。
在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。
而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。
面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」
谷歌真是虎落平阳。
有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」
Less is More:1美元跑2小时的性能怪兽
跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。
Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。
正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。
它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。
针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。
它变得更聪明利落,代码风格更干净,废话更少。
而这种减法带来的直接后果,就是成本的断崖式下跌。
下面就是一个非常震撼的真实实测案例。
开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。
他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。
这两个模型都运行了大约 2 个小时,结果惊人。
Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。
而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!
这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」
在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。
在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。)
Codedamn创始人、开发者Mehul Mohan直呼:
Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「
在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。
作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。
甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。
它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。
Alexandr Wang的狂飙,小扎的终极野心
Muse Spark 1.3 的横空出世,离不开其背后的操盘手。
今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。
短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。
如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。
他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。
也就是说,Meta看下一个ASI风口——「智能体工程」。
Meta AI负责人Alexandr Wang在接受Axios采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。
要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。
1.极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。
当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。
2.极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。
Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。
它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。
为此,北大校友、Meta研究员孙之清透露Meta团队对此前的牛油果avocado模型再次后训练,实现了更好的测试scaling。
狂欢背后:我们被「刷榜」骗了吗?
不过,Muse Spark 1.3也同样受到了质疑。
知名 AI 机构 BridgeMind发了一段引人深思的话:
Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。
Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。
因为,这个月的AI发布如出一辙,分数飙升,但真实世界的体验却毫无长进。
这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。
这段话,精准地击中了当前大模型行业的痛点。
有网友对Muse Spark 1.3、Gemini Flash 3.8z在后端级3D约束下做了压力测试,结果两个模型的老底都被揭穿了:
Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。
现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。
DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。
而Muse Spark 1.3 也露出了马脚。
在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。
比如,在 AA-Omniscience测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。
这降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分提升得那么夸张。
大模型的下半场,到底比什么?
今天 Muse Spark 1.3和Gemini 3.8 Flash的发布,可以让我们得出以下几个判断。
首先,基座模型的「参数红利」正在见顶。
单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。
未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做极致的「减法」,谁就能获得真正的体验跃升。
另外,「智能体工程」才是胜负手。
大模型之争,已经从「谁更会说话」转向「谁更能干活」。
未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。
像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。
参考资料:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。















