“牛到家”的智谱,第一刀就砍向DeepSeek
当了这么久的“价格屠夫”,DeepSeek终于也等来了砍向自己的一刀。
动刀的,是智谱。
智谱AI刚刚发布的GLM-5.3-Flash,即是风靡海外社区的神秘大模型OX Alpha,也是GLM-5系列里的第一个原生多模态模型。
虽它的名字带着Flash,但性能可一点都不Flash,特别是在Artificial Analysis Intelligence Index上,它拿下57分,高于DeepSeek V4 Pro正式版的53分;连官方也毫不谦虚,说在某些口径上,性能甚至可以对标之前Claude 的旗舰Opus 4.8。
但GLM-5.3-Flash最震撼的莫过于:模型一上线,就把“便宜”两个字写在了脸上。
每百万Token输入0.8元、输出2.8元,甚至还有两周限时半价优惠。能力可以对标Opus 4.8,价格却只有它的1/40,甚至比“价格屠夫”DeepSeek的闲时价格还要低。
这价格,谁看了不迷糊?
而这,恰恰是DeepSeek最熟悉的打法。
前脚,主打超绝性价比的DeepSeek开始执行峰谷定价,涨幅最高可达1100%;后脚,GLM-5.3-Flash就价格压到了“日常消耗品”的区间。
难道,AI大模型性价比之王要“改朝换代”了?
花小钱,办大事
要了解GLM-5.3-Flash,还是得从一头神秘的“牛”说起。
8月20日,AI聚合平台OpenRouter突然上线了一个名为 Ox Alpha 的匿名模型。没官宣、没预热,没有公布开发者,没有披露参数规模,更没有给出技术报告,堪称“野模”。
适逢动画电影《牛来》走红,而“Ox”本身就是“牛”的意思,于是中文开发者顺手借梗,把Ox Alpha叫成了“牛来”模型。
“野模”虽“野”,却相当大方:Ox Alpha 可以接收文本、图片和视频输入,输出文本,匿名测试版本还提供104万Token上下文,然而开发者调用它,却不用花一分钱,全部由模型公司买单。
这种几乎“白嫖”的方式,让Ox Alpha迅速走红。
上线不到一天,Ox Alpha同时登顶了OpenRouter和OpenCode两个调用量榜,创下了OpenRouter的模型发布纪录,终结了DeepSeek连续56天霸榜的纪录。
就连Hermes Agent创始人也震惊发文:这个模型正在屠杀我们所有的内部基准,究竟发生了什么?!
一时间,猜测 Ox Alpha 背后的“爹妈”成为了开发者社区的新乐子。毕竟,能拿出这种性能模型的还出手如此阔绰的,背后大概率不会是个“无名之辈”。
事实上,果真如此。
背后是智谱这样的头部大模型公司,当然解释了它为什么有底气替全球开发者买单。
但再家大业大,也经不起海量Token一直免费烧下去。Ox Alpha敢于如此阔绰,还因为这头“牛”看着块头很大,饭量却比想象中小得多。
GLM-5.3-Flash拥有3200亿总参数,但每处理一个Token,只会激活约180亿参数,占比只有5.6%。面对104万Token的超长上下文,它又把线性注意力和稀疏注意力结合起来,尽量减少处理海量历史信息所需的计算量。
两套设计,服务的其实是同一个目标:模型看起来是个3200亿参数的大块头,实际账单却尽量不按3200亿参数来开。
这才是智谱出手阔绰的另一层底气:公司负责兜底,模型自己也得学会省钱。
现在回头看,Ox Alpha匿名期间的免费大放送,本身也像是一场“低成本宣言”。
海量Token全部由智谱买单,除了测试模型、制造热度,也是在向开发者证明:智谱敢把调用量彻底放开,是因为这款模型本身就没有想象中那么烧钱。
总价下来就是一句话:这头“牛”确实吃得不多。
到了Agent场景,这一点就更加重要了。一次任务可能连续调用模型几十次甚至上百次,单次调用省下的一点成本,最终都会被高频调用不断放大。
所以,GLM-5.3-Flash的架构真正瞄准的是让Agent把大模型当成一种可以高频消耗的基础设施。
而在开发者心中,“性能强、价格低、可以放心调用”这些标签,过去几乎都属于DeepSeek。
智谱真正想冲击的,恐怕正是DeepSeek最值钱的性价比招牌。
赢了“梁文峰”,输了“梁文谷”
GLM-5.3-Flash发布的时间点,相当巧妙。
7月31日,DeepSeek V4 Flash正式版上线后,OpenCode上的使用量单日增长了30%,OpenCode Go的新订阅用户也增长了30%。仅8月1日一天,DeepSeek V4 Flash的单日处理量就高达8万亿Token。
但8月17日,DeepSeek的新版定价正式生效。DeepSeek V4 Pro高峰时间段涨幅最高达1100%;DeepSeek V4 Flash峰时输出价格也从0.28美元提高到1.32美元,涨了4.71倍。
大幅涨价,最直接的影响就是开发者开始用脚投票。
此前流出的梁文锋录音中,他曾提到,智能需求没有弹性。但现实似乎没那么简单,尤其对于轻量级模型。
涨价后,DeepSeek的日Token用量很快跌到了此前峰值的一半以下。OpenCode CEO甚至估算,平台因此空出了接近10万亿Token的日需求。
偏偏就在这个时候,披着“牛来”外套的GLM-5.3-Flash来了。
GLM-5.3-Flash堪称“便宜大碗”:每百万Token缓存未命中输入0.8元、输出2.8元,相当于GLM-5.3的十分之一。
上线后还有两周限时半价优惠,缓存未命中输入0.4元、输出1.4元,缓存命中输入0.115元,优惠一直持续到2026年9月9日24时。
按这组最显眼的价格来看,GLM-5.3-Flash确实杀气腾腾。
但要判断GLM-5.3-Flash究竟有没有砍到DeepSeek,只看缓存未命中输入和输出,还不够。
因为到了真实的Agent场景,缓存命中价格反而可能成为账单的大头。
所谓缓存命中,可以简单理解成:Agent反复调用模型时,经常会带着相同的系统提示词、工具定义、历史对话和代码。这些内容平台此前已经计算过,下一次可以直接复用。
既然是用过的东西再拿出来用,那价格当然也比“缓存未命中”的便宜。
这在普通聊天里可能没那么重要,但Agent完成一次任务,往往要连续调用模型几十次甚至上百次,同一套任务背景和历史记录会被反复塞进上下文。特别是写代码这类输入很长、输出相对较短的任务,缓存命中价格会更多地影响账单。
这也是智谱定价里藏着的一点小心思。
它在宣传中重点突出每百万Token输入0.8元、输出2.8元,以及限时半价后的0.4元和1.4元。按照缓存未命中输入和输出比较,GLM确实比DeepSeek便宜。
但GLM-5.3-Flash的标准缓存命中价格是0.23元,半价期间也要0.115元。DeepSeek V4 Flash峰时只要0.1元,谷时更低至0.05元。
只看缓存这一项,即便在半价期间,GLM也比DeepSeek峰时更贵;恢复原价后,更是DeepSeek峰时的2.3倍、谷时的4.6倍。
假设一个Agent任务累计输入50万Token,其中99%命中缓存,最终只输出1万Token。也就是49.5万Token按照缓存命中计费,剩下5000 Token按照缓存未命中计费。
优惠结束后,这个任务使用GLM-5.3-Flash大约需要0.146元;使用DeepSeek V4 Flash,谷时只需要约0.077元,峰时则需要约0.155元。
按照这个假设,同一个任务,GLM比“梁文谷”贵了接近90%,只比“梁文峰”便宜了不到6%。
这也解释了为什么有开发者实际使用后发现,GLM综合用下来比DeepSeek谷时更贵,只是比峰时便宜:对于高缓存命中的Agent任务,GLM在输入和输出上省下的钱,很容易被更贵的缓存吃掉。
更关键的是,智谱的半价优惠只有两周,9月10日就会恢复原价。
所以,GLM-5.3-Flash只能砍过“梁文峰”,却未必砍得过“梁文谷”。
但除了缓存命中,GLM-5.3-Flash其他方面的定价,确实全面低于DeepSeek。
DeepSeek已经够便宜了,智谱究竟是怎么在保持不错性能的同时,还把价格地板继续打穿的?
而答案,就藏在支撑这头“牛”的算力里。
还是“国产牛”
不光模型出自国内,撑住这波全球海量真实流量的算力,用的也是国产方案。
匿名上线期间,Ox Alpha单日处理量一度达到约62万亿Token,线上流量全部由10万张国产芯片扛下。有媒体报道,这些芯片可能来自华为、摩尔线程和海光。
当然,把10万张卡堆在一起,并不会自动变成一套高效的推理系统。
按照智谱的说法,这批国产芯片面临的主要瓶颈是内存容量和带宽。
为了支撑最长104万Token的上下文,智谱在SGLang基础上搭建了一套专用推理引擎,把多模态编码、提示词预填充和逐Token解码拆开,分别进行调度和扩缩容,再通过量化、并行和内存优化,尽可能把国产芯片的性能榨出来。
更有意思的是,这套系统的优化也有GLM-5.3自己参与。智谱用Infra Agent协助工程师开发和优化算子、诊断性能瓶颈、改进部署服务栈,形成了一个“模型优化系统,系统承载模型”的循环。
智谱称,与同一批硬件上的初始基线相比,这套系统的端到端服务性能提升了3倍,硬件效率和单Token成本已经达到主流英伟达GPU的水平。
国外半导体研究机构SemiAnalysis也评价称,英伟达的护城河再次受到了考验。
模型架构负责少算,推理系统负责把国产芯片的性能尽量榨出来,两者合在一起,才构成了智谱继续压低价格的工程底座。
这当然不是说国产芯片已经全面追上英伟达。
10万张国产卡承载全球开发者的真实流量,能够证明的是这套系统已经具备大规模服务能力;至于硬件效率和单Token成本是否真正达到主流英伟达GPU的水平,目前仍主要来自智谱自己的测算。
但这头“牛”真正难缠的地方,是它背后站着的,除了一个国产模型,还有一整套被真实流量压过的国产算力方案。
对于DeepSeek来说,这恐怕比单纯的低价更棘手。
参考资料:
[1]量子位:神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
[2]科技狐:霸榜多日的“牛来”模型,果然是智谱GLM-5.3-Flash!
[3]硅基深蓝:智谱的牛来了!股价暴涨12.62%,吃透DeepSeek开源技术
[4]智能纪元AGI:“唐圣”重置了!智谱开源“牛来”多模态模型,1亿token花3元
[5]APPSO:DeepSeek的斩杀线一夜被斩杀,便宜大碗才是真旗舰
[6]数字生命卡兹克:这一次,智谱用GLM-5.3-Flash实现了真正的智能平权
本文来自微信公众号“蓝字计划”,作者:周末,36氪经授权发布。















