智谱 VS Deepseek ,两条分叉的自进化树

字母AI·2026年08月17日 18:01
智谱精准狙击DeepSeek,跑分八项赢了七项,但自进化路线的胜负才刚刚分晓

智谱发布GLM-5.1的时候,盘中涨幅一度接近19%,收盘涨幅11.5%。到了GLM-5.2,当天暴涨32.8%,一周后市值突破万亿。按照这个逻辑来看,GLM-5.3发布后,智谱股价不得起飞喽?

可事与愿违,8月14日发布GLM-5.3当天,智谱跌3.57%,日内回撤超11%。

智谱GLM-5.3的成绩单很亮眼。DeepSWE的66.9分超过了V4 Pro的62.7,Terminal Bench 3.0从5.2的4.6分暴涨到 28.3分拿下开源第一,CyberGym以84.5%登顶全球,在高难度编程任务上,只用了不到Claude Opus 4.8一半的 token,就拿到了更高的完成率。

在智谱官方放出的性能图里,编程、终端操作、Agent任务、网络安全等八方面,赢过了DeepSeek V4 Pro正式版七项,对DeepSeek形成了“精准狙击”。

但是却很少有人注意到,GLM-5.3其实并非“新”模型,它和GLM-5.2 用的是同一个7430亿参数基座,所有提升全靠后训练。这和DeepSeek V4 Pro从预览版到正式版的逻辑是一样的,后者也都是同一个1.6T基座,能力跃迁同样来自后训练。

GLM-5.3之于5.2,就是V4 Pro正式版之于预览版。两者的不同在于,智谱没有涨价,DeepSeek却涨了一大截。从8月17日0点开始,DeepSeek API新一轮调价,全面引入峰谷分时定价机制,整体价格较此前出现大幅上调,全计费项涨幅区间为50%至1100%。

还有一点,那就是在自进化这块,智谱已经和DeepSeek形成了初步交锋。GLM-5.3的新后训练方法,本质上是一种模型自进化。而DeepSeek V4 Pro同步发布的DeepSeek Harness,其插件即一切的策略,也是为了自进化。

自进化是公认通往AGI的赛道,眼下国产大模型的 AGI 赛道,本质上就是智谱、DeepSeekKimi 三家的竞速。 都喊着 AGI,都在拼谁的模型更像一个能独立干活的 "人"。

两家的方法论究竟有何不同?

先看智谱这边。GLM-5.2到5.3最核心的变化是加入了一套“自己出真题自己做”的环境合成流水线。

在GLM-5.2的时期,训练环境还主要靠人工搭建,所以题型有限、场景也偏模拟题。

到了5.3,智谱引入了一个全自动的环境生成机制。

具体来讲,智谱用了一个“AI研究员”(研究Agent)去真实场景里面抄题目。比如它会观察工程师到底怎么干活,把真活儿变成考题。

其实很早之前的生成对抗就采用了类似的逻辑,用机器给机器出题。

可机器出题没法保证每道题都是好题。 有的题可能根本解不出来(出题时条件给错了),有的题可能缺关键信息(做到一半卡死),有的题可能是“无解题”(mission impossible)。如果这些废题混进训练题库,模型辛辛苦苦刷了半天,刷的是一道根本做不出来的题。

因此智谱用了一个AI判卷员(判断Agent),先自己做一遍。 相当于出题人出完卷子,先自己答一遍,确认“这题真的能解出来”,不是道废题。防止出那种连老师都不会做、纯粹难为学生的怪题。

判卷员在做题过程中,不许看参考答案,只看解题过程。

如果是带着答案做题,那么模型可能学会“背答案”或者“抄近路”。表面上得分高,实际啥也没学会。所以判卷员得盯着解题轨迹,看它是不是一步一个脚印真解出来的,有没有钻漏洞、走捷径。只有“题能出、能做、过程干净”三道关卡全过了,这道题才配进训练题库。

这套流水线让训练环境规模扩大了数倍。

除了方法改变以外,刷题的整个基础设施也得到了升级。

slime是智谱从GLM-5时代就一直在用的一套训练框架,你可以把它理解成一个自动化的刷题工厂。

5.3在这套工厂上做了两层大改造。第一层是算法层面,新增了一批技术配置,最关键的一个改动,是让练习和考试的环境几乎完全一致。两者计算结果的平均差异控制在千万分之一的量级,比之前精确了99.99%。

AI的强化学习,本质上是成千上万轮的循环。先考试生成一批答卷,再根据答卷讲课更新模型,然后再考试、再讲课,无限循环。

如果练习和考试的环境有一点点不一样,每一轮都带入一点误差,一万轮下来误差就滚成了大雪球,模型可能学歪甚至直接崩掉。

就好比NBA比赛中,三分线弧顶距离是7.24米,底角是6.7米,但是FIBA国际篮联的三分线是6.75米,如果练习的时候以FIBA的标准,那么到了NBA中就适应不了那么远的三分线。

第二层是系统层面,智谱给这个出题工厂加了一堆效率优化。

常用的数据放到近处缓存,不用每次去远处取。相当于教材室紧挨教室,拿到教材就可以立马发给学生。

多个老师还可以自动切换,还能提前备好课,任务调度让每台机器都不闲着,还能根据题型自动调整到最优配置。这些优化叠在一起,长程编码任务的整体训练速度翻了2.3倍。

在Agent领域影响力最大的Terminal Bench 3.0基准数,得分从5.2的4.6分,暴涨到了5.3的28.3分,拿下开源模型第一。DeepSWE v1.1从46.2涨到66.9,Agents' Last Exam从23.8涨到28.5,AutomationBench从26.2涨到48.2。

再看DeepSeek这边,从预览版到正式版,DeepSeek V4 Pro也强化了后训练。预览版的监督微调数据以通用问答和基础代码为主,而在正式版当中,新增了大量Agent专用的多步骤工具调用对话范例。

以前教模型的例子,是“帮我写封邮件”这种一问一答。现在换成“把文件夹里所有PDF转成Word”这种真活儿。AI得先扫文件夹,然后识别PDF,并逐个进行转换。一切都完成后,汇总报告,一环扣一环。

同时,DeepSeek把GRPO强化学习的奖励函数给重新设计了一遍。

预览版在Agent场景下有两个常见的硬伤,其一是工具调用死循环,反复调用同一工具但提取不到有用信息;其二是参数解析错误,JSON格式错、必填字段漏。

正式版的奖励信号专门针对这两类失败做了惩罚,在需要35次工具调用的复杂任务中,正式版基本可以一次跑通不再卡死。

唐杰vs梁文锋+崔添翼

技术路线的背后从来都是人的理念。智谱和DeepSeek这场对抗,本质上是两种AGI路径的对撞。

智谱创始人唐杰在7月11日发布了内部信《巨浪已来》,宣布启动“Touch High(摸高)计划”。信中写到,未来两年不把重心放在商业变现上,集中资源冲AGI的下一个高地。

唐杰把AGI的突破拆解为三座必须翻越的大山:

第一座是记忆,长上下文和RAG已经逼近记忆雏形;第二座是完全自治的智能体系统(Autonomous Agent System,即持续学习和自我评判),模型迭代频次的提升本身就在逼近持续学习,前沿模型已显露自我评判的萌芽;第三座是自进化(Self-Evolving)。

唐杰表示,“AI训练AI已经成型,模型自己写代码、自己清洗与合成数据、自己训练自己。这或许会消耗一些算力,却节省了最宝贵的人力与时间。而在大模型时代,速度是最重要的,快速迭代会直接拉开认知的代际差距。”

前文提到的GLM-5.3后训练办法,本质上就是一种自进化。

不过自进化最有魅力的地方,并不在于它如何实现了开发者一开始给它规定的目标。就比如GLM-5.3,的确通过自进化,让性能更强了。但最有魅力的地方在于,GLM-5.3获得了极强的网络安全能力。

智谱给GLM-5.3做后训练时,确实往训练环境里加了一些漏洞挖掘的任务。初衷很简单,让模型找漏洞、分析漏洞的能力强一点。

结果训练规模上去了,事态也跟着失控了。

官方博客中写到,“我们本来以为它只是更会找单个漏洞,但出乎意料的是,它开始跨越漏洞利用的多个阶段,形成完整的攻击链计划。”

在CyberGym测试中,任务要求模型从白盒源码出发识别并验证漏洞,GLM-5.3拿到了84.5%分,全球第一,压过了Anthropic的Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。

DeepSeek在自进化这道题上,给出的答案是“插件”。梁文锋把模型基座冻结在1.6T不动,崔添翼带队的DSH框架则把“自进化”发生的场所,从模型内部搬到了模型外部。

DSH的核心设计原则只有五个字,“一切皆插件”(Everything is a Plugin)。模型接入、工具注册表、会话日志、审批策略、沙箱、存储、上下文管理、甚至驱动 Agent 运转的主循环本身,全都是可以拔插的积木。

底层的Cordis微内核只负责插件的加载、卸载和依赖管理,其他什么都不管。

DSH在GitHub宣布开源的当天,也发布了一篇长达88页的论文《时空可组合性的编程范式》,来阐述DSH的理论基础。

Cordis最关键的特性叫“可逆效应”。它指的是,每个插件注册时产生的所有副作用都被追踪,卸载时自动回收,不留垃圾、不漏内存。

这意味着Agent可以在运行过程中随时更换插件,觉得这个搜索引擎不好用。OK,马上换下一个。甚至可以在Agent跑任务的时候换掉它的决策策略,类似于“热插拔”一样,即便更改插件,运行状态也不会崩。

简单来说,传统的Agent非常死板,师傅怎么教,他就怎么学,只要超出知识点就会无能为力。DSH发现缺扳手时,现场自己锻造一把、插到手上接着拧螺丝,用完还能拆下来。

插件化还有另外一层含义,那就是相互独立。传统软件之间存在强依赖关系,改了A,可能B就会受牵连。插件之间相互独立,因此可以相互演化,进而带动整个模型实现自进化。

DSH发布不到两天,就在GitHub就收获10万颗以上的星星,可见开发者社区对它的青睐。

但智谱和DeepSeek其实是两种完全不同的自进化观。

唐杰追求的是“模型自己变聪明”,进化发生在训练阶段,目标是提升模型本身的智商;梁文锋和崔添翼追求的是 “模型的身体可以无限重组”,进化发生在推理和运行阶段,模型本身的智商不变,但它的“手脚”和“器官”可以随时替换、扩展、升级,能力边界由插件生态的丰富程度决定。

如果说唐杰的自进化是生物学意义上的进化 ,基因在迭代中变得更聪明。那梁文锋+崔添翼的自进化就是工具意义上的进化,人本身没变,但从石器到青铜器到蒸汽机,工具的重组让人的能力指数级扩张。

两条路线谁对谁错,没人能定夺,然而智谱的股价成了这场对抗的风向标,甚至被网友戏称为“衡量DeepSeek模型能力最好的测试集”。

4月24日DeepSeek V4预览版发布当天,智谱暴跌逾9%,随后几个交易日持续下挫,4月28日盘中一度跌超13%、跌破千元大关。

市场的逻辑是,DeepSeek又强又便宜还开源,而智谱这边却在涨价。

从2月开始智谱连续上调API定价,一季度累计涨幅约83%,4月GLM-5.1发布时完成年内第三次提价。

这就导致智谱的商业化空间被挤压,估值逻辑遭到了质疑。

8月13日,V4 Pro正式版遭遇乌龙事件,凌晨静默发布、白天官网横幅撤下公告删除、后端指纹改回Preview状态、不到24小时又重新发布。当天智谱股价反而从开盘1230港元涨到收盘1317港元,涨幅约9%。

对手“翻车”被解读为自身利好,说明市场已经从“DeepSeek出模型 = 智谱利空”的简单零和逻辑,转向了对两家路线可持续性的更微妙博弈。

8月14日GLM-5.3发布当天,智谱股价高开低走,开盘1356港元、盘中最高冲到1435港元,收盘却跌到1270港元,跌幅3.57%,从日内最高点算回撤超过11%。

这可能意味着投资者不再只看模型的性能本身,而是唐杰的“自进化闭环”和梁文锋+崔添翼的“插件化生态”之间,哪条路更可能跑到AGI的终点。

GLM-5.3虽然八项赢七项,但市场认为这是“符合预期”的后训练迭代,没有超出基座不变的框架。V4 Pro+DSH的组合,或许才是长期变量。

从“价格屠夫”到集体涨价

前面说完了智谱涨价,现在该说说DeepSeek涨价了。

DeepSeek一直以“价格屠夫”著称,早在V3时代,DeepSeek就用极致的性价比,打穿了整个行业的价格底线。后面到了V4预览版,DeepSeek又延续了这个策略,缓存命中输入低至0.025元/百万token,未命中输入3元,输出6元,几乎是海外旗舰模型的几十分之一。

但8月13日晚间,DeepSeek在发布V4 Pro正式版的同时官宣了API调价,从8月17日零点生效。

在这次价格调整中,DeepSeek首次引入了峰谷分时定价,高峰时段为北京时间9:00-12:00和14:00-18:00,空闲时段价格为高峰的一半。

V4 Pro高峰时段缓存命中输入从0.025元涨到0.3元,涨幅12倍;未命中输入从3元涨到9元,涨幅3倍;输出从6 元涨到27元,是原来的4.5倍。空闲时段则分别为0.15 元、4.5元和13.5元。V4 Flash也同步调价,空闲时段缓存命中0.05元、未命中1.5元、输出4.5元,高峰翻倍。

对于一个以“便宜”为核心竞争力的公司来说,DeepSeek这番涨价势必削弱了公司的吸引力。

开发者圈子里,从“梁文锋的恩情还不完”的论调,变成了“梁圣变梁子”的调侃。社区吐槽称,DeepSeek每贵一块钱,就要破产几百家OPC(单人公司),现在涨了好几倍,几乎已经不给这些独立开发者留退路了。

不过涨价的并非只有DeepSeek和智谱,全行业都在涨价。

DeepSeek作为最后一个坚持低价的头部玩家,它的涨价标志着一个时代的结束。用低价换规模、用补贴换市场份额的阶段,正式落幕了。

涨价的本质不是算力贵了,这是所有人都能用的借口。真正的原因是公司长大了。

AGI研发是个无底洞,唐杰的摸高计划要投入百亿级做可解释性、建合成数据工厂、搞自治智能体系统,梁文锋要除了迭代模型以外,现在还要养DSH的开源生态。

不能一直靠融资和烧钱,终究得靠自己造血。当模型能力逼近海外第一梯队,而模型价格却继续保持海外头部的几十分之一出售时,本质上是在贱卖自己的技术溢价,也是在告诉资本市场我还没准备好挣钱。

涨价是从成本加成定价转向价值定价,模型值多少钱,应该由它能替用户创造多少价值决定。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。

+1
32

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业