DeepSeek-V4-Pro正式版实测:山不在高,有“梁”则灵
DeepSWE 12.8到62.7,约4.9倍。这是
8月12日晚,这个模型悄然出现在
价格方面,
“梁圣”就是“梁圣”,一如既往地不走寻常路,连涨价预告都一并写得清清楚楚:“计划近期整体上调
于是,我们花了一宿,用社区最新的一批复杂测试手法,看看它的涨价底气到底从何而来。
结论先放在这里,这次升级绝对过硬,前端审美发生质变,Agent能力稳稳得很踏实。不过,也有让我们暂时无解的卡bug问题,比如鹈鹕骑自行车翻车了,生成了两个挂在天上的弯月。
一个悄悄上线的新版本
V4-Pro不是新模型,是转正。今年4月24日,
这次转正,参数上做了几件实打实的事。上下文支持1M上下文长度,输出上限拉到384K Token,支持thinking和non-thinking双模式,其中默认开启思考模式状态。接口同时兼容OpenAI和Anthropic两套格式,接入Claude Code这类Agent框架可以直接换base_url。
官方的叙事,换了一个词
比参数更重要的是官方换了个说法,不再强调「更会答题」,而是强调「更会把一件事干完」。有博主把官方数据翻译成人话:DeepSWE从12.8提到62.7,测的不是「会不会写一段代码」,而是「能不能像工程师一样持续干活」。
九项Agent与代码基准全线大涨。Terminal Bench 2.1打到87.9(终端操作),Cybergym提升至83.3(网络安全),NL2Repo涨到61.5(自然语言转代码仓库),DeepSWE增长到62.7(软件工程),而相对应的Preview版本分别提升15.8、30.6、23.0、49.9。
社区也存在质疑声,有开发者对比后认为0813仍略逊于Luna MX,也有人指出它约一半基准还落后
这就是我们做这次实测的原因,不转述官方数字,自己跑。
考题换代,从鹈鹕到指环王
在动手之前,有个背景必须交代,圈里的测试手法正在换代。8月2日,入职Anthropic的Karpathy发了一条长推,说我们该告别「鹈鹕骑自行车」这类测试了。
他给Opus 5塞了《指环王》第一段,配100万token的预算(约10美元),要求生成三个JS渲染版本。Opus 5跑了约2小时,写出5500行代码,用Three.js搭出一个「有点上世纪国产3D动画味」的霍比屯,穿模、漂浮不少。
随后有网友拿
所以我们给0813设计的测试,全部避开了基础能力,用的都是这类最新、最复杂的手法。方式上,我们没有走网页聊天界面,而是把
第一道题,它就翻车了
先说坏消息,
第一道题是我们的老朋友,即旧基准下的「鹈鹕骑自行车难题」,SVG生成,让鹈鹕骑上车、动起来。尽管这是Karpathy点名要「退休」的考题,但正因为人人测过,拿来当对照组最合适。
0813的表现是这样的,鹈鹕的脚踩在踏板上,但踏板不在自行车上。车架结构怎么看都不科学,这样的设计,鹈鹕的屁股不会冒火吗?
我们怀疑是推理强度太高导致过度思考,把强度从max降到high又测了一轮。结果依旧,鹈鹕形状是怪的,天上的云依旧是反向的。
有意思的是,之前测
60种风格,一张墙
第二道题直接翻盘,让0813在一个HTML文件里生成一张Bento卡片墙,60种设计风格,每张卡片必须用该风格最典型的视觉语言,不能只换颜色。
结果出乎意料地完整,60种风格全部实现,严格执行了不规则拼贴的要求,风格之间的差异非常明显,一次通过,没有任何敷衍的「换色卡」,以后vibe coding项目再也不用担心风格单调了。
这道题真正见功力的是它对「设计语法」的理解,玻璃拟态和粗野主义在视觉上几乎没有任何共同点,能把它们都抓准并排在一张墙上,说明模型对风格语料的积累是实打实的,而非死记硬背下几种配色方案。
把一段文字变成一部动画
第三道题是前端动画叙事,给0813一段描写「老水手夜晚等船」的文字,要求它做成自动播放、循环的动画页面,同时镜头要随时间推进,情绪要靠配色和节奏传达。
它交出了一部完整的叙事,画风、节奏、镜头推进都把握得很好,从镇子远景推到码头,再推到灯塔,自动循环流畅,文字以精致排版叠加在画面上随场景出现。
唯一的问题出在月亮,绘制明显出错。能力这么强的模型,却在简单的月亮上掉链子,和第一道题的鹈鹕简直如出一辙。我们暂时找不到它犯错的规律,只能把它记下来,等样本多了再说。
这次,配色终于不像AI了
第四道题是Three.js 3D打砖块游戏,我们给出的要求是游戏机制闭环,要能玩到比出胜负,还要兼顾UI和游戏手感。
测试下来,游戏完整可玩,碰撞准确没有穿模,丢分、结算逻辑正常,一次通过。但让我们印象最深的不是机制,是配色,配色不再是之前一眼AI的感觉。
这句话值得展开,过去大半年,AI生成的前端有个通病,蓝紫渐变、玻璃拟态、圆角卡片,一眼假。0813这次交出来的配色、碰撞音效和操作反馈,都已经进入顶级模型的层次,怪不得会宣布要涨价,这样的表现即便涨价也是极具性价比的选择。
让AI搭一个中土世界
第五道题是这次的主角,Karpathy的新基准,给0813《指环王》第一章的开头,让它用Three.js把霍比屯的111岁生日宴会搭成一个可运行的3D世界。
和Karpathy给Opus 5完整段落不同,我们只给了一个开头,这样能在短时间内拿到结果。0813的表现是,洞屋、宴会长桌、宾客、烟火要素齐全,没有漂浮、没有穿模,运镜从俯瞰霍比屯推近到比尔博,之后是单调的左右晃动。
单从这一个场景看,0813和Opus 5不相上下。需要注意的是,这不是说两个模型整体能力相当,因为单场景、单段落,样本仍然有限。但至少说明,在「读懂文学、搭出一个世界」这条新赛道上,国产模型没有掉队。我们会在后续的对比测试里给完整段落,再下最终的结论。
1.5小时,一座浮岛
第六道题是压轴大戏,我们用与GPT-5.6、
这道题它花了1.5小时,是全场最久。最后半小时,它一直在自己测试项目能不能顺利启动,直到确认没有问题才交付,交付结果首轮0 bug运行。
转场、运镜、交互、移动端适配都做得极好。唯一缺点是初始界面过曝,一进页面先被亮光晃到。
历史成绩摆在这里,GPT-5.6 Sol功能完整度最高,但点击物件时把背景虚化了;
0813这次,是在V4-Flash的基础上把运镜、转场、交互全部补上了。性能逼近Fable 5确实没有信口开河,0813是有真材实料的。
它能连续干完一件事吗
最后一道题回到官方最狠的宣称,DeepSWE风格的长周期工程。我们让0813从零搭一个记账本全栈应用,连续做三轮迭代,记账核心功能、月度分类统计、预算提醒。每轮都要改多份文件、补测试、跑测试、跑不过自己修。
三轮全部完成,关键是过程,它不是一轮写完假装三轮,而是每一轮都真实跑测试,不通过就自己修bug,直到通过才进入下一轮。全程没有让我们介入纠错,唯一的小插曲是每新建一个文件它都会申请一次权限。
这种踏实的做事风格真是暖暖的很贴心,模型能力再强,能稳稳接住用户的需求才是王道,0813在这方面做得很出色。
一个可能被低估的版本
把7项测试放回桌面上看,0813的画像比官方基准更立体。
前端审美是这次最大的质变,从打砖块的配色到浮岛的运镜,它已经告别了「AI前端一眼假」的阶段,站进了顶级模型的行列。创意类任务全线高分,指环王场景零漂浮零穿模,和Opus 5单场景不相上下。长周期工程扎实,测试闭环、自修bug,是「能连续干活」的样子。
问题也存在,鹈鹕和月亮两处低级失误,都发生在它能力很强的领域,强如K3也犯过类似的错误,这个暂时解释不了。
有意思的是,Grok 4.6几乎和0813同一时间发布,一个顶级闭源、一个顶级开源,都是超高性价比的定价路线。这场对决,可能比官方benchmark更能说明问题,我们已经在筹备两个模型的同题对比测试。
至于「涨价了还值不值」,以这次的表现,即便涨价,它依然极具性价比。不差钱的
本文来自微信公众号“guangzi0088”(ID:TMTweb),作者:高晓阳,编辑:郝鑫,36氪经授权发布。















