实测正式版 DeepSeek V4 Pro,补齐 Agent 和图像能力

极客公园·2026年08月13日 11:03
大鲸鱼的旗舰终于补完了最大的短板。

没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4 Pro 的正式版,就这么悄悄的来了。

8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是那个 deepseek-v4-pro,但 fingerprint 已经变成了 fp_v4pro_20260812。打开社区一看,消息已经炸开——V4 Pro 正式版,来了。

从 4 月 24 日预览版上线算起,整整 111 天。

这期间 Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版先行一步在 7 月 31 日上线,API 涨价的预告更是悬在所有开发者头顶。

所有人都在问同一个问题:Pro 的正式版到底什么时候来?

答案是一个周三的深夜。

01

架构没变,能力暴涨

先说硬参数。V4 Pro 正式版的模型架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文、384K 最大输出。变的是后训练,而且变化大到像换了个模型。

最夸张的数字来自 Agent 相关评测。DeepSWE(DeepSeek 自家的软件工程基准)从预览版的 12.8 飙到 62.7,涨了将近 50 分。Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9,DSBench-Hard 翻了一倍多达到 67.2。

这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。恰好是预览版最容易翻车的地方。

DeepSeek V4 Pro 正式版 Agent 能力大幅增强|图片来源:DeepSeek

从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准测试远超 V4-Pro-Preview」的程度,Pro 版只是补上了同一课。

另一个重要变化是多模态。预览版是纯文本模型,正式版首次原生支持图像推理。DeepThink 引擎现在可以在同一个思考流程中分析图片、解读截图、处理混合文档。

这对于需要「看图干活」的 Agent 场景来说,是从无到有的突破。

价格方面,每百万 token 输入 3 元、输出 6 元,和预览版持平。

虽然 8 月 6 日 DeepSeek 已经预告「计划近期整体上调 API 定价,预计涨幅较大」,但目前 0813 版本还没动。窗口期能撑多久不好说,想薅的趁早。

02

天花板和脾气

跑分好看只是门票,真正有意义的是拿真实任务去试。

极客公园用 V4 Pro 正式版跑了三个不同方向的测试,试图回答一个问题——这个模型在「一次性生成完整可运行代码」这件事上,到底到什么水平了?

第一个任务是 Boids 群体涌现模拟。要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。这是一个涉及物理模拟、实时渲染和 UI 设计的综合任务。

V4 Pro 用了大约 170 秒,生成了 761 行完整 HTML。打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。

第二个任务故意模糊——用中文告诉它「我想要一个好看的番茄钟工作面板」,只给了「能计时、能记录、有白噪音、中文界面、要有质感」这几个方向,其余让模型自行决定。

V4 Pro 交回来 1223 行代码,除了基础的 25/5 分钟计时功能,它自己加了任务标签、专注统计图表、快捷键支持、甚至用 Web Audio API 从零合成了几种白噪音。

对模糊需求的「产品化补全」能力,确实比预览版有明显进步。

第三个任务是寻路算法可视化,要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互的网格画墙、迷宫自动生成。这个任务的代码量最大,也是翻车最多的地方——但翻车的方式本身就很有意思。

开着默认的 thinking 模式,V4 Pro 用了 16384 个 token 的输出配额,其中 13394 个花在了「思考」上。留给实际代码的不到 3000 个 token,直接截断,HTML 写到一半就断了。

关掉 thinking 模式重跑,54 秒就输出了完整的 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。

这不是一个 bug,而是 V4 Pro 正式版的一个真实特征——thinking 模式在复杂代码生成场景下,推理 token 可能占到输出的 80% 以上,反而挤压了实际内容的空间。

对于需要大段代码输出的任务,开发者可能需要主动关闭 thinking,或者大幅提高 max_tokens 来兜底。

03

大鲸鱼的位置

经过 API 实测之后,坦率地说,V4 Pro 0813 不是一张「全面碾压」的成绩单。

HLE 不使用工具时 42.7 分,落后 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3。NL2Repo 以 61.5 落后 Opus 4.8 的 69.7。有 Kimi K3 在前,它在部分测试上也存在轻微差距。

纯知识推理和最复杂的软件工程任务,V4 Pro 还没有坐上头把交椅。

DeepSeek 从来不是靠「最强」赢的。它靠的是那条所有人都背得出来的定律——比我强的没我便宜,比我便宜的没我强。

每百万 token 输入 3 元的价格,大约是 Fable 5 的十分之一、Kimi K3 的三分之一。

在 Agent 能力从「几乎不可用」暴涨到,「能和头部闭源模型正面对打」之后,这条定律的杀伤力比预览版时期大了一个量级。

更值得关注的是藏在 V4 Flash 正式版更新日志里的一行小字——评测使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架。结合前两天注册的「DeepSeek Harness 团队」公众号和此前的招聘信息,DeepSeek 正在准备把模型和 Agent 运行框架打包推出。

如果说过去大家的竞争还停留在「谁的模型更聪明」这个维度,那 Harness 的出现意味着竞争正式进入下一阶段——不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。

V4 Pro 正式版补齐了大脑这一环。接下来,就看那个「即将发布」还要等多久了。

本文来自微信公众号“极客公园”(ID:geekpark),作者:桦林舞王,编辑:靖宇,36氪经授权发布。

+1
30

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000
特邀作者

用极客视角,追踪你最不可错过的科技圈。

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

AI开始从“给人看病”,走向“给机器看病”。

4小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业